H3白模红模素材参考能力核查-20260927.md

H3「白模 / 红模」素材参考能力核查

核查时间:2026-09-27 00:45 | 执行者:DSH(本机)| 未跑任何生成任务(GPU 机当时 2774 MiB 占用 / 0% 利用率,只在跑别的业务) 触发:用户下载了 03_L_复仇摇-ai素材_720x1280.mp4,想确认「H3 官方是否发布过参考这类白模/红模素材的工作流」


一、结论(先看这三条)

  1. MiniMax 官方没有专门叫「白模 / 红模」的工作流或技能。 官方(GitHub MiniMax-AI/MiniMax-H3 + HuggingFace MiniMaxAI/MiniMax-H3)发布的是能力与写法规范:Ref2VA「全参考」模型 + 官方《全参考提示词指南》。该规范明确允许一段参考视频只提供动作/编队/镜头,身份完全来自图片——这正是白模/红模素材的用法,但官方从不使用「白模/红模」这个词,官方示例里的参考视频也是真人(粉西装抱黑羊羔的小伙子)。
  2. 官方体系里最接近「白模/骨骼驱动」的现成工作流,是 ComfyUI 官方的 Fun ControlNet Union(Pose / Depth / Canny / HED / MLSD 控制视频,内置 SDPose 抽骨架)。它属于 Alibaba PAI 出模型、Comfy-Org 打包的官方模板,本机 ComfyUI 0.37.0 已满足版本要求,但模型文件没装(models/model_patches/ 为空、无 SDPose 权重),要用得先下载。
  3. 不需要等官方:本机在 2026-09-14 就已经用抖音绿幕人偶参考视频跑通过这条路(generate --mode rv2v,多人换人成功,141 帧 / 1344×768 / 9 分 15 秒)。这次的 03 素材可单条直接用(14.04 s,正好压在 15 s 参考上限内);02(21.5 s)必须裁到 ≤15 s 才能喂。

二、你下载的这两条素材实况(已 ffprobe + 抽帧目视)

项02_L_去年夏天-白膜素材03_L_复仇摇-ai素材
作者 / 来源抖音 L(unique_id 90624020045,签名「首发原创高质量白模风格视频」)同账号 L;文案 #复仇摇 ai素材自取,作品@晚棠不吃榴莲
分辨率1080×1920(竖屏 9:16,源即天花板)720×1280(竖屏 9:16,源即天花板)
编码 / 像素格式H.264 / yuv420pH.264 / yuv420p
帧率24 fps24 fps
帧数 / 时长516 帧 / 21.50 s337 帧 / 14.04 s
音频AAC 44.1 kHz 立体声(21.5 s)AAC 44.1 kHz 立体声(14.08 s),128 kbps
画面内容(抽帧目视)白模(白色无脸人形)舞蹈素材红模:红色无脸人偶、绿色纯色背景(chroma green),双手持银色手枪的舞蹈动作
背景绿幕/纯色棚平坦绿幕,无地板线、无阴影杂物(好抠像)
文件大小1.59 MiB1.18 MiB
SHA-256a397bb8198ba547f53330b305fab9449b32aa86a502b01499538c36bca60076b56c92d4314896e4513ddf2341468f34562f187c8747145d1cfb865a19a61dfc6
质检全解码零 error / warning、无抖音水印、无片尾卡(见 56-抖音视频下载/README-下载说明.md)同左

素材本体在:/home/zyw/Downloads/dl-hub/56-抖音视频下载/(含封面 webp、抽帧 jpg、完整档位元数据 json)


三、官方到底发布了什么(分层核查,含证据)

3.1 MiniMax 官方(权重 + 提示词规范)

官方产物内容与「白模/红模」的关系
H3-Base-Ref2VA(omni-reference)多模态参考:图 ≤9、视频 ≤3 段(每段 2–15 s,合计 ≤15 s)、音频 ≤3 段(同规格)、跨类型合计 ≤12 个文件✅ 正是吃「白模/红模舞视频 + 角色图」的模型(本机已装 minimax_h3_ref2va_pruned_int8_convrot 等)
官方《全参考模式提示词指南》VIDEO_PROMPT_WRITING_GUIDE_ref_en.md六段式;任务类型表含 reference generation("一段视频只提供动作/运镜/节奏等生成指引,不作为被编辑的源视频")与 video editing;retention_analysis 里可声明 <Video 1>: fully_preserved for body movement, poses, action timing, camera ...、<Subject 1>: identity_not_preserved✅ 白模/红模素材的官方写法依据:把模特当"只供动作的参考视频",身份另接图片。❌ 通篇没有 mannequin / 白模 / 绿幕等字样
官方可复现脚本 scripts/readme/*ref2va*含真实示例:参考视频是 cdn.hailuoai.com/.../h3_promo_eval_ref2va/...mp4(真人:粉西装+黑羊羔),参考音频 mp3❌ 官方示例素材是真人,没有官方白模/红模示例资产
官方 9 个技能(skills/)1 个可移植 h3-prompt-writing + 8 个 MiniMax Hub 专用风格技能(3D 动画短片、品牌片、纸艺定格、手绘实拍、纸拼贴、极简产品广告、MV 字幕、联机游戏开场)❌ 没有"白模/红模/舞蹈复刻/换人"技能
官方可复现脚本 / H3-Regenerate-2K / Context-IR只提供 API 与脚本;Context-IR、Regenerate-2K、稀疏注意力未开源与本问题无关(但 2K 输出走这条路)

参考:GitHub MiniMax-AI/MiniMax-H3、官方全参考提示词指南;本地已离线归档于 dl-hub/13-MiniMaxH3官方资源包/

3.2 ComfyUI 官方(模板 + 文档,属于"官方工作流"最直接的来源)

官方模板/文档用途与白模/红模的关系
MiniMax H3 R2V(= Ref2VA) 模板 + 文档参考图/视频/音频组合生成;文档明确"给每个参考分配任务(身份/风格/运动/相机/声音)";ref_image_size=match/max✅ 官方版的"参考生视频",白模/红模接 <Video 1>
Fun ControlNet Union 模板Canny / Depth / HED / MLSD / Pose 控制视频 + mask 局部重绘;内置 SDPose 子图自动从输入视频抽骨架(示例素材 dancer_field_pose.mp4)✅✅ 官方体系里最贴近「白模/骨骼驱动」的一条;但需下载 minimax_h3_fun_controlnet_union_pruned_int8_convrot + sdpose_wholebody_fp16 + rt_detr_v4-x-hgnet_fp16,要求 ComfyUI ≥ 0.35.0(本机 0.37.0 ✅,模型 ❌ 未装)
Multi-frame reference 模板用 MiniMaxH3AddGuide 把引导锚定到任意帧(视频片段/音频)辅助(分段、续接)
FastVideo FastH3 模板加速推理辅助(提速)
blueprints/ 里的 motion_transfer_wan_animate_2 / image_to_video_wan_dancer是 Wan 系的动作迁移/舞蹈,不是 H3⚠️ 别混:这类"动作迁移"官方归在 Wan Animate 名下

参考:ComfyUI H3 原生工作流(T2V/I2V/R2V)、H3 Fun ControlNet Union、H3 提示词指南

3.3 本机 / 第三方(不是官方,但已可用)

产物位置说明
h3-dance-replication(舞蹈复刻)GPU 机 ~/minimax-h3-video-studio/skills/项目自带技能:把参考舞蹈视频当动作/队形/镜头/音轨来源,替换成指定角色与新背景;默认 4-step Turbo、9:16
h3-character-migration(人物迁移)同上单人换身份、保原场景/镜头/音频,支持持久分段与 Motion Context
identity-migration.md 身份迁移规范skills/h3-ref2va-prompt-compiler/references/编号铁律:<Subject 1>=源视频被替换者,<Subject 2>=目标角色(来自 <Picture 1>);必须过 validate_h3_ref2va_prompt.py --profile identity-migration
H3 Video Studio 本体GPU 机 /home/zyw/minimax-h3-video-studio,v0.5.0,非 MiniMax 官方项目(仓库 siyuan-liu31/minimax-h3-video-studio)CHANGELOG 明确"新增项目内置 H3 生产 Skill 套件:人物对白生视频、舞蹈复刻与不限时长人物迁移";其参考合同也已对齐官方规格(图 9 / 视频 3 / 音频 3 / 合计 12)

这就是你可能记得的"官方发布"来源之一——skill 名字和措辞很像官方,但它属于本地 Studio 项目,不是 MiniMax 官方仓库。MiniMax 官方 skills/ 只有 9 个,且不含舞蹈/换人。


四、这两条素材喂给 H3 的匹配度检查(只核查,未提交)

官方 Ref2VA 参考约束 vs 素材实际:

约束02 白膜素材03 红模素材判定
参考视频每段 2–15 s21.50 s14.04 s02 ❌ 需裁到 ≤15 s(建议取 5–8 s 单一动作段);03 ✅
参考视频总时长 ≤15 s——03 单条几乎吃满 15 s 预算 → 同一次任务里别再叠第二条视频;02 裁完就独占
参考视频 ≤3 段、混合文件 ≤12满足满足✅
帧率24 fps24 fps✅ 与 H3 输出 24 fps 一致(省一次真补帧)
画布(短边 768 / 每轴 32 倍数)1080×1920720×1280(720 不是 32 的倍数)⚠️ 需按派生规则落画布:竖屏 1080×1920 → 480×864(省显存);720×1280 → 同样 480×864 或 736/704×1280
编码 / 像素格式H.264 / yuv420p ✅H.264 / yuv420p ✅✅ 已符合参考视频预处理要求(H.264 + YUV420P + 24 fps)
音频复用有音轨,可 <Audio 1>: fully_copy有音轨,可复用("复仇摇"配乐)✅ 但要用官方 fully_copy 标记,否则 H3 只当音色参考、口型/节奏会脱节
sm120 + SageAttention 灰屏风险长序列会整段灰屏同⚠️ 参考视频先派生到 480×864 / 24 fps(Studio 文档 docs/h3-reference-video-preprocessing-requirements.md 已把它写成硬性验收项);H3 优先走 ComfyUI 官方 Director 工作流(不含已被证实会强拉 SageAttention 的实验补丁节点)
绿幕纯色背景易抠平坦绿幕✅ 想保留绿幕就正向描述"chroma-key green backdrop";想换场景就把原背景列入排除项(已有成功先例)

五、本机已验证的先例(2026-09-14,可复用其结论)

记录内容结果
10-视频生成流水线/20260914_0101_绿幕人偶测试/提示词把画面定义为「红色无脸人形人偶(红色西装 + 白衬衫 + 黄领带)+ 两个白色无脸女偶 + 平坦绿幕」,声明 not_referenced 所有文字/水印证明人偶+绿幕可按规范描述并控制输出
10-视频生成流水线/多人换人提示词-红模特主角-7张三视图-20260914.md源视频 = 红模特主角 + 6 个白模特配角;7 张三视图换人;过 identity-migration 校验;单人/多人编号规则、五条铁律、4 步 Turbo 参数✅ 成功的完整配方(含"三视图=1 个人不是 3 个人"的声明写法)
10-视频生成流水线/H3换人视频-部署与实测报告-20260914.md抖音绿幕人偶参考视频 → 全部替换为指定形象、保留原动作;run --mode rv2v,141 帧 / 1344×768 / 9 分 15 秒✅ 多人换人成功;坑:--segment-frames 默认 243 会爆显存(5 s 源用 124)、输出分辨率固定 1344×768(降源不省显存)、必须固定 --seed 否则背景漂移
20260914_0220/0227_姿态参考测试把红/白模当作 pose_reference_only(只取姿态/站位/镜头,人偶不得渲染)✅ 已有可直接套用的 retention 写法

六、可选路线(等你决定,GPU 空闲再跑)

路线怎么做适用代价/前置
A. 官方 Director-rv2v(推荐)ComfyUI 打开 user/default/workflows/H3官方工作流/Director-rv2v.json(或"加速4步"版);<Video 1> = 03(或裁好的 02),<Picture N> = 目标角色三视图;提示词走 identity-migration 规范并过校验器换角色、保留动作/编队/镜头/音频;最"官方"、最稳无需新装模型;要写提示词 + 固定 seed;单段 ≤15.08 s
B. 加装 Fun ControlNet Union下 minimax_h3_fun_controlnet_union_pruned_int8_convrot → models/model_patches/;sdpose_wholebody_fp16 → models/checkpoints/;rt_detr_v4-x-hgnet_fp16 → models/diffusion_models/;用官方模板,pose 控制视频可用原舞者或白模需要姿势级强控制、背景/服装大改、原片太复杂约 1–2 GB 下载 + 一次兼容性验证;ComfyUI 已 ≥0.35 ✅
C. Studio 编排(dance-replication / 长视频)h3ctl ... --mode rv2v + h3-dance-replication;长片用 video compose 分段(3–1000 段)需换背景 + 编队指定 + 长视频⚠️ 2026-09-14 有 SageAttention 补丁导致掉总线的历史(已修);优先 A

跑之前需要你确认的 4 件事:① 用 03(红模·双枪·14 s)还是 02(白模·21.5 s 需裁);② 目标角色图(单张正面 vs 三视图单人或多人);③ 保留原绿幕还是换新场景(换场景要写排除项);④ 音轨是否 fully_copy 复用。


七、GPU 机现状(本次核查只读,未改动)


八、参考链接

九、本地相关文件索引

下载此文件