核查时间:2026-09-27 00:45 | 执行者:DSH(本机)| 未跑任何生成任务(GPU 机当时 2774 MiB 占用 / 0% 利用率,只在跑别的业务) 触发:用户下载了
03_L_复仇摇-ai素材_720x1280.mp4,想确认「H3 官方是否发布过参考这类白模/红模素材的工作流」
MiniMax-AI/MiniMax-H3 + HuggingFace MiniMaxAI/MiniMax-H3)发布的是能力与写法规范:Ref2VA「全参考」模型 + 官方《全参考提示词指南》。该规范明确允许一段参考视频只提供动作/编队/镜头,身份完全来自图片——这正是白模/红模素材的用法,但官方从不使用「白模/红模」这个词,官方示例里的参考视频也是真人(粉西装抱黑羊羔的小伙子)。models/model_patches/ 为空、无 SDPose 权重),要用得先下载。generate --mode rv2v,多人换人成功,141 帧 / 1344×768 / 9 分 15 秒)。这次的 03 素材可单条直接用(14.04 s,正好压在 15 s 参考上限内);02(21.5 s)必须裁到 ≤15 s 才能喂。| 项 | 02_L_去年夏天-白膜素材 | 03_L_复仇摇-ai素材 |
|---|---|---|
| 作者 / 来源 | 抖音 L(unique_id 90624020045,签名「首发原创高质量白模风格视频」) | 同账号 L;文案 #复仇摇 ai素材自取,作品@晚棠不吃榴莲 |
| 分辨率 | 1080×1920(竖屏 9:16,源即天花板) | 720×1280(竖屏 9:16,源即天花板) |
| 编码 / 像素格式 | H.264 / yuv420p | H.264 / yuv420p |
| 帧率 | 24 fps | 24 fps |
| 帧数 / 时长 | 516 帧 / 21.50 s | 337 帧 / 14.04 s |
| 音频 | AAC 44.1 kHz 立体声(21.5 s) | AAC 44.1 kHz 立体声(14.08 s),128 kbps |
| 画面内容(抽帧目视) | 白模(白色无脸人形)舞蹈素材 | 红模:红色无脸人偶、绿色纯色背景(chroma green),双手持银色手枪的舞蹈动作 |
| 背景 | 绿幕/纯色棚 | 平坦绿幕,无地板线、无阴影杂物(好抠像) |
| 文件大小 | 1.59 MiB | 1.18 MiB |
| SHA-256 | a397bb8198ba547f53330b305fab9449b32aa86a502b01499538c36bca60076b | 56c92d4314896e4513ddf2341468f34562f187c8747145d1cfb865a19a61dfc6 |
| 质检 | 全解码零 error / warning、无抖音水印、无片尾卡(见 56-抖音视频下载/README-下载说明.md) | 同左 |
素材本体在:/home/zyw/Downloads/dl-hub/56-抖音视频下载/(含封面 webp、抽帧 jpg、完整档位元数据 json)
| 官方产物 | 内容 | 与「白模/红模」的关系 |
|---|---|---|
H3-Base-Ref2VA(omni-reference) | 多模态参考:图 ≤9、视频 ≤3 段(每段 2–15 s,合计 ≤15 s)、音频 ≤3 段(同规格)、跨类型合计 ≤12 个文件 | ✅ 正是吃「白模/红模舞视频 + 角色图」的模型(本机已装 minimax_h3_ref2va_pruned_int8_convrot 等) |
官方《全参考模式提示词指南》VIDEO_PROMPT_WRITING_GUIDE_ref_en.md | 六段式;任务类型表含 reference generation("一段视频只提供动作/运镜/节奏等生成指引,不作为被编辑的源视频")与 video editing;retention_analysis 里可声明 <Video 1>: fully_preserved for body movement, poses, action timing, camera ...、<Subject 1>: identity_not_preserved | ✅ 白模/红模素材的官方写法依据:把模特当"只供动作的参考视频",身份另接图片。❌ 通篇没有 mannequin / 白模 / 绿幕等字样 |
官方可复现脚本 scripts/readme/*ref2va* | 含真实示例:参考视频是 cdn.hailuoai.com/.../h3_promo_eval_ref2va/...mp4(真人:粉西装+黑羊羔),参考音频 mp3 | ❌ 官方示例素材是真人,没有官方白模/红模示例资产 |
官方 9 个技能(skills/) | 1 个可移植 h3-prompt-writing + 8 个 MiniMax Hub 专用风格技能(3D 动画短片、品牌片、纸艺定格、手绘实拍、纸拼贴、极简产品广告、MV 字幕、联机游戏开场) | ❌ 没有"白模/红模/舞蹈复刻/换人"技能 |
| 官方可复现脚本 / H3-Regenerate-2K / Context-IR | 只提供 API 与脚本;Context-IR、Regenerate-2K、稀疏注意力未开源 | 与本问题无关(但 2K 输出走这条路) |
参考:GitHub MiniMax-AI/MiniMax-H3、官方全参考提示词指南;本地已离线归档于
dl-hub/13-MiniMaxH3官方资源包/
| 官方模板/文档 | 用途 | 与白模/红模的关系 |
|---|---|---|
| MiniMax H3 R2V(= Ref2VA) 模板 + 文档 | 参考图/视频/音频组合生成;文档明确"给每个参考分配任务(身份/风格/运动/相机/声音)";ref_image_size=match/max | ✅ 官方版的"参考生视频",白模/红模接 <Video 1> |
| Fun ControlNet Union 模板 | Canny / Depth / HED / MLSD / Pose 控制视频 + mask 局部重绘;内置 SDPose 子图自动从输入视频抽骨架(示例素材 dancer_field_pose.mp4) | ✅✅ 官方体系里最贴近「白模/骨骼驱动」的一条;但需下载 minimax_h3_fun_controlnet_union_pruned_int8_convrot + sdpose_wholebody_fp16 + rt_detr_v4-x-hgnet_fp16,要求 ComfyUI ≥ 0.35.0(本机 0.37.0 ✅,模型 ❌ 未装) |
| Multi-frame reference 模板 | 用 MiniMaxH3AddGuide 把引导锚定到任意帧(视频片段/音频) | 辅助(分段、续接) |
| FastVideo FastH3 模板 | 加速推理 | 辅助(提速) |
blueprints/ 里的 motion_transfer_wan_animate_2 / image_to_video_wan_dancer | 是 Wan 系的动作迁移/舞蹈,不是 H3 | ⚠️ 别混:这类"动作迁移"官方归在 Wan Animate 名下 |
参考:ComfyUI H3 原生工作流(T2V/I2V/R2V)、H3 Fun ControlNet Union、H3 提示词指南
| 产物 | 位置 | 说明 |
|---|---|---|
h3-dance-replication(舞蹈复刻) | GPU 机 ~/minimax-h3-video-studio/skills/ | 项目自带技能:把参考舞蹈视频当动作/队形/镜头/音轨来源,替换成指定角色与新背景;默认 4-step Turbo、9:16 |
h3-character-migration(人物迁移) | 同上 | 单人换身份、保原场景/镜头/音频,支持持久分段与 Motion Context |
identity-migration.md 身份迁移规范 | skills/h3-ref2va-prompt-compiler/references/ | 编号铁律:<Subject 1>=源视频被替换者,<Subject 2>=目标角色(来自 <Picture 1>);必须过 validate_h3_ref2va_prompt.py --profile identity-migration |
| H3 Video Studio 本体 | GPU 机 /home/zyw/minimax-h3-video-studio,v0.5.0,非 MiniMax 官方项目(仓库 siyuan-liu31/minimax-h3-video-studio) | CHANGELOG 明确"新增项目内置 H3 生产 Skill 套件:人物对白生视频、舞蹈复刻与不限时长人物迁移";其参考合同也已对齐官方规格(图 9 / 视频 3 / 音频 3 / 合计 12) |
这就是你可能记得的"官方发布"来源之一——skill 名字和措辞很像官方,但它属于本地 Studio 项目,不是 MiniMax 官方仓库。MiniMax 官方
skills/只有 9 个,且不含舞蹈/换人。
官方 Ref2VA 参考约束 vs 素材实际:
| 约束 | 02 白膜素材 | 03 红模素材 | 判定 |
|---|---|---|---|
| 参考视频每段 2–15 s | 21.50 s | 14.04 s | 02 ❌ 需裁到 ≤15 s(建议取 5–8 s 单一动作段);03 ✅ |
| 参考视频总时长 ≤15 s | — | — | 03 单条几乎吃满 15 s 预算 → 同一次任务里别再叠第二条视频;02 裁完就独占 |
| 参考视频 ≤3 段、混合文件 ≤12 | 满足 | 满足 | ✅ |
| 帧率 | 24 fps | 24 fps | ✅ 与 H3 输出 24 fps 一致(省一次真补帧) |
| 画布(短边 768 / 每轴 32 倍数) | 1080×1920 | 720×1280(720 不是 32 的倍数) | ⚠️ 需按派生规则落画布:竖屏 1080×1920 → 480×864(省显存);720×1280 → 同样 480×864 或 736/704×1280 |
| 编码 / 像素格式 | H.264 / yuv420p ✅ | H.264 / yuv420p ✅ | ✅ 已符合参考视频预处理要求(H.264 + YUV420P + 24 fps) |
| 音频复用 | 有音轨,可 <Audio 1>: fully_copy | 有音轨,可复用("复仇摇"配乐) | ✅ 但要用官方 fully_copy 标记,否则 H3 只当音色参考、口型/节奏会脱节 |
| sm120 + SageAttention 灰屏风险 | 长序列会整段灰屏 | 同 | ⚠️ 参考视频先派生到 480×864 / 24 fps(Studio 文档 docs/h3-reference-video-preprocessing-requirements.md 已把它写成硬性验收项);H3 优先走 ComfyUI 官方 Director 工作流(不含已被证实会强拉 SageAttention 的实验补丁节点) |
| 绿幕 | 纯色背景易抠 | 平坦绿幕 | ✅ 想保留绿幕就正向描述"chroma-key green backdrop";想换场景就把原背景列入排除项(已有成功先例) |
| 记录 | 内容 | 结果 |
|---|---|---|
10-视频生成流水线/20260914_0101_绿幕人偶测试/ | 提示词把画面定义为「红色无脸人形人偶(红色西装 + 白衬衫 + 黄领带)+ 两个白色无脸女偶 + 平坦绿幕」,声明 not_referenced 所有文字/水印 | 证明人偶+绿幕可按规范描述并控制输出 |
10-视频生成流水线/多人换人提示词-红模特主角-7张三视图-20260914.md | 源视频 = 红模特主角 + 6 个白模特配角;7 张三视图换人;过 identity-migration 校验;单人/多人编号规则、五条铁律、4 步 Turbo 参数 | ✅ 成功的完整配方(含"三视图=1 个人不是 3 个人"的声明写法) |
10-视频生成流水线/H3换人视频-部署与实测报告-20260914.md | 抖音绿幕人偶参考视频 → 全部替换为指定形象、保留原动作;run --mode rv2v,141 帧 / 1344×768 / 9 分 15 秒 | ✅ 多人换人成功;坑:--segment-frames 默认 243 会爆显存(5 s 源用 124)、输出分辨率固定 1344×768(降源不省显存)、必须固定 --seed 否则背景漂移 |
20260914_0220/0227_姿态参考测试 | 把红/白模当作 pose_reference_only(只取姿态/站位/镜头,人偶不得渲染) | ✅ 已有可直接套用的 retention 写法 |
| 路线 | 怎么做 | 适用 | 代价/前置 |
|---|---|---|---|
| A. 官方 Director-rv2v(推荐) | ComfyUI 打开 user/default/workflows/H3官方工作流/Director-rv2v.json(或"加速4步"版);<Video 1> = 03(或裁好的 02),<Picture N> = 目标角色三视图;提示词走 identity-migration 规范并过校验器 | 换角色、保留动作/编队/镜头/音频;最"官方"、最稳 | 无需新装模型;要写提示词 + 固定 seed;单段 ≤15.08 s |
| B. 加装 Fun ControlNet Union | 下 minimax_h3_fun_controlnet_union_pruned_int8_convrot → models/model_patches/;sdpose_wholebody_fp16 → models/checkpoints/;rt_detr_v4-x-hgnet_fp16 → models/diffusion_models/;用官方模板,pose 控制视频可用原舞者或白模 | 需要姿势级强控制、背景/服装大改、原片太复杂 | 约 1–2 GB 下载 + 一次兼容性验证;ComfyUI 已 ≥0.35 ✅ |
| C. Studio 编排(dance-replication / 长视频) | h3ctl ... --mode rv2v + h3-dance-replication;长片用 video compose 分段(3–1000 段) | 需换背景 + 编队指定 + 长视频 | ⚠️ 2026-09-14 有 SageAttention 补丁导致掉总线的历史(已修);优先 A |
跑之前需要你确认的 4 件事:① 用 03(红模·双枪·14 s)还是 02(白模·21.5 s 需裁);② 目标角色图(单张正面 vs 三视图单人或多人);③ 保留原绿幕还是换新场景(换场景要写排除项);④ 音轨是否 fully_copy 复用。
nvidia-smi:2774 MiB / 16311 MiB,GPU util 0%(有别的服务常驻但空闲,未跑任何生成)。minimax_h3_ref2va_pruned_int8_convrot、minimax_h3_fl2va_pruned_int8_convrot、DasiwaMinimaxH3_dasiwaHybrid8turboV1、Minimax-h3_Singularity_ref2va_Pruned_v1.3_int8 等。ComfyUI/user/default/workflows/H3官方工作流/(Director rv2v / r2v / v2v / fl2v / t2v / 加速版 / 二采加速 / 外部组 / MotionContext)——已就位、界面可见。models/model_patches/ 只有占位文件 put_model_patches_here)。dl-hub/56-抖音视频下载/02_L_去年夏天-白膜素材_1080x1920.mp4、03_L_复仇摇-ai素材_720x1280.mp4(+ 封面 / 抽帧 / 元数据 / sha256.txt / README-下载说明.md)dl-hub/13-MiniMaxH3官方资源包/(含官方 prompt 指南、9 技能、可复现脚本)dl-hub/10-视频生成流水线/H3换人视频-部署与实测报告-20260914.md、多人换人提示词-红模特主角-7张三视图-20260914.md、H3长视频分段合成方法-20260914.md、T8mars-H3生态速览-20260915.mddl-hub/06-ComfyUI-H3运维记录/ComfyUI-H3运维记录.md