MiniMax H3 提速方案(基于社区最新性能实测,2026-09-06)
目标机:RTX 5060 Ti 16GB / 32GB RAM(+72GB swap) / ComfyUI 0.34 / H3 int8_convrot+w4a8 + NVFP4 TE / torch 2.11.0+cu130(CUDA 13 ✓) 现状实测:官方 25 步工作流 143s/it × 25 ≈ 60 分钟/条 15s 视频(远程日志逐 it 确认,非估算) 数据来源:社区《MiniMax H3 – Performance & Best-Configuration Report》(2026-08-16,2 份硬核基准 + 17 份 Reddit 实测)及本机配置核对
一、现状诊断:60 分钟花在哪
- 步数是大头:25 步 × 143s/it ≈ 59m48s。社区同款 12GB/32GB 机 832×480 10s 实测:15 步 7m22s / 20 步 8m25s / 25 步 10m30s —— 步数几乎线性决定时长。
- 显存档加剧:16GB 卡 + 20GB 模型 dynamic staging(
--lowvram,日志 "19995MB Staged")每步都在内存/swap 间搬运权重;32GB RAM + swap 是隐性瓶颈(12GB 档实测:64GB RAM 是 offload 抖动的根治手段)。
- 好消息:你的 CUDA 13 + torch 2.11 已经是社区"提速前置条件"的达标状态(有 4080S 老哥同参数下 12.6→13 后 1MP/5s 从 20–60 分钟掉到 ~300s);音频 VAE fp32、ComfyUI ≥0.30(你 0.34)也都已满足。
二、提速优先级(针对 16GB 档,按性价比排序)
| # | 手段 | 预期 | 社区证据与注意 |
| ① | Turbo LoRA 降步数(最优先) | 采样时间 ÷3.4(4步)/ ÷2.1(8步)→ 60min → 约 15–20min | 基准 RTX 4070 12GB(576×832/124帧):baseline 20步 272.97s → LightX2V 8-step 用 4 步 = 79.36s(3.44×,最快);Larz/drbaph v4_step600_ema 8步 = 130.3s(2.09×) |
| ② | 换轻量 attention(替代已禁用的 Sage) | 5–30% 采样提速(实测档位) | Sol-Attn:community 判 lossless(bit-identical),显存开销小,--lowvram 友好(你已装 ComfyUI-SolAttn_triton);--use-ck-attention(Comfy Kitchen 内置):40/50 系多名用户报告比 Sage 快/干净;Sage 全球 flag 维持禁用 |
| ③ | 分辨率/时长控制 | 每条再省 30–60% | 社区消费卡实践线:0.2MP 是速度地板、0.8MP 是可用的天花板;15s 用链式分段(你已有 last-frame chaining 经验),单条 5–10s + 拼接 |
| ④ | 内存(治本) | 消除 per-step shuffle | 32GB+swap → 64GB RAM 是 12GB/16GB 档社区公认的 offload 抖动根治项 |
| ⑤ | 双段流程 + EasyCache(草稿向) | 草稿 5–10min/条 | 12GB 档实测 20 步 1280×736/5s=1006s,Turbo 4 步 + EasyCache = 420s(最快可用组合);先 4 步低清草稿、再高步数精修或外部放大。注意 EasyCache 社区报告有分歧(能否配 Turbo LoRA),按草稿工具用、可 A/B |
| ⑥ | 采样器微调 | 同步数省 10–20% | 基准:res_multistep 或 euler/simple,cfg=1.0,sigma_shift video 12 / audio 3(audio 6 更响但对轻声~9dB 过冲);20 步=质量基准,25–32 步只换来 +15–20% 音频/动态收益 |
三、社区各档实测锚点(对照你的 16GB 档)
| 配置 | 实测 |
| RTX 4080 Super + CUDA 13 + 8步 Turbo + Sage + Spectrum | ~300s / 1MP 5s(原来 20–60min) |
| RTX 5080 16GB(已官方基准) | 960×544 舒适运行(h3-turbo-eval 25 组配置全跑) |
| 12GB + 32GB RAM | 20步 1280×736/5s = 1006s;Turbo4+EasyCache = 420s |
| 12GB + 32GB RAM(你同基建) | 832×480 10s:15/20/25 步 = 7m22s / 8m25s / 10m30s |
| 12GB --lowvram 加速器结论 | ✅Sol-Attn(无损)✅Turbo4+EasyCache ✅64GB RAM;❌Sage(2.5–3×更慢,多占显存→多卸载)❌Spectrum(30–50 步才有用)⚠️FP8 (<15% gain) |
四、立即执行的行动清单
- 直接用"加速版"工作流:本机已有
H3Director官方-20260903/minimax_h3_director_加速版.json 和 ..._二采_加速.json(官方模板自带 turbo LoRA + 加速接线),FL2VA/T2V 场景今天就能切。
- LoRA 文件选对(本机 loras/ 已有):
- FL2V:
minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16(稳妥)或 ...4step_v1.0_768p_comfyui_bf16(最快);...4step_v0.1...alpha8 是旧 v0.1,不优先
- Ref2V:
minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16(先用 8 步或保留高步数跑成品)
- T8 的
minimax_h3_turbo_4步加速_DasiwaREF2VAHybridV1... 是 dasiwa/turbo 混合向。
- 质量与速度分场景:
- 草稿/批量/镜头裁选:4–8 步 + 0.5MP 内 → 单条 5–15min
- 成品(尤其 Ref2VA/音频重要):≥20 步 + ≤0.8MP;4 步蒸馏会伤轻声/口音/快动作,成品别用
- 15s:分段链式(每段 5–10s,接 last-frame)
- attention 冒烟 A/B(每个 7 分钟短任务):Sol-Attn 开关 → 若稳定且提速,永久开(无损);再试
--use-ck-attention 对比。Sage 保持禁用。
- 观察 swap/瓶颈:
free -h、跑任务时看 vmstat;若 per-step shuffle 明显(swap 抖动),优先重内存(32→64GB 已是社区根治共识,成本<一张 24GB 卡)。
- CUDA 13 收益你已吃到,无需再动;未来关注:官方 4/8 步版本、稀疏注意力、GGUF Q4_K_M(UNet 19.9GB/总~40GB)作为 16GB 档备选权重。
五、预期
- 同样的 15s 场景:60min → 乐观 15–25min(8 步 + Sol-Attn + 0.8MP 内),4 步草稿档可到 ~10min。
- 再往下就是成本问题:云上 H3 Max(fal,5s≈3s、约 $0.20/5s@768p)做交期/批量;或硬件升级(24GB+ / 64GB RAM / 多卡 vLLM-Omni)。
六、参考
- 社区性能报告(本文主要数据源):https://github.com/wildminder/awesome-minimax-H3/blob/main/guides/minimax-h3-performance.md
- h3-turbo-eval 25 组配置基准:https://jo-nike.github.io/h3-turbo-eval/
- sepiablue-ai turbo-lora 基准:https://github.com/sepiablue-ai/minimax-h3-turbo-lora-benchmark
- 相关前排记录:
2026-09-06-SageAttention是否导致GPU掉线-核实.md、2026-09-06-SageAttention版本3核实.md、2026-09-06-sageattention-Blackwell社区轮子评价.md(同目录)