2026-09-06-H3提速方案.md

MiniMax H3 提速方案(基于社区最新性能实测,2026-09-06)

目标机:RTX 5060 Ti 16GB / 32GB RAM(+72GB swap) / ComfyUI 0.34 / H3 int8_convrot+w4a8 + NVFP4 TE / torch 2.11.0+cu130(CUDA 13 ✓) 现状实测:官方 25 步工作流 143s/it × 25 ≈ 60 分钟/条 15s 视频(远程日志逐 it 确认,非估算) 数据来源:社区《MiniMax H3 – Performance & Best-Configuration Report》(2026-08-16,2 份硬核基准 + 17 份 Reddit 实测)及本机配置核对


一、现状诊断:60 分钟花在哪


二、提速优先级(针对 16GB 档,按性价比排序)

#手段预期社区证据与注意
①Turbo LoRA 降步数(最优先)采样时间 ÷3.4(4步)/ ÷2.1(8步)→ 60min → 约 15–20min基准 RTX 4070 12GB(576×832/124帧):baseline 20步 272.97s → LightX2V 8-step 用 4 步 = 79.36s(3.44×,最快);Larz/drbaph v4_step600_ema 8步 = 130.3s(2.09×)
②换轻量 attention(替代已禁用的 Sage)5–30% 采样提速(实测档位)Sol-Attn:community 判 lossless(bit-identical),显存开销小,--lowvram 友好(你已装 ComfyUI-SolAttn_triton);--use-ck-attention(Comfy Kitchen 内置):40/50 系多名用户报告比 Sage 快/干净;Sage 全球 flag 维持禁用
③分辨率/时长控制每条再省 30–60%社区消费卡实践线:0.2MP 是速度地板、0.8MP 是可用的天花板;15s 用链式分段(你已有 last-frame chaining 经验),单条 5–10s + 拼接
④内存(治本)消除 per-step shuffle32GB+swap → 64GB RAM 是 12GB/16GB 档社区公认的 offload 抖动根治项
⑤双段流程 + EasyCache(草稿向)草稿 5–10min/条12GB 档实测 20 步 1280×736/5s=1006s,Turbo 4 步 + EasyCache = 420s(最快可用组合);先 4 步低清草稿、再高步数精修或外部放大。注意 EasyCache 社区报告有分歧(能否配 Turbo LoRA),按草稿工具用、可 A/B
⑥采样器微调同步数省 10–20%基准:res_multistep 或 euler/simple,cfg=1.0,sigma_shift video 12 / audio 3(audio 6 更响但对轻声~9dB 过冲);20 步=质量基准,25–32 步只换来 +15–20% 音频/动态收益

三、社区各档实测锚点(对照你的 16GB 档)

配置实测
RTX 4080 Super + CUDA 13 + 8步 Turbo + Sage + Spectrum~300s / 1MP 5s(原来 20–60min)
RTX 5080 16GB(已官方基准)960×544 舒适运行(h3-turbo-eval 25 组配置全跑)
12GB + 32GB RAM20步 1280×736/5s = 1006s;Turbo4+EasyCache = 420s
12GB + 32GB RAM(你同基建)832×480 10s:15/20/25 步 = 7m22s / 8m25s / 10m30s
12GB --lowvram 加速器结论✅Sol-Attn(无损)✅Turbo4+EasyCache ✅64GB RAM;❌Sage(2.5–3×更慢,多占显存→多卸载)❌Spectrum(30–50 步才有用)⚠️FP8 (<15% gain)

四、立即执行的行动清单

  1. 直接用"加速版"工作流:本机已有 H3Director官方-20260903/minimax_h3_director_加速版.json 和 ..._二采_加速.json(官方模板自带 turbo LoRA + 加速接线),FL2VA/T2V 场景今天就能切。
  2. LoRA 文件选对(本机 loras/ 已有):
    • FL2V:minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16(稳妥)或 ...4step_v1.0_768p_comfyui_bf16(最快);...4step_v0.1...alpha8 是旧 v0.1,不优先
    • Ref2V:minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16(先用 8 步或保留高步数跑成品)
    • T8 的 minimax_h3_turbo_4步加速_DasiwaREF2VAHybridV1... 是 dasiwa/turbo 混合向。
  3. 质量与速度分场景:
    • 草稿/批量/镜头裁选:4–8 步 + 0.5MP 内 → 单条 5–15min
    • 成品(尤其 Ref2VA/音频重要):≥20 步 + ≤0.8MP;4 步蒸馏会伤轻声/口音/快动作,成品别用
    • 15s:分段链式(每段 5–10s,接 last-frame)
  4. attention 冒烟 A/B(每个 7 分钟短任务):Sol-Attn 开关 → 若稳定且提速,永久开(无损);再试 --use-ck-attention 对比。Sage 保持禁用。
  5. 观察 swap/瓶颈:free -h、跑任务时看 vmstat;若 per-step shuffle 明显(swap 抖动),优先重内存(32→64GB 已是社区根治共识,成本<一张 24GB 卡)。
  6. CUDA 13 收益你已吃到,无需再动;未来关注:官方 4/8 步版本、稀疏注意力、GGUF Q4_K_M(UNet 19.9GB/总~40GB)作为 16GB 档备选权重。

五、预期


六、参考

下载此文件