# MiniMax H3 提速方案（基于社区最新性能实测，2026-09-06）

> 目标机：RTX 5060 Ti 16GB / 32GB RAM(+72GB swap) / ComfyUI 0.34 / H3 int8_convrot+w4a8 + NVFP4 TE / torch 2.11.0+cu130（CUDA 13 ✓）
> 现状实测：官方 25 步工作流 **143s/it × 25 ≈ 60 分钟/条 15s 视频**（远程日志逐 it 确认，非估算）
> 数据来源：社区《MiniMax H3 – Performance & Best-Configuration Report》（2026-08-16，2 份硬核基准 + 17 份 Reddit 实测）及本机配置核对

---

## 一、现状诊断：60 分钟花在哪

- **步数是大头**：25 步 × 143s/it ≈ 59m48s。社区同款 12GB/32GB 机 832×480 10s 实测：15 步 7m22s / 20 步 8m25s / **25 步 10m30s** —— 步数几乎线性决定时长。
- **显存档加剧**：16GB 卡 + 20GB 模型 dynamic staging（`--lowvram`，日志 "19995MB Staged"）每步都在内存/swap 间搬运权重；32GB RAM + swap 是隐性瓶颈（12GB 档实测：64GB RAM 是 offload 抖动的**根治**手段）。
- 好消息：你的 **CUDA 13 + torch 2.11** 已经是社区"提速前置条件"的达标状态（有 4080S 老哥同参数下 12.6→13 后 1MP/5s 从 20–60 分钟掉到 **~300s**）；音频 VAE fp32、ComfyUI ≥0.30（你 0.34）也都已满足。

---

## 二、提速优先级（针对 16GB 档，按性价比排序）

| # | 手段 | 预期 | 社区证据与注意 |
|---|---|---|---|
| ① | **Turbo LoRA 降步数（最优先）** | 采样时间 ÷3.4（4步）/ ÷2.1（8步）→ 60min → **约 15–20min** | 基准 RTX 4070 12GB（576×832/124帧）：baseline 20步 272.97s → **LightX2V 8-step 用 4 步 = 79.36s（3.44×，最快）**；Larz/drbaph v4_step600_ema 8步 = 130.3s（2.09×） |
| ② | **换轻量 attention（替代已禁用的 Sage）** | 5–30% 采样提速（实测档位） | **Sol-Attn：community 判 lossless（bit-identical），显存开销小，--lowvram 友好（你已装 ComfyUI-SolAttn_triton）**；`--use-ck-attention`（Comfy Kitchen 内置）：40/50 系多名用户报告比 Sage 快/干净；Sage 全球 flag 维持禁用 |
| ③ | **分辨率/时长控制** | 每条再省 30–60% | 社区消费卡实践线：0.2MP 是速度地板、**0.8MP 是可用的天花板**；15s 用链式分段（你已有 last-frame chaining 经验），单条 5–10s + 拼接 |
| ④ | **内存（治本）** | 消除 per-step shuffle | 32GB+swap → **64GB RAM** 是 12GB/16GB 档社区公认的 offload 抖动根治项 |
| ⑤ | **双段流程 + EasyCache（草稿向）** | 草稿 5–10min/条 | 12GB 档实测 20 步 1280×736/5s=1006s，**Turbo 4 步 + EasyCache = 420s**（最快可用组合）；先 4 步低清草稿、再高步数精修或外部放大。注意 EasyCache 社区报告有分歧（能否配 Turbo LoRA），按草稿工具用、可 A/B |
| ⑥ | 采样器微调 | 同步数省 10–20% | 基准：`res_multistep` 或 `euler/simple`，cfg=1.0，sigma_shift video 12 / audio 3（audio 6 更响但对轻声~9dB 过冲）；20 步=质量基准，25–32 步只换来 +15–20% 音频/动态收益 |

---

## 三、社区各档实测锚点（对照你的 16GB 档）

| 配置 | 实测 |
|---|---|
| RTX 4080 Super + CUDA 13 + 8步 Turbo + Sage + Spectrum | **~300s / 1MP 5s**（原来 20–60min） |
| RTX 5080 16GB（已官方基准） | 960×544 舒适运行（h3-turbo-eval 25 组配置全跑） |
| 12GB + 32GB RAM | 20步 1280×736/5s = 1006s；Turbo4+EasyCache = 420s |
| 12GB + 32GB RAM（你同基建） | 832×480 10s：15/20/25 步 = 7m22s / 8m25s / 10m30s |
| 12GB --lowvram 加速器结论 | ✅Sol-Attn（无损）✅Turbo4+EasyCache ✅64GB RAM；❌Sage（2.5–3×更慢，多占显存→多卸载）❌Spectrum（30–50 步才有用）⚠️FP8 (<15% gain) |

---

## 四、立即执行的行动清单

1. **直接用"加速版"工作流**：本机已有 `H3Director官方-20260903/minimax_h3_director_加速版.json` 和 `..._二采_加速.json`（官方模板自带 turbo LoRA + 加速接线），FL2VA/T2V 场景今天就能切。
2. **LoRA 文件选对**（本机 loras/ 已有）：
   - FL2V：`minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16`（稳妥）或 `...4step_v1.0_768p_comfyui_bf16`（最快）；`...4step_v0.1...alpha8` 是旧 v0.1，不优先
   - Ref2V：`minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16`（先用 8 步或保留高步数跑成品）
   - T8 的 `minimax_h3_turbo_4步加速_DasiwaREF2VAHybridV1...` 是 dasiwa/turbo 混合向。
3. **质量与速度分场景**：
   - 草稿/批量/镜头裁选：4–8 步 + 0.5MP 内 → 单条 5–15min
   - 成品（尤其 Ref2VA/音频重要）：≥20 步 + ≤0.8MP；**4 步蒸馏会伤轻声/口音/快动作**，成品别用
   - 15s：分段链式（每段 5–10s，接 last-frame）
4. **attention 冒烟 A/B（每个 7 分钟短任务）**：Sol-Attn 开关 → 若稳定且提速，永久开（无损）；再试 `--use-ck-attention` 对比。Sage 保持禁用。
5. **观察 swap/瓶颈**：`free -h`、跑任务时看 `vmstat`；若 per-step shuffle 明显（swap 抖动），优先重内存（32→64GB 已是社区根治共识，成本<一张 24GB 卡）。
6. **CUDA 13 收益你已吃到**，无需再动；未来关注：官方 4/8 步版本、稀疏注意力、GGUF Q4_K_M（UNet 19.9GB/总~40GB）作为 16GB 档备选权重。

---

## 五、预期

- 同样的 15s 场景：**60min → 乐观 15–25min**（8 步 + Sol-Attn + 0.8MP 内），4 步草稿档可到 **~10min**。
- 再往下就是成本问题：云上 H3 Max（fal，5s≈3s、约 $0.20/5s@768p）做交期/批量；或硬件升级（24GB+ / 64GB RAM / 多卡 vLLM-Omni）。

---

## 六、参考
- 社区性能报告（本文主要数据源）：https://github.com/wildminder/awesome-minimax-H3/blob/main/guides/minimax-h3-performance.md
- h3-turbo-eval 25 组配置基准：https://jo-nike.github.io/h3-turbo-eval/
- sepiablue-ai turbo-lora 基准：https://github.com/sepiablue-ai/minimax-h3-turbo-lora-benchmark
- 相关前排记录：`2026-09-06-SageAttention是否导致GPU掉线-核实.md`、`2026-09-06-SageAttention版本3核实.md`、`2026-09-06-sageattention-Blackwell社区轮子评价.md`（同目录）