报告_MiniMax_H3_dasiwa加速部署.md

MiniMax H3(海螺 AI 3.0)加速部署调研与实测报告

主题:社区开发者 dasiwa(大师娃,GitHub: darksidewalker) 发布的 MiniMax H3 加速更新调研与 GPU 机(192.168.31.25)部署验证。 目标:把 0.4MP × 10s 的视频生成时间压缩到 2 分钟量级。 日期:2026-08-29 | 状态:已部署并实测


一、背景与结论速览


二、技术材料来源(社区与官方)

来源链接说明
dasiwa 节点包仓库https://github.com/darksidewalker/ComfyUI-DaSiWa-NodesH3 Cache / Kitchen Attention / Director
H3 Cache 文档https://github.com/darksidewalker/ComfyUI-DaSiWa-Nodes/blob/main/docs/minimax_h3_cache.md算法、参数、兼容性
H3 Director 文档https://github.com/darksidewalker/ComfyUI-DaSiWa-Nodes/blob/main/docs/minimax_h3_director.mdUI 使用手册
缓存算法上游https://github.com/lihaoyun6/ComfyUI-MiniMaxH3-Cachedasiwa 缓存算法来源(GPL-3.0)
官方模型转制包https://huggingface.co/Comfy-Org/MiniMax-H3ComfyUI 各量化档模型
官方原始权重https://huggingface.co/MiniMaxAI/MiniMax-H3MiniMax 官方仓库
官方 ComfyUI 文档https://docs.comfy.org/tutorials/video/minimax/minimax-h3官方教程
官方工作流模板https://github.com/Comfy-Org/workflow_templatest2v / i2v / r2v
社区整合包介绍https://www.zxcyw.com/ai-vloggers/walk-with-ai/17541.htmlturbo LoRA 4/8/20 步 + 放大
社区视频演示https://www.bilibili.com/video/BV16mug6WEEs/“首个 H3 加速插件 500s+→200s+”

三、加速原理

3.1 MiniMax H3 Cache(dasiwa / lihaoyun6 同源算法)

3.2 Patch Comfy Kitchen Attention

3.3 组合拳(本机实测配置)

UNETLoader(w4a8) → LoraLoaderModelOnly(turbo 8step) → MiniMaxH3Cache → PatchComfyKitchenAttention → Guider/Sampler


四、模型文件清单(Comfy-Org/MiniMax-H3)

存放路径均为 ComfyUI/models/ 下对应子目录。

文件大小说明
diffusion_models/minimax_h3_fl2va_pruned_w4a8_mixed.safetensors12.5 GB主模型 FL2VA,w4a8 混合量化(本机选用,最省显存)
diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors21.0 GB主模型 int8 档(官方推荐,需 cu130)
diffusion_models/minimax_h3_ref2va_pruned_w4a8_mixed.safetensors11.8 GBRef2VA 参考视频模式 w4a8
text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15.7 GB32B 文本编码器 nvfp4(不要求 Blackwell)
text_encoders/qwen3vl_32b_minimax_h3_int8_convrot.safetensors27.1 GB32B 文本编码器 int8
vae/minimax_h3_video_vae_int8_convrot.safetensors3.2 GB视频 VAE int8
vae/minimax_h3_video_vae_fp16.safetensors5.2 GB视频 VAE fp16
vae/minimax_h3_audio_vae_fp32.safetensors0.6 GB音频 VAE
loras/minimax/minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors2.0 GBturbo 8 步 LoRA(平衡档)
loras/minimax_h3_fl2v_turbo_4step_v1.0_768p_comfyui_bf16.safetensors2.0 GBturbo 4 步 LoRA(最快档)

注:GPU 机(192.168.31.25)上列模型文件均已存在(此前会话已下载),本次无需重复下载。


五、部署过程(GPU 机 192.168.31.25)

环境:ComfyUI 0.32.0(git bd34f338)+ torch 2.11.0+cu130 + RTX 5060 Ti 16GB + 32GB RAM。

  1. 安装 dasiwa 节点包
    • 在 DSH 机经代理下载 darksidewalker/ComfyUI-DaSiWa-Nodes main 分支(1.9MB),scp 到 GPU 机 custom_nodes/ComfyUI-DaSiWa-Nodes。
    • 依赖(torch/av/Pillow/numpy/transformers/accelerate/huggingface_hub/psutil/imageio-ffmpeg)GPU 机均已具备;nvidia-vfx 为 RTX 节点可选项、惰性导入,缺失不影响加载。
  2. 重启 ComfyUI(v6 启动脚本,kill 旧进程后 bash /home/zyw/start_comfyui_v6.sh)
    • 日志确认:[DaSiWa Nodes] Loaded 22 ... nodes,Import times: 0.1s: ComfyUI-DaSiWa-Nodes
    • /object_info 确认注册:MiniMaxH3Cache、PathchComfyKitchenAttentionDaSiWa、MiniMaxH3Director、MiniMaxH3DirectorGuide 等。
  3. 节点重名说明:本机已有 ComfyUI_MiniMaxH3_Director(AiMixer 分支,注册 MiniMaxH3Director/MiniMaxH3DirectorRefine 等)。dasiwa 包同时注册 MiniMaxH3Director,仅此一名重名,ComfyUI 按加载序处理,未影响启动;Cache 与 Kitchen Attention 节点名唯一,正常使用。既有 Director 工作流不受影响。
  4. 测试工作流:h3_t2v_cache_workflow.json(已上传 GPU 机 user/default/workflows/)
    • 640×640(0.41 MP,32 对齐)× 243 帧(10.1s @24fps)T2V
    • 8 步 simple/res_multistep + turbo 8step LoRA + H3 Cache + Kitchen INT8 attention
    • API 提交:POST /prompt(prompt_id a13fa35e-…)

六、实测结果(RTX 5060 Ti 16GB / 32GB RAM)

测试条件:T2V 640×640(0.41 MP,32 对齐)× 243 帧(10.13s @24fps)+ 原生音频, w4a8 主模型 + nvfp4 文本编码器 + int8 视频 VAE + fp32 音频 VAE + turbo LoRA, ComfyUI 0.32.0(torch 2.11.0+cu130,v6 启动参数),API 提交。

#配置步数缓存命中端到端耗时说明
1默认缓存 + 冷启动82/8(1.33x)237.6 s含 ~50s 模型冷加载
2基线(无缓存)8—182.3 s对照基准
3激进缓存(阈值0.10)80/8182.3 s命中率与种子/轨迹相关,非越高越好
4默认缓存(0.05)82/8(1.33x)146.1 s(~2.4 分钟)相比基线省 ~36s
54步 turbo + 默认缓存41/4(1.33x)88.8 s(~1.5 分钟)✅达成 ≤2 分钟目标

结论

运行日志关键行(实测摘录)

[DaSiWa Patch Comfy Kitchen Attention] Using Comfy Kitchen INT8 attention.
[INFO] Model MiniMaxH3 prepared ... 11956MB Staged. 208 patches attached.
[DaSiWa MiniMax H3 Cache] step 2: reuse block-stack residual.
[DaSiWa MiniMax H3 Cache] skipped 2/8 block-stack runs (1.33x theoretical speedup).
[INFO] Prompt executed in 146.12 seconds
[INFO] Prompt executed in 88.77 seconds

七、使用建议


附:相关文件


八、T8mars TwoPass 二阶段工作流部署(2026-08-29 追加)

应需求"0.4MP 出片保存 latent → 核验 → 二采",安装社区 T8mars/comfyui-minimax-h3-audio-T8(学习型 latent 放大 + 二阶段生成)。

已部署

二采机制(作者说明)


九、MythicAlchemy 为什么 500s + 加速方案(2026-08-29 实测补充)

现象

用户在 GPU 机跑 dasiwa 官方 MythicAlchemy C-MMH3-16(5 秒素材)实测 521 秒,感觉"没有速度改善"。

原因(重要)

MythicAlchemy 是 dasiwa 的满配质量参考流,默认配置不包含任何加速手段:

→ 25 步 × ~20s ≈ 500s,属正常预期,不是故障。

实测对比(本机 RTX 5060 Ti 16GB)

配置素材采样步数采样耗时端到端
MythicAlchemy 原版(25 步原生)5s25~450s521.4s
扁平加速流(w4a8+8步turbo+Cache+INT8注意力)5s@0.41MP852s(命中2/8)227.8s(含67s模型冷加载)
扁平加速流(历史实测)10s@0.41MP8~120s(命中2/8)146.1s
扁平加速流(历史实测,4步turbo)10s@0.41MP4~60s88.8s

加速版工作流

已生成 DaSiWa MiniMaxH3 MythicAlchemy C-MMH3-16 加速版.json(同 UI):

提速建议(按收益排序)

  1. 步数 25→8 + turbo 8 步 LoRA:采样 450s→约 100-120s(加速版已配好)
  2. 换 4 步 turbo LoRA + 4 步:采样再减半(约 50-60s),验证提示词用
  3. 开 MemCache / SageAttention(Settings 面板开关):模型驻留减少重复加载(本机实测冷加载 67s vs warm 20s)
  4. 想更激进可自行在模型环路上插 MiniMaxH3Cache + Patch Comfy Kitchen Attention(参考本报告第六节实测)
  5. 换 w4a8 主模型(12.5GB)比 int8(21GB)offload 更轻

结论

dasiwa 缓存节点有效但命中率有限(实测 8 步命中 2/8,理论 1.33x);"2 分钟"目标的关键是 turbo LoRA 少步数(8→4 步),缓存与 INT8 注意力锦上添花。16GB 卡上 H3 的固定开销(模型加载+VAE 编解码)约 60-90s,素材越小占比越大。


十、DaSiWa Hybrid 8Turbo 融合模型部署(2026-08-30)

背景

社区/云镜像(compshare 260GB 镜像)主打的"DaSiWa MiniMax H3 融合模型",原始出处是 dasiwa 本人在 Civitai 发布的 DaSiWa MiniMax H3 Hybrid 系列(Hybrid v1 / 8Turbo v1 / 4Turbo v1,536 条 Overwhelmingly Positive 评价)。本质 = REF2VA pruned 基础 + turbo LoRA 熔进单个 checkpoint,8 步直接跑、免挂 LoRA。

获取

搭配工作流(官方原版,2026-08-30 修正)

按用户要求改用模型提供方官方工作流(不再自改 JSON):

提示

int4 文本编码器最终落地(2026-08-31 凌晨)

8Turbo 文件损坏实锤与重下(2026-08-31)

下载此文件