解读对象:抖音 @有趣的80后程序员 《TaomateH3 3步采样超高速模型》 短链 https://v.douyin.com/437JMeZfA6c/ · 视频 ID
7686315113481047296发布 2026-09-17 09:48(+08:00)· 时长 11 分 12 秒(672.5s)· 1024×576/30fps 数据:点赞 122 · 收藏 93 · 评论 11 · 分享 13 解读方式:下载 1080p 无 logo 原片 → 抽音频 → faster-whisper large-v3 逐句转写(GPU 机 CPU int8,272 段)→ 逐帧核对节点参数 → 外部资料交叉核实
视频不是"吹"也不是"黑",而是一次边界测试:TaoMate-H3 的三步 LoRA 在「大脸 + 低动作」这类简单表演场景里,画质和稳定性几乎不输四步/八步方案;但一旦涉及高速动作、特殊的摄影过程(延时摄影的光影扫过),或需要严格保留参考视频运动逻辑的任务,它会把"主体任务"做错——画面依旧好看,错误却很难第一眼发现。
作者的原话总结:"一个模型不是单纯谈它好还是不好,而是要搞清楚它到底合用在什么地方。"
| 时间 | 内容 |
|---|---|
| 00:00–00:40 | 开场:阿里 TaoLive AIGC 团队发布 TaoMate-H3,把传统 8 步 / 4 步 Turbo LoRA 压缩到 3 步;作者的疑问是"这么快,牺牲了什么" |
| 00:40–01:08 | 宣布测试计划:放进 ComfyUI,四组场景(大脸低动作 / 延时摄影复杂光影 / 两位古典美女快速比剑 / 复杂产品解构) |
| 01:08–01:57 | 准备工作:官方 TaoMate-H3 不能直接在 ComfyUI 用,必须下载转换版;介绍两个转换版 |
| 01:57–03:38 | 工作流讲解:两套(首尾帧 I2V / 参考生成 RV2V),结构相同只有条件节点不同;LoRA 强度 1.0;主模型二选一;采样 3 步、100 万像素、10 秒 |
| 03:38–05:35 | 测试 1:Big Face + Low Motion(第一人称手机视频通话) |
| 05:35–07:12 | 测试 2:延时摄影的中式窗格光影(同一人物 Character Sheet) |
| 07:12–08:33 | 测试 3:两位古典美女月夜竹林快速比剑 |
| 08:33–10:11 | 测试 4:精密相机零件解构(3D 参考视频 → 参考生成) |
| 10:11–11:12 | 总结:能力边界与主模型选择建议 |
官方原版不能直接进 ComfyUI,必须用转换版。作者介绍了两个,并声明本期全部测试用的是第一个:
| 版本 | 作者说法 | 实测文件体积(HF 核对) | 与官方权重的关系 |
|---|---|---|---|
| Robert(Robert1212star) | 约 2.48G,"只是格式转换,没有训练" | taomate_h3_3step_comfy.safetensors = 2,481,007,456 B(2.31 GiB) | 与官方 TaoLiveAIGC/TaoMate-H3 的 adapter_model.safetensors(2,480,974,080 B)体积几乎逐字节同量级 → 作者"只转格式不训练"的判断与体积吻合 |
| KJ(Kijai) | 平均 Rank 19,当前文件只有 182MB | loras/minimax_h3_taomate_3step_lora_avg_rank_19_bf16.safetensors = 181,697,688 B(173 MiB) | 降秩压缩版,体积只有 1/13 |
第三方还有一档:
Asirus/TaoMate_H3_3_Step_LoRA的 LIGHT fp16 / MAXQUALITY bf16,各 1.24 GB。作者没提。
安装:把文件丢进 ComfyUI/models/loras。作者也把工作流传到了 RunningHub(工作流文件本身视频里没给下载链接,需要自己去 RunningHub 找)。
两套工作流:首尾帧(Image-to-Video,用 FL2VA 权重) 与 参考生成(Reference-to-Video,用 Ref2VA 权重),结构相同,只有条件节点不同。该 LoRA 两套都能挂。
节点级参数(视频 190s 处的截屏,已存档到 关键帧/):
| 节点 | 取值 |
|---|---|
| Load LoRA | taomate_h3_3step_comfy.safetensors,strength_model = 1.00 |
| 主模型(测试 1/2 用的 Singularity 档) | Minimax-h3_Singularity_ref2va_Pruned_v1.3_int8.safetensors |
| Load CLIP | qwen3vl_32b_minimax_h3_int8_convrot.safetensors,type = minimax |
| SamplerCustomAdvanced ← KSamplerSelect | euler |
| BasicScheduler | beta,steps = 3,denoise = 1.00 |
| 注意力处理 | Memory Efficient Sage Attention 节点 + Sol Attention(作者说"参考 Singularity 的做法") |
| 分辨率 | 100 万像素(作者特意没走常见的 0.7 MP) |
| 时长 | 10 秒 |
⚠️ 转写稿里"采样器 Ola"是语音识别的误听,节点截图确认是 euler。
素材:一个人手里拿着竖屏手机,屏幕里女友把脸靠在手上,卧室柔和暖光。
素材:同一人物不同视角的 Character Sheet,在中式窗边生成角色,要求太阳运动把窗格阴影扫过脸部,明暗边界要正确。
素材:一段 3D 参考视频——零件从四周聚合成完整相机 → 镜头沿光轴展开 → 顶部面板 / 电路板 / 机身外壳按正确层次展开 → 最后重新收拢。
| 场景 | 建议 |
|---|---|
| 大脸低动作、普通人物表演、简单镜头推进、常规氛围视频 | 非常值得尝试三步 LoRA——速度又快,效果也不错 |
| 在意自然表情 / 较轻 AI 感 | 主模型选 Singularity |
| 在意构图边界、指令遵循、结构准确度 | 主模型选 官方模型 |
| 快速动作、特殊摄影过程、高难度参考生成 | 这个 LoRA 不能胜任 |
| 总纲 | 不是单纯谈模型好不好,而是搞清它合用在什么地方 |
这一节是我加的,不是视频内容。目的是验证作者说法、并补上他没讲的关键前提。
github.com/TaoLiveAIGC/TaoMate-H3(阿里淘天 TaoLive AIGC 团队)自述:它是基于 MiniMax H3 + 3-step LoRA 的低延迟流式音视频生成 runtime,一块块出同步的音视频、支持长视频续接。硬性要求:
性能表(8×H20,480×864,10 秒):纯 DiT 14.81s vs MiniMax H3 169.57s(11.45×),首个可播视频 17.29s vs 183.31s(10.60×)。
关键事实:官方目前只发布了 T2AV 的 3-step LoRA(FL2AV "26/10/15 前发布",Ref2AV 仍是 TBD)。
→ 这说明两件事:
github.com/matsuo-koya/minimax-h3-notes(单卡 RTX 5090,一个月实测)记录了 TaoMate-H3 3-step LoRA 自用的数据:
fc1 存的是 [value; gate],ComfyUI 的 H3 存的是 [gate; value];形状一样,不报错,LoRA 只半生效(风格转了、身份没转,强度调高就崩)。这解释了为什么市面"转换版"有好几个——选错转换脚本会出现"看起来能用但效果不对"的隐性坑。taomate_h3_3step_comfy.safetensors、strength 1.00、euler + beta、steps=3、1.00)与 HF 上的真实文件体积能逐项对上;对失败点的描述(哪一秒、哪里崩)很具体,不像摆拍。euler——以节点截图为准。qwen3vl_32b_minimax_h3_int8_convrot 与 Minimax-h3_Singularity_*_int8 属于本机没有安装的 int8_convrot 档(本机 dl-hub/06-ComfyUI-H3运维记录 已记录 MotionContext 工作流因此不可用)。Memory Efficient Sage Attention 正是本机笔记中确认的 GPU 掉总线元凶(MiniMaxH3MemoryEfficientSageAttentionPatch,即使把 sage_attention 设为 disabled 也会把注意力强行拉回 SageAttention,而本机 sageattention 无 sm120 内核 → GSP 挂死)。要用就先删掉/换掉该节点。| 文件 | 说明 |
|---|---|
dy-437JMeZfA6c-1080p.mp4 | 原片(1080p 无 logo,54.8 MB,1024×576/30fps/11:12) |
transcript/transcript.txt | 逐句转写(带时间戳,272 段) |
transcript/transcript.srt | 字幕格式,可直接挂播放器对照 |
关键帧/ | 6 张场景关键帧 + 4 张节点参数放大截图(采样器/调度器、Load LoRA、主模型、CLIP) |
本地路径:/home/zyw/Downloads/dl-hub/58-TaoMate-H3三步LoRA调研/ 下载页:http://192.168.31.76:8899/58-TaoMate-H3%E4%B8%89%E6%AD%A5LoRA%E8%B0%83%E7%A0%94/
| 转写 | 实际 |
|---|---|
| TaoLab AIJC / Talmate / TOMate | TaoLive AIGC / TaoMate(作者口音,转写误听) |
| 采样器 Ola | euler |
| 延迟摄影 | 延时摄影 |
| "首尾针" | 首尾帧 |
| "参考生成/参考视频" | RV2V(Reference-to-Video) |