目标场景:离线口播 / 说话人视频。输入 一张图(或一小段视频)+ 一段中文音频,输出口型同步成片。 不需要实时直播、实时对话、流式交互。
硬约束:
- 必须完全本地、免费、离线,不接入任何云端 API
- 单张 RTX 5060 Ti 16GB(Blackwell sm_120)+ 32GB 内存 + Ubuntu + ComfyUI
调研时点:2026-09-22
数据分级:🟢 第三方实测 | 🟡 厂商/论文宣称 | 🟨 中文社区个案 | 🔴 未查到(不编造)
本版本相对于初稿的变化:按新约束收窄重点到 8 个模型(Wan2.2-S2V、LongCat-Video-Avatar 1.5、InfiniteTalk、OmniAvatar、HunyuanVideo-Avatar、Wan-Animate-2、EchoMimic V3、FantasyTalking),为每个模型补齐「显存占用 + 生成速度 + 16GB 能否跑 + 要什么量化 + N 秒视频要多久」,新增 sm120/Blackwell 兼容性总表(§0)与 中文 TTS 配音选型(§4)。
RTX 5060 Ti 是 Blackwell / sm_120(Compute Capability 12.0)。2025 年编译的绝大多数加速库没有 sm_120 内核,装上去不是报错就是静默崩。本机 2026-09-14 已实测确认过一次 GPU 掉总线(4 次全部来自 SageAttention 路径)。
GPU : NVIDIA GeForce RTX 5060 Ti capability (12, 0) → sm_120
torch : 2.11.0+cu130
CUDA : 13.0
arch_list: ['sm_75','sm_80','sm_86','sm_90','sm_100','sm_120'] ← 含 sm_120 ✅
triton : 3.6.0
SageAttn : 2.2.0(源码自建,装于 /home/zyw/SageAttention)
_fused.so → sm_75 sm_80 sm_86 sm_89 sm_90 sm_100 sm_120 sm_120a ← 含 sm_120 ✅
_qattn_sm89.so → sm_120a ← 含 sm_120 ✅
结论:本机 torch 与 SageAttention 的 sm_120 编译问题已经解决(不是"缺内核",源码构建时已带上 12.0)。但——woct0rdho 上游实测 RTX 5060 Ti 上循环调用 SageAttention 约 300~630 次(30~65 秒)后会 GPU 丢失(woct0rdho/SageAttention #103),且有报告 _sageattn_int8_fp8_nhd 长序列在 5060 Ti 上直接掉驱动(GPU is lost,需重启)而同条件原生 PyTorch 注意力正常(#391)。这正好解释本机 H3 长序列掉总线。 → 所以本机的正确策略不是"装不了",而是"长序列别用":短视频可试 SageAttention 2.2.0,长序列/高分辨率一律 SDPA。
| 库 | sm_120 支持状况 | 本机结论 | 来源 |
|---|---|---|---|
| PyTorch + CUDA | 50 系最低 torch ≥2.7 + cu128;社区与 kijai 一致建议 torch 2.9.1 + CUDA 13.0(RTX 5060 报 CUDA error: no kernel image is available,换 torch 2.9.1+cu130 后"完美运行") | ✅ 本机 torch 2.11.0+cu130 已超出要求 | 🟢 kijai #1875 |本机实拉 |
| triton | Blackwell 需 triton ≥3.3 + torch ≥2.7 + CUDA ≥12.8;版本须与 torch 配对(2.9.x↔3.5.x;2.10.x↔3.6.x) | ✅ 本机 triton 3.6.0 | 🟢 Rogala/AI_Attention |
| SageAttention 2.2.0 | ⚠️ 官方/Comfy-Org 预编译 wheel 多数缺 sm120:sageattention-2.2.0+cu130torch2.10 的 _qattn_sm89.pyd 只标 sm_80/sm_90a,遇到 GQA 32:8 / head_dim 128 / L=4096 直接 no kernel image;只有 packages/sageattention.yml 里 cu130/torch2.9 与 torch2.11 两条矩阵带 12.0 | ✅ 本机是源码自建且含 sm_120 cubin;⚠️ 但长序列会 GPU 丢失(见 §0.0) | 🟢 Comfy-Org/wheels #22 |本机 strings 实测 |
| SageAttention 源码编译 | 🔴 TORCH_CUDA_ARCH_LIST="9.0;12.0" 会编译失败(wgmma.fence not supported on sm_120)→ 必须只写 12.0 | ℹ️ 记下来:以后重编只写 12.0 | 🟢 SageAttention #291(维护者 woct0rdho 亲自回复) |
| SageAttention 3.x | 🔴 sm120 上不可信:① DGX Spark 上 SA3 出马赛克伪影且不比 2.2 快(#321)② RTX 5060 Ti + sa3.0 在 Wan wrapper 复现同样伪影,需强制 per_block_mean 才修好 ③ sm120 上 sageattn_qk_int8_pv_fp8_cuda 在 CUDA Graph 重放时静默算错(#392) | ❌ 禁用 sage3。kijai 口径:「不要把 sage3 用在 Wan 视频上,画质损害很大而速度提升有限,就用 sageattn 2.2.0」 | 🟢 kijai #1875 · SageAttention #321 |
| 2026-09-01 上游新进展 | Comfy-Org comfy-kitchen-sageattention(#147/#148)已产出官方托管 SA2.2.0 wheel(Py3.12 / torch 2.13 / CUDA 13.0),_fused/_qattn_sm80/_qattn_sm89 均含 SM120 cubin,并在 RTX PRO 6000 Blackwell 上 smoke 通过 | ⚠️ 锁 torch 2.13,与本机 2.11 不匹配 → 暂不用;等升 torch 或继续用自建版 | 🟢 comfy-kitchen #147 |
| FlashAttention FA2 | 默认 arch list 不含 sm_120,必须显式加 12.0 重编;有免编译成功组合:flash-attn 2.8.0 + Py3.10 + CUDA 12.8 + torch 2.7.1 | ⚠️ 装不上就用 SDPA(ComfyUI 默认回退),速度损失约 20~40% | 🟢 flash-attention #2535 · #2016 |
| FlashAttention FA3 | 🔴 在 sm120 上不可能:依赖 sm90a 的 wgmma 指令,sm120 不支持("只有企业级 Blackwell 支持");相关 issue 从 2025-04 开到 2026 仍无支持(#1757/#1810/#1825/#1609/#1638/#1785) | ❌ 不要碰 FA3 | 🟢 上述 issue |
| FlashAttention FA4(4.0.0b*) | ⚠️ 已有 FlashAttentionForwardSm120 但 2026 年仍不稳:RTX 5060 Ti 前向 kernel 运行期编译失败(#2453);5090 上比 FA2 慢约 5%;sm_120 varlen ≥4 段非法内存访问(#2860) | ❌ 不要碰 FA4 | 🟢 上述 issue |
| xFormers | 🔴 sm120 上不可用:0.0.32 在 Blackwell 消费卡报 CUDA error: invalid argument(疑因 FA3 实现不支持 sm120,#1323);50 系整体报 kernel 架构不兼容(#1342);0.0.34 宣称支持 torch≥2.10 但实际装不上(#1374) | ❌ 从依赖里直接划掉,一律用 SDPA | 🟢 上述 issue |
| torchcodec / torchvision | 🔴 LongCat issue #141:新版 torchvision 用 torchcodec 取代了 write_video(),导致仓库里大量代码跑不起来 | ⚠️ 跑 LongCat 官方脚本时注意 | 🟢 LongCat #141 |
| 模型 | SageAttention | FlashAttention | torch/CUDA | xformers |
|---|---|---|---|---|
| Wan2.2-S2V | SA2 2.2.0(本机自建版含 sm120);禁 SA3 | 不用(FA2 需自编 12.0;FA3/FA4 不可靠) | ≥2.9.1 + cu130 ✅ 已满足 | ❌ |
| LongCat-Avatar 1.5 | 未查到明确结论;节点内 sageattn_3 是坏的 | 🟢 官方 issue #141 明确:Blackwell 禁用 FA2 | torch 2.11 + CUDA 12.8+ ✅;⚠️ 新版 torchvision 会打断仓库代码 | ❌ |
| InfiniteTalk | 社区多走 SDPA;SA2 须含 sm120 | 不建议 | ≥2.9.1 + cu130(#1875 实证可跑通) | ❌ |
| OmniAvatar | 无记录 | 官方依赖 flash-attn(需自编);有"无 FA 多卡"issue #42 | 常规 | ❌ |
| HunyuanVideo-Avatar | 节点当前无(#22 称"以后也许支持") | 官方锁 flash-attn 2.6.3,编译失败是高频 issue(#34/#126/#40)→ 优先 SDPA | 官方代码是 torch 2.4–2.6 时代,需手动升 | ❌ |
| Wan2.2-Animate-2 | 同 Wan 系 | 同 Wan 系 | 同 Wan 系 | ❌ |
| EchoMimic V3 | 节点未接 | 无 | 官方 Py3.10 / CUDA ≥12.1 | ❌ |
| FantasyTalking | 有用户请求(#69)未实现 | 🔴 官方明说必须装 flash_attn,否则结果错误(#13 回复) → sm120 上是大坑 | — | ❌ |
cd /home/zyw/ComfyUI && setsid nohup env \
PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:512,expandable_segments:True \
CUDA_VISIBLE_DEVICES=0 OMP_NUM_THREADS=4 \
venv/bin/python main.py --listen 0.0.0.0 --port 8189 \
--lowvram --force-fp16 --reserve-vram 1.0 --fast-disk --cache-lru 20 \
--preview-method none > /home/zyw/comfyui_8189_opt.log 2>&1 < /dev/null &
关键:
--force-fp16 --reserve-vram 1.0;默认不加--use-sage-attention。若某个模型确认收益明显且序列不长,可临时开启并盯住日志;一旦出现 GPU 掉总线立刻回退 SDPA。
| 模型 | 16GB 能否跑 | 要什么量化 | 10 秒视频大约要多久 | 一句话 |
|---|---|---|---|---|
| EchoMimicV3-Flash-pro | ✅ 能,官方验证过 16G(V100) + 官方实测耗时 | 无重量化;768×512 + block_offload | 🟢 官方口径:5 秒视频 7 分钟(量化版,12GB 显存)→ 10 秒约 14 分钟 | 首选:原生中文 + 官方 16G 档位 + 官方实测耗时 + Apache-2.0 |
| Wan2.2-Animate-2 | ✅ 能(本机型唯一有逐秒实测) | INT8_convrot 部分卸载(7.3GB 显存)/ GGUF Q4_K_M 10.56 GiB | 🟢 实测:49 帧 @480×854 = 126.8 秒(10 步)→ 按 25fps 算 49 帧≈2 秒,10 秒约 10 分钟 | ❌ 但它是"图+驱动视频",不吃音频 → 场景不匹配 |
| InfiniteTalk | ✅ 能(5080 16GB 实测 + 5060 16GB 跑通) | GGUF Q4_K_M 底座(11.34GB) + patch Q4(1.4GB) + block swap 30~40 | 🟢 5080 16GB:640×640 5 秒 = 1300 秒 → 10 秒约 43 分钟 | ComfyUI 有官方核心节点;但 3 分钟视频吃 >120GB 内存 |
| LongCat-Video-Avatar 1.5 | ✅ 能(3060 12GB GGUF Q4 已跑通) | INT8 14.81 GiB 或 GGUF Q4_K_M 11.24~12.07 GiB + block_num=1 + 全 offload CPU | 🟢 480p 44 秒视频 ≈ 2 小时(GB10)→ 10 秒约 27 分钟起 | 能力最全(MIT/多人/长视频)但有未修缺陷 |
| HunyuanVideo-Avatar | ⚠️ 推断偏不可行 | Wan2GP int8 13.41GB / GGUF Q4 7.42 GiB | 🟢 5090 未优化 30 步≈30 分钟;3090 112.32 s/it | 成功案例全带 96–192GB RAM,本机 32GB 大概率不够;许可排除 EU/UK/KR |
| Wan2.2-S2V-14B | ❌ 不推荐 | 理论:GGUF Q4_K_M 12.91 GiB + T5 全 CPU | 🟡 L40S 48GB:5 秒 ≈20 分钟;4×64GB:720P 10 秒 ≈1 小时 | 官方门槛 ≥80GB;失败模式 = 走共享内存后慢到必须中止 |
| OmniAvatar-14B | ❌ 不可用 | 无任何官方/社区量化档 | 🟢 H100 SXM:3 秒音频/25 步 >7 分钟 | 官方称需 64GB 内存;本机 32GB 不够 |
| FantasyTalking | ❌ 不可行(有 5070 Ti 16GB 失败报告) | 社区 GGUF 明确失败并归档 | 🟢 A800 40G:30 秒视频 = 1 小时;1 分钟音频 >19 小时 | 官方最低档 20GB;且官方要求必须装 flash_attn(sm120 大坑) |
中文文案
↓ ① TTS 配音(本机 16GB 内,见 §4)
GPT-SoVITS v2ProPlus ← MIT|RTF 0.028(4060 Ti)|sm_120 最不易踩坑|5s 克隆/few-shot 微调
(升级档:IndexTTS-2.5 八维情感控制 / Qwen3-TTS-1.7B 质量上限)
↓ ② 音频驱动口型(本机 16GB 内,见 §3)
EchoMimicV3-Flash-pro ← Apache-2.0|transformer 仅 3.47GiB|768×512 + block_offload
↓ ③(可选)口型精修
LatentSync 1.5(最低 8GB,官方明示改善中文)
↓
成片(25fps,口型同步)
三步全在本机 16GB 内、全部 Apache-2.0、总权重 < 12 GiB(不含可选的 LatentSync)。 两个模型分时复用显存即可(本机 ComfyUI 已是
--lowvram档,TTS 只占 ~2GB)。
体积口径:官方原始权重与量化档分别列出。「显存」列给的是实测/社区报告的峰值占用,「速度」列必须与 GPU 型号一起看。
| 模型 | 参数量 | bf16/fp16 权重 | fp8 / INT8 | GGUF | 实测峰值显存 | 实测速度(GPU+分辨率) | 16GB 判定 |
|---|---|---|---|---|---|---|---|
| EchoMimicV3-Flash-pro | 1.3B | transformer 3.47 GiB | 无 | 无(不需要) | 🟢 默认 768 档 33,726 MiB(L40S)/🟡 官方低显存档 6.5 GB @768×512/🟢 官方量化档另测到 43,434 MiB(talking head)、63,248 MiB(half body) | 🟢 官方量化版(app_mm.py):最低 12GB 显存,5 秒视频 7 分钟(作者本人回复)/L40S 3.63s 音频 251.94 s/🟢 未量化 10s 音频 ≈12 分钟(4090) | ✅ 官方测试 GPU 含 V100 16G;⚠️ 但有 RTX 5090 量化版跑不通的未回复 issue(疑似 sm120) |
| InfiniteTalk | patch 2.487B + 底座 Wan2.1-14B(14.289B DiT) | patch 9.948 GB(fp32)/Kijai fp16 5.125 GB/comfyui/ 版 2.53 GiB | Kijai fp8_scaled 2.714 GB;全模型 fp8/int8 档各 19.5 GiB | patch Q4_K_M 1.403 / Q6_K 2.044 / Q8 2.646 GB;底座 Q4_K_M 11.34 / Q5_K_M 12.74 / Q8_0 18.14 GB;fp8 底座 16.64 GB | 🟢 RTX 5080 16GB 可跑;🟢 L40 48GB 28 GB | 🟢 RTX 5080 16GB:640×640 5 秒 = 1300 秒(20 block swap+SA+compile)/🟢 4090 未量化 10s/480p = 40 分钟/🟢 4090 + FusionX 8步+TeaCache 10s ≈ 15 分钟(2026-09)/🟢 3090 832×480 ≈30 s/秒视频/🟢 8GB 只能跑 81 帧 | ✅ 可跑(5080 16GB 实测 + RTX 5060 16GB 在 torch 2.9.1+cu130 后跑通);⚠️ 4070 Super 12GB OOM |
| LongCat-Video-Avatar 1.5 | 13.6B | 29.5 GiB(6 shard) | 官方 INT8 14.81 GiB(4 shard) | 社区 Q8 17.77 / Q6 14.42 / Q4_K_M 11.24~12.07 / Q3_K_M 9.22 / Q2_K 7.77 GiB | 🟢 H200 单卡 46,827 MiB;🟢 GB10 block_num=1 8 GB VRAM + 16 GB RAM;🟢 720p 28,040 MiB + 35.3 GB RAM | 🟢 3.63s 音频 → 233.08 s(H200)/🟢 480p 44 秒视频 ≈ 2 小时(GB10)/🟢 4090D 480p/10步/105帧 ≈60 s/it | ✅ 可跑(3060 12GB GGUF Q4 已跑通、3090 24GB fp8+block swap 跑通);⚠️ 16GB 无本人实测 |
| Wan2.2-Animate-2-14B | 14B | 30.54 GiB(base/distill 各一) | INT8_convrot 15.51 GiB | TURBO 蒸馏版 Q8_0 16.90 / Q6_K 13.25 / Q5_K_M 11.87 / Q4_K_M 10.56 / Q4_K_S 9.72 / Q3_K_M 8.00 / Q2_K 6.05 GiB | 🟢 RTX 5060 Ti 16GB:distill int8_convrot 部分卸载 ≈7.3 GB 显存 / 8.6 GB 内存 | 🟢 RTX 5060 Ti 16GB:官方 video_wan_animate2_distilled 动作迁移图,10/10 步、49 帧 @480×854 = 126.8 秒 ← 本次唯一拿到本机型逐秒实测的模型;🟢 上一代 Animate-14B:A800 480P/20步 替换模式 10.76 s/it | ✅ 能跑;但 ❌ 它不吃音频(输入是参考图+驱动视频),与口播场景不匹配 |
| Wan2.2-S2V-14B | 14B | DiT ≈30.35 GiB(4 shard)+ T5 10.58 GiB + wav2vec 1.18 + VAE 0.47 | ComfyUI 官方 fp8_scaled 15.27 GiB;Kijai fp8 16.65 GB | Q8_0 18.27 / Q6_K 15.10 / Q5_K_M 13.97 / Q4_K_M 12.91 / Q4_K_S 12.07 / IQ4_XS 11.32 / Q2_K 8.86 GiB | ⚪ 未查到任何消费级卡峰值显存 | 🟡 L40S 48GB:5 秒视频 ≈20 分钟(含约 10 分钟编译+加载);🟡 4×64GB 卡跑 720P 每 10 秒 ≈1 小时;🟢 H200 3.8 秒 → 780 秒 | ❌ 官方要求 ≥80GB;⚪ 无 16GB 成功案例;已知 16GB 失败模式 = 显存填满→走共享内存→慢到必须中止 |
| HunyuanVideo-Avatar | 13B(Wan2GP 定义) | 30.51 GB(官方)+ 文本编码器 16.76 GB | 官方 fp8 24.85 GB;Wan2GP int8 13.41 GB | 社区实验版(ComfyUI 不支持)Q2_K 4.86 / Q4_K_M 7.42 GiB | ⚪ 未查到 16GB 实测 | 🟢 5090 未优化:30 步 ≈30 分钟(≈60 s/it)/🟢 3090+CPU offload+fp8:704px/129帧 112.32 s/it(50 步 1h33m 后 OOM)/🟢 4090 24GB+128GB RAM 走 ComfyUI 节点:采样前要等 30+ 分钟预热/🟢 3060 12GB 在 Wan2GP 跑通 | ⚠️ 推断偏不可行:int8 13.41GB 会被 pin 进内存(实测 pin 12,785 MB),而成功案例全带 96/97/192GB RAM,本机仅 32GB |
| OmniAvatar-14B | 14B | LoRA+音频权重 1.238 GB(底座 Wan2.1-T2V-14B) | ⚪ 无 fp8/int8/GGUF | ⚪ 无 | 🟢 第三方 24GB VRAM + 31.3GB RAM 加载即 OOM | 🟢 官方 A800:bf16 不限 36G/16.0 s/it;7B 常驻 21G/19.4 s/it;全 offload 8G/22.1 s/it;🟢 A800×4 fsdp 4.8 s/it;🟢 H100 SXM 3 秒音频/25 步 >7 分钟;19 秒音频/50 步 >1 小时;🟢 单 B200 5.2 s/it | ❌ 官方称需 64GB 内存,本机 32GB 不够 |
| FantasyTalking | 14B(Wan2.1-I2V) + 适配器 1.68 GB | 适配器 fp16 1.68 GB | ⚪ 无 | 🔴 社区 GGUF 明确失败并归档 | 🟡 官方 A100 表:40G / 20G / 5G 三档 | 🟡 官方 A100:15.5 / 32.8 / 42.6 s/it(对应 40G/20G/5G)/🟢 A800 40G:30 秒视频 = 1 小时/🟢 另一用户 1 分钟音频 >19 小时 | ❌ 有 RTX 5070 Ti 16GB 明确失败报告("Doesn't work with 16GB VRAM");RTX 5090 32GB 最小设置也 OOM |
这一节回答"别人在 16GB 卡上到底跑通了什么"——比任何厂商宣称都实在。
| 显卡 | 模型 | 实测结果 | 来源 |
|---|---|---|---|
| RTX 5060 Ti 16GB(本机型) | Wan2.2-Animate-2 | distilled int8_convrot 部分卸载 ≈7.3 GB 显存 / 8.6 GB 内存;49 帧 @480×854 126.8 秒 | ComfyUI-MultiGPU #219 |
| RTX 5060 Ti 16GB | InfiniteTalk | ✅ 跑通(Wan wrapper;升级到 torch 2.9.1 + cu130 后成功) | kijai #1875 |
| RTX 5060 Ti 16GB | SageAttention 2.2.0 | 🔴 官方 cu130/torch2.10 wheel 缺 sm_120 内核 → cudaErrorNoKernelImageForDevice(本机是源码自建版,已含 sm_120) | Comfy-Org/wheels #22 |
| RTX 5060 Ti 16GB | SageAttention 3.0 | 🔴 在 Wan wrapper 出马赛克伪影,需强制 per_block_mean 才修好;自述"SA3 与 2.2 速度接近" | SageAttention #321 |
| RTX 5060 16GB | Wan2.2 通用 | ✅ 原生 ComfyUI 用 GGUF Q4_K_M + fp8 文本编码器稳定出 121 帧 @720×960(同参数下 kijai wrapper 超 480×640 就 OOM) | kijai #1805 |
| RTX 5080 16GB | InfiniteTalk | 640×640 5 秒 = 1300 秒 | kijai #1185 |
| RTX 5070 Ti 16GB | FantasyTalking | 🔴 明确失败("Doesn't work with 16GB VRAM") | FantasyTalking #37 |
| RTX 5070 Ti 16GB | MiniMaxH3 + SageAttention patch | 🔴 在 sm120 崩 | KJNodes #736 |
| RTX 4070 Ti 16GB + 32GB RAM | HunyuanVideo-Avatar | ⚪ 提问无人回复 | HYA #70 |
| RTX 4070 Super 12GB | InfiniteTalk | 🔴 OOM | kijai #1186 |
| RTX 3060 12GB | LongCat-Avatar 1.5 | ✅ 用 GGUF Q4_K_M 跑通(需升级 WanVideoWrapper nightly) | kijai #1780 |
| RTX 3060 12GB | HunyuanVideo-Avatar | ✅ 在 Wan2GP 里跑通 | Wan2GP #508 |
| RTX 3090 24GB | LongCat-Avatar 1.5 | ✅ fp8 + block swap 可跑(832×480/10 步出片正常) | kijai #1780 |
| RTX 4090 24GB | HunyuanVideo-Avatar | ⚠️ ComfyUI 节点采样前要等 30+ 分钟预热;需 128GB RAM | smthemex #15 |
| RTX 4090 24GB | EchoMimic V3 | 未量化 10 秒音频 ≈12 分钟 | echomimic_v3 |
| RTX 5090 32GB | EchoMimic V3 量化版 | 🔴 跑不通(2025-12-31,0 回复,疑似 sm120) | echomimic_v3 #62 |
| RTX 5090 32GB | HunyuanVideo-Avatar | 未优化 30 步 ≈ 30 分钟 | HYA #61 |
| RTX 5090 32GB | FantasyTalking | 🔴 最小设置 OOM | FantasyTalking #17 |
| 项 | 数据 |
|---|---|
| 发布方 | 蚂蚁集团 Alipay 终端技术部(论文署名 Terminal Technology Department, Alipay, Ant Group;⚠️ 网传"复旦"在论文与仓库中无出处) |
| 会议 / 论文 | AAAI 2026(2025-11-09 录用)|arXiv 2507.03905 |
| 时间线 | 论文 2025-07-08 → 代码+权重 2025-08-08 → 12G 显存 GradioUI 2025-08-12 → ComfyUI 16G 跑通 2025-08-12 → V3-Flash(8 步 / 12G / 768×768)2026-01-22 → 仓库最后提交 2026-03-18 |
| 参数量 / 体积 | 1.3B;echomimicv3-flash-pro/diffusion_pytorch_model.safetensors 3.47 GiB;transformer/... 3.18 GiB;另需 clip_vision_h 1.26 GB、umt5_xxl_fp8 6.74 GB、Wan2.1_VAE 0.51 GB |
| 许可证 | Apache-2.0(官方原文:"licensed under the Apache 2.0 License. We claim no rights over your generated contents") |
| GitHub | 1,061 ★ / 128 fork(2026-09-22) |
🟢 显存(官方给了可直接照抄的档位)
| 版本 | 分辨率 | 显存 | 步数 | 条件 |
|---|---|---|---|---|
| V3(preview) | 768×768 | 12 G | 8 步 | 官方 GradioUI app_mm.py |
| V3(preview) | — | 8 G+ | — | mmgp,partial_video_length=65 或 33 |
| V3-Flash-pro | 768×768 | 12 G | 8 步 | 无需 Face Mask |
| V3-Flash-pro | 768×512 | 6.5 G | 8 步 | 需开 block_offload |
| 官方测试过的 GPU | — | A100 80G / RTX 4090D 24G / V100 16G | — | 🟢 官方把 16GB 写进了测试列表 |
🟢 ComfyUI 节点作者给的本机参数(smthemex/ComfyUI_EchoMimic,实测环境 12G VRAM):
- V3 正式上线,测试环境 12G VRAM,OOM 需减少视频分块
partial_video_length:12G 可以跑 65,16 可以试试 97,更高可以试试 113- v3 flash:12G、8 步可以推理 768×768;6.5G 可以推理 768×512(需开
block_offload)- "need 8G and more(use mmgp, LOW LOW,
partial_video_length==65or 33)"
→ 本机(16GB)的档位 = partial_video_length = 97 + 768×512 + block_offload=on。
🟢 速度(这是 8 个模型里唯一有官方实测耗时的)
app_mm.py)作者本人回复:最低 12GB 显存,5 秒视频 7 分钟(issue #21)→ 10 秒 ≈ 14 分钟✅ 中文(8 个模型里最强)
chinese-wav2vec2-base(腾讯 GameMate)→ 原生中文音频前端(preview 版才用英文 wav2vec2-base-960h)加速手段:TeaCache(teacache_threshold 推荐 0~0.1,横评称提速 1.5× 且质量无损)|LightX2V LoRA(10 步)|LCM(4 步自动开启)
ComfyUI 两条路径:① smthemex/ComfyUI_EchoMimic(官方 README 亲自致谢推荐;支持 V1/V2/V3 + V3-Flash;lowram=False 可关 mmgp FP8 换质量)② havvk/ComfyUI_AIIA(默认开 TeaCache、自动检测 FlashAttention 2、支持流式;该仓库明确写了"修复了唇形漂移问题")
长视频:README 原文 "Long video generation: If you want to generate a video longer than 138 frames, you can use Long Video CFG";论文消融证明它有效——w/o Long Video CFG 的 FVD 从 496.76 恶化到 530.21
🔴 坑
block_offload=on + partial_video_length=97 + TeaCache。retina-face==0.0.17(须外网下载)、mmgp、tensorflow==2.15.0(版本敏感);ffmpeg 报错要 pip uninstall ffmpeg && pip install ffmpeg-python。diffusion_pytorch_model.safetensors 有两个同名文件(Wan2.1-Fun 的 3.13G vs EchoMimicV3 的 transformer)→ 放错位置会静默加载错权重。🎯 16GB 结论:✅ 能跑,且是本场景首选。 官方测试过 V100 16G;用 768×512 + block_offload + partial_video_length=97;10 秒中文口播预期 10~12 分钟(需自测)。
| 项 | 数据 |
|---|---|
| 发布方 | 美团 LongCat 团队|1.5 首发 2026-05-21(1.0 为 2025-12-16)|技术报告 arXiv 2605.26486 |
| 参数量 | 13.6B dense DiT;1.5 音频编码器换为 Whisper-large-v3 |
| 许可证 | MIT(模型权重 + 代码均可商用)——8 个模型里最干净的授权 |
| GitHub | 8,375 ★ / 1,491 fork(2026-09-22) |
| 语言 | HF 模型卡 language: [en, zh](中英双语) |
各精度体积
| 版本 | 文件 | 体积 |
|---|---|---|
| 1.5 bf16(官方) | base_model/* 6 shard | 29.5 GiB(≈31.71 GB) |
1.5 INT8(官方,--use_int8,仅 1.5 支持) | base_model_int8/* 4 shard | 14.78 GiB(≈15.89 GB) |
| 1.5 distill LoRA(1.5 强制需要) | lora/dmd_lora.safetensors | 2.52 GB(ComfyUI 打包版 1.26 GB) |
| 1.5 Whisper-large-v3 | whisper-large-v3/model.safetensors | 3.09 GB |
| 共享(LongCat-Video 仓) | UMT5 text_encoder 5 shard + VAE | 22.73 GB + 0.51 GB |
| 社区 GGUF | Q8_0 / Q6_K / Q5_K_M / Q4_K_M / Q3_K_M / Q2_K | 17.77 / 14.42 / 12.78 / 11.24 / 9.22 / 7.77 GiB |
| 社区 INT8 单文件 | smthem/LongCat-Video-Avatar-1.5-merge | 15.88 GB |
🟢 显存与速度实测
| 数据 | GPU | 来源 |
|---|---|---|
第三方横评:单卡(context_parallel_size=1)峰值 46,827 MiB,3.63 秒音频 233.08 秒,480×832@25fps | H200 | 🟢 Tight Studio 2026-08-23 |
官方示例全部是 2 卡 --nproc_per_node=2 --context_parallel_size=2;官方从未声明最低显存 | — | 🟡 README |
block_num=1 + 全 offload CPU:8 GB VRAM + 16 GB RAM;但 480p 的 44 秒视频耗时约 2 小时;默认预设吃满 37 GB VRAM + 35 GB RAM 导致系统崩溃 | GB10(128GB 统一内存) | 🟢 ComfyUI-LongCat-Avatar issue #2 |
| 720p:28,040 MiB VRAM + 35.3 GB RAM → 本机 32GB 内存也会被击穿 | GB10 | 🟢 同上 |
| 480p / 10 步 / 105 帧 ≈60 s/it | RTX 4090D | 🟢 kijai #1806 |
| fp8 + block swap 可跑(24GB);GGUF Q4_K_M 在 3060 12GB 上可跑(需升级 WanVideoWrapper nightly) | 3090 24GB / 3060 12GB | 🟢 kijai #1780 |
| 🟡 官方效率宣称:DMD 蒸馏 50 步→8 步,"生成 10 秒视频仅需约 1 分钟"(未注明 GPU 型号) | 未标 | 🟡 美团博客;⚠️ 与第三方 H200 实测(3.63s→233s)严重矛盾,不可用作 16GB 预期 |
ComfyUI
official_int8_sharded、block_num 流式、offload_device=cpu✅ 能力:原生 多人对话(multi-stream audio,audio_type=para/add)|原生长视频续写(首窗 93 帧,后续 +80 帧,重叠 13 帧)|480p(480×832)/720p(768×1280)@25fps|8 步蒸馏
🔴 坑(这就是它不该当首选的原因)
dmd_lora 的 multiplier 从 1.0 降到 0.1。write_video(),仓库里大量代码跑不起来。sageattn_3 是坏的(LongCat varlen cross-attention 未接完),只能用 sageattn → 在 sm120 上正好是雷区 → 建议直接用 sdpa。🎯 16GB 结论:⚠️ 能跑,但只能 480p + 量化 + block_num=1 + 全 CPU offload。
block_num=1(千万别用 0)+ VAE/文本编码器全 offload CPU + 8 步 + text/audio CFG 1.0 + 480p(不要碰 720p) + 短片段| 项 | 数据 |
|---|---|
| 发布方 | 美团 MeiGen-AI(+ 中科院大学 / NLPR-CASIA / 港科大 / 中山大学) |
| 首次开源 | 2025-08-19(arXiv 2508.14033,与 MultiTalk 为同源,MultiTalk 是 NeurIPS 2025) |
| 许可证 | Apache-2.0(可商用) |
| GitHub | 7,901 ★ / 1,365 fork(2026-09-22);主仓库代码实质停更 2025-09,2026 年推进全在 ComfyUI 官方核心 + 社区 wrapper(wrapper 最后 push 2026-05-24) |
| 架构 | patch 2.487B 参数 + 底座 Wan2.1-I2V-14B-480P(DiT 14.289B 参数) |
各精度体积(必须同时装 patch + 底座)
| 组件 | 格式 | 体积 |
|---|---|---|
| InfiniteTalk patch | fp32 single/infinitetalk.safetensors | 9.948 GB |
| Kijai fp16 | 5.125 GB | |
| Kijai fp8_scaled | 2.714 GB | |
| GGUF Q4_K_M / Q6_K / Q8 | 1.403 / 2.044 / 2.646 GB | |
comfyui/infinitetalk_single.safetensors(F8_E4M3 混合) | 2.713 GB | |
| 底座 Wan2.1-I2V-14B-480P | fp8_e4m3fn_scaled(Kijai) | 16.64 GB ⚠️ 单文件已超 16GB |
| GGUF Q4_K_M / Q5_K_M / Q6_K / Q8_0 / bf16 | 11.34 / 12.74 / 14.23 / 18.14 / 33.28 GB | |
| T5 文本编码器 | fp16 / fp8 | 11.37 / 6.74 GB(必须 offload 到 CPU) |
| 音频编码器(中文) | wav2vec2-chinese-base_fp16 | 0.19 GB |
🟢 速度实测(全部来自公开 issue)
| GPU | 实测 | 来源 |
|---|---|---|
| RTX 4090 24GB | 未量化/无 LoRA:10 秒 480p 用 40 分钟;8 秒默认 40 步 = 3h56m | InfiniteTalk #210 / #187 |
| RTX 4090 24GB | 2026-09-15 最新:FusionX 8 步 + TeaCache + streaming,10 秒 ≈ 15 分钟 | 同上 |
| RTX 5080 16GB | 640×640,5 秒 = 1,300 秒(20 block swap + Sage + compile) | kijai #1185 |
| RTX 3090 24GB | 832×480 约 30 秒/秒视频(10 秒 ≈ 5 分钟) | kijai #1185 |
| L40 48GB | 40 秒 480×832 用 16 分钟,峰值 28 GB | kijai #1229 |
| H100 80GB | 15 秒"最好情况 10 分钟";加卡不提速 | 同上 |
| 8GB VRAM | Wan2GP 作者亲测:仅 81 帧(≈3.4 秒)可跑 | InfiniteTalk #25 |
| RTX 5060 16GB | 🟢 跑通(Wan wrapper,升级到 torch 2.9.1 + cu130 后成功) | kijai #1875 |
| RTX 4070 Super 12GB | 🔴 OOM | kijai #1186 |
| A800 | fp8/int8 量化档反而慢 2.6 倍(5 小时 vs 1.3 小时) | InfiniteTalk #18 |
ComfyUI(最大优势)
WanInfiniteTalkToVideo——kijai 提交的 Comfy-Org/ComfyUI PR #10179 2026-01-22 合并;代码在 comfy_extras/nodes_wan.py,内部复用 comfy/ldm/wan/model_multitalk.pytwo_speakers 模式 → 原生多人对话wan2.1-i2v-14b-480p-Q8_0.gguf(18.14GB) + patch Wan2_1-InfiniteTalk_Single_Q8.gguf(2.646GB) + Block Swap 20 块 + lightx2v rank64 LoRA + 6 步 cfg 1.0 + 832×480 / 81 帧 / motion_frame 9
kijai 提醒:"You can't mix GGUF MultiTalk with non-GGUF main model" → GGUF patch 必须配 GGUF 底座
✅ 中文音频:原生支持(TencentGameMate/chinese-wav2vec2-base)
🔴 坑
shape [20,1400,5120] invalid)。🎯 16GB 结论:✅ 可跑,且本机型已有跑通记录(kijai #1875:RTX 5060 在 torch 2.9.1+cu130 后跑通)。但属于"慢速可用"档,且 32GB 内存是真瓶颈(12GB 卡反而直接 OOM,见 kijai #1186)。
底座: city96/Wan2.1-I2V-14B-480P-gguf → Q4_K_M (11.34 GB)
patch: Kijai/WanVideo_comfy_GGUF → Wan2_1-InfiniteTalk_Single_Q4_K_M.gguf (1.403 GB)
音频: Kijai/wav2vec2_safetensors → wav2vec2-chinese-base_fp16 (0.19 GB,中文)
LoRA: lightx2v_I2V_14B_480p_cfg_step_distill_rank64 (4~6 步)
Block swap: 30~40 块 | 分辨率 832×480(必须 16 整除)| T5 卸载到 CPU
环境: torch ≥2.9.1 + CUDA 13.0(本机 2.11.0+cu130 ✅);attention 优先 SDPA,SA2 须含 sm120
长视频: 每 10~20 秒一段落盘,清缓存再续接
预期: 480p、10 秒 ≈ 30~45 分钟(按 RTX 5080 16GB 的 1300 秒/5 秒 @640×640 换算)
| 项 | 数据 |
|---|---|
| 发布方 | 阿里巴巴 Wan 团队(通义万相)|首发 2025-08-26|HF 权重最后更新 2025-09-17 |
| 参数量 | 14B(Wan2.2 MoE DiT 的单专家 S2V) |
| 许可证 | Apache-2.0,可商用 |
| GitHub | 17,585 ★ / 2,257 fork(主仓库 2026-09-21 仍在提交,但 S2V 本体自 2025-09 未再更新) |
各精度体积
| 组件 | 格式 | 体积 |
|---|---|---|
| DiT | bf16(官方 4 shard) | ≈30.35 GiB |
ComfyUI 官方 fp8_scaled | 15.27 GiB | |
Kijai fp8_e4m3fn_scaled | 16.65 GB | |
| GGUF Q8_0 / Q6_K / Q5_K_M / Q4_K_M / Q4_K_S / IQ4_XS / Q2_K | 18.27 / 15.10 / 13.97 / 12.91 / 12.07 / 11.32 / 8.86 GiB | |
| T5 文本编码器 | umt5_xxl_fp8_e4m3fn_scaled | 6.27 GiB(bf16 版 10.58 GiB) |
| 音频编码器 | wav2vec2_large_xlsr-53_english_fp16 | 1.18 GiB(英文) |
| VAE | wan_2.1_vae | 0.24~0.47 GiB |
🔴 算一笔账:官方 fp8 UNet 15.27 GiB + fp8 T5 6.27 GiB = 21.5 GiB,必然超 16GB。所以 16GB 上要么换 GGUF Q4_K_M(12.91 GiB),要么靠
--lowvram让 ComfyUI 自动把文本编码器换出。
🟢 显存与速度
--offload_model True --convert_model_dtype),官方门槛仍是 80GB。这是厂商自己给的数字。ComfyUI(官方原生,配法已核实)
wan2.2_s2v_14B_fp8_scaled.safetensors(15.27 GiB)或 bf16(30.35 GiB);官方明说"本模板用 fp8_scaled,它需要更少的显存"umt5_xxl_fp8_e4m3fn_scaled.safetensors(6.27 GiB)wav2vec2_large_english_fp16.safetensors → 放 models/audio_encoders/wan_2.1_vae.safetensorsVideo S2V Extend 子图每块 77 帧 = 4.8125 秒 @16fps;按 音频秒数×16÷77 向上取整决定子图数(14 秒 → 3 块)ComfyUI-GGUF 的 Unet Loader (GGUF) + CLIPLoader (GGUF)(本机已装 ComfyUI-GGUF,可直接用)🎯 16GB 结论:❌ 不推荐。 官方 80GB、第三方 57.3GB,16GB 属于"理论可行(Q4 GGUF + 分块 offload + 低分辨率 + 短片段)、无任何公开成功案例"区间,且已知失败模式是走共享内存后慢到必须中止。若一定要试:calcuis/wan-s2v-gguf 的 Q4_K_M(12.91 GiB) + ComfyUI-GGUF 的 Unet Loader (GGUF) + T5 换出 + 480P 以下 + 单块 77 帧(4.8 秒)。16fps 输出也是流畅度劣势。
ℹ️ 一个间接的乐观信号:同为 16GB 的 RTX 5060 在原生 ComfyUI 里用 Wan2.2 GGUF Q4_K_M + fp8 文本编码器稳定出了 121 帧 @720×960(kijai #1805)——说明 Wan 系 14B 在 16GB 上"有戏",但 S2V 本身无人验证。
其他坑:🟢 横评记录"官方设置在推理开始前还需要修几个依赖(其音视频读取器用的包)";ComfyUI 博客评论区有用户问"how can I achieve longer video clips than 15 seconds?"(默认模板容易卡在 ~15 秒)。 中文:官方支持 --enable_tts 走 CosyVoice 做中文合成,但音频编码器是英文 wav2vec2-large-xlsr-53-english → 中文唇形精度只有厂商演示,⚪ 未查到中文 LSE 第三方数字。
| 项 | 数据 |
|---|---|
| 发布方 | 腾讯混元|2025-05-28 首发|仓库最后 push 2025-12-16(已 9 个月无功能更新)|arXiv 2505.20156 |
| 参数量 | 13B(Wan2GP 模型定义明写 "Hunyuan Video Avatar 720p 13B") |
| 许可证 | 🔴 腾讯混元社区协议(非 Apache/MIT),明确写明"本协议不适用于欧盟、英国、韩国",另有 Acceptable Use Policy。ComfyUI 作者原话:"anyone in the european union, uk or south korea is not allowed to use the model" |
各精度体积
| 组件 | 体积 |
|---|---|
官方 mp_rank_00_model_states.pt(bf16/fp32) | 30.51 GB |
| 官方 fp8 | 24.85 GB |
| llava 文本编码器(4 shard) | 16.76 GB |
| Wan2GP int8「quanto」 | 13.41 GB |
| Wan2GP bf16 重打包 | 25.98 GB |
| 社区 GGUF 实验版 Q2_K / Q4_K_M / Q5_K_M / Q8_0 | 4.86 / 7.97 / 9.55 / 14.14 GB |
| HF 仓库总计 | 80.77 GiB |
🟡🟢 显存与速度
| 配置 | 实测 |
|---|---|
| RTX 5090(未优化) | 30 步 ≈ 30 分钟(≈60 s/it) |
| RTX 3090 + CPU offload + fp8 | 704px / 129 帧 = 112.32 s/it(50 步跑 1h33m 后 OOM) |
| RTX 4090 24GB + 128GB RAM(ComfyUI 节点) | 采样开始前要等 30+ 分钟预热(文本/图像编码器被挪到 CPU 以塞进 12GB) |
| RTX 3060 12GB | 在 Wan2GP 里跑通 |
| V100 32GB + 64GB RAM | 在 Wan2GP profile4 仍 OOM |
ComfyUI
[ ] ComfyUI 至今未打勾;ComfyUI 官方 issue #8311 自 2025-05-28 起一直 open,作者明确因许可证给「very low priority」→ 这一点不会随时间改善smthemex/ComfyUI_HunyuanAvatar_Sm(80★,最后 push 2025-06-24)、Yuan-ManX/ComfyUI-HunyuanVideo-Avatar(29★,最后 push 2025-05-29)✅ 能力:中文音频支持(whisper-tiny + LLaVA,多语言)|多人对话(Face-Aware Audio Adapter,按人脸 mask 做 latent 级多角色音频注入)——16GB 可达的低显存模型里唯一支持多人对话的 🟢 第三方 LSE 数据:EMTD 基准 HY-Avatar(12.99B)LSE-C 7.210 / LSE-D 8.494(同表 InfiniteTalk 8.535/7.108、Wan-S2V 6.999/8.292、Hallo3 5.352/9.828)
🔴 坑:显存 issue 密集——#81「CUDA OOM even with 8×24GB VRAM」、#6「80GB H100 still got OOM」、#25(8 卡 4090 OOM)、#61(single 3090 OOM)、#63(WSL2 + 32GB RAM + 4090 OOM);质量吐槽 #78(A100 80GB 质量低)、#79(图像模糊)、#58(low vram 出黑屏);flash-attn 2.6.3 编译失败是高频 issue
🎯 16GB 结论:⚠️→❌ 从"能跑"下调为"推断偏不可行"。
🔴 选型第一坑:Wan-Animate 系列不吃音频。 它输入的是「参考图 + 驱动视频」,输出角色动画。口播场景需要你先生成/拍摄一段驱动视频,链路变成三段。对本场景不匹配。
| 项 | 数据 |
|---|---|
| 两代关系 | Wan2.2-Animate-14B(= Wan-Animate,首发 2025-09-19,HF likes 1,261)→ Wan2.2-Animate-2-14B(首发 2026-08-07,arXiv 2608.06009,独立仓库 323★,但 Comfy-Org 重打包 535,555 下载)。不存在第三代。 |
| 机制差异 | 上一代有骨架/姿态中间表示;Animate-2 让驱动视频直接进 DiT,取消中间姿态提取器 |
| 参数量 / 体积 | 14B;bf16 30.54 GiB(base + distill 各一份)|INT8_convrot 15.51 GiB(base + distill 各一份)|另需 umt5_xxl_fp16 11.37GB / fp8 6.74GB、clip_vision_h 1.26GB(必需)、Wan2.1 VAE 0.25GB、lightx2v LoRA 0.74GB |
| 社区 GGUF(TURBO 蒸馏版) | Q8_0 16.90 / Q6_K 13.25 / Q5_K_M 11.87 / Q4_K_M 10.56 / Q4_K_S 9.72 / Q3_K_M 8.00 / Q2_K 6.05 GiB |
| 许可证 | Apache-2.0,可商用 |
| 🟢 显存(本机型实测!) | RTX 5060 Ti 16GB:distill int8_convrot 部分卸载 ≈ 7.3 GB 显存 / 8.6 GB 内存 —— 这是本次调研唯一拿到的、与本机同型号显卡的逐项实测数据(来源:ComfyUI-MultiGPU #219) |
| 🟢 速度(本机型实测!) | RTX 5060 Ti 16GB:官方 video_wan_animate2_distilled 动作迁移图,10/10 步、49 帧 @480×854 = 126.8 秒 → 按 25fps 折算 49 帧≈2 秒画面,10 秒约 10 分钟;🟢 上一代 Animate-14B:A800 480P/20步 替换模式 10.76 s/it(另一用户 720p 8–10 秒/25 步 ≈40 分钟) |
| 🟡 上一代第三方汇编 | 未量化约 28 GB,量化后约 16 GB;官方模型卡:默认设置调优于 8×A800,480P 在 2×A800 上测过 → 官方只在多卡上验证过 |
ComfyUI:✅ Day-1 官方原生(2026-08-08 官方博客同日宣布)。两个新节点:WanAnimate2ToVideo(吃参考角色图 + 驱动视频,可控 pose_strength/pose_start_percent/pose_end_percent/reference_image_strength)与 WanAnimate2Cache。生态扩展:wuwukaka/ComfyUI-WanAnimatePlus(413★,2026-09-14 更新,做长视频接缝与多参考图)
🔴 坑(按危险度排序)
① 本机型专属:WanAnimate2Cache 的 device/dtype 组合会静默杀进程 🟢 ComfyUI-MultiGPU #219 已在 5060 Ti 16GB 上复现:WanAnimate2Cache 设 device=gpu + dtype=int8,再配合 MultiGPU 类 patch,会静默杀掉进程(无报错)。 → 正确配置:device=cpu + dtype=default。
WanAnimate2Cache 的实际加速比:未查到任何第三方 A/B 数字,只有官方"约减半(roughly halves)"的宣称。② GGUF 静默失败(最阴险) —— 来自 GGUF 量化仓库作者原话:
Wan-Animate-2 不会通过 tensor 名自报家门。ComfyUI 从 safetensors
__metadata__的configblob(model_type: "animate2")选择架构,而 GGUF 没有等价字段,所以任何该模型的 GGUF 都会被当成普通 Wan 2.1 I2V 加载。失败是静默的:模型加载、采样运行、出来一段带你参考角色的视频——但驱动视频被完全忽略,随机运动、没有表演迁移,不报任何错。
解法:装 ComfyUI-GGUF + Rebels W3A8 Loader,把 model_type 显式设为 animate2;控制台加载时必须打印 model class=WAN_Animate2 才算成功。
③ 其他坑:GGUF + 自定义节点会在采样期崩(discussions/2,2026-08-22 open,报 TypeError 于 comfy/ldm/wan/model_animate2.py 的 _cross_attn_ffn);参考图必须大致匹配驱动视频的开场姿态(与量化无关,bf16 同样如此);上一代有长视频色偏 issue(#1277)。
🎯 16GB 结论:✅ 技术上完全能跑,而且是本机型唯一有逐秒实测的模型(7.3GB 显存 + 49 帧 126.8 秒)。 ❌ 但它需要「参考图 + 驱动视频」,不吃音频,不符合"一张图 + 一段中文音频"的口播场景。
⚠️ 一个容易被误导的岔路:如果你的素材本来就是"一段视频 + 一段中文音频",那你需要的是 InfiniteTalk / MuseTalk / LatentSync 那类视频重绘配音模型,不是 Animate——Animate 做的是"让参考图里的人做出驱动视频的动作",与"对上录音的嘴型"是两件不同的事。
| 项 | 数据 |
|---|---|
| 发布方 | 浙江大学 + 阿里巴巴(Qijun Gan 等)|arXiv 2506.18866 |
| 时间线 | 14B 权重 2025-06-24;1.3B 权重 2025-07-02;GitHub 最后 push 2025-08-06(停更 13.5 个月) |
| 参数量 / 体积 | 14B;OmniAvatar-14B/pytorch_model.pt 仅 1.238 GB(LoRA + 音频条件权重),底座是 Wan2.1-T2V-14B;1.3B 版 0.355 GB |
| 许可证 | 14B Apache-2.0;⚠️ 1.3B 的 HF license 字段为空(未声明) |
| GitHub | 1,861 ★ / 168 fork(2026-09-22) |
| 音频编码器 | facebook/wav2vec2-base-960h(英文 LibriSpeech 960h) |
🟡 官方显存表(A800,480p,官方 README)
| 参数量 | dtype | GPU 数 | num_persistent_param_in_dit | 速度 | 所需显存 |
|---|---|---|---|---|---|
| 14B | bfloat16 | 1 | None(不限) | 16.0 s/it | 36 G |
| 14B | bfloat16 | 1 | 7e9(7B) | 19.4 s/it | 21 G |
| 14B | bfloat16 | 1 | 0 | 22.1 s/it | 8 G |
| 14B | bfloat16 | 4 | 不限 | 4.8 s/it | 14.3 G |
🟢 第三方实测(决定性)
--hp=num_persistent_param_in_dit=7000000000",被追问内存需求时答 "Maybe 64GB CPU RAM is required"ComfyUI:❌ 无。feature request kijai #836 自 2025-07-20 提交,至 2026-09-22 仍 open;wrapper 里没有 omniavatar 模块。2025-07 曾有一个"OmniAvatar 1.3B 图生数字人工作流"在微信公众号传播,但被官方仓库 issue 定性为闭源付费推广(作者直接把 issue closed 并注明 "Not open-source. Closed it.")。 量化:⚪ 无 fp8 / int8 / GGUF(HF 上只有 1.238GB 的 LoRA+音频权重) 中文:⚠️ 未查到官方支持(编码器是英文 960h)。网传"支持 31 种语言"在官方 GitHub / HF / 项目页均无出处,不采信。
🎯 16GB 结论:❌ 14B 不可用(官方称需 64GB 内存,本机 32GB 不够);1.3B 能跑(~8GB)但生态为零:无 ComfyUI 节点、无量化、无中文官方支持、项目停更 13.5 个月、RTX 50 系兼容 issue 从未处理。排除。
| 项 | 数据 |
|---|---|
| 发布方 | 阿里巴巴 AMAP(高德)CV Lab|ACM MM 2025|开源 2025-07-07|最后更新 2025-08-20(停更 13 个月) |
| 参数量 / 体积 | 14B(基于 Wan2.1-I2V-14B-720P)+ 口型适配器 fantasytalking_fp16.safetensors 1.68 GB |
| 许可证 | Apache-2.0 |
| GitHub | 1,630 ★ |
🟡 官方显存/速度表(A100,512×512,81 帧)
torch_dtype | num_persistent_param_in_dit | 速度 | 需求显存 |
|---|---|---|---|
| bfloat16 | None(不限) | 15.5 s/it | 40 G |
| bfloat16 | 7×10⁹(7B 常驻) | 32.8 s/it | 20 G |
| bfloat16 | 0(全部 offload) | 42.6 s/it | 5 G |
→ 唯一能进 16GB 的是"全 offload → 5G"档,但 42.6 s/it。按 30 步算约 21 分钟/帧组,10 秒视频是"小时级"——不可用级慢,不是"稍慢"。
🔴 16GB 上的明确失败证据(本调研新查到)
flash_attn,否则结果错误(#13 回复)→ 在 sm120 上是大坑(FA2 需自编 12.0,FA3/FA4 不可用)ComfyUI:✅ 社区路径(kijai/ComfyUI-WanVideoWrapper 的 FantasyTalkingWav2VecEmbeds 节点,30 步 UniPC,CFG=5);⚠️ 该 wrapper 仓库没有 README(raw 全 404)。有 issue #753 "Fantasy Talking VRAM Usage"。SageAttention 支持有用户请求(#69)但未实现。 🔴 量化无解:社区 GGUF 尝试明确失败并归档——kael558/ComfyUI-GGUF-FantasyTalking 的 README 全文只有一句:"P.S. Couldn't quantize the fantasy talking model so this repo doesnt work" 中文:⚠️ 工作流用 facebook/wav2vec2-base-960h(英文 960h),官方 demo 音频也是英文 → 中文口型不可靠 其他:81 帧固定窗口,未见官方长视频/分段续写方案;❌ 不支持多人
🟢 第三方质量(EchoMimicV3 论文 Table 1,512×512 半身):FantasyTalk-14B Sync-C 4.05(全表最低)/ Sync-D 11.01(全表最差),FID 45.03、FVD 603.95 → 唇形同步是它的相对弱项 ⚠️ FantasyTalking2:AAAI 2026 论文,仓库 只有 README.md + assert/ 目录,3 个 commit 全在 2025-08-15~08-18,65★,无 LICENSE 文件,无代码无权重 → 不是"不推荐",是"不存在可用产物"
🎯 16GB 结论:❌ 明确不可行。 有 RTX 5070 Ti 16GB 的失败报告、RTX 5090 32GB 最小设置 OOM、32GB 内存不足、官方要求必须装 flash_attn(sm120 大坑)、量化已失败归档、停更 13 个月、中文前端是英文、唇形同步在其论文对比表里垫底、A800 上 30 秒要 1 小时。八个"不"——直接划掉。
为什么单列一节:口播链路的第一环是配音。中文 TTS 的"像不像人"直接决定成片质量,而许可证问题在这一环比在数字人那一环更严重——多个知名中文 TTS 的权重是 CC-BY-NC 非商用(代码 MIT 掩盖不了权重许可),商用一票否决。
| 问题 | 具体表现 | 应对 | 来源 |
|---|---|---|---|
| 🔴 CosyVoice 有直击本机的 issue | issue #1318 "5060ti 16g 运行 cosyVoice2 无法启动";issue #1815 "Compatibility Issue with PyTorch 2.4+ and RTX 50-series GPUs (sm_120)" | 必须按 issue 指定的 torch/cu128 组合;不要用旧 pin | 🟢 GitHub issues |
| 🔴 IndexTTS GPU 检测失败 | issue #295 "Setting accelerator to CPU... we were unable to detect it" —— 与 Blackwell 新架构高度相关 | 先查 torch 是否 cu128+ 与 CUDA 可见性 | 🟢 GitHub issue |
| flash-attn 无 sm_120 预编译内核 | attn_implementation="flash_attention_2" → no kernel image is available for execution on the device | 改用 eager 或 sdpa;有 4090 用户反馈该模型上 eager 与 FA2 速度相当甚至更好 | 🟢 flash-attention #2168 |
| torch 必须 cu128+ | 默认 pip install torch 会拉 cu121 → sm_120 内核缺失 | pip install --upgrade torch --index-url https://download.pytorch.org/whl/cu128(本机 2.11.0+cu130 已满足) | 🟢 多模型 README |
| SageAttention | 本机自建版含 sm_120 cubin,但长序列会 GPU 丢失(见 §0) | TTS 场景完全不要开 sage_attn,一律 sdpa | 本机运维记录 |
| OmniVoice 在 Blackwell 有未修 bug | issue #155:Blackwell 上输出噪声/乱码(5090 复现,2026-05 仍未修);issue #83:微调撞 sm_120 的 ~99KB shared memory 墙(datacenter Blackwell sm_100 才有 228KB) | 推理可试;微调不行;建议等修复 | 🟢 GitHub issues |
| pynini / WeTextProcessing | conda 外安装困难(历史性痛点) | Linux 上优先 conda 装 pynini,或走模型自带 jieba/cn2an 路径 | 🟢 IndexTTS #61 |
| ✅ GPT-SoVITS 对 sm_120 最友好 | README"测试通过环境"明确列出 PyTorch 2.7.0/CUDA 12.8、2.8.0dev/CUDA 12.8 —— torch 2.7+ 才有完整 Blackwell 内核 | 直接用 bash install.sh --device CU128 | 🟢 GPT-SoVITS README |
"能不能在这台机上跑起来"的难度排序(从易到难): GPT-SoVITS ≈ Qwen3-TTS ≈ VoxCPM2 < CosyVoice3 ≈ IndexTTS-2.5 < OmniVoice(有未修 bug)< GLM-TTS / Fun-CineForge(无 ComfyUI 节点,需自行封装)
横评 A:OpenMOSS/MOSS-TTS 官方对比表(来源:MOSS-TTS README_zh)。ZH CER = 中文字错率↓;ZH SIM = 说话人相似度↑
⚠️ 由 OpenMOSS 发布(自家模型在表内),对自家模型可能有正向偏差;但它是唯一同时列闭源与十余个开源模型的表。
| 模型 | 参数 | 开源 | EN WER↓ | EN SIM↑ | ZH CER↓ | ZH SIM↑ |
|---|---|---|---|---|---|---|
| (闭源)MiniMax-Speech | — | ❌ | 1.65 | 69.2 | 0.83 | 78.3 |
| (闭源)Seed-TTS | — | ❌ | 2.25 | 76.2 | 1.12 | 79.6 |
| (闭源)CosyVoice3 | 1.5B | ❌ | 2.22 | 72 | 1.12 | 78.1 |
| GLM-TTS-RL | 1.5B | ✅ | 1.91 | 68.1 | 0.89 | 76.4 |
| VoxCPM(1.0) | 0.5B | ✅ | 1.85 | 72.9 | 0.93 | 77.2 |
| IndexTTS2 | 1.5B | ✅ | 2.23 | 70.6 | 1.03 | 76.5 |
| GLM-TTS | 1.5B | ✅ | 2.23 | 67.2 | 1.03 | 76.1 |
| CosyVoice3 | 0.5B | ✅ | 2.02 | 71.8 | 1.16 | 78.0 |
| VibeVoice | 1.5B | ✅ | 3.04 | 68.9 | 1.16 | 74.4 |
| FireRedTTS-2 | 1.5B | ✅ | 1.95 | 66.5 | 1.14 | 73.6 |
| Qwen3-TTS | 1.7B | ✅ | 1.50 | 71.45 | 1.33 | 76.72 |
| Qwen3-TTS | 0.6B | ✅ | 1.68 | 70.39 | 1.23 | 76.4 |
| MossTTSLocal | 1.7B | ✅ | 1.93 | 73.28 | 1.44 | 79.62 |
| CosyVoice2 | 0.5B | ✅ | 3.09 | 65.9 | 1.38 | 75.7 |
| F5-TTS | 0.3B | ✅ | 2.00 | 67 | 1.53 | 76 |
| SparkTTS | 0.5B | ✅ | 3.14 | 57.3 | 1.54 | 66 |
| CosyVoice | 0.3B | ✅ | 4.29 | 60.9 | 3.63 | 72.3 |
横评 B:VoicePing 中文专项基准(🟡 第三方,2026-09-20 更新)——含情感识别与"数字读法"两个 MOSS 表没有的维度
| 模型 | 中文 CER | 情感识别↑ | 数字:标识符 | 数字:小数 | median RTF | median 峰值显存 |
|---|---|---|---|---|---|---|
| Qwen3-TTS-1.7B-CustomVoice | 9.7% | 53.3%(最高) | 0%(30/30 全失败) | 86.7% | 1.58 | 8.13 GB |
| VoxCPM2 (2B) | 4.4%(最低=最好) | 35.0% | — | — | 9.84 | 12.79 GB |
| IndexTTS-2 / 2.5 | — | — | 40% | 100%(唯一满分) | 6.97(2.0) | 7.29 GB |
| Fish Audio S1-mini | — | 内联标记基本失效 | 综合 79.3%(S2.1,需开厂商正则) | — | 3.47 | 13.05 GB(最高) |
🔴 两表口径冲突,必须知道:OpenMOSS 表里 Qwen3-TTS-1.7B 的 ZH CER 是 1.33,VoicePing 测出 9.7%。测试集、文本难度、评测脚本都不同,不能混比。看趋势(谁强谁弱)可以,看绝对值不行。
| 模型 | 许可证 | 能否商用 |
|---|---|---|
| Qwen3-TTS(全系) | Apache-2.0 | ✅ 无附加条件 |
| Fun-CosyVoice3-0.5B-2512 / CosyVoice2 / 300M | Apache-2.0 | ✅ 无附加条件 |
| VoxCPM / VoxCPM2(面壁+清华) | Apache-2.0 | ✅ 无附加条件 |
| GPT-SoVITS | MIT(仓库 LICENSE 原文确认) | ✅ 无附加条件 |
| MOSS-TTS 全系 / OmniVoice / Dots TTS / MegaTTS3 / FireRedTTS2 | Apache-2.0 | ✅ |
| GLM-TTS(智谱) | ⚠️ HF 卡写 mit,仓库 LICENSE 原文是 Apache-2.0 → 两者都允许商用,但口径不一致,建议以仓库 LICENSE 为准并留存证据 | ✅ |
| VibeVoice(微软) | ⚠️ HF 卡 MIT,但第三方 TTS-Audio-Suite 引擎表标注 "MIT (research-only per model card)" → 冲突,商用前自行核对微软条款;且其 HF 表中 VibeVoice-TTS-1.5B 状态为 Disabled | ⚠️ 需核 |
| IndexTTS-2 / 2.5(B站) | ⚠️ 不是 Apache-2.0。仓库是 "bilibili Model Use License Agreement":授予全球、非独占、不可转让、免版税许可 → 普通规模可商用;例外:你或关联方上月 MAU > 1 亿,或上一年营收 > 10 亿人民币,须另行申请。附加义务:保留版权声明;不得用本模型改进其他 AI 模型(除非该模型本身非商用);禁止高风险场景(医疗诊断/自动驾驶/军事/关键基础设施/大规模生物识别监控/自动化信贷雇佣)。管辖区:中国法、上海仲裁委 | ✅ 普通规模可商用(比我初稿的判断更宽松);⚠️ 但必须读完全文 |
| F5-TTS | 🔴 README 原文:代码 MIT,但预训练权重是 CC-BY-NC(因训练数据 Emilia);HF 卡 cc-by-nc-4.0 | ❌ 一票否决 |
| SparkTTS(阿里) | 🔴 代码 Apache-2.0,权重 cc-by-nc-sa-4.0 | ❌ |
| Fish-Speech / S2 Pro | 🔴 LICENSE 原文:"Any Commercial use of the Materials requires a separate license from Fish Audio." | ❌ |
| ChatTTS | 🔴 代码 AGPL-3.0(强 copyleft)+ 权重 CC-BY-NC-4.0 双杀 | ❌ |
| Higgs Audio v3(Boson) | 🔴 Research and Non-Commercial License | ❌ |
| DramaBox | ⚠️ LTX-2 Community License;需 ~24GB VRAM(fast mode) | ❌ 硬件不够 |
⚠️ 教训:不要相信 HF 镜像卡上的 license 字段(IndexTTS-2 就是反例,多个第三方镜像卡误标
apache-2.0)。要核实官方仓库根目录的 LICENSE 文件原文。
体积口径:HF 仓库
total含所有量化/备份文件(如 CosyVoice3 同时含llm.pt与llm.rl.pt,IndexTTS 含多版本),实际推理只加载其中一份,故"推理所需"列更贴近真实。
| 模型 | 参数 | HF 总体积 / 推理所需 | 许可证 | 16GB | ComfyUI 节点 | 中文效果 | 音色克隆 | 生成 10s 音频 |
|---|---|---|---|---|---|---|---|---|
| GPT-SoVITS v2ProPlus | 0.21B(133M+77M) | 极小 | MIT ✅ | ✅ ~6GB 级 | ✅ AIFSH/ComfyUI-GPT_SoVITS | 中文原生核心场景(g2pW 多音字前端);⚪ 未查到权威第三方 CER/MOS | ✅ 5s zero-shot / 1min few-shot 微调 | 🟠 ≈0.28 秒(RTF 0.028 @4060 Ti,项目自述);RTF 0.014 @4090 |
| IndexTTS-2.5 | 0.8B(官网)/ 1.5B(他表)⚠️ | 5.11 GiB / ~5.1 GiB | bilibili 许可 ✅ 普通规模可商用 | ✅ 峰值 ~7.3 GB | ✅ joyfoxai/ComfyUI-Index-TTS-25(一套节点同支持 2 与 2.5) | 🟠 ZH CER 3.93(RL);🟡数字小数 100%(唯一满分)、标识符 40% | ✅ zero-shot + 8 维情感向量 | 🟠 2.1s(RTF 0.2065 @4090 bf16)/🟡 29s(RTF 2.92 @5060 Ti) |
| Qwen3-TTS-12Hz-1.7B | 1.7B | 4.23 GiB / ~4.2 GiB | Apache-2.0 ✅ | ✅ 峰值 ~8 GB | ✅ 2 套(ComfyUI-TD-Qwen3TTS / ComfyUI-Qwen-TTS) | 🟡 第三方综合第一(CER 9.7%、情感识别 53.3% 最高、唯一 anchor margin 为正);🔴 但长数字串 0%(30/30 全失败) | ✅ zero-shot(3s 参考) | 🟡 ~15.8s(RTF 1.58)/社区报 RTF 2–4× |
| Qwen3-TTS-12Hz-0.6B | 0.6B | 2.34 GiB / ~2.3 GiB | Apache-2.0 ✅ | ✅ 余量极大 | ✅ 同上(同代码) | 🟠 CER 1.23 / SIM 76.4 | ✅ | 未查到(应更快) |
| VoxCPM2(面壁+清华) | 2B | 4.62 GiB / ~4.6 GiB | Apache-2.0 ✅ | ✅ 官方 ~8 GB | ✅ starsFriday/ComfyUI-VoxCPM、nkxx188/ComfyUI-VoxCPM-nkxx | 🟡 中文 CER 4.4%(VoicePing 最低=最好),但情感仅 35.0% | ✅ zero-shot + 音色设计;支持 LoRA 训练 | 🟠 3.0s(RTF 0.30 @4090)/🟡 98s(RTF 9.84,GPU 未标) |
| Fun-CosyVoice3-0.5B-2512 | 0.5B | 9.08 GiB / ~4.2–5.2 GiB | Apache-2.0 ✅ | ✅(5060 Ti 实跑;"6G 勉强、8G 可跑") | ✅ 4+ 套(ComfyUI_FL-CosyVoice3 ⭐) | 🟠 CER 0.81(RL)/ SS 77.4;🟡标识符 90% 最佳,但货币错误多 | ✅ 3–30s zero-shot + instruct 情感/方言 | 🟡 18.8s(RTF 1.88 @5060 Ti,第三方);🟠 部分用户报 RTF>2 |
| MOSS-TTS-Local-1.7B / v1.5-8B | 1.7B / 8B | 8.49 / 15.83 GiB | Apache-2.0 ✅ | ✅ 官方称 8B 经 llama.cpp 优化后可跑 8GB GPU | ✅ richservo/comfyui-moss-tts | 🟠 Local-1.7B ZH SIM 79.62(表内最高) / CER 1.44 | ✅ 稳定克隆 | 未查到统一数字 |
| OmniVoice(k2-fsa) | ~0.6B | ~3.3 GB | Apache-2.0 ✅ | ✅ 第三方 5060 Ti ~4 GB | ✅ Saganaki22/ComfyUI-OmniVoice-TTS | ⚠️ 600+ 语种但长尾;🔴 Blackwell 有未修乱码 bug | ✅ zero-shot + 音色设计 | 🟡 ~1.2 秒(5060 Ti 上 0.6s / 5s 音频) |
| VibeVoice-1.5B(微软) | 1.5B | 5.04 GiB | ⚠️ MIT vs research-only 冲突 | ✅ | ✅ bozoyan/ComfyUI-VibeVoice | 🟠 CER 1.16 / SIM 74.4 | ❌(多说话人长音频) | 未查到 |
| GLM-TTS / GLM-TTS-RL | 1.5B / 3B ⚠️ | 8.28 GiB | MIT / Apache-2.0 ✅ | ⚠️ 理论可,无实测 | ❌ 未查到任何节点 | 🟠 CER 0.89(RL,表内最低) / SIM 76.4 | ✅ 3–10s | 未查到 |
| Kokoro-82M-v1.1-zh | 82M | 0.37 GiB / 0.31 GiB | Apache-2.0 ✅ | ✅ <3 GB | ✅ 2 套 | ⚪ 未查到权威中文 MOS/CER;社区报"Mandarin problem" | ❌ 不支持克隆 | 未查到 |
| Fun-CineForge(阿里通义)⭐ | 未查到 | 12.68 GiB(主干 ~9.6GB) | Apache-2.0 ✅ | ⚠️ 理论可,无 16GB 实测 | ❌ 未查到 | 专为影视配音 + 唇同步时间对齐设计 | ✅ | 未查到 |
| F5-TTS | 0.3B | 6.28 GiB / ~1.2 GiB | 🔴 权重 CC-BY-NC | ✅ | ✅ | CER 1.53 / SIM 76 | ✅ | 未查到 |
| SparkTTS | 0.5B | 3.67 GiB | 🔴 权重 CC-BY-NC-SA | ✅ | 未查到专用 | CER 1.54 / SIM 66(最低) | ✅ | 未查到 |
| Fish Audio S2 Pro | 4B | 10.26 GiB | 🔴 商用需单独授权 | ✅ | ✅ TTS-Audio-Suite | 🟡 数字综合 79.3% 第一(需开厂商正则) | ✅ | 🟠 2.0s(RTF 0.195) |
| ChatTTS | 未查到 | — | 🔴 AGPL + CC-BY-NC | ✅ <4GB | ⚠️ 仅 LLM_party | 🔴 音质被官方故意加噪降质 | ❌ | 🟡 ~3s |
| MegaTTS 3(字节) | 未查到 | 3.98 GiB | Apache-2.0 ✅ | ✅ 节点称 ≥4GB | ✅ 2 套 | 未见第三方中文数字 | ✅(需 WAV+NPY 对) | 未查到 |
排序逻辑:因为这是本机选型,我把 ① sm_120 能否顺利跑起来 ② 速度是否阻塞链路 的权重提到与"效果"同级——配音是链路上游,出 10 秒音频等 30 秒会让整条流水线窒息。
理由
g2pW/pypinyin-g2pW,多音字处理是卖点之一。最致命的坑
install.sh --device CU128;中文需额外下 G2PWModel;需 ffmpeg、libsox-dev。理由
emo_text 文本情感 + duration_factor(0.5–2.0 语速)。口播最缺的就是"同一音色、不同情绪/语速"的稳定可控——CosyVoice 的 instruct 与 GPT-SoVITS(无情感控制)都比不上。config.yaml 的 version 字段),内置官方源码、5 种情感模式、已兼容 transformers 4.52.1~4.57.x、并修掉了 TorchAudio 2.9 整数 PCM 保存导致的严重削波;README 把依赖坑(fugashi+unidic-lite、WeTextProcessing、g2p-en、jieba、cn2an、descript-audiotools)全列清楚了。最致命的坑
Setting accelerator to CPU... we were unable to detect it),与 Blackwell 高度相关,必须先排查。deepspeed / flash-attn / cuda_kernel / torch_compile 四个加速开关默认关闭 —— sm_120 上建议全部保持关闭。pynini 安装问题(经典坑);社区报中文多音字问题。理由
AICoderTudou/ComfyUI-TD-Qwen3TTS、flybirdxx/ComfyUI-Qwen-TTS(后者支持 sage_attn/flash_attn/sdpa/eager 自动降级,并明确提示 no kernel image is available 是 CUDA 内核缺失而非注意力问题,还提供 unload_model_after_generate 释放显存);另有 GGUF(Serveurperso/Qwen3-TTS-GGUF,下载 288,188)。最致命的坑
transformers 必须锁 ==4.57.3(≥5.0 直接加载失败;节点 README 用加粗警告)。eager/sdpa。language 参数要全名("Chinese",写 "zh" 会报错)。nkxx188/ComfyUI-VoxCPM-nkxx 支持多人对话 + LoRA 训练torch.compile/Triton warm-up 报 torch._dynamo.exc.Unsupported → 用 VoxCPM.from_pretrained(..., optimize=False);Could not load libtorchcodec → 装系统 ffmpeg + torchcodec 或改用 soundfile 后端;VoicePing 测得 median RTF 9.84(该测试路径偏慢)| 模型 | 判定 | 原因 |
|---|---|---|
| F5-TTS | ❌ 淘汰 | 🔴 权重 CC-BY-NC 非商用(代码 MIT 掩盖不了权重许可)——商用红线一票否决;且 2025-03 之后无新版模型 |
| SparkTTS | ❌ 淘汰 | 🔴 权重 cc-by-nc-sa-4.0 + 停更 1.5 年 + SIM 66 全场最低;且 wav2vec2 就占 1.2GB,性价比差 |
| Fish-Speech / S2 Pro | ❌ 淘汰 | 🔴 LICENSE 原文要求任何商业用途需单独授权;VoicePing 峰值显存 13.05GB(最高);情感内联标记基本失效 |
| ChatTTS | ❌ 淘汰 | 🔴 AGPL-3.0 + 权重 CC-BY-NC 双杀;且音质被官方故意加噪降质(防滥用)→ 对口播是致命的;不支持克隆 |
| Higgs Audio v3 | ❌ 淘汰 | 🔴 Research and Non-Commercial License |
| DramaBox | ❌ 淘汰 | 需 ~24GB VRAM(fast mode),官方明说不保证最低 GPU |
| Step-Audio 2 mini | ❌ 淘汰 | HF 总 16.66 GiB,fp16 塞不下 16GB;且定位是语音理解/对话(ASR+S2ST),非纯口播 TTS |
| Kokoro-82M-v1.1-zh | ⚠️ 降级为备用 | Apache-2.0、<3GB、TTS Arena Elo 1178(前十唯一开源小模型);但(a)中文档停更 1.5 年(2025-03-04)(b)❌ 不支持音色克隆 → 无法满足"固定主播音色"这一口播刚需 |
| GLM-TTS | ⚠️ 降级为跟踪项 | 中文 CER 0.89(RL)全表最强之一、许可可商用、8.28 GiB 可控;但 ❌ 未查到任何 ComfyUI 节点(TTS-Audio-Suite 19 引擎里也没有)+ 参数量口径冲突(1.5B vs 3B)+ 无 16GB 实测 |
| OmniVoice | ⚠️ 降级待观察 | 速度/Apache/体积都极优(5060 Ti 上 0.6s/5s、~4GB);但 🔴 Blackwell 有未修的乱码 bug(#155,5090 复现)+ sm_120 微调撞 shared memory 墙(#83) → 在你的卡上属高风险。另注:中文报道称"小米开源 OmniVoice",但仓库实为 k2-fsa/OmniVoice(k2-fsa 组织),未查到与小米的官方关联 → 该报道疑似误标 |
| Fun-CineForge | ⚠️ Phase-2 观察项 | Apache-2.0、与"配音+唇同步"方向最对口(影视级配音 + 时间模态对齐,基于 CosyVoice3);但仅 48 次下载(极冷)、无 ComfyUI 节点、无 16GB 实测、主干 9.6GiB。且它是"给已有视频配音"的定位,而你的音频是给数字人模型当驱动信号的——能力不完全等价 |
| VibeVoice | ⚠️ 需自核许可 | HF 卡 MIT vs 第三方标 research-only 冲突;TTS 侧 2026 年停止推进(近期更新全在 ASR);中文 SIM 74.4 偏低 |
| MegaTTS3 | ⚠️ 降级 | Apache-2.0 没问题;但停更 1.5 年、克隆需 WAV+NPY 文件对(不如"丢个 wav 就行"方便)、未查到任何第三方中文客观数据 |
| MOSS-TTS / MOSS-TTSD | ⚠️ 备选 Plan B | Apache-2.0 + 官方称 8B 经 llama.cpp 优化后可跑 8GB GPU + 节点齐全 + Local-1.7B ZH SIM 79.62(最高);但未查到 16GB/5060Ti 实测 + 基准含大量厂商自测 + 单人场景用不上 TTSD 的对话能力 |
| CosyVoice3 | ⚠️ 从 Top1 降为备选 | 中文效果与生态都很好(4+ 套节点、18+ 方言、5060 Ti 实测 RTF 1.88);但 🔴 有直击本机的 issue:#1318「5060ti 16g 运行 cosyVoice2 无法启动」、#1815「PyTorch 2.4+ & RTX 50-series sm_120 兼容问题」 → 必须按 issue 方案先验证能否启动。另 vllm 版本未给明确 pin(#1847)、pynini 安装困难 |
Phase 1(1 天内跑通整条链路)
└─ GPT-SoVITS v2ProPlus(bash install.sh --device CU128)
→ 用 5s~1min 素材做音色;先打通「文案 → 配音 → 数字人口型同步」
→ 选它的原因:MIT、sm_120 最不易踩坑、RTF 0.028 快到不阻塞链路
Phase 2(升级质感)
└─ IndexTTS-2.5 + joyfoxai/ComfyUI-Index-TTS-25
→ 补上情感/语速控制,做「同一主播、多情绪」的口播矩阵
→ 必做预处理:把数字展开成汉字
Phase 3(追质量上限,A/B 试听)
└─ Qwen3-TTS-1.7B-CustomVoice(锁 transformers==4.57.3 + eager 注意力)
或 VoxCPM2(48kHz,中文 CER 4.4%)
全程遵守
├─ 参考音频 ≤3.5s(防显存尖峰;OmniVoice 有 >4s 飙到 8GB 的报告)
├─ 不开 sage_attn,一律 sdpa / eager
├─ torch 用 cu128+(本机 2.11.0+cu130 ✅)
└─ 与数字人模型串行执行(16GB 绝不同时驻留两个大模型)
⚠️ 一条跨所有 TTS 的通用规则:没有一个中文 TTS 能可靠地读长数字串。Qwen3-TTS 标识符 0%、IndexTTS 标识符 40%、CosyVoice3 标识符 90% 但货币项只有 46.7% 且错误多为把金额本身改掉。 → 把"数字/金额/编号展开成汉字"写进 pipeline 的预处理,这是本链路最容易被忽略、后果最严重的一环。
| 阶段 | 模型 | 权重常驻 | 峰值显存 | 备注 |
|---|---|---|---|---|
| ① 配音 | GPT-SoVITS v2ProPlus(0.21B) | ~1 GiB 级 | ≤3 GB | 可与 ComfyUI 共存;CPU 也能跑;升级档 IndexTTS-2.5 ≈5.1 GiB / Qwen3-TTS-1.7B ≈4.2 GiB |
| ② 口型 | EchoMimicV3-Flash-pro | 3.47 GiB | 6.5~12 GB(768×512 开 block_offload) | 主战场 |
| ③(可选)修嘴 | LatentSync 1.5 | ~5 GB | ~8 GB | 官方最低 8 GB |
| 合计 | — | — | 分时执行,无需同时常驻 | 本机 ComfyUI 已 --lowvram --reserve-vram 1.0,够用 |
⚠️ 不要同时加载 TTS 与数字人模型:16GB 会被 VAE + 文本编码器挤爆。先出 WAV,再跑口型。
duration_factor 0.5–2.0)transformers==4.57.3 + eager 注意力)或 VoxCPM2(48kHz)block_offload=on + partial_video_length=97 + TeaCache → 出片| 环节 | 预期耗时 | 依据 |
|---|---|---|
| TTS 配音 | 约 10~30 秒 | L40S 上 RTF 0.87 → 10 秒音频 ≈ 8.7 秒;5060 Ti 按 2~3 倍算 |
| 口型生成 | 约 10~12 分钟 | L40S 实测 3.63s→252s 外推(5060 Ti 需自测,可能更慢) |
| (可选)LatentSync 修嘴 | 约 2~6 分钟 | 🟨 3060 12G 上 10 秒约 2~6 分钟(旧数据) |
| 合计 | 约 12~20 分钟 / 10 秒成片 | — |
来源:arXiv 2608.12107(港理工 + 字节 + AMD)。EMTD 数据集,每项为「5 秒 / 30 秒」两档。
| 模型 | LLM Judge Overall↑ | Sync-C↑ | Sync-D↓ | FID↓ | 延迟(s)↓ |
|---|---|---|---|---|---|
| InfiniteTalk | 3.39 / 3.96 | 6.73 / 6.81 | 8.00 / 7.95 | 39.25 / 37.63 | 51.5 / 309.2 |
| OmniAvatar | 3.57 / 2.26 | 5.57 / 6.83 | 9.47 / 8.59 | 61.62 / 115.84 | 850 / >1 小时 |
| LiveAvatar | 3.65 / 4.12 | 6.67 / 6.62 | 8.45 / 8.08 | 39.23 / 61.17 | 53.0 / 321.0 |
| SoulX-FlashTalk | 3.68 / 3.98 | 6.83 / 6.83 | 7.97 / 7.96 | 38.91 / 33.46 | 25.4 / 125.3 |
| Avatar-Forever(本文) | 3.82 / 4.32 | 7.56 / 6.85 | 7.95 / 7.94 | 38.37 / 33.33 | 5.2 / 38.9 |
🟢 用户盲测投票(Table 2,EMTD 长视频档,20 人,归一化 0–100)
| 模型 | 得分 |
|---|---|
| Avatar-Forever | 76.00 |
| SoulX-FlashTalk | 60.23 |
| LiveAvatar | 57.68 |
| InfiniteTalk | 55.33 |
| OmniAvatar | 40.20(垫底) |
⚠️ 局限:论文未标注延迟测量所用 GPU → 延迟绝对值只能相对比较,不能外推到 5060 Ti。该表未包含 MultiTalk / EchoMimic / FlashHead / LongCat / Wan2.2-S2V。
| 模型 | 参数量 | LSE-C↑ | LSE-D↓ |
|---|---|---|---|
| InfiniteTalk | — | 8.535 | 7.108 |
| HunyuanVideo-Avatar | 12.99B | 7.210 | 8.494 |
| Wan-S2V | — | 6.999 | 8.292 |
| Hallo3 | — | 5.352 | 9.828 |
来源:arXiv 2608.16220(表 4,EMTD)。⚠️ 量级与经典 SyncNet 不同,只能同表内比较。
| 方法 | Sync-C↑ | Sync-D↓ | FID↓ | FVD↓ | IQA↑ | ID↑ |
|---|---|---|---|---|---|---|
| EchoMimicV3-1.3B | 5.49 | 9.67 | 42.45(最优) | 496.76(最优) | 4.91 | 1.0 |
| HunyuanAvatar-14B | 6.12 | 9.11 | 42.54 | 676.28 | 4.96 | 1.0 |
| OmniAvatar-1.3B | 5.61 | 9.58 | 53.24 | 705.21 | 4.92 | 0.97 |
| Hallo3 | 5.42 | 9.65 | 68.6 | 865.32 | 4.4 | 0.91 |
| FantasyTalk-14B | 4.05(最低) | 11.01(最差) | 45.03 | 603.95 | 4.85 | 0.96 |
来源:arXiv 2507.03905v3。读法:EchoMimicV3 用 1.3B 打赢了 14B 的 FantasyTalk,并在 FID/FVD 上全表最优。
EMTD(110 段 720P 半身带手,最长 74 秒):
| 方法 | FID↓ | FVD↓ | IQA↑ | Sync-C↑ | Sync-D↓ |
|---|---|---|---|---|---|
| Hallo3 | 74.10 | 250.12 | 1.95 | 7.31 | 9.30 |
| MultiTalk | 85.01 | 404.45 | 1.78 | 8.76 | 7.69 |
| OmniAvatar | 131.69 | 705.14 | 1.67 | 8.81 | 7.76 |
| HunyuanVideo-Avatar | 100.10 | 662.61 | 1.52 | 7.22 | 8.98 |
| InfinityHuman(本文) | 69.28 | 239.05 | 2.11 | 8.59 | 7.53 |
HDTF(100 段 512×512):
| 方法 | FID↓ | FVD↓ | IQA↑ | Sync-C↑ | Sync-D↓ |
|---|---|---|---|---|---|
| OmniAvatar | 82.54 | 1104.99 | 2.16 | 5.40 | 9.13 |
| MultiTalk | 103.68 | 1040.43 | 2.07 | 6.34 | 8.47 |
| Hallo3 | 104.51 | 1256.10 | 2.31 | 4.26 | 10.22 |
| FantasyTalking | 133.73 | 1307.20 | 2.11 | 1.11 | 12.88 |
| HunyuanVideo-Avatar | 139.39 | 2160.92 | 1.76 | 4.89 | 9.37 |
⚠️ 这是 InfinityHuman 作者自己的复现实验,会系统性偏向自研方法;且不含 2026 年新模型。只用于老模型之间的相对排序。
| 方法 | HDTF LSE-C↑ | 静音测试(越低越"没在听音频") | 人类评分:图像/同步 |
|---|---|---|---|
| LatentSync | 7.58 | 0.81 | 3.95 / 3.68 |
| Wav2Lip | 7.38 | 0.84 | 3.78 / 3.22 |
| MuseTalk | 6.21 | 0.68(最差) | 4.34(最高)/ 3.14(最低) |
| HighSync(本文) | — | 0.93(最好) | — / 4.01 |
静音测试的含义:给模型一段静音,看嘴动不动。MuseTalk 0.68 说明"不上音频也在动嘴"。
结论:不存在"EvalTalker 2026 榜单排名"可引用。 2026 年主流横评用的是 SyncNet 的 Sync-C / Sync-D,不是 LSE-C / LSE-D。
| 模型 | 判定 | 核心原因 |
|---|---|---|
| EchoMimic V3 / V3-Flash | ✅ 采用(Top1) | 官方测试过 V100 16G;768×512 仅 6.5GB;原生中文;Apache-2.0;有 ComfyUI 节点与第三方一键脚本 |
| InfiniteTalk | 🟡 备选 | ComfyUI 官方核心原生节点;中文原生;Apache-2.0;但 3 分钟视频吃 >120GB 内存、10 秒要 30~60 分钟 |
| LongCat-Video-Avatar 1.5 | 🟡 中期实验 | MIT + 13.6B + 原生多人 + 长视频;但 v1.5 夸张表情缺陷至今未修、sm_120 专项警告、480p 44 秒要 2 小时 |
| HunyuanVideo-Avatar | 🟡 仅在需要多人对话时 | Wan2GP 10GB 路径;但许可排除 EU/UK/KR、官方 ComfyUI 一年未落地、停更 9 个月 |
| Wan2.2-Animate-2 | ❌ 场景不匹配 | 不吃音频(要驱动视频);且 GGUF 有静默失败陷阱 |
| Wan2.2-S2V-14B | ❌ 淘汰 | 官方要求 ≥80GB,第三方实测 57.3GB,无 16GB 成功案例;16fps |
| OmniAvatar | ❌ 淘汰 | 官方称需 64GB 内存(本机 32GB);1.3B 版生态为零;停更 13.5 个月 |
| FantasyTalking | ❌ 淘汰 | 官方最低 20GB;5G 档 42.6 s/it 不可用;停更 13 个月;中文前端是英文;量化失败归档;唇形同步垫底 |
| 模型 | 判定 | 一句话 |
|---|---|---|
| SoulX-FlashHead Lite 1.3B | ✅ 强备选 | 🟢 峰值 5.76 GB(唯一两组第三方独立验证 <16GB)、热块 0.19 秒、Apache-2.0;但画质最弱(英中两组实测均称"不真实")、仅 512×512、中文能力仅厂商宣称未验证 |
| MuseTalk 1.5 | ✅ 仅"给已有视频换嘴型"时 | 4GB 可跑、42FPS 实时、中英日;但静音时也动嘴、256×256、ComfyUI 主节点停更 |
| LatentSync 1.5 | ✅ 可作修嘴环节 | 最低 8GB、官方明示改善中文;但停更一年 + 228 open issues + 必须正脸 25fps |
| LatentSync 1.6 | ❌ | 官方 18GB > 16GB |
| daVinci-MagiHuman | ❌ 场景不匹配 | 文本→(视频+语音)联合生成,不接受外部音频;社区 fp8 分支作者自称跑不起来 |
| LTX-2.5 / JoyAI-Echo echoVid | ❌ 场景不匹配 | 同上,"renders picture and sound in one pass";许可非标准 OSI |
| LiveAvatar(ECCV 2026 Spotlight) | ❌ 硬件不够 | 单卡 ≥80GB,FP8 后 48GB;但第三方横评里质量第一、耗时最短,值得盯盘 |
| SoulX-FlashTalk-14B | ❌ | 单卡 >64GB,--cpu_offload 后 40GB |
| HunyuanPortrait | ❌ | 根本不是音频驱动(参考图 + 驱动视频);仅学术用途禁止商用;零量化方案 |
| MoCha(Meta 版) | ❌ | 从未开源代码或权重(GitHub 1 星,只有演示 mp4) |
| MoCha(Orange-3DV 版) | ❌ 场景不匹配 | CVPR 2026,AGPL-3.0,是视频换人模型 |
| Wan2.5 / Wan3.0 | ❌ | 🔴 不存在开源权重;"Wan2.5-S2V"不是开源模型 |
| Ditto | ⚠️ | 8GB+ 可跑但 TRT 引擎按 Ampere_Plus 编译,sm_120 必须重转 |
| Hallo3 / Hallo4 | ❌ | 官方只吃英文;Hallo3 受 CogVideoX LICENSE 约束;Hallo4 无 LICENSE 文件且仅 38★ |
| Sonic | ❌ | CC BY-NC-SA 明确不可商用;官方基线是 32G GPU |
| Wav2Lip | ❌ | 🚫 明令禁止商用(LRS2 训练) |
| DreamID-Omni | ⚪ 可试 | Apache-2.0、FP8 ~12GB、模型卡写"Recommended for ≤16 GB GPUs";但语言标 en、无第三方实测 |
显存/速度类
int8_convrot 的 7.3GB / 126.8s,不是 GGUF)WanAnimate2Cache 的实际加速比——只有官方"约减半"宣称,零第三方 A/B 数字Serveurperso/Qwen3-TTS-GGUF、Richasy/IndexTTS-2.5-GGUF、cstr/cosyvoice3-0.5b-2512-GGUF、DennisHuang648/VoxCPM2-GGUF、OpenMOSS-Team/MOSS-TTS-GGUF、Serveurperso/OmniVoice-GGUF),无任何权威量化对照表社区/来源类
gh-proxy.com 代理 GitHub API 取得大部分,少量仅能核验编号与标题⚠️ 已识别并剔除/降级的不可信来源
- 两篇 CSDN「Wan2.2-S2V-14B 性能基准测试」:AI 批量生成的伪评测,含明显编造(把 4090 写成 16GB 显存、虚构
moe_expert_capacity参数、编造 L40/A6000/H100 全套数据)→ 本文未采信其任何数字instavar.com/pdf/HunyuanVideo_Avatar_*.pdf、instavar.com/pdf/InfiniteTalk_*.pdf:SEO 聚合站自动生成的 "TL;DR" 页,无原始测量、无 GPU 型号 → 剔除- CSDN《数字人EchoMimicV3 落地实践》(2026-08-19):逐段读过——内容实为官方 README 复述 + 环境报错修复,"最低 16G / Flash 版 12G"与官方口径一致,但全文没有任何显卡型号 + 耗时 → 仅作旁证,不作数据源
- 今日头条《8G显存跑数字人?LongCat 实战指南》等标题党:数据为厂商宣称搬运 → 未采信
- 一篇 Sonic 显存实测帖(CSDN):行文高度模板化、疑似 AI 生成 → 已标注"可信度低,仅作量级参考"
- 唯一需注明出处的 AI 参与案例:SageAttention #321 中某用户的修复代码自述"由 Gemini V3 提供"——代码来源存疑,但其硬件/版本事实(5060 Ti / torch 2.9.1 / triton 3.6 / sa3.0 / 马赛克伪影)可用
提醒:2026 年"数字人选型 / TTS 选型"是流量话题,中文平台 AI 伪横评极多。凡未给 GPU 型号 / 未给可复现命令 / 数字过于整齐的表格,先怀疑。
web_search + web_fetch(40+ 次检索、30+ 次页面抓取)torch.cuda.get_arch_list() 与 strings 检查 SageAttention .so 的 cubin 架构 —— 见 §0.0raw.githubusercontent.com(可达)取 README 与 LICENSEhf-mirror.com/api/models/<id>?blobs=true 取权威文件体积与 license 字段(本文体积数字的主要来源,比 README 文字描述可靠)ar5iv.labs.arxiv.org / export.arxiv.org 取论文gh-proxy.com 代理 GitHub API 取 issue 正文、星标与 commit 时间/api 的文件体积与许可字段|LiveTalking FPS 表|GitHub API 星标/commit 时间|CosyVoice 第三方 benchmark(RTF/TTFB)数字人模型:Tight Studio 六模型横评 2026-08 · Avatar-Forever arXiv 2608.12107 · EchoMimicV3 arXiv 2507.03905 · InfinityHuman arXiv 2508.20210 · HighSync arXiv 2605.16918 · PC-Talk arXiv 2503.14295 · LSE 横比 arXiv 2608.16220 · EvalTalker arXiv 2512.01340 · ComfyUI 官方 Wan2.2-S2V 教程 · ComfyUI Wan-Animate-2 博客 · LongCat-Video GitHub · InfiniteTalk GitHub · OmniAvatar GitHub · HunyuanVideo-Avatar GitHub · EchoMimicV3 GitHub · FantasyTalking GitHub
ComfyUI 生态:smthemex/ComfyUI_EchoMimic · vokilook/comfyui-echomimic-setup · rookiestar28/ComfyUI-LongCat-Avatar · kijai/ComfyUI-WanVideoWrapper · ComfyUI PR #10179 · HM-RunningHub/ComfyUI_RH_FlashHead · Wan2GP
sm120 / Blackwell:Rogala/AI_Attention(RTX 5000 系加速包) · woct0rdho/SageAttention · kijai #1875(RTX 5060 修复) · LongCat #141(sm120 警告)
中文 TTS(横评与实测):OpenMOSS/MOSS-TTS 对比表 · VoicePing 中文情感 TTS 基准 · VoicePing 中文数字保真基准 · cosyvoice-docker BENCHMARK(L40S,RTF 0.87) · 托尼不是塔克:CosyVoice3/IndexTTS2 在 5060 Ti 16G 实测 RTF 1.88/2.92 · smeltcore 5060 Ti 配方库 中文 TTS(模型与许可):Fun-CosyVoice3-0.5B-2512 · Qwen3-TTS-1.7B-Base · IndexTTS-2.5 · IndexTTS LICENSE(bilibili 协议原文) · GPT-SoVITS · VoxCPM2 · GLM-TTS · F5-TTS LICENSE(CC-BY-NC) · Fish-Speech LICENSE · ChatTTS LICENSE · VibeVoice-1.5B · Fun-CineForge · OmniVoice(k2-fsa) 中文 TTS(ComfyUI 节点):filliptm/ComfyUI_FL-CosyVoice3 · joyfoxai/ComfyUI-Index-TTS-25 · AICoderTudou/ComfyUI-TD-Qwen3TTS · flybirdxx/ComfyUI-Qwen-TTS · AIFSH/ComfyUI-GPT_SoVITS · nkxx188/ComfyUI-VoxCPM-nkxx · richservo/comfyui-moss-tts · diodiogod/TTS-Audio-Suite(19 引擎) 中文 TTS(sm_120 直击本机的 issue):CosyVoice #1318(5060ti 16g 无法启动) · CosyVoice #1815(PyTorch 2.4+ & RTX50 系 sm_120) · IndexTTS #295(GPU 检测失败) · OmniVoice #155(Blackwell 乱码) · OmniVoice #83(sm_120 shared memory 墙) · flash-attention #2168(sm_120 无内核)
文档生成时间:2026-09-22|范围:2026-09 时点可得公开信息 下载页:http://192.168.31.76:8899/49-数字人选型调研/离线音频驱动数字人模型调研.md?preview=1