# 离线音频驱动数字人口播链路选型（2026-09）

## 场景与硬约束（已收窄）

> **目标场景**：**离线口播 / 说话人视频**。输入 **一张图（或一小段视频）+ 一段中文音频**，输出**口型同步成片**。
> **不需要**实时直播、实时对话、流式交互。
>
> **硬约束**：
> - **必须完全本地、免费、离线**，**不接入任何云端 API**
> - **单张 RTX 5060 Ti 16GB**（Blackwell **sm_120**）+ **32GB 内存** + Ubuntu + **ComfyUI**
>
> **调研时点**：2026-09-22
>
> **数据分级**：🟢 第三方实测 ｜ 🟡 厂商/论文宣称 ｜ 🟨 中文社区个案 ｜ 🔴 未查到（**不编造**）
>
> **本版本相对于初稿的变化**：按新约束**收窄重点到 8 个模型**（Wan2.2-S2V、LongCat-Video-Avatar 1.5、InfiniteTalk、OmniAvatar、HunyuanVideo-Avatar、Wan-Animate-2、EchoMimic V3、FantasyTalking），为每个模型补齐「**显存占用 + 生成速度 + 16GB 能否跑 + 要什么量化 + N 秒视频要多久**」，新增 **sm120/Blackwell 兼容性总表**（§0）与 **中文 TTS 配音选型**（§4）。

---

## 0. 🔴 先读：sm120 / Blackwell 兼容性总表（这比"显存够不够"更容易让项目失败）

RTX 5060 Ti 是 **Blackwell / sm_120（Compute Capability 12.0）**。2025 年编译的绝大多数加速库**没有 sm_120 内核**，装上去不是报错就是静默崩。本机 2026-09-14 已实测确认过一次 GPU 掉总线（4 次全部来自 SageAttention 路径）。

### 0.0 ✅ 本机环境实测（2026-09-22 实拉，非推测）

```
GPU      : NVIDIA GeForce RTX 5060 Ti   capability (12, 0)  → sm_120
torch    : 2.11.0+cu130
CUDA     : 13.0
arch_list: ['sm_75','sm_80','sm_86','sm_90','sm_100','sm_120']   ← 含 sm_120 ✅
triton   : 3.6.0
SageAttn : 2.2.0（源码自建，装于 /home/zyw/SageAttention）
  _fused.so      → sm_75 sm_80 sm_86 sm_89 sm_90 sm_100 sm_120 sm_120a  ← 含 sm_120 ✅
  _qattn_sm89.so → sm_120a                                               ← 含 sm_120 ✅
```

**结论：本机 torch 与 SageAttention 的 sm_120 编译问题已经解决**（不是"缺内核"，源码构建时已带上 12.0）。**但**——woct0rdho 上游实测 **RTX 5060 Ti 上循环调用 SageAttention 约 300~630 次（30~65 秒）后会 GPU 丢失**（[woct0rdho/SageAttention #103](https://github.com/woct0rdho/SageAttention/issues/103)），且有报告 `_sageattn_int8_fp8_nhd` 长序列在 5060 Ti 上**直接掉驱动（GPU is lost，需重启）**而同条件原生 PyTorch 注意力正常（[#391](https://github.com/woct0rdho/SageAttention/issues/391)）。**这正好解释本机 H3 长序列掉总线**。
→ **所以本机的正确策略不是"装不了"，而是"长序列别用"**：**短视频可试 SageAttention 2.2.0，长序列/高分辨率一律 SDPA。**

### 0.1 加速库兼容性总表

| 库 | sm_120 支持状况 | 本机结论 | 来源 |
|---|---|---|---|
| **PyTorch + CUDA** | 50 系最低 **torch ≥2.7 + cu128**；社区与 kijai 一致建议 **torch 2.9.1 + CUDA 13.0**（RTX 5060 报 `CUDA error: no kernel image is available`，换 torch 2.9.1+cu130 后"完美运行"） | ✅ **本机 torch 2.11.0+cu130 已超出要求** | 🟢 [kijai #1875](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1875) ｜本机实拉 |
| **triton** | Blackwell 需 **triton ≥3.3 + torch ≥2.7 + CUDA ≥12.8**；版本须与 torch 配对（2.9.x↔3.5.x；2.10.x↔3.6.x） | ✅ 本机 **triton 3.6.0** | 🟢 [Rogala/AI_Attention](https://github.com/Rogala/AI_Attention) |
| **SageAttention 2.2.0** | ⚠️ **官方/Comfy-Org 预编译 wheel 多数缺 sm120**：`sageattention-2.2.0+cu130torch2.10` 的 `_qattn_sm89.pyd` 只标 sm_80/sm_90a，遇到 GQA 32:8 / head_dim 128 / L=4096 直接 `no kernel image`；只有 `packages/sageattention.yml` 里 **cu130/torch2.9 与 torch2.11 两条矩阵带 `12.0`** | ✅ **本机是源码自建且含 sm_120 cubin**；⚠️ **但长序列会 GPU 丢失**（见 §0.0） | 🟢 [Comfy-Org/wheels #22](https://github.com/Comfy-Org/wheels/issues/22) ｜本机 `strings` 实测 |
| **SageAttention 源码编译** | 🔴 **`TORCH_CUDA_ARCH_LIST="9.0;12.0"` 会编译失败**（`wgmma.fence not supported on sm_120`）→ **必须只写 `12.0`** | ℹ️ 记下来：以后重编只写 `12.0` | 🟢 [SageAttention #291](https://github.com/woct0rdho/SageAttention/issues/291)（维护者 woct0rdho 亲自回复） |
| **SageAttention 3.x** | 🔴 **sm120 上不可信**：① DGX Spark 上 SA3 出**马赛克伪影**且不比 2.2 快（[#321](https://github.com/woct0rdho/SageAttention/issues/321)）② **RTX 5060 Ti + sa3.0** 在 Wan wrapper 复现同样伪影，需强制 `per_block_mean` 才修好 ③ sm120 上 `sageattn_qk_int8_pv_fp8_cuda` 在 **CUDA Graph 重放时静默算错**（[#392](https://github.com/woct0rdho/SageAttention/issues/392)） | ❌ **禁用 sage3**。kijai 口径：「**不要把 sage3 用在 Wan 视频上**，画质损害很大而速度提升有限，就用 sageattn **2.2.0**」 | 🟢 [kijai #1875](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1875) · [SageAttention #321](https://github.com/woct0rdho/SageAttention/issues/321) |
| **2026-09-01 上游新进展** | Comfy-Org `comfy-kitchen-sageattention`（#147/#148）已产出**官方托管 SA2.2.0 wheel**（Py3.12 / **torch 2.13** / CUDA 13.0），`_fused`/`_qattn_sm80`/`_qattn_sm89` **均含 SM120 cubin**，并在 RTX PRO 6000 Blackwell 上 smoke 通过 | ⚠️ **锁 torch 2.13，与本机 2.11 不匹配** → 暂不用；等升 torch 或继续用自建版 | 🟢 comfy-kitchen #147 |
| **FlashAttention FA2** | 默认 arch list **不含 sm_120**，必须显式加 `12.0` 重编；有免编译成功组合：**flash-attn 2.8.0 + Py3.10 + CUDA 12.8 + torch 2.7.1** | ⚠️ **装不上就用 SDPA**（ComfyUI 默认回退），速度损失约 20~40% | 🟢 [flash-attention #2535](https://github.com/Dao-AILab/flash-attention/issues/2535) · [#2016](https://github.com/Dao-AILab/flash-attention/issues/2016) |
| **FlashAttention FA3** | 🔴 **在 sm120 上不可能**：依赖 sm90a 的 `wgmma` 指令，sm120 不支持（"只有企业级 Blackwell 支持"）；相关 issue 从 2025-04 开到 2026 仍无支持（#1757/#1810/#1825/#1609/#1638/#1785） | ❌ **不要碰 FA3** | 🟢 上述 issue |
| **FlashAttention FA4（4.0.0b*）** | ⚠️ 已有 `FlashAttentionForwardSm120` 但 2026 年仍不稳：**RTX 5060 Ti 前向 kernel 运行期编译失败**（[#2453](https://github.com/Dao-AILab/flash-attention/issues/2453)）；5090 上比 FA2 慢约 5%；**sm_120 varlen ≥4 段非法内存访问**（[#2860](https://github.com/Dao-AILab/flash-attention/issues/2860)） | ❌ **不要碰 FA4** | 🟢 上述 issue |
| **xFormers** | 🔴 **sm120 上不可用**：0.0.32 在 Blackwell 消费卡报 `CUDA error: invalid argument`（疑因 FA3 实现不支持 sm120，[#1323](https://github.com/facebookresearch/xformers/issues/1323)）；50 系整体报 kernel 架构不兼容（#1342）；0.0.34 宣称支持 torch≥2.10 但实际装不上（#1374） | ❌ **从依赖里直接划掉**，一律用 SDPA | 🟢 上述 issue |
| **torchcodec / torchvision** | 🔴 LongCat issue #141：新版 torchvision 用 **torchcodec 取代了 `write_video()`**，导致仓库里大量代码跑不起来 | ⚠️ 跑 LongCat 官方脚本时注意 | 🟢 [LongCat #141](https://github.com/meituan-longcat/LongCat-Video/issues/141) |

### 0.1.1 逐模型 × 依赖速查（本机可执行版）

| 模型 | SageAttention | FlashAttention | torch/CUDA | xformers |
|---|---|---|---|---|
| **Wan2.2-S2V** | SA2 2.2.0（本机自建版含 sm120）；**禁 SA3** | 不用（FA2 需自编 12.0；FA3/FA4 不可靠） | ≥2.9.1 + cu130 ✅ 已满足 | ❌ |
| **LongCat-Avatar 1.5** | 未查到明确结论；节点内 `sageattn_3` 是坏的 | 🟢 **官方 issue #141 明确：Blackwell 禁用 FA2** | torch 2.11 + CUDA 12.8+ ✅；⚠️ 新版 torchvision 会打断仓库代码 | ❌ |
| **InfiniteTalk** | 社区多走 SDPA；SA2 须含 sm120 | 不建议 | ≥2.9.1 + cu130（#1875 实证可跑通） | ❌ |
| **OmniAvatar** | 无记录 | 官方依赖 flash-attn（需自编）；有"无 FA 多卡"issue #42 | 常规 | ❌ |
| **HunyuanVideo-Avatar** | 节点当前无（#22 称"以后也许支持"） | 官方锁 **flash-attn 2.6.3，编译失败是高频 issue**（#34/#126/#40）→ **优先 SDPA** | 官方代码是 torch 2.4–2.6 时代，需手动升 | ❌ |
| **Wan2.2-Animate-2** | 同 Wan 系 | 同 Wan 系 | 同 Wan 系 | ❌ |
| **EchoMimic V3** | 节点未接 | 无 | 官方 Py3.10 / CUDA ≥12.1 | ❌ |
| **FantasyTalking** | 有用户请求（#69）未实现 | 🔴 **官方明说必须装 flash_attn，否则结果错误（#13 回复）** → **sm120 上是大坑** | — | ❌ |

### 0.2 本机 ComfyUI 稳定启动参数（勿加 sage attention）

```bash
cd /home/zyw/ComfyUI && setsid nohup env \
  PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:512,expandable_segments:True \
  CUDA_VISIBLE_DEVICES=0 OMP_NUM_THREADS=4 \
  venv/bin/python main.py --listen 0.0.0.0 --port 8189 \
  --lowvram --force-fp16 --reserve-vram 1.0 --fast-disk --cache-lru 20 \
  --preview-method none > /home/zyw/comfyui_8189_opt.log 2>&1 < /dev/null &
```
> 关键：`--force-fp16 --reserve-vram 1.0`；**默认不加 `--use-sage-attention`**。若某个模型确认收益明显且序列不长，可临时开启并盯住日志；**一旦出现 GPU 掉总线立刻回退 SDPA**。

---

## 1. 一分钟结论

### 1.1 16GB 单卡能跑什么（8 个重点模型）

| 模型 | 16GB 能否跑 | 要什么量化 | 10 秒视频大约要多久 | 一句话 |
|---|---|---|---|---|
| **EchoMimicV3-Flash-pro** | ✅ **能，官方验证过 16G(V100) + 官方实测耗时** | 无重量化；**768×512 + `block_offload`** | 🟢 **官方口径：5 秒视频 7 分钟**（量化版，12GB 显存）→ **10 秒约 14 分钟** | **首选**：原生中文 + 官方 16G 档位 + **官方实测耗时** + Apache-2.0 |
| **Wan2.2-Animate-2** | ✅ **能（本机型唯一有逐秒实测）** | **INT8_convrot 部分卸载**（7.3GB 显存）/ GGUF Q4_K_M 10.56 GiB | 🟢 **实测：49 帧 @480×854 = 126.8 秒**（10 步）→ 按 25fps 算 49 帧≈2 秒，**10 秒约 10 分钟** | ❌ **但它是"图+驱动视频"，不吃音频** → 场景不匹配 |
| **InfiniteTalk** | ✅ **能**（5080 16GB 实测 + **5060 16GB 跑通**） | **GGUF Q4_K_M 底座(11.34GB) + patch Q4(1.4GB)** + block swap 30~40 | 🟢 **5080 16GB：640×640 5 秒 = 1300 秒** → **10 秒约 43 分钟** | ComfyUI 有**官方核心节点**；但 **3 分钟视频吃 >120GB 内存** |
| **LongCat-Video-Avatar 1.5** | ✅ **能**（3060 12GB GGUF Q4 已跑通） | **INT8 14.81 GiB** 或 **GGUF Q4_K_M 11.24~12.07 GiB** + `block_num=1` + 全 offload CPU | 🟢 **480p 44 秒视频 ≈ 2 小时**（GB10）→ **10 秒约 27 分钟起** | 能力最全（MIT/多人/长视频）但**有未修缺陷** |
| **HunyuanVideo-Avatar** | ⚠️ **推断偏不可行** | Wan2GP int8 13.41GB / GGUF Q4 7.42 GiB | 🟢 5090 未优化 30 步≈30 分钟；3090 112.32 s/it | **成功案例全带 96–192GB RAM，本机 32GB 大概率不够**；许可排除 EU/UK/KR |
| **Wan2.2-S2V-14B** | ❌ **不推荐** | 理论：GGUF Q4_K_M 12.91 GiB + T5 全 CPU | 🟡 L40S 48GB：5 秒 ≈20 分钟；4×64GB：720P 10 秒 ≈1 小时 | 官方门槛 **≥80GB**；**失败模式 = 走共享内存后慢到必须中止** |
| **OmniAvatar-14B** | ❌ **不可用** | 无任何官方/社区量化档 | 🟢 H100 SXM：3 秒音频/25 步 >7 分钟 | 官方称**需 64GB 内存**；本机 32GB 不够 |
| **FantasyTalking** | ❌ **不可行（有 5070 Ti 16GB 失败报告）** | 社区 GGUF **明确失败并归档** | 🟢 A800 40G：**30 秒视频 = 1 小时**；1 分钟音频 **>19 小时** | 官方最低档 20GB；**且官方要求必须装 flash_attn（sm120 大坑）** |

### 1.2 完整离线口播链路（推荐方案）

```
中文文案
   ↓  ① TTS 配音（本机 16GB 内，见 §4）
GPT-SoVITS v2ProPlus       ← MIT｜RTF 0.028（4060 Ti）｜sm_120 最不易踩坑｜5s 克隆/few-shot 微调
   （升级档：IndexTTS-2.5 八维情感控制 / Qwen3-TTS-1.7B 质量上限）
   ↓  ② 音频驱动口型（本机 16GB 内，见 §3）
EchoMimicV3-Flash-pro      ← Apache-2.0｜transformer 仅 3.47GiB｜768×512 + block_offload
   ↓  ③（可选）口型精修
LatentSync 1.5（最低 8GB，官方明示改善中文）
   ↓
成片（25fps，口型同步）
```

> **三步全在本机 16GB 内、全部 Apache-2.0、总权重 < 12 GiB（不含可选的 LatentSync）。**
> 两个模型**分时复用**显存即可（本机 ComfyUI 已是 `--lowvram` 档，TTS 只占 ~2GB）。

### 1.3 三条必须记住的结论

1. **32GB 内存比 16GB 显存更容易先爆**——三个已证实案例：InfiniteTalk 3 分钟视频需 **>120GB 内存**；OmniAvatar 官方称**需 64GB 内存**；LongCat 1.5 的 720p 实测 **35.3GB RAM**。→ **长音频必须切段（建议每段 ≤20 秒）落盘再续接。**
2. **sm120 上先解决软件栈，再谈模型选择**——torch ≥2.9.1 + CUDA ≥13.0、只装标注 sm120 的 SageAttention wheel、**禁用 SageAttention 3**、装不上 flash-attn 就用 SDPA。
3. **8 个模型里真正"官方+第三方双证据支持 16GB"的只有 EchoMimicV3 和（近似）SoulX-FlashHead**；其余要么靠第三方量化硬压、要么根本没有成功案例。

---

## 2. 8 个重点模型 16GB 速查总表（含各精度体积）

> 体积口径：**官方原始权重**与**量化档**分别列出。「显存」列给的是**实测/社区报告的峰值占用**，「速度」列**必须与 GPU 型号一起看**。

| 模型 | 参数量 | bf16/fp16 权重 | fp8 / INT8 | GGUF | 实测峰值显存 | 实测速度（GPU+分辨率） | 16GB 判定 |
|---|---|---|---|---|---|---|---|
| **EchoMimicV3-Flash-pro** | **1.3B** | transformer **3.47 GiB** | 无 | 无（不需要） | 🟢 默认 768 档 **33,726 MiB**（L40S）／🟡 官方低显存档 **6.5 GB @768×512**／🟢 官方量化档另测到 43,434 MiB（talking head）、63,248 MiB（half body） | 🟢 **官方量化版（`app_mm.py`）：最低 12GB 显存，5 秒视频 7 分钟**（作者本人回复）／L40S 3.63s 音频 251.94 s／🟢 未量化 10s 音频 ≈12 分钟（4090） | ✅ **官方测试 GPU 含 V100 16G**；⚠️ 但有 **RTX 5090 量化版跑不通**的未回复 issue（疑似 sm120） |
| **InfiniteTalk** | patch **2.487B** + 底座 Wan2.1-14B（14.289B DiT） | patch **9.948 GB**(fp32)／Kijai fp16 **5.125 GB**／`comfyui/` 版 **2.53 GiB** | Kijai fp8_scaled **2.714 GB**；全模型 fp8/int8 档各 **19.5 GiB** | patch **Q4_K_M 1.403 / Q6_K 2.044 / Q8 2.646 GB**；底座 Q4_K_M **11.34 / Q5_K_M 12.74 / Q8_0 18.14 GB**；fp8 底座 **16.64 GB** | 🟢 **RTX 5080 16GB 可跑**；🟢 L40 48GB **28 GB** | 🟢 **RTX 5080 16GB：640×640 5 秒 = 1300 秒**（20 block swap+SA+compile）／🟢 4090 未量化 10s/480p = **40 分钟**／🟢 4090 + FusionX 8步+TeaCache **10s ≈ 15 分钟**（2026-09）／🟢 3090 832×480 ≈30 s/秒视频／🟢 8GB 只能跑 81 帧 | ✅ **可跑**（5080 16GB 实测 + **RTX 5060 16GB 在 torch 2.9.1+cu130 后跑通**）；⚠️ **4070 Super 12GB OOM** |
| **LongCat-Video-Avatar 1.5** | **13.6B** | **29.5 GiB**（6 shard） | 官方 **INT8 14.81 GiB**（4 shard） | 社区 Q8 17.77 / Q6 14.42 / **Q4_K_M 11.24~12.07** / Q3_K_M 9.22 / Q2_K 7.77 GiB | 🟢 H200 单卡 **46,827 MiB**；🟢 GB10 `block_num=1` **8 GB VRAM + 16 GB RAM**；🟢 **720p 28,040 MiB + 35.3 GB RAM** | 🟢 3.63s 音频 → **233.08 s**（H200）／🟢 **480p 44 秒视频 ≈ 2 小时**（GB10）／🟢 4090D 480p/10步/105帧 **≈60 s/it** | ✅ **可跑**（**3060 12GB GGUF Q4 已跑通**、3090 24GB fp8+block swap 跑通）；⚠️ 16GB 无本人实测 |
| **Wan2.2-Animate-2-14B** | **14B** | **30.54 GiB**（base/distill 各一） | **INT8_convrot 15.51 GiB** | TURBO 蒸馏版 Q8_0 16.90 / Q6_K 13.25 / Q5_K_M 11.87 / **Q4_K_M 10.56** / Q4_K_S 9.72 / Q3_K_M 8.00 / Q2_K 6.05 GiB | 🟢 **RTX 5060 Ti 16GB：distill int8_convrot 部分卸载 ≈7.3 GB 显存 / 8.6 GB 内存** | 🟢 **RTX 5060 Ti 16GB：官方 `video_wan_animate2_distilled` 动作迁移图，10/10 步、49 帧 @480×854 = 126.8 秒** ← **本次唯一拿到本机型逐秒实测的模型**；🟢 上一代 Animate-14B：A800 480P/20步 替换模式 10.76 s/it | ✅ **能跑**；但 ❌ **它不吃音频**（输入是参考图+驱动视频），**与口播场景不匹配** |
| **Wan2.2-S2V-14B** | **14B** | DiT **≈30.35 GiB**（4 shard）+ T5 **10.58 GiB** + wav2vec 1.18 + VAE 0.47 | ComfyUI 官方 **fp8_scaled 15.27 GiB**；Kijai fp8 16.65 GB | **Q8_0 18.27 / Q6_K 15.10 / Q5_K_M 13.97 / Q4_K_M 12.91 / Q4_K_S 12.07 / IQ4_XS 11.32 / Q2_K 8.86 GiB** | ⚪ **未查到任何消费级卡峰值显存** | 🟡 L40S 48GB：**5 秒视频 ≈20 分钟**（含约 10 分钟编译+加载）；🟡 4×64GB 卡跑 720P **每 10 秒 ≈1 小时**；🟢 H200 3.8 秒 → 780 秒 | ❌ **官方要求 ≥80GB**；⚪ **无 16GB 成功案例**；已知 16GB 失败模式 = 显存填满→走共享内存→慢到必须中止 |
| **HunyuanVideo-Avatar** | **13B**（Wan2GP 定义） | **30.51 GB**（官方）+ 文本编码器 16.76 GB | 官方 fp8 **24.85 GB**；Wan2GP int8 **13.41 GB** | 社区实验版（**ComfyUI 不支持**）Q2_K 4.86 / **Q4_K_M 7.42** GiB | ⚪ **未查到 16GB 实测** | 🟢 **5090 未优化：30 步 ≈30 分钟**（≈60 s/it）／🟢 3090+CPU offload+fp8：704px/129帧 **112.32 s/it**（50 步 1h33m 后 OOM）／🟢 4090 24GB+**128GB RAM** 走 ComfyUI 节点：**采样前要等 30+ 分钟预热**／🟢 3060 12GB 在 Wan2GP 跑通 | ⚠️ **推断偏不可行**：int8 13.41GB 会被 pin 进内存（实测 pin 12,785 MB），而**成功案例全带 96/97/192GB RAM**，本机仅 32GB |
| **OmniAvatar-14B** | **14B** | LoRA+音频权重 **1.238 GB**（底座 Wan2.1-T2V-14B） | ⚪ **无 fp8/int8/GGUF** | ⚪ **无** | 🟢 第三方 **24GB VRAM + 31.3GB RAM 加载即 OOM** | 🟢 官方 A800：bf16 不限 **36G/16.0 s/it**；7B 常驻 **21G/19.4 s/it**；全 offload **8G/22.1 s/it**；🟢 A800×4 fsdp **4.8 s/it**；🟢 **H100 SXM 3 秒音频/25 步 >7 分钟；19 秒音频/50 步 >1 小时**；🟢 单 B200 5.2 s/it | ❌ 官方称**需 64GB 内存**，本机 32GB 不够 |
| **FantasyTalking** | **14B**(Wan2.1-I2V) + 适配器 **1.68 GB** | 适配器 fp16 1.68 GB | ⚪ 无 | 🔴 社区 GGUF **明确失败并归档** | 🟡 官方 A100 表：**40G / 20G / 5G** 三档 | 🟡 官方 A100：**15.5 / 32.8 / 42.6 s/it**（对应 40G/20G/5G）／🟢 **A800 40G：30 秒视频 = 1 小时**／🟢 另一用户 **1 分钟音频 >19 小时** | ❌ **有 RTX 5070 Ti 16GB 明确失败报告**（"Doesn't work with 16GB VRAM"）；RTX 5090 32GB 最小设置也 OOM |

---

## 2.5 🟢 16GB 级显卡实测清单（本次挖到的全部，逐条可查）

> 这一节回答"**别人在 16GB 卡上到底跑通了什么**"——比任何厂商宣称都实在。

| 显卡 | 模型 | 实测结果 | 来源 |
|---|---|---|---|
| **RTX 5060 Ti 16GB**（本机型） | **Wan2.2-Animate-2** | distilled `int8_convrot` 部分卸载 **≈7.3 GB 显存 / 8.6 GB 内存**；49 帧 @480×854 **126.8 秒** | [ComfyUI-MultiGPU #219](https://github.com/pollockjj/ComfyUI-MultiGPU/issues/219) |
| **RTX 5060 Ti 16GB** | **InfiniteTalk** | ✅ **跑通**（Wan wrapper；升级到 **torch 2.9.1 + cu130** 后成功） | [kijai #1875](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1875) |
| **RTX 5060 Ti 16GB** | SageAttention 2.2.0 | 🔴 官方 cu130/torch2.10 wheel **缺 sm_120 内核** → `cudaErrorNoKernelImageForDevice`（**本机是源码自建版，已含 sm_120**） | [Comfy-Org/wheels #22](https://github.com/Comfy-Org/wheels/issues/22) |
| **RTX 5060 Ti 16GB** | SageAttention **3.0** | 🔴 在 Wan wrapper 出**马赛克伪影**，需强制 `per_block_mean` 才修好；自述"SA3 与 2.2 速度接近" | [SageAttention #321](https://github.com/woct0rdho/SageAttention/issues/321) |
| **RTX 5060 16GB** | **Wan2.2 通用** | ✅ 原生 ComfyUI 用 **GGUF Q4_K_M + fp8 文本编码器稳定出 121 帧 @720×960**（同参数下 kijai wrapper 超 480×640 就 OOM） | [kijai #1805](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1805) |
| **RTX 5080 16GB** | **InfiniteTalk** | 640×640 **5 秒 = 1300 秒** | [kijai #1185](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1185) |
| **RTX 5070 Ti 16GB** | **FantasyTalking** | 🔴 **明确失败**（"Doesn't work with 16GB VRAM"） | [FantasyTalking #37](https://github.com/Fantasy-AMAP/fantasy-talking/issues/37) |
| **RTX 5070 Ti 16GB** | MiniMaxH3 + SageAttention patch | 🔴 **在 sm120 崩** | KJNodes #736 |
| **RTX 4070 Ti 16GB + 32GB RAM** | **HunyuanVideo-Avatar** | ⚪ 提问**无人回复** | [HYA #70](https://github.com/Tencent-Hunyuan/HunyuanVideo-Avatar/issues/70) |
| **RTX 4070 Super 12GB** | InfiniteTalk | 🔴 **OOM** | [kijai #1186](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1186) |
| **RTX 3060 12GB** | **LongCat-Avatar 1.5** | ✅ 用 **GGUF Q4_K_M** 跑通（需升级 WanVideoWrapper nightly） | [kijai #1780](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1780) |
| **RTX 3060 12GB** | HunyuanVideo-Avatar | ✅ 在 **Wan2GP** 里跑通 | Wan2GP #508 |
| **RTX 3090 24GB** | LongCat-Avatar 1.5 | ✅ fp8 + block swap 可跑（832×480/10 步出片正常） | [kijai #1780](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1780) |
| **RTX 4090 24GB** | HunyuanVideo-Avatar | ⚠️ ComfyUI 节点**采样前要等 30+ 分钟**预热；需 128GB RAM | smthemex #15 |
| **RTX 4090 24GB** | EchoMimic V3 | 未量化 10 秒音频 ≈12 分钟 | echomimic_v3 |
| **RTX 5090 32GB** | **EchoMimic V3 量化版** | 🔴 **跑不通**（2025-12-31，0 回复，**疑似 sm120**） | [echomimic_v3 #62](https://github.com/antgroup/echomimic_v3/issues/62) |
| **RTX 5090 32GB** | HunyuanVideo-Avatar | 未优化 30 步 ≈ **30 分钟** | HYA #61 |
| **RTX 5090 32GB** | FantasyTalking | 🔴 最小设置 **OOM** | [FantasyTalking #17](https://github.com/Fantasy-AMAP/fantasy-talking/issues/17) |

### 从这张表能读出的三条规律

1. **"16GB 能跑"与"16GB 跑得动"是两回事**——InfiniteTalk、LongCat、Wan-Animate-2 **都能跑**，但**只有 Wan-Animate-2 给出了可接受的速度（49 帧 127 秒）**，而它偏偏**不吃音频**。
2. **12GB 卡在 InfiniteTalk 上直接 OOM，而 16GB 能跑** → **16GB 是 Wan 系 14B 的最低可用门槛**，本机刚好卡在门槛上，**没有任何余量做"同时加载两个模型"**。
3. **sm120 的真实风险不是"报错"而是"静默出错或掉驱动"**：EchoMimic 在 5090 上"跑不通且无人解答"、SageAttention 3 出马赛克、5060 Ti 上 SageAttention 循环 300–630 次后 GPU 丢失。**本机做任何验证都要盯日志 + 小规模先跑。**

---

## 3. 8 个重点模型逐个深析

### 3.1 🥇 EchoMimic V3 / V3-Flash（蚂蚁集团 Alipay，AAAI 2026）

| 项 | 数据 |
|---|---|
| 发布方 | **蚂蚁集团 Alipay 终端技术部**（论文署名 *Terminal Technology Department, Alipay, Ant Group*；⚠️ 网传"复旦"在论文与仓库中**无出处**） |
| 会议 / 论文 | **AAAI 2026**（2025-11-09 录用）｜arXiv **2507.03905** |
| 时间线 | 论文 2025-07-08 → 代码+权重 **2025-08-08** → 12G 显存 GradioUI **2025-08-12** → **ComfyUI 16G 跑通 2025-08-12** → **V3-Flash（8 步 / 12G / 768×768）2026-01-22** → 仓库最后提交 **2026-03-18** |
| 参数量 / 体积 | **1.3B**；`echomimicv3-flash-pro/diffusion_pytorch_model.safetensors` **3.47 GiB**；`transformer/...` 3.18 GiB；另需 `clip_vision_h` 1.26 GB、`umt5_xxl_fp8` 6.74 GB、`Wan2.1_VAE` 0.51 GB |
| 许可证 | **Apache-2.0**（官方原文："licensed under the Apache 2.0 License. We claim no rights over your generated contents"） |
| GitHub | **1,061 ★** / 128 fork（2026-09-22） |

**🟢 显存（官方给了可直接照抄的档位）**

| 版本 | 分辨率 | 显存 | 步数 | 条件 |
|---|---|---|---|---|
| V3（preview） | 768×768 | **12 G** | 8 步 | 官方 GradioUI `app_mm.py` |
| V3（preview） | — | **8 G+** | — | mmgp，`partial_video_length=65 或 33` |
| **V3-Flash-pro** | **768×768** | **12 G** | **8 步** | 无需 Face Mask |
| **V3-Flash-pro** | **768×512** | **6.5 G** | 8 步 | **需开 `block_offload`** |
| **官方测试过的 GPU** | — | **A100 80G / RTX 4090D 24G / V100 16G** | — | 🟢 **官方把 16GB 写进了测试列表** |

**🟢 ComfyUI 节点作者给的本机参数**（[smthemex/ComfyUI_EchoMimic](https://github.com/smthemex/ComfyUI_EchoMimic)，实测环境 12G VRAM）：
> * V3 正式上线，测试环境 **12G VRAM**，OOM 需减少视频分块 `partial_video_length`：**12G 可以跑 65，16 可以试试 97**，更高可以试试 113
> * v3 flash：**12G、8 步可以推理 768×768**；**6.5G 可以推理 768×512**（需开 `block_offload`）
> * "need **8G and more**（use mmgp, LOW LOW, `partial_video_length==65` or 33）"

→ **本机（16GB）的档位 = `partial_video_length = 97` + 768×512 + `block_offload=on`。**

**🟢 速度（这是 8 个模型里唯一有官方实测耗时的）**
- 🟢 **官方量化版（`app_mm.py`）作者本人回复：最低 12GB 显存，5 秒视频 7 分钟**（[issue #21](https://github.com/antgroup/echomimic_v3/issues/21)）→ **10 秒 ≈ 14 分钟**
- 🟢 第三方横评（L40S）：3.63 秒音频 → **251.94 秒**（480×848@25fps，8 步）→ 10 秒 ≈ 10~12 分钟
- 🟢 未量化 10 秒音频 5 步：talking head **43 GB / 3 分钟**；half body **63 GB / 12 分钟**（[issue #16](https://github.com/antgroup/echomimic_v3/issues/16)）
- 🟢 未量化 10s 音频 ≈12 分钟（RTX 4090）
- 🟡 第三方一键脚本（[vokilook/comfyui-echomimic-setup](https://github.com/vokilook/comfyui-echomimic-setup)，Ubuntu 22.04/24.04/26.04 + **CUDA 13**）写 **"NVIDIA 12+ GB VRAM（推荐 24 GB）" + 32+ GB 内存 + ~20 GB 磁盘**
- 🟢 **3090 也会 OOM**（[issue #47](https://github.com/antgroup/echomimic_v3/issues/47)）→ 说明**不做低显存调参会翻车**
- ⚪ **未查到 5060 Ti / sm_120 上的实测秒数**
- ⚠️ **🔴 sm120 警告**：[issue #62](https://github.com/antgroup/echomimic_v3/issues/62)（2025-12-31，**0 回复**）报告 **RTX 5090 32GB 用官方量化版也跑不通** —— **疑似 sm120 问题，截至本次调研无人解答**。本机是 5060 Ti（同为 sm120），**这是 EchoMimic 在本机的最大未知数，必须先小规模验证**。

**✅ 中文（8 个模型里最强）**
- **Flash-pro 专用音频编码器是 `chinese-wav2vec2-base`**（腾讯 GameMate）→ **原生中文音频前端**（preview 版才用英文 `wav2vec2-base-960h`）
- README 有专门的 **"Chinese Driven Audio"** 演示区（4 个中文示例）
- 论文宣称 "achieves **superior Chinese lip-sync accuracy**"

**加速手段**：TeaCache（`teacache_threshold` 推荐 **0~0.1**，横评称提速 1.5× 且质量无损）｜LightX2V LoRA（10 步）｜LCM（4 步自动开启）

**ComfyUI 两条路径**：① [smthemex/ComfyUI_EchoMimic](https://github.com/smthemex/ComfyUI_EchoMimic)（**官方 README 亲自致谢推荐**；支持 V1/V2/V3 + V3-Flash；`lowram=False` 可关 mmgp FP8 换质量）② [havvk/ComfyUI_AIIA](https://github.com/havvk/ComfyUI_AIIA)（默认开 TeaCache、自动检测 FlashAttention 2、支持流式；**该仓库明确写了"修复了唇形漂移问题"**）

**长视频**：README 原文 *"**Long video generation**: If you want to generate a video longer than 138 frames, you can use **Long Video CFG**"*；论文消融证明它有效——`w/o Long Video CFG` 的 FVD 从 496.76 恶化到 **530.21**

**🔴 坑**
1. **厂商口径（12G/6.5G）与第三方默认配置实测（33,726 MiB）差距巨大** → **不调参在 16GB 上必 OOM**。必须：Flash-pro + `block_offload=on` + `partial_video_length=97` + TeaCache。
2. 依赖 `retina-face==0.0.17`（**须外网下载**）、`mmgp`、`tensorflow==2.15.0`（版本敏感）；ffmpeg 报错要 `pip uninstall ffmpeg && pip install ffmpeg-python`。
3. **同名文件坑**：ComfyUI 目录里 `diffusion_pytorch_model.safetensors` **有两个同名文件**（Wan2.1-Fun 的 3.13G vs EchoMimicV3 的 transformer）→ **放错位置会静默加载错权重**。
4. 1.3B 主干上限：第三方横评称"嘴部和身体动作比 LongCat 更细腻，但**全帧变化干扰较少**"（偏静态口播）。
5. **❌ 不支持多人对话**；⚪ 5060 Ti 无实测。

**🎯 16GB 结论**：✅ **能跑，且是本场景首选。** 官方测试过 V100 16G；用 **768×512 + `block_offload` + `partial_video_length=97`**；**10 秒中文口播预期 10~12 分钟**（需自测）。

---

### 3.2 ⚠️ LongCat-Video-Avatar 1.5（美团，2026-05-21）

| 项 | 数据 |
|---|---|
| 发布方 | 美团 LongCat 团队｜**1.5 首发 2026-05-21**（1.0 为 2025-12-16）｜技术报告 arXiv **2605.26486** |
| 参数量 | **13.6B** dense DiT；1.5 音频编码器换为 **Whisper-large-v3** |
| 许可证 | **MIT（模型权重 + 代码均可商用）**——**8 个模型里最干净的授权** |
| GitHub | **8,375 ★** / 1,491 fork（2026-09-22） |
| 语言 | HF 模型卡 **`language: [en, zh]`**（中英双语） |

**各精度体积**

| 版本 | 文件 | 体积 |
|---|---|---|
| **1.5 bf16（官方）** | `base_model/*` 6 shard | **29.5 GiB（≈31.71 GB）** |
| **1.5 INT8（官方，`--use_int8`，仅 1.5 支持）** | `base_model_int8/*` 4 shard | **14.78 GiB（≈15.89 GB）** |
| 1.5 distill LoRA（**1.5 强制需要**） | `lora/dmd_lora.safetensors` | 2.52 GB（ComfyUI 打包版 1.26 GB） |
| 1.5 Whisper-large-v3 | `whisper-large-v3/model.safetensors` | 3.09 GB |
| 共享（LongCat-Video 仓） | UMT5 text_encoder 5 shard + VAE | 22.73 GB + 0.51 GB |
| **社区 GGUF** | Q8_0 / Q6_K / **Q5_K_M** / **Q4_K_M** / Q3_K_M / Q2_K | **17.77 / 14.42 / 12.78 / 11.24 / 9.22 / 7.77 GiB** |
| 社区 INT8 单文件 | `smthem/LongCat-Video-Avatar-1.5-merge` | 15.88 GB |

**🟢 显存与速度实测**

| 数据 | GPU | 来源 |
|---|---|---|
| 第三方横评：单卡（`context_parallel_size=1`）**峰值 46,827 MiB**，3.63 秒音频 **233.08 秒**，480×832@25fps | H200 | 🟢 [Tight Studio 2026-08-23](https://tight.studio/zh-cn/blog/open-source-talking-avatar-models/) |
| 官方示例**全部是 2 卡** `--nproc_per_node=2 --context_parallel_size=2`；**官方从未声明最低显存** | — | 🟡 README |
| **`block_num=1` + 全 offload CPU：8 GB VRAM + 16 GB RAM；但 480p 的 44 秒视频耗时约 2 小时**；默认预设吃满 **37 GB VRAM + 35 GB RAM 导致系统崩溃** | GB10（128GB 统一内存） | 🟢 [ComfyUI-LongCat-Avatar issue #2](https://github.com/rookiestar28/ComfyUI-LongCat-Avatar/issues/2) |
| **720p：28,040 MiB VRAM + 35.3 GB RAM** → **本机 32GB 内存也会被击穿** | GB10 | 🟢 同上 |
| 480p / 10 步 / 105 帧 **≈60 s/it** | RTX 4090D | 🟢 [kijai #1806](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1806) |
| fp8 + block swap 可跑（24GB）；**GGUF Q4_K_M 在 3060 12GB 上可跑**（需升级 WanVideoWrapper nightly） | 3090 24GB / 3060 12GB | 🟢 [kijai #1780](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1780) |
| 🟡 官方效率宣称：DMD 蒸馏 50 步→8 步，"**生成 10 秒视频仅需约 1 分钟**"（**未注明 GPU 型号**） | 未标 | 🟡 美团博客；⚠️ 与第三方 H200 实测（3.63s→233s）**严重矛盾，不可用作 16GB 预期** |

**ComfyUI**
- **专为 1.5 写的节点包**：[rookiestar28/ComfyUI-LongCat-Avatar](https://github.com/rookiestar28/ComfyUI-LongCat-Avatar)（MIT，9 节点，**有 12GB 显存配方**，2026-08-09 在 ComfyUI Core 0.31.0 验证）；支持 `official_int8_sharded`、`block_num` 流式、`offload_device=cpu`
- **🔴 该节点不支持 GGUF / FP8 / FP16 运行时精度**（只有 bf16 与 INT8 两种权重模式）
- kijai wrapper 也支持（有 GGUF），但**多人在 kijai 那边是坏的**
- **25 fps 是硬约束**（官方验证：非 25fps 会造成"lip sync 与 motion timing 不稳定"）

**✅ 能力**：原生 **多人对话**（multi-stream audio，`audio_type=para`/`add`）｜原生**长视频续写**（首窗 93 帧，后续 +80 帧，重叠 13 帧）｜480p(480×832)/720p(768×1280)@25fps｜8 步蒸馏

**🔴 坑（这就是它不该当首选的原因）**
1. **v1.5 有官方承认但长期未修的质量缺陷**：[issue #120「Excessive facial expression and motion in v1.5」](https://github.com/meituan-longcat/LongCat-Video/issues/120)（2026-05-30 起）——嘴动过大、头部动作不自然、**逐帧累积导致面部漂移**。官方 2026-06-16："**夸张表情已修复，但唇色累积还在弄**……**已发布的模型还没有更新**"；用户 2026-07-02 / 07-13 / **08-19** 三次追问，**无答复** → **修复版至今未发布**。另有 [issue #130](https://github.com/meituan-longcat/LongCat-Video/issues/130)（口型过夸张）独立复现。社区 workaround：`dmd_lora` 的 **`multiplier` 从 1.0 降到 0.1**。
2. **🔴 sm_120 专项警告**：[issue #141](https://github.com/meituan-longcat/LongCat-Video/issues/141)（**2026-08-26**）——Blackwell/GB 架构**不要用 FlashAttention2**；**torch 2.6/2.8 无法 build（最高支持 sm_90）**，需 torch 2.11 + CUDA 12.8+；新版 torchvision 用 torchcodec 取代 `write_video()`，**仓库里大量代码跑不起来**。
3. ComfyUI 节点的 **`sageattn_3` 是坏的**（LongCat varlen cross-attention 未接完），只能用 `sageattn` → 在 sm120 上正好是雷区 → **建议直接用 `sdpa`**。
4. 社区仍在求量化版：[issue #146](https://github.com/meituan-longcat/LongCat-Video/issues/146)（**2026-09-18**）"We really need quantized model for it"。
5. 社区反馈**长视频约 25~30 秒后开始出现伪影**（官方开发者称 480p 推理过 10 分钟无明显色偏，更长没测）。

**🎯 16GB 结论**：⚠️ **能跑，但只能 480p + 量化 + `block_num=1` + 全 CPU offload。**
- **推荐配置**：**GGUF Q4_K_M（11.24 GiB）** 或 **官方 INT8 sharded（14.78 GiB）** + `block_num=1`（**千万别用 0**）+ VAE/文本编码器全 offload CPU + 8 步 + text/audio CFG 1.0 + **480p（不要碰 720p）** + 短片段
- **预期速度：480p 的 10 秒视频约 30 分钟 ~ 2 小时**（按 GB10 实测 44 秒 ≈ 2 小时外推；5060 Ti 算力弱于 GB10，可能更慢）
- **不建议作为首选**（未修缺陷 + sm_120 麻烦 + 速度），但它是**唯一 MIT + 支持多人对话 + 支持长视频**的选项，值得作为中期实验对象。

---

### 3.3 ⚠️ InfiniteTalk（MeiGen-AI / 美团）

| 项 | 数据 |
|---|---|
| 发布方 | 美团 MeiGen-AI（+ 中科院大学 / NLPR-CASIA / 港科大 / 中山大学） |
| 首次开源 | **2025-08-19**（arXiv 2508.14033，与 MultiTalk 为同源，MultiTalk 是 NeurIPS 2025） |
| 许可证 | **Apache-2.0（可商用）** |
| GitHub | **7,901 ★** / 1,365 fork（2026-09-22）；主仓库代码实质停更 2025-09，**2026 年推进全在 ComfyUI 官方核心 + 社区 wrapper**（wrapper 最后 push 2026-05-24） |
| 架构 | patch **2.487B 参数** + 底座 **Wan2.1-I2V-14B-480P**（DiT **14.289B** 参数） |

**各精度体积（必须同时装 patch + 底座）**

| 组件 | 格式 | 体积 |
|---|---|---|
| InfiniteTalk patch | fp32 `single/infinitetalk.safetensors` | **9.948 GB** |
| | Kijai fp16 | 5.125 GB |
| | Kijai fp8_scaled | 2.714 GB |
| | **GGUF Q4_K_M / Q6_K / Q8** | **1.403 / 2.044 / 2.646 GB** |
| | `comfyui/infinitetalk_single.safetensors`（F8_E4M3 混合） | 2.713 GB |
| 底座 Wan2.1-I2V-14B-480P | **fp8_e4m3fn_scaled（Kijai）** | **16.64 GB** ⚠️ **单文件已超 16GB** |
| | GGUF **Q4_K_M** / Q5_K_M / Q6_K / Q8_0 / bf16 | **11.34 / 12.74 / 14.23 / 18.14 / 33.28 GB** |
| T5 文本编码器 | fp16 / fp8 | 11.37 / **6.74 GB**（**必须 offload 到 CPU**） |
| 音频编码器（中文） | `wav2vec2-chinese-base_fp16` | **0.19 GB** |

**🟢 速度实测（全部来自公开 issue）**

| GPU | 实测 | 来源 |
|---|---|---|
| **RTX 4090 24GB** | 未量化/无 LoRA：**10 秒 480p 用 40 分钟**；8 秒默认 40 步 = **3h56m** | [InfiniteTalk #210](https://github.com/MeiGen-AI/InfiniteTalk/issues/210) / [#187](https://github.com/MeiGen-AI/InfiniteTalk/issues/187) |
| **RTX 4090 24GB** | **2026-09-15 最新：FusionX 8 步 + TeaCache + streaming，10 秒 ≈ 15 分钟** | [同上](https://github.com/MeiGen-AI/InfiniteTalk/issues/210) |
| **RTX 5080 16GB** | **640×640，5 秒 = 1,300 秒**（20 block swap + Sage + compile） | [kijai #1185](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1185) |
| RTX 3090 24GB | 832×480 约 **30 秒/秒视频**（10 秒 ≈ 5 分钟） | [kijai #1185](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1185) |
| L40 48GB | 40 秒 480×832 用 16 分钟，**峰值 28 GB** | [kijai #1229](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1229) |
| H100 80GB | 15 秒"最好情况 10 分钟"；**加卡不提速** | 同上 |
| **8GB VRAM** | **Wan2GP 作者亲测：仅 81 帧（≈3.4 秒）可跑** | [InfiniteTalk #25](https://github.com/MeiGen-AI/InfiniteTalk/issues/25) |
| **RTX 5060 16GB** | 🟢 **跑通**（Wan wrapper，升级到 **torch 2.9.1 + cu130** 后成功） | [kijai #1875](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1875) |
| **RTX 4070 Super 12GB** | 🔴 **OOM** | [kijai #1186](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1186) |
| A800 | fp8/int8 量化档**反而慢 2.6 倍**（5 小时 vs 1.3 小时） | [InfiniteTalk #18](https://github.com/MeiGen-AI/InfiniteTalk/issues/18) |

**ComfyUI（最大优势）**
- **ComfyUI 官方核心已内置原生节点 `WanInfiniteTalkToVideo`**——kijai 提交的 [Comfy-Org/ComfyUI PR #10179](https://github.com/Comfy-Org/ComfyUI/pull/10179) **2026-01-22 合并**；代码在 `comfy_extras/nodes_wan.py`，内部复用 `comfy/ldm/wan/model_multitalk.py`
- **原生支持 `two_speakers` 模式** → 原生多人对话
- 官方工作流：[comfy.org 官方 InfiniteTalk 工作流](https://comfy.org/zh/workflows/video_wan2_1_infinitetalk-b95499a55c9f/)
- **🟢 kijai 官方示例工作流默认参数**：底座 `wan2.1-i2v-14b-480p-Q8_0.gguf`(18.14GB) + patch `Wan2_1-InfiniteTalk_Single_Q8.gguf`(2.646GB) + **Block Swap 20 块** + lightx2v rank64 LoRA + **6 步** cfg 1.0 + **832×480 / 81 帧 / motion_frame 9**
  > kijai 提醒：*"**You can't mix GGUF MultiTalk with non-GGUF main model**"* → GGUF patch 必须配 GGUF 底座

**✅ 中文音频：原生支持**（`TencentGameMate/chinese-wav2vec2-base`）

**🔴 坑**
1. **🔴 长视频吃爆系统内存**：[kijai #1088](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1088)（**至今 open**）——**3 分钟 480P 视频需 >120 GB 系统内存**，内存消耗集中在**最终解码阶段**；另一用户报告 **32GB 内存在音频超过 3 分钟时于 60% 进度崩溃**。
2. kijai 的反直觉告警（[#1091](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1091)）：**满 block swap 时"GGUF Q4 并不真的省显存，只省内存"**——真省显存要靠降分辨率/减帧数。
3. **系统 RAM 被误报成"VRAM OOM"**（[#1095](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1095)）。
4. **分辨率必须能被 16 整除**（832×480 ✅；800×456 ❌ 会崩 `shape [20,1400,5120] invalid`）。
5. **禁用 SageAttention 3**（kijai 亲述画质劣化）；**RTX 50 系必须 torch ≥2.9.1 + CUDA ≥13.0**。
6. **VRAM 泄漏**：每轮迭代约泄漏 30MB（[#1308](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1308)）。
7. **多人对话实测很差**：2 人勉强，**3~4 人普遍失败**（[#1944](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1944)、[#1891](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1891)、[#1866](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1866)）。
8. 🟡 官方自曝：**FusionX LoRA 超 1 分钟加剧色偏**；**I2V 单图超 1 分钟色偏明显**。

**🎯 16GB 结论**：✅ **可跑，且本机型已有跑通记录**（[kijai #1875](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1875)：RTX 5060 在 **torch 2.9.1+cu130** 后跑通）。但属于"慢速可用"档，且 **32GB 内存是真瓶颈**（12GB 卡反而直接 OOM，见 [kijai #1186](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1186)）。

```
底座:   city96/Wan2.1-I2V-14B-480P-gguf  → Q4_K_M (11.34 GB)
patch:  Kijai/WanVideo_comfy_GGUF → Wan2_1-InfiniteTalk_Single_Q4_K_M.gguf (1.403 GB)
音频:   Kijai/wav2vec2_safetensors → wav2vec2-chinese-base_fp16 (0.19 GB，中文)
LoRA:   lightx2v_I2V_14B_480p_cfg_step_distill_rank64 (4~6 步)
Block swap: 30~40 块 ｜ 分辨率 832×480（必须 16 整除）｜ T5 卸载到 CPU
环境:   torch ≥2.9.1 + CUDA 13.0（本机 2.11.0+cu130 ✅）；attention 优先 SDPA，SA2 须含 sm120
长视频: 每 10~20 秒一段落盘，清缓存再续接
预期:   480p、10 秒 ≈ 30~45 分钟（按 RTX 5080 16GB 的 1300 秒/5 秒 @640×640 换算）
```

---

### 3.4 ❌ Wan2.2-S2V-14B（阿里万相）—— 官方门槛 80GB

| 项 | 数据 |
|---|---|
| 发布方 | 阿里巴巴 Wan 团队（通义万相）｜**首发 2025-08-26**｜HF 权重最后更新 **2025-09-17** |
| 参数量 | **14B**（Wan2.2 MoE DiT 的单专家 S2V） |
| 许可证 | **Apache-2.0，可商用** |
| GitHub | **17,585 ★** / 2,257 fork（主仓库 2026-09-21 仍在提交，但 **S2V 本体自 2025-09 未再更新**） |

**各精度体积**

| 组件 | 格式 | 体积 |
|---|---|---|
| DiT | bf16（官方 4 shard） | **≈30.35 GiB** |
| | ComfyUI 官方 `fp8_scaled` | **15.27 GiB** |
| | Kijai `fp8_e4m3fn_scaled` | 16.65 GB |
| | **GGUF** Q8_0 / Q6_K / Q5_K_M / **Q4_K_M** / Q4_K_S / IQ4_XS / Q2_K | **18.27 / 15.10 / 13.97 / 12.91 / 12.07 / 11.32 / 8.86 GiB** |
| T5 文本编码器 | `umt5_xxl_fp8_e4m3fn_scaled` | **6.27 GiB**（bf16 版 10.58 GiB） |
| 音频编码器 | `wav2vec2_large_xlsr-53_english_fp16` | 1.18 GiB（**英文**） |
| VAE | `wan_2.1_vae` | 0.24~0.47 GiB |

> 🔴 **算一笔账**：官方 fp8 UNet **15.27 GiB** + fp8 T5 **6.27 GiB** = **21.5 GiB，必然超 16GB**。所以 16GB 上要么换 **GGUF Q4_K_M（12.91 GiB）**，要么靠 `--lowvram` 让 ComfyUI 自动把文本编码器换出。

**🟢 显存与速度**
- 🟡 **官方 README 明确写：单卡需 "at least 80GB VRAM"**——即使省显存模式（`--offload_model True --convert_model_dtype`），**官方门槛仍是 80GB**。**这是厂商自己给的数字。**
- 🟡 L40S 48GB：**5 秒视频 ≈ 20 分钟**（含约 10 分钟编译+加载）—— [Wan2.2 #115](https://github.com/Wan-Video/Wan2.2/issues/115)
- 🟡 **4×64GB 卡跑 720P：每 10 秒 ≈ 1 小时** —— [Wan2.2 #319](https://github.com/Wan-Video/Wan2.2/issues/319)
- 🟢 第三方横评（H200）：**峰值 58,681 MiB（≈57.3 GB）**，**3.8 秒输出用 780.29 秒（13 分钟）**，512×896 **@16fps**
- 🔴 **16GB 上的已知失败模式**（[kijai #1147](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1147)）：**显存填满 → 走共享内存（shared memory）→ 慢到必须中止**。这是消费卡跑 14B 视频模型的典型死法
- ⚪ **没有任何第三方给出过 16GB 单卡跑通 S2V 的成功实测，也没有任何消费级卡的峰值显存数字**

**ComfyUI（官方原生，配法已核实）**
- ✅ **官方原生工作流**：[docs.comfy.org/zh/tutorials/video/wan/wan2-2-s2v](https://docs.comfy.org/zh/tutorials/video/wan/wan2-2-s2v)。节点链：
  1. **UNet 加载器** ← `wan2.2_s2v_14B_fp8_scaled.safetensors`（**15.27 GiB**）或 bf16（30.35 GiB）；官方明说"本模板用 fp8_scaled，它需要更少的显存"
  2. **CLIP 加载器** ← `umt5_xxl_fp8_e4m3fn_scaled.safetensors`（6.27 GiB）
  3. **音频编码器** ← `wav2vec2_large_english_fp16.safetensors` → 放 `models/audio_encoders/`
  4. **VAE** ← `wan_2.1_vae.safetensors`
  5. `Video S2V Extend` 子图每块 **77 帧 = 4.8125 秒 @16fps**；按 `音频秒数×16÷77` 向上取整决定子图数（14 秒 → 3 块）
- **GGUF 路线**：🔴 **官方文档完全没提 GGUF**；社区走 `ComfyUI-GGUF` 的 `Unet Loader (GGUF)` + `CLIPLoader (GGUF)`（**本机已装 `ComfyUI-GGUF`，可直接用**）
- ⚪ **"S2V 在 16GB 上必须把文本编码器 CPU offload"这一步，本次未查到 16GB 用户的明确表述**（官方文档不给显存门槛，只给模型清单与 77 帧/块）

**🎯 16GB 结论**：❌ **不推荐。** 官方 80GB、第三方 57.3GB，**16GB 属于"理论可行（Q4 GGUF + 分块 offload + 低分辨率 + 短片段）、无任何公开成功案例"区间**，且已知失败模式是**走共享内存后慢到必须中止**。若一定要试：`calcuis/wan-s2v-gguf` 的 **Q4_K_M（12.91 GiB）** + `ComfyUI-GGUF` 的 `Unet Loader (GGUF)` + T5 换出 + 480P 以下 + 单块 77 帧（4.8 秒）。**16fps 输出也是流畅度劣势。**
> ℹ️ 一个间接的乐观信号：**同为 16GB 的 RTX 5060** 在**原生 ComfyUI** 里用 **Wan2.2 GGUF Q4_K_M + fp8 文本编码器稳定出了 121 帧 @720×960**（[kijai #1805](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1805)）——说明 Wan 系 14B 在 16GB 上"有戏"，**但 S2V 本身无人验证**。

**其他坑**：🟢 横评记录"官方设置在推理开始前还需要修几个依赖（其音视频读取器用的包）"；ComfyUI 博客评论区有用户问"how can I achieve longer video clips than 15 seconds?"（默认模板容易卡在 ~15 秒）。
**中文**：官方支持 `--enable_tts` 走 CosyVoice 做中文合成，**但音频编码器是英文 `wav2vec2-large-xlsr-53-english`** → 中文唇形精度只有厂商演示，⚪ **未查到中文 LSE 第三方数字**。

---

### 3.5 ⚠️ HunyuanVideo-Avatar（腾讯混元）

| 项 | 数据 |
|---|---|
| 发布方 | 腾讯混元｜**2025-05-28 首发**｜仓库最后 push **2025-12-16**（已 9 个月无功能更新）｜arXiv 2505.20156 |
| 参数量 | **13B**（Wan2GP 模型定义明写 "Hunyuan Video Avatar 720p **13B**"） |
| 许可证 | 🔴 **腾讯混元社区协议（非 Apache/MIT）**，**明确写明"本协议不适用于欧盟、英国、韩国"**，另有 Acceptable Use Policy。ComfyUI 作者原话：*"anyone in the european union, uk or south korea is not allowed to use the model"* |

**各精度体积**

| 组件 | 体积 |
|---|---|
| 官方 `mp_rank_00_model_states.pt`（bf16/fp32） | **30.51 GB** |
| 官方 fp8 | **24.85 GB** |
| llava 文本编码器（4 shard） | 16.76 GB |
| **Wan2GP int8「quanto」** | **13.41 GB** |
| Wan2GP bf16 重打包 | 25.98 GB |
| 社区 GGUF 实验版 Q2_K / **Q4_K_M** / Q5_K_M / Q8_0 | **4.86 / 7.97 / 9.55 / 14.14 GB** |
| **HF 仓库总计** | **80.77 GiB** |

**🟡🟢 显存与速度**
- 🟡 **官方 README**：最低 **24GB**（704×768×129f，"very slow"）；**推荐 96GB**；**官方测试环境是 8 卡**
- 🟢 **Wan2GP 作者实测（厂商官方 README 已回链认可）**：*"**10GB 显存**即可生成最长 15s 高质量视频，无质量损失，且比原始实现更快"*（[issue #46](https://github.com/Tencent-Hunyuan/HunyuanVideo-Avatar/issues/46)）——**这是混元官方唯一承认的低显存路径，而它在 Wan2GP 里，不在 ComfyUI 里**
- 🟢 **实测耗时（本调研新查到）**：
  | 配置 | 实测 |
  |---|---|
  | **RTX 5090（未优化）** | **30 步 ≈ 30 分钟**（≈60 s/it） |
  | **RTX 3090 + CPU offload + fp8** | 704px / 129 帧 = **112.32 s/it**（50 步跑 1h33m 后 OOM） |
  | **RTX 4090 24GB + 128GB RAM**（ComfyUI 节点） | **采样开始前要等 30+ 分钟预热**（文本/图像编码器被挪到 CPU 以塞进 12GB） |
  | **RTX 3060 12GB** | 在 **Wan2GP** 里跑通 |
  | V100 32GB + 64GB RAM | 在 Wan2GP profile4 **仍 OOM** |
- 🔴 **对本机最致命的一条**：**所有成功案例都带 96 / 97 / 192 GB 系统内存**；Wan2GP 的 int8（13.41GB）会被 **pin 进内存**（实测 pin 了 **12,785 MB**），而**本机只有 32GB 内存** → **判定为「推断偏不可行」**
- ⚪ **未查到 16GB 卡上的任何成功或失败实测**（只有一位 **RTX 4070 Ti 16GB + 32GB RAM** 的用户提问，[issue #70](https://github.com/Tencent-Hunyuan/HunyuanVideo-Avatar/issues/70)，**无人回复**）

**ComfyUI**
- ⚠️ **官方 Open-source Plan 里 `[ ] ComfyUI` 至今未打勾**；**ComfyUI 官方 issue #8311 自 2025-05-28 起一直 open**，作者明确因**许可证**给「very low priority」→ **这一点不会随时间改善**
- 社区节点两个**均已停更**：`smthemex/ComfyUI_HunyuanAvatar_Sm`（80★，最后 push 2025-06-24）、`Yuan-ManX/ComfyUI-HunyuanVideo-Avatar`（29★，最后 push 2025-05-29）
- kijai 的 WanVideoWrapper 里**没有** HunyuanVideo-Avatar 专用节点
- 有人做 GGUF 实验（[lym00/HunyuanVideo-Avatar-GGUF-Experiment](https://huggingface.co/lym00/HunyuanVideo-Avatar-GGUF-Experiment)），但模型卡**头一句就是"⚠️ Not yet supported in ComfyUI"**，标注 "intended for experimental use only"

**✅ 能力**：中文音频支持（whisper-tiny + LLaVA，多语言）｜**多人对话**（Face-Aware Audio Adapter，按人脸 mask 做 latent 级多角色音频注入）——**16GB 可达的低显存模型里唯一支持多人对话的**
**🟢 第三方 LSE 数据**：EMTD 基准 **HY-Avatar（12.99B）LSE-C 7.210 / LSE-D 8.494**（同表 InfiniteTalk 8.535/7.108、Wan-S2V 6.999/8.292、Hallo3 5.352/9.828）

**🔴 坑**：显存 issue 密集——**#81「CUDA OOM even with 8×24GB VRAM」**、**#6「80GB H100 still got OOM」**、#25（8 卡 4090 OOM）、#61（single 3090 OOM）、#63（WSL2 + 32GB RAM + 4090 OOM）；质量吐槽 #78（A100 80GB 质量低）、#79（图像模糊）、#58（low vram 出黑屏）；`flash-attn 2.6.3` 编译失败是高频 issue

**🎯 16GB 结论**：⚠️→❌ **从"能跑"下调为"推断偏不可行"**。
- **显存维度够**（Wan2GP int8 13.41 GB / GGUF Q4_K_M 7.42 GiB）
- **但内存维度不够**：成功案例**全部带 96–192GB 系统内存**，int8 权重会被 pin 进内存约 **12.8 GB**，而**本机只有 32GB**；V100 32GB + 64GB RAM 在 Wan2GP 里仍 OOM
- 且：**官方 ComfyUI 一年未落地（因许可而非技术，不会改善）** + 停更 9 个月 + 许可排除 EU/UK/KR + **RTX 50 系兼容 issue 从未处理**
- **保留价值**：**唯一低显存多人对话方案**。**仅当你确实需要"多人对话"且不在 EU/UK/KR、并愿意升内存时才考虑。**

---

### 3.6 ⚠️ Wan2.2-Animate-2-14B（阿里）——**它不是音频驱动**

> **🔴 选型第一坑：Wan-Animate 系列不吃音频。** 它输入的是「参考图 + **驱动视频**」，输出角色动画。**口播场景需要你先生成/拍摄一段驱动视频**，链路变成三段。**对本场景不匹配。**

| 项 | 数据 |
|---|---|
| 两代关系 | **Wan2.2-Animate-14B**（= Wan-Animate，首发 2025-09-19，HF likes **1,261**）→ **Wan2.2-Animate-2-14B**（首发 **2026-08-07**，arXiv **2608.06009**，独立仓库 323★，但 Comfy-Org 重打包 **535,555 下载**）。**不存在第三代。** |
| 机制差异 | 上一代有骨架/姿态中间表示；**Animate-2 让驱动视频直接进 DiT**，取消中间姿态提取器 |
| 参数量 / 体积 | 14B；bf16 **30.54 GiB**（base + distill 各一份）｜**INT8_convrot 15.51 GiB**（base + distill 各一份）｜另需 `umt5_xxl_fp16` 11.37GB / fp8 6.74GB、**`clip_vision_h` 1.26GB（必需）**、Wan2.1 VAE 0.25GB、lightx2v LoRA 0.74GB |
| 社区 GGUF（TURBO 蒸馏版） | Q8_0 16.90 / Q6_K 13.25 / Q5_K_M 11.87 / **Q4_K_M 10.56** / Q4_K_S 9.72 / Q3_K_M 8.00 / Q2_K 6.05 GiB |
| 许可证 | **Apache-2.0，可商用** |
| 🟢 **显存（本机型实测！）** | **RTX 5060 Ti 16GB：`distill int8_convrot` 部分卸载 ≈ 7.3 GB 显存 / 8.6 GB 内存** —— **这是本次调研唯一拿到的、与本机同型号显卡的逐项实测数据**（来源：[ComfyUI-MultiGPU #219](https://github.com/pollockjj/ComfyUI-MultiGPU/issues/219)） |
| 🟢 **速度（本机型实测！）** | **RTX 5060 Ti 16GB：官方 `video_wan_animate2_distilled` 动作迁移图，10/10 步、49 帧 @480×854 = 126.8 秒** → 按 25fps 折算 49 帧≈2 秒画面，**10 秒约 10 分钟**；🟢 上一代 Animate-14B：A800 480P/20步 替换模式 10.76 s/it（另一用户 720p 8–10 秒/25 步 ≈40 分钟） |
| 🟡 上一代第三方汇编 | 未量化约 28 GB，量化后约 16 GB；官方模型卡：默认设置调优于 **8×A800**，480P 在 **2×A800** 上测过 → **官方只在多卡上验证过** |

**ComfyUI**：✅ **Day-1 官方原生**（2026-08-08 官方博客同日宣布）。两个新节点：**`WanAnimate2ToVideo`**（吃参考角色图 + 驱动视频，可控 `pose_strength`/`pose_start_percent`/`pose_end_percent`/`reference_image_strength`）与 **`WanAnimate2Cache`**。生态扩展：[wuwukaka/ComfyUI-WanAnimatePlus](https://github.com/wuwukaka/ComfyUI-WanAnimatePlus)（413★，2026-09-14 更新，做长视频接缝与多参考图）

**🔴 坑（按危险度排序）**

**① 本机型专属：`WanAnimate2Cache` 的 device/dtype 组合会静默杀进程**
🟢 [ComfyUI-MultiGPU #219](https://github.com/pollockjj/ComfyUI-MultiGPU/issues/219) 已在 **5060 Ti 16GB 上复现**：**`WanAnimate2Cache` 设 `device=gpu` + `dtype=int8`，再配合 MultiGPU 类 patch，会静默杀掉进程**（无报错）。
→ **正确配置：`device=cpu` + `dtype=default`。**
- 🟡 官方文档给出 cache 的代价：**480×832 / 81 帧 bf16 约需 12.5 GB 系统内存**（随分辨率与时长增长）——本机 32GB 内存够，但要与其他进程错开。
- ⚪ **`WanAnimate2Cache` 的实际加速比：未查到任何第三方 A/B 数字**，只有官方"约减半（roughly halves）"的宣称。

**② GGUF 静默失败（最阴险）** —— 来自 GGUF 量化仓库作者原话：
> Wan-Animate-2 **不会通过 tensor 名自报家门**。ComfyUI 从 safetensors `__metadata__` 的 `config` blob（`model_type: "animate2"`）选择架构，而 **GGUF 没有等价字段**，所以**任何该模型的 GGUF 都会被当成普通 Wan 2.1 I2V 加载**。失败是**静默**的：模型加载、采样运行、出来一段带你参考角色的视频——但**驱动视频被完全忽略**，随机运动、没有表演迁移，**不报任何错**。

**解法**：装 [ComfyUI-GGUF](https://github.com/city96/ComfyUI-GGUF) + [Rebels W3A8 Loader](https://github.com/RealRebelAI/Rebels_w3a8_Loader)，把 `model_type` 显式设为 **`animate2`**；**控制台加载时必须打印 `model class=WAN_Animate2` 才算成功**。

**③ 其他坑**：GGUF + 自定义节点会在采样期崩（[discussions/2](https://huggingface.co/realrebelai/Wan-Animate-2_GGUFs/discussions/2)，2026-08-22 open，报 `TypeError` 于 `comfy/ldm/wan/model_animate2.py` 的 `_cross_attn_ffn`）；**参考图必须大致匹配驱动视频的开场姿态**（与量化无关，bf16 同样如此）；上一代有长视频色偏 issue（[#1277](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1277)）。

**🎯 16GB 结论**：✅ **技术上完全能跑，而且是本机型唯一有逐秒实测的模型**（7.3GB 显存 + 49 帧 126.8 秒）。
❌ **但它需要「参考图 + 驱动视频」，不吃音频，不符合"一张图 + 一段中文音频"的口播场景。**
> **⚠️ 一个容易被误导的岔路**：如果你的素材本来就是**"一段视频 + 一段中文音频"**，那你需要的是 **InfiniteTalk / MuseTalk / LatentSync 那类视频重绘配音模型**，**不是 Animate**——Animate 做的是"让参考图里的人做出驱动视频的动作"，与"对上录音的嘴型"是两件不同的事。

---

### 3.7 ❌ OmniAvatar-14B（浙江大学 + 阿里巴巴）

| 项 | 数据 |
|---|---|
| 发布方 | 浙江大学 + 阿里巴巴（Qijun Gan 等）｜arXiv 2506.18866 |
| 时间线 | 14B 权重 **2025-06-24**；1.3B 权重 2025-07-02；**GitHub 最后 push 2025-08-06（停更 13.5 个月）** |
| 参数量 / 体积 | 14B；`OmniAvatar-14B/pytorch_model.pt` 仅 **1.238 GB**（LoRA + 音频条件权重），底座是 `Wan2.1-T2V-14B`；1.3B 版 0.355 GB |
| 许可证 | 14B **Apache-2.0**；⚠️ **1.3B 的 HF license 字段为空（未声明）** |
| GitHub | 1,861 ★ / 168 fork（2026-09-22） |
| 音频编码器 | `facebook/wav2vec2-base-960h`（**英文 LibriSpeech 960h**） |

**🟡 官方显存表（A800，480p，官方 README）**

| 参数量 | dtype | GPU 数 | `num_persistent_param_in_dit` | 速度 | **所需显存** |
|---|---|---|---|---|---|
| 14B | bfloat16 | 1 | None（不限） | **16.0 s/it** | **36 G** |
| 14B | bfloat16 | 1 | 7e9（7B） | 19.4 s/it | **21 G** |
| 14B | bfloat16 | 1 | **0** | 22.1 s/it | **8 G** |
| 14B | bfloat16 | 4 | 不限 | 4.8 s/it | 14.3 G |

**🟢 第三方实测（决定性）**
- **24GB VRAM + 31.3GB RAM：14B 在加载模型阶段就 OOM**（[issue #77](https://github.com/Omni-Avatar/OmniAvatar/issues/77)）；官方回复"可试 `--hp=num_persistent_param_in_dit=7000000000`"，被追问内存需求时答 **"Maybe 64GB CPU RAM is required"**
- 1.3B 版 **约 8GB VRAM**（[issue #80](https://github.com/Omni-Avatar/OmniAvatar/issues/80)）
- **延迟最差**：第三方横评 **5 秒视频 850 秒；30 秒视频 >1 小时**（同批 InfiniteTalk 51.5s/309s、LiveChat 53s/321s、SoulX-FlashTalk 25.4s/125.3s）
- **用户盲测垫底**：EMTD 长视频档归一化 **40.20**（InfiniteTalk 55.33、SoulX-FlashTalk 60.23、Avatar-Forever 76.00）

**ComfyUI**：❌ **无**。feature request [kijai #836](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/836) 自 **2025-07-20** 提交，**至 2026-09-22 仍 open**；wrapper 里**没有 `omniavatar` 模块**。2025-07 曾有一个"OmniAvatar 1.3B 图生数字人工作流"在微信公众号传播，但被官方仓库 issue 定性为**闭源付费推广**（作者直接把 issue closed 并注明 "Not open-source. Closed it."）。
**量化**：⚪ **无 fp8 / int8 / GGUF**（HF 上只有 1.238GB 的 LoRA+音频权重）
**中文**：⚠️ **未查到官方支持**（编码器是英文 960h）。网传"支持 31 种语言"**在官方 GitHub / HF / 项目页均无出处，不采信。**

**🎯 16GB 结论**：❌ **14B 不可用**（官方称需 64GB 内存，本机 32GB 不够）；**1.3B 能跑（~8GB）但生态为零**：无 ComfyUI 节点、无量化、无中文官方支持、**项目停更 13.5 个月**、**RTX 50 系兼容 issue 从未处理**。**排除。**

---

### 3.8 ❌ FantasyTalking（阿里高德 Fantasy-AMAP，ACM MM 2025）

| 项 | 数据 |
|---|---|
| 发布方 | 阿里巴巴 **AMAP（高德）CV Lab**｜**ACM MM 2025**｜开源 **2025-07-07**｜**最后更新 2025-08-20（停更 13 个月）** |
| 参数量 / 体积 | 14B（基于 **Wan2.1-I2V-14B-720P**）+ 口型适配器 `fantasytalking_fp16.safetensors` **1.68 GB** |
| 许可证 | **Apache-2.0** |
| GitHub | 1,630 ★ |

**🟡 官方显存/速度表（A100，512×512，81 帧）**

| `torch_dtype` | `num_persistent_param_in_dit` | 速度 | **需求显存** |
|---|---|---|---|
| bfloat16 | None（不限） | 15.5 s/it | **40 G** |
| bfloat16 | 7×10⁹（7B 常驻） | 32.8 s/it | **20 G** |
| bfloat16 | **0（全部 offload）** | **42.6 s/it** | **5 G** |

→ **唯一能进 16GB 的是"全 offload → 5G"档，但 42.6 s/it。按 30 步算约 21 分钟/帧组，10 秒视频是"小时级"——不可用级慢，不是"稍慢"。**

**🔴 16GB 上的明确失败证据（本调研新查到）**
- 🟢 **RTX 5070 Ti 16GB 明确失败**：issue 标题即 *"Doesn't work with 16GB VRAM"* —— [FantasyTalking #37](https://github.com/Fantasy-AMAP/fantasy-talking/issues/37)
- 🟢 **RTX 5090 32GB 最小设置也 OOM** —— [#17](https://github.com/Fantasy-AMAP/fantasy-talking/issues/17)
- 🟢 **8GB（3070）失败**
- 🟢 **32GB 系统内存本身就不够** —— [#24](https://github.com/Fantasy-AMAP/fantasy-talking/issues/24)
- 🟢 **A800 40G：30 秒视频 = 1 小时** —— [#58](https://github.com/Fantasy-AMAP/fantasy-talking/issues/58)；另一用户 **1 分钟音频 > 19 小时** —— [#64](https://github.com/Fantasy-AMAP/fantasy-talking/issues/64)
- 🔴 **官方明说必须装 `flash_attn`，否则结果错误**（[#13 回复](https://github.com/Fantasy-AMAP/fantasy-talking/issues/13)）→ **在 sm120 上是大坑**（FA2 需自编 12.0，FA3/FA4 不可用）

**ComfyUI**：✅ 社区路径（[kijai/ComfyUI-WanVideoWrapper](https://github.com/kijai/ComfyUI-WanVideoWrapper) 的 `FantasyTalkingWav2VecEmbeds` 节点，30 步 UniPC，CFG=5）；⚠️ 该 wrapper **仓库没有 README**（raw 全 404）。有 issue [#753 "Fantasy Talking VRAM Usage"](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/753)。**SageAttention 支持有用户请求（[#69](https://github.com/Fantasy-AMAP/fantasy-talking/issues/69)）但未实现。**
**🔴 量化无解**：社区 GGUF 尝试**明确失败并归档**——`kael558/ComfyUI-GGUF-FantasyTalking` 的 README 全文只有一句：*"P.S. **Couldn't quantize the fantasy talking model so this repo doesnt work**"*
**中文**：⚠️ 工作流用 `facebook/wav2vec2-base-960h`（**英文 960h**），官方 demo 音频也是英文 → **中文口型不可靠**
**其他**：**81 帧固定窗口，未见官方长视频/分段续写方案**；❌ 不支持多人

**🟢 第三方质量（EchoMimicV3 论文 Table 1，512×512 半身）**：FantasyTalk-14B **Sync-C 4.05（全表最低）/ Sync-D 11.01（全表最差）**，FID 45.03、FVD 603.95 → **唇形同步是它的相对弱项**
**⚠️ FantasyTalking2**：AAAI 2026 论文，仓库 **只有 README.md + assert/ 目录**，3 个 commit 全在 2025-08-15~08-18，**65★，无 LICENSE 文件，无代码无权重** → **不是"不推荐"，是"不存在可用产物"**

**🎯 16GB 结论**：❌ **明确不可行。** 有 **RTX 5070 Ti 16GB 的失败报告**、RTX 5090 32GB 最小设置 OOM、32GB 内存不足、官方要求必须装 flash_attn（sm120 大坑）、量化已失败归档、停更 13 个月、中文前端是英文、唇形同步在其论文对比表里垫底、A800 上 30 秒要 1 小时。**八个"不"——直接划掉。**

---

## 4. 🆕 中文文案 → 配音 TTS（本地首选，16GB 内）

> **为什么单列一节**：口播链路的**第一环是配音**。中文 TTS 的"像不像人"直接决定成片质量，而**许可证问题在这一环比在数字人那一环更严重**——多个知名中文 TTS 的**权重**是 CC-BY-NC 非商用（代码 MIT 掩盖不了权重许可），商用一票否决。

### 4.0 🔴 本机专属：TTS 的 sm_120 兼容性坑（比数字人模型更需要注意）

| 问题 | 具体表现 | 应对 | 来源 |
|---|---|---|---|
| **🔴 CosyVoice 有直击本机的 issue** | [issue **#1318** *"5060ti 16g 运行 cosyVoice2 无法启动"*](https://github.com/QwenAudio/CosyVoice/issues/1318)；[issue **#1815** *"Compatibility Issue with PyTorch 2.4+ and RTX 50-series GPUs (sm_120)"*](https://github.com/QwenAudio/CosyVoice/issues/1815) | 必须按 issue 指定的 torch/cu128 组合；**不要用旧 pin** | 🟢 GitHub issues |
| **🔴 IndexTTS GPU 检测失败** | [issue **#295** *"Setting accelerator to CPU... we were unable to detect it"*](https://github.com/index-tts/index-tts/issues/295) —— **与 Blackwell 新架构高度相关** | 先查 torch 是否 cu128+ 与 CUDA 可见性 | 🟢 GitHub issue |
| **flash-attn 无 sm_120 预编译内核** | `attn_implementation="flash_attention_2"` → `no kernel image is available for execution on the device` | **改用 `eager` 或 `sdpa`**；有 4090 用户反馈该模型上 eager 与 FA2 **速度相当甚至更好** | 🟢 [flash-attention #2168](https://github.com/Dao-AILab/flash-attention/issues/2168) |
| **torch 必须 cu128+** | 默认 `pip install torch` 会拉 cu121 → sm_120 内核缺失 | `pip install --upgrade torch --index-url https://download.pytorch.org/whl/cu128`（本机 **2.11.0+cu130 已满足**） | 🟢 多模型 README |
| **SageAttention** | 本机自建版含 sm_120 cubin，但**长序列会 GPU 丢失**（见 §0） | **TTS 场景完全不要开 sage_attn**，一律 sdpa | 本机运维记录 |
| **OmniVoice 在 Blackwell 有未修 bug** | [issue **#155**](https://github.com/k2-fsa/OmniVoice/issues/155)：Blackwell 上**输出噪声/乱码**（5090 复现，2026-05 仍未修）；[issue #83](https://github.com/k2-fsa/OmniVoice/issues/83)：**微调撞 sm_120 的 ~99KB shared memory 墙**（datacenter Blackwell sm_100 才有 228KB） | 推理可试；**微调不行**；建议等修复 | 🟢 GitHub issues |
| **pynini / WeTextProcessing** | conda 外安装困难（**历史性痛点**） | Linux 上优先 conda 装 pynini，或走模型自带 `jieba`/`cn2an` 路径 | 🟢 IndexTTS #61 |
| **✅ GPT-SoVITS 对 sm_120 最友好** | README"测试通过环境"明确列出 **PyTorch 2.7.0/CUDA 12.8、2.8.0dev/CUDA 12.8** —— torch 2.7+ 才有完整 Blackwell 内核 | 直接用 `bash install.sh --device CU128` | 🟢 GPT-SoVITS README |

> **"能不能在这台机上跑起来"的难度排序**（从易到难）：
> **GPT-SoVITS ≈ Qwen3-TTS ≈ VoxCPM2 < CosyVoice3 ≈ IndexTTS-2.5 < OmniVoice（有未修 bug）< GLM-TTS / Fun-CineForge（无 ComfyUI 节点，需自行封装）**

### 4.1 🟢 两套第三方中文 TTS 横评（注意两者口径不同）

**横评 A：OpenMOSS/MOSS-TTS 官方对比表**（来源：[MOSS-TTS README_zh](https://github.com/OpenMOSS/MOSS-TTS/blob/main/README_zh.md)）。**ZH CER = 中文字错率↓；ZH SIM = 说话人相似度↑**
> ⚠️ 由 OpenMOSS 发布（自家模型在表内），**对自家模型可能有正向偏差**；但它是唯一同时列闭源与十余个开源模型的表。

| 模型 | 参数 | 开源 | EN WER↓ | EN SIM↑ | **ZH CER↓** | **ZH SIM↑** |
|---|---|---|---|---|---|---|
| （闭源）MiniMax-Speech | — | ❌ | 1.65 | 69.2 | **0.83** | 78.3 |
| （闭源）Seed-TTS | — | ❌ | 2.25 | 76.2 | 1.12 | 79.6 |
| （闭源）CosyVoice3 | 1.5B | ❌ | 2.22 | 72 | 1.12 | 78.1 |
| **GLM-TTS-RL** | 1.5B | ✅ | 1.91 | 68.1 | **0.89** | 76.4 |
| **VoxCPM**（1.0） | 0.5B | ✅ | 1.85 | **72.9** | **0.93** | 77.2 |
| **IndexTTS2** | 1.5B | ✅ | 2.23 | 70.6 | **1.03** | 76.5 |
| GLM-TTS | 1.5B | ✅ | 2.23 | 67.2 | 1.03 | 76.1 |
| **CosyVoice3** | **0.5B** | ✅ | 2.02 | 71.8 | **1.16** | **78.0** |
| VibeVoice | 1.5B | ✅ | 3.04 | 68.9 | 1.16 | 74.4 |
| FireRedTTS-2 | 1.5B | ✅ | 1.95 | 66.5 | 1.14 | 73.6 |
| Qwen3-TTS | **1.7B** | ✅ | **1.50** | 71.45 | 1.33 | 76.72 |
| Qwen3-TTS | 0.6B | ✅ | 1.68 | 70.39 | 1.23 | 76.4 |
| **MossTTSLocal** | 1.7B | ✅ | 1.93 | **73.28** | 1.44 | **79.62** |
| CosyVoice2 | 0.5B | ✅ | 3.09 | 65.9 | 1.38 | 75.7 |
| F5-TTS | 0.3B | ✅ | 2.00 | 67 | 1.53 | 76 |
| SparkTTS | 0.5B | ✅ | 3.14 | 57.3 | 1.54 | 66 |
| CosyVoice | 0.3B | ✅ | 4.29 | 60.9 | 3.63 | 72.3 |

**横评 B：VoicePing 中文专项基准（🟡 第三方，2026-09-20 更新）**——**含情感识别与"数字读法"两个 MOSS 表没有的维度**

| 模型 | 中文 CER | 情感识别↑ | 数字：标识符 | 数字：小数 | median RTF | median 峰值显存 |
|---|---|---|---|---|---|---|
| **Qwen3-TTS-1.7B-CustomVoice** | 9.7% | **53.3%（最高）** | **0%（30/30 全失败）** | 86.7% | 1.58 | 8.13 GB |
| **VoxCPM2 (2B)** | **4.4%（最低=最好）** | 35.0% | — | — | 9.84 | 12.79 GB |
| **IndexTTS-2 / 2.5** | — | — | 40% | **100%（唯一满分）** | 6.97（2.0） | 7.29 GB |
| **Fish Audio S1-mini** | — | 内联标记基本失效 | 综合 79.3%（S2.1，需开厂商正则） | — | 3.47 | **13.05 GB（最高）** |

> 🔴 **两表口径冲突，必须知道**：OpenMOSS 表里 Qwen3-TTS-1.7B 的 ZH CER 是 **1.33**，VoicePing 测出 **9.7%**。**测试集、文本难度、评测脚本都不同，不能混比**。**看趋势（谁强谁弱）可以，看绝对值不行。**

### 4.2 🚨 许可证是这个赛道的最大陷阱（务必先看这一栏）

| 模型 | 许可证 | 能否商用 |
|---|---|---|
| **Qwen3-TTS（全系）** | **Apache-2.0** | ✅ 无附加条件 |
| **Fun-CosyVoice3-0.5B-2512 / CosyVoice2 / 300M** | **Apache-2.0** | ✅ 无附加条件 |
| **VoxCPM / VoxCPM2**（面壁+清华） | **Apache-2.0** | ✅ 无附加条件 |
| **GPT-SoVITS** | **MIT（仓库 LICENSE 原文确认）** | ✅ 无附加条件 |
| **MOSS-TTS 全系 / OmniVoice / Dots TTS / MegaTTS3 / FireRedTTS2** | **Apache-2.0** | ✅ |
| **GLM-TTS**（智谱） | ⚠️ **HF 卡写 `mit`，仓库 LICENSE 原文是 Apache-2.0** → **两者都允许商用**，但**口径不一致**，建议以仓库 LICENSE 为准并留存证据 | ✅ |
| **VibeVoice**（微软） | ⚠️ **HF 卡 MIT**，但第三方 `TTS-Audio-Suite` 引擎表标注 **"MIT (research-only per model card)"** → **冲突，商用前自行核对微软条款**；且其 HF 表中 `VibeVoice-TTS-1.5B` 状态为 **Disabled** | ⚠️ 需核 |
| **IndexTTS-2 / 2.5**（B站） | ⚠️ **不是 Apache-2.0**。仓库是 **"bilibili Model Use License Agreement"**：**授予全球、非独占、不可转让、免版税许可 → 普通规模可商用**；**例外**：你或关联方**上月 MAU > 1 亿**，或**上一年营收 > 10 亿人民币**，须另行申请。附加义务：保留版权声明；**不得用本模型改进其他 AI 模型**（除非该模型本身非商用）；**禁止高风险场景**（医疗诊断/自动驾驶/军事/关键基础设施/大规模生物识别监控/自动化信贷雇佣）。管辖区：中国法、上海仲裁委 | ✅ **普通规模可商用**（比我初稿的判断更宽松）；⚠️ 但**必须读完全文** |
| **F5-TTS** | 🔴 README 原文：代码 MIT，**但预训练权重是 CC-BY-NC**（因训练数据 Emilia）；HF 卡 `cc-by-nc-4.0` | ❌ **一票否决** |
| **SparkTTS**（阿里） | 🔴 代码 Apache-2.0，**权重 `cc-by-nc-sa-4.0`** | ❌ |
| **Fish-Speech / S2 Pro** | 🔴 LICENSE 原文：*"Any Commercial use of the Materials **requires a separate license** from Fish Audio."* | ❌ |
| **ChatTTS** | 🔴 代码 **AGPL-3.0**（强 copyleft）+ 权重 **CC-BY-NC-4.0** 双杀 | ❌ |
| **Higgs Audio v3**（Boson） | 🔴 Research and Non-Commercial License | ❌ |
| **DramaBox** | ⚠️ LTX-2 Community License；**需 ~24GB VRAM（fast mode）** | ❌ 硬件不够 |

> **⚠️ 教训**：**不要相信 HF 镜像卡上的 license 字段**（IndexTTS-2 就是反例，多个第三方镜像卡误标 `apache-2.0`）。要核实**官方仓库根目录的 LICENSE 文件原文**。

### 4.3 主对比表（16GB + 中文 + 商用 + ComfyUI 视角）

> **体积口径**：HF 仓库 `total` 含所有量化/备份文件（如 CosyVoice3 同时含 `llm.pt` 与 `llm.rl.pt`，IndexTTS 含多版本），**实际推理只加载其中一份**，故"推理所需"列更贴近真实。

| 模型 | 参数 | HF 总体积 / 推理所需 | 许可证 | 16GB | ComfyUI 节点 | 中文效果 | 音色克隆 | 生成 10s 音频 |
|---|---|---|---|---|---|---|---|---|
| **GPT-SoVITS v2ProPlus** | 0.21B（133M+77M） | 极小 | **MIT** ✅ | ✅ ~6GB 级 | ✅ `AIFSH/ComfyUI-GPT_SoVITS` | 中文原生核心场景（g2pW 多音字前端）；⚪ **未查到权威第三方 CER/MOS** | ✅ 5s zero-shot / **1min few-shot 微调** | 🟠 **≈0.28 秒**（**RTF 0.028 @4060 Ti**，项目自述）；RTF 0.014 @4090 |
| **IndexTTS-2.5** | 0.8B（官网）/ 1.5B（他表）⚠️ | 5.11 GiB / **~5.1 GiB** | bilibili 许可 ✅ 普通规模可商用 | ✅ 峰值 ~7.3 GB | ✅ **`joyfoxai/ComfyUI-Index-TTS-25`**（一套节点同支持 2 与 2.5） | 🟠 ZH CER 3.93（RL）；🟡**数字小数 100%（唯一满分）**、标识符 40% | ✅ zero-shot + **8 维情感向量** | 🟠 2.1s（RTF 0.2065 @4090 bf16）／🟡 **29s（RTF 2.92 @5060 Ti）** |
| **Qwen3-TTS-12Hz-1.7B** | 1.7B | 4.23 GiB / ~4.2 GiB | **Apache-2.0** ✅ | ✅ 峰值 ~8 GB | ✅ **2 套**（`ComfyUI-TD-Qwen3TTS` / `ComfyUI-Qwen-TTS`） | 🟡 **第三方综合第一**（CER 9.7%、情感识别 53.3% 最高、唯一 anchor margin 为正）；🔴 **但长数字串 0%（30/30 全失败）** | ✅ zero-shot（3s 参考） | 🟡 ~15.8s（RTF 1.58）／社区报 RTF 2–4× |
| **Qwen3-TTS-12Hz-0.6B** | 0.6B | 2.34 GiB / ~2.3 GiB | **Apache-2.0** ✅ | ✅ 余量极大 | ✅ 同上（同代码） | 🟠 CER 1.23 / SIM 76.4 | ✅ | 未查到（应更快） |
| **VoxCPM2**（面壁+清华） | 2B | 4.62 GiB / ~4.6 GiB | **Apache-2.0** ✅ | ✅ 官方 **~8 GB** | ✅ `starsFriday/ComfyUI-VoxCPM`、`nkxx188/ComfyUI-VoxCPM-nkxx` | 🟡 **中文 CER 4.4%（VoicePing 最低=最好）**，但情感仅 35.0% | ✅ zero-shot + 音色设计；**支持 LoRA 训练** | 🟠 3.0s（RTF 0.30 @4090）／🟡 98s（RTF 9.84，GPU 未标） |
| **Fun-CosyVoice3-0.5B-2512** | 0.5B | 9.08 GiB / **~4.2–5.2 GiB** | **Apache-2.0** ✅ | ✅（5060 Ti 实跑；"6G 勉强、8G 可跑"） | ✅ **4+ 套**（`ComfyUI_FL-CosyVoice3` ⭐） | 🟠 CER 0.81（RL）/ SS 77.4；🟡**标识符 90% 最佳**，但货币错误多 | ✅ 3–30s zero-shot + instruct 情感/方言 | 🟡 **18.8s**（**RTF 1.88 @5060 Ti**，第三方）；🟠 部分用户报 RTF>2 |
| **MOSS-TTS-Local-1.7B / v1.5-8B** | 1.7B / 8B | 8.49 / 15.83 GiB | **Apache-2.0** ✅ | ✅ 官方称 **8B 经 llama.cpp 优化后可跑 8GB GPU** | ✅ `richservo/comfyui-moss-tts` | 🟠 **Local-1.7B ZH SIM 79.62（表内最高）** / CER 1.44 | ✅ 稳定克隆 | 未查到统一数字 |
| **OmniVoice**（k2-fsa） | ~0.6B | ~3.3 GB | **Apache-2.0** ✅ | ✅ 第三方 5060 Ti **~4 GB** | ✅ `Saganaki22/ComfyUI-OmniVoice-TTS` | ⚠️ 600+ 语种但长尾；🔴 **Blackwell 有未修乱码 bug** | ✅ zero-shot + 音色设计 | 🟡 **~1.2 秒**（5060 Ti 上 0.6s / 5s 音频） |
| **VibeVoice-1.5B**（微软） | 1.5B | 5.04 GiB | ⚠️ MIT vs research-only 冲突 | ✅ | ✅ `bozoyan/ComfyUI-VibeVoice` | 🟠 CER 1.16 / SIM 74.4 | ❌（多说话人长音频） | 未查到 |
| **GLM-TTS / GLM-TTS-RL** | 1.5B / 3B ⚠️ | 8.28 GiB | MIT / Apache-2.0 ✅ | ⚠️ 理论可，**无实测** | ❌ **未查到任何节点** | 🟠 **CER 0.89（RL，表内最低）** / SIM 76.4 | ✅ 3–10s | 未查到 |
| **Kokoro-82M-v1.1-zh** | 82M | **0.37 GiB / 0.31 GiB** | **Apache-2.0** ✅ | ✅ **<3 GB** | ✅ 2 套 | ⚪ 未查到权威中文 MOS/CER；社区报"Mandarin problem" | ❌ **不支持克隆** | 未查到 |
| **Fun-CineForge**（阿里通义）⭐ | 未查到 | 12.68 GiB（主干 ~9.6GB） | **Apache-2.0** ✅ | ⚠️ 理论可，**无 16GB 实测** | ❌ 未查到 | 专为**影视配音 + 唇同步时间对齐**设计 | ✅ | 未查到 |
| **F5-TTS** | 0.3B | 6.28 GiB / ~1.2 GiB | 🔴 **权重 CC-BY-NC** | ✅ | ✅ | CER 1.53 / SIM 76 | ✅ | 未查到 |
| **SparkTTS** | 0.5B | 3.67 GiB | 🔴 权重 CC-BY-NC-SA | ✅ | 未查到专用 | CER 1.54 / **SIM 66（最低）** | ✅ | 未查到 |
| **Fish Audio S2 Pro** | 4B | 10.26 GiB | 🔴 商用需单独授权 | ✅ | ✅ TTS-Audio-Suite | 🟡 数字综合 79.3% 第一（需开厂商正则） | ✅ | 🟠 2.0s（RTF 0.195） |
| **ChatTTS** | 未查到 | — | 🔴 AGPL + CC-BY-NC | ✅ <4GB | ⚠️ 仅 LLM_party | 🔴 **音质被官方故意加噪降质** | ❌ | 🟡 ~3s |
| **MegaTTS 3**（字节） | 未查到 | 3.98 GiB | Apache-2.0 ✅ | ✅ 节点称 ≥4GB | ✅ 2 套 | 未见第三方中文数字 | ✅（需 WAV+NPY 对） | 未查到 |

### 4.4 🏆 TTS Top3 推荐（针对本机中文口播链路）

> **排序逻辑**：因为这是**本机**选型，我把 **① sm_120 能否顺利跑起来 ② 速度是否阻塞链路** 的权重提到与"效果"同级——配音是**链路上游**，出 10 秒音频等 30 秒会让整条流水线窒息。

#### 🥇 Top1：**GPT-SoVITS v2ProPlus** —— 先跑通链路的零风险选择

**理由**
1. **🟢 速度断层第一**：**RTF 0.028 @RTX 4060 Ti**（项目自述，**给了 GPU 型号**）→ **10 秒音频约 0.28 秒**；4090 上 RTF 0.014。**这是全表唯一能把配音耗时压到"用户无感"的方案。**
2. **🟢 对 sm_120 最友好**：README"测试通过环境"明确列出 **PyTorch 2.7.0/CUDA 12.8** 与 **2.8.0dev/CUDA 12.8** —— torch 2.7+ 才有完整 Blackwell 内核。**在 8 个候选里它是踩坑概率最低的**（对比 CosyVoice 有 #1318「5060ti 无法启动」、IndexTTS 有 #295「GPU 检测失败」）。
3. **✅ MIT 许可，无任何附加条件**（比 bilibili 许可更干净：没有 MAU/营收红线，也没有"不得用于改进其他模型"的条款）。
4. **音色克隆是绝对强项**：**5 秒 zero-shot / 1 分钟 few-shot 微调**（相似度超 zero-shot）——适合"固定主播音色跨多条视频一致"这一口播刚需。
5. **中文原生核心场景**：文本前端含 `g2pW`/`pypinyin-g2pW`，**多音字处理是卖点之一**。
6. GitHub **61,999 ★**、最后提交 2026-08-18，**中文社区生态最厚**。

**最致命的坑**
- **❌ 没有情感控制**——官方 TODO 里"增强的 TTS 情感控制"**被划掉了**。做"同一主播、不同情绪"的口播矩阵时是硬伤。
- **⚪ 未查到任何权威第三方中文 CER / MOS / SIM** —— 它**完全未被** VoicePing（两个基准）、MOSS 官方表、CosyVoice 官方表收录。这既是"没有差评"，也是"没有客观背书"。
- 安装需 conda + `install.sh --device CU128`；中文需额外下 **G2PWModel**；需 `ffmpeg`、`libsox-dev`。

#### 🥈 Top2：**IndexTTS-2.5** —— 中文口播"效果 × 可控性"综合最优

**理由**
1. **🟢 音色 + 情感解耦是同级唯一**：**8 维情感向量**（喜怒哀惧厌郁惊平）+ 情感参考音频 + `emo_text` 文本情感 + `duration_factor`（0.5–2.0 语速）。口播最缺的就是**"同一音色、不同情绪/语速"的稳定可控**——CosyVoice 的 instruct 与 GPT-SoVITS（无情感控制）都比不上。
2. **🟡 中文数字安全性最好**：VoicePing 数字基准 **小数 100%（唯一满分）**，明显优于 Qwen3-TTS 的 86.7%。
3. **✅ 许可证商家友好**：bilibili 许可**免版税、普通规模免费商用**（只有 >1亿 MAU 或 >10亿 RMB 年收入才需单独授权）。
4. **✅ ComfyUI 节点质量最高**：[joyfoxai/ComfyUI-Index-TTS-25](https://github.com/joyfoxai/ComfyUI-Index-TTS-25) **一套节点同时支持 2 与 2.5**（读 `config.yaml` 的 `version` 字段），内置官方源码、5 种情感模式、**已兼容 transformers 4.52.1~4.57.x**、并**修掉了 TorchAudio 2.9 整数 PCM 保存导致的严重削波**；README 把依赖坑（`fugashi`+`unidic-lite`、`WeTextProcessing`、`g2p-en`、`jieba`、`cn2an`、`descript-audiotools`）全列清楚了。
5. **🟢 官方在推生产化**：vLLM recipe 已开源；arXiv 2607.21042 给出 TensorRT/TensorRT-LLM 的 **3.6× 端到端加速**方案 → 未来提速有明确路径。
6. **显存峰值 ~7.3 GB**，16GB 有一倍余量。

**最致命的坑**
- **⚠️ 速度争议极大**：官方 RTF **0.2065@4090** 是理想路径；**第三方实测 5060 Ti 上 RTF 2.92**（同机 CosyVoice3 是 1.88）；VoicePing 测得 median RTF **6.97**；arXiv 2607.21042 直言 *"its inference speed **barely reaches real-time** without streaming or batching support"*。→ **按 RTF 1–3 预估（10 秒音频 10–30 秒）。**
- **🔴 [issue #295](https://github.com/index-tts/index-tts/issues/295)：GPU 检测失败**（`Setting accelerator to CPU... we were unable to detect it`），**与 Blackwell 高度相关，必须先排查**。
- **`deepspeed` / `flash-attn` / `cuda_kernel` / `torch_compile` 四个加速开关默认关闭** —— sm_120 上**建议全部保持关闭**。
- **日文几乎不可用**（VoicePing 测得日文 CER **91.0%**）。
- [issue #61](https://github.com/index-tts/index-tts/issues/61) `pynini` 安装问题（经典坑）；社区报中文多音字问题。
- **参数量口径冲突**：官网/MOSS 表写 **0.8B**，CosyVoice 与 Qwen 的基准表写 **1.5B**（买显存按 5.1GiB 权重算即可）。

#### 🥉 Top3：**Qwen3-TTS-12Hz-1.7B（Base / CustomVoice）** —— 2026 年最大变量、质量上限最高

**理由**
1. **🟡 第三方中文评测综合第一**：VoicePing（2026-09-20）原文——*"Qwen3-TTS CustomVoice 1.7B is **the strongest balanced model in this benchmark**"*：中文 CER 9.7%、**中文情感识别 53.3%（最高）**、**唯一中文 anchor margin 为正（+0.0448）**、NISQA-TTS 4.007。
2. **✅ Apache-2.0，无任何附加条款**；**2026 年下载量最大**（1.7B-Base **388 万**、0.6B-CustomVoice 102 万）→ 生态活跃、修复快。
3. **✅ 两套 ComfyUI 节点都成熟**：`AICoderTudou/ComfyUI-TD-Qwen3TTS`、`flybirdxx/ComfyUI-Qwen-TTS`（后者支持 sage_attn/flash_attn/sdpa/eager **自动降级**，并**明确提示 `no kernel image is available` 是 CUDA 内核缺失而非注意力问题**，还提供 `unload_model_after_generate` 释放显存）；另有 GGUF（`Serveurperso/Qwen3-TTS-GGUF`，下载 288,188）。
4. **支持 VoiceDesign**（用一句话描述声音生成音色）——如"沉稳的中年男声、新闻播报感"直接生成，**不用找参考音频**。
5. **0.6B 档存在**（2.34 GiB）→ 可先用 0.6B 跑通链路再换 1.7B，**同一套节点无需改代码**。

**最致命的坑**
- **🔴 中文长数字串会崩**：VoicePing 基准里"标识符"类别 **30/30 全部失败（0%）**——会把长数字串合并读并漏位。→ **口播文案含订单号/身份证/长编号时，必须在送入 TTS 前把数字展开成汉字**（这是必须写进 pipeline 的预处理步骤）。它的**公式/科学单位/货币都是 86.7%（第一）**，短板很具体。
- **社区报告 RTF 2–4×**（3090/4090/5090 皆然），官方已开 issue #89 跟进提速 → **目前偏慢**。
- **🔴 `transformers` 必须锁 `==4.57.3`**（≥5.0 直接加载失败；节点 README 用加粗警告）。
- **flash-attn 在 sm_120 无预编译内核** → 用 `eager`/`sdpa`。
- **Base 模型不含预设说话人**（要 CustomVoice 才有 9 个音色）；Base 的 WebUI 需 HTTPS 才能用麦克风；`language` 参数要**全名**（`"Chinese"`，写 `"zh"` 会报错）。

#### 📌 值得同步试的第四选项：**VoxCPM2**（中文文本保真度冠军）

- **Apache-2.0**、2B、**4.62 GiB**、2026-08-18、**下载 361,510**（热度极高）
- 🟡 **VoicePing 中文 CER 4.4%——5 个模型里最低（最好）**
- 🟠 官方：VRAM **~8 GB**、RTF **~0.30@4090**、Nano-vLLM 加速后 ~0.13
- ✅ ComfyUI 两套节点，其中 `nkxx188/ComfyUI-VoxCPM-nkxx` **支持多人对话 + LoRA 训练**
- 🔴 坑：`torch.compile`/Triton warm-up 报 `torch._dynamo.exc.Unsupported` → 用 `VoxCPM.from_pretrained(..., optimize=False)`；`Could not load libtorchcodec` → 装系统 ffmpeg + `torchcodec` 或改用 soundfile 后端；VoicePing 测得 median RTF 9.84（该测试路径偏慢）

### 4.5 ❌ TTS 淘汰/降级清单

| 模型 | 判定 | 原因 |
|---|---|---|
| **F5-TTS** | ❌ **淘汰** | 🔴 **权重 CC-BY-NC 非商用**（代码 MIT 掩盖不了权重许可）——商用红线一票否决；且 **2025-03 之后无新版模型** |
| **SparkTTS** | ❌ **淘汰** | 🔴 权重 **cc-by-nc-sa-4.0** + **停更 1.5 年** + **SIM 66 全场最低**；且 wav2vec2 就占 1.2GB，性价比差 |
| **Fish-Speech / S2 Pro** | ❌ **淘汰** | 🔴 LICENSE 原文要求**任何商业用途需单独授权**；VoicePing 峰值显存 **13.05GB（最高）**；情感内联标记基本失效 |
| **ChatTTS** | ❌ **淘汰** | 🔴 **AGPL-3.0 + 权重 CC-BY-NC 双杀**；且**音质被官方故意加噪降质**（防滥用）→ 对口播是致命的；不支持克隆 |
| **Higgs Audio v3** | ❌ **淘汰** | 🔴 Research and Non-Commercial License |
| **DramaBox** | ❌ **淘汰** | 需 **~24GB VRAM**（fast mode），官方明说不保证最低 GPU |
| **Step-Audio 2 mini** | ❌ **淘汰** | HF 总 **16.66 GiB**，fp16 塞不下 16GB；且定位是语音理解/对话（ASR+S2ST），非纯口播 TTS |
| **Kokoro-82M-v1.1-zh** | ⚠️ **降级为备用** | Apache-2.0、<3GB、TTS Arena Elo 1178（**前十唯一开源小模型**）；**但（a）中文档停更 1.5 年（2025-03-04）（b）❌ 不支持音色克隆** → **无法满足"固定主播音色"这一口播刚需** |
| **GLM-TTS** | ⚠️ **降级为跟踪项** | 中文 CER **0.89（RL）全表最强之一**、许可可商用、8.28 GiB 可控；**但 ❌ 未查到任何 ComfyUI 节点**（TTS-Audio-Suite 19 引擎里也没有）+ 参数量口径冲突（1.5B vs 3B）+ **无 16GB 实测** |
| **OmniVoice** | ⚠️ **降级待观察** | 速度/Apache/体积都极优（5060 Ti 上 **0.6s/5s**、~4GB）；**但 🔴 Blackwell 有未修的乱码 bug（[#155](https://github.com/k2-fsa/OmniVoice/issues/155)，5090 复现）+ sm_120 微调撞 shared memory 墙（[#83](https://github.com/k2-fsa/OmniVoice/issues/83)）** → 在你的卡上属高风险。**另注**：中文报道称"小米开源 OmniVoice"，但仓库实为 **`k2-fsa/OmniVoice`**（k2-fsa 组织），**未查到与小米的官方关联 → 该报道疑似误标** |
| **Fun-CineForge** | ⚠️ **Phase-2 观察项** | Apache-2.0、**与"配音+唇同步"方向最对口**（影视级配音 + 时间模态对齐，基于 CosyVoice3）；**但仅 48 次下载（极冷）、无 ComfyUI 节点、无 16GB 实测、主干 9.6GiB**。且**它是"给已有视频配音"的定位**，而你的音频是**给数字人模型当驱动信号**的——**能力不完全等价** |
| **VibeVoice** | ⚠️ **需自核许可** | HF 卡 MIT vs 第三方标 research-only **冲突**；TTS 侧 2026 年停止推进（近期更新全在 ASR）；**中文 SIM 74.4 偏低** |
| **MegaTTS3** | ⚠️ **降级** | Apache-2.0 没问题；但**停更 1.5 年**、克隆需 **WAV+NPY 文件对**（不如"丢个 wav 就行"方便）、**未查到任何第三方中文客观数据** |
| **MOSS-TTS / MOSS-TTSD** | ⚠️ **备选 Plan B** | Apache-2.0 + 官方称 **8B 经 llama.cpp 优化后可跑 8GB GPU** + 节点齐全 + **Local-1.7B ZH SIM 79.62（最高）**；但**未查到 16GB/5060Ti 实测** + 基准含大量厂商自测 + 单人场景用不上 TTSD 的对话能力 |
| **CosyVoice3** | ⚠️ **从 Top1 降为备选** | 中文效果与生态都很好（**4+ 套节点**、18+ 方言、**5060 Ti 实测 RTF 1.88**）；**但 🔴 有直击本机的 issue**：[#1318「5060ti 16g 运行 cosyVoice2 无法启动」](https://github.com/QwenAudio/CosyVoice/issues/1318)、[#1815「PyTorch 2.4+ & RTX 50-series sm_120 兼容问题」](https://github.com/QwenAudio/CosyVoice/issues/1815) → **必须按 issue 方案先验证能否启动**。另 `vllm` 版本未给明确 pin（[#1847](https://github.com/QwenAudio/CosyVoice/issues/1847)）、`pynini` 安装困难 |

### 4.6 落地顺序建议（针对本机）

```
Phase 1（1 天内跑通整条链路）
  └─ GPT-SoVITS v2ProPlus（bash install.sh --device CU128）
     → 用 5s~1min 素材做音色；先打通「文案 → 配音 → 数字人口型同步」
     → 选它的原因：MIT、sm_120 最不易踩坑、RTF 0.028 快到不阻塞链路

Phase 2（升级质感）
  └─ IndexTTS-2.5 + joyfoxai/ComfyUI-Index-TTS-25
     → 补上情感/语速控制，做「同一主播、多情绪」的口播矩阵
     → 必做预处理：把数字展开成汉字

Phase 3（追质量上限，A/B 试听）
  └─ Qwen3-TTS-1.7B-CustomVoice（锁 transformers==4.57.3 + eager 注意力）
     或 VoxCPM2（48kHz，中文 CER 4.4%）

全程遵守
  ├─ 参考音频 ≤3.5s（防显存尖峰；OmniVoice 有 >4s 飙到 8GB 的报告）
  ├─ 不开 sage_attn，一律 sdpa / eager
  ├─ torch 用 cu128+（本机 2.11.0+cu130 ✅）
  └─ 与数字人模型串行执行（16GB 绝不同时驻留两个大模型）
```

> ⚠️ **一条跨所有 TTS 的通用规则**：**没有一个中文 TTS 能可靠地读长数字串**。Qwen3-TTS 标识符 0%、IndexTTS 标识符 40%、CosyVoice3 标识符 90% 但**货币项只有 46.7% 且错误多为把金额本身改掉**。
> → **把"数字/金额/编号展开成汉字"写进 pipeline 的预处理**，这是本链路最容易被忽略、后果最严重的一环。

---

## 5. 完整离线口播链路组装（本机 16GB 实测参数建议）

### 5.1 显存排班（TTS 与数字人模型分时复用）

| 阶段 | 模型 | 权重常驻 | 峰值显存 | 备注 |
|---|---|---|---|---|
| ① 配音 | **GPT-SoVITS v2ProPlus**（0.21B） | ~1 GiB 级 | **≤3 GB** | 可与 ComfyUI 共存；CPU 也能跑；**升级档 IndexTTS-2.5 ≈5.1 GiB / Qwen3-TTS-1.7B ≈4.2 GiB** |
| ② 口型 | EchoMimicV3-Flash-pro | 3.47 GiB | **6.5~12 GB**（768×512 开 block_offload） | 主战场 |
| ③（可选）修嘴 | LatentSync 1.5 | ~5 GB | **~8 GB** | 官方最低 8 GB |
| **合计** | — | — | **分时执行，无需同时常驻** | 本机 ComfyUI 已 `--lowvram --reserve-vram 1.0`，够用 |

> ⚠️ **不要同时加载 TTS 与数字人模型**：16GB 会被 VAE + 文本编码器挤爆。先出 WAV，再跑口型。

### 5.2 端到端操作顺序

1. **写中文文案** → 建议**按句切分**（每段 ≤20 秒音频，避开 32GB 内存瓶颈）
2. **ComfyUI 里跑 TTS**（详见 §4.6 三阶段）：
   - Phase 1：**GPT-SoVITS v2ProPlus** → 5s~1min 参考音频做音色 → 导出 WAV（**最快、最不易踩 sm_120 坑**）
   - Phase 2：**IndexTTS-2.5** → 8 维情感向量 + 语速控制（`duration_factor` 0.5–2.0）
   - Phase 3：**Qwen3-TTS-1.7B-CustomVoice**（锁 `transformers==4.57.3` + eager 注意力）或 **VoxCPM2**（48kHz）
   - 🔴 **无论用哪个：先把文案里的数字/金额/编号展开成汉字**（没有中文 TTS 能可靠读长数字串）
3. **EchoMimicV3-Flash-pro** → 768×512 + `block_offload=on` + `partial_video_length=97` + TeaCache → 出片
4. （可选）**LatentSync 1.5** 精修口型（**注意必须正脸 + 25fps + 全片有人脸**）
5. **ffmpeg 拼接**多段成片

### 5.3 关键时间预期（10 秒中文口播，本机）

| 环节 | 预期耗时 | 依据 |
|---|---|---|
| TTS 配音 | **约 10~30 秒** | L40S 上 RTF 0.87 → 10 秒音频 ≈ 8.7 秒；5060 Ti 按 2~3 倍算 |
| 口型生成 | **约 10~12 分钟** | L40S 实测 3.63s→252s 外推（**5060 Ti 需自测，可能更慢**） |
| （可选）LatentSync 修嘴 | 约 2~6 分钟 | 🟨 3060 12G 上 10 秒约 2~6 分钟（旧数据） |
| **合计** | **约 12~20 分钟 / 10 秒成片** | — |

---

## 6. 客观质量数据汇总

### 6.1 🟢 跨模型 SyncNet 横比（Avatar-Forever 论文，2026-08）

来源：[arXiv 2608.12107](https://ar5iv.labs.arxiv.org/html/2608.12107v1)（港理工 + 字节 + AMD）。**EMTD 数据集，每项为「5 秒 / 30 秒」两档。**

| 模型 | LLM Judge Overall↑ | **Sync-C↑** | Sync-D↓ | FID↓ | **延迟(s)↓** |
|---|---|---|---|---|---|
| **InfiniteTalk** | 3.39 / 3.96 | **6.73 / 6.81** | **8.00 / 7.95** | 39.25 / 37.63 | **51.5 / 309.2** |
| **OmniAvatar** | 3.57 / **2.26** | 5.57 / 6.83 | 9.47 / 8.59 | 61.62 / 115.84 | **850 / >1 小时** |
| LiveAvatar | 3.65 / 4.12 | 6.67 / 6.62 | 8.45 / 8.08 | 39.23 / 61.17 | 53.0 / 321.0 |
| SoulX-FlashTalk | 3.68 / 3.98 | 6.83 / 6.83 | 7.97 / 7.96 | **38.91 / 33.46** | **25.4 / 125.3** |
| Avatar-Forever（本文） | **3.82 / 4.32** | **7.56** / 6.85 | 7.95 / 7.94 | 38.37 / 33.33 | **5.2 / 38.9** |

**🟢 用户盲测投票（Table 2，EMTD 长视频档，20 人，归一化 0–100）**

| 模型 | 得分 |
|---|---|
| Avatar-Forever | **76.00** |
| SoulX-FlashTalk | 60.23 |
| LiveAvatar | 57.68 |
| **InfiniteTalk** | **55.33** |
| **OmniAvatar** | **40.20（垫底）** |

> ⚠️ **局限**：论文**未标注延迟测量所用 GPU** → 延迟绝对值**只能相对比较，不能外推到 5060 Ti**。该表**未包含 MultiTalk / EchoMimic / FlashHead / LongCat / Wan2.2-S2V**。

### 6.2 🟢 跨模型 LSE 横比（arXiv 2608.16220，2026-08）

| 模型 | 参数量 | **LSE-C↑** | **LSE-D↓** |
|---|---|---|---|
| **InfiniteTalk** | — | **8.535** | **7.108** |
| **HunyuanVideo-Avatar** | 12.99B | 7.210 | 8.494 |
| **Wan-S2V** | — | 6.999 | 8.292 |
| Hallo3 | — | 5.352 | 9.828 |

来源：[arXiv 2608.16220](https://export.arxiv.org/pdf/2608.16220)（表 4，EMTD）。⚠️ 量级与经典 SyncNet 不同，**只能同表内比较**。

### 6.3 🟢 EchoMimicV3 论文 Table 1（512×512 半身，随机 300 条）

| 方法 | Sync-C↑ | Sync-D↓ | FID↓ | FVD↓ | IQA↑ | ID↑ |
|---|---|---|---|---|---|---|
| **EchoMimicV3-1.3B** | **5.49** | 9.67 | **42.45（最优）** | **496.76（最优）** | 4.91 | **1.0** |
| HunyuanAvatar-14B | **6.12** | **9.11** | 42.54 | 676.28 | **4.96** | **1.0** |
| OmniAvatar-1.3B | 5.61 | 9.58 | 53.24 | 705.21 | 4.92 | 0.97 |
| Hallo3 | 5.42 | 9.65 | 68.6 | 865.32 | 4.4 | 0.91 |
| **FantasyTalk-14B** | **4.05（最低）** | **11.01（最差）** | 45.03 | 603.95 | 4.85 | 0.96 |

来源：[arXiv 2507.03905v3](https://arxiv.org/pdf/2507.03905v3)。**读法：EchoMimicV3 用 1.3B 打赢了 14B 的 FantasyTalk，并在 FID/FVD 上全表最优。**

### 6.4 🟢 InfinityHuman 论文的 EMTD / HDTF 对比（arXiv 2508.20210）

**EMTD**（110 段 720P 半身带手，最长 74 秒）：

| 方法 | FID↓ | FVD↓ | IQA↑ | **Sync-C↑** | **Sync-D↓** |
|---|---|---|---|---|---|
| **Hallo3** | **74.10** | **250.12** | 1.95 | 7.31 | 9.30 |
| **MultiTalk** | 85.01 | 404.45 | 1.78 | 8.76 | 7.69 |
| **OmniAvatar** | 131.69 | 705.14 | 1.67 | 8.81 | 7.76 |
| **HunyuanVideo-Avatar** | 100.10 | 662.61 | 1.52 | 7.22 | 8.98 |
| InfinityHuman（本文） | **69.28** | **239.05** | **2.11** | 8.59 | 7.53 |

**HDTF**（100 段 512×512）：

| 方法 | FID↓ | FVD↓ | IQA↑ | **Sync-C↑** | **Sync-D↓** |
|---|---|---|---|---|---|
| **OmniAvatar** | 82.54 | 1104.99 | 2.16 | 5.40 | 9.13 |
| **MultiTalk** | 103.68 | 1040.43 | 2.07 | **6.34** | 8.47 |
| **Hallo3** | 104.51 | 1256.10 | **2.31** | 4.26 | 10.22 |
| **FantasyTalking** | 133.73 | 1307.20 | 2.11 | **1.11** | 12.88 |
| **HunyuanVideo-Avatar** | 139.39 | 2160.92 | 1.76 | 4.89 | 9.37 |

> ⚠️ 这是 InfinityHuman 作者自己的复现实验，**会系统性偏向自研方法**；且**不含 2026 年新模型**。**只用于老模型之间的相对排序。**

### 6.5 🟢 静音测试与唇形重绘系对比（HighSync，arXiv 2605.16918，2026-05）

| 方法 | HDTF LSE-C↑ | **静音测试**（越低越"没在听音频"） | 人类评分：图像/同步 |
|---|---|---|---|
| **LatentSync** | **7.58** | 0.81 | 3.95 / 3.68 |
| **Wav2Lip** | 7.38 | **0.84** | 3.78 / 3.22 |
| **MuseTalk** | 6.21 | **0.68（最差）** | **4.34（最高）/ 3.14（最低）** |
| HighSync（本文） | — | **0.93（最好）** | — / 4.01 |

> **静音测试的含义**：给模型一段静音，看嘴动不动。**MuseTalk 0.68 说明"不上音频也在动嘴"**。

### 6.6 🟢 EvalTalker 到底是什么 —— 已查明，**它不是 LSE 排行榜**

- **EvalTalker = THQA-MT**，上海交大 + 美团，**2025-12**（arXiv 2512.01340）
- 是**主观 MOS 质量评估数据集**，不是排行榜：**400 张真实人像 × 15 个 multi-talker 模型 → 5,492 条视频**，**40 名被试、219,680 次主观评分**，输出 MOS + 12 维失真向量
- **不提供 LSE-C / LSE-D 排名**；**论文正文也未给逐模型 MOS 数值**（只在图 3 可视化）→ **无法给出具体分数**
- 🟢 已查到的结论与**鲁棒性成功率**：原文称"**MultiTalk 持续产出更高质量的结果**""**MultiTalk 失真率最低**"；**MultiTalk 400/400**、**OmniAvatar 400/400**、HunyuanAvatar 400/400、**Hallo3 341/400**、**MuseTalk 243/400**、Sonic 372/400
- ⚠️ **该榜不含 InfiniteTalk、MoCha、LongCat、Wan2.2-S2V**
- ⚠️ **与 §6.1 存在张力**：THQA-MT 说 MultiTalk 最好，Avatar-Forever 说 InfiniteTalk > OmniAvatar（且没测 MultiTalk）→ **目前没有共识性的权威排名**

> **结论：不存在"EvalTalker 2026 榜单排名"可引用。** 2026 年主流横评用的是 **SyncNet 的 Sync-C / Sync-D**，不是 LSE-C / LSE-D。

---

## 7. 淘汰原因汇总与"未查到"清单

### 7.1 8 个重点模型的最终判定

| 模型 | 判定 | 核心原因 |
|---|---|---|
| **EchoMimic V3 / V3-Flash** | ✅ **采用（Top1）** | 官方测试过 **V100 16G**；768×512 仅 6.5GB；**原生中文**；Apache-2.0；有 ComfyUI 节点与第三方一键脚本 |
| **InfiniteTalk** | 🟡 **备选** | ComfyUI **官方核心原生节点**；中文原生；Apache-2.0；但 **3 分钟视频吃 >120GB 内存**、10 秒要 30~60 分钟 |
| **LongCat-Video-Avatar 1.5** | 🟡 **中期实验** | MIT + 13.6B + 原生多人 + 长视频；但 **v1.5 夸张表情缺陷至今未修**、**sm_120 专项警告**、**480p 44 秒要 2 小时** |
| **HunyuanVideo-Avatar** | 🟡 **仅在需要多人对话时** | Wan2GP 10GB 路径；但**许可排除 EU/UK/KR**、官方 ComfyUI 一年未落地、停更 9 个月 |
| **Wan2.2-Animate-2** | ❌ **场景不匹配** | **不吃音频**（要驱动视频）；且 GGUF 有**静默失败**陷阱 |
| **Wan2.2-S2V-14B** | ❌ **淘汰** | **官方要求 ≥80GB**，第三方实测 57.3GB，**无 16GB 成功案例**；16fps |
| **OmniAvatar** | ❌ **淘汰** | 官方称**需 64GB 内存**（本机 32GB）；1.3B 版**生态为零**；停更 13.5 个月 |
| **FantasyTalking** | ❌ **淘汰** | 官方最低 20GB；5G 档 42.6 s/it 不可用；停更 13 个月；中文前端是英文；量化失败归档；唇形同步垫底 |

### 7.2 其余候选的一句话判定（本场景下）

| 模型 | 判定 | 一句话 |
|---|---|---|
| **SoulX-FlashHead Lite 1.3B** | ✅ **强备选** | 🟢 峰值 **5.76 GB**（唯一两组第三方独立验证 <16GB）、热块 0.19 秒、Apache-2.0；但**画质最弱**（英中两组实测均称"不真实"）、仅 512×512、**中文能力仅厂商宣称未验证** |
| **MuseTalk 1.5** | ✅ 仅"给已有视频换嘴型"时 | 4GB 可跑、42FPS 实时、中英日；但**静音时也动嘴**、256×256、ComfyUI 主节点停更 |
| **LatentSync 1.5** | ✅ 可作修嘴环节 | 最低 8GB、官方明示改善中文；但停更一年 + 228 open issues + 必须正脸 25fps |
| **LatentSync 1.6** | ❌ | 官方 **18GB > 16GB** |
| **daVinci-MagiHuman** | ❌ 场景不匹配 | **文本→（视频+语音）联合生成，不接受外部音频**；社区 fp8 分支作者自称跑不起来 |
| **LTX-2.5 / JoyAI-Echo echoVid** | ❌ 场景不匹配 | 同上，**"renders picture and sound in one pass"**；许可非标准 OSI |
| **LiveAvatar**（ECCV 2026 Spotlight） | ❌ 硬件不够 | 单卡 **≥80GB**，FP8 后 48GB；但第三方横评里**质量第一、耗时最短**，值得盯盘 |
| **SoulX-FlashTalk-14B** | ❌ | 单卡 >64GB，`--cpu_offload` 后 40GB |
| **HunyuanPortrait** | ❌ | **根本不是音频驱动**（参考图 + 驱动视频）；仅学术用途禁止商用；零量化方案 |
| **MoCha（Meta 版）** | ❌ | **从未开源代码或权重**（GitHub 1 星，只有演示 mp4） |
| **MoCha（Orange-3DV 版）** | ❌ 场景不匹配 | CVPR 2026，AGPL-3.0，是**视频换人**模型 |
| **Wan2.5 / Wan3.0** | ❌ | 🔴 **不存在开源权重**；**"Wan2.5-S2V"不是开源模型** |
| **Ditto** | ⚠️ | 8GB+ 可跑但 **TRT 引擎按 Ampere_Plus 编译，sm_120 必须重转** |
| **Hallo3 / Hallo4** | ❌ | **官方只吃英文**；Hallo3 受 CogVideoX LICENSE 约束；Hallo4 无 LICENSE 文件且仅 38★ |
| **Sonic** | ❌ | **CC BY-NC-SA 明确不可商用**；官方基线是 32G GPU |
| **Wav2Lip** | ❌ | 🚫 **明令禁止商用**（LRS2 训练） |
| **DreamID-Omni** | ⚪ 可试 | Apache-2.0、FP8 ~12GB、模型卡写"Recommended for ≤16 GB GPUs"；但**语言标 en、无第三方实测** |

### 7.3 明确"未查到"的清单（不编造）

**显存/速度类**
1. **EchoMimicV3-Flash 在 5060 Ti / sm_120 上的实测秒数**（L40S 与官方 12GB 数据不能直接外推）
2. **HunyuanVideo-Avatar 走 Wan2GP 10GB 路径的任何「N 秒视频耗时」**（只有 2025-06 的宣称；2026-01 有用户抱怨"太慢"，作者答"没有现成 LoRA 加速器"）
3. **HunyuanVideo-Avatar 在 16GB 卡上的任何成功实测**（成功/失败都没有，只有 RTX 4070 Ti 16GB + 32GB RAM 的提问）
4. **HunyuanVideo-Avatar 在 32GB 系统内存下能否跑 int8**（成功案例全带 96/97/192GB RAM → 本机只能标为**推断偏不可行**）
5. **Wan2.2-S2V 在 12GB/16GB 卡上的任何成功实测**，及**任何消费级卡的峰值显存数字**
6. **「S2V 在 16GB 上必须把文本编码器 CPU offload」的明确第三方表述**（官方文档不给显存门槛）
7. **Wan-Animate-2 的 GGUF Q4_K_M 在 16GB 上的实测显存与速度**（拿到的是 `int8_convrot` 的 7.3GB / 126.8s，不是 GGUF）
8. **`WanAnimate2Cache` 的实际加速比**——只有官方"约减半"宣称，**零第三方 A/B 数字**
9. **OmniAvatar 在 16GB 上的任何实测**
10. **FantasyTalking 在 16GB 上的任何成功实测**（只有 RTX 5070 Ti 16GB 的**失败**报告）
11. **InfiniteTalk 在 5060 Ti / 4060 Ti 上的具体耗时**（5060 Ti 只有"跑通"，5080 的 1300s/5s 只能当上界参考）
12. **LongCat 1.5 的官方最低显存数字**（官方从未声明）与其 LSE 数字
13. **MoCha（Meta 版）的权重、显存、许可证**（从未开源）
14. **多数中文 TTS 在 5060 Ti 上的实测速度**（已拿到 3 个：CosyVoice3 **RTF 1.88**、IndexTTS-2 **RTF 2.92**（同一台 5060 Ti 对照）、OmniVoice ~0.6s/5s；但 **GPT-SoVITS / Qwen3-TTS / VoxCPM2 / GLM-TTS 在本机型上均无实测**）
15. **各中文 TTS 的 int8 / GGUF 量化后显存与 RTF 对照**——只知道**存在**这些量化仓库（`Serveurperso/Qwen3-TTS-GGUF`、`Richasy/IndexTTS-2.5-GGUF`、`cstr/cosyvoice3-0.5b-2512-GGUF`、`DennisHuang648/VoxCPM2-GGUF`、`OpenMOSS-Team/MOSS-TTS-GGUF`、`Serveurperso/OmniVoice-GGUF`），**无任何权威量化对照表**
16. **VoicePing 两个基准所用 GPU 型号**——其资源表只有 GPU util/power，**未给型号**，故其 RTF 绝对值可信度受限（已按 🟡 标注）
17. **CosyVoice / IndexTTS 的 sm_120 issue 具体修复命令**——只能确认 issue **#1815 / #1318 / #295 存在且标题直指问题**，但本机 GitHub HTML 与 API 均不可达，**无法读正文** → **需在能访问 GitHub 的环境自行核对**
18. **GPT-SoVITS 的第三方中文 CER/MOS/SIM**——它**完全未被** VoicePing 两个基准、MOSS 官方表、CosyVoice 官方表收录
19. **GLM-TTS 的官方或社区 ComfyUI 节点** + **Fun-CineForge / Step-Audio 2 的 ComfyUI 节点**——多轮检索（含 ComfyUI Manager 生态、TTS-Audio-Suite 19 引擎清单）**均未发现**
20. **一份可信的、带 GPU 型号与可复现命令的《2026 中文 TTS 大横评》**——知乎那篇《开源语音大模型中文表现三级分级对比报告》返回 **HTTP 403** 无法核验；其余中文横评多为无 GPU 型号的聚合/AI 生成内容，**均不采信**

**社区/来源类**
15. **Reddit r/comfyui、r/StableDiffusion 的原文** —— 本机 reddit.com DNS 被污染，**所有 redlib / safereddit 镜像亦超时** → **本次一条 Reddit 原文都没取到**；涉及 Reddit 的说法全部来自搜索引擎索引层转述，**按二手降级**
16. **知乎 / B站帖文原文** —— 本机 403 / 不可达；社区口碑改用 GitHub Issues + HF 讨论区 + CSDN / SegmentFault / dev.to 替代
17. **部分 GitHub issue 正文** —— 通过 `gh-proxy.com` 代理 GitHub API 取得大部分，**少量仅能核验编号与标题**

> ### ⚠️ 已识别并剔除/降级的不可信来源
> - **两篇 CSDN「Wan2.2-S2V-14B 性能基准测试」**：AI 批量生成的**伪评测**，含明显编造（**把 4090 写成 16GB 显存**、虚构 `moe_expert_capacity` 参数、编造 L40/A6000/H100 全套数据）→ **本文未采信其任何数字**
> - **`instavar.com/pdf/HunyuanVideo_Avatar_*.pdf`、`instavar.com/pdf/InfiniteTalk_*.pdf`**：SEO 聚合站自动生成的 "TL;DR" 页，**无原始测量、无 GPU 型号** → **剔除**
> - **CSDN《数字人EchoMimicV3 落地实践》（2026-08-19）**：逐段读过——内容实为**官方 README 复述 + 环境报错修复**，"最低 16G / Flash 版 12G"与官方口径一致，但**全文没有任何显卡型号 + 耗时** → **仅作旁证，不作数据源**
> - **今日头条《8G显存跑数字人？LongCat 实战指南》等标题党**：数据为厂商宣称搬运 → **未采信**
> - **一篇 Sonic 显存实测帖（CSDN）**：行文高度模板化、疑似 AI 生成 → 已标注"可信度低，仅作量级参考"
> - **唯一需注明出处的 AI 参与案例**：SageAttention #321 中某用户的修复代码自述"由 Gemini V3 提供"——**代码来源存疑，但其硬件/版本事实（5060 Ti / torch 2.9.1 / triton 3.6 / sa3.0 / 马赛克伪影）可用**
>
> **提醒**：2026 年"数字人选型 / TTS 选型"是流量话题，中文平台 AI 伪横评极多。**凡未给 GPU 型号 / 未给可复现命令 / 数字过于整齐的表格，先怀疑。**

---

## 8. 方法与来源

### 8.1 检索方法

- **主调研**：多轮 `web_search` + `web_fetch`（40+ 次检索、30+ 次页面抓取）
- **并行子研究员（6 个独立会话）**：
  - A（Wan 系 / EchoMimic）、B（InfiniteTalk / MultiTalk / OmniAvatar / MoCha）、C（腾讯美团系）、D（LatentSync / MuseTalk / Ditto / Hallo3+4 / Wav2Lip）—— 均交付，已交叉核对
  - **E（中文 TTS 专项）**、**F（8 模型显存速度空白 + sm120 专项）** —— F 交付（**12 轮检索 ≈40 条 query + ≈60 次 GitHub issue / HF API 抓取**），其数据已并入 §0、§2、§2.5 与各模型小节
- **本机环境实拉**（非推测）：通过 SSH 到 GPU 机（192.168.31.31）执行 `torch.cuda.get_arch_list()` 与 `strings` 检查 SageAttention `.so` 的 cubin 架构 —— 见 §0.0
- **关键绕行**（本机 192.168.31.76 **无法直连** github.com / api.github.com / huggingface.co / reddit.com / 知乎）：
  - `raw.githubusercontent.com`（可达）取 README 与 LICENSE
  - **`hf-mirror.com/api/models/<id>?blobs=true`** 取**权威文件体积与 license 字段**（本文体积数字的主要来源，比 README 文字描述可靠）
  - `ar5iv.labs.arxiv.org` / `export.arxiv.org` 取论文
  - **`gh-proxy.com`** 代理 GitHub API 取 issue 正文、星标与 commit 时间
  - ⚠️ **已知盲区**：**Reddit 全部镜像超时 → 零 Reddit 原文**；部分 issue 正文与知乎/B站帖无法读取，相关结论只引用**编号、标题与可抓取片段**并明确标注

### 8.2 可信度分级

- 🟢 **第三方实测**：Tight Studio 2026-08 六模型同条件横评（峰值显存+耗时+输出规格，方法透明）｜Avatar-Forever 论文横评（含用户盲测）｜HF `/api` 的文件体积与许可字段｜LiveTalking FPS 表｜GitHub API 星标/commit 时间｜CosyVoice 第三方 benchmark（RTF/TTFB）
- 🟡 **厂商/论文宣称**：各 README 的 FPS、FID/Sync-C、显存档位、胜率
- 🟨 **中文社区个案**：SegmentFault 一键整合包、CSDN 分析帖、B站整合包（有价值但样本小）
- 🔴 **未查到**：明确标注，**未做任何数字推测**（唯一的推断已显式标注为"推断"）

### 8.3 主要来源（按主题）

**数字人模型**：[Tight Studio 六模型横评 2026-08](https://tight.studio/zh-cn/blog/open-source-talking-avatar-models/) · [Avatar-Forever arXiv 2608.12107](https://ar5iv.labs.arxiv.org/html/2608.12107v1) · [EchoMimicV3 arXiv 2507.03905](https://arxiv.org/pdf/2507.03905v3) · [InfinityHuman arXiv 2508.20210](https://ar5iv.labs.arxiv.org/html/2508.20210v1) · [HighSync arXiv 2605.16918](https://ar5iv.labs.arxiv.org/html/2605.16918) · [PC-Talk arXiv 2503.14295](https://ar5iv.labs.arxiv.org/html/2503.14295) · [LSE 横比 arXiv 2608.16220](https://export.arxiv.org/pdf/2608.16220) · [EvalTalker arXiv 2512.01340](https://ar5iv.labs.arxiv.org/html/2512.01340) · [ComfyUI 官方 Wan2.2-S2V 教程](https://docs.comfy.org/tutorials/video/wan/wan2-2-s2v) · [ComfyUI Wan-Animate-2 博客](https://blog.comfy.org/p/wan-animate-2-is-now-available-in) · [LongCat-Video GitHub](https://github.com/meituan-longcat/LongCat-Video) · [InfiniteTalk GitHub](https://github.com/MeiGen-AI/InfiniteTalk) · [OmniAvatar GitHub](https://github.com/Omni-Avatar/OmniAvatar) · [HunyuanVideo-Avatar GitHub](https://github.com/Tencent-Hunyuan/HunyuanVideo-Avatar) · [EchoMimicV3 GitHub](https://github.com/antgroup/echomimic_v3) · [FantasyTalking GitHub](https://github.com/Fantasy-AMAP/fantasy-talking)

**ComfyUI 生态**：[smthemex/ComfyUI_EchoMimic](https://github.com/smthemex/ComfyUI_EchoMimic) · [vokilook/comfyui-echomimic-setup](https://github.com/vokilook/comfyui-echomimic-setup) · [rookiestar28/ComfyUI-LongCat-Avatar](https://github.com/rookiestar28/ComfyUI-LongCat-Avatar) · [kijai/ComfyUI-WanVideoWrapper](https://github.com/kijai/ComfyUI-WanVideoWrapper) · [ComfyUI PR #10179](https://github.com/Comfy-Org/ComfyUI/pull/10179) · [HM-RunningHub/ComfyUI_RH_FlashHead](https://github.com/HM-RunningHub/ComfyUI_RH_FlashHead) · [Wan2GP](https://github.com/deepbeepmeep/Wan2GP)

**sm120 / Blackwell**：[Rogala/AI_Attention（RTX 5000 系加速包）](https://github.com/Rogala/AI_Attention) · [woct0rdho/SageAttention](https://github.com/woct0rdho/SageAttention) · [kijai #1875（RTX 5060 修复）](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1875) · [LongCat #141（sm120 警告）](https://github.com/meituan-longcat/LongCat-Video/issues/141)

**中文 TTS（横评与实测）**：[OpenMOSS/MOSS-TTS 对比表](https://github.com/OpenMOSS/MOSS-TTS/blob/main/README_zh.md) · [VoicePing 中文情感 TTS 基准](https://voiceping.net/en/blog/research-ja-zh-emotional-tts-benchmark/) · [VoicePing 中文数字保真基准](https://voiceping.net/en/blog/research-mandarin-tts-numeric-fidelity/) · [cosyvoice-docker BENCHMARK（L40S，RTF 0.87）](https://github.com/neosun100/cosyvoice-docker/blob/main/BENCHMARK_REPORT.md) · [托尼不是塔克：CosyVoice3/IndexTTS2 在 5060 Ti 16G 实测 RTF 1.88/2.92](https://www.tonyisstark.com/4660.html) · [smeltcore 5060 Ti 配方库](https://smeltcore.com/recipes/qwen3-tts-1-7b-base-on-rtx-5060-ti-multilingual-voice-cloning-in-10-languages/)
**中文 TTS（模型与许可）**：[Fun-CosyVoice3-0.5B-2512](https://huggingface.co/FunAudioLLM/Fun-CosyVoice3-0.5B-2512) · [Qwen3-TTS-1.7B-Base](https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base) · [IndexTTS-2.5](https://huggingface.co/IndexTeam/IndexTTS-2.5) · [IndexTTS LICENSE（bilibili 协议原文）](https://raw.githubusercontent.com/index-tts/index-tts/main/LICENSE) · [GPT-SoVITS](https://github.com/RVC-Boss/GPT-SoVITS) · [VoxCPM2](https://huggingface.co/openbmb/VoxCPM2) · [GLM-TTS](https://huggingface.co/zai-org/GLM-TTS) · [F5-TTS LICENSE（CC-BY-NC）](https://huggingface.co/SWivid/F5-TTS) · [Fish-Speech LICENSE](https://raw.githubusercontent.com/fishaudio/fish-speech/main/LICENSE) · [ChatTTS LICENSE](https://raw.githubusercontent.com/2noise/ChatTTS/main/LICENSE) · [VibeVoice-1.5B](https://huggingface.co/microsoft/VibeVoice-1.5B) · [Fun-CineForge](https://huggingface.co/FunAudioLLM/Fun-CineForge) · [OmniVoice（k2-fsa）](https://github.com/k2-fsa/OmniVoice)
**中文 TTS（ComfyUI 节点）**：[filliptm/ComfyUI_FL-CosyVoice3](https://github.com/filliptm/ComfyUI_FL-CosyVoice3) · [joyfoxai/ComfyUI-Index-TTS-25](https://github.com/joyfoxai/ComfyUI-Index-TTS-25) · [AICoderTudou/ComfyUI-TD-Qwen3TTS](https://github.com/AICoderTudou/ComfyUI-TD-Qwen3TTS) · [flybirdxx/ComfyUI-Qwen-TTS](https://github.com/flybirdxx/ComfyUI-Qwen-TTS) · [AIFSH/ComfyUI-GPT_SoVITS](https://github.com/AIFSH/ComfyUI-GPT_SoVITS) · [nkxx188/ComfyUI-VoxCPM-nkxx](https://github.com/nkxx188/ComfyUI-VoxCPM-nkxx) · [richservo/comfyui-moss-tts](https://github.com/richservo/comfyui-moss-tts) · [diodiogod/TTS-Audio-Suite（19 引擎）](https://github.com/diodiogod/TTS-Audio-Suite)
**中文 TTS（sm_120 直击本机的 issue）**：[CosyVoice #1318（5060ti 16g 无法启动）](https://github.com/QwenAudio/CosyVoice/issues/1318) · [CosyVoice #1815（PyTorch 2.4+ & RTX50 系 sm_120）](https://github.com/QwenAudio/CosyVoice/issues/1815) · [IndexTTS #295（GPU 检测失败）](https://github.com/index-tts/index-tts/issues/295) · [OmniVoice #155（Blackwell 乱码）](https://github.com/k2-fsa/OmniVoice/issues/155) · [OmniVoice #83（sm_120 shared memory 墙）](https://github.com/k2-fsa/OmniVoice/issues/83) · [flash-attention #2168（sm_120 无内核）](https://github.com/Dao-AILab/flash-attention/issues/2168)

---

*文档生成时间：2026-09-22｜范围：2026-09 时点可得公开信息*
*下载页：`http://192.168.31.76:8899/49-数字人选型调研/离线音频驱动数字人模型调研.md?preview=1`*
