# 数字人选型结论（离线口播 · 单卡 RTX 5060 Ti 16GB · 全本地零成本）2026-09-22

> 需求：**离线口播成片**（一张图/一段视频 + 人声音频 → 口型同步视频），**必须本机跑、不用云端 API**。硬件 = GPU 机 192.168.31.31 单卡 RTX 5060 Ti 16GB（sm120）+ 32GB 内存 + ComfyUI（2026-09-20 版本）+ 磁盘剩 138 GiB。
>
> **版本说明**：v2（2026-09-22 下午修订）。v1 曾把 `Wan2.2-S2V-14B` 排为首选；后台深度调研拿到 **2026-08 第三方六模型同条件横评**（Tight Studio，Modal 固定 commit 部署、同一头像 + 同一段 3.63 秒音频）后，**排序被修正**——原因见第二节。本文所有关键数字都标了来源等级：🟢 第三方实测 / 🟡 厂商宣称 / 🔴 未查到。

---

## 一、修正后的结论

### 先分清两类模型（最容易选错的地方）

| | **A 类：音频驱动（给现成录音对口型）** | **B 类：联合音视频生成（自己生成语音）** |
|---|---|---|
| 输入 | 图/视频 **+ 你提供的音频** | 文本（+ 可选参考图） |
| 对你 | ✅ **正是你要的** | ❌ **不能给现成录音对口型** |
| 代表 | FlashHead、EchoMimicV3、LongCat 1.5、Wan2.2-S2V、InfiniteTalk、MuseTalk、LiveAvatar | daVinci-MagiHuman、LTX-2.5 / JoyAI-Echo echoVid |

### 按你的场景推荐

**路径 B-1：一段已有视频，只想换成另一段录音的嘴型** → **`MuseTalk 1.5`**
- 🟦 官方 RTX 3050 Ti Laptop **4GB** 可跑 fp16；LiveTalking 实测 3080Ti **42 FPS**、4090 **72 FPS**（实时线）
- ✅ 中文/英文/日文明确；README 明文「代码 MIT + 模型可商用」（但 GitHub API 许可字段是 NOASSERTION，子模型需各自核验）
- 🔴 坑：分辨率 **256×256**，高清必须外挂 GFPGAN 超分

**路径 B-2：一张图 + 录音，全新生成口播视频** → 按下面的三步走

| 顺序 | 模型 | 为什么是它 | 显存（可跑档） | **10 秒成片耗时** | 代价 |
|---|---|---|---|---|---|
| **① 首选（但必须先验证 sm120）** | **EchoMimicV3-Flash-pro 1.3B**（蚂蚁，Apache-2.0） | **中文最强**：原生 **chinese-wav2vec2**；**官方测试 GPU 列表含 V100 16G**；**官方 README 明确写「12G VRAM Requirement」**（官方量化版 `app_mm.py` 最低 12 GB）；768×512 开 `block_offload` 仅 **6.5 GB**（支持到 768×768、8 步、无需 face mask）；ComfyUI 节点给 16G 档参数 `partial_video_length=97` | 6.5 GB（768×512 + block_offload） | 🟢 **10 秒约 14 分钟**（官方口径：5 秒 7 分钟） | 🔴🔴 **最大未知数：issue #62 —— RTX 5090 32GB 用官方量化版也跑不通（2025-12-31，0 回复，疑似 sm120）** → **必须先小规模验证再谈批量**；默认配置实测 33.7 GB 不调参必 OOM；**非流式**（`partial_video_length` 分段）；画面运动幅度小 |
| **② 保底** | **SoulX-FlashHead 1.3B Lite**（Soul App，Apache-2.0） | **唯一被两组独立第三方验证 <16GB** 的全功能音频驱动模型；ComfyUI 原生节点；无限时长流式分块 | 🟢 峰值 **5.76 GB**（权重全 F32，**转 fp16 可降到 ~3 GB**） | 🟢 **约 1~2 分钟**（热启动 0.19 s/块） | 🔴 **画质最弱**（两组实测均称「不真实」）；仅 512×512 |
| **③ 已有视频换嘴型** | **MuseTalk 1.5**（腾讯音乐） | 官方 4GB 卡可跑 fp16；中英日明确；代码 MIT + 模型可商用 | ≤8 GB（**5060 Ti 实测 ~3.6 GB**） | ⚠️ **别按「官方实时」理解**：LiveTalking 封装的 3080Ti 42 FPS 是外层功劳；**官方实现直跑 5060 Ti 实测仅 ≈5.8 FPS**（issue #409，361 帧验证），且官方成员确认**不支持音频流式**（issue #33） | 🔴 **静音测试 0.68 全场最低**（不给音频也动嘴）；256×256 需外挂 GFPGAN |
| ⚠️ 中期（长视频/多人才考虑） | **LongCat 1.5**（MIT）／**InfiniteTalk**（Apache-2.0） | LongCat：原生多人 + 长视频续写 + 中文口型；InfiniteTalk：ComfyUI 已有**官方核心节点**，**已在 RTX 5060 16GB 上跑通**（需升到 torch 2.9.1+cu130） | LongCat INT8 **15.89 GB** 或 GGUF Q4 **12.07 GB** + `block_num=1`；InfiniteTalk GGUF Q4 底座 11.34 GB + patch 1.4 GB + block swap 30~40 | 🟡 **30 分钟 ~ 2 小时**（RTX 5080 16G 实测 640×640 5 秒 = 1300 秒） | 🔴 **16GB 是 Wan 系 14B 的最低门槛**（4070 Super 12GB 直接 OOM），**本机卡在门槛上、没有余量同时加载两个模型**；LongCat 仅 480p、表情缺陷未修；**InfiniteTalk 3 分钟视频吃 >120 GB 内存**（本机 32GB）→ 必须切 ≤20 秒分段 |

**本机算力标尺（唯一有逐秒实测的模型）**：`Wan2.2-Animate-2` 的 `distill int8_convrot` 部分卸载 ≈ **7.3 GB 显存 / 8.6 GB 内存**，**49 帧 @480×854 = 126.8 秒**（10 步）——**但它不吃音频**（要驱动视频），只能当"这张卡跑 14B 级视频有多慢"的参照。另注意坑：`WanAnimate2Cache` 设 `device=gpu + dtype=int8` 再配 MultiGPU patch 会**静默杀进程**，必须 `device=cpu + dtype=default`。

**`Wan2.2-S2V-14B` 的角色降级但不淘汰**：
- 它仍是 **ComfyUI 生态最顺 + 生态位中心**（Live Avatar、InfiniteTalk、Bernini-R 全挂在它身上），Apache-2.0。
- 但第三方实测显示：官方 40 步流程在 **H200 上峰值 58,681 MiB**、3.8 秒输出要 **13 分钟**（6 个成功模型里**最慢**）；输出只有 **16fps**；**HF 自 2025-09-17 起一年没更新**；**中文音频未查到可靠结论**（音频编码器是 `wav2vec2-large-xlsr-53-english`）。
- 结论：**当作「量化底座 + 长视频扩展件」用**（GGUF Q4_K_M 12.91 GiB / Q2_K 8.86 GiB，官方原生工作流 + Lightning 4 步），而不是当作第一顺位出片主力。

**中文口型优先级**：`LongCat 1.5`（Whisper-large-v3，原生中英） ≈ `EchoMimicV3 v1.5`（专门改善中文） > `MuseTalk`（中英日明确） > `Wan2.2-S2V`（英文编码器，中文未验证）。

---

## 二、为什么排序被修正：16GB 上「质量与显存严格成反比」

第三方横评（🟢 [Tight Studio，2026-08-23](https://tight.studio/zh-cn/blog/open-source-talking-avatar-models/)）同一条件实测：

| 模型 | 峰值 VRAM | 3.63 秒音频耗时 | 输出规格 |
|---|---|---|---|
| LiveAvatar（阿里） | **61,401 MiB** | 181.44 s（最快） | 384×704 @25fps |
| Wan2.2-S2V-14B | **58,681 MiB** | **780.29 s（最慢）** | 512×896 @**16fps** |
| SoulX-FlashTalk-14B | 57,805 MiB | 331.93 s | 416×720 @25fps |
| LongCat-Video-Avatar 1.5 | 46,827 MiB | 233.08 s | 480×832 @25fps |
| EchoMimicV3-Flash | 33,726 MiB | 251.94 s | 480×848 @25fps |
| **SoulX-FlashHead Lite** | **5,763 MiB** | 235.31 s（首块 155.7 s 为编译，之后 **0.19 s/块**） | 512×512 @25fps |

横评原文：**「16 GB 以下：SoulX-FlashHead Lite 是经过验证的唯一一款完全适配的全功能生成器。」**

画质的主观排序则是：**LiveAvatar（最清晰）> EchoMimicV3-Flash（最佳平衡）> LongCat 1.5（最有表现力）> FlashHead（最不逼真）**。
→ **能跑的画质弱，画质好的跑不动**。这就是 16GB 的现实，任何「一张图出电影级数字人」的说法在这张卡上都不成立。

---

## 三、Wan2.2-S2V 量化路线的具体数据（当扩展件用时）

来源：HF 模型卡 + 社区 GGUF 实测体积（2026-09-22）。

| 项目 | 事实 |
|---|---|
| 许可证 | **Apache-2.0**（可商用） |
| 架构 | 14B **单体**（不是 T2V/I2V 的 27B MoE 双专家） |
| 官方单卡门槛 | `generate.py` 注释 **≥80GB VRAM**，第三方 H200 实测峰值 58.7 GB |
| GGUF 档（`calcuis/wan-s2v-gguf`，含完整工作流 JSON） | Q8_0 18.27 / Q6_K 15.10 / **Q4_K_M 12.91** / IQ4_XS 11.32 / **Q2_K 8.86 GiB** |
| 配套 | 文本编码器三选一（cow-umt5xxl Q2_K 3.67 GiB 等）、`wav2vec2...f16.gguf` 0.59 GiB、VAE 0.254 GiB |
| 本机状态 | ComfyUI 2026-09-20 + `ComfyUI-GGUF` 已装；`models/audio_encoders/` 为空，需补 |
| 长视频 | 官方工作流 `Video S2V Extend` 每片 **77 帧 ≈ 4.81 秒 @16fps**，按 `音频秒数 × 16 ÷ 77` 算节点数 |
| 生态升级件 | **Live Avatar**（阿里 Quark+中科大，ECCV 2026 Spotlight，Apache-2.0）只是它上面的 **1.26 GiB LoRA**（4 步、无限长、20FPS@5×H800）；**官方单卡离线推理尚未发布**，可试挂 LoRA，属实验性 |
| **InfiniteTalk**（给已有视频配音、无限时长） | ComfyUI 适配权重仅 2.53 GiB（需 Wan2.1-14B 底模）；但 kijai wrapper 有专门针对 **RTX 5060 的求助 issue #1875**、以及 **#1185「渲染极慢」**；官方自曝 I2V 超过 1 分钟**色彩偏移明显** |
| ⚠️ LTX-2.5（本机已有权重+audio VAE） | 属 **B 类**（模型自生成语音），**不接受你提供的录音**；社区有 lipsync 条件化工作流但未验证能稳定吃外部音频 → **先别指望它当主力**，只适合「文本→数字人自说自话」 |

---

## 四、本地完整链路与配音

```
中文文案 →(本地 TTS)→ 人声 WAV（mono / 44.1~48kHz / 干净无 BGM）
   →(可选：人声分离去 BGM)→(A 类模型对口型)→ 口型视频
      →(可选：VideoHelperSuite 拼接 / RTX VSR 放大 / FaceRefine 修脸)→ 落盘 + 归档相册
```

### 4.1 中文配音（文案 → 人声）本地 TTS 选型（hf-mirror 下载量/点赞实测）

| 模型 | 许可证 | 语言 | 关键实测 | 定位 |
|---|---|---|---|---|
| **GPT-SoVITS v2ProPlus** | **MIT（无附加条件）** | 中文 | README 明确列出测试通过环境含 **PyTorch 2.7.0/CUDA 12.8、2.8.0dev/CUDA 12.8**；**RTF 0.028 @4060 Ti → 10 秒音频 ≈0.28 秒**（全表最快） | ✅ **离线链路首选（Phase 1）**——sm_120 最友好、速度压倒性；坑：**无情感控制**、🟡 无第三方中文 CER/SIM 数据 |
| **IndexTTS-2.5**（2026-08-10 新版） | bilibili 自定义协议，**免版税、普通规模免费商用**（仅 >1 亿 MAU 或 >10 亿 RMB 年收入需单独授权） | zh / en | **8 维情感向量**（同级唯一）、**小数读法 100%（唯一满分）** | **Phase 2 上情感**；⚠️ **速度争议极大**（官方 RTF 0.2065@4090 vs **5060 Ti 实测 2.92**）+ **issue #295 GPU 检测失败（与 Blackwell 相关）** |
| **Qwen3-TTS**（`0.6B-CustomVoice` / `1.7B-Base`） | **Apache-2.0**（repo 13k⭐） | 中文母语级 | 388 万下载、两套 ComfyUI 节点；第三方 VoicePing 称 *"the strongest balanced model in this benchmark"*；官方**首包 97 ms**、**本次唯一「sm_120 零 issue」的 TTS** | Phase 3 追质量；⚠️ **中文长数字串 30/30 全失败（0%）**、**必须锁 `transformers==4.57.3`** |
| **LongCat-AudioDiT**（美团） | **MIT** | 中文 | **中文相似度全场最高（SIM 81.8 / CER 1.09）**，非流式——离线口播不吃亏 | 追中文相似度可选；⚠️ 待验：3.83B F32 ≈ **15 GB+** 能否进 16GB |
| **VoxCPM2**（面壁+清华，2B） | Apache-2.0 | 中文 | **中文 CER 4.4% 全表最低** | 追字准可选 |
| Fun-CosyVoice3-0.5B-2512 | Apache-2.0（代码+权重） | 11 语 + 18 种中文方言 | 中文相似度 CV3-Eval 80.01 最高 | ⚠️ **降为「备选，须先验证能否启动」**：[issue #1318「5060ti 16g 运行 CosyVoice2 无法启动」](https://github.com/QwenAudio/CosyVoice/issues/1318) + [#1815 sm_120 兼容](https://github.com/QwenAudio/CosyVoice/issues/1815) |

🔴🔴 **最容易被忽略、后果最严重的一条通用规则：没有任何中文 TTS 能可靠读长数字串。** 实测：Qwen3-TTS 标识符 **0%**、IndexTTS-2.5 **40%**、CosyVoice3 标识符 90% 但**货币项仅 46.7%，且错误多是把金额本身改掉**。→ **必须在 pipeline 预处理里把「数字 / 金额 / 编号 / 日期」展开成汉字**（这一步做不做，决定口播成品是否可信），展开后再送 TTS。

**TTS 落地顺序（写进 §4.6）**：Phase 1 `GPT-SoVITS` 跑通链路 → Phase 2 `IndexTTS-2.5` 上情感 → Phase 3 `Qwen3-TTS / VoxCPM2` 追质量。全程：参考音频 **≤3.5 秒**、不开 sage_attn、torch 用 **cu128+**、**与数字人模型串行执行**（别同时驻留）。

⚠️ **许可红线（先前的说法要更正）**：**IndexTTS 不是 Apache-2.0**，是 bilibili 自定义协议（普通规模可商用）；**F5-TTS 权重 CC-BY-NC**、**Spark-TTS 权重 CC-BY-NC-SA（GitHub 写 Apache，自相矛盾）**、**Fish-Speech 商用需单独授权**、**ChatTTS 是 AGPL+CC-BY-NC 且官方故意加噪降质**、**Higgs Audio v3 非商用**、**VibeVoice 已被微软下架** → 全部出局。**教训：不要信 HF 镜像卡的 license 字段，要读仓库 LICENSE 原文。**
⚠️ **指标口径警告（4 个实例）**：Qwen3-TTS 自报 0.77 vs 第三方 1.22~1.33（1.6×）；Fish S2 Pro 0.54 vs 3.62（**6.7×**）；OmniVoice 0.84 vs 3.41（4×）；GPT-SoVITS 1.6 vs 7.34（4.6×）。→ **引用必须带榜单名，最终用 [seed-tts-eval](https://github.com/BytedanceSpeech/seed-tts-eval) 自测。**

**音频预处理是第一杀手**：先做**人声分离**（干净人声轨的唇形质量远好于混 BGM）；**mono + 44.1/48 kHz**；FlashHead 官方要求参考图**正脸、居中、上半身**，音频**最好 16 kHz**。
**本机现成后处理**：`Nvidia_RTX_Nodes_ComfyUI`（RTX VSR）、`ComfyUI-H3-FaceRefine`、`comfyui-VideoHelperSuite`。

---

## 五、淘汰清单

| 方案 | 淘汰原因 |
|---|---|
| **LiveAvatar / SoulX-FlashTalk-14B / Wan2.2-Animate-14B** | 单卡需求 61~64 GB（Animate INT8 17.15 GiB 已超 16GB）；LiveAvatar 单卡离线推理未发布 |
| **FantasyTalking** | **有直接的 16GB 失败证据**：RTX 5070 Ti 16GB 明确失败（issue 标题就是 "Doesn't work with 16GB VRAM"）、RTX 5090 32GB 最小设置 OOM；官方**明说必须装 flash_attn 否则结果错误**（sm120 大坑）；A800 40G 上 30 秒视频=1 小时、1 分钟音频>19 小时；官方最低档 20 GB / 32.8 秒每迭代；第三方论文实测唇形同步指标最差（Sync-C 1.11 vs 其他 4~6） |
| **HunyuanVideo-Avatar** | **从「能跑」下调为「本机偏不可行」**：所有成功案例都带 **96 / 97 / 192 GB 系统内存**（int8 权重会被 pin 进内存约 **12.8 GB**，本机只有 32GB）；V100 32GB + 64GB RAM 在 Wan2GP 里仍 OOM；官方 ComfyUI 支持一年多未落地（Open-source Plan 未打勾）；社区节点门槛写 >24G；许可证非标准 OSI |
| **daVinci-MagiHuman / LTX-2.5 echoVid** | **B 类**：自己生成语音，不接受外部录音；社区 fp8 分支作者自述「跑不起来、EXPERIMENTAL」 |
| **Sonic** | **CC BY-NC-SA 4.0 不可商用**（官方要求商用走腾讯云）；仅测于 32G 单卡 |
| **OmniAvatar-14B** | HF 仓库只剩 1.15 GiB 的 `pytorch_model.pt`，权重不完整；且官方称需 **64GB 内存** |
| **HunyuanPortrait** | **根本不是音频驱动**——它是「参考图 + 驱动视频」驱动，与口播需求不匹配 |
| **MoCha（Meta）** | Meta 版**从未开源**，无权重可用 |
| **Bernini-R-S2V** | 作者自己写明「**不是 SOTA audio-to-video**」；双专家 int8 各 17.72 GiB；音频上限 9~15 秒 |
| **Chanjing-Avatar（蝉镜）** | 2026-08 才放出，仅适配器权重（14B 目录 1.15 GiB，须配 Wan2.1 底座），下载量 16~90，无第三方实测 |
| **3D / 3DGS 数字人** | 开源 3DGS 说话头几乎全非商用（清华许可禁商用、GaussianAvatars/SplattingAvatar 为 CC-BY-NC-SA），且叠了 FLAME/BFM/SMPL 非商用底座；仓库普遍锁 py3.7 + torch1.12 + CUDA11，与 sm_120 不兼容。详见 `3D数字人_一体化平台_授权风险.md` |
| **Wan-Animate-2 / Wan2.2-Animate** | 视频驱动（动作迁移），不是音频驱动；且 INT8 15.51 / 17.15 GiB 都很紧 |

---

## 六、许可证红线（摘要，详见 `3D数字人_一体化平台_授权风险.md`）

1. **Wav2Lip 权重严禁商用**——却常被默认打包进 Linly-Talker / SadTalker / AigcPanel 流程；要用就固定选 **MuseTalk** 或 **LatentSync**。
2. **Duix.Avatar（原 HeyGem.ai）** 自定义 `DUIX.COM Community License`：LICENSE 原文 **MAU>1000 须商业授权**，README 却写 10 万，**冲突时按 LICENSE 保守评估**；另需 "Built with DUIX.COM" 署名。
3. **LivePortrait 是 MIT，但其 InsightFace 检测模型非商用** → 不替换检测器不能商用。
4. **腾讯混元系（Hunyuan3D 2.x / HunyuanVideo-Avatar / HunyuanWorld）** 社区许可**排除欧盟、英国、韩国**，且禁止用其输出改进其他模型。
5. **2026 年许可系统性收紧**：Qwen3.8-Max 弃用 Apache-2.0（5000 万美元收入门槛）；Kimi K3 年收入 2000 万美元触发分成 → **逐仓库读 LICENSE 原文**。
6. **合规（中国）**：最高法《关于依法审理涉人工智能纠纷案件的意见》（2026-09-07）第 4 条——未经同意用他人姓名/肖像生成**可识别虚拟数字形象**侵害肖像权，未经同意用他人声音合成人声侵害**声音权益**；发布须按《标识办法》加显式+隐式 AI 标识。
7. **一体化平台**：口播视频 → **AigcPanel**（Apache-2.0，Electron 桌面 App，零 Docker/零编译，中文一等公民）；实时对话 → **OpenAvatarChat**（Apache-2.0，LiteAvatar MIT + MuseTalk MIT + CosyVoice Apache-2.0，LiteAvatar 路线仅 4GB 显存，要求 CUDA≥12.8 正合 Blackwell）。

---

## 七、备用路线：实时对话数字人（本次不需要，存档备查）

> 结论先放这：**14B 级「实时」数字人全部与 16GB 无缘**——SoulX-FlashTalk-14B 单卡 >64GB（`--cpu_offload` 后 40GB）、LiveAvatar 61.4GB、Wan2.2-S2V 58.7GB、LongCat 1.5 46.8GB，**与量化无关，它们依赖多卡序列并行**。16GB 上能实时的只有小模型。详见 `实时交互数字人与TTS调研.md`。

| 方案 | 组成 | 显存/延迟 | 坑 |
|---|---|---|---|
| **口径最优先** | **LiveTalking + vLLM-Omni(Qwen3-TTS-0.6B) + 本地 9B LLM** | wav2lip256 ~200MB（或 musetalk 3.9GB）+ TTS + LLM ≈ **10.5~14 GB**；**TTS 首包 ~130ms**（作者在 3090 实测🟢） | ⚠️ vLLM-Omni 实测 0.6B 竟占 ~13GB → 必须下调 `--gpu-memory-utilization`（0.35~0.45）；**musetalk 必须确认版本含 2026-08-20 PR #612**（缺 `@torch.no_grad()` 的历史 OOM bug，17.62GB → 修复后 3.9GB） |
| **画质优先** | **OpenAvatarChat v0.6.0 + SoulX-FlashHead-1.3B + CosyVoice3** | FlashHead Lite 峰值 **5,763 MiB**、**96 FPS**🟡、无限时长流式 | 需 flash-attn（sm_120 无预编译 wheel）+ OpenAvatarChat 钉 torch 2.4.1+cu124 |
| **流式 TTS 首选** | **Fun-CosyVoice3-0.5B-2512**（Apache-2.0 代码+权重） | 官方双向流式（称 150ms），第三方 CV3-Eval 中文相似度 80.01 全表最高 | 备选 IndexTTS-2.5（中文 CER 0.93~1.21%、~6GB）**但没有流式**；MOSS-TTS-Realtime（Apache-2.0，TTFB 180ms） |
| **可关注** | Ditto-talkinghead（蚂蚁，Apache-2.0，45 FPS 流式，权重 ~2.4GB） | — | 🔴 钉 `tensorrt==8.6.1`，**不支持 sm_120** |
| **非商用可优先试** | **NanoAvatar**（`wpydcr/NanoAvatar`，2026-09） | **显存 834 MiB**（Lite 700 MiB）、**4090 量化版 333 FPS / 首帧 18ms**、官方称流式 LLM+TTS 下 **~0.3 秒开始说话**；要求 `torch==2.10.0+cu128`（原生 sm_120）、**不依赖 SageAttention/flash-attn** → sm_120 风险最低 | ⚠️ **代码 MIT 但口型权重 CC BY-NC 4.0 → 不可商用**；仓库很新（15⭐），无第三方复现 |
| **3D 动作路线** | **SentiAvatar**（2026-04，453⭐，~2.9GB） | 输出 **BVH 动作**，不碰 diffusers/attention 内核 → sm_120 最安全 | ⚠️ **CC BY-NC-SA，不可商用** |
| **许可警告** | **OmniVoice 代码 Apache-2.0 但权重 CC-BY-NC（不可商用）**；Fish Audio S2 Pro 自研 Research License（企业自用也算商用）；ChatTTS AGPL+CC-BY-NC；Fay 是 **GPL-3.0**（README 自称「商用免责」不成立）；Linly-Talker 主仓 2026-02 后停更 | | |

**顺带一个离线也能用的优化**：SoulX-FlashHead Lite 权重 **843 个张量全是 F32**（6.107 GB）→ **转 fp16 只剩约 3 GB**，16GB 上更宽松。

---

## 八、本机落地顺序与必须知道的坑

**建议顺序（风险从低到高）**
1. 装 `ComfyUI_EchoMimic` + 一键脚本（Ubuntu/CUDA 13 版）→ **首选**：768×512、开 `block_offload`（官方口径 6.5 GB）、ComfyUI 节点 16G 档参数 `partial_video_length=97`。**但先做「冒烟测试」**：只跑 **3~5 秒片段 + 480p**（官方口径 5 秒 7 分钟），确认 sm120 上不报 `no kernel image` / 不崩（**issue #62：5090 32GB 用官方量化版都没跑通，本机风险未知**）。通过后再放大到 10 秒/768。
2. 若 EchoMimic 压不进 16GB → 退到 `ComfyUI_RH_FlashHead`（Lite 档、512×512、峰值实测 5.76 GB），**保底一定跑得起来**，代价是画质弱。
3. 需要给已有视频换嘴型 → 上 **MuseTalk 1.5**（4GB 显存即可，但**官方实现直跑 5060 Ti 只有 ≈5.8 FPS，且不支持音频流式**；要实时得靠 LiveTalking 那层封装）。
4. 中期再评估 **LongCat 1.5 INT8**（`int8_sharded` + `block_num` + `device=cpu` offload，走 **sdpa**；注意 480p/44 秒约要 2 小时）。
5. 长视频/扩展件最后再考虑 **Wan2.2-S2V GGUF Q4 / InfiniteTalk**。

**端到端推荐链路（全程 MIT/Apache-2.0/免费商用，分时复用显存）**
`文案预处理（数字/金额/编号 → 汉字展开）→ GPT-SoVITS v2ProPlus 配音 → EchoMimicV3-Flash-pro 出片`
→ **约 14 分钟 / 10 秒成片**（其中配音约 0.3 秒、出片约 14 分钟）；**长音频一律切成 ≤20 秒分段**，出片后拼接。
- **Phase 1** `GPT-SoVITS v2ProPlus`（MIT、RTF 0.028 @4060 Ti、README 测试环境含 torch 2.7/2.8+cu128）先跑通链路 → **Phase 2** `IndexTTS-2.5` 加情感 → **Phase 3** `Qwen3-TTS / VoxCPM2` 追质量/字准。
- 🔴 **预处理必须先做「数字展开」**：没有任何中文 TTS 能可靠读长数字串（Qwen3-TTS 标识符 0%、IndexTTS-2.5 40%、CosyVoice3 货币项仅 46.7% 且常把金额改掉）。
- ⚠️ **版本检查**：`Qwen3-TTS` 须锁 `transformers==4.57.3`；`Fun-CosyVoice3` 有 issue #1318「5060ti 16g 无法启动」→ 只能当备选；**LatentSync 官方钉 torch 2.5.1+cu121，在 sm_120 上会 `no kernel image` → 修嘴这步默认跳过**。

**通用坑**
1. **SageAttention：本机其实装了 sm_120 内核，但「长序列必掉 GPU」**。SSH 实拉确认：本机 SageAttention 2.2.0 是**源码自建**（`/home/zyw/SageAttention`），`_fused.so` 含 sm_75/80/86/89/90/100/120/120a、`_qattn_sm89.so` 含 sm_120a——**所以问题不是「装不上」，而是「长序列不能用」**：上游实测 **5060 Ti 上循环 300~630 次（30~65 秒）后 GPU 丢失**，另有 `_sageattn_int8_fp8_nhd` 长序列直接掉驱动的报告——**这正好解释本机 H3 的一夜 4 次掉总线**。结论：短序列可试，**长序列一律 SDPA**；`SageAttention 3` 另有 kijai 亲述的画质劣化。源码编译时**必须只写 `TORCH_CUDA_ARCH_LIST="12.0"`**（写成 `"9.0;12.0"` 会因 `wgmma.fence not supported on sm_120` 直接失败）。**xformers 在 sm120 不可用；FA3 不可能；FA4 不稳。**
2. **sm_120 的根因是内核缺失，不是显存**：消费级 Blackwell（sm_120）**只有 MMAv2，没有 tcgen05 / WGMMA / TMEM**，所有为 sm_100/sm_120a 或 Hopper sm_90a 写的加速内核在 5060 Ti 上无处可跑。门槛：**torch ≥2.7 + cu128**、onnxruntime-gpu ≥1.27、**FA3/FA4 对 sm_120 完全无路径**、SageAttention 官方包实际回退 SM89 内核、xformers 需 PR #1254 之后。本机 `torch 2.11.0+cu130` 的 arch list 已含 sm_120，**门槛满足**。
3. 🔴 **凡是把 torch 钉在 <2.7 或 cu117/cu121/cu124 的项目，照 README 装必挂**（症状：`no kernel image is available`）——已知名单：**Wav2Lip、Ultralight-Digital-Human、MuseTalk 旧档、LatentSync（torch 2.5.1+cu121）、Duix.Avatar 官方镜像**；**CosyVoice 官方 requirements（torch 2.3.1 只到 sm_90）被 issue #1815 直接点名 RTX 5060 Ti**；**Duix.Avatar 的 issue #624（2026-09-04，0 回复）在 RTX 5070 上就是这个报错** → 这条链上要用就得自己升 torch 重编。**这就是为什么「首选 EchoMimic + CosyVoice3」要先确认版本能跑在 torch≥2.7/cu128 上。**
4. **LiveTalking 的音频接口是硬编码的**（源码 `tts/base_tts.py`：`sample_rate=16000`、每块 `16000//(fps*2)=320` 样本 = **20 ms**）→ 自定义 TTS 必须输出 **16 kHz 单声道 int16 / 20 ms 分块**；而 IndexTTS2.5 是 22.05k、OmniVoice/Kokoro/ChatTTS 24k、Fish 44.1k、VoxCPM2/GPT-SoVITS v4 48k，**接入前必须重采样**。（`--tts` 合法值含 `gpt-sovits/cosyvoice/fishtts/indextts2/qwentts` 等 9 个 + `omnitts`。）
3. **跑视频前先清显存**：`bash ~/stop-ridge.sh` + `lms unload --all`。
4. **32GB 内存比 16GB 显存更容易先爆**：InfiniteTalk 3 分钟视频需 **>120 GB 内存**、LongCat 720p 需 **35.3 GB RAM** → 必须**分段生成、及时落盘**，别指望一口气跑完长视频。
5. **磁盘只剩 138 GiB（88% 已用）**：EchoMimic 约 20 GiB、FlashHead 约 8 GiB、LongCat int8 约 20 GiB、Wan S2V GGUF 约 15 GiB——**别一次全下**。
6. **别信网上流传的「S2V 显存/耗时表」**：抓到的 CSDN 类文章给出的 `--moe_expert_capacity`、`--moe_gate_dropout` 在 Wan2.2-S2V 中根本不存在（S2V 是单体模型），数据系编造。
7. **未在本机验证的事**：EchoMimic / FlashHead 均无 Ubuntu + sm_120 实机报告，消费卡上的延迟与驱动框架支持仍是空白。

---

## 九、配套文件与来源

**本目录文件**
- `数字人选型结论-20260922.md`（本文，v2 主结论）
- `离线音频驱动数字人模型调研.md`（**1040 行 / 126 条来源链接**，定稿；结构：§0 sm120 总表（含本机 SSH 实拉）→ §1 一分钟结论 → §2 8 模型 16GB 速查总表 → §2.5 16GB 级显卡实测清单 → §3 8 模型逐个深析 → §4 中文 TTS 选型（含 §4.6 落地顺序）→ §5 链路组装与显存排班 → §6 客观质量 → §7 淘汰与未查到）✅
- `实时交互数字人与TTS调研.md`（**463 行 / 156 表格行**；含 5 个 2026 新项目（NanoAvatar / AvatarForcing / SentiAvatar / Realtime-Venus / LingCast 等）、**sm_120 根因与 torch 钉版黑名单**、LiveTalking 音频接口硬约束、**TTS 首选更正为 Qwen3-TTS**、MuseTalk/Duix 三处更正）✅
- `3D数字人_一体化平台_授权风险.md`（669 行 / 128 条来源 URL / 24 条许可红线）✅
- `本地环境核查-20260922.md`（本机硬件/ComfyUI/模型/磁盘实测）
- `_scratch/`：调研代理的中间草稿（原始检索记录），非结论，可忽略或删除

**关键来源**
- 🟢 2026-08 六模型同条件横评（峰值显存/耗时/画质排序）：[Tight Studio](https://tight.studio/zh-cn/blog/open-source-talking-avatar-models/)
- SoulX-FlashHead：[GitHub](https://github.com/Soul-AILab/SoulX-FlashHead) · [HF](https://huggingface.co/Soul-AILab/SoulX-FlashHead-1_3B) · [ComfyUI 节点](https://github.com/HM-RunningHub/ComfyUI_RH_FlashHead)
- EchoMimicV3：[HF](https://huggingface.co/BadToBest/EchoMimicV3) · [Ubuntu/CUDA13 一键脚本](https://github.com/vokilook/comfyui-echomimic-setup)
- LongCat-Video-Avatar 1.5：[HF 模型卡](https://hf-mirror.com/meituan-longcat/LongCat-Video-Avatar-1.5)（MIT / int8 / `--use_distill`）· [ComfyUI 节点](https://github.com/rookiestar28/ComfyUI-LongCat-Avatar) · [美团技术博客](https://tech.meituan.com/2026/05/25/LongCat-Video-Avatar-1.5.html)
- Wan2.2-S2V：[HF 模型卡](https://hf-mirror.com/Wan-AI/Wan2.2-S2V-14B) · [ComfyUI 官方教程](https://comfyui-wiki.com/zh/tutorial/advanced/video/wan2.2/wan2-2-s2v) · [GGUF](https://huggingface.co/QuantStack/Wan2.2-S2V-14B-GGUF)
- MuseTalk：[GitHub](https://github.com/TMElyralab/MuseTalk) · [LiveTalking 性能表](https://github.com/lipku/LiveTalking)
- Live Avatar：[HF](https://hf-mirror.com/Quark-Vision/Live-Avatar) · [GitHub](https://github.com/Alibaba-Quark/LiveAvatar)
- InfiniteTalk 已知问题：[kijai wrapper #1875（RTX 5060）](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1875) · [#1185（渲染极慢）](https://github.com/kijai/ComfyUI-WanVideoWrapper/issues/1185)
- TTS 热度与许可证：`hf-mirror.com` 模型 API 实测

> 数据分级声明：🟢 第三方实测 / 🟡 厂商宣称 / 🔴 未查到。本文所有「实测」均注明来源；厂商宣称一律标注，未与第三方数据混写。
