# 实时数字人（Talking Head / Avatar）框架选型调研 — 2026 年 9 月最新状态

> **调研日期**：2026-09-22（本文件所有 star / 许可 / 最后提交均为当日抓取）
> **调研人**：DH 子代理（DeepSeek Harness）｜**协作**：三个并行子代理 ClusterB/C/D
> **目标硬件**：RTX 5060 Ti **16GB**（sm_120 消费级 Blackwell，**无 tcgen05/WGMMA/TMEM**）、32GB RAM、Ubuntu 24.04、驱动 610.43.02、CUDA 13.2
> **方法**：全部结论以 `curl` 直取 README / arXiv / HuggingFace API / shields.io 徽章原始返回为依据。
> GitHub REST API 本机已限流（60/hr），star/license/last-commit 一律取 **shields.io 徽章 JSON 的 message 原值**；后端抓取主力为 **jsDelivr 镜像**（`https://cdn.jsdelivr.net/gh/<owner>/<repo>@main/<path>`，比 raw.githubusercontent 稳定得多）。
> **凡查不到的一律写「未查到」，不做推测填充；无一条 URL / 数字 / star 是编造的。**
>
> **本文件是自包含的**：§2 已包含候选名单逐项核实结论，不依赖其它文件。
> **配套文件**（同目录，可选深入阅读）：`_clusterC.md`（11 个既有基线项目 × 16GB 深挖，940 行 / 241 条来源）· `_clusterD.md`（sm_120/Blackwell 坑 + 2026 新增仓库扫街，127 条来源）· `_clusterB.md`（候选名单核实，525 行，用 GitHub commits Atom feed 取精确提交时间）。**本报告 §2 已独立覆盖候选核实，不依赖上述文件。**

---

## 0. 结论速览

### 0.1 一句话
2026 年真正能在 **16GB 单卡**上跑「**实时流式**」的，是 **SoulX-FlashHead（1.3B）**、**Ditto**、**NanoAvatar（0.8GB）**；
**14B 级的 SoulX-FlashTalk / LiveAvatar / Wan-Dancer 在 16GB 上明确不可行**，且原因是结构性的（依赖多卡序列并行 + Hopper 专属内核），**不是量化就能解决**。

### 0.2 总表

| 项目 | 首发/最新 | 类型 | License | stars | 16GB 单卡 | 实时流式 | 中文 |
|---|---|---|---|---|---|---|---|
| ⭐**SoulX-FlashHead** | 2026.02 / 2026.05 | 2D 潜空间 DiT 1.3B | Apache-2.0 | 1.1k | **✅ 社区实测 Lite≈6GB / Pro≈8GB** | ✅ 单4090 96FPS | 数据集 15 语种 |
| ⭐**Ditto** | 2025.11 | 2D 运动空间扩散+TRT | Apache-2.0 | 891 | ✅ 运行时 ~2.4GB | ✅ 45FPS | 未查到 |
| ⭐**NanoAvatar** | 2026.09 | 端侧 2D 口型 | MIT(代码)/CC BY-NC(权重) | 15 | **✅ 仅 ~0.8GB** | ✅ 首帧 103ms | ✅ 有中文 demo |
| **EchoMimicV3-Flash** | 2026.01 | 2D DiT 1.3B | Apache-2.0 | 1.1k | ✅ 官方 12GB | ❌ 非流式 | ✅ 中文 wav2vec2 |
| **LiveTalking** | 2026.09.13 | 实时推流框架（多后端） | Apache-2.0 | 9.6k | ✅ wav2lip 1.3GB | ✅ 支持打断 | ✅ 全身 |
| **OpenAvatarChat** | 2026.07 | 全链路对话框架 | Apache-2.0 | 3.8k | ✅ LAM 3.1GB | ✅ 双工打断 | ✅ |
| **AvatarForcing** | 2026.03 | 一步流式扩散 1.3B | Apache-2.0（README） | 81 | ⚠️ 权重文件 19GB 待实测 | ✅ 34ms/帧 | 未查到 |
| **AVTR-1** | 2026.05 | flow-matching 自回归 | ⚠️**非商用** | 469 | ✅ 4060Ti 166ms=1.2× | ✅ | 未查到 |
| **Realtime-Venus** | 2026.09.22 | 9B 全双工对话（**只出语音，不出脸**） | Apache-2.0 | 40 | ⚠️ 单模型 ~18.7GB | ✅ | ✅ |
| **SentiAvatar** | 2026.04 | 3D 动作（输出 BVH） | CC BY-NC-SA 4.0 | 453 | ✅ 权重 ~2.9GB | ✅ 6s/0.3s | ✅ |
| **MuseTalk 1.5** | 2025.03（停更） | 2D latent inpainting | MIT | 6.6k | ✅ 5060Ti 实测 3.6GB | ❌ 官方确认不支持流式 | ✅ |
| **LatentSync 1.6** | 2025.06（停更） | 2D diffusion 口型 | Apache-2.0 | 6.1k | ⚠️ 官方 18GB / 实测 15.8GB 压线 | ❌ 0.6–0.9 帧/秒 | ✅ 1.5 起改进中文 |
| **LivePortrait** | 2026.06 | 视频驱动肖像（非 lip-sync） | MIT（InsightFace 限非商用） | 19k | ✅ 建议 8GB | ❌ 官方无 | ✅ |
| ❌**SoulX-FlashTalk** | 2026.01 / 2026.07 | 2D DiT **14B** | Apache-2.0 | 1.5k | **❌ >64GB，offload 40GB** | ✅ 但需 8×H800 | ✅ 粤语 |
| ❌**LiveAvatar** | 2026.01 / 2026.08 | 2D DiT **14B** | Apache-2.0 | 2.4k | **❌ 单卡 80GB / FP8 48GB** | ✅ 但需 5×H800 | 未查到 |
| ❌**Wan-Dancer** | 2026.07 | 音乐→舞蹈 **14B** | Apache-2.0 | 432 | **❌ 权重 85.67GB / 8×A800** | ❌ | — |
| ❌HunyuanVideo-Avatar | 2025.12 | 3D MM-DiT | 自定义 | 2.2k | ❌ 官方最低 24GB | ❌ | 未查到 |
| ❌Hallo3 | 2025.03（停更） | 2D 视频 DiT | MIT | 1.4k | ❌ H100 测试 | ❌ 0.16FPS | 未查到 |

---

## 1. 任务 A：2026 年新出现 / 大更新的项目

### 1.1 SoulX-FlashHead（Soul-AILab）— **2026 年最大发现，16GB 首选** ⭐

**仓库**：https://github.com/Soul-AILab/SoulX-FlashHead
**arXiv**：https://arxiv.org/abs/2602.07449 （v1 2026-02-07，v3 2026-02-11）
**权重**：https://huggingface.co/Soul-AILab/SoulX-FlashHead-1_3B

**活跃度与许可**（shields.io 原值）：
- stars **1.1k**｜license **Apache-2.0**｜last commit **`may`**（2026 年 5 月）
- HF 权重仓库 `lastModified` **2026-04-02T03:24:15Z**，likes 62，downloads 2331（https://hf-mirror.com/api/models/Soul-AILab/SoulX-FlashHead-1_3B ）
- VividHead 数据集 `lastModified` **2026-02-12**，license `apache-2.0`，782 小时 / 33 万片段（https://hf-mirror.com/api/datasets/Soul-AILab/VividHead ）

**时间线**（README News 原文）：2026.02.07 技术报告+数据集 → **2026.02.12** 推理代码+权重+项目页+Soul App 在线体验 → 2026.03.02 第三方 ComfyUI 节点 → 2026.03.04 Gradio（含流式）→ 2026.03.09 HF Spaces 流式 demo。`Model_Pretrained` 仍未发布。

**实现方式**：**2D 潜空间 DiT，1.3B**。论文 4. Experiments 原文："We build our model upon the **Wan2.1 T2V (1.3B)** architecture"。
- Lite 用 **LTX-VAE**（下采样 32×32×8，像素:token = 8192:1）；Pro 用 **WAN 2.1 VAE**（4×8×8）。
- 音频驱动：Wav2Vec 流式嵌入 + **Temporal Audio Context Cache**（固定 8s 音频窗，缓解 1.32s 短片段特征坍缩）。
- 防漂移：**Oracle-Guided Bidirectional Distillation** + 参考图 latent 通道拼接。
- **DMD 蒸馏 → 流式仅 4 步去噪**（非流式 20 步）。源码 `flash_head/inference.py` 第 34–36 行：`sample_steps = 20`（非流式）/ `4`（流式）。
- 推理配置 `flash_head/configs/infer_params.yaml`（**jsDelivr 实取**）：`frame_num: 33`、`tgt_fps: 25`、`height: 512`、`width: 512`、`motion_frames_latent_num: 2`、`cached_audio_duration: 8`、`num_heads: 12`
  → **输出规格 = 512×512 @ 25fps，每 chunk 33 帧**。
- 加速：**FlashAttention-2** + `torch.compile`；多卡才用 xDiT 混合序列并行。
- 论文原文自我定位：点名 LiveAvatar 与 SoulX-FlashTalk「hindered by heavy computational overhead and complex pipeline parallelism. This renders low-latency streaming interaction on **consumer-grade GPUs largely infeasible**」——本模型专为消费级单卡设计。

**显存需求与 16GB 可行性 ✅**
- 权重硬数据（HF API）：

| 文件 | 大小 |
|---|---|
| `Model_Lite/diffusion_pytorch_model.safetensors` | **6.108 GB** |
| `Model_Pro/diffusion_pytorch_model.safetensors` | 6.031 GB |
| `VAE_LTX/diffusion_pytorch_model.safetensors` | 1.677 GB |
| `VAE_Wan/Wan2.1_VAE.pth` | 0.508 GB |

- **实测 dtype = F32**：按 safetensors 规范读取 `Model_Lite/diffusion_pytorch_model.safetensors` 的 8 字节头长度（85016）+ JSON 头，解析出 **843 个张量全部 `F32`，payload 6.107 GB** → 转 fp16 后权重仅 **≈3.05 GB**。这是它低显存友好的根本原因。
- Lite 全量 = 6.108 + 1.677 ≈ **7.8 GB**（fp32，未转换）。
- **社区第三方实测显存**：「实测 **lite 显存大约 6GB，pro 显存大约 8GB**」，建议 CUDA ≥12.8（[cnblogs 2026-04-12](https://www.cnblogs.com/dsx2016/articles/19855950)，[CSDN 镜像 2026-06-06](https://blog.csdn.net/weixin_37865166/article/details/159695502)）；该文标题即「8GB显存可用」。
  ⚠️ 该第三方仅测**离线视频生成**（Windows 一键包），**未测实时流式**；**未查到 sm_120 + 流式模式的实测帖**。

**端到端延迟 / FPS**
- Lite：**96 FPS**（流式），或单 4090 上 **3 路并发、每路 25+FPS**。
- Pro：**10.81 FPS**（单 4090 流式）；双 5090 达 25+FPS。
- 论文 Table 3（HDTF，流式）：Lite FID 11.37 / FVD 126.52 / Sync-C 4.21 / **96 FPS**；Pro FID 9.97 / FVD 111.38 / Sync-C 5.73 / **10.81 FPS**。
- 横向对比（同表）：**Ditto 45.04 FPS**、SadTalker 2.17、EchoMimic 0.81、**Hallo3 0.16**。
- **⚠️ 96 FPS 的硬件口径官方自相矛盾**：摘要与 README 写 "single NVIDIA **RTX 4090**"，但同论文 4. Experiments / Evaluation Metrics 段原文写 "we report inference efficiency in frames per second measured on **a single NVIDIA H20 GPU**"。H20 显存带宽远高于 4090 → **引用 96 FPS 必须带此保留**。
- **首帧延迟**：README 与论文**均未给出毫秒数** → **未查到**。

**流式 / 可打断**：✅ 真流式。`gradio_app_streaming.py` 源码注释：「单独线程：按 chunk 顺序执行 infer，**每生成一帧就放入 res_queue，立即继续下一 chunk**」，主线程按 chunk_id 取对应音频合并；`CHUNKS_PER_SEGMENT = 3`。支持无限长度。**「用户插话打断」（barge-in）API → 未查到**。

**中文 / 半身全身**：
- 数据集 VividHead 覆盖 **15 languages**（论文 Table 2 与正文）。
- 但官方默认音频编码器是 **`facebook/wav2vec2-base-960h`（英文预训练）**，**未换成中文 wav2vec2** → 中文效果**需自行验证**。
- 官方示例含中文素材（`assets/chengdu.mp4`、`assets/qitiandasheng.mp4`），Gradio 源码为中文注释，团队为 Soul（中文社交 App）→ **推断可用，但无官方中文评测数字**。
- **半身/全身**：数据管线「cropped to **512×512** centered on the detected face」+ DWpose 过滤手遮脸 → **头部/肩部为主，非全身**；全身 → **未查到**（判定不支持）。

**生态**：`HM-RunningHub/ComfyUI_RH_FlashHead`（**39 stars**，last commit **february**，Apache-2.0）；`iaskask-com/ComfyUI_iAskAsk_SoulX_FlashHead`（存在，统计未查到）。

---

### 1.2 NanoAvatar（wpydcr）— **显存最低（~0.8GB）** ⭐

**仓库**：https://github.com/wpydcr/NanoAvatar ｜**权重**：https://huggingface.co/wpydcr/NanoAvatar

- stars **15**｜last commit **`last wednesday`**（2026-09 上周）｜license：shields 报 `not identifiable`，README 明确 **代码 MIT / 口型权重 CC BY-NC 4.0**（非商用）
- HF `lastModified` **2026-09-16**，likes 3
- **实现方式**：端侧 2D 口型生成。HuBERT（FP16 或 W8A16）+ 口型网络（FP32 或 INT8）。
- **显存（README 官方性能表，逐字）**：

| 模型 | 设备 | FPS | 首帧 | **显存** |
|---|---|---|---|---|
| NanoAvatar | 骁龙 8 Gen 3 | 39 FPS | **115 ms** | **834 MiB** |
| NanoAvatar Lite | 骁龙 8 Gen 3 | **41 FPS** | **103 ms** | **700 MiB** |
| NanoAvatar Lite | 骁龙 8 Gen 1 | 18 FPS | 183 ms | 693 MiB |
| 量化版(CUDA DLL) | **RTX 4090** | **333 FPS** | **18 ms** | 834 MiB |
| 全精度 | **RTX 4090** | **224 FPS** | 37 ms | **1119 MiB** |

- **16GB 可行性：✅ 余量最大**（~0.8–1.1GB）。官方要求 **`torch==2.10.0` + **cu128** wheel → **原生 sm_120 支持**；**不依赖 SageAttention / flash-attn**。
- **流式**：✅ README 原文 *"Streaming generation: start speaking as audio arrives … starts speaking in about **0.3 seconds**"*。
- **中文**：✅ 有 Chinese demo（HF 仓库含 `assets/demo-zh.mp4`）。
- **权重总量**：HF 仓库合计 **0.88 GB**（`quantized/hubert_w8a16.pt` 355.3MB + `lip_mixed_int8.pt` 51.4MB + Android QNN 资源）。
- ⚠️ 缺点：stars 仅 15，**2026-09 新项目、社区验证极少**；口型权重非商用。

---

### 1.3 AvatarForcing（KlingAIResearch / 快手 Kling）— 一步流式扩散

**仓库**：https://github.com/KlingAIResearch/AvatarForcing ｜**arXiv**：https://arxiv.org/abs/2603.14331 ｜**权重**：https://huggingface.co/lycui/AvatarForcing

- stars **81**｜last commit **`may`**（2026-05）｜shields license `not identifiable`，但 **README「📜 License」节原文写 Apache-2.0**
- HF `lastModified` **2026-03-26**，likes 9
- **实现方式**：**一步流式扩散（one-step streaming diffusion）**。单参考图 + 语音 + 文本 → 视频。**局部未来滑窗 + 异构噪声**联合去噪，每步产出 1 个干净 block，**恒定单步开销**。学生模型 **1.3B**（Wan2.1-T2V-1.3B），音频用流式 Wav2Vec2 逐帧嵌入。
- 论文配置：**25 FPS、832×480、B=4 帧/block、L=4 窗长、34 ms/帧**（原文注明 "hardware-dependent"）。
- **⚠️ 16GB 风险点**：HF 权重仓库只有两个文件 —— **`model.pt` 19.16 GB** + `ode_audio_init.pt` 6.39 GB，**合计 25.54 GB**。19GB 远超 1.3B bf16（~2.6GB），推测为含教师/假分数网络的完整训练检查点 → **单文件 19GB 在 16GB 卡上无法整体加载**；实际推理能否只载学生子集 **未查到实测**。**判定：⚠️ 需实测，不能直接算「16GB 可跑」。**
- 支持 **I2V only**（`--i2v`）；`--num_output_frames` 需满足 `(N-1) % 4 == 0`。
- 流式 ✅｜中文 未查到。

---

### 1.4 AVTR-1（avaturn-live）— 唯一给逐卡延迟表，但**非商用**

**仓库**：https://github.com/avaturn-live/avtr-1 ｜**权重**：https://huggingface.co/avaturn-live/avtr-1

- stars **469**｜last commit **`may`**（2026-05）｜license：⚠️ **非开源许可** —— 模型权重走 **Community License（有营收门槛）**，renderer 与 live backend/streamer 为 **PolyForm Noncommercial License 1.0.0（仅非商用）**
- **实现方式**：**flow-matching 自回归**，一张肖像 + 双路音频，**同时渲染说话口型 + 主动聆听**，单卡 25 fps；TensorRT 加速。要求 NVIDIA GPU（Ampere+）+ **CUDA 12.x + TensorRT 10.x**。
- **README 自附逐卡延迟表**（5 帧 chunk @25fps = 200ms/块）：

| GPU | 每块延迟 | 实时倍率 |
|---|---|---|
| L40 | 84 ms | 2.4× |
| A100 | 91 ms | 2.2× |
| **RTX 4060 Ti** | **166 ms** | **1.2×** |
| RTX 3070 | 181 ms | 1.1× |
| L4 | 202 ms | 0.99× |
| RTX 3060 Ti | 206 ms | 0.97× |
| RTX 4060 | 232 ms | 0.86× |

- **16GB 可行性：✅**（4060 Ti 级已有 1.2× 实时证据）。**TensorRT 10.x** 是硬要求（对 Blackwell 是好消息），但 16GB 档实际显存未公布 → **未查到**。
- ⚠️ **商用需另谈授权** —— 最大问题。

---

### 1.5 Realtime-Venus（Ant Group + 清华）— **只出语音，不出脸**（重要辨析）

**仓库**：https://github.com/inclusionAI/Realtime-Venus ｜**arXiv**：https://arxiv.org/abs/2609.13814 （v1 2026-09-12，v2 2026-09-18）

- stars **40**｜license **Apache-2.0**｜last commit **`today`（2026-09-22，就是今天）** —— 全场最新
- HF `lastModified` **2026-09-21**，likes 55（https://hf-mirror.com/api/models/inclusionAI/Realtime-Venus ）
- **⚠️ 关键辨析：它不是 talking head 生成器。** 论文摘要原文：两个分别训练的 **9B** 模型 —— **Realtime-Venus-Omni**（音视频交互理解）与 **Realtime-Venus-Audio**（语音交互），"Each model serves as a complete conversational frontend, integrating continuous perception, conversational control, and **native speech generation**"。
  → 输出是**文本 + 语音**，**不生成人脸视频**。它是数字人栈里的「**大脑 + 耳 + 嘴**」，不是「脸」。
- 亮点：全双工（Full-Duplex-Bench v1.5 上响应 75% 打断，continuation 率 97%/88%/86%，**超过 Gemini 3.1 Live 与 GPT-4o**）；异步委派（Harness 后台跑任务）。
- **显存**：每个模型 4 shards ≈ **18.7 GB**（bf16），仓库合计 40.08 GB（含两套模型），另有 `token2wav/flow.pt` 0.62GB 等 → **⚠️ 单模型 18.7GB > 16GB，需量化；未查到量化版本。**
- 中文：✅（含 Speech CMMLU 67.8 基准）。

---

### 1.6 SentiAvatar（SentiPulse + 人大 GSAI）— 3D 动作路线，最不踩内核坑

**仓库**：https://github.com/SentiAvatar/SentiAvatar ｜**arXiv**：https://arxiv.org/abs/2604.02908

- stars **453**｜last commit **`april`**（2026-04，2026 年新建）｜license：GitHub 无法识别（**论文 CC BY-NC-SA 4.0**）
- **实现方式**：**交互式 3D 数字人**。SuSuInterActs 数据集（21K clip / 37h）+ 运动基础模型 + plan-then-infill + RVQVAE/Face VQVAE，**输出 BVH / UE JSON 动作，不是像素视频**。
- **实时**：README 原文 *"Generates **6 seconds of motion in 0.3 seconds** with unlimited multi-turn streaming"*。
- **显存**：权重合计约 **2.9 GB**，跑 vLLM(Qwen2-0.5B)，**不依赖 SageAttention/flash-attn** → **sm_120 风险最低**。
- 代价：**需要自备渲染器**（UE/Blender）才能出画面 → 不是开箱即用的 talking head。

---

### 1.7 其他 2026 新仓库（由 ClusterD 扫街所得，star 为 shields.io 实测）

| 仓库 | ⭐ | License | 新建/最后提交 | 一句话 | 实时流式 |
|---|---|---|---|---|---|
| [PeterIverson/Super-Star](https://github.com/PeterIverson/Super-Star) | 10 | Apache-2.0 | 2026-07/2026-08 | **[ACM MM 2026]** 3D 数字人流式实时交互；Qwen3-Omni-30B-A3B + 在线手势生成（arXiv 2608.24909） | ✅ ⚠️ 30B 语音前端对 16GB 不友好 |
| [Kedreamix/Linly-Talker-Stream](https://github.com/Kedreamix/Linly-Talker-Stream) | 133 | Apache-2.0 | 2026-02 | 全双工低延迟实时流式对话数字人（主仓已停更，能力迁至此分仓） | ✅ |
| [rookiestar28/ComfyUI-LongCat-Avatar](https://github.com/rookiestar28/ComfyUI-LongCat-Avatar) | 36 | MIT | 2026-06/2026-08 | LongCat Video Avatar 1.5 的 ComfyUI 节点 | 部分 |
| [taochangle/LingCast](https://github.com/taochangle/LingCast) | 11 | 未标注 | 2026-08 | 端到端数字人直播平台（LivePortrait+Wav2Lip+DeepSeek+SRS 推流） | ✅ |
| [MrrZed0/Stream-Avatars-Custom](https://github.com/MrrZed0/Stream-Avatars-Custom) | 1 | 未标注 | 2026-03 | 仓库过小，**描述未查到** | 未查到 |
| [google/GNM](https://github.com/google/GNM) | 1.5k | Apache-2.0 | 2026-03/2026-09 | 参数化统计人体/头部**几何**模型（非 talking head） | ❌ |
| [NVlabs/SOMA-X](https://github.com/NVlabs/SOMA-X) | 788 | Apache-2.0 | 2026-03/2026-09 | 人体+手部可微表示（非 talking head） | ❌ |
| [k2-fsa/OmniVoice](https://github.com/k2-fsa/OmniVoice) | 14k | Apache-2.0 | 2026-03/2026-08 | TTS/语音模型（数字人语音前端候选） | ❌ |

**既有项目 2026 仍活跃**：LiveTalking 9.6k⭐（2026-09-13）· aigcpanel 5.6k⭐（2026-09-22 今天）· Duix-Mobile 8.3k⭐（2026-08）· OpenAvatarChat 3.8k⭐（2026-07）· SoulX-FlashTalk 1.5k⭐（2026-07）· Fay 14k⭐（yesterday）· met4citizen/TalkingHead 1.6k⭐（2026-06）· jdh-algo/JoyVASA 878⭐（2026-04）· dlp3d-ai/dlp3d.ai 358⭐（2026-05）· Project-N-E-K-O/N.E.K.O 3k⭐（2026-09-22）。

**2026 年趋势判断**：热点已从「LiveTalking/Wav2Lip 式拼装管线」转向 **少步流式扩散 talking head**（SoulX-FlashHead 96FPS@4090、AvatarForcing one-step、AVTR-1 flow-matching 自回归）与 **端侧**（NanoAvatar 0.8GB）。

---

## 2. 任务 A 附：候选名单逐项核实（真实存在 vs 未找到）

| 候选名 | 判定 | 证据 / 说明 |
|---|---|---|
| SoulX-FlashTalk 系列 | ✅ **真实** | 见 §3。2025.12 项目页，**2026.01.08 代码+权重**，last commit 2026-07；HF 权重 54.46GB |
| **SoulX-FlashHead** | ✅ **真实（2026 新品）** | 见 §1.1。2026.02.12 首发；1.1k⭐ Apache-2.0 |
| **LiveAvatar** | ✅ **真实** | https://github.com/Alibaba-Quark/LiveAvatar 2.4k⭐ Apache-2.0，**ECCV 2026 Spotlight**（2026.06.18），last commit 2026-08；**2026.01.20 v1.1 FP8** |
| **Wan-Dancer** | ✅ **真实** | https://github.com/Wan-Video/Wan-Dancer **432⭐ Apache-2.0**，last commit **2026-07**；HF `Wan-AI/Wan-Dancer-14B` lastModified **2026-07-17**，likes 186，downloads 15792；权重 **85.67GB**，实测环境 **8×A800 80GB** |
| Wan2.2-S2V | ✅ **真实** | https://huggingface.co/Wan-AI/Wan2.2-S2V-14B ，HF lastModified 2025-09-17，likes 475，合计 49.15GB。是 LiveAvatar 的底座 |
| Wan2.2 / Wan2.1 | ✅ 真实且极活跃 | Wan-Video/Wan2.2 **18k⭐**，last commit **`yesterday`**；Wan-Video/Wan2.1 17k⭐，last commit `march`（2026） |
| Hallo3 | ✅ 真实（**2026 无活动**） | fudan-generative-vision/hallo3，1.4k⭐ MIT，last commit **`march 2025`**；News 最新 2025/02/27 |
| **Hallo4** | ✅ **真实但极小，且权重门控** | https://github.com/fudan-generative-vision/hallo4 —— **38⭐**，last commit **2025-11-30**，**无 LICENSE 文件**。⚠️ **HF `fudan-generative-ai/hallo4` 匿名访问返回 401 restricted（需申请授权）**；仓库仅 5 个 commit、README 要求 H100 → **工程可用性极低，2026 年无活动** |
| EchoMimic V3 | ✅ **真实** | antgroup/echomimic_v3，**1.1k⭐ Apache-2.0**，last commit **`march`（2026）**，**AAAI 2026**；2026.01.22 Flash 更新（12GB VRAM） |
| Hunyuan-Avatar / HunyuanVideo-Avatar | ✅ 真实（**2026 无活动**） | Tencent-Hunyuan/HunyuanVideo-Avatar，2.2k⭐，last commit **`december 2025`**，license 自定义；官方最低 24GB |
| OmniHuman-1.5 | ❌ **非开源** | 未找到任何 `bytedance/OmniHuman*` GitHub 仓库（`bytedance/OmniHuman-1`、`bytedance/OmniHuman`、`OmniHuman/OmniHuman-1` 全部 `repo not found`）。仅以 **API 形式**在 [Replicate](https://replicate.com/bytedance/omni-human-1.5) / [fal.ai](https://fal.ai/models/fal-ai/bytedance/omnihuman/v1.5) 提供 → **闭源** |
| FantasyTalking2 | ⚠️ **降级：仅有论文页，无代码/权重** | 真实仓库名是 **`Fantasy-AMAP/fantasy-talking2`（全小写）** —— **65⭐**，last commit **2025-08-18**，无 LICENSE。**ClusterB 复核发现 README 全文仅 Abstract + Citation，没有 inference 代码、权重、安装说明** → 标注 [AAAI 2026] 但**工程上不可用，2026 年无活动** |
| Ditto | ✅ **真实** | antgroup/ditto-talkinghead，**891⭐ Apache-2.0**，last commit `november 2025`；**ACM MM 2025** |
| Sonic | ✅ **真实，2026 有活动** | https://github.com/jixiaozhong/Sonic —— **3.3k⭐**，last commit **2026-01-08**，**license = CC BY-NC-SA 4.0（🔴 禁商用）**。（`tencent-ailab/Sonic` 不存在） |
| FLOAT | ✅ 真实（2026 无活动） | https://github.com/deepbrainai-research/float —— **492⭐**，last commit **2025-11-10**，**license = CC BY-NC-ND 4.0（🔴 禁商用）**；ICCV 2025 |
| MEMO | ✅ 真实（2026 无活动） | 仓库名是 **`memoavatar/MEMO`**（全大写）；1.1k⭐ Apache-2.0，last commit **2025-08-06**；仅 preview 模型 |
| **MuseTalk 1.5** | ✅ 真实 | 官方 README News 原文：「[03/28/2025] We are thrilled to announce the release of our **1.5** version」。**MuseTalk 2.0 → 未找到**（README 最新更新条目为 04/05/2025） |
| **LatentSync 1.6** | ✅ 真实 | 官方 README 原文：「`2025/06/11`: We released **LatentSync 1.6**」；「`2025/03/14`: **LatentSync 1.5**」。**LatentSync 2.x → 未找到** |
| **Realtime-Venus** | ✅ **真实（2026-09 全新）** | https://github.com/inclusionAI/Realtime-Venus —— 40⭐ Apache-2.0，last commit **2026-09-22**；arXiv 2609.13814。⚠️**只出语音不出脸** |
| **SentiAvatar** | ✅ **真实（2026-04 全新）** | https://github.com/SentiAvatar/SentiAvatar —— 453⭐，last commit 2026-04；arXiv 2604.02908 |
| InfiniteTalk | ✅ **真实** | MeiGen-AI/InfiniteTalk **7.9k⭐ Apache-2.0**，last commit `may`（2026）；是 FlashTalk 的教师模型 |
| MultiTalk | ✅ 真实 | MeiGen-AI/MultiTalk 3k⭐ Apache-2.0，last commit `may`（2026） |
| OmniAvatar | ✅ 真实 | Omni-Avatar/OmniAvatar 1.9k⭐ Apache-2.0，last commit `august 2025` |

---

## 3. 特别重点：SoulX-FlashTalk（14B）核实 —— ❌ 16GB 不可行

**仓库**：https://github.com/Soul-AILab/SoulX-FlashTalk
**arXiv**：https://arxiv.org/abs/2512.23379 ｜全文 v3：https://arxiv.org/html/2512.23379v3
**权重**：https://huggingface.co/Soul-AILab/SoulX-FlashTalk-14B

### 3.1 活跃度与许可
- stars **1.5k**｜license **Apache-2.0**｜last commit **`july`**（2026 年 7 月）（shields.io）
- HF `lastModified` **2026-03-19**，likes 45，downloads 2557
- 时间线：2025.12.30 项目页 + 技术报告 → **2026.01.08 推理代码 + 权重**；Todo 未完成：Online demo
- README「Coming soon」原文：**"A 4-GPU real-time version of SoulX-FlashTalk."** → 方向仍是**多卡**，**没有单卡/16GB 路线**

### 3.2 「0.87s 启动延迟 / 32FPS」的真实测试条件 ✅ **已核实**
论文 §3.3 Inference Latency Analysis **原文**：
> "we analyze component-wise latency on a single-node system with varying numbers of NVIDIA H800 GPUs. The experimental setup targets high-fidelity streaming at a resolution of **720×416 with 4-step denoising**. Each clip comprises **33 frames, including 28 generated frames and 5 motion frames**. Under this configuration, the pipeline achieves a throughput of up to **32 FPS**."

组件级延迟分解（论文 Table 4 / Figure 6）：

| 组件 | 单 GPU | 8×H800 | 加速比 |
|---|---|---|---|
| DiT 每步 | **1070 ms** | 193 ms | ~5.5× |
| VAE 运动帧编码 | 97 ms | 21 ms | ~4.6× |
| VAE 生成帧解码 | **988 ms** | 192 ms | ~5.1× |

稳态每轮总延迟（8×H800，Figure 6 原文）：**876 ms** = 音频 33ms + **4 步 DiT 616ms** + 帧解码 187ms + 运动帧编码 14ms + 杂项。
- 论文同时给出「start-up latency 0.87 s，约 3× 快于基线 2.89 s」，即**「启动延迟」= 8 卡上出第一个 chunk 的时间**。
- ⚠️ 注意：**0.87s 与上表稳态单轮 876ms 几乎完全相同**。因此**「0.87s 启动」是在 8 卡上量到的**，**不是单卡首帧时间**（论文未给单卡首帧毫秒数）。
- **〔推算〕单卡**：仅 DiT 一项 4 步 = 1070 × 4 = **4280 ms**，再加 VAE 解码 988 ms ≈ **5.3 s / 33 帧 ≈ 6 FPS**（由论文 Table 4 的单卡数字推导，非官方实测）。

**结论：32 FPS 的完整前提 = 8×H800 + 720×416 + 4 步去噪 + 33 帧/clip。单卡连实时都达不到。**

### 3.3 显存需求 —— 16GB 明确不可行
- README **原文**：`# Requires more than 64G of VRAM. Use --cpu_offload to reduce VRAM usage to 40G.`
- 权重硬数据（HF API，全部 bf16）：

| 文件 | 大小 |
|---|---|
| `models_t5_umt5-xxl-enc-bf16.pth` | 11.362 GB |
| `diffusion_pytorch_model-00001-of-00004` | 9.959 GB |
| `diffusion_pytorch_model-00002-of-00004` | 9.986 GB |
| `diffusion_pytorch_model-00003-of-00004` | 9.965 GB |
| `diffusion_pytorch_model-00004-of-00004` | 7.854 GB |
| `models_clip_open-clip-xlm-roberta-large-vit-huge-14.pth` | 4.772 GB |
| `Wan2.1_VAE.pth` | 0.508 GB |
| **合计** | **54.46 GB** |

- `inference_script_single_gpu.sh` **全文只有 `CUDA_VISIBLE_DEVICES=0` 与一条 python 命令，不含任何 offload 参数**；`--cpu_offload` 是 `generate_video.py` 第 71–73 行的可选 flag（help: "Enable CPU offload for low VRAM usage"），README 要你手动加。**加满 offload 后官方数字是 40GB —— 仍是 16GB 的 2.5 倍。**

### 3.4 有无量化 / 蒸馏版本？—— **官方无**
- **官方仓库内未查到任何量化（fp8/int8/GGUF）或更小蒸馏权重**；HF 只有上述 14B bf16。
- 官方「蒸馏」指的是**训练阶段**（Self-Correcting Bidirectional Distillation，从 InfiniteTalk 教师蒸馏成 4 步学生），**不是发布小模型**。
- **社区量化（第三方 GGUF/fp8）：未查到。**
- 官方给出的消费级替代品是**另一个模型 SoulX-FlashHead（1.3B）**——这才是 16GB 路线。
- README「Coming soon」是 **4-GPU 实时版**，不是单卡版。

### 3.5 其它字段
- **实现方式**：2D 潜空间 DiT，基于 **InfiniteTalk + Wan2.1**，代码底座 Self-Forcing；bidirectional teacher→bidirectional student。
- **加速依赖**：xDiT 混合序列并行（Ulysses + Ring Attention，8 卡 5× 加速）+ **3D VAE 切片并行**（LightX2V，5×）+ **FlashAttention-3**。论文原文："we **tailor our kernel implementations for the Hopper architecture**" → **FA3 是 Hopper 专属**，sm_120 无官方路径。
- **许可**：Apache-2.0（HF 仓库含 `LICENSE.txt`）。
- **中文**：✅ 音频编码器用 **`TencentGameMate/chinese-wav2vec2-base`**；示例含 `examples/cantonese_16k.wav`（粤语）。
- **半身/全身**：论文强调 full-body coherence → **支持全身/半身**（它的强项）。
- **流式**：✅ 真流式（chunk 级，33 帧/clip 含 5 运动帧），支持无限长。
- **首帧延迟**：官方只给「0.87s start-up latency」（= 8 卡稳态周期），**未给单卡首帧毫秒数**。

### 3.6 最终判定
> **SoulX-FlashTalk 不属于「16GB 可跑」。** 官方门槛 >64GB（offload 40GB ≈ 2.5×16GB）；核心加速依赖 8 卡序列并行 + Hopper 专属 FA3；**无量化版、无蒸馏小模型、无单卡路线**。README 自己也说明了这一点。想用 Soul 系方案跑 16GB，**唯一答案是 SoulX-FlashHead（1.3B）**。

---

## 4. 任务 B：16GB 单卡可行性逐项明细

### 4.1 LiveAvatar（Alibaba-Quark / 阿里）— ❌ 不可行
- **仓库**：https://github.com/Alibaba-Quark/LiveAvatar ｜**论文**：https://arxiv.org/abs/2512.04677
- stars **2.4k**｜license **Apache-2.0**｜last commit **`august`**（2026-08）
- HF（LoRA）https://huggingface.co/Quark-Vision/Live-Avatar ：lastModified 2025-12-09，likes **258**，仅 `liveavatar.safetensors` **1.353 GB**；底座 **Wan2.2-S2V-14B**（HF 合计 **49.15 GB**）
- 时间线：2025.12.04 论文 → 2025.12.08 多卡实时代码+权重（HF #1 Paper of the day）→ 2025.12.12 **单卡代码（需 ≥80GB）** → **2026.01.20 v1.1：FP8 量化使推理可在 48GB GPU 运行**，编译+cuDNN attention 提速 ~2.5× 峰值/3× 平均 FPS → **2026.06.18 ECCV 2026 Spotlight**
- 性能：**45 FPS on multi-card H800**，4-step sampling，10,000+ 秒流式
- **显存**：实时 TPP 推理「requires **five** GPUs」；单卡脚本 **≥80GB**；**即使开 FP8 也只降到 48GB** → **16GB 差 3 倍，明确不可行**
- 流式 ✅｜中文 **未查到**（底座音频编码器为 `wav2vec2-large-xlsr-53-english`，偏英文）｜半身/全身 **未查到**
- 许可细节：主体 Apache-2.0，README 注明「research preview」

### 4.2 Ditto（antgroup）— ✅ 可行（但有 sm_120 工具链坑）
- **仓库**：https://github.com/antgroup/ditto-talkinghead ｜arXiv 2411.19509｜**ACM MM 2025**
- stars **891**｜license **Apache-2.0**｜last commit **`november 2025`** → **2026 年无新提交**（最新动态 2025.11.12 开源训练代码）
- HF https://huggingface.co/digital-avatar/ditto-talkinghead ：lastModified 2025-11-12，likes 40，仓库合计 **6.93 GB**（含 TRT/ONNX/PyTorch 三套重复权重）
  **PyTorch 路线实际只需**：`hubert_streaming_fix_kv.onnx` 1.461GB + `models/*.pth` ≈0.92GB ≈ **2.4 GB**
- **实现方式**：**2D 运动空间扩散（Motion-Space Diffusion）+ 光流 warp**，借鉴 S2G-MDDiffusion 与 LivePortrait
- **FPS**：FlashHead 论文 Table 3 给出 **45.04 FPS**（流式）——全部对比项中除 FlashHead Lite 外唯一实时
- **16GB 可行性**：✅（权重 ~2.4GB）——但**属推断，未查到官方显存数字或实测帖**
- **首帧延迟**：**未查到**｜流式 ✅（有 `v0.4_hubert_cfg_trt_online.pkl` 在线配置）
- 中文 **未查到**｜半身/全身：基于 LivePortrait 风格 → 头部/肖像，**非全身**
- 🔴 **已知坑（sm_120 关键）**：README 原文——预置 TRT 引擎 `hardware-compatibility-level=Ampere_Plus`，「If your GPU does not support it, please execute the `cvt_onnx_to_trt.py` script」；依赖 **`tensorrt==8.6.1`**（**TRT 8.6.1 根本不支持 Blackwell**，需 TRT 10.x）；另有架构相关预编译插件 `libgrid_sample_3d_plugin.so` 需重编；ONNX 钉 `numpy==2.0.1`。→ **显存不是问题，TensorRT 工具链才是**；可走 PyTorch 后端绕开 TRT，但性能未验证。

### 4.3 EchoMimicV3 / EchoMimicV3-Flash（antgroup / Alipay）— ✅ 可行（非流式）
- **仓库**：https://github.com/antgroup/echomimic_v3 ｜arXiv 2507.03905｜**AAAI 2026**
- stars **1.1k**｜license **Apache-2.0**｜last commit **`march`**（2026-03）
- **2026.01.22 更新 EchoMimicV3-Flash**（HF `BadToBest/EchoMimicV3/tree/main/echomimicv3-flash-pro`）：「🚀 **8-step** High-quality Generation / 🧩 **No Face Mask required** / 💾 **12G VRAM Requirement** / ✅ Supports up to **768×768** Resolution」
- 更早：2025.11.09 AAAI 2026 接收；2025.08.12「**12G VRAM is All YOU NEED**」+「can run on **16G VRAM** using ComfyUI」（第三方 `smthemex/ComfyUI_EchoMimic`，**699⭐**，last commit february）
- **实现方式**：2D 潜空间 DiT，底座 **`alibaba-pai/Wan2.1-Fun-V1.1-1.3B-InP`**（1.3B）
- **测试硬件（README）**：A100(80G) / **RTX4090D (24G)** / **V100(16G)** ← 官方把 16G 的 V100 列为测过的卡
- **16GB 可行性：✅**（官方 12GB 门槛 + 官方验证过 V100 16GB）
- **流式：❌ 非流式**（长视频靠分段 + Long Video CFG；「If you want to generate a video longer than 138 frames, you can use Long Video CFG」）→ 适合离线生成
- **中文：✅ 明确**（Flash 档用 `chinese-wav2vec2-base`；README 有 Chinese Driven Audio 图集与 README_zh.md）
- 半身/全身：EchoMimicV2 即主打 Semi-Body → **半身支持明确**；全身未查到
- 降显存：`partial_video_length` 设 81/65 或更小
- 首帧延迟 / FPS：**未查到**｜sm_120：**未查到**专门报告

### 4.4 InfiniteTalk（MeiGen-AI）— ⚠️ 极限
- **仓库**：https://github.com/MeiGen-AI/InfiniteTalk
- stars **7.9k**｜license **Apache-2.0**｜last commit **`may`**（2026-05）
- 底座 Wan2.1 **14B**；是 SoulX-FlashTalk 的**教师模型**（FlashTalk 论文原文 "We build our model upon the **InfiniteTalk** architecture"）
- **低显存路径（README 明确给出）**：`--num_persistent_param_in_dit 0` → "Run with very low VRAM"；**int8 量化**（Todo 已勾）；**fp8 量化模型** `--quant fp8 --quant_dir weights/InfiniteTalk/quant_models/infinitetalk_single_fp8.safetensors`（"Only support run with single gpu"）；第三方 **Wan2GP**（deepbeepmeep/Wan2GP）集成，官方原文「optimized for low VRAM」
- **16GB 可行性：⚠️ 不保证** —— 14B fp8 ≈ 14GB 权重 + 激活，16GB 卡余量极小；**未查到 16GB 实测**
- **流式：❌ 不是低延迟流式**（无限长度 ≠ 实时；无 FPS/首帧数字）｜中文 **未查到**

### 4.5 HunyuanVideo-Avatar（腾讯混元）— ❌
- **仓库**：https://github.com/Tencent-Hunyuan/HunyuanVideo-Avatar ｜论文 https://arxiv.org/pdf/2505.20156
- stars **2.2k**｜last commit **`december 2025`**｜license：shields 报 `not identifiable by github` → **自定义（腾讯混元社区许可）**
- **实现方式**：**3D MM-DiT**；角色图注入 + 音频情绪模块 (AEM) + Face-Aware Audio Adapter (FAA) 支持**多角色对话**
- **显存（README 原文）**：「**Minimum**: The minimum GPU memory required is **24GB** for 704px768px129f but very slow.」「**Recommended**: 96GB.」；测试环境 8 GPU
  - 第三方 **Wan2GP + TeaCache 可在 10GB VRAM 单卡运行**（README News 2025.06.06 收录）→ ⚠️ 非官方路径，且 2025 年项目
- **16GB：⚠️ 官方最低 24GB（不可行）；第三方 Wan2GP 称 10GB（可行但非官方非实时）**
- 流式 ❌（批量 129 帧）｜中文 **未查到**｜**半身/全身均支持**（"Multi-scale generation spanning portrait, **upper-body and full-body**"）← 它的强项
- **2026 年无新提交**

### 4.6 Hallo3 — ❌ 已停更
- **仓库**：https://github.com/fudan-generative-vision/hallo3
- stars **1.4k**｜license **MIT**｜last commit **`march 2025`**；News 最新 2025/02/27（CVPR 2025）
- 测试硬件 **H100**；Ubuntu 20.04/22.04 + CUDA 12.1
- FPS：FlashHead 论文 Table 3 给出 **0.16 FPS** → 无实时价值
- **Hallo4**：真实但 **38⭐**、last commit **2025-11-30**、**无 LICENSE**、**HF 权重门控（401 restricted，需申请）**、仅 5 个 commit、README 要求 H100 → 2026 无活动，**工程可用性极低**

### 4.7 既有基线项目（详表见 `_clusterC.md`）

| 项目 | ⭐ | License | 2026 状态 | 16GB 结论 | 首帧延迟 | FPS | 流式 |
|---|---|---|---|---|---|---|---|
| **LiveTalking** | 9.6k | Apache-2.0 | ✅ 2026-09-13 | **✅ 最稳**。wav2lip 实测 **1.3GB**、4090 上 **750fps**；musetalk **必须含 PR #612**（缺 `@torch.no_grad()` 时峰值 17.62GB→OOM，修复后 **3.9GB**）；ernerf ~2GB。⚠️ RAM 也是瓶颈（10s 1080p 缓存 ≈1.61GB/路，默认 5 路）。官方验证栈 **torch 2.9.1 + CUDA 12.8（= sm_120 可用）**，无 flash-attn/triton/onnx 依赖 | 未查到 | wav2lip256: 3060=**60**、3080Ti=**120**；musetalk: 4090=**72** | ✅ 支持**打断** + WebRTC/RTMP + 多并发 |
| **MuseTalk 1.5** | 6.6k | MIT | ❌ **最后提交 2025-09-26（停更近一年）** | ✅ **5060 Ti 16GB 实测 ~3.6GB**（issue #409，361 帧验证）。⚠️ 必须 torch 2.10+**cu128**；须绕开 mmcv（Py3.12 编译失败→face-alignment） | TTFV 1769ms(3090)/2095ms(4090)〔第三方〕 | **≈5.8fps（非实时）**；官方 30fps+@V100 | ❌ **官方成员确认不支持音频流式**（issue #33） |
| **LatentSync 1.6** | 6.1k | **Apache-2.0（本批唯一真正宽松的开源许可）** | ❌ 停更（1.6 发布 2025-06-11） | ⚠️ **官方 1.6 门槛 18GB > 16GB**；第三方在 **RTX 5070 Ti 16GB 实测跑通**：eager 峰值 **15,807MB**（贴 96%）、TensorRT 后 **12,551MB**。**1.5 官方门槛 8GB，稳妥可用** | 未查到 | 🔴 **≈0.61–0.90 帧/秒**（比实时慢 28~41 倍） | ❌ 离线批处理 |
| **Wav2Lip** | 13k | 🔴 **无 LICENSE；README 明确「any form of commercial use is strictly prohibited」** | 停更 | ⚠️ 显存够（1.3GB）但 **`torch==1.1.0` 是 2019 年化石**（PyPI 仅 9 个 wheel、cp27–cp37、无 cp38+、manylinux1 2010 ABI）→ **Py3.12 装不上、sm_120 跑不了、生态全断**，只能当算法参考 | 未查到 | 经 LiveTalking 3060=60fps；4090=750fps@1.3GB | ❌ 自身不支持 |
| **LivePortrait** | 19k | MIT（**InsightFace 模型仅限非商业研究，商用须替换**） | ✅ 2026-06（已改名 KlingAIResearch） | ✅ **建议取 8GB 保守门槛**（官方权重 499.6MB / pinokio 6GB / aigcpanel 标 8G+） | ~1 分钟 torch.compile 首次编译 | **14.77ms/帧 ≈ 67.7 FPS**（4090+torch.compile，纯模型）；FasterLivePortrait 3090 30+FPS 含前后处理 | ❌ 官方无 |
| **OpenAvatarChat** | 3.8k | Apache-2.0 | ✅ 2026-07 | ✅ **LAM 实测 3.1GB、LiteAvatar 5.3GB**（RTX3060 6G 笔记本）；要求 CUDA≥12.8、驱动≥575.64.03 | **平均响应 2.2s**（i9-13900KF+4090，"用户说完→数字人开口"） | 输出典型 25fps | ✅✅ **0.6.0 起全后端手动+双工打断（本批最强）** |
| **Linly-Talker** | 3.5k | MIT | ⚠️ **主仓 2026-02 起停更** | ⚠️ 取决于组合；官方无数字，第三方估「12GB 最低门槛」（可信度低） | 未查到 | MuseTalk V100 >30fps（转述上游） | ⚠️ 主仓 ❌；**Linly-Talker-Stream ✅ barge-in 全双工** |
| **Fay** | 14k | 🔴 **GPL-3.0**（商用传染风险） | ✅ yesterday | ✅ **本体 0 显存**（纯编排，不渲染） | 未查到 | 未查到 | ✅ 全时流式 + 支持打断 |
| **aigcpanel** | 5.6k | Apache-2.0 | ✅ **2026-09-22（今天）** | ✅ **面板 0 显存**；**官方 12 个模型包中 11 个 ≤16GB**（Wav2Lip/SadTalker 4G+、MuseTalk 6G+、LatentSync/Heygem-v2/LivePortrait/FlashHead-Lite 8G+、Heygem 16G+；唯一超限 **FlashTalk-14B 24G+**）；**6 包标「支持50显卡」** | 未查到 | 未查到（唯一数字是 FlashHead Lite 标称 96FPS） | ❌ 任务式批处理 |
| **Ultralight-Digital-Human** | 2.6k | ⚠️ 存疑（shields `not specified`，README 徽章 Apache-2.0） | 停更 | ✅ 显存必然够（实测未查到）；真瓶颈是 **RAM ~10GB/路** + **官方 `torch 1.13.1+cu117` 无 sm_120** | 未查到 | **<10ms/帧**（2080 多并发，**需转 ONNX**）〔作者实测〕 | ⚠️ 支持但代码未完善；继任 **FeatherTalk**（Apache-2.0，C++/MNN） |
| **Duix.Avatar**（原 Duix.Heygem） | 16k | 自定义（**合规雷，见下**） | ✅ 2026-04 | 🔴 **当前在 sm_120 上不可用** | 未查到 | 未查到（issue #251：4×24G 显卡"推理速度很慢"） | ❌ **官方自述非实时** |

**🔴 Duix.Avatar = 本报告最重要的反面教材 + 合规雷**
- [issue #624](https://github.com/duixcom/Duix-Avatar/issues/624)（2026-09-04，**Open 零回复**）：RTX 5070 **CC12.0** 报 `no kernel image is available`，根因是**默认 Docker 镜像的 PyTorch 无 CC12.0 内核，用户无力自救**；仅有 5090 专用 compose，**未验证 5060 Ti**。→ **「README 声称支持 50 系」≠「实际可用」。**
- **许可证有 100 倍口径差**：LICENSE 正文第 2 条写 **1,000 MAU** 门槛，而 README 英文对比表写「**more than 100,000 users or annual revenue exceeding 10 million USD**」→ **差 100 倍，官方未说明以哪个为准，建议按 LICENSE 从严**。
- 另有 5 项易漏义务：① 须在网站/UI/文档**显著展示 "Built with DUIX.COM"** 并在 ToS/EULA 声明；② 若分发基于其材料训练/微调的模型，**模型名必须以 "DUIX.COM" 开头**；③ 分发须保留 `Notice` 署名；④ 第 5.c 条你须授予 DUIX **永久/不可撤销的案例营销权**；⑤ 第 5.b 条你若起诉 DUIX 则许可自动终止。
- **对照：LatentSync 的 LICENSE 已核实为标准 Apache-2.0 —— 本批唯一真正宽松的开源许可。**

---

## 5. sm_120 / Blackwell 兼容性坑（本机 RTX 5060 Ti 关键）

> 完整版（含全部 issue 链接）见 `_clusterD.md` §1。

### 5.1 总根因
**消费级 Blackwell（sm_120）只有 Ampere 时代的 `mma.sync.aligned.m16n8k16`（MMAv2），没有 tcgen05 / WGMMA / TMEM** —— 那是企业级 Blackwell（sm_100/103）专属。
- [Dao-AILab/flash-attention#2307](https://github.com/Dao-AILab/flash-attention/issues/2307) 原文：*"SM120 uses SM80-era mma.sync.aligned.m16n8k16 MMA instructions (no tcgen05/WGMMA/TMEM)."*
- [triton-lang/triton#9734](https://github.com/triton-lang/triton/pull/9734) 原文：*"There is no sm_120a. Consumer Blackwell is just sm_120."*

→ **任何只在 sm_90a / sm_100a 上编译的 attention 内核（FA3、FA4、SageAttention3 FP4）在 sm_120 上要么编译失败、要么静默走退化路径。**

### 5.2 SageAttention（坑最多，与本机 H3 掉总线问题同源）
- **PyPI 包无 sm_120 内核**：[#303](https://github.com/thu-ml/SageAttention/issues/303)（提问者正是 **RTX 5060 Ti 16GB**）自建 wheel 后 `getattr(sageattention, "_fused_attention", None)` → **False**，`device_capability=(12,0)`，几乎无加速；同 issue 发现 `setup.py` 的 `SUPPORTED_ARCHS` 里 `"10.0" "12.0"` **少一个逗号**导致 12.0 未被当作受支持架构。
- **内幕**：[#392](https://github.com/thu-ml/SageAttention/issues/392) 定位 sm_120 dispatch **实际调用的是 `_qattn_sm89` 内核**（用 `-gencode arch=compute_120a` 把 SM89 内核编成 sm_120a）→ **这解释了「能跑但静默出错/驱动挂死」**。
- 具体报错：

| 现象 | 环境 | 来源 |
|---|---|---|
| **驱动级 GPU lost**（`GPU is lost`，需重启，~54s 崩）；原生 SDPA 在**更高**显存（15.3 vs 13.0GB）下跑通 → 排除显存/功耗/温度 | **RTX 5060 Ti 16GB** + MiniMax H3 | [#391](https://github.com/thu-ml/SageAttention/issues/391) |
| `CUDA error: misaligned address` | 5060 Ti | [#357](https://github.com/thu-ml/SageAttention/issues/357) |
| `ptxas error: Instruction 'wgmma.fence' not supported on .target 'sm_120'` | `TORCH_CUDA_ARCH_LIST` 含 9.0 | [#291](https://github.com/thu-ml/SageAttention/issues/291) |
| **静默噪声**（>~160k token，无异常） | sm_120 + H3 | [#388](https://github.com/thu-ml/SageAttention/issues/388) |
| CUDA Graph 重放静默偏差 ~90% | sm_120 | [#392](https://github.com/thu-ml/SageAttention/issues/392) |
| `Failed to initialize the TMA descriptor 1` | ~74k token | [#382](https://github.com/thu-ml/SageAttention/issues/382) |
| `sageattention is not new enough version or could not determine CUDA architecture…` | ComfyUI H3 mem-eff patch | [KJNodes#721](https://github.com/kijai/ComfyUI-KJNodes/issues/721) |

- **✅ 已知修复**：① [woct0rdho/SageAttention](https://github.com/woct0rdho/SageAttention) fork 预编译 wheel **`v2.2.0-windows.post6`**，README 原文 "also **sm120 for CUDA >= 12.8**"（**CUDA 12 与 13 不通用**）；② [mengqin/SageAttention](https://github.com/mengqin/SageAttention) fork + `-allow-unsupported-compiler`（已验证修好 5060 Ti / 5070 Ti）。
- **本机建议：H3 等长序列直接关 SageAttention 走 PyTorch SDPA**（#388/#391 双证据）。这与本机既有运维结论一致。

### 5.3 FlashAttention
- **FA2 预编译 wheel 不含 sm_120** → `CUDA error: no kernel image is available for execution on the device`（[#1638](https://github.com/Dao-AILab/flash-attention/issues/1638)）；需源码编译（`--no-build-isolation`），耗时且易失败。
- **FA3** 依赖 Hopper WGMMA，需 guard（[PR #2593](https://github.com/Dao-AILab/flash-attention/pull/2593)）→ **sm_120 不可用**（这也直接否决了 SoulX-FlashTalk）。
- **FA4** 走 tcgen05，**原生不支持消费级**；2026 社区在补 `flash_fwd_sm120.py` 但受阻（[#2307](https://github.com/Dao-AILab/flash-attention/issues/2307)/#2499/#2634/#2758/#2771）。
- ⚠️ 但注意：**SoulX-FlashHead 论文明确声称 FA2 "maximizes memory bandwidth utilization on NVIDIA Ada Lovelace and Blackwell architectures"** → FA2 是唯一对 sm_120 有官方说法的 attention 后端，但**预编译 wheel 是否含 sm_120 仍需实测确认**。

### 5.4 PyTorch / CUDA / ONNX / 其它
- **PyTorch 2.7 是首个正式支持 Blackwell 的稳定版**，发 cu128 预编译 wheel，内置 **Triton 3.3**（https://pytorch.org/blog/pytorch-2.7/ ）。
  ⚠️ **但官方该节标题逐字是「`[Prototype]` NVIDIA Blackwell Architecture Support」——即便升到 2.7+cu128 也属原型级，需留实测余量。**
- **cu121 的硬证据**：其运行期支持的 arch 列表逐字为「sm_50 sm_60 sm_61 sm_70 sm_75 sm_80 sm_86 **sm_90**」——**止于 sm_90，无 sm_120**；且 pytorch issue **#166794 标题即「RTX 5070 Ti (sm_120) not recognized by PyTorch 2.5.1+cu121」**。
  → **凡把 torch 钉在 <2.7 或 cu117/cu121/cu124 的项目（Wav2Lip、Ultralight、MuseTalk 旧档、LatentSync 的 `torch 2.5.1+cu121`），原样在 5060 Ti 上都会报 `no kernel image is available`。**
- ⚠️ `sm_120a` 后缀会被自动剥掉（只生成 `sm_120`），破坏 CUTLASS block-scale MMA/NVFP4（[pytorch#172807](https://github.com/pytorch/pytorch/issues/172807)）；cuDNN SDPA 在 sm_120 上 head_dim 上限卡 128（[#181379](https://github.com/pytorch/pytorch/issues/181379)）。
- **ONNX Runtime 是第二个深坑**：
  - 官方 PyPI `onnxruntime-gpu` **不含 sm_120 内核** → `CUDAExecutionProvider` 不可用、全部回退 CPU（[Natfii/onnxruntime-gpu-blackwell](https://github.com/Natfii/onnxruntime-gpu-blackwell)）。
  - [ORT #27621](https://github.com/microsoft/onnxruntime/issues/27621)：**RTX 5060 sm_120 上 `InferenceSession.run()` 在 Python 线程内静默死锁**（已被 stale 机器人关闭）。
  - **版本跨度坑**：官方文档逐字「1.26.x–1.21.x | CUDA 12.8」，且 12.8 构建只保证与 **12.x** 兼容。**LatentSync 钉的 `onnxruntime-gpu==1.21.0` 是 cu12.8 构建，而目标机是 CUDA 13.2 → 跨大版本，可能缺 `libcudart.so.12`**；须升 ORT ≥1.27（cu13.0）后重测，或补 CUDA 12 运行库。
  - 官方版本表：**≥1.27 起 PyPI 包默认用 CUDA 13.0 构建**（[ORT 官方文档](https://onnxruntime.ai/docs/execution-providers/CUDA-ExecutionProvider.html)）。→ 依赖 onnxruntime 的项目（**LivePortrait 硬钉 1.18.0**、LatentSync、Ultralight 流式）**必须换 ≥1.27 或第三方重建 wheel**。
- **xformers**：直到 [PR #1254](https://github.com/facebookresearch/xformers/pull/1254)（已 merged）才支持 Blackwell（检查 CUDA≥12.8 即启用 capability 120）——该 PR 之前官方预编译 wheel **完全不支持 50 系**。
- **Triton**：3.3 随 torch 2.7 首发支持 Blackwell；sm_120 有 ≥2 个 `tl.load()` 即 segfault 的 bug（pytorch#176426）。
- **cuDNN**：好消息 —— torch 2.4+ 与 2.5.1 同为 **cuDNN 9**，换 torch 时 cuDNN 不冲突。
- **本机既有验证**：torch 为 cu130 而系统 CUDA 13.1 → 需注入 `LD_LIBRARY_PATH=.../nvidia/cu13/lib` 才能找到 `libnvrtc-builtins.so.13.0`（见工作区 `dl-hub/10-视频生成流水线` 运维记录）。

### 5.5 对本次候选项目的 sm_120 风险评级

| 项目 | 风险 | 理由 |
|---|---|---|
| **NanoAvatar** | 🟢 最低 | 官方要求 `torch==2.10.0+cu128`（原生 sm_120）；**不依赖 SageAttention/flash-attn**；纯 CUDA |
| **SentiAvatar** | 🟢 最低 | 不碰 diffusers/attention 内核，只跑 vLLM(Qwen2-0.5B) |
| **SoulX-FlashHead** | 🟢 低 | 用 **FA2**（论文声明支持 Blackwell），SageAttention 是**可选**项（README「Optional」）→ **建议不装**；`torch==2.7.1+cu128` |
| **EchoMimicV3** | 🟡 中 | 无 sm_120 专门报告；Wan2.1-Fun 生态在 Blackwell 上社区已跑通；需 `torch==2.10+cu128` |
| **LiveTalking** | 🟡 中 | 官方验证栈 **torch 2.9.1 + CUDA 12.8**（= sm_120 可用）；无 flash-attn/triton/onnx 依赖 → 实际风险低。⚠️ musetalk 后端必须含 PR #612 |
| **LatentSync** | 🟡 中 | 无 flash-attn 天坑，只差一次 torch 升级；已被第三方在 RTX 5070 Ti 16GB 实测跑通 |
| **Ditto** | 🔴 高 | `tensorrt==8.6.1` + 预编译 `Ampere_Plus` 引擎 + 自编译 `.so`，全不含 sm_120 → 必须升 TRT 10 + 重转引擎 + 重编插件，或改走 PyTorch 后端 |
| **LivePortrait** | 🔴 高 | `onnxruntime-gpu` 硬钉 **1.18.0**（无 sm_120）+ ORT #27621 静默死锁；TRT 实时档必须 TensorRT 8.x |
| **SoulX-FlashTalk** | 🔴 极高 | 依赖 **Hopper 专属 FlashAttention-3** → sm_120 无路径（且显存已否决） |
| **Duix.Avatar** | 🔴 极高 | **已确认在 Blackwell 上报错且无人修**（issue #624） |

---

## 6. 16GB / sm_120 落地检查清单

| 检查项 | 要求 | 依据 |
|---|---|---|
| **PyTorch** | **≥2.7，且必须 cu128+ 轮子**（推荐 cu128–cu130）；注意官方仍标 `[Prototype]` | [PyTorch 2.7 发布说明](https://pytorch.org/blog/pytorch-2.7/)；MuseTalk [#409](https://github.com/TMElyralab/MuseTalk/issues/409) 的 cu124/cu126 ❌ vs cu128 ✅；pytorch #166794 |
| **onnxruntime-gpu** | **≥1.27（CUDA 13.0 构建）**；避免 1.18/1.21 旧档（1.21 是 cu12.8，与 CUDA 13.2 跨大版本）；或换第三方 sm_120 wheel | [ORT 版本表](https://onnxruntime.ai/docs/execution-providers/CUDA-ExecutionProvider.html)；[Natfii/onnxruntime-gpu-blackwell](https://github.com/Natfii/onnxruntime-gpu-blackwell)；ORT [#27621](https://github.com/microsoft/onnxruntime/issues/27621) |
| **CUDA** | 驱动支持的 CUDA **≥12.8**（目标机 CUDA 13.2 ✅） | OpenAvatarChat 快速开始页；Duix「50 series … CUDA 12.8」 |
| **NVIDIA 驱动** | RTX 50 系建议 **≥575.64.03**（目标机 610.43.02 ✅） | OpenAvatarChat System Requirements |
| **SageAttention** | **原则不装**；必须用时换 [woct0rdho](https://github.com/woct0rdho/SageAttention) `v2.2.0-windows.post6` 或 mengqin fork | [#391](https://github.com/thu-ml/SageAttention/issues/391)/[#388](https://github.com/thu-ml/SageAttention/issues/388) |
| **flash-attn** | 需**源码编译**（`--no-build-isolation`），sm_120 下耗时易失败；**FA3 不可用** | FA [#1638](https://github.com/Dao-AILab/flash-attention/issues/1638)；OAC 快速开始页 |
| **mmcv / mmpose** | **Python 3.12 无 wheel 且源码编译失败** → 改用 **face-alignment** | MuseTalk [#409](https://github.com/TMElyralab/MuseTalk/issues/409)、[#334](https://github.com/TMElyralab/MuseTalk/issues/334) |
| **`torch.load`** | 新 PyTorch 默认 `weights_only=True`，加载旧 checkpoint 需调整参数 | MuseTalk [#334](https://github.com/TMElyralab/MuseTalk/issues/334) |
| **显存** | 推理路径必须带 `@torch.no_grad()`，batch 降到 8 | LiveTalking [PR #612](https://github.com/lipku/LiveTalking/pull/612) / [issue #192](https://github.com/lipku/LiveTalking/issues/192) |
| **验证方法** | **不要只信 README**：先跑 `python -c "import torch;print(torch.cuda.get_device_capability())"`（应得 `(12, 0)`），再跑官方最小推理样例 | Duix [#624](https://github.com/duixcom/Duix-Avatar/issues/624) 的教训 |
| **商用许可** | 🔴 **明确禁商用**：Wav2Lip（README 原文「any form of commercial use is strictly prohibited」）、**Sonic（CC BY-NC-SA 4.0）**、**FLOAT（CC BY-NC-ND 4.0）**、AVTR-1（**PolyForm Noncommercial 1.0.0**）、NanoAvatar 口型权重（**CC BY-NC**）、SentiAvatar（**CC BY-NC-SA**）。⚠️ **无明确许可**：Hallo4、FantasyTalking2。⚠️ **门槛/附加义务**：Duix.Avatar（MAU/营收门槛 + 5 项义务，且 LICENSE 与 README 口径差 100 倍）；LivePortrait（须替换 InsightFace 检测模型）。**GPL-3.0（传染）**：Fay。✅ **本批最宽松**：LatentSync / SoulX-FlashHead / SoulX-FlashTalk / LiveAvatar / Ditto / EchoMimicV3 / LiveTalking / OpenAvatarChat（均 Apache-2.0） | 各项目 LICENSE / README |
| **训练** | **16GB 单卡一律不可训练**（MuseTalk ≥32GB、LatentSync ≥20GB、stage2 55GB） | 各项目 README |

---

## 7. 最终选型建议（针对 RTX 5060 Ti 16GB / sm_120）

**若目标是「实时流式对话数字人」**
1. **首选 SoulX-FlashHead Lite** —— 1.3B、Apache-2.0、社区实测显存仅 **6GB**、单 4090 96FPS、2026 年新项目且仍在更新。需注意：96FPS 硬件口径存疑、中文音频编码器未换、512×512 头肩为主、首帧延迟官方未给。
2. **工程最稳 LiveTalking（`--model wav2lip`）** —— 9.6k⭐、2026-09-13 仍活跃、实测 1.3GB、官方栈恰为 CUDA 12.8、支持打断 + 中文 + 全身、无 flash-attn/onnx 依赖。用 musetalk 后端则**必须确认已含 PR #612**。
3. **LAM/LiteAvatar 路线走 OpenAvatarChat** —— 实测 3.1/5.3GB、**0.6.0 起双工打断（本批最强）**、平均响应 2.2s。
4. **次选 Ditto** —— Apache-2.0、运行时权重 ~2.4GB、45FPS；代价是必须解决 TensorRT 8.6.1 → TRT 10 的引擎重转。
5. **端侧选 NanoAvatar** —— ~0.8GB、103ms 首帧、torch 2.10+cu128；⚠️ 口型权重 CC BY-NC。

**若目标是「离线高质量出片」**：EchoMimicV3-Flash（官方 12GB、支持中文、半身）＞ LatentSync 1.5（8GB 门槛，但 0.6–0.9 帧/秒）＞ HunyuanVideo-Avatar（第三方 Wan2GP 路径，半身/全身均支持）。

**明确排除**：SoulX-FlashTalk（>64GB）、LiveAvatar（80GB / FP8 48GB）、Wan-Dancer（85.67GB / 8×A800）、HunyuanVideo-Avatar（官方 24GB 起）、Hallo3（停更 + 0.16FPS）、Duix.Avatar（sm_120 已确认不可用 + 合规雷）。

**若需要「会听会说的大脑」而非「脸」**：Realtime-Venus（9B 全双工，Apache-2.0，2026-09-22 当天仍在更新），但需量化才能在 16GB 上跑。

---

## 8. 来源清单

### 8.1 GitHub 仓库（README 均经 curl / jsDelivr 实取）
- SoulX-FlashHead：https://github.com/Soul-AILab/SoulX-FlashHead
  - README：https://raw.githubusercontent.com/Soul-AILab/SoulX-FlashHead/main/README.md
  - 流式 Gradio 源码：https://raw.githubusercontent.com/Soul-AILab/SoulX-FlashHead/main/gradio_app_streaming.py
  - 推理步数配置：https://raw.githubusercontent.com/Soul-AILab/SoulX-FlashHead/main/flash_head/inference.py
  - 推理参数 YAML（jsDelivr）：https://cdn.jsdelivr.net/gh/Soul-AILab/SoulX-FlashHead@main/flash_head/configs/infer_params.yaml
  - ComfyUI 节点：https://github.com/HM-RunningHub/ComfyUI_RH_FlashHead
- SoulX-FlashTalk：https://github.com/Soul-AILab/SoulX-FlashTalk
  - 单卡脚本：https://raw.githubusercontent.com/Soul-AILab/SoulX-FlashTalk/main/inference_script_single_gpu.sh
  - 多卡脚本：https://raw.githubusercontent.com/Soul-AILab/SoulX-FlashTalk/main/inference_script_multi_gpu.sh
  - 主脚本（含 `--cpu_offload`）：https://raw.githubusercontent.com/Soul-AILab/SoulX-FlashTalk/main/generate_video.py
- LiveAvatar：https://github.com/Alibaba-Quark/LiveAvatar
- Ditto：https://github.com/antgroup/ditto-talkinghead
- EchoMimicV3：https://github.com/antgroup/echomimic_v3 ｜ ComfyUI 节点：https://github.com/smthemex/ComfyUI_EchoMimic
- InfiniteTalk：https://github.com/MeiGen-AI/InfiniteTalk ｜ MultiTalk：https://github.com/MeiGen-AI/MultiTalk
- HunyuanVideo-Avatar：https://github.com/Tencent-Hunyuan/HunyuanVideo-Avatar
- Hallo3：https://github.com/fudan-generative-vision/hallo3 ｜ Hallo4：https://github.com/fudan-generative-vision/hallo4
- Wan-Dancer：https://github.com/Wan-Video/Wan-Dancer ｜ Wan2.2：https://github.com/Wan-Video/Wan2.2 ｜ Wan2.1：https://github.com/Wan-Video/Wan2.1
- AvatarForcing：https://github.com/KlingAIResearch/AvatarForcing
- AVTR-1：https://github.com/avaturn-live/avtr-1
- NanoAvatar：https://github.com/wpydcr/NanoAvatar
- Realtime-Venus：https://github.com/inclusionAI/Realtime-Venus
- SentiAvatar：https://github.com/SentiAvatar/SentiAvatar
- Super-Star：https://github.com/PeterIverson/Super-Star
- Linly-Talker-Stream：https://github.com/Kedreamix/Linly-Talker-Stream
- Sonic：https://github.com/jixiaozhong/Sonic ｜ FLOAT：https://github.com/deepbrainai-research/float ｜ MEMO：https://github.com/memoavatar/memo
- FantasyTalking2：https://github.com/Fantasy-AMAP/fantasy-talking2
- OmniAvatar：https://github.com/Omni-Avatar/OmniAvatar

### 8.2 论文
- SoulX-FlashHead：https://arxiv.org/abs/2602.07449 ｜全文（Table 3/4）：https://ar5iv.labs.arxiv.org/html/2602.07449
- SoulX-FlashTalk：https://arxiv.org/abs/2512.23379 ｜全文 v3（§3.3 延迟）：https://arxiv.org/html/2512.23379v3
- LiveAvatar：https://arxiv.org/abs/2512.04677
- AvatarForcing：https://arxiv.org/abs/2603.14331
- Realtime-Venus：https://arxiv.org/abs/2609.13814
- SentiAvatar：https://arxiv.org/abs/2604.02908
- Super-Star：https://arxiv.org/abs/2608.24909
- EchoMimicV3：https://arxiv.org/abs/2507.03905
- HunyuanVideo-Avatar：https://arxiv.org/pdf/2505.20156
- Ditto：arXiv 2411.19509 ｜ MuseTalk：https://arxiv.org/abs/2410.10122 ｜ LatentSync：https://arxiv.org/abs/2412.09262

### 8.3 HuggingFace（API 经 hf-mirror.com 实取）
- https://hf-mirror.com/api/models/Soul-AILab/SoulX-FlashHead-1_3B
- https://hf-mirror.com/api/models/Soul-AILab/SoulX-FlashTalk-14B
- https://hf-mirror.com/api/models/Quark-Vision/Live-Avatar ｜ https://huggingface.co/Wan-AI/Wan2.2-S2V-14B
- https://hf-mirror.com/api/models/digital-avatar/ditto-talkinghead
- https://hf-mirror.com/api/models/lycui/AvatarForcing
- https://hf-mirror.com/api/models/wpydcr/NanoAvatar
- https://hf-mirror.com/api/models/inclusionAI/Realtime-Venus
- https://hf-mirror.com/api/models/Wan-AI/Wan-Dancer-14B
- https://hf-mirror.com/api/datasets/Soul-AILab/VividHead
- https://huggingface.co/avaturn-live/avtr-1 ｜ https://huggingface.co/BadToBest/EchoMimicV3

### 8.4 统计徽章（shields.io）
`https://img.shields.io/github/stars|license|last-commit|created-at/<owner>/<repo>.json`

### 8.5 第三方实测 / 媒体
- SoulX-FlashHead 8GB 可用 + lite≈6GB / pro≈8GB 实测：[cnblogs 2026-04-12](https://www.cnblogs.com/dsx2016/articles/19855950) ｜ [CSDN 镜像](https://blog.csdn.net/weixin_37865166/article/details/159695502)
- Soul 开源实时数字人 单卡4090 96FPS：[IT之家](https://m.ithome.com/html/921697.htm) ｜ [C114](https://www.c114.net.cn/industry/60412.html) ｜ [腾讯云社区](https://cloud.tencent.cn/developer/article/2639488) ｜ [PConline](https://m.pcpop.com/article_6917499.html) ｜ [极客公园](https://w.geekpark.net/news/360311)
- 本机（RTX 5060 Ti）既有实测与运维：工作区 `dl-hub/06-ComfyUI-H3运维记录/`、`dl-hub/10-视频生成流水线/`

### 8.6 sm_120 / Blackwell 关键 issue
[thu-ml/SageAttention#391](https://github.com/thu-ml/SageAttention/issues/391) · [#388](https://github.com/thu-ml/SageAttention/issues/388) · [#392](https://github.com/thu-ml/SageAttention/issues/392) · [#357](https://github.com/thu-ml/SageAttention/issues/357) · [#303](https://github.com/thu-ml/SageAttention/issues/303) · [#291](https://github.com/thu-ml/SageAttention/issues/291) · [#382](https://github.com/thu-ml/SageAttention/issues/382) · [Dao-AILab/flash-attention#2307](https://github.com/Dao-AILab/flash-attention/issues/2307) · [#1638](https://github.com/Dao-AILab/flash-attention/issues/1638) · [microsoft/onnxruntime#27621](https://github.com/microsoft/onnxruntime/issues/27621) · [pytorch#172807](https://github.com/pytorch/pytorch/issues/172807) · [pytorch#181379](https://github.com/pytorch/pytorch/issues/181379) · [pytorch#166794](https://github.com/pytorch/pytorch/issues/166794) · [kijai/ComfyUI-KJNodes#721](https://github.com/kijai/ComfyUI-KJNodes/issues/721) · [duixcom/Duix-Avatar#624](https://github.com/duixcom/Duix-Avatar/issues/624) · [TMElyralab/MuseTalk#409](https://github.com/TMElyralab/MuseTalk/issues/409) · [lipku/LiveTalking#612](https://github.com/lipku/LiveTalking/pull/612) · [PyTorch 2.7 发布说明](https://pytorch.org/blog/pytorch-2.7/) · [ORT CUDA EP 版本表](https://onnxruntime.ai/docs/execution-providers/CUDA-ExecutionProvider.html)

### 8.7 本次调研方法局限（须知）
- GitHub REST API 未认证额度（60/hr）中途耗尽 → star/license/last-commit 一律改用 shields.io 徽章值；shields.io 的 last-commit **只返回月份单词（多数无年份）**，已按「晚于 9 月的月份属更早年份」规则排除 2025 及以前。
- `github.com` HTML 在调研后段不可达（返回 000）；`raw.githubusercontent.com` 后期整体超时 → **改用 jsDelivr 镜像**。
- 部分 issue 正文只能取到页面标题（已标为「索引标题级证据」），**未穷举** issue 列表。
- 明确「未查到」的项目：SoulX-FlashHead / FlashTalk / Ditto / LiveAvatar 等的**首帧延迟毫秒数**；Ditto / AVTR-1 的 16GB 实测显存；InfiniteTalk 的 16GB 实测；EchoMimicV3 的 FPS；sm_120 上 SoulX-FlashHead 的**流式**实测帖；**MuseTalk 2.0 / LatentSync 2.x（不存在）**。
