_raw_DH.md

实时数字人(Talking Head / Avatar)框架选型调研 — 2026 年 9 月最新状态

调研日期:2026-09-22(本文件所有 star / 许可 / 最后提交均为当日抓取) 调研人:DH 子代理(DeepSeek Harness)|协作:三个并行子代理 ClusterB/C/D 目标硬件:RTX 5060 Ti 16GB(sm_120 消费级 Blackwell,无 tcgen05/WGMMA/TMEM)、32GB RAM、Ubuntu 24.04、驱动 610.43.02、CUDA 13.2 方法:全部结论以 curl 直取 README / arXiv / HuggingFace API / shields.io 徽章原始返回为依据。 GitHub REST API 本机已限流(60/hr),star/license/last-commit 一律取 shields.io 徽章 JSON 的 message 原值;后端抓取主力为 jsDelivr 镜像(https://cdn.jsdelivr.net/gh/<owner>/<repo>@main/<path>,比 raw.githubusercontent 稳定得多)。 凡查不到的一律写「未查到」,不做推测填充;无一条 URL / 数字 / star 是编造的。

本文件是自包含的:§2 已包含候选名单逐项核实结论,不依赖其它文件。 配套文件(同目录,可选深入阅读):_clusterC.md(11 个既有基线项目 × 16GB 深挖,940 行 / 241 条来源)· _clusterD.md(sm_120/Blackwell 坑 + 2026 新增仓库扫街,127 条来源)· _clusterB.md(候选名单核实,525 行,用 GitHub commits Atom feed 取精确提交时间)。本报告 §2 已独立覆盖候选核实,不依赖上述文件。


0. 结论速览

0.1 一句话

2026 年真正能在 16GB 单卡上跑「实时流式」的,是 SoulX-FlashHead(1.3B)、Ditto、NanoAvatar(0.8GB); 14B 级的 SoulX-FlashTalk / LiveAvatar / Wan-Dancer 在 16GB 上明确不可行,且原因是结构性的(依赖多卡序列并行 + Hopper 专属内核),不是量化就能解决。

0.2 总表

项目首发/最新类型Licensestars16GB 单卡实时流式中文
⭐SoulX-FlashHead2026.02 / 2026.052D 潜空间 DiT 1.3BApache-2.01.1k✅ 社区实测 Lite≈6GB / Pro≈8GB✅ 单4090 96FPS数据集 15 语种
⭐Ditto2025.112D 运动空间扩散+TRTApache-2.0891✅ 运行时 ~2.4GB✅ 45FPS未查到
⭐NanoAvatar2026.09端侧 2D 口型MIT(代码)/CC BY-NC(权重)15✅ 仅 ~0.8GB✅ 首帧 103ms✅ 有中文 demo
EchoMimicV3-Flash2026.012D DiT 1.3BApache-2.01.1k✅ 官方 12GB❌ 非流式✅ 中文 wav2vec2
LiveTalking2026.09.13实时推流框架(多后端)Apache-2.09.6k✅ wav2lip 1.3GB✅ 支持打断✅ 全身
OpenAvatarChat2026.07全链路对话框架Apache-2.03.8k✅ LAM 3.1GB✅ 双工打断✅
AvatarForcing2026.03一步流式扩散 1.3BApache-2.0(README)81⚠️ 权重文件 19GB 待实测✅ 34ms/帧未查到
AVTR-12026.05flow-matching 自回归⚠️非商用469✅ 4060Ti 166ms=1.2×✅未查到
Realtime-Venus2026.09.229B 全双工对话(只出语音,不出脸)Apache-2.040⚠️ 单模型 ~18.7GB✅✅
SentiAvatar2026.043D 动作(输出 BVH)CC BY-NC-SA 4.0453✅ 权重 ~2.9GB✅ 6s/0.3s✅
MuseTalk 1.52025.03(停更)2D latent inpaintingMIT6.6k✅ 5060Ti 实测 3.6GB❌ 官方确认不支持流式✅
LatentSync 1.62025.06(停更)2D diffusion 口型Apache-2.06.1k⚠️ 官方 18GB / 实测 15.8GB 压线❌ 0.6–0.9 帧/秒✅ 1.5 起改进中文
LivePortrait2026.06视频驱动肖像(非 lip-sync)MIT(InsightFace 限非商用)19k✅ 建议 8GB❌ 官方无✅
❌SoulX-FlashTalk2026.01 / 2026.072D DiT 14BApache-2.01.5k❌ >64GB,offload 40GB✅ 但需 8×H800✅ 粤语
❌LiveAvatar2026.01 / 2026.082D DiT 14BApache-2.02.4k❌ 单卡 80GB / FP8 48GB✅ 但需 5×H800未查到
❌Wan-Dancer2026.07音乐→舞蹈 14BApache-2.0432❌ 权重 85.67GB / 8×A800❌—
❌HunyuanVideo-Avatar2025.123D MM-DiT自定义2.2k❌ 官方最低 24GB❌未查到
❌Hallo32025.03(停更)2D 视频 DiTMIT1.4k❌ H100 测试❌ 0.16FPS未查到

1. 任务 A:2026 年新出现 / 大更新的项目

1.1 SoulX-FlashHead(Soul-AILab)— 2026 年最大发现,16GB 首选 ⭐

仓库:https://github.com/Soul-AILab/SoulX-FlashHead arXiv:https://arxiv.org/abs/2602.07449 (v1 2026-02-07,v3 2026-02-11) 权重:https://huggingface.co/Soul-AILab/SoulX-FlashHead-1_3B

活跃度与许可(shields.io 原值):

时间线(README News 原文):2026.02.07 技术报告+数据集 → 2026.02.12 推理代码+权重+项目页+Soul App 在线体验 → 2026.03.02 第三方 ComfyUI 节点 → 2026.03.04 Gradio(含流式)→ 2026.03.09 HF Spaces 流式 demo。Model_Pretrained 仍未发布。

实现方式:2D 潜空间 DiT,1.3B。论文 4. Experiments 原文:"We build our model upon the Wan2.1 T2V (1.3B) architecture"。

显存需求与 16GB 可行性 ✅

文件大小
Model_Lite/diffusion_pytorch_model.safetensors6.108 GB
Model_Pro/diffusion_pytorch_model.safetensors6.031 GB
VAE_LTX/diffusion_pytorch_model.safetensors1.677 GB
VAE_Wan/Wan2.1_VAE.pth0.508 GB

端到端延迟 / FPS

流式 / 可打断:✅ 真流式。gradio_app_streaming.py 源码注释:「单独线程:按 chunk 顺序执行 infer,每生成一帧就放入 res_queue,立即继续下一 chunk」,主线程按 chunk_id 取对应音频合并;CHUNKS_PER_SEGMENT = 3。支持无限长度。「用户插话打断」(barge-in)API → 未查到。

中文 / 半身全身:

生态:HM-RunningHub/ComfyUI_RH_FlashHead(39 stars,last commit february,Apache-2.0);iaskask-com/ComfyUI_iAskAsk_SoulX_FlashHead(存在,统计未查到)。


1.2 NanoAvatar(wpydcr)— 显存最低(~0.8GB) ⭐

仓库:https://github.com/wpydcr/NanoAvatar |权重:https://huggingface.co/wpydcr/NanoAvatar

模型设备FPS首帧显存
NanoAvatar骁龙 8 Gen 339 FPS115 ms834 MiB
NanoAvatar Lite骁龙 8 Gen 341 FPS103 ms700 MiB
NanoAvatar Lite骁龙 8 Gen 118 FPS183 ms693 MiB
量化版(CUDA DLL)RTX 4090333 FPS18 ms834 MiB
全精度RTX 4090224 FPS37 ms1119 MiB

1.3 AvatarForcing(KlingAIResearch / 快手 Kling)— 一步流式扩散

仓库:https://github.com/KlingAIResearch/AvatarForcing |arXiv:https://arxiv.org/abs/2603.14331 |权重:https://huggingface.co/lycui/AvatarForcing


1.4 AVTR-1(avaturn-live)— 唯一给逐卡延迟表,但非商用

仓库:https://github.com/avaturn-live/avtr-1 |权重:https://huggingface.co/avaturn-live/avtr-1

GPU每块延迟实时倍率
L4084 ms2.4×
A10091 ms2.2×
RTX 4060 Ti166 ms1.2×
RTX 3070181 ms1.1×
L4202 ms0.99×
RTX 3060 Ti206 ms0.97×
RTX 4060232 ms0.86×

1.5 Realtime-Venus(Ant Group + 清华)— 只出语音,不出脸(重要辨析)

仓库:https://github.com/inclusionAI/Realtime-Venus |arXiv:https://arxiv.org/abs/2609.13814 (v1 2026-09-12,v2 2026-09-18)


1.6 SentiAvatar(SentiPulse + 人大 GSAI)— 3D 动作路线,最不踩内核坑

仓库:https://github.com/SentiAvatar/SentiAvatar |arXiv:https://arxiv.org/abs/2604.02908


1.7 其他 2026 新仓库(由 ClusterD 扫街所得,star 为 shields.io 实测)

仓库⭐License新建/最后提交一句话实时流式
PeterIverson/Super-Star10Apache-2.02026-07/2026-08[ACM MM 2026] 3D 数字人流式实时交互;Qwen3-Omni-30B-A3B + 在线手势生成(arXiv 2608.24909)✅ ⚠️ 30B 语音前端对 16GB 不友好
Kedreamix/Linly-Talker-Stream133Apache-2.02026-02全双工低延迟实时流式对话数字人(主仓已停更,能力迁至此分仓)✅
rookiestar28/ComfyUI-LongCat-Avatar36MIT2026-06/2026-08LongCat Video Avatar 1.5 的 ComfyUI 节点部分
taochangle/LingCast11未标注2026-08端到端数字人直播平台(LivePortrait+Wav2Lip+DeepSeek+SRS 推流)✅
MrrZed0/Stream-Avatars-Custom1未标注2026-03仓库过小,描述未查到未查到
google/GNM1.5kApache-2.02026-03/2026-09参数化统计人体/头部几何模型(非 talking head)❌
NVlabs/SOMA-X788Apache-2.02026-03/2026-09人体+手部可微表示(非 talking head)❌
k2-fsa/OmniVoice14kApache-2.02026-03/2026-08TTS/语音模型(数字人语音前端候选)❌

既有项目 2026 仍活跃:LiveTalking 9.6k⭐(2026-09-13)· aigcpanel 5.6k⭐(2026-09-22 今天)· Duix-Mobile 8.3k⭐(2026-08)· OpenAvatarChat 3.8k⭐(2026-07)· SoulX-FlashTalk 1.5k⭐(2026-07)· Fay 14k⭐(yesterday)· met4citizen/TalkingHead 1.6k⭐(2026-06)· jdh-algo/JoyVASA 878⭐(2026-04)· dlp3d-ai/dlp3d.ai 358⭐(2026-05)· Project-N-E-K-O/N.E.K.O 3k⭐(2026-09-22)。

2026 年趋势判断:热点已从「LiveTalking/Wav2Lip 式拼装管线」转向 少步流式扩散 talking head(SoulX-FlashHead 96FPS@4090、AvatarForcing one-step、AVTR-1 flow-matching 自回归)与 端侧(NanoAvatar 0.8GB)。


2. 任务 A 附:候选名单逐项核实(真实存在 vs 未找到)

候选名判定证据 / 说明
SoulX-FlashTalk 系列✅ 真实见 §3。2025.12 项目页,2026.01.08 代码+权重,last commit 2026-07;HF 权重 54.46GB
SoulX-FlashHead✅ 真实(2026 新品)见 §1.1。2026.02.12 首发;1.1k⭐ Apache-2.0
LiveAvatar✅ 真实https://github.com/Alibaba-Quark/LiveAvatar 2.4k⭐ Apache-2.0,ECCV 2026 Spotlight(2026.06.18),last commit 2026-08;2026.01.20 v1.1 FP8
Wan-Dancer✅ 真实https://github.com/Wan-Video/Wan-Dancer 432⭐ Apache-2.0,last commit 2026-07;HF Wan-AI/Wan-Dancer-14B lastModified 2026-07-17,likes 186,downloads 15792;权重 85.67GB,实测环境 8×A800 80GB
Wan2.2-S2V✅ 真实https://huggingface.co/Wan-AI/Wan2.2-S2V-14B ,HF lastModified 2025-09-17,likes 475,合计 49.15GB。是 LiveAvatar 的底座
Wan2.2 / Wan2.1✅ 真实且极活跃Wan-Video/Wan2.2 18k⭐,last commit yesterday;Wan-Video/Wan2.1 17k⭐,last commit march(2026)
Hallo3✅ 真实(2026 无活动)fudan-generative-vision/hallo3,1.4k⭐ MIT,last commit march 2025;News 最新 2025/02/27
Hallo4✅ 真实但极小,且权重门控https://github.com/fudan-generative-vision/hallo4 —— 38⭐,last commit 2025-11-30,无 LICENSE 文件。⚠️ HF fudan-generative-ai/hallo4 匿名访问返回 401 restricted(需申请授权);仓库仅 5 个 commit、README 要求 H100 → 工程可用性极低,2026 年无活动
EchoMimic V3✅ 真实antgroup/echomimic_v3,1.1k⭐ Apache-2.0,last commit march(2026),AAAI 2026;2026.01.22 Flash 更新(12GB VRAM)
Hunyuan-Avatar / HunyuanVideo-Avatar✅ 真实(2026 无活动)Tencent-Hunyuan/HunyuanVideo-Avatar,2.2k⭐,last commit december 2025,license 自定义;官方最低 24GB
OmniHuman-1.5❌ 非开源未找到任何 bytedance/OmniHuman* GitHub 仓库(bytedance/OmniHuman-1、bytedance/OmniHuman、OmniHuman/OmniHuman-1 全部 repo not found)。仅以 API 形式在 Replicate / fal.ai 提供 → 闭源
FantasyTalking2⚠️ 降级:仅有论文页,无代码/权重真实仓库名是 Fantasy-AMAP/fantasy-talking2(全小写) —— 65⭐,last commit 2025-08-18,无 LICENSE。ClusterB 复核发现 README 全文仅 Abstract + Citation,没有 inference 代码、权重、安装说明 → 标注 [AAAI 2026] 但工程上不可用,2026 年无活动
Ditto✅ 真实antgroup/ditto-talkinghead,891⭐ Apache-2.0,last commit november 2025;ACM MM 2025
Sonic✅ 真实,2026 有活动https://github.com/jixiaozhong/Sonic —— 3.3k⭐,last commit 2026-01-08,license = CC BY-NC-SA 4.0(🔴 禁商用)。(tencent-ailab/Sonic 不存在)
FLOAT✅ 真实(2026 无活动)https://github.com/deepbrainai-research/float —— 492⭐,last commit 2025-11-10,license = CC BY-NC-ND 4.0(🔴 禁商用);ICCV 2025
MEMO✅ 真实(2026 无活动)仓库名是 memoavatar/MEMO(全大写);1.1k⭐ Apache-2.0,last commit 2025-08-06;仅 preview 模型
MuseTalk 1.5✅ 真实官方 README News 原文:「[03/28/2025] We are thrilled to announce the release of our 1.5 version」。MuseTalk 2.0 → 未找到(README 最新更新条目为 04/05/2025)
LatentSync 1.6✅ 真实官方 README 原文:「2025/06/11: We released LatentSync 1.6」;「2025/03/14: LatentSync 1.5」。LatentSync 2.x → 未找到
Realtime-Venus✅ 真实(2026-09 全新)https://github.com/inclusionAI/Realtime-Venus —— 40⭐ Apache-2.0,last commit 2026-09-22;arXiv 2609.13814。⚠️只出语音不出脸
SentiAvatar✅ 真实(2026-04 全新)https://github.com/SentiAvatar/SentiAvatar —— 453⭐,last commit 2026-04;arXiv 2604.02908
InfiniteTalk✅ 真实MeiGen-AI/InfiniteTalk 7.9k⭐ Apache-2.0,last commit may(2026);是 FlashTalk 的教师模型
MultiTalk✅ 真实MeiGen-AI/MultiTalk 3k⭐ Apache-2.0,last commit may(2026)
OmniAvatar✅ 真实Omni-Avatar/OmniAvatar 1.9k⭐ Apache-2.0,last commit august 2025

3. 特别重点:SoulX-FlashTalk(14B)核实 —— ❌ 16GB 不可行

仓库:https://github.com/Soul-AILab/SoulX-FlashTalk arXiv:https://arxiv.org/abs/2512.23379 |全文 v3:https://arxiv.org/html/2512.23379v3 权重:https://huggingface.co/Soul-AILab/SoulX-FlashTalk-14B

3.1 活跃度与许可

3.2 「0.87s 启动延迟 / 32FPS」的真实测试条件 ✅ 已核实

论文 §3.3 Inference Latency Analysis 原文:

"we analyze component-wise latency on a single-node system with varying numbers of NVIDIA H800 GPUs. The experimental setup targets high-fidelity streaming at a resolution of 720×416 with 4-step denoising. Each clip comprises 33 frames, including 28 generated frames and 5 motion frames. Under this configuration, the pipeline achieves a throughput of up to 32 FPS."

组件级延迟分解(论文 Table 4 / Figure 6):

组件单 GPU8×H800加速比
DiT 每步1070 ms193 ms~5.5×
VAE 运动帧编码97 ms21 ms~4.6×
VAE 生成帧解码988 ms192 ms~5.1×

稳态每轮总延迟(8×H800,Figure 6 原文):876 ms = 音频 33ms + 4 步 DiT 616ms + 帧解码 187ms + 运动帧编码 14ms + 杂项。

结论:32 FPS 的完整前提 = 8×H800 + 720×416 + 4 步去噪 + 33 帧/clip。单卡连实时都达不到。

3.3 显存需求 —— 16GB 明确不可行

文件大小
models_t5_umt5-xxl-enc-bf16.pth11.362 GB
diffusion_pytorch_model-00001-of-000049.959 GB
diffusion_pytorch_model-00002-of-000049.986 GB
diffusion_pytorch_model-00003-of-000049.965 GB
diffusion_pytorch_model-00004-of-000047.854 GB
models_clip_open-clip-xlm-roberta-large-vit-huge-14.pth4.772 GB
Wan2.1_VAE.pth0.508 GB
合计54.46 GB

3.4 有无量化 / 蒸馏版本?—— 官方无

3.5 其它字段

3.6 最终判定

SoulX-FlashTalk 不属于「16GB 可跑」。 官方门槛 >64GB(offload 40GB ≈ 2.5×16GB);核心加速依赖 8 卡序列并行 + Hopper 专属 FA3;无量化版、无蒸馏小模型、无单卡路线。README 自己也说明了这一点。想用 Soul 系方案跑 16GB,唯一答案是 SoulX-FlashHead(1.3B)。


4. 任务 B:16GB 单卡可行性逐项明细

4.1 LiveAvatar(Alibaba-Quark / 阿里)— ❌ 不可行

4.2 Ditto(antgroup)— ✅ 可行(但有 sm_120 工具链坑)

4.3 EchoMimicV3 / EchoMimicV3-Flash(antgroup / Alipay)— ✅ 可行(非流式)

4.4 InfiniteTalk(MeiGen-AI)— ⚠️ 极限

4.5 HunyuanVideo-Avatar(腾讯混元)— ❌

4.6 Hallo3 — ❌ 已停更

4.7 既有基线项目(详表见 _clusterC.md)

项目⭐License2026 状态16GB 结论首帧延迟FPS流式
LiveTalking9.6kApache-2.0✅ 2026-09-13✅ 最稳。wav2lip 实测 1.3GB、4090 上 750fps;musetalk 必须含 PR #612(缺 @torch.no_grad() 时峰值 17.62GB→OOM,修复后 3.9GB);ernerf ~2GB。⚠️ RAM 也是瓶颈(10s 1080p 缓存 ≈1.61GB/路,默认 5 路)。官方验证栈 torch 2.9.1 + CUDA 12.8(= sm_120 可用),无 flash-attn/triton/onnx 依赖未查到wav2lip256: 3060=60、3080Ti=120;musetalk: 4090=72✅ 支持打断 + WebRTC/RTMP + 多并发
MuseTalk 1.56.6kMIT❌ 最后提交 2025-09-26(停更近一年)✅ 5060 Ti 16GB 实测 ~3.6GB(issue #409,361 帧验证)。⚠️ 必须 torch 2.10+cu128;须绕开 mmcv(Py3.12 编译失败→face-alignment)TTFV 1769ms(3090)/2095ms(4090)〔第三方〕≈5.8fps(非实时);官方 30fps+@V100❌ 官方成员确认不支持音频流式(issue #33)
LatentSync 1.66.1kApache-2.0(本批唯一真正宽松的开源许可)❌ 停更(1.6 发布 2025-06-11)⚠️ 官方 1.6 门槛 18GB > 16GB;第三方在 RTX 5070 Ti 16GB 实测跑通:eager 峰值 15,807MB(贴 96%)、TensorRT 后 12,551MB。1.5 官方门槛 8GB,稳妥可用未查到🔴 ≈0.61–0.90 帧/秒(比实时慢 28~41 倍)❌ 离线批处理
Wav2Lip13k🔴 无 LICENSE;README 明确「any form of commercial use is strictly prohibited」停更⚠️ 显存够(1.3GB)但 torch==1.1.0 是 2019 年化石(PyPI 仅 9 个 wheel、cp27–cp37、无 cp38+、manylinux1 2010 ABI)→ Py3.12 装不上、sm_120 跑不了、生态全断,只能当算法参考未查到经 LiveTalking 3060=60fps;4090=750fps@1.3GB❌ 自身不支持
LivePortrait19kMIT(InsightFace 模型仅限非商业研究,商用须替换)✅ 2026-06(已改名 KlingAIResearch)✅ 建议取 8GB 保守门槛(官方权重 499.6MB / pinokio 6GB / aigcpanel 标 8G+)~1 分钟 torch.compile 首次编译14.77ms/帧 ≈ 67.7 FPS(4090+torch.compile,纯模型);FasterLivePortrait 3090 30+FPS 含前后处理❌ 官方无
OpenAvatarChat3.8kApache-2.0✅ 2026-07✅ LAM 实测 3.1GB、LiteAvatar 5.3GB(RTX3060 6G 笔记本);要求 CUDA≥12.8、驱动≥575.64.03平均响应 2.2s(i9-13900KF+4090,"用户说完→数字人开口")输出典型 25fps✅✅ 0.6.0 起全后端手动+双工打断(本批最强)
Linly-Talker3.5kMIT⚠️ 主仓 2026-02 起停更⚠️ 取决于组合;官方无数字,第三方估「12GB 最低门槛」(可信度低)未查到MuseTalk V100 >30fps(转述上游)⚠️ 主仓 ❌;Linly-Talker-Stream ✅ barge-in 全双工
Fay14k🔴 GPL-3.0(商用传染风险)✅ yesterday✅ 本体 0 显存(纯编排,不渲染)未查到未查到✅ 全时流式 + 支持打断
aigcpanel5.6kApache-2.0✅ 2026-09-22(今天)✅ 面板 0 显存;官方 12 个模型包中 11 个 ≤16GB(Wav2Lip/SadTalker 4G+、MuseTalk 6G+、LatentSync/Heygem-v2/LivePortrait/FlashHead-Lite 8G+、Heygem 16G+;唯一超限 FlashTalk-14B 24G+);6 包标「支持50显卡」未查到未查到(唯一数字是 FlashHead Lite 标称 96FPS)❌ 任务式批处理
Ultralight-Digital-Human2.6k⚠️ 存疑(shields not specified,README 徽章 Apache-2.0)停更✅ 显存必然够(实测未查到);真瓶颈是 RAM ~10GB/路 + 官方 torch 1.13.1+cu117 无 sm_120未查到<10ms/帧(2080 多并发,需转 ONNX)〔作者实测〕⚠️ 支持但代码未完善;继任 FeatherTalk(Apache-2.0,C++/MNN)
Duix.Avatar(原 Duix.Heygem)16k自定义(合规雷,见下)✅ 2026-04🔴 当前在 sm_120 上不可用未查到未查到(issue #251:4×24G 显卡"推理速度很慢")❌ 官方自述非实时

🔴 Duix.Avatar = 本报告最重要的反面教材 + 合规雷


5. sm_120 / Blackwell 兼容性坑(本机 RTX 5060 Ti 关键)

完整版(含全部 issue 链接)见 _clusterD.md §1。

5.1 总根因

消费级 Blackwell(sm_120)只有 Ampere 时代的 mma.sync.aligned.m16n8k16(MMAv2),没有 tcgen05 / WGMMA / TMEM —— 那是企业级 Blackwell(sm_100/103)专属。

→ 任何只在 sm_90a / sm_100a 上编译的 attention 内核(FA3、FA4、SageAttention3 FP4)在 sm_120 上要么编译失败、要么静默走退化路径。

5.2 SageAttention(坑最多,与本机 H3 掉总线问题同源)

现象环境来源
驱动级 GPU lost(GPU is lost,需重启,~54s 崩);原生 SDPA 在更高显存(15.3 vs 13.0GB)下跑通 → 排除显存/功耗/温度RTX 5060 Ti 16GB + MiniMax H3#391
CUDA error: misaligned address5060 Ti#357
ptxas error: Instruction 'wgmma.fence' not supported on .target 'sm_120'TORCH_CUDA_ARCH_LIST 含 9.0#291
静默噪声(>~160k token,无异常)sm_120 + H3#388
CUDA Graph 重放静默偏差 ~90%sm_120#392
Failed to initialize the TMA descriptor 1~74k token#382
sageattention is not new enough version or could not determine CUDA architecture…ComfyUI H3 mem-eff patchKJNodes#721

5.3 FlashAttention

5.4 PyTorch / CUDA / ONNX / 其它

5.5 对本次候选项目的 sm_120 风险评级

项目风险理由
NanoAvatar🟢 最低官方要求 torch==2.10.0+cu128(原生 sm_120);不依赖 SageAttention/flash-attn;纯 CUDA
SentiAvatar🟢 最低不碰 diffusers/attention 内核,只跑 vLLM(Qwen2-0.5B)
SoulX-FlashHead🟢 低用 FA2(论文声明支持 Blackwell),SageAttention 是可选项(README「Optional」)→ 建议不装;torch==2.7.1+cu128
EchoMimicV3🟡 中无 sm_120 专门报告;Wan2.1-Fun 生态在 Blackwell 上社区已跑通;需 torch==2.10+cu128
LiveTalking🟡 中官方验证栈 torch 2.9.1 + CUDA 12.8(= sm_120 可用);无 flash-attn/triton/onnx 依赖 → 实际风险低。⚠️ musetalk 后端必须含 PR #612
LatentSync🟡 中无 flash-attn 天坑,只差一次 torch 升级;已被第三方在 RTX 5070 Ti 16GB 实测跑通
Ditto🔴 高tensorrt==8.6.1 + 预编译 Ampere_Plus 引擎 + 自编译 .so,全不含 sm_120 → 必须升 TRT 10 + 重转引擎 + 重编插件,或改走 PyTorch 后端
LivePortrait🔴 高onnxruntime-gpu 硬钉 1.18.0(无 sm_120)+ ORT #27621 静默死锁;TRT 实时档必须 TensorRT 8.x
SoulX-FlashTalk🔴 极高依赖 Hopper 专属 FlashAttention-3 → sm_120 无路径(且显存已否决)
Duix.Avatar🔴 极高已确认在 Blackwell 上报错且无人修(issue #624)

6. 16GB / sm_120 落地检查清单

检查项要求依据
PyTorch≥2.7,且必须 cu128+ 轮子(推荐 cu128–cu130);注意官方仍标 [Prototype]PyTorch 2.7 发布说明;MuseTalk #409 的 cu124/cu126 ❌ vs cu128 ✅;pytorch #166794
onnxruntime-gpu≥1.27(CUDA 13.0 构建);避免 1.18/1.21 旧档(1.21 是 cu12.8,与 CUDA 13.2 跨大版本);或换第三方 sm_120 wheelORT 版本表;Natfii/onnxruntime-gpu-blackwell;ORT #27621
CUDA驱动支持的 CUDA ≥12.8(目标机 CUDA 13.2 ✅)OpenAvatarChat 快速开始页;Duix「50 series … CUDA 12.8」
NVIDIA 驱动RTX 50 系建议 ≥575.64.03(目标机 610.43.02 ✅)OpenAvatarChat System Requirements
SageAttention原则不装;必须用时换 woct0rdho v2.2.0-windows.post6 或 mengqin fork#391/#388
flash-attn需源码编译(--no-build-isolation),sm_120 下耗时易失败;FA3 不可用FA #1638;OAC 快速开始页
mmcv / mmposePython 3.12 无 wheel 且源码编译失败 → 改用 face-alignmentMuseTalk #409、#334
torch.load新 PyTorch 默认 weights_only=True,加载旧 checkpoint 需调整参数MuseTalk #334
显存推理路径必须带 @torch.no_grad(),batch 降到 8LiveTalking PR #612 / issue #192
验证方法不要只信 README:先跑 python -c "import torch;print(torch.cuda.get_device_capability())"(应得 (12, 0)),再跑官方最小推理样例Duix #624 的教训
商用许可🔴 明确禁商用:Wav2Lip(README 原文「any form of commercial use is strictly prohibited」)、Sonic(CC BY-NC-SA 4.0)、FLOAT(CC BY-NC-ND 4.0)、AVTR-1(PolyForm Noncommercial 1.0.0)、NanoAvatar 口型权重(CC BY-NC)、SentiAvatar(CC BY-NC-SA)。⚠️ 无明确许可:Hallo4、FantasyTalking2。⚠️ 门槛/附加义务:Duix.Avatar(MAU/营收门槛 + 5 项义务,且 LICENSE 与 README 口径差 100 倍);LivePortrait(须替换 InsightFace 检测模型)。GPL-3.0(传染):Fay。✅ 本批最宽松:LatentSync / SoulX-FlashHead / SoulX-FlashTalk / LiveAvatar / Ditto / EchoMimicV3 / LiveTalking / OpenAvatarChat(均 Apache-2.0)各项目 LICENSE / README
训练16GB 单卡一律不可训练(MuseTalk ≥32GB、LatentSync ≥20GB、stage2 55GB)各项目 README

7. 最终选型建议(针对 RTX 5060 Ti 16GB / sm_120)

若目标是「实时流式对话数字人」

  1. 首选 SoulX-FlashHead Lite —— 1.3B、Apache-2.0、社区实测显存仅 6GB、单 4090 96FPS、2026 年新项目且仍在更新。需注意:96FPS 硬件口径存疑、中文音频编码器未换、512×512 头肩为主、首帧延迟官方未给。
  2. 工程最稳 LiveTalking(--model wav2lip) —— 9.6k⭐、2026-09-13 仍活跃、实测 1.3GB、官方栈恰为 CUDA 12.8、支持打断 + 中文 + 全身、无 flash-attn/onnx 依赖。用 musetalk 后端则必须确认已含 PR #612。
  3. LAM/LiteAvatar 路线走 OpenAvatarChat —— 实测 3.1/5.3GB、0.6.0 起双工打断(本批最强)、平均响应 2.2s。
  4. 次选 Ditto —— Apache-2.0、运行时权重 ~2.4GB、45FPS;代价是必须解决 TensorRT 8.6.1 → TRT 10 的引擎重转。
  5. 端侧选 NanoAvatar —— ~0.8GB、103ms 首帧、torch 2.10+cu128;⚠️ 口型权重 CC BY-NC。

若目标是「离线高质量出片」:EchoMimicV3-Flash(官方 12GB、支持中文、半身)> LatentSync 1.5(8GB 门槛,但 0.6–0.9 帧/秒)> HunyuanVideo-Avatar(第三方 Wan2GP 路径,半身/全身均支持)。

明确排除:SoulX-FlashTalk(>64GB)、LiveAvatar(80GB / FP8 48GB)、Wan-Dancer(85.67GB / 8×A800)、HunyuanVideo-Avatar(官方 24GB 起)、Hallo3(停更 + 0.16FPS)、Duix.Avatar(sm_120 已确认不可用 + 合规雷)。

若需要「会听会说的大脑」而非「脸」:Realtime-Venus(9B 全双工,Apache-2.0,2026-09-22 当天仍在更新),但需量化才能在 16GB 上跑。


8. 来源清单

8.1 GitHub 仓库(README 均经 curl / jsDelivr 实取)

8.2 论文

8.3 HuggingFace(API 经 hf-mirror.com 实取)

8.4 统计徽章(shields.io)

https://img.shields.io/github/stars|license|last-commit|created-at/<owner>/<repo>.json

8.5 第三方实测 / 媒体

8.6 sm_120 / Blackwell 关键 issue

thu-ml/SageAttention#391 · #388 · #392 · #357 · #303 · #291 · #382 · Dao-AILab/flash-attention#2307 · #1638 · microsoft/onnxruntime#27621 · pytorch#172807 · pytorch#181379 · pytorch#166794 · kijai/ComfyUI-KJNodes#721 · duixcom/Duix-Avatar#624 · TMElyralab/MuseTalk#409 · lipku/LiveTalking#612 · PyTorch 2.7 发布说明 · ORT CUDA EP 版本表

8.7 本次调研方法局限(须知)

下载此文件