调研日期:2026-09-22(本文件所有 star / 许可 / 最后提交均为当日抓取) 调研人:DH 子代理(DeepSeek Harness)|协作:三个并行子代理 ClusterB/C/D 目标硬件:RTX 5060 Ti 16GB(sm_120 消费级 Blackwell,无 tcgen05/WGMMA/TMEM)、32GB RAM、Ubuntu 24.04、驱动 610.43.02、CUDA 13.2 方法:全部结论以
curl直取 README / arXiv / HuggingFace API / shields.io 徽章原始返回为依据。 GitHub REST API 本机已限流(60/hr),star/license/last-commit 一律取 shields.io 徽章 JSON 的 message 原值;后端抓取主力为 jsDelivr 镜像(https://cdn.jsdelivr.net/gh/<owner>/<repo>@main/<path>,比 raw.githubusercontent 稳定得多)。 凡查不到的一律写「未查到」,不做推测填充;无一条 URL / 数字 / star 是编造的。本文件是自包含的:§2 已包含候选名单逐项核实结论,不依赖其它文件。 配套文件(同目录,可选深入阅读):
_clusterC.md(11 个既有基线项目 × 16GB 深挖,940 行 / 241 条来源)·_clusterD.md(sm_120/Blackwell 坑 + 2026 新增仓库扫街,127 条来源)·_clusterB.md(候选名单核实,525 行,用 GitHub commits Atom feed 取精确提交时间)。本报告 §2 已独立覆盖候选核实,不依赖上述文件。
2026 年真正能在 16GB 单卡上跑「实时流式」的,是 SoulX-FlashHead(1.3B)、Ditto、NanoAvatar(0.8GB); 14B 级的 SoulX-FlashTalk / LiveAvatar / Wan-Dancer 在 16GB 上明确不可行,且原因是结构性的(依赖多卡序列并行 + Hopper 专属内核),不是量化就能解决。
| 项目 | 首发/最新 | 类型 | License | stars | 16GB 单卡 | 实时流式 | 中文 |
|---|---|---|---|---|---|---|---|
| ⭐SoulX-FlashHead | 2026.02 / 2026.05 | 2D 潜空间 DiT 1.3B | Apache-2.0 | 1.1k | ✅ 社区实测 Lite≈6GB / Pro≈8GB | ✅ 单4090 96FPS | 数据集 15 语种 |
| ⭐Ditto | 2025.11 | 2D 运动空间扩散+TRT | Apache-2.0 | 891 | ✅ 运行时 ~2.4GB | ✅ 45FPS | 未查到 |
| ⭐NanoAvatar | 2026.09 | 端侧 2D 口型 | MIT(代码)/CC BY-NC(权重) | 15 | ✅ 仅 ~0.8GB | ✅ 首帧 103ms | ✅ 有中文 demo |
| EchoMimicV3-Flash | 2026.01 | 2D DiT 1.3B | Apache-2.0 | 1.1k | ✅ 官方 12GB | ❌ 非流式 | ✅ 中文 wav2vec2 |
| LiveTalking | 2026.09.13 | 实时推流框架(多后端) | Apache-2.0 | 9.6k | ✅ wav2lip 1.3GB | ✅ 支持打断 | ✅ 全身 |
| OpenAvatarChat | 2026.07 | 全链路对话框架 | Apache-2.0 | 3.8k | ✅ LAM 3.1GB | ✅ 双工打断 | ✅ |
| AvatarForcing | 2026.03 | 一步流式扩散 1.3B | Apache-2.0(README) | 81 | ⚠️ 权重文件 19GB 待实测 | ✅ 34ms/帧 | 未查到 |
| AVTR-1 | 2026.05 | flow-matching 自回归 | ⚠️非商用 | 469 | ✅ 4060Ti 166ms=1.2× | ✅ | 未查到 |
| Realtime-Venus | 2026.09.22 | 9B 全双工对话(只出语音,不出脸) | Apache-2.0 | 40 | ⚠️ 单模型 ~18.7GB | ✅ | ✅ |
| SentiAvatar | 2026.04 | 3D 动作(输出 BVH) | CC BY-NC-SA 4.0 | 453 | ✅ 权重 ~2.9GB | ✅ 6s/0.3s | ✅ |
| MuseTalk 1.5 | 2025.03(停更) | 2D latent inpainting | MIT | 6.6k | ✅ 5060Ti 实测 3.6GB | ❌ 官方确认不支持流式 | ✅ |
| LatentSync 1.6 | 2025.06(停更) | 2D diffusion 口型 | Apache-2.0 | 6.1k | ⚠️ 官方 18GB / 实测 15.8GB 压线 | ❌ 0.6–0.9 帧/秒 | ✅ 1.5 起改进中文 |
| LivePortrait | 2026.06 | 视频驱动肖像(非 lip-sync) | MIT(InsightFace 限非商用) | 19k | ✅ 建议 8GB | ❌ 官方无 | ✅ |
| ❌SoulX-FlashTalk | 2026.01 / 2026.07 | 2D DiT 14B | Apache-2.0 | 1.5k | ❌ >64GB,offload 40GB | ✅ 但需 8×H800 | ✅ 粤语 |
| ❌LiveAvatar | 2026.01 / 2026.08 | 2D DiT 14B | Apache-2.0 | 2.4k | ❌ 单卡 80GB / FP8 48GB | ✅ 但需 5×H800 | 未查到 |
| ❌Wan-Dancer | 2026.07 | 音乐→舞蹈 14B | Apache-2.0 | 432 | ❌ 权重 85.67GB / 8×A800 | ❌ | — |
| ❌HunyuanVideo-Avatar | 2025.12 | 3D MM-DiT | 自定义 | 2.2k | ❌ 官方最低 24GB | ❌ | 未查到 |
| ❌Hallo3 | 2025.03(停更) | 2D 视频 DiT | MIT | 1.4k | ❌ H100 测试 | ❌ 0.16FPS | 未查到 |
仓库:https://github.com/Soul-AILab/SoulX-FlashHead arXiv:https://arxiv.org/abs/2602.07449 (v1 2026-02-07,v3 2026-02-11) 权重:https://huggingface.co/Soul-AILab/SoulX-FlashHead-1_3B
活跃度与许可(shields.io 原值):
may(2026 年 5 月)lastModified 2026-04-02T03:24:15Z,likes 62,downloads 2331(https://hf-mirror.com/api/models/Soul-AILab/SoulX-FlashHead-1_3B )lastModified 2026-02-12,license apache-2.0,782 小时 / 33 万片段(https://hf-mirror.com/api/datasets/Soul-AILab/VividHead )时间线(README News 原文):2026.02.07 技术报告+数据集 → 2026.02.12 推理代码+权重+项目页+Soul App 在线体验 → 2026.03.02 第三方 ComfyUI 节点 → 2026.03.04 Gradio(含流式)→ 2026.03.09 HF Spaces 流式 demo。Model_Pretrained 仍未发布。
实现方式:2D 潜空间 DiT,1.3B。论文 4. Experiments 原文:"We build our model upon the Wan2.1 T2V (1.3B) architecture"。
flash_head/inference.py 第 34–36 行:sample_steps = 20(非流式)/ 4(流式)。flash_head/configs/infer_params.yaml(jsDelivr 实取):frame_num: 33、tgt_fps: 25、height: 512、width: 512、motion_frames_latent_num: 2、cached_audio_duration: 8、num_heads: 12 → 输出规格 = 512×512 @ 25fps,每 chunk 33 帧。torch.compile;多卡才用 xDiT 混合序列并行。显存需求与 16GB 可行性 ✅
| 文件 | 大小 |
|---|---|
Model_Lite/diffusion_pytorch_model.safetensors | 6.108 GB |
Model_Pro/diffusion_pytorch_model.safetensors | 6.031 GB |
VAE_LTX/diffusion_pytorch_model.safetensors | 1.677 GB |
VAE_Wan/Wan2.1_VAE.pth | 0.508 GB |
Model_Lite/diffusion_pytorch_model.safetensors 的 8 字节头长度(85016)+ JSON 头,解析出 843 个张量全部 F32,payload 6.107 GB → 转 fp16 后权重仅 ≈3.05 GB。这是它低显存友好的根本原因。端到端延迟 / FPS
流式 / 可打断:✅ 真流式。gradio_app_streaming.py 源码注释:「单独线程:按 chunk 顺序执行 infer,每生成一帧就放入 res_queue,立即继续下一 chunk」,主线程按 chunk_id 取对应音频合并;CHUNKS_PER_SEGMENT = 3。支持无限长度。「用户插话打断」(barge-in)API → 未查到。
中文 / 半身全身:
facebook/wav2vec2-base-960h(英文预训练),未换成中文 wav2vec2 → 中文效果需自行验证。assets/chengdu.mp4、assets/qitiandasheng.mp4),Gradio 源码为中文注释,团队为 Soul(中文社交 App)→ 推断可用,但无官方中文评测数字。生态:HM-RunningHub/ComfyUI_RH_FlashHead(39 stars,last commit february,Apache-2.0);iaskask-com/ComfyUI_iAskAsk_SoulX_FlashHead(存在,统计未查到)。
仓库:https://github.com/wpydcr/NanoAvatar |权重:https://huggingface.co/wpydcr/NanoAvatar
last wednesday(2026-09 上周)|license:shields 报 not identifiable,README 明确 代码 MIT / 口型权重 CC BY-NC 4.0(非商用)lastModified 2026-09-16,likes 3| 模型 | 设备 | FPS | 首帧 | 显存 |
|---|---|---|---|---|
| NanoAvatar | 骁龙 8 Gen 3 | 39 FPS | 115 ms | 834 MiB |
| NanoAvatar Lite | 骁龙 8 Gen 3 | 41 FPS | 103 ms | 700 MiB |
| NanoAvatar Lite | 骁龙 8 Gen 1 | 18 FPS | 183 ms | 693 MiB |
| 量化版(CUDA DLL) | RTX 4090 | 333 FPS | 18 ms | 834 MiB |
| 全精度 | RTX 4090 | 224 FPS | 37 ms | 1119 MiB |
torch==2.10.0 + cu128 wheel → 原生 sm_120 支持;不依赖 SageAttention / flash-attn**。assets/demo-zh.mp4)。quantized/hubert_w8a16.pt 355.3MB + lip_mixed_int8.pt 51.4MB + Android QNN 资源)。仓库:https://github.com/KlingAIResearch/AvatarForcing |arXiv:https://arxiv.org/abs/2603.14331 |权重:https://huggingface.co/lycui/AvatarForcing
may(2026-05)|shields license not identifiable,但 README「📜 License」节原文写 Apache-2.0lastModified 2026-03-26,likes 9model.pt 19.16 GB + ode_audio_init.pt 6.39 GB,合计 25.54 GB。19GB 远超 1.3B bf16(~2.6GB),推测为含教师/假分数网络的完整训练检查点 → 单文件 19GB 在 16GB 卡上无法整体加载;实际推理能否只载学生子集 未查到实测。判定:⚠️ 需实测,不能直接算「16GB 可跑」。--i2v);--num_output_frames 需满足 (N-1) % 4 == 0。仓库:https://github.com/avaturn-live/avtr-1 |权重:https://huggingface.co/avaturn-live/avtr-1
may(2026-05)|license:⚠️ 非开源许可 —— 模型权重走 Community License(有营收门槛),renderer 与 live backend/streamer 为 PolyForm Noncommercial License 1.0.0(仅非商用)| GPU | 每块延迟 | 实时倍率 |
|---|---|---|
| L40 | 84 ms | 2.4× |
| A100 | 91 ms | 2.2× |
| RTX 4060 Ti | 166 ms | 1.2× |
| RTX 3070 | 181 ms | 1.1× |
| L4 | 202 ms | 0.99× |
| RTX 3060 Ti | 206 ms | 0.97× |
| RTX 4060 | 232 ms | 0.86× |
仓库:https://github.com/inclusionAI/Realtime-Venus |arXiv:https://arxiv.org/abs/2609.13814 (v1 2026-09-12,v2 2026-09-18)
today(2026-09-22,就是今天) —— 全场最新lastModified 2026-09-21,likes 55(https://hf-mirror.com/api/models/inclusionAI/Realtime-Venus )token2wav/flow.pt 0.62GB 等 → ⚠️ 单模型 18.7GB > 16GB,需量化;未查到量化版本。仓库:https://github.com/SentiAvatar/SentiAvatar |arXiv:https://arxiv.org/abs/2604.02908
april(2026-04,2026 年新建)|license:GitHub 无法识别(论文 CC BY-NC-SA 4.0)| 仓库 | ⭐ | License | 新建/最后提交 | 一句话 | 实时流式 |
|---|---|---|---|---|---|
| PeterIverson/Super-Star | 10 | Apache-2.0 | 2026-07/2026-08 | [ACM MM 2026] 3D 数字人流式实时交互;Qwen3-Omni-30B-A3B + 在线手势生成(arXiv 2608.24909) | ✅ ⚠️ 30B 语音前端对 16GB 不友好 |
| Kedreamix/Linly-Talker-Stream | 133 | Apache-2.0 | 2026-02 | 全双工低延迟实时流式对话数字人(主仓已停更,能力迁至此分仓) | ✅ |
| rookiestar28/ComfyUI-LongCat-Avatar | 36 | MIT | 2026-06/2026-08 | LongCat Video Avatar 1.5 的 ComfyUI 节点 | 部分 |
| taochangle/LingCast | 11 | 未标注 | 2026-08 | 端到端数字人直播平台(LivePortrait+Wav2Lip+DeepSeek+SRS 推流) | ✅ |
| MrrZed0/Stream-Avatars-Custom | 1 | 未标注 | 2026-03 | 仓库过小,描述未查到 | 未查到 |
| google/GNM | 1.5k | Apache-2.0 | 2026-03/2026-09 | 参数化统计人体/头部几何模型(非 talking head) | ❌ |
| NVlabs/SOMA-X | 788 | Apache-2.0 | 2026-03/2026-09 | 人体+手部可微表示(非 talking head) | ❌ |
| k2-fsa/OmniVoice | 14k | Apache-2.0 | 2026-03/2026-08 | TTS/语音模型(数字人语音前端候选) | ❌ |
既有项目 2026 仍活跃:LiveTalking 9.6k⭐(2026-09-13)· aigcpanel 5.6k⭐(2026-09-22 今天)· Duix-Mobile 8.3k⭐(2026-08)· OpenAvatarChat 3.8k⭐(2026-07)· SoulX-FlashTalk 1.5k⭐(2026-07)· Fay 14k⭐(yesterday)· met4citizen/TalkingHead 1.6k⭐(2026-06)· jdh-algo/JoyVASA 878⭐(2026-04)· dlp3d-ai/dlp3d.ai 358⭐(2026-05)· Project-N-E-K-O/N.E.K.O 3k⭐(2026-09-22)。
2026 年趋势判断:热点已从「LiveTalking/Wav2Lip 式拼装管线」转向 少步流式扩散 talking head(SoulX-FlashHead 96FPS@4090、AvatarForcing one-step、AVTR-1 flow-matching 自回归)与 端侧(NanoAvatar 0.8GB)。
| 候选名 | 判定 | 证据 / 说明 |
|---|---|---|
| SoulX-FlashTalk 系列 | ✅ 真实 | 见 §3。2025.12 项目页,2026.01.08 代码+权重,last commit 2026-07;HF 权重 54.46GB |
| SoulX-FlashHead | ✅ 真实(2026 新品) | 见 §1.1。2026.02.12 首发;1.1k⭐ Apache-2.0 |
| LiveAvatar | ✅ 真实 | https://github.com/Alibaba-Quark/LiveAvatar 2.4k⭐ Apache-2.0,ECCV 2026 Spotlight(2026.06.18),last commit 2026-08;2026.01.20 v1.1 FP8 |
| Wan-Dancer | ✅ 真实 | https://github.com/Wan-Video/Wan-Dancer 432⭐ Apache-2.0,last commit 2026-07;HF Wan-AI/Wan-Dancer-14B lastModified 2026-07-17,likes 186,downloads 15792;权重 85.67GB,实测环境 8×A800 80GB |
| Wan2.2-S2V | ✅ 真实 | https://huggingface.co/Wan-AI/Wan2.2-S2V-14B ,HF lastModified 2025-09-17,likes 475,合计 49.15GB。是 LiveAvatar 的底座 |
| Wan2.2 / Wan2.1 | ✅ 真实且极活跃 | Wan-Video/Wan2.2 18k⭐,last commit yesterday;Wan-Video/Wan2.1 17k⭐,last commit march(2026) |
| Hallo3 | ✅ 真实(2026 无活动) | fudan-generative-vision/hallo3,1.4k⭐ MIT,last commit march 2025;News 最新 2025/02/27 |
| Hallo4 | ✅ 真实但极小,且权重门控 | https://github.com/fudan-generative-vision/hallo4 —— 38⭐,last commit 2025-11-30,无 LICENSE 文件。⚠️ HF fudan-generative-ai/hallo4 匿名访问返回 401 restricted(需申请授权);仓库仅 5 个 commit、README 要求 H100 → 工程可用性极低,2026 年无活动 |
| EchoMimic V3 | ✅ 真实 | antgroup/echomimic_v3,1.1k⭐ Apache-2.0,last commit march(2026),AAAI 2026;2026.01.22 Flash 更新(12GB VRAM) |
| Hunyuan-Avatar / HunyuanVideo-Avatar | ✅ 真实(2026 无活动) | Tencent-Hunyuan/HunyuanVideo-Avatar,2.2k⭐,last commit december 2025,license 自定义;官方最低 24GB |
| OmniHuman-1.5 | ❌ 非开源 | 未找到任何 bytedance/OmniHuman* GitHub 仓库(bytedance/OmniHuman-1、bytedance/OmniHuman、OmniHuman/OmniHuman-1 全部 repo not found)。仅以 API 形式在 Replicate / fal.ai 提供 → 闭源 |
| FantasyTalking2 | ⚠️ 降级:仅有论文页,无代码/权重 | 真实仓库名是 Fantasy-AMAP/fantasy-talking2(全小写) —— 65⭐,last commit 2025-08-18,无 LICENSE。ClusterB 复核发现 README 全文仅 Abstract + Citation,没有 inference 代码、权重、安装说明 → 标注 [AAAI 2026] 但工程上不可用,2026 年无活动 |
| Ditto | ✅ 真实 | antgroup/ditto-talkinghead,891⭐ Apache-2.0,last commit november 2025;ACM MM 2025 |
| Sonic | ✅ 真实,2026 有活动 | https://github.com/jixiaozhong/Sonic —— 3.3k⭐,last commit 2026-01-08,license = CC BY-NC-SA 4.0(🔴 禁商用)。(tencent-ailab/Sonic 不存在) |
| FLOAT | ✅ 真实(2026 无活动) | https://github.com/deepbrainai-research/float —— 492⭐,last commit 2025-11-10,license = CC BY-NC-ND 4.0(🔴 禁商用);ICCV 2025 |
| MEMO | ✅ 真实(2026 无活动) | 仓库名是 memoavatar/MEMO(全大写);1.1k⭐ Apache-2.0,last commit 2025-08-06;仅 preview 模型 |
| MuseTalk 1.5 | ✅ 真实 | 官方 README News 原文:「[03/28/2025] We are thrilled to announce the release of our 1.5 version」。MuseTalk 2.0 → 未找到(README 最新更新条目为 04/05/2025) |
| LatentSync 1.6 | ✅ 真实 | 官方 README 原文:「2025/06/11: We released LatentSync 1.6」;「2025/03/14: LatentSync 1.5」。LatentSync 2.x → 未找到 |
| Realtime-Venus | ✅ 真实(2026-09 全新) | https://github.com/inclusionAI/Realtime-Venus —— 40⭐ Apache-2.0,last commit 2026-09-22;arXiv 2609.13814。⚠️只出语音不出脸 |
| SentiAvatar | ✅ 真实(2026-04 全新) | https://github.com/SentiAvatar/SentiAvatar —— 453⭐,last commit 2026-04;arXiv 2604.02908 |
| InfiniteTalk | ✅ 真实 | MeiGen-AI/InfiniteTalk 7.9k⭐ Apache-2.0,last commit may(2026);是 FlashTalk 的教师模型 |
| MultiTalk | ✅ 真实 | MeiGen-AI/MultiTalk 3k⭐ Apache-2.0,last commit may(2026) |
| OmniAvatar | ✅ 真实 | Omni-Avatar/OmniAvatar 1.9k⭐ Apache-2.0,last commit august 2025 |
仓库:https://github.com/Soul-AILab/SoulX-FlashTalk arXiv:https://arxiv.org/abs/2512.23379 |全文 v3:https://arxiv.org/html/2512.23379v3 权重:https://huggingface.co/Soul-AILab/SoulX-FlashTalk-14B
july(2026 年 7 月)(shields.io)lastModified 2026-03-19,likes 45,downloads 2557论文 §3.3 Inference Latency Analysis 原文:
"we analyze component-wise latency on a single-node system with varying numbers of NVIDIA H800 GPUs. The experimental setup targets high-fidelity streaming at a resolution of 720×416 with 4-step denoising. Each clip comprises 33 frames, including 28 generated frames and 5 motion frames. Under this configuration, the pipeline achieves a throughput of up to 32 FPS."
组件级延迟分解(论文 Table 4 / Figure 6):
| 组件 | 单 GPU | 8×H800 | 加速比 |
|---|---|---|---|
| DiT 每步 | 1070 ms | 193 ms | ~5.5× |
| VAE 运动帧编码 | 97 ms | 21 ms | ~4.6× |
| VAE 生成帧解码 | 988 ms | 192 ms | ~5.1× |
稳态每轮总延迟(8×H800,Figure 6 原文):876 ms = 音频 33ms + 4 步 DiT 616ms + 帧解码 187ms + 运动帧编码 14ms + 杂项。
结论:32 FPS 的完整前提 = 8×H800 + 720×416 + 4 步去噪 + 33 帧/clip。单卡连实时都达不到。
# Requires more than 64G of VRAM. Use --cpu_offload to reduce VRAM usage to 40G.| 文件 | 大小 |
|---|---|
models_t5_umt5-xxl-enc-bf16.pth | 11.362 GB |
diffusion_pytorch_model-00001-of-00004 | 9.959 GB |
diffusion_pytorch_model-00002-of-00004 | 9.986 GB |
diffusion_pytorch_model-00003-of-00004 | 9.965 GB |
diffusion_pytorch_model-00004-of-00004 | 7.854 GB |
models_clip_open-clip-xlm-roberta-large-vit-huge-14.pth | 4.772 GB |
Wan2.1_VAE.pth | 0.508 GB |
| 合计 | 54.46 GB |
inference_script_single_gpu.sh 全文只有 CUDA_VISIBLE_DEVICES=0 与一条 python 命令,不含任何 offload 参数;--cpu_offload 是 generate_video.py 第 71–73 行的可选 flag(help: "Enable CPU offload for low VRAM usage"),README 要你手动加。加满 offload 后官方数字是 40GB —— 仍是 16GB 的 2.5 倍。LICENSE.txt)。TencentGameMate/chinese-wav2vec2-base;示例含 examples/cantonese_16k.wav(粤语)。SoulX-FlashTalk 不属于「16GB 可跑」。 官方门槛 >64GB(offload 40GB ≈ 2.5×16GB);核心加速依赖 8 卡序列并行 + Hopper 专属 FA3;无量化版、无蒸馏小模型、无单卡路线。README 自己也说明了这一点。想用 Soul 系方案跑 16GB,唯一答案是 SoulX-FlashHead(1.3B)。
august(2026-08)liveavatar.safetensors 1.353 GB;底座 Wan2.2-S2V-14B(HF 合计 49.15 GB)wav2vec2-large-xlsr-53-english,偏英文)|半身/全身 未查到november 2025 → 2026 年无新提交(最新动态 2025.11.12 开源训练代码)hubert_streaming_fix_kv.onnx 1.461GB + models/*.pth ≈0.92GB ≈ 2.4 GBv0.4_hubert_cfg_trt_online.pkl 在线配置)hardware-compatibility-level=Ampere_Plus,「If your GPU does not support it, please execute the cvt_onnx_to_trt.py script」;依赖 tensorrt==8.6.1(TRT 8.6.1 根本不支持 Blackwell,需 TRT 10.x);另有架构相关预编译插件 libgrid_sample_3d_plugin.so 需重编;ONNX 钉 numpy==2.0.1。→ 显存不是问题,TensorRT 工具链才是;可走 PyTorch 后端绕开 TRT,但性能未验证。march(2026-03)BadToBest/EchoMimicV3/tree/main/echomimicv3-flash-pro):「🚀 8-step High-quality Generation / 🧩 No Face Mask required / 💾 12G VRAM Requirement / ✅ Supports up to 768×768 Resolution」smthemex/ComfyUI_EchoMimic,699⭐,last commit february)alibaba-pai/Wan2.1-Fun-V1.1-1.3B-InP(1.3B)chinese-wav2vec2-base;README 有 Chinese Driven Audio 图集与 README_zh.md)partial_video_length 设 81/65 或更小may(2026-05)--num_persistent_param_in_dit 0 → "Run with very low VRAM";int8 量化(Todo 已勾);fp8 量化模型 --quant fp8 --quant_dir weights/InfiniteTalk/quant_models/infinitetalk_single_fp8.safetensors("Only support run with single gpu");第三方 Wan2GP(deepbeepmeep/Wan2GP)集成,官方原文「optimized for low VRAM」december 2025|license:shields 报 not identifiable by github → 自定义(腾讯混元社区许可)march 2025;News 最新 2025/02/27(CVPR 2025)_clusterC.md)| 项目 | ⭐ | License | 2026 状态 | 16GB 结论 | 首帧延迟 | FPS | 流式 |
|---|---|---|---|---|---|---|---|
| LiveTalking | 9.6k | Apache-2.0 | ✅ 2026-09-13 | ✅ 最稳。wav2lip 实测 1.3GB、4090 上 750fps;musetalk 必须含 PR #612(缺 @torch.no_grad() 时峰值 17.62GB→OOM,修复后 3.9GB);ernerf ~2GB。⚠️ RAM 也是瓶颈(10s 1080p 缓存 ≈1.61GB/路,默认 5 路)。官方验证栈 torch 2.9.1 + CUDA 12.8(= sm_120 可用),无 flash-attn/triton/onnx 依赖 | 未查到 | wav2lip256: 3060=60、3080Ti=120;musetalk: 4090=72 | ✅ 支持打断 + WebRTC/RTMP + 多并发 |
| MuseTalk 1.5 | 6.6k | MIT | ❌ 最后提交 2025-09-26(停更近一年) | ✅ 5060 Ti 16GB 实测 ~3.6GB(issue #409,361 帧验证)。⚠️ 必须 torch 2.10+cu128;须绕开 mmcv(Py3.12 编译失败→face-alignment) | TTFV 1769ms(3090)/2095ms(4090)〔第三方〕 | ≈5.8fps(非实时);官方 30fps+@V100 | ❌ 官方成员确认不支持音频流式(issue #33) |
| LatentSync 1.6 | 6.1k | Apache-2.0(本批唯一真正宽松的开源许可) | ❌ 停更(1.6 发布 2025-06-11) | ⚠️ 官方 1.6 门槛 18GB > 16GB;第三方在 RTX 5070 Ti 16GB 实测跑通:eager 峰值 15,807MB(贴 96%)、TensorRT 后 12,551MB。1.5 官方门槛 8GB,稳妥可用 | 未查到 | 🔴 ≈0.61–0.90 帧/秒(比实时慢 28~41 倍) | ❌ 离线批处理 |
| Wav2Lip | 13k | 🔴 无 LICENSE;README 明确「any form of commercial use is strictly prohibited」 | 停更 | ⚠️ 显存够(1.3GB)但 torch==1.1.0 是 2019 年化石(PyPI 仅 9 个 wheel、cp27–cp37、无 cp38+、manylinux1 2010 ABI)→ Py3.12 装不上、sm_120 跑不了、生态全断,只能当算法参考 | 未查到 | 经 LiveTalking 3060=60fps;4090=750fps@1.3GB | ❌ 自身不支持 |
| LivePortrait | 19k | MIT(InsightFace 模型仅限非商业研究,商用须替换) | ✅ 2026-06(已改名 KlingAIResearch) | ✅ 建议取 8GB 保守门槛(官方权重 499.6MB / pinokio 6GB / aigcpanel 标 8G+) | ~1 分钟 torch.compile 首次编译 | 14.77ms/帧 ≈ 67.7 FPS(4090+torch.compile,纯模型);FasterLivePortrait 3090 30+FPS 含前后处理 | ❌ 官方无 |
| OpenAvatarChat | 3.8k | Apache-2.0 | ✅ 2026-07 | ✅ LAM 实测 3.1GB、LiteAvatar 5.3GB(RTX3060 6G 笔记本);要求 CUDA≥12.8、驱动≥575.64.03 | 平均响应 2.2s(i9-13900KF+4090,"用户说完→数字人开口") | 输出典型 25fps | ✅✅ 0.6.0 起全后端手动+双工打断(本批最强) |
| Linly-Talker | 3.5k | MIT | ⚠️ 主仓 2026-02 起停更 | ⚠️ 取决于组合;官方无数字,第三方估「12GB 最低门槛」(可信度低) | 未查到 | MuseTalk V100 >30fps(转述上游) | ⚠️ 主仓 ❌;Linly-Talker-Stream ✅ barge-in 全双工 |
| Fay | 14k | 🔴 GPL-3.0(商用传染风险) | ✅ yesterday | ✅ 本体 0 显存(纯编排,不渲染) | 未查到 | 未查到 | ✅ 全时流式 + 支持打断 |
| aigcpanel | 5.6k | Apache-2.0 | ✅ 2026-09-22(今天) | ✅ 面板 0 显存;官方 12 个模型包中 11 个 ≤16GB(Wav2Lip/SadTalker 4G+、MuseTalk 6G+、LatentSync/Heygem-v2/LivePortrait/FlashHead-Lite 8G+、Heygem 16G+;唯一超限 FlashTalk-14B 24G+);6 包标「支持50显卡」 | 未查到 | 未查到(唯一数字是 FlashHead Lite 标称 96FPS) | ❌ 任务式批处理 |
| Ultralight-Digital-Human | 2.6k | ⚠️ 存疑(shields not specified,README 徽章 Apache-2.0) | 停更 | ✅ 显存必然够(实测未查到);真瓶颈是 RAM ~10GB/路 + 官方 torch 1.13.1+cu117 无 sm_120 | 未查到 | <10ms/帧(2080 多并发,需转 ONNX)〔作者实测〕 | ⚠️ 支持但代码未完善;继任 FeatherTalk(Apache-2.0,C++/MNN) |
| Duix.Avatar(原 Duix.Heygem) | 16k | 自定义(合规雷,见下) | ✅ 2026-04 | 🔴 当前在 sm_120 上不可用 | 未查到 | 未查到(issue #251:4×24G 显卡"推理速度很慢") | ❌ 官方自述非实时 |
🔴 Duix.Avatar = 本报告最重要的反面教材 + 合规雷
no kernel image is available,根因是默认 Docker 镜像的 PyTorch 无 CC12.0 内核,用户无力自救;仅有 5090 专用 compose,未验证 5060 Ti。→ 「README 声称支持 50 系」≠「实际可用」。Notice 署名;④ 第 5.c 条你须授予 DUIX 永久/不可撤销的案例营销权;⑤ 第 5.b 条你若起诉 DUIX 则许可自动终止。完整版(含全部 issue 链接)见
_clusterD.md§1。
消费级 Blackwell(sm_120)只有 Ampere 时代的 mma.sync.aligned.m16n8k16(MMAv2),没有 tcgen05 / WGMMA / TMEM —— 那是企业级 Blackwell(sm_100/103)专属。
→ 任何只在 sm_90a / sm_100a 上编译的 attention 内核(FA3、FA4、SageAttention3 FP4)在 sm_120 上要么编译失败、要么静默走退化路径。
getattr(sageattention, "_fused_attention", None) → False,device_capability=(12,0),几乎无加速;同 issue 发现 setup.py 的 SUPPORTED_ARCHS 里 "10.0" "12.0" 少一个逗号导致 12.0 未被当作受支持架构。_qattn_sm89 内核(用 -gencode arch=compute_120a 把 SM89 内核编成 sm_120a)→ 这解释了「能跑但静默出错/驱动挂死」。| 现象 | 环境 | 来源 |
|---|---|---|
驱动级 GPU lost(GPU is lost,需重启,~54s 崩);原生 SDPA 在更高显存(15.3 vs 13.0GB)下跑通 → 排除显存/功耗/温度 | RTX 5060 Ti 16GB + MiniMax H3 | #391 |
CUDA error: misaligned address | 5060 Ti | #357 |
ptxas error: Instruction 'wgmma.fence' not supported on .target 'sm_120' | TORCH_CUDA_ARCH_LIST 含 9.0 | #291 |
| 静默噪声(>~160k token,无异常) | sm_120 + H3 | #388 |
| CUDA Graph 重放静默偏差 ~90% | sm_120 | #392 |
Failed to initialize the TMA descriptor 1 | ~74k token | #382 |
sageattention is not new enough version or could not determine CUDA architecture… | ComfyUI H3 mem-eff patch | KJNodes#721 |
v2.2.0-windows.post6,README 原文 "also sm120 for CUDA >= 12.8"(CUDA 12 与 13 不通用);② mengqin/SageAttention fork + -allow-unsupported-compiler(已验证修好 5060 Ti / 5070 Ti)。CUDA error: no kernel image is available for execution on the device(#1638);需源码编译(--no-build-isolation),耗时且易失败。flash_fwd_sm120.py 但受阻(#2307/#2499/#2634/#2758/#2771)。[Prototype] NVIDIA Blackwell Architecture Support」——即便升到 2.7+cu128 也属原型级,需留实测余量。torch 2.5.1+cu121),原样在 5060 Ti 上都会报 no kernel image is available。sm_120a 后缀会被自动剥掉(只生成 sm_120),破坏 CUTLASS block-scale MMA/NVFP4(pytorch#172807);cuDNN SDPA 在 sm_120 上 head_dim 上限卡 128(#181379)。onnxruntime-gpu 不含 sm_120 内核 → CUDAExecutionProvider 不可用、全部回退 CPU(Natfii/onnxruntime-gpu-blackwell)。InferenceSession.run() 在 Python 线程内静默死锁(已被 stale 机器人关闭)。onnxruntime-gpu==1.21.0 是 cu12.8 构建,而目标机是 CUDA 13.2 → 跨大版本,可能缺 libcudart.so.12;须升 ORT ≥1.27(cu13.0)后重测,或补 CUDA 12 运行库。tl.load() 即 segfault 的 bug(pytorch#176426)。LD_LIBRARY_PATH=.../nvidia/cu13/lib 才能找到 libnvrtc-builtins.so.13.0(见工作区 dl-hub/10-视频生成流水线 运维记录)。| 项目 | 风险 | 理由 |
|---|---|---|
| NanoAvatar | 🟢 最低 | 官方要求 torch==2.10.0+cu128(原生 sm_120);不依赖 SageAttention/flash-attn;纯 CUDA |
| SentiAvatar | 🟢 最低 | 不碰 diffusers/attention 内核,只跑 vLLM(Qwen2-0.5B) |
| SoulX-FlashHead | 🟢 低 | 用 FA2(论文声明支持 Blackwell),SageAttention 是可选项(README「Optional」)→ 建议不装;torch==2.7.1+cu128 |
| EchoMimicV3 | 🟡 中 | 无 sm_120 专门报告;Wan2.1-Fun 生态在 Blackwell 上社区已跑通;需 torch==2.10+cu128 |
| LiveTalking | 🟡 中 | 官方验证栈 torch 2.9.1 + CUDA 12.8(= sm_120 可用);无 flash-attn/triton/onnx 依赖 → 实际风险低。⚠️ musetalk 后端必须含 PR #612 |
| LatentSync | 🟡 中 | 无 flash-attn 天坑,只差一次 torch 升级;已被第三方在 RTX 5070 Ti 16GB 实测跑通 |
| Ditto | 🔴 高 | tensorrt==8.6.1 + 预编译 Ampere_Plus 引擎 + 自编译 .so,全不含 sm_120 → 必须升 TRT 10 + 重转引擎 + 重编插件,或改走 PyTorch 后端 |
| LivePortrait | 🔴 高 | onnxruntime-gpu 硬钉 1.18.0(无 sm_120)+ ORT #27621 静默死锁;TRT 实时档必须 TensorRT 8.x |
| SoulX-FlashTalk | 🔴 极高 | 依赖 Hopper 专属 FlashAttention-3 → sm_120 无路径(且显存已否决) |
| Duix.Avatar | 🔴 极高 | 已确认在 Blackwell 上报错且无人修(issue #624) |
| 检查项 | 要求 | 依据 |
|---|---|---|
| PyTorch | ≥2.7,且必须 cu128+ 轮子(推荐 cu128–cu130);注意官方仍标 [Prototype] | PyTorch 2.7 发布说明;MuseTalk #409 的 cu124/cu126 ❌ vs cu128 ✅;pytorch #166794 |
| onnxruntime-gpu | ≥1.27(CUDA 13.0 构建);避免 1.18/1.21 旧档(1.21 是 cu12.8,与 CUDA 13.2 跨大版本);或换第三方 sm_120 wheel | ORT 版本表;Natfii/onnxruntime-gpu-blackwell;ORT #27621 |
| CUDA | 驱动支持的 CUDA ≥12.8(目标机 CUDA 13.2 ✅) | OpenAvatarChat 快速开始页;Duix「50 series … CUDA 12.8」 |
| NVIDIA 驱动 | RTX 50 系建议 ≥575.64.03(目标机 610.43.02 ✅) | OpenAvatarChat System Requirements |
| SageAttention | 原则不装;必须用时换 woct0rdho v2.2.0-windows.post6 或 mengqin fork | #391/#388 |
| flash-attn | 需源码编译(--no-build-isolation),sm_120 下耗时易失败;FA3 不可用 | FA #1638;OAC 快速开始页 |
| mmcv / mmpose | Python 3.12 无 wheel 且源码编译失败 → 改用 face-alignment | MuseTalk #409、#334 |
torch.load | 新 PyTorch 默认 weights_only=True,加载旧 checkpoint 需调整参数 | MuseTalk #334 |
| 显存 | 推理路径必须带 @torch.no_grad(),batch 降到 8 | LiveTalking PR #612 / issue #192 |
| 验证方法 | 不要只信 README:先跑 python -c "import torch;print(torch.cuda.get_device_capability())"(应得 (12, 0)),再跑官方最小推理样例 | Duix #624 的教训 |
| 商用许可 | 🔴 明确禁商用:Wav2Lip(README 原文「any form of commercial use is strictly prohibited」)、Sonic(CC BY-NC-SA 4.0)、FLOAT(CC BY-NC-ND 4.0)、AVTR-1(PolyForm Noncommercial 1.0.0)、NanoAvatar 口型权重(CC BY-NC)、SentiAvatar(CC BY-NC-SA)。⚠️ 无明确许可:Hallo4、FantasyTalking2。⚠️ 门槛/附加义务:Duix.Avatar(MAU/营收门槛 + 5 项义务,且 LICENSE 与 README 口径差 100 倍);LivePortrait(须替换 InsightFace 检测模型)。GPL-3.0(传染):Fay。✅ 本批最宽松:LatentSync / SoulX-FlashHead / SoulX-FlashTalk / LiveAvatar / Ditto / EchoMimicV3 / LiveTalking / OpenAvatarChat(均 Apache-2.0) | 各项目 LICENSE / README |
| 训练 | 16GB 单卡一律不可训练(MuseTalk ≥32GB、LatentSync ≥20GB、stage2 55GB) | 各项目 README |
若目标是「实时流式对话数字人」
--model wav2lip) —— 9.6k⭐、2026-09-13 仍活跃、实测 1.3GB、官方栈恰为 CUDA 12.8、支持打断 + 中文 + 全身、无 flash-attn/onnx 依赖。用 musetalk 后端则必须确认已含 PR #612。若目标是「离线高质量出片」:EchoMimicV3-Flash(官方 12GB、支持中文、半身)> LatentSync 1.5(8GB 门槛,但 0.6–0.9 帧/秒)> HunyuanVideo-Avatar(第三方 Wan2GP 路径,半身/全身均支持)。
明确排除:SoulX-FlashTalk(>64GB)、LiveAvatar(80GB / FP8 48GB)、Wan-Dancer(85.67GB / 8×A800)、HunyuanVideo-Avatar(官方 24GB 起)、Hallo3(停更 + 0.16FPS)、Duix.Avatar(sm_120 已确认不可用 + 合规雷)。
若需要「会听会说的大脑」而非「脸」:Realtime-Venus(9B 全双工,Apache-2.0,2026-09-22 当天仍在更新),但需量化才能在 16GB 上跑。
--cpu_offload):https://raw.githubusercontent.com/Soul-AILab/SoulX-FlashTalk/main/generate_video.pyhttps://img.shields.io/github/stars|license|last-commit|created-at/<owner>/<repo>.json
dl-hub/06-ComfyUI-H3运维记录/、dl-hub/10-视频生成流水线/thu-ml/SageAttention#391 · #388 · #392 · #357 · #303 · #291 · #382 · Dao-AILab/flash-attention#2307 · #1638 · microsoft/onnxruntime#27621 · pytorch#172807 · pytorch#181379 · pytorch#166794 · kijai/ComfyUI-KJNodes#721 · duixcom/Duix-Avatar#624 · TMElyralab/MuseTalk#409 · lipku/LiveTalking#612 · PyTorch 2.7 发布说明 · ORT CUDA EP 版本表
github.com HTML 在调研后段不可达(返回 000);raw.githubusercontent.com 后期整体超时 → 改用 jsDelivr 镜像。