_clusterB.md

实时数字人(Talking Head / Avatar)开源项目核实 —— Cluster B

核实日期:2026-09-22(本文件所有"last commit"均为当日实测值)

核实方法(全部为可复现的一手探测,未使用 2024/2025 二手描述):

⚠️ shields.io 的 last-commit 只给"月份"粒度:不带年份的裸月份 = 2026 年(如 march = 2026-03),带年份才是往年。本文件已用 Atom feed 交叉核对。


1. Realtime-Venus

项目内容
名称Realtime-Venus(Realtime-Venus-Omni · 9B / Realtime-Venus-Audio · 9B / Realtime-Venus-Harness)
仓库 URLhttps://github.com/inclusionAI/Realtime-Venus (✅ 存在,HTTP 200)
是否存在存在(Ant Group「Venus Team」+ 清华大学,inclusionAI 组织)
stars40
licenseApache-2.0(README「License」节明示;LICENSE 文件实测为 Apache License 2.0 正文)
last commit2026-09-21(Atom feed <updated>2026-09-21T15:45:17Z;shields 显示 yesterday)
模型权重Hugging Face inclusionAI/Realtime-Venus(hf-mirror API 实测 200);ModelScope 镜像 inclusionAI/Realtime-Venus
Releasetag android-beta-0918,含 Realtime-Venus-0918.apk Android Beta 演示包
论文arXiv 2609.13814
简介全双工(full-duplex)实时交互系统 + 异步委派(asynchronous delegation),不是"音频驱动人脸视频生成"模型。Omni-9B 吃流式音视频输入,边听边说、可主动发起回应、原生生成语音;Harness 运行时把自然语言任务丢到后台(demo 用 Codex 作为任务后端)执行,结果回到同一会话由模型择时用语音播报。仓库含 Omni 模型集成、可复用 Harness 包、浏览器 demo、Android Beta。

定位提醒:它是"实时多模态对话 + 语音输出"的交互层,不产出 talking-head 视频。若选型目标是"音频→口型视频",本项只对应"实时对话脑 + TTS 语音",需另外叠加渲染层。

来源:GitHub · Hugging Face · arXiv · 项目页 · Release tag


2. Wan-Dancer / Wan2.2-S2V

2a. Wan-Dancer —— ✅ 真实存在,但不是数字人/talking head

项目内容
名称Wan-Dancer(💃 Wan-Dancer)
仓库 URLhttps://github.com/Wan-Video/Wan-Dancer (✅ HTTP 200)
是否存在存在
stars432
licenseApache-2.0(README「📜 License」节明示,LICENSE 实测为 Apache 2.0 正文)
last commit2026-07-17(Atom feed <updated>2026-07-17T08:49:55Z;shields july)
模型权重Wan-AI/Wan-Dancer-14B;ModelScope Wan-AI/Wan-Dancer-14B
论文arXiv 2607.09581
简介音乐→长时舞蹈视频生成(hierarchical:全局关键帧规划 + 局部时序精修)。时间映射 RoPE 动态帧率适配、光流连续性损失、运动速度控制;720p/30fps 超过 1 分钟,跨 5 种舞种,音频 + 文本条件。训练硬件为 8×A800 80GB。与"音频驱动肖像/口型"无关,属于"全身舞蹈视频生成"。

⚠️ 候选名 "Wan-Dancer" 容易与"数字人"混为一谈,实测它是跳舞视频,不驱动人脸口型。

2b. Wan2.2-S2V —— ✅ 存在,在 Wan2.2 主仓内(无独立仓库)

项目内容
名称Wan2.2-S2V-14B(Speech-to-Video)
仓库 URLhttps://github.com/Wan-Video/Wan2.2 (S2V 为其中一项任务,无 Wan-Video/Wan2.2-S2V 独立仓库)
是否存在存在(作为 Wan2.2 的子能力)
stars18k(整个 Wan2.2 仓库)
licenseApache-2.0(shields 实测)
last commit2026-09-21(Atom feed <updated>2026-09-21T06:16:22Z;shields yesterday)
模型权重Wan-AI/Wan2.2-S2V-14B(hf-mirror API 实测 200);ModelScope Wan-AI/Wan2.2-S2V-14B
简介音频驱动的电影级视频生成(speech-to-video),支持 480P/720P。首次发布于 2025-08-26(Wan2.2 的 News 节),随 Wan2.2 仓库持续维护(仓库 2026-09 仍活跃)。Wan2.2 本身是 MoE 视频基座(T2V-A14B / I2V-A14B / TI2V-5B / S2V-14B / Animate-14B)。
2026 活动主仓 2026-09-21 有提交;但 S2V 子任务本身在 README 的 Latest News 中最后更新为 2025-09-05,2026 无 S2V 专属新版本公告。

注意区分:Wan2.2-Animate-14B(角色动画/替换,2025-09-19 发布)≠ Wan2.2-S2V-14B(音频驱动说话视频)。

来源:Wan-Dancer GitHub · Wan-Dancer HF · Wan-Dancer arXiv · Wan2.2 GitHub · Wan2.2-S2V-14B HF · S2V 项目页


3. Hallo3 / Hallo4(fudan-generative-vision)

3a. Hallo3 —— ✅ 存在,但已停更

项目内容
名称Hallo3(Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer)
仓库 URLhttps://github.com/fudan-generative-vision/hallo3 (✅ HTTP 200)
是否存在存在
stars1.4k
licenseMIT(shields 实测 MIT)
last commit2025-03-13(Atom feed <updated>2025-03-13T08:34:23Z;shields march 2025)
2026 活动无(最后提交为止于 2025-03)
简介复旦 generative-vision 组的肖像动画(video diffusion transformer 驱动),是 Hallo 系列第三代。

3b. Hallo4 —— ✅ 存在,star 极少,模型权重门控

项目内容
名称Hallo4(Hallo4: High-Fidelity Dynamic Portrait Animation via Direct Preference Optimization)
仓库 URLhttps://github.com/fudan-generative-vision/hallo4 (✅ HTTP 200,默认分支 master,仅 5 个 commit)
是否存在存在
stars38(fork 4,issues 2,PR 1 —— 页面实测)
license未指定(shields 返回 not specified;仓库文件列表仅 .gitignore / README.md / inf.sh / requirements.txt / assets/ / vace/,无 LICENSE 文件)
last commit2025-11-30(Atom feed <updated>2025-11-30T06:26:14Z;shields november 2025)
2026 活动无(最后提交止于 2025-11-30)
模型权重Hugging Face fudan-generative-ai/hallo4 —— 门控(gated):匿名访问返回 HTTP 401 Access to model ... is restricted. You must have access to it and be authenticated
简介SIGGRAPH Asia 2025 论文(ACM DL / ar5iv 2505.23525)。用 DPO(Direct Preference Optimization)+ 时序运动调制做高保真动态肖像动画。作者:Jiahao Cui, Baoyou Chen, Mingwang Xu, Hanlin Shang, Yuxuan Chen, Yun Zhan, Zilong Dong, Yao Yao, Jingdong Wang, Siyu Zhu(复旦 / 百度 / 上海创智学院 / 南大 / 阿里)。推理要求 Ubuntu 20.04/22.04 + CUDA 12.1,测试显卡为 H100,依赖 Wan2.1 编码器。

⚠️ Hallo4 实用性问题:38 star、5 commit、无 LICENSE、权重门控、需 H100 级显存 —— 作为选型候选工程可用性很低,且 2026 年零活动。

来源:hallo3 GitHub · hallo4 GitHub · hallo4 HF(门控) · ACM DL · ar5iv


4. EchoMimic V3(antgroup/echomimic_v3)

项目内容
名称EchoMimicV3: 1.3B Parameters are All You Need for Unified Multi-Modal and Multi-Task Human Animation
仓库 URLhttps://github.com/antgroup/echomimic_v3 (✅ HTTP 200)
是否存在存在
stars1.1k
licenseApache-2.0(LICENSE.txt 实测为 Apache License 2.0 正文;注意文件名是 LICENSE.txt,LICENSE 返回 404)
last commit2026-03-18(Atom feed <updated>2026-03-18T03:31:56Z;shields march = 2026-03)
2026 活动有
模型权重BadToBest/EchoMimicV3(hf-mirror API 实测 200);ModelScope BadToBest/EchoMimicV3
论文arXiv 2507.03905;被 AAAI 2026 接收(2025-11-09)
简介统一多模态多任务人体动画:1.3B 参数,音频/姿态/文本多条件驱动。2025-08-08 开源代码 + 权重;2025-08-12 提供 GradioUI(12GB 显存即可生成);被社区集成进 ComfyUI(ComfyUI_EchoMimic,16GB 显存可跑)。

🔥 2026 关键更新(选型重点)

来源:GitHub · HF 模型 · EchoMimicV3-Flash · arXiv · 项目页


5. Hunyuan-Avatar / HunyuanVideo-Avatar(腾讯混元)

项目内容
名称HunyuanVideo-Avatar(仓库名就是 HunyuanVideo-Avatar;未找到单独的 "Hunyuan-Avatar" 仓库)
仓库 URLhttps://github.com/Tencent-Hunyuan/HunyuanVideo-Avatar (✅ HTTP 200)
是否存在存在("Hunyuan-Avatar" 这一写法 未找到 对应仓库)
stars2.2k
licenseTencent Hunyuan Community License Agreement(LICENSE 实测正文首行 TENCENT HUNYUAN COMMUNITY LICENSE AGREEMENT,Release Date: May…;shields 返回 not identifiable by github,因为它是自定义社区许可而非 SPDX 标准协议)
last commit2025-12-16(Atom feed <updated>2025-12-16T12:32:46Z;shields december 2025)
2026 活动无(最后提交止于 2025-12;README News 最后一条为 2025-06-06)
模型权重tencent/HunyuanVideo-Avatar(hf-mirror API 实测 200)
简介基于 MM-DiT 的多模态扩散 Transformer 数字人:① 角色图像注入模块(替代加性条件,消除训练/推理条件错配);② 音频情绪模块 AEM(从情绪参考图迁移情绪风格);③ 人脸感知音频适配器 FAA(latent 级人脸 mask,支持多角色对话独立音频注入)。2025-05-28 开源推理代码 + 权重;2025-06-06 经 Wan2GP 支持单卡 10GB 显存(含 TeaCache)。

⚠️ 2026 年零提交,作为"2026 实时数字人"候选属于停更状态。

来源:GitHub · HF


6. OmniHuman-1.5(字节跳动)

项目内容
名称OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation
仓库 URL未找到(无任何官方公开 GitHub 仓库)
是否存在非开源。实测以下路径全部 HTTP 404:bytedance/OmniHuman、bytedance/OmniHuman-1、bytedance/OmniHuman-1.5、ByteDance/OmniHuman-1.5、bytedance/omnihuman
stars未查到(无仓库)
license未查到(无开源许可)
last commit未查到
Hugging Face 权重未查到官方权重。hf-mirror 搜索 OmniHuman 仅返回社区自建评测集 1,非 ByteDance 官方模型
论文arXiv 2508.19209(Intelligent Creation Lab, ByteDance)
结论✅ API-only / 闭源。仅通过第三方推理平台提供:fal.ai 端点 0(HTTP 200)与 Replicate 1(HTTP 200)。Replicate 描述为"A film-grade digital human model that generates realistic video from a single image, audio clip, and optional text prompt"。
简介字节跳动"认知模拟"数字人:单图 + 音频(+ 可选文本提示)→ 逼真说话视频,号称具备"主动思维"(逻辑推理驱动动作)。

选型含义:OmniHuman-1.5 不能自部署、不可审计、按调用付费。若硬性要求开源可自托管,本项直接排除。

来源:fal.ai API 端点 · Replicate · arXiv 2508.19209


7. FantasyTalking2(Fantasy-AMAP)

项目内容
名称FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait Animation
仓库 URLhttps://github.com/Fantasy-AMAP/fantasy-talking2 (✅ HTTP 200,注意实际仓库名是全小写 fantasy-talking2,FantasyTalking2 拼写返回 404)
是否存在存在(但仅论文页/摘要,未见推理代码或权重)
stars65
license未指定(shields not specified;LICENSE 与 LICENSE on master 均 404 —— 无许可证文件)
last commit2025-08-18(Atom feed <updated>2025-08-18T06:52:07Z;shields august 2025)
2026 活动无(最后提交止于 2025-08-18)
简介音频驱动肖像动画的偏好对齐工作:① Talking-Critic 多模态奖励模型量化多维人类偏好;② Talking-NSQ 大规模多维偏好数据集(410K 偏好对);③ TLPO(Timestep-Layer adaptive multi-expert Preference Optimization),把偏好解耦为专家模块并按 timestep/网络层融合。声称在口型准确度、运动自然度、视觉质量上均优于基线。
论文arXiv 2508.11255(AAAI 2026,见仓库标题)· 项目页
代码可用性实测 README 全文仅含 Abstract + Citation,未找到 inference 代码 / 权重 / 安装说明。README 中无 HF 权重链接。

⚠️ 名称陷阱:任务给的 "FantasyTalking2" 大小写不是真实仓库名;真实 URL 是 Fantasy-AMAP/fantasy-talking2。

来源:GitHub · arXiv · 项目页


8. Ditto(antgroup/ditto-talkinghead)

项目内容
名称Ditto: Motion-Space Diffusion for Controllable Realtime Talking Head Synthesis
仓库 URLhttps://github.com/antgroup/ditto-talkinghead (✅ HTTP 200;digital-human/ditto-talkinghead 与 di74/Ditto 均 404)
是否存在存在(蚂蚁集团 Ant Group)
stars891
licenseApache-2.0(README「⚖️ License」节明示;LICENSE 实测为 Apache 2.0 正文)
last commit2025-11-12(Atom feed <updated>2025-11-12T13:58:42Z;shields november 2025)
2026 活动无(最后提交止于 2025-11-12)
模型权重digital-avatar/ditto-talkinghead
论文arXiv 2411.19509,被 ACM MM 2025 接收(2025-07-07)
简介运动空间扩散的可控实时说话头合成。Updates:2025-01-10 开源推理代码 + 模型;2025-01-21 更新 Colab demo;2025-07-11 发布 PyTorch 模型;2025-11-12 开源训练代码(tree/train 分支,作者说明"版本较多、整理时间有限,可能与论文版略有差异")。

来源:GitHub · HF · arXiv · 项目页


9. MEMO(MEMO: Memory-Guided Diffusion)

项目内容
名称MEMO: Memory-Guided Diffusion for Expressive Talking Video Generation
仓库 URLhttps://github.com/memoavatar/MEMO (✅ HTTP 200;MEMO-Avatar/MEMO、magic-research/memo、antonioo/MEMO 均 404)
是否存在存在
stars1.1k
licenseApache-2.0(shields 实测;LICENSE 实拉为 Apache License 2.0 正文)
last commit2025-08-06(Atom feed <updated>2025-08-06T15:27:15Z;shields august 2025)
2026 活动无(最后提交止于 2025-08-06)
模型权重memoavatar/memo(hf-mirror API 实测 200)
论文arXiv 2412.04448 · 项目页
简介记忆引导扩散的表情丰富说话视频生成。作者:Longtao Zheng, Yifan Zhang, Hanzhong Guo, Jiachun Pan, Zhenxiong Tan, Jiahao Lu, Chuanxin Tang, Bo An, Shuicheng Yan(NTU 等)。
⚠️ 重要限制README 明写:仓库只包含 MEMO-preview 模型的示例推理脚本;「To reduce potential risks, we have only open-sourced a preview model for research purposes.」——仅开源预览模型,非完整版。生态:社区 ComfyUI 集成、Gradio app、Jupyter notebook。

来源:GitHub · HF · arXiv · 项目页


10. Sonic(tencent-ailab Sonic)

项目内容
名称Sonic: Shifting Focus to Global Audio Perception in Portrait Animation
仓库 URLhttps://github.com/jixiaozhong/Sonic (✅ HTTP 200)—— ⚠️ tencent-ailab/Sonic 不存在(404),真实托管在作者个人账号 jixiaozhong 下
是否存在存在
stars3.3k
licenseCC BY-NC-SA 4.0(LICENSE 实拉正文首行 Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International)—— 非商用
last commit2026-01-08(Atom feed <updated>2026-01-08T11:32:14Z;shields january = 2026-01)
2026 活动有(截至 2026-01-08)
论文CVPR 2025(CVPR 开放获取 PDF)· 项目页
简介强调全局音频感知的肖像动画(CVPR 2025)。生态:官方 Gradio demo、HF Space xiaozhongji/Sonic、社区 ComfyUI_Sonic;团队 2025-05-06 另开源情绪表达系统 DICE-Talk。

⚠️ 商用限制:CC BY-NC-SA 4.0(署名-非商业-相同方式共享),README 明确提示商业化需另行处理。

来源:GitHub(jixiaozhong/Sonic) · 项目页 · CVPR 2025 论文


11. FLOAT(deepbrainai-research/float)

项目内容
名称FLOAT: Generative Motion Latent Flow Matching for Audio-driven Talking Portrait
仓库 URLhttps://github.com/deepbrainai-research/float (✅ HTTP 200)
是否存在存在(DeepBrain AI Research)
stars492
licenseCC BY-NC-ND 4.0(README「❗License❗」节 + 2025-02-17 Updates 均指向 creativecommons.org/licenses/by-nc-nd/4.0;仓库内无 LICENSE 文件,/LICENSE 返回 404,故 shields 显示 not identifiable by github)—— 非商用 + 禁止演绎
last commit2025-11-10(Atom feed <updated>2025-11-10T14:06:06Z;shields november 2025)
2026 活动无(最后提交止于 2025-11-10)
论文arXiv 2412.01064,被 ICCV 2025 接收(2025-06-26)
简介基于 flow matching 的音频驱动说话肖像生成。核心:不用像素级 latent,而用学习到的正交运动 latent 空间(orthogonal motion latent space),实现时序一致的 motion 生成与编辑;transformer 向量场预测器 + 逐帧条件机制;支持语音驱动情绪增强(speech-driven emotion enhancement)。作者:Taekyung Ki, Dongchan Min, Gyeongsu Chae。2025-02-17 开源推理代码 + checkpoints。

来源:GitHub · arXiv · 项目页


12. MuseTalk 1.5 / 2.0(TMElyralab/MuseTalk)

项目内容
名称MuseTalk(Real-Time High-Fidelity Video Dubbing via Spatio-Temporal Sampling)
仓库 URLhttps://github.com/TMElyralab/MuseTalk (✅ HTTP 200)
是否存在存在
stars6.6k
licenseMIT(master/LICENSE 实拉正文首行 MIT License;main/LICENSE 返回 000/超时,shields 因默认分支探测失败显示 not identifiable by github —— 以实体文件为准,MIT)
last commit2025-09-26(Atom feed <updated>2025-09-26T05:44:17Z;shields september 2025)
2026 活动无(最后提交止于 2025-09-26)

版本核实结论:2026 年最新公开版本仍是 1.5,不存在 MuseTalk 2.0

模型权重TMElyralab/MuseTalk(hf-mirror API 实测 200)
简介实时唇形同步(video dubbing / lip-sync)。1.5 版引入 perceptual loss + GAN loss + sync loss 联合训练,两阶段训练策略 + 时空数据采样,在视觉质量与口型精度间取平衡。是"音改口型"而非"整脸动画",因此常与 Wav2Lip/LatentSync 同类对比。

"MuseTalk 2.0" = 未找到(无仓库 tag、无 HF 权重、无 README 条目、无 release)。

来源:GitHub · HF · arXiv 2410.10122


13. LatentSync 1.6 / 2.x(bytedance/LatentSync)

项目内容
名称LatentSync(End-to-end lip sync leveraging audio conditioned latent diffusion models)
仓库 URLhttps://github.com/bytedance/LatentSync (✅ HTTP 200)
是否存在存在
stars6.1k
licenseApache-2.0(shields 实测 Apache-2.0)
last commit2025-06-20(Atom feed <updated>2025-06-20T07:36:51Z;shields june 2025)
2026 活动无(最后提交止于 2025-06-20)

版本核实结论:最新为 1.6,不存在 2.x

"LatentSync 2.x" / "LatentSync 2.0" = 未找到(无 README 条目、无 HF 权重、无 release)。第三方博客提到 2026 年语境(如 sync.so 的 2026 评测文),但不代表存在 2.x 版本。

来源:GitHub · HF 1.6 · arXiv


🆕 额外发现:2026 年值得注意的实时流式数字人开源项目

这些不在原始候选清单内,但在核实过程中确认是 2026 年新建/活跃的实时流式(streaming)avatar 项目,且工程指标(FPS/延迟/消费级显卡可跑)明确公开,比清单里多数"停更"候选更贴合"实时数字人"目标。

A1. SoulX-FlashTalk(Soul-AILab,2026)

项目内容
仓库 URLhttps://github.com/Soul-AILab/SoulX-FlashTalk (✅ HTTP 200)
stars1.5k
licenseApache-2.0(shields 实测)
last commit2026-07-30(Atom feed <updated>2026-07-30T09:13:58Z;shields july)
权重Soul-AILab/SoulX-FlashTalk-14B(hf-mirror API 实测 200)
简介首个做到亚秒级启动延迟(0.87s)+ 实时 32 FPS(8×H800 节点)的 14B 模型。全称:"Real-Time Infinite Streaming of Audio-Driven Avatars via Self-Correcting Bidirectional Distillation"。
时间线2025-12-30 技术报告 + 项目页;2026-01-08 开源推理代码 + 模型权重。
论文arXiv 2512.23379

A2. SoulX-FlashHead(Soul-AILab,2026)—— ⭐ 消费级显卡可实时

项目内容
仓库 URLhttps://github.com/Soul-AILab/SoulX-FlashHead (✅ HTTP 200)
stars1.1k
licenseApache-2.0(shields 实测)
last commit2026-05(shields may = 2026-05;Atom feed 当日探测超时,未能取得精确日)
权重Soul-AILab/SoulX-FlashHead-1_3B(hf-mirror API 实测 200)· 数据集 Soul-AILab/VividHead
简介"Oracle-guided Generation of Infinite Real-time Streaming Talking Heads"。明确给出消费级显卡指标:Model_Lite 单张 RTX 4090 可达 96 FPS(或 3 路并发各 25+ FPS 实时);Model_Pro 单张 RTX 4090 为 10.8 FPS,两张 RTX 5090 可实时(25+ FPS)。
生态Gradio app(2026-03-04)、ComfyUI 节点 ComfyUI_RH_FlashHead(2026-03-02)、HF Space 在线 demo(2026-03-09)
时间线2026-02-07 技术报告 + 数据集;2026-02-12 开源推理代码 + 权重 + 项目页
论文arXiv 2602.07449

💡 对本地 16GB 显存(RTX 5060 Ti)选型最有参考价值的一项:1.3B 模型、Model_Lite 在 4090 上 96 FPS,是清单中唯一给出"消费级单卡实时"明确数字的流式说话头项目。

A3. LiveAvatar(Alibaba-Quark,ECCV 2026 Spotlight)

项目内容
仓库 URLhttps://github.com/Alibaba-Quark/LiveAvatar (✅ HTTP 200)
stars2.4k
licenseApache-2.0(README「📜 License Agreement」:主体 Apache 2.0;基座 Wan 模型同为 Apache 2.0)
last commit2026-08-24(Atom feed <updated>2026-08-24T15:10:10Z;shields august)
权重Quark-Vision/Live-Avatar(hf-mirror API 实测 200)
简介算法-系统协同设计的实时流式无限长交互 avatar:14B 扩散模型,多卡 H800 上 45 FPS、4-step 采样,Block-wise Autoregressive 处理支持 10,000+ 秒流式视频。
时间线2025-12-04 论文 + demo 页;2025-12-08 实时推理代码 + 权重;2025-12-12 单卡 80GB 推理代码;2026-01-20 v1.1(FP8 量化 → 可用 48GB 显卡推理;编译 + cuDNN attention 提速峰值 ~2.5×、均值 3×,多 H800 稳定 45+ FPS);2026-06-18 被 ECCV 2026 接收为 Spotlight。
论文arXiv 2512.04677

⚠️ 显存门槛高:v1.1 的 FP8 路线仍需 48GB 卡;16GB 消费卡不可行。

A4. Linly-Talker-Stream(Kedreamix)

项目内容
仓库 URLhttps://github.com/Kedreamix/Linly-Talker-Stream (✅ HTTP 200)
stars133
licenseApache-2.0(shields 实测)
last commit2026-02(shields february = 2026-02)
简介"Linly-Talker-Stream: Real-Time Streaming Conversational Digital Human System —— 全双工、低延迟、实时交互数字人框架"。是 Linly-Talker 系列的流式全双工版本,偏系统集成(ASR + LLM + TTS + 渲染编排)而非单一生成模型。

A5. SentiAvatar(SentiAvatar/SentiAvatar)—— 3D 交互数字人

项目内容
仓库 URLhttps://github.com/SentiAvatar/SentiAvatar (✅ HTTP 200)
stars453
license未指定(shields not identifiable by github;未查到明确开源许可,需自行核对仓库 LICENSE)
last commit2026-04(shields april = 2026-04)
简介SentiPulse 与 GSAI 联合开源,被称为首个交互式 3D 数字人框架,2026 年 4 月全球开源(人民网报道 · PRNewswire 稿)。与上述 2D 视频生成路线不同,属 3D 驱动方向。

📊 汇总速查表

#名称仓库存在starslicenselast commit2026 活跃类型
1Realtime-VenusinclusionAI/Realtime-Venus✅40Apache-2.02026-09-21✅全双工对话/异步委派(含 TTS,非视频生成)
2aWan-DancerWan-Video/Wan-Dancer✅432Apache-2.02026-07-17✅音乐→舞蹈视频(非数字人)
2bWan2.2-S2VWan-Video/Wan2.2✅18k(整仓)Apache-2.02026-09-21✅音频驱动说话视频
3aHallo3fudan-generative-vision/hallo3✅1.4kMIT2025-03-13❌肖像动画
3bHallo4fudan-generative-vision/hallo4✅38未指定2025-11-30❌肖像动画(DPO);权重门控
4EchoMimic V3antgroup/echomimic_v3✅1.1kApache-2.02026-03-18✅多模态人体动画,1.3B,12GB 可跑
5HunyuanVideo-AvatarTencent-Hunyuan/HunyuanVideo-Avatar✅2.2k腾讯混元社区许可2025-12-16❌多角色情绪数字人
6OmniHuman-1.5无仓库❌ 闭源未查到未查到未查到API-only闭源 API(fal / Replicate)
7FantasyTalking2Fantasy-AMAP/fantasy-talking2✅65未指定2025-08-18❌偏好对齐(仅摘要,无代码)
8Dittoantgroup/ditto-talkinghead✅891Apache-2.02025-11-12❌实时说话头(含训练码)
9MEMOmemoavatar/MEMO✅1.1kApache-2.02025-08-06❌记忆引导(仅 preview 模型)
10Sonicjixiaozhong/Sonic✅3.3kCC BY-NC-SA 4.02026-01-08⚠️ 止于 1 月肖像动画(非商用)
11FLOATdeepbrainai-research/float✅492CC BY-NC-ND 4.02025-11-10❌Flow matching 说话肖像(非商用)
12MuseTalkTMElyralab/MuseTalk✅6.6kMIT2025-09-26❌唇形同步;最新 1.5,无 2.0
13LatentSyncbytedance/LatentSync✅6.1kApache-2.02025-06-20❌唇形同步;最新 1.6,无 2.x
A1SoulX-FlashTalkSoul-AILab/SoulX-FlashTalk✅1.5kApache-2.02026-07-30✅流式 avatar,0.87s 延迟 / 32 FPS
A2SoulX-FlashHeadSoul-AILab/SoulX-FlashHead✅1.1kApache-2.02026-05✅流式说话头,4090 单卡 96 FPS
A3LiveAvatarAlibaba-Quark/LiveAvatar✅2.4kApache-2.02026-08-24✅流式无限长,45 FPS(H800)/48GB 卡
A4Linly-Talker-StreamKedreamix/Linly-Talker-Stream✅133Apache-2.02026-02✅全双工流式对话数字人(系统集成)
A5SentiAvatarSentiAvatar/SentiAvatar✅453未指定2026-04✅交互式 3D 数字人框架

🎯 关键结论

  1. 13 个候选名中,12 个能对应到真实公开仓库;只有 "OmniHuman-1.5" 是彻底闭源 API-only(GitHub 无仓库、HF 无官方权重、仅有 fal.ai / Replicate 端点)。
  2. 两个版本号是虚构/未找到的:
    • MuseTalk 2.0 → 未找到(官方最新 1.5,2025-03-28 发布;HF 仅 TMElyralab/MuseTalk)
    • LatentSync 2.x → 未找到(官方最新 1.6,2025-06-11 发布;HF 仅 ByteDance/LatentSync / -1.5 / -1.6)
  3. 仓库名易错点:Fantasy-AMAP/fantasy-talking2(全小写)、jixiaozhong/Sonic(不是 tencent-ailab)、memoavatar/MEMO、inclusionAI/Realtime-Venus、Alibaba-Quark/LiveAvatar、fudan-generative-vision/hallo4(默认分支 master)。
  4. 2026 年仍有提交的只有 7 个:Realtime-Venus(2026-09-21)、Wan2.2(2026-09-21)、Wan-Dancer(2026-07-17)、EchoMimicV3(2026-03-18)、Sonic(2026-01-08),加上额外的 SoulX-FlashTalk(2026-07-30)、LiveAvatar(2026-08-24)、SoulX-FlashHead(2026-05)、Linly-Talker-Stream(2026-02)、SentiAvatar(2026-04)。
  5. "实时/流式"真正对口的是额外发现的三项:SoulX-FlashHead(消费级 4090 单卡 96 FPS / 1.3B)、SoulX-FlashTalk(14B / 0.87s / 32 FPS @8×H800)、LiveAvatar(14B / 45 FPS @多卡 H800,48GB 单卡可推理)。原候选清单里的 Ditto("Realtime")虽标称实时,但已 10 个月无更新。
  6. 许可红线:Sonic 是 CC BY-NC-SA 4.0、FLOAT 是 CC BY-NC-ND 4.0(均禁商用);HunyuanVideo-Avatar 是腾讯混元社区许可(非 SPDX 标准);Hallo4 / FantasyTalking2 / SentiAvatar 无明确许可证——商用前必须逐一确认。
  7. Hallo4 性价比极低:38 star、5 commit、无 LICENSE、HF 权重门控(401)、需 H100 级测试环境,且 2025-11 后停更。

📚 来源清单

代码仓库(均于 2026-09-22 实测 HTTP 200)

不存在(404 实测)

模型权重 / 论文 / 项目页


📎 附录:父任务侧(同工作区并行核实)补充数据点

以下条目由父任务侧独立核实并于 2026-09-22 同步给本报告,本次未由我二次独立复核(模型权重体积类数据无法用上面的 shields/Atom 方法验证,故单独列出,标注来源)。

项目父任务侧补充数据点我的核实是否一致
Realtime-Venus只出语音不出脸(9B 全双工对话前端);单模型 ~18.7GB bf16✅ 一致(我独立确认仓库/星数/许可/时间;"只出语音"结论一致)
Wan-DancerHF Wan-AI/Wan-Dancer-14B 权重 85.67GB;实测环境 8×A800 80GB✅ 环境一致(我从 README 独立读到 8×A800 80GB);权重体积未独立复核
Wan2.2-S2VHF Wan-AI/Wan2.2-S2V-14B,49.15GB体积未独立复核(仓库/权重存在性已独立确认)
EchoMimic V3AAAI 2026✅ 一致(我另确认 2026-01-22 发布 EchoMimicV3-Flash)
HunyuanVideo-Avatar自定义许可;官方最低 24GB许可 ✅ 一致(腾讯混元社区许可);24GB 门槛未独立复核(README 另载社区 Wan2GP 可单卡 10GB)
OmniHuman-1.5bytedance/OmniHuman* 全 404,仅 Replicate/fal.ai API✅ 完全一致
Soniclast commit 2026-01✅ 一致(Atom feed 精确到 2026-01-08)
MuseTalk官方 News 2025-03-28;2.0 未找到✅ 完全一致
LatentSync官方 News 2025-06-11,18GB 门槛;2.x 未找到✅ 一致(18GB 我从 README 独立读到;我另确认 HF 仅 ByteDance/LatentSync/-1.5/-1.6)
DittoACM MM 2025✅ 一致(我另确认 2025-11-12 开源训练代码)
MEMOlast commit 2025-08✅ 一致(Atom feed 精确到 2025-08-06;另确认仅开源 preview 模型)
FantasyTalking2last commit 2025-08、2026 无活动✅ 一致(Atom feed 精确到 2025-08-18)
Hallo3 / Hallo4hallo3 last commit 2025-03;hallo4 仅 38⭐、last commit 2025-11✅ 完全一致(另确认 hallo4 权重门控 401、无 LICENSE)
FLOATlast commit 2025-11✅ 一致(Atom feed 精确到 2025-11-10;另确认 CC BY-NC-ND 4.0)

数据来源(badge/API,非人写)

下载此文件