需求:离线口播成片(一张图/一段视频 + 人声音频 → 口型同步视频),必须本机跑、不用云端 API。硬件 = GPU 机 192.168.31.31 单卡 RTX 5060 Ti 16GB(sm120)+ 32GB 内存 + ComfyUI(2026-09-20 版本)+ 磁盘剩 138 GiB。
版本说明:v2(2026-09-22 下午修订)。v1 曾把
Wan2.2-S2V-14B排为首选;后台深度调研拿到 2026-08 第三方六模型同条件横评(Tight Studio,Modal 固定 commit 部署、同一头像 + 同一段 3.63 秒音频)后,排序被修正——原因见第二节。本文所有关键数字都标了来源等级:🟢 第三方实测 / 🟡 厂商宣称 / 🔴 未查到。
| A 类:音频驱动(给现成录音对口型) | B 类:联合音视频生成(自己生成语音) | |
|---|---|---|
| 输入 | 图/视频 + 你提供的音频 | 文本(+ 可选参考图) |
| 对你 | ✅ 正是你要的 | ❌ 不能给现成录音对口型 |
| 代表 | FlashHead、EchoMimicV3、LongCat 1.5、Wan2.2-S2V、InfiniteTalk、MuseTalk、LiveAvatar | daVinci-MagiHuman、LTX-2.5 / JoyAI-Echo echoVid |
路径 B-1:一段已有视频,只想换成另一段录音的嘴型 → MuseTalk 1.5
路径 B-2:一张图 + 录音,全新生成口播视频 → 按下面的三步走
| 顺序 | 模型 | 为什么是它 | 显存(可跑档) | 10 秒成片耗时 | 代价 |
|---|---|---|---|---|---|
| ① 首选(但必须先验证 sm120) | EchoMimicV3-Flash-pro 1.3B(蚂蚁,Apache-2.0) | 中文最强:原生 chinese-wav2vec2;官方测试 GPU 列表含 V100 16G;官方 README 明确写「12G VRAM Requirement」(官方量化版 app_mm.py 最低 12 GB);768×512 开 block_offload 仅 6.5 GB(支持到 768×768、8 步、无需 face mask);ComfyUI 节点给 16G 档参数 partial_video_length=97 | 6.5 GB(768×512 + block_offload) | 🟢 10 秒约 14 分钟(官方口径:5 秒 7 分钟) | 🔴🔴 最大未知数:issue #62 —— RTX 5090 32GB 用官方量化版也跑不通(2025-12-31,0 回复,疑似 sm120) → 必须先小规模验证再谈批量;默认配置实测 33.7 GB 不调参必 OOM;非流式(partial_video_length 分段);画面运动幅度小 |
| ② 保底 | SoulX-FlashHead 1.3B Lite(Soul App,Apache-2.0) | 唯一被两组独立第三方验证 <16GB 的全功能音频驱动模型;ComfyUI 原生节点;无限时长流式分块 | 🟢 峰值 5.76 GB(权重全 F32,转 fp16 可降到 ~3 GB) | 🟢 约 1~2 分钟(热启动 0.19 s/块) | 🔴 画质最弱(两组实测均称「不真实」);仅 512×512 |
| ③ 已有视频换嘴型 | MuseTalk 1.5(腾讯音乐) | 官方 4GB 卡可跑 fp16;中英日明确;代码 MIT + 模型可商用 | ≤8 GB(5060 Ti 实测 ~3.6 GB) | ⚠️ 别按「官方实时」理解:LiveTalking 封装的 3080Ti 42 FPS 是外层功劳;官方实现直跑 5060 Ti 实测仅 ≈5.8 FPS(issue #409,361 帧验证),且官方成员确认不支持音频流式(issue #33) | 🔴 静音测试 0.68 全场最低(不给音频也动嘴);256×256 需外挂 GFPGAN |
| ⚠️ 中期(长视频/多人才考虑) | LongCat 1.5(MIT)/InfiniteTalk(Apache-2.0) | LongCat:原生多人 + 长视频续写 + 中文口型;InfiniteTalk:ComfyUI 已有官方核心节点,已在 RTX 5060 16GB 上跑通(需升到 torch 2.9.1+cu130) | LongCat INT8 15.89 GB 或 GGUF Q4 12.07 GB + block_num=1;InfiniteTalk GGUF Q4 底座 11.34 GB + patch 1.4 GB + block swap 30~40 | 🟡 30 分钟 ~ 2 小时(RTX 5080 16G 实测 640×640 5 秒 = 1300 秒) | 🔴 16GB 是 Wan 系 14B 的最低门槛(4070 Super 12GB 直接 OOM),本机卡在门槛上、没有余量同时加载两个模型;LongCat 仅 480p、表情缺陷未修;InfiniteTalk 3 分钟视频吃 >120 GB 内存(本机 32GB)→ 必须切 ≤20 秒分段 |
本机算力标尺(唯一有逐秒实测的模型):Wan2.2-Animate-2 的 distill int8_convrot 部分卸载 ≈ 7.3 GB 显存 / 8.6 GB 内存,49 帧 @480×854 = 126.8 秒(10 步)——但它不吃音频(要驱动视频),只能当"这张卡跑 14B 级视频有多慢"的参照。另注意坑:WanAnimate2Cache 设 device=gpu + dtype=int8 再配 MultiGPU patch 会静默杀进程,必须 device=cpu + dtype=default。
Wan2.2-S2V-14B 的角色降级但不淘汰:
wav2vec2-large-xlsr-53-english)。中文口型优先级:LongCat 1.5(Whisper-large-v3,原生中英) ≈ EchoMimicV3 v1.5(专门改善中文) > MuseTalk(中英日明确) > Wan2.2-S2V(英文编码器,中文未验证)。
第三方横评(🟢 Tight Studio,2026-08-23)同一条件实测:
| 模型 | 峰值 VRAM | 3.63 秒音频耗时 | 输出规格 |
|---|---|---|---|
| LiveAvatar(阿里) | 61,401 MiB | 181.44 s(最快) | 384×704 @25fps |
| Wan2.2-S2V-14B | 58,681 MiB | 780.29 s(最慢) | 512×896 @16fps |
| SoulX-FlashTalk-14B | 57,805 MiB | 331.93 s | 416×720 @25fps |
| LongCat-Video-Avatar 1.5 | 46,827 MiB | 233.08 s | 480×832 @25fps |
| EchoMimicV3-Flash | 33,726 MiB | 251.94 s | 480×848 @25fps |
| SoulX-FlashHead Lite | 5,763 MiB | 235.31 s(首块 155.7 s 为编译,之后 0.19 s/块) | 512×512 @25fps |
横评原文:「16 GB 以下:SoulX-FlashHead Lite 是经过验证的唯一一款完全适配的全功能生成器。」
画质的主观排序则是:LiveAvatar(最清晰)> EchoMimicV3-Flash(最佳平衡)> LongCat 1.5(最有表现力)> FlashHead(最不逼真)。 → 能跑的画质弱,画质好的跑不动。这就是 16GB 的现实,任何「一张图出电影级数字人」的说法在这张卡上都不成立。
来源:HF 模型卡 + 社区 GGUF 实测体积(2026-09-22)。
| 项目 | 事实 |
|---|---|
| 许可证 | Apache-2.0(可商用) |
| 架构 | 14B 单体(不是 T2V/I2V 的 27B MoE 双专家) |
| 官方单卡门槛 | generate.py 注释 ≥80GB VRAM,第三方 H200 实测峰值 58.7 GB |
GGUF 档(calcuis/wan-s2v-gguf,含完整工作流 JSON) | Q8_0 18.27 / Q6_K 15.10 / Q4_K_M 12.91 / IQ4_XS 11.32 / Q2_K 8.86 GiB |
| 配套 | 文本编码器三选一(cow-umt5xxl Q2_K 3.67 GiB 等)、wav2vec2...f16.gguf 0.59 GiB、VAE 0.254 GiB |
| 本机状态 | ComfyUI 2026-09-20 + ComfyUI-GGUF 已装;models/audio_encoders/ 为空,需补 |
| 长视频 | 官方工作流 Video S2V Extend 每片 77 帧 ≈ 4.81 秒 @16fps,按 音频秒数 × 16 ÷ 77 算节点数 |
| 生态升级件 | Live Avatar(阿里 Quark+中科大,ECCV 2026 Spotlight,Apache-2.0)只是它上面的 1.26 GiB LoRA(4 步、无限长、20FPS@5×H800);官方单卡离线推理尚未发布,可试挂 LoRA,属实验性 |
| InfiniteTalk(给已有视频配音、无限时长) | ComfyUI 适配权重仅 2.53 GiB(需 Wan2.1-14B 底模);但 kijai wrapper 有专门针对 RTX 5060 的求助 issue #1875、以及 #1185「渲染极慢」;官方自曝 I2V 超过 1 分钟色彩偏移明显 |
| ⚠️ LTX-2.5(本机已有权重+audio VAE) | 属 B 类(模型自生成语音),不接受你提供的录音;社区有 lipsync 条件化工作流但未验证能稳定吃外部音频 → 先别指望它当主力,只适合「文本→数字人自说自话」 |
中文文案 →(本地 TTS)→ 人声 WAV(mono / 44.1~48kHz / 干净无 BGM)
→(可选:人声分离去 BGM)→(A 类模型对口型)→ 口型视频
→(可选:VideoHelperSuite 拼接 / RTX VSR 放大 / FaceRefine 修脸)→ 落盘 + 归档相册
| 模型 | 许可证 | 语言 | 关键实测 | 定位 |
|---|---|---|---|---|
| GPT-SoVITS v2ProPlus | MIT(无附加条件) | 中文 | README 明确列出测试通过环境含 PyTorch 2.7.0/CUDA 12.8、2.8.0dev/CUDA 12.8;RTF 0.028 @4060 Ti → 10 秒音频 ≈0.28 秒(全表最快) | ✅ 离线链路首选(Phase 1)——sm_120 最友好、速度压倒性;坑:无情感控制、🟡 无第三方中文 CER/SIM 数据 |
| IndexTTS-2.5(2026-08-10 新版) | bilibili 自定义协议,免版税、普通规模免费商用(仅 >1 亿 MAU 或 >10 亿 RMB 年收入需单独授权) | zh / en | 8 维情感向量(同级唯一)、小数读法 100%(唯一满分) | Phase 2 上情感;⚠️ 速度争议极大(官方 RTF 0.2065@4090 vs 5060 Ti 实测 2.92)+ issue #295 GPU 检测失败(与 Blackwell 相关) |
Qwen3-TTS(0.6B-CustomVoice / 1.7B-Base) | Apache-2.0(repo 13k⭐) | 中文母语级 | 388 万下载、两套 ComfyUI 节点;第三方 VoicePing 称 "the strongest balanced model in this benchmark";官方首包 97 ms、本次唯一「sm_120 零 issue」的 TTS | Phase 3 追质量;⚠️ 中文长数字串 30/30 全失败(0%)、必须锁 transformers==4.57.3 |
| LongCat-AudioDiT(美团) | MIT | 中文 | 中文相似度全场最高(SIM 81.8 / CER 1.09),非流式——离线口播不吃亏 | 追中文相似度可选;⚠️ 待验:3.83B F32 ≈ 15 GB+ 能否进 16GB |
| VoxCPM2(面壁+清华,2B) | Apache-2.0 | 中文 | 中文 CER 4.4% 全表最低 | 追字准可选 |
| Fun-CosyVoice3-0.5B-2512 | Apache-2.0(代码+权重) | 11 语 + 18 种中文方言 | 中文相似度 CV3-Eval 80.01 最高 | ⚠️ 降为「备选,须先验证能否启动」:issue #1318「5060ti 16g 运行 CosyVoice2 无法启动」 + #1815 sm_120 兼容 |
🔴🔴 最容易被忽略、后果最严重的一条通用规则:没有任何中文 TTS 能可靠读长数字串。 实测:Qwen3-TTS 标识符 0%、IndexTTS-2.5 40%、CosyVoice3 标识符 90% 但货币项仅 46.7%,且错误多是把金额本身改掉。→ 必须在 pipeline 预处理里把「数字 / 金额 / 编号 / 日期」展开成汉字(这一步做不做,决定口播成品是否可信),展开后再送 TTS。
TTS 落地顺序(写进 §4.6):Phase 1 GPT-SoVITS 跑通链路 → Phase 2 IndexTTS-2.5 上情感 → Phase 3 Qwen3-TTS / VoxCPM2 追质量。全程:参考音频 ≤3.5 秒、不开 sage_attn、torch 用 cu128+、与数字人模型串行执行(别同时驻留)。
⚠️ 许可红线(先前的说法要更正):IndexTTS 不是 Apache-2.0,是 bilibili 自定义协议(普通规模可商用);F5-TTS 权重 CC-BY-NC、Spark-TTS 权重 CC-BY-NC-SA(GitHub 写 Apache,自相矛盾)、Fish-Speech 商用需单独授权、ChatTTS 是 AGPL+CC-BY-NC 且官方故意加噪降质、Higgs Audio v3 非商用、VibeVoice 已被微软下架 → 全部出局。教训:不要信 HF 镜像卡的 license 字段,要读仓库 LICENSE 原文。 ⚠️ 指标口径警告(4 个实例):Qwen3-TTS 自报 0.77 vs 第三方 1.22~1.33(1.6×);Fish S2 Pro 0.54 vs 3.62(6.7×);OmniVoice 0.84 vs 3.41(4×);GPT-SoVITS 1.6 vs 7.34(4.6×)。→ 引用必须带榜单名,最终用 seed-tts-eval 自测。
音频预处理是第一杀手:先做人声分离(干净人声轨的唇形质量远好于混 BGM);mono + 44.1/48 kHz;FlashHead 官方要求参考图正脸、居中、上半身,音频最好 16 kHz。 本机现成后处理:Nvidia_RTX_Nodes_ComfyUI(RTX VSR)、ComfyUI-H3-FaceRefine、comfyui-VideoHelperSuite。
| 方案 | 淘汰原因 |
|---|---|
| LiveAvatar / SoulX-FlashTalk-14B / Wan2.2-Animate-14B | 单卡需求 61~64 GB(Animate INT8 17.15 GiB 已超 16GB);LiveAvatar 单卡离线推理未发布 |
| FantasyTalking | 有直接的 16GB 失败证据:RTX 5070 Ti 16GB 明确失败(issue 标题就是 "Doesn't work with 16GB VRAM")、RTX 5090 32GB 最小设置 OOM;官方明说必须装 flash_attn 否则结果错误(sm120 大坑);A800 40G 上 30 秒视频=1 小时、1 分钟音频>19 小时;官方最低档 20 GB / 32.8 秒每迭代;第三方论文实测唇形同步指标最差(Sync-C 1.11 vs 其他 4~6) |
| HunyuanVideo-Avatar | 从「能跑」下调为「本机偏不可行」:所有成功案例都带 96 / 97 / 192 GB 系统内存(int8 权重会被 pin 进内存约 12.8 GB,本机只有 32GB);V100 32GB + 64GB RAM 在 Wan2GP 里仍 OOM;官方 ComfyUI 支持一年多未落地(Open-source Plan 未打勾);社区节点门槛写 >24G;许可证非标准 OSI |
| daVinci-MagiHuman / LTX-2.5 echoVid | B 类:自己生成语音,不接受外部录音;社区 fp8 分支作者自述「跑不起来、EXPERIMENTAL」 |
| Sonic | CC BY-NC-SA 4.0 不可商用(官方要求商用走腾讯云);仅测于 32G 单卡 |
| OmniAvatar-14B | HF 仓库只剩 1.15 GiB 的 pytorch_model.pt,权重不完整;且官方称需 64GB 内存 |
| HunyuanPortrait | 根本不是音频驱动——它是「参考图 + 驱动视频」驱动,与口播需求不匹配 |
| MoCha(Meta) | Meta 版从未开源,无权重可用 |
| Bernini-R-S2V | 作者自己写明「不是 SOTA audio-to-video」;双专家 int8 各 17.72 GiB;音频上限 9~15 秒 |
| Chanjing-Avatar(蝉镜) | 2026-08 才放出,仅适配器权重(14B 目录 1.15 GiB,须配 Wan2.1 底座),下载量 16~90,无第三方实测 |
| 3D / 3DGS 数字人 | 开源 3DGS 说话头几乎全非商用(清华许可禁商用、GaussianAvatars/SplattingAvatar 为 CC-BY-NC-SA),且叠了 FLAME/BFM/SMPL 非商用底座;仓库普遍锁 py3.7 + torch1.12 + CUDA11,与 sm_120 不兼容。详见 3D数字人_一体化平台_授权风险.md |
| Wan-Animate-2 / Wan2.2-Animate | 视频驱动(动作迁移),不是音频驱动;且 INT8 15.51 / 17.15 GiB 都很紧 |
3D数字人_一体化平台_授权风险.md)DUIX.COM Community License:LICENSE 原文 MAU>1000 须商业授权,README 却写 10 万,冲突时按 LICENSE 保守评估;另需 "Built with DUIX.COM" 署名。结论先放这:14B 级「实时」数字人全部与 16GB 无缘——SoulX-FlashTalk-14B 单卡 >64GB(
--cpu_offload后 40GB)、LiveAvatar 61.4GB、Wan2.2-S2V 58.7GB、LongCat 1.5 46.8GB,与量化无关,它们依赖多卡序列并行。16GB 上能实时的只有小模型。详见实时交互数字人与TTS调研.md。
| 方案 | 组成 | 显存/延迟 | 坑 |
|---|---|---|---|
| 口径最优先 | LiveTalking + vLLM-Omni(Qwen3-TTS-0.6B) + 本地 9B LLM | wav2lip256 ~200MB(或 musetalk 3.9GB)+ TTS + LLM ≈ 10.5~14 GB;TTS 首包 ~130ms(作者在 3090 实测🟢) | ⚠️ vLLM-Omni 实测 0.6B 竟占 ~13GB → 必须下调 --gpu-memory-utilization(0.35~0.45);musetalk 必须确认版本含 2026-08-20 PR #612(缺 @torch.no_grad() 的历史 OOM bug,17.62GB → 修复后 3.9GB) |
| 画质优先 | OpenAvatarChat v0.6.0 + SoulX-FlashHead-1.3B + CosyVoice3 | FlashHead Lite 峰值 5,763 MiB、96 FPS🟡、无限时长流式 | 需 flash-attn(sm_120 无预编译 wheel)+ OpenAvatarChat 钉 torch 2.4.1+cu124 |
| 流式 TTS 首选 | Fun-CosyVoice3-0.5B-2512(Apache-2.0 代码+权重) | 官方双向流式(称 150ms),第三方 CV3-Eval 中文相似度 80.01 全表最高 | 备选 IndexTTS-2.5(中文 CER 0.93~1.21%、~6GB)但没有流式;MOSS-TTS-Realtime(Apache-2.0,TTFB 180ms) |
| 可关注 | Ditto-talkinghead(蚂蚁,Apache-2.0,45 FPS 流式,权重 ~2.4GB) | — | 🔴 钉 tensorrt==8.6.1,不支持 sm_120 |
| 非商用可优先试 | NanoAvatar(wpydcr/NanoAvatar,2026-09) | 显存 834 MiB(Lite 700 MiB)、4090 量化版 333 FPS / 首帧 18ms、官方称流式 LLM+TTS 下 ~0.3 秒开始说话;要求 torch==2.10.0+cu128(原生 sm_120)、不依赖 SageAttention/flash-attn → sm_120 风险最低 | ⚠️ 代码 MIT 但口型权重 CC BY-NC 4.0 → 不可商用;仓库很新(15⭐),无第三方复现 |
| 3D 动作路线 | SentiAvatar(2026-04,453⭐,~2.9GB) | 输出 BVH 动作,不碰 diffusers/attention 内核 → sm_120 最安全 | ⚠️ CC BY-NC-SA,不可商用 |
| 许可警告 | OmniVoice 代码 Apache-2.0 但权重 CC-BY-NC(不可商用);Fish Audio S2 Pro 自研 Research License(企业自用也算商用);ChatTTS AGPL+CC-BY-NC;Fay 是 GPL-3.0(README 自称「商用免责」不成立);Linly-Talker 主仓 2026-02 后停更 |
顺带一个离线也能用的优化:SoulX-FlashHead Lite 权重 843 个张量全是 F32(6.107 GB)→ 转 fp16 只剩约 3 GB,16GB 上更宽松。
建议顺序(风险从低到高)
ComfyUI_EchoMimic + 一键脚本(Ubuntu/CUDA 13 版)→ 首选:768×512、开 block_offload(官方口径 6.5 GB)、ComfyUI 节点 16G 档参数 partial_video_length=97。但先做「冒烟测试」:只跑 3~5 秒片段 + 480p(官方口径 5 秒 7 分钟),确认 sm120 上不报 no kernel image / 不崩(issue #62:5090 32GB 用官方量化版都没跑通,本机风险未知)。通过后再放大到 10 秒/768。ComfyUI_RH_FlashHead(Lite 档、512×512、峰值实测 5.76 GB),保底一定跑得起来,代价是画质弱。int8_sharded + block_num + device=cpu offload,走 sdpa;注意 480p/44 秒约要 2 小时)。端到端推荐链路(全程 MIT/Apache-2.0/免费商用,分时复用显存) 文案预处理(数字/金额/编号 → 汉字展开)→ GPT-SoVITS v2ProPlus 配音 → EchoMimicV3-Flash-pro 出片 → 约 14 分钟 / 10 秒成片(其中配音约 0.3 秒、出片约 14 分钟);长音频一律切成 ≤20 秒分段,出片后拼接。
GPT-SoVITS v2ProPlus(MIT、RTF 0.028 @4060 Ti、README 测试环境含 torch 2.7/2.8+cu128)先跑通链路 → Phase 2 IndexTTS-2.5 加情感 → Phase 3 Qwen3-TTS / VoxCPM2 追质量/字准。Qwen3-TTS 须锁 transformers==4.57.3;Fun-CosyVoice3 有 issue #1318「5060ti 16g 无法启动」→ 只能当备选;LatentSync 官方钉 torch 2.5.1+cu121,在 sm_120 上会 no kernel image → 修嘴这步默认跳过。通用坑
/home/zyw/SageAttention),_fused.so 含 sm_75/80/86/89/90/100/120/120a、_qattn_sm89.so 含 sm_120a——所以问题不是「装不上」,而是「长序列不能用」:上游实测 5060 Ti 上循环 300~630 次(30~65 秒)后 GPU 丢失,另有 _sageattn_int8_fp8_nhd 长序列直接掉驱动的报告——这正好解释本机 H3 的一夜 4 次掉总线。结论:短序列可试,长序列一律 SDPA;SageAttention 3 另有 kijai 亲述的画质劣化。源码编译时必须只写 TORCH_CUDA_ARCH_LIST="12.0"(写成 "9.0;12.0" 会因 wgmma.fence not supported on sm_120 直接失败)。xformers 在 sm120 不可用;FA3 不可能;FA4 不稳。torch 2.11.0+cu130 的 arch list 已含 sm_120,门槛满足。no kernel image is available)——已知名单:Wav2Lip、Ultralight-Digital-Human、MuseTalk 旧档、LatentSync(torch 2.5.1+cu121)、Duix.Avatar 官方镜像;CosyVoice 官方 requirements(torch 2.3.1 只到 sm_90)被 issue #1815 直接点名 RTX 5060 Ti;Duix.Avatar 的 issue #624(2026-09-04,0 回复)在 RTX 5070 上就是这个报错 → 这条链上要用就得自己升 torch 重编。这就是为什么「首选 EchoMimic + CosyVoice3」要先确认版本能跑在 torch≥2.7/cu128 上。tts/base_tts.py:sample_rate=16000、每块 16000//(fps*2)=320 样本 = 20 ms)→ 自定义 TTS 必须输出 16 kHz 单声道 int16 / 20 ms 分块;而 IndexTTS2.5 是 22.05k、OmniVoice/Kokoro/ChatTTS 24k、Fish 44.1k、VoxCPM2/GPT-SoVITS v4 48k,接入前必须重采样。(--tts 合法值含 gpt-sovits/cosyvoice/fishtts/indextts2/qwentts 等 9 个 + omnitts。)bash ~/stop-ridge.sh + lms unload --all。--moe_expert_capacity、--moe_gate_dropout 在 Wan2.2-S2V 中根本不存在(S2V 是单体模型),数据系编造。本目录文件
数字人选型结论-20260922.md(本文,v2 主结论)离线音频驱动数字人模型调研.md(1040 行 / 126 条来源链接,定稿;结构:§0 sm120 总表(含本机 SSH 实拉)→ §1 一分钟结论 → §2 8 模型 16GB 速查总表 → §2.5 16GB 级显卡实测清单 → §3 8 模型逐个深析 → §4 中文 TTS 选型(含 §4.6 落地顺序)→ §5 链路组装与显存排班 → §6 客观质量 → §7 淘汰与未查到)✅实时交互数字人与TTS调研.md(463 行 / 156 表格行;含 5 个 2026 新项目(NanoAvatar / AvatarForcing / SentiAvatar / Realtime-Venus / LingCast 等)、sm_120 根因与 torch 钉版黑名单、LiveTalking 音频接口硬约束、TTS 首选更正为 Qwen3-TTS、MuseTalk/Duix 三处更正)✅3D数字人_一体化平台_授权风险.md(669 行 / 128 条来源 URL / 24 条许可红线)✅本地环境核查-20260922.md(本机硬件/ComfyUI/模型/磁盘实测)_scratch/:调研代理的中间草稿(原始检索记录),非结论,可忽略或删除关键来源
--use_distill)· ComfyUI 节点 · 美团技术博客hf-mirror.com 模型 API 实测数据分级声明:🟢 第三方实测 / 🟡 厂商宣称 / 🔴 未查到。本文所有「实测」均注明来源;厂商宣称一律标注,未与第三方数据混写。