数字人选型结论-20260922.md

数字人选型结论(离线口播 · 单卡 RTX 5060 Ti 16GB · 全本地零成本)2026-09-22

需求:离线口播成片(一张图/一段视频 + 人声音频 → 口型同步视频),必须本机跑、不用云端 API。硬件 = GPU 机 192.168.31.31 单卡 RTX 5060 Ti 16GB(sm120)+ 32GB 内存 + ComfyUI(2026-09-20 版本)+ 磁盘剩 138 GiB。

版本说明:v2(2026-09-22 下午修订)。v1 曾把 Wan2.2-S2V-14B 排为首选;后台深度调研拿到 2026-08 第三方六模型同条件横评(Tight Studio,Modal 固定 commit 部署、同一头像 + 同一段 3.63 秒音频)后,排序被修正——原因见第二节。本文所有关键数字都标了来源等级:🟢 第三方实测 / 🟡 厂商宣称 / 🔴 未查到。


一、修正后的结论

先分清两类模型(最容易选错的地方)

A 类:音频驱动(给现成录音对口型)B 类:联合音视频生成(自己生成语音)
输入图/视频 + 你提供的音频文本(+ 可选参考图)
对你✅ 正是你要的❌ 不能给现成录音对口型
代表FlashHead、EchoMimicV3、LongCat 1.5、Wan2.2-S2V、InfiniteTalk、MuseTalk、LiveAvatardaVinci-MagiHuman、LTX-2.5 / JoyAI-Echo echoVid

按你的场景推荐

路径 B-1:一段已有视频,只想换成另一段录音的嘴型 → MuseTalk 1.5

路径 B-2:一张图 + 录音,全新生成口播视频 → 按下面的三步走

顺序模型为什么是它显存(可跑档)10 秒成片耗时代价
① 首选(但必须先验证 sm120)EchoMimicV3-Flash-pro 1.3B(蚂蚁,Apache-2.0)中文最强:原生 chinese-wav2vec2;官方测试 GPU 列表含 V100 16G;官方 README 明确写「12G VRAM Requirement」(官方量化版 app_mm.py 最低 12 GB);768×512 开 block_offload 仅 6.5 GB(支持到 768×768、8 步、无需 face mask);ComfyUI 节点给 16G 档参数 partial_video_length=976.5 GB(768×512 + block_offload)🟢 10 秒约 14 分钟(官方口径:5 秒 7 分钟)🔴🔴 最大未知数:issue #62 —— RTX 5090 32GB 用官方量化版也跑不通(2025-12-31,0 回复,疑似 sm120) → 必须先小规模验证再谈批量;默认配置实测 33.7 GB 不调参必 OOM;非流式(partial_video_length 分段);画面运动幅度小
② 保底SoulX-FlashHead 1.3B Lite(Soul App,Apache-2.0)唯一被两组独立第三方验证 <16GB 的全功能音频驱动模型;ComfyUI 原生节点;无限时长流式分块🟢 峰值 5.76 GB(权重全 F32,转 fp16 可降到 ~3 GB)🟢 约 1~2 分钟(热启动 0.19 s/块)🔴 画质最弱(两组实测均称「不真实」);仅 512×512
③ 已有视频换嘴型MuseTalk 1.5(腾讯音乐)官方 4GB 卡可跑 fp16;中英日明确;代码 MIT + 模型可商用≤8 GB(5060 Ti 实测 ~3.6 GB)⚠️ 别按「官方实时」理解:LiveTalking 封装的 3080Ti 42 FPS 是外层功劳;官方实现直跑 5060 Ti 实测仅 ≈5.8 FPS(issue #409,361 帧验证),且官方成员确认不支持音频流式(issue #33)🔴 静音测试 0.68 全场最低(不给音频也动嘴);256×256 需外挂 GFPGAN
⚠️ 中期(长视频/多人才考虑)LongCat 1.5(MIT)/InfiniteTalk(Apache-2.0)LongCat:原生多人 + 长视频续写 + 中文口型;InfiniteTalk:ComfyUI 已有官方核心节点,已在 RTX 5060 16GB 上跑通(需升到 torch 2.9.1+cu130)LongCat INT8 15.89 GB 或 GGUF Q4 12.07 GB + block_num=1;InfiniteTalk GGUF Q4 底座 11.34 GB + patch 1.4 GB + block swap 30~40🟡 30 分钟 ~ 2 小时(RTX 5080 16G 实测 640×640 5 秒 = 1300 秒)🔴 16GB 是 Wan 系 14B 的最低门槛(4070 Super 12GB 直接 OOM),本机卡在门槛上、没有余量同时加载两个模型;LongCat 仅 480p、表情缺陷未修;InfiniteTalk 3 分钟视频吃 >120 GB 内存(本机 32GB)→ 必须切 ≤20 秒分段

本机算力标尺(唯一有逐秒实测的模型):Wan2.2-Animate-2 的 distill int8_convrot 部分卸载 ≈ 7.3 GB 显存 / 8.6 GB 内存,49 帧 @480×854 = 126.8 秒(10 步)——但它不吃音频(要驱动视频),只能当"这张卡跑 14B 级视频有多慢"的参照。另注意坑:WanAnimate2Cache 设 device=gpu + dtype=int8 再配 MultiGPU patch 会静默杀进程,必须 device=cpu + dtype=default。

Wan2.2-S2V-14B 的角色降级但不淘汰:

中文口型优先级:LongCat 1.5(Whisper-large-v3,原生中英) ≈ EchoMimicV3 v1.5(专门改善中文) > MuseTalk(中英日明确) > Wan2.2-S2V(英文编码器,中文未验证)。


二、为什么排序被修正:16GB 上「质量与显存严格成反比」

第三方横评(🟢 Tight Studio,2026-08-23)同一条件实测:

模型峰值 VRAM3.63 秒音频耗时输出规格
LiveAvatar(阿里)61,401 MiB181.44 s(最快)384×704 @25fps
Wan2.2-S2V-14B58,681 MiB780.29 s(最慢)512×896 @16fps
SoulX-FlashTalk-14B57,805 MiB331.93 s416×720 @25fps
LongCat-Video-Avatar 1.546,827 MiB233.08 s480×832 @25fps
EchoMimicV3-Flash33,726 MiB251.94 s480×848 @25fps
SoulX-FlashHead Lite5,763 MiB235.31 s(首块 155.7 s 为编译,之后 0.19 s/块)512×512 @25fps

横评原文:「16 GB 以下:SoulX-FlashHead Lite 是经过验证的唯一一款完全适配的全功能生成器。」

画质的主观排序则是:LiveAvatar(最清晰)> EchoMimicV3-Flash(最佳平衡)> LongCat 1.5(最有表现力)> FlashHead(最不逼真)。 → 能跑的画质弱,画质好的跑不动。这就是 16GB 的现实,任何「一张图出电影级数字人」的说法在这张卡上都不成立。


三、Wan2.2-S2V 量化路线的具体数据(当扩展件用时)

来源:HF 模型卡 + 社区 GGUF 实测体积(2026-09-22)。

项目事实
许可证Apache-2.0(可商用)
架构14B 单体(不是 T2V/I2V 的 27B MoE 双专家)
官方单卡门槛generate.py 注释 ≥80GB VRAM,第三方 H200 实测峰值 58.7 GB
GGUF 档(calcuis/wan-s2v-gguf,含完整工作流 JSON)Q8_0 18.27 / Q6_K 15.10 / Q4_K_M 12.91 / IQ4_XS 11.32 / Q2_K 8.86 GiB
配套文本编码器三选一(cow-umt5xxl Q2_K 3.67 GiB 等)、wav2vec2...f16.gguf 0.59 GiB、VAE 0.254 GiB
本机状态ComfyUI 2026-09-20 + ComfyUI-GGUF 已装;models/audio_encoders/ 为空,需补
长视频官方工作流 Video S2V Extend 每片 77 帧 ≈ 4.81 秒 @16fps,按 音频秒数 × 16 ÷ 77 算节点数
生态升级件Live Avatar(阿里 Quark+中科大,ECCV 2026 Spotlight,Apache-2.0)只是它上面的 1.26 GiB LoRA(4 步、无限长、20FPS@5×H800);官方单卡离线推理尚未发布,可试挂 LoRA,属实验性
InfiniteTalk(给已有视频配音、无限时长)ComfyUI 适配权重仅 2.53 GiB(需 Wan2.1-14B 底模);但 kijai wrapper 有专门针对 RTX 5060 的求助 issue #1875、以及 #1185「渲染极慢」;官方自曝 I2V 超过 1 分钟色彩偏移明显
⚠️ LTX-2.5(本机已有权重+audio VAE)属 B 类(模型自生成语音),不接受你提供的录音;社区有 lipsync 条件化工作流但未验证能稳定吃外部音频 → 先别指望它当主力,只适合「文本→数字人自说自话」

四、本地完整链路与配音

中文文案 →(本地 TTS)→ 人声 WAV(mono / 44.1~48kHz / 干净无 BGM)
   →(可选:人声分离去 BGM)→(A 类模型对口型)→ 口型视频
      →(可选:VideoHelperSuite 拼接 / RTX VSR 放大 / FaceRefine 修脸)→ 落盘 + 归档相册

4.1 中文配音(文案 → 人声)本地 TTS 选型(hf-mirror 下载量/点赞实测)

模型许可证语言关键实测定位
GPT-SoVITS v2ProPlusMIT(无附加条件)中文README 明确列出测试通过环境含 PyTorch 2.7.0/CUDA 12.8、2.8.0dev/CUDA 12.8;RTF 0.028 @4060 Ti → 10 秒音频 ≈0.28 秒(全表最快)✅ 离线链路首选(Phase 1)——sm_120 最友好、速度压倒性;坑:无情感控制、🟡 无第三方中文 CER/SIM 数据
IndexTTS-2.5(2026-08-10 新版)bilibili 自定义协议,免版税、普通规模免费商用(仅 >1 亿 MAU 或 >10 亿 RMB 年收入需单独授权)zh / en8 维情感向量(同级唯一)、小数读法 100%(唯一满分)Phase 2 上情感;⚠️ 速度争议极大(官方 RTF 0.2065@4090 vs 5060 Ti 实测 2.92)+ issue #295 GPU 检测失败(与 Blackwell 相关)
Qwen3-TTS(0.6B-CustomVoice / 1.7B-Base)Apache-2.0(repo 13k⭐)中文母语级388 万下载、两套 ComfyUI 节点;第三方 VoicePing 称 "the strongest balanced model in this benchmark";官方首包 97 ms、本次唯一「sm_120 零 issue」的 TTSPhase 3 追质量;⚠️ 中文长数字串 30/30 全失败(0%)、必须锁 transformers==4.57.3
LongCat-AudioDiT(美团)MIT中文中文相似度全场最高(SIM 81.8 / CER 1.09),非流式——离线口播不吃亏追中文相似度可选;⚠️ 待验:3.83B F32 ≈ 15 GB+ 能否进 16GB
VoxCPM2(面壁+清华,2B)Apache-2.0中文中文 CER 4.4% 全表最低追字准可选
Fun-CosyVoice3-0.5B-2512Apache-2.0(代码+权重)11 语 + 18 种中文方言中文相似度 CV3-Eval 80.01 最高⚠️ 降为「备选,须先验证能否启动」:issue #1318「5060ti 16g 运行 CosyVoice2 无法启动」 + #1815 sm_120 兼容

🔴🔴 最容易被忽略、后果最严重的一条通用规则:没有任何中文 TTS 能可靠读长数字串。 实测:Qwen3-TTS 标识符 0%、IndexTTS-2.5 40%、CosyVoice3 标识符 90% 但货币项仅 46.7%,且错误多是把金额本身改掉。→ 必须在 pipeline 预处理里把「数字 / 金额 / 编号 / 日期」展开成汉字(这一步做不做,决定口播成品是否可信),展开后再送 TTS。

TTS 落地顺序(写进 §4.6):Phase 1 GPT-SoVITS 跑通链路 → Phase 2 IndexTTS-2.5 上情感 → Phase 3 Qwen3-TTS / VoxCPM2 追质量。全程:参考音频 ≤3.5 秒、不开 sage_attn、torch 用 cu128+、与数字人模型串行执行(别同时驻留)。

⚠️ 许可红线(先前的说法要更正):IndexTTS 不是 Apache-2.0,是 bilibili 自定义协议(普通规模可商用);F5-TTS 权重 CC-BY-NC、Spark-TTS 权重 CC-BY-NC-SA(GitHub 写 Apache,自相矛盾)、Fish-Speech 商用需单独授权、ChatTTS 是 AGPL+CC-BY-NC 且官方故意加噪降质、Higgs Audio v3 非商用、VibeVoice 已被微软下架 → 全部出局。教训:不要信 HF 镜像卡的 license 字段,要读仓库 LICENSE 原文。 ⚠️ 指标口径警告(4 个实例):Qwen3-TTS 自报 0.77 vs 第三方 1.22~1.33(1.6×);Fish S2 Pro 0.54 vs 3.62(6.7×);OmniVoice 0.84 vs 3.41(4×);GPT-SoVITS 1.6 vs 7.34(4.6×)。→ 引用必须带榜单名,最终用 seed-tts-eval 自测。

音频预处理是第一杀手:先做人声分离(干净人声轨的唇形质量远好于混 BGM);mono + 44.1/48 kHz;FlashHead 官方要求参考图正脸、居中、上半身,音频最好 16 kHz。 本机现成后处理:Nvidia_RTX_Nodes_ComfyUI(RTX VSR)、ComfyUI-H3-FaceRefine、comfyui-VideoHelperSuite。


五、淘汰清单

方案淘汰原因
LiveAvatar / SoulX-FlashTalk-14B / Wan2.2-Animate-14B单卡需求 61~64 GB(Animate INT8 17.15 GiB 已超 16GB);LiveAvatar 单卡离线推理未发布
FantasyTalking有直接的 16GB 失败证据:RTX 5070 Ti 16GB 明确失败(issue 标题就是 "Doesn't work with 16GB VRAM")、RTX 5090 32GB 最小设置 OOM;官方明说必须装 flash_attn 否则结果错误(sm120 大坑);A800 40G 上 30 秒视频=1 小时、1 分钟音频>19 小时;官方最低档 20 GB / 32.8 秒每迭代;第三方论文实测唇形同步指标最差(Sync-C 1.11 vs 其他 4~6)
HunyuanVideo-Avatar从「能跑」下调为「本机偏不可行」:所有成功案例都带 96 / 97 / 192 GB 系统内存(int8 权重会被 pin 进内存约 12.8 GB,本机只有 32GB);V100 32GB + 64GB RAM 在 Wan2GP 里仍 OOM;官方 ComfyUI 支持一年多未落地(Open-source Plan 未打勾);社区节点门槛写 >24G;许可证非标准 OSI
daVinci-MagiHuman / LTX-2.5 echoVidB 类:自己生成语音,不接受外部录音;社区 fp8 分支作者自述「跑不起来、EXPERIMENTAL」
SonicCC BY-NC-SA 4.0 不可商用(官方要求商用走腾讯云);仅测于 32G 单卡
OmniAvatar-14BHF 仓库只剩 1.15 GiB 的 pytorch_model.pt,权重不完整;且官方称需 64GB 内存
HunyuanPortrait根本不是音频驱动——它是「参考图 + 驱动视频」驱动,与口播需求不匹配
MoCha(Meta)Meta 版从未开源,无权重可用
Bernini-R-S2V作者自己写明「不是 SOTA audio-to-video」;双专家 int8 各 17.72 GiB;音频上限 9~15 秒
Chanjing-Avatar(蝉镜)2026-08 才放出,仅适配器权重(14B 目录 1.15 GiB,须配 Wan2.1 底座),下载量 16~90,无第三方实测
3D / 3DGS 数字人开源 3DGS 说话头几乎全非商用(清华许可禁商用、GaussianAvatars/SplattingAvatar 为 CC-BY-NC-SA),且叠了 FLAME/BFM/SMPL 非商用底座;仓库普遍锁 py3.7 + torch1.12 + CUDA11,与 sm_120 不兼容。详见 3D数字人_一体化平台_授权风险.md
Wan-Animate-2 / Wan2.2-Animate视频驱动(动作迁移),不是音频驱动;且 INT8 15.51 / 17.15 GiB 都很紧

六、许可证红线(摘要,详见 3D数字人_一体化平台_授权风险.md)

  1. Wav2Lip 权重严禁商用——却常被默认打包进 Linly-Talker / SadTalker / AigcPanel 流程;要用就固定选 MuseTalk 或 LatentSync。
  2. Duix.Avatar(原 HeyGem.ai) 自定义 DUIX.COM Community License:LICENSE 原文 MAU>1000 须商业授权,README 却写 10 万,冲突时按 LICENSE 保守评估;另需 "Built with DUIX.COM" 署名。
  3. LivePortrait 是 MIT,但其 InsightFace 检测模型非商用 → 不替换检测器不能商用。
  4. 腾讯混元系(Hunyuan3D 2.x / HunyuanVideo-Avatar / HunyuanWorld) 社区许可排除欧盟、英国、韩国,且禁止用其输出改进其他模型。
  5. 2026 年许可系统性收紧:Qwen3.8-Max 弃用 Apache-2.0(5000 万美元收入门槛);Kimi K3 年收入 2000 万美元触发分成 → 逐仓库读 LICENSE 原文。
  6. 合规(中国):最高法《关于依法审理涉人工智能纠纷案件的意见》(2026-09-07)第 4 条——未经同意用他人姓名/肖像生成可识别虚拟数字形象侵害肖像权,未经同意用他人声音合成人声侵害声音权益;发布须按《标识办法》加显式+隐式 AI 标识。
  7. 一体化平台:口播视频 → AigcPanel(Apache-2.0,Electron 桌面 App,零 Docker/零编译,中文一等公民);实时对话 → OpenAvatarChat(Apache-2.0,LiteAvatar MIT + MuseTalk MIT + CosyVoice Apache-2.0,LiteAvatar 路线仅 4GB 显存,要求 CUDA≥12.8 正合 Blackwell)。

七、备用路线:实时对话数字人(本次不需要,存档备查)

结论先放这:14B 级「实时」数字人全部与 16GB 无缘——SoulX-FlashTalk-14B 单卡 >64GB(--cpu_offload 后 40GB)、LiveAvatar 61.4GB、Wan2.2-S2V 58.7GB、LongCat 1.5 46.8GB,与量化无关,它们依赖多卡序列并行。16GB 上能实时的只有小模型。详见 实时交互数字人与TTS调研.md。

方案组成显存/延迟坑
口径最优先LiveTalking + vLLM-Omni(Qwen3-TTS-0.6B) + 本地 9B LLMwav2lip256 ~200MB(或 musetalk 3.9GB)+ TTS + LLM ≈ 10.5~14 GB;TTS 首包 ~130ms(作者在 3090 实测🟢)⚠️ vLLM-Omni 实测 0.6B 竟占 ~13GB → 必须下调 --gpu-memory-utilization(0.35~0.45);musetalk 必须确认版本含 2026-08-20 PR #612(缺 @torch.no_grad() 的历史 OOM bug,17.62GB → 修复后 3.9GB)
画质优先OpenAvatarChat v0.6.0 + SoulX-FlashHead-1.3B + CosyVoice3FlashHead Lite 峰值 5,763 MiB、96 FPS🟡、无限时长流式需 flash-attn(sm_120 无预编译 wheel)+ OpenAvatarChat 钉 torch 2.4.1+cu124
流式 TTS 首选Fun-CosyVoice3-0.5B-2512(Apache-2.0 代码+权重)官方双向流式(称 150ms),第三方 CV3-Eval 中文相似度 80.01 全表最高备选 IndexTTS-2.5(中文 CER 0.93~1.21%、~6GB)但没有流式;MOSS-TTS-Realtime(Apache-2.0,TTFB 180ms)
可关注Ditto-talkinghead(蚂蚁,Apache-2.0,45 FPS 流式,权重 ~2.4GB)—🔴 钉 tensorrt==8.6.1,不支持 sm_120
非商用可优先试NanoAvatar(wpydcr/NanoAvatar,2026-09)显存 834 MiB(Lite 700 MiB)、4090 量化版 333 FPS / 首帧 18ms、官方称流式 LLM+TTS 下 ~0.3 秒开始说话;要求 torch==2.10.0+cu128(原生 sm_120)、不依赖 SageAttention/flash-attn → sm_120 风险最低⚠️ 代码 MIT 但口型权重 CC BY-NC 4.0 → 不可商用;仓库很新(15⭐),无第三方复现
3D 动作路线SentiAvatar(2026-04,453⭐,~2.9GB)输出 BVH 动作,不碰 diffusers/attention 内核 → sm_120 最安全⚠️ CC BY-NC-SA,不可商用
许可警告OmniVoice 代码 Apache-2.0 但权重 CC-BY-NC(不可商用);Fish Audio S2 Pro 自研 Research License(企业自用也算商用);ChatTTS AGPL+CC-BY-NC;Fay 是 GPL-3.0(README 自称「商用免责」不成立);Linly-Talker 主仓 2026-02 后停更

顺带一个离线也能用的优化:SoulX-FlashHead Lite 权重 843 个张量全是 F32(6.107 GB)→ 转 fp16 只剩约 3 GB,16GB 上更宽松。


八、本机落地顺序与必须知道的坑

建议顺序(风险从低到高)

  1. 装 ComfyUI_EchoMimic + 一键脚本(Ubuntu/CUDA 13 版)→ 首选:768×512、开 block_offload(官方口径 6.5 GB)、ComfyUI 节点 16G 档参数 partial_video_length=97。但先做「冒烟测试」:只跑 3~5 秒片段 + 480p(官方口径 5 秒 7 分钟),确认 sm120 上不报 no kernel image / 不崩(issue #62:5090 32GB 用官方量化版都没跑通,本机风险未知)。通过后再放大到 10 秒/768。
  2. 若 EchoMimic 压不进 16GB → 退到 ComfyUI_RH_FlashHead(Lite 档、512×512、峰值实测 5.76 GB),保底一定跑得起来,代价是画质弱。
  3. 需要给已有视频换嘴型 → 上 MuseTalk 1.5(4GB 显存即可,但官方实现直跑 5060 Ti 只有 ≈5.8 FPS,且不支持音频流式;要实时得靠 LiveTalking 那层封装)。
  4. 中期再评估 LongCat 1.5 INT8(int8_sharded + block_num + device=cpu offload,走 sdpa;注意 480p/44 秒约要 2 小时)。
  5. 长视频/扩展件最后再考虑 Wan2.2-S2V GGUF Q4 / InfiniteTalk。

端到端推荐链路(全程 MIT/Apache-2.0/免费商用,分时复用显存) 文案预处理(数字/金额/编号 → 汉字展开)→ GPT-SoVITS v2ProPlus 配音 → EchoMimicV3-Flash-pro 出片 → 约 14 分钟 / 10 秒成片(其中配音约 0.3 秒、出片约 14 分钟);长音频一律切成 ≤20 秒分段,出片后拼接。

通用坑

  1. SageAttention:本机其实装了 sm_120 内核,但「长序列必掉 GPU」。SSH 实拉确认:本机 SageAttention 2.2.0 是源码自建(/home/zyw/SageAttention),_fused.so 含 sm_75/80/86/89/90/100/120/120a、_qattn_sm89.so 含 sm_120a——所以问题不是「装不上」,而是「长序列不能用」:上游实测 5060 Ti 上循环 300~630 次(30~65 秒)后 GPU 丢失,另有 _sageattn_int8_fp8_nhd 长序列直接掉驱动的报告——这正好解释本机 H3 的一夜 4 次掉总线。结论:短序列可试,长序列一律 SDPA;SageAttention 3 另有 kijai 亲述的画质劣化。源码编译时必须只写 TORCH_CUDA_ARCH_LIST="12.0"(写成 "9.0;12.0" 会因 wgmma.fence not supported on sm_120 直接失败)。xformers 在 sm120 不可用;FA3 不可能;FA4 不稳。
  2. sm_120 的根因是内核缺失,不是显存:消费级 Blackwell(sm_120)只有 MMAv2,没有 tcgen05 / WGMMA / TMEM,所有为 sm_100/sm_120a 或 Hopper sm_90a 写的加速内核在 5060 Ti 上无处可跑。门槛:torch ≥2.7 + cu128、onnxruntime-gpu ≥1.27、FA3/FA4 对 sm_120 完全无路径、SageAttention 官方包实际回退 SM89 内核、xformers 需 PR #1254 之后。本机 torch 2.11.0+cu130 的 arch list 已含 sm_120,门槛满足。
  3. 🔴 凡是把 torch 钉在 <2.7 或 cu117/cu121/cu124 的项目,照 README 装必挂(症状:no kernel image is available)——已知名单:Wav2Lip、Ultralight-Digital-Human、MuseTalk 旧档、LatentSync(torch 2.5.1+cu121)、Duix.Avatar 官方镜像;CosyVoice 官方 requirements(torch 2.3.1 只到 sm_90)被 issue #1815 直接点名 RTX 5060 Ti;Duix.Avatar 的 issue #624(2026-09-04,0 回复)在 RTX 5070 上就是这个报错 → 这条链上要用就得自己升 torch 重编。这就是为什么「首选 EchoMimic + CosyVoice3」要先确认版本能跑在 torch≥2.7/cu128 上。
  4. LiveTalking 的音频接口是硬编码的(源码 tts/base_tts.py:sample_rate=16000、每块 16000//(fps*2)=320 样本 = 20 ms)→ 自定义 TTS 必须输出 16 kHz 单声道 int16 / 20 ms 分块;而 IndexTTS2.5 是 22.05k、OmniVoice/Kokoro/ChatTTS 24k、Fish 44.1k、VoxCPM2/GPT-SoVITS v4 48k,接入前必须重采样。(--tts 合法值含 gpt-sovits/cosyvoice/fishtts/indextts2/qwentts 等 9 个 + omnitts。)
  5. 跑视频前先清显存:bash ~/stop-ridge.sh + lms unload --all。
  6. 32GB 内存比 16GB 显存更容易先爆:InfiniteTalk 3 分钟视频需 >120 GB 内存、LongCat 720p 需 35.3 GB RAM → 必须分段生成、及时落盘,别指望一口气跑完长视频。
  7. 磁盘只剩 138 GiB(88% 已用):EchoMimic 约 20 GiB、FlashHead 约 8 GiB、LongCat int8 约 20 GiB、Wan S2V GGUF 约 15 GiB——别一次全下。
  8. 别信网上流传的「S2V 显存/耗时表」:抓到的 CSDN 类文章给出的 --moe_expert_capacity、--moe_gate_dropout 在 Wan2.2-S2V 中根本不存在(S2V 是单体模型),数据系编造。
  9. 未在本机验证的事:EchoMimic / FlashHead 均无 Ubuntu + sm_120 实机报告,消费卡上的延迟与驱动框架支持仍是空白。

九、配套文件与来源

本目录文件

关键来源

数据分级声明:🟢 第三方实测 / 🟡 厂商宣称 / 🔴 未查到。本文所有「实测」均注明来源;厂商宣称一律标注,未与第三方数据混写。

下载此文件