离线音频驱动数字人模型调研.md

离线音频驱动数字人口播链路选型(2026-09)

场景与硬约束(已收窄)

目标场景:离线口播 / 说话人视频。输入 一张图(或一小段视频)+ 一段中文音频,输出口型同步成片。 不需要实时直播、实时对话、流式交互。

硬约束:

  • 必须完全本地、免费、离线,不接入任何云端 API
  • 单张 RTX 5060 Ti 16GB(Blackwell sm_120)+ 32GB 内存 + Ubuntu + ComfyUI

调研时点:2026-09-22

数据分级:🟢 第三方实测 | 🟡 厂商/论文宣称 | 🟨 中文社区个案 | 🔴 未查到(不编造)

本版本相对于初稿的变化:按新约束收窄重点到 8 个模型(Wan2.2-S2V、LongCat-Video-Avatar 1.5、InfiniteTalk、OmniAvatar、HunyuanVideo-Avatar、Wan-Animate-2、EchoMimic V3、FantasyTalking),为每个模型补齐「显存占用 + 生成速度 + 16GB 能否跑 + 要什么量化 + N 秒视频要多久」,新增 sm120/Blackwell 兼容性总表(§0)与 中文 TTS 配音选型(§4)。


0. 🔴 先读:sm120 / Blackwell 兼容性总表(这比"显存够不够"更容易让项目失败)

RTX 5060 Ti 是 Blackwell / sm_120(Compute Capability 12.0)。2025 年编译的绝大多数加速库没有 sm_120 内核,装上去不是报错就是静默崩。本机 2026-09-14 已实测确认过一次 GPU 掉总线(4 次全部来自 SageAttention 路径)。

0.0 ✅ 本机环境实测(2026-09-22 实拉,非推测)

GPU      : NVIDIA GeForce RTX 5060 Ti   capability (12, 0)  → sm_120
torch    : 2.11.0+cu130
CUDA     : 13.0
arch_list: ['sm_75','sm_80','sm_86','sm_90','sm_100','sm_120']   ← 含 sm_120 ✅
triton   : 3.6.0
SageAttn : 2.2.0(源码自建,装于 /home/zyw/SageAttention)
  _fused.so      → sm_75 sm_80 sm_86 sm_89 sm_90 sm_100 sm_120 sm_120a  ← 含 sm_120 ✅
  _qattn_sm89.so → sm_120a                                               ← 含 sm_120 ✅

结论:本机 torch 与 SageAttention 的 sm_120 编译问题已经解决(不是"缺内核",源码构建时已带上 12.0)。但——woct0rdho 上游实测 RTX 5060 Ti 上循环调用 SageAttention 约 300~630 次(30~65 秒)后会 GPU 丢失(woct0rdho/SageAttention #103),且有报告 _sageattn_int8_fp8_nhd 长序列在 5060 Ti 上直接掉驱动(GPU is lost,需重启)而同条件原生 PyTorch 注意力正常(#391)。这正好解释本机 H3 长序列掉总线。 → 所以本机的正确策略不是"装不了",而是"长序列别用":短视频可试 SageAttention 2.2.0,长序列/高分辨率一律 SDPA。

0.1 加速库兼容性总表

库sm_120 支持状况本机结论来源
PyTorch + CUDA50 系最低 torch ≥2.7 + cu128;社区与 kijai 一致建议 torch 2.9.1 + CUDA 13.0(RTX 5060 报 CUDA error: no kernel image is available,换 torch 2.9.1+cu130 后"完美运行")✅ 本机 torch 2.11.0+cu130 已超出要求🟢 kijai #1875 |本机实拉
tritonBlackwell 需 triton ≥3.3 + torch ≥2.7 + CUDA ≥12.8;版本须与 torch 配对(2.9.x↔3.5.x;2.10.x↔3.6.x)✅ 本机 triton 3.6.0🟢 Rogala/AI_Attention
SageAttention 2.2.0⚠️ 官方/Comfy-Org 预编译 wheel 多数缺 sm120:sageattention-2.2.0+cu130torch2.10 的 _qattn_sm89.pyd 只标 sm_80/sm_90a,遇到 GQA 32:8 / head_dim 128 / L=4096 直接 no kernel image;只有 packages/sageattention.yml 里 cu130/torch2.9 与 torch2.11 两条矩阵带 12.0✅ 本机是源码自建且含 sm_120 cubin;⚠️ 但长序列会 GPU 丢失(见 §0.0)🟢 Comfy-Org/wheels #22 |本机 strings 实测
SageAttention 源码编译🔴 TORCH_CUDA_ARCH_LIST="9.0;12.0" 会编译失败(wgmma.fence not supported on sm_120)→ 必须只写 12.0ℹ️ 记下来:以后重编只写 12.0🟢 SageAttention #291(维护者 woct0rdho 亲自回复)
SageAttention 3.x🔴 sm120 上不可信:① DGX Spark 上 SA3 出马赛克伪影且不比 2.2 快(#321)② RTX 5060 Ti + sa3.0 在 Wan wrapper 复现同样伪影,需强制 per_block_mean 才修好 ③ sm120 上 sageattn_qk_int8_pv_fp8_cuda 在 CUDA Graph 重放时静默算错(#392)❌ 禁用 sage3。kijai 口径:「不要把 sage3 用在 Wan 视频上,画质损害很大而速度提升有限,就用 sageattn 2.2.0」🟢 kijai #1875 · SageAttention #321
2026-09-01 上游新进展Comfy-Org comfy-kitchen-sageattention(#147/#148)已产出官方托管 SA2.2.0 wheel(Py3.12 / torch 2.13 / CUDA 13.0),_fused/_qattn_sm80/_qattn_sm89 均含 SM120 cubin,并在 RTX PRO 6000 Blackwell 上 smoke 通过⚠️ 锁 torch 2.13,与本机 2.11 不匹配 → 暂不用;等升 torch 或继续用自建版🟢 comfy-kitchen #147
FlashAttention FA2默认 arch list 不含 sm_120,必须显式加 12.0 重编;有免编译成功组合:flash-attn 2.8.0 + Py3.10 + CUDA 12.8 + torch 2.7.1⚠️ 装不上就用 SDPA(ComfyUI 默认回退),速度损失约 20~40%🟢 flash-attention #2535 · #2016
FlashAttention FA3🔴 在 sm120 上不可能:依赖 sm90a 的 wgmma 指令,sm120 不支持("只有企业级 Blackwell 支持");相关 issue 从 2025-04 开到 2026 仍无支持(#1757/#1810/#1825/#1609/#1638/#1785)❌ 不要碰 FA3🟢 上述 issue
FlashAttention FA4(4.0.0b*)⚠️ 已有 FlashAttentionForwardSm120 但 2026 年仍不稳:RTX 5060 Ti 前向 kernel 运行期编译失败(#2453);5090 上比 FA2 慢约 5%;sm_120 varlen ≥4 段非法内存访问(#2860)❌ 不要碰 FA4🟢 上述 issue
xFormers🔴 sm120 上不可用:0.0.32 在 Blackwell 消费卡报 CUDA error: invalid argument(疑因 FA3 实现不支持 sm120,#1323);50 系整体报 kernel 架构不兼容(#1342);0.0.34 宣称支持 torch≥2.10 但实际装不上(#1374)❌ 从依赖里直接划掉,一律用 SDPA🟢 上述 issue
torchcodec / torchvision🔴 LongCat issue #141:新版 torchvision 用 torchcodec 取代了 write_video(),导致仓库里大量代码跑不起来⚠️ 跑 LongCat 官方脚本时注意🟢 LongCat #141

0.1.1 逐模型 × 依赖速查(本机可执行版)

模型SageAttentionFlashAttentiontorch/CUDAxformers
Wan2.2-S2VSA2 2.2.0(本机自建版含 sm120);禁 SA3不用(FA2 需自编 12.0;FA3/FA4 不可靠)≥2.9.1 + cu130 ✅ 已满足❌
LongCat-Avatar 1.5未查到明确结论;节点内 sageattn_3 是坏的🟢 官方 issue #141 明确:Blackwell 禁用 FA2torch 2.11 + CUDA 12.8+ ✅;⚠️ 新版 torchvision 会打断仓库代码❌
InfiniteTalk社区多走 SDPA;SA2 须含 sm120不建议≥2.9.1 + cu130(#1875 实证可跑通)❌
OmniAvatar无记录官方依赖 flash-attn(需自编);有"无 FA 多卡"issue #42常规❌
HunyuanVideo-Avatar节点当前无(#22 称"以后也许支持")官方锁 flash-attn 2.6.3,编译失败是高频 issue(#34/#126/#40)→ 优先 SDPA官方代码是 torch 2.4–2.6 时代,需手动升❌
Wan2.2-Animate-2同 Wan 系同 Wan 系同 Wan 系❌
EchoMimic V3节点未接无官方 Py3.10 / CUDA ≥12.1❌
FantasyTalking有用户请求(#69)未实现🔴 官方明说必须装 flash_attn,否则结果错误(#13 回复) → sm120 上是大坑—❌

0.2 本机 ComfyUI 稳定启动参数(勿加 sage attention)

cd /home/zyw/ComfyUI && setsid nohup env \
  PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:512,expandable_segments:True \
  CUDA_VISIBLE_DEVICES=0 OMP_NUM_THREADS=4 \
  venv/bin/python main.py --listen 0.0.0.0 --port 8189 \
  --lowvram --force-fp16 --reserve-vram 1.0 --fast-disk --cache-lru 20 \
  --preview-method none > /home/zyw/comfyui_8189_opt.log 2>&1 < /dev/null &

关键:--force-fp16 --reserve-vram 1.0;默认不加 --use-sage-attention。若某个模型确认收益明显且序列不长,可临时开启并盯住日志;一旦出现 GPU 掉总线立刻回退 SDPA。


1. 一分钟结论

1.1 16GB 单卡能跑什么(8 个重点模型)

模型16GB 能否跑要什么量化10 秒视频大约要多久一句话
EchoMimicV3-Flash-pro✅ 能,官方验证过 16G(V100) + 官方实测耗时无重量化;768×512 + block_offload🟢 官方口径:5 秒视频 7 分钟(量化版,12GB 显存)→ 10 秒约 14 分钟首选:原生中文 + 官方 16G 档位 + 官方实测耗时 + Apache-2.0
Wan2.2-Animate-2✅ 能(本机型唯一有逐秒实测)INT8_convrot 部分卸载(7.3GB 显存)/ GGUF Q4_K_M 10.56 GiB🟢 实测:49 帧 @480×854 = 126.8 秒(10 步)→ 按 25fps 算 49 帧≈2 秒,10 秒约 10 分钟❌ 但它是"图+驱动视频",不吃音频 → 场景不匹配
InfiniteTalk✅ 能(5080 16GB 实测 + 5060 16GB 跑通)GGUF Q4_K_M 底座(11.34GB) + patch Q4(1.4GB) + block swap 30~40🟢 5080 16GB:640×640 5 秒 = 1300 秒 → 10 秒约 43 分钟ComfyUI 有官方核心节点;但 3 分钟视频吃 >120GB 内存
LongCat-Video-Avatar 1.5✅ 能(3060 12GB GGUF Q4 已跑通)INT8 14.81 GiB 或 GGUF Q4_K_M 11.24~12.07 GiB + block_num=1 + 全 offload CPU🟢 480p 44 秒视频 ≈ 2 小时(GB10)→ 10 秒约 27 分钟起能力最全(MIT/多人/长视频)但有未修缺陷
HunyuanVideo-Avatar⚠️ 推断偏不可行Wan2GP int8 13.41GB / GGUF Q4 7.42 GiB🟢 5090 未优化 30 步≈30 分钟;3090 112.32 s/it成功案例全带 96–192GB RAM,本机 32GB 大概率不够;许可排除 EU/UK/KR
Wan2.2-S2V-14B❌ 不推荐理论:GGUF Q4_K_M 12.91 GiB + T5 全 CPU🟡 L40S 48GB:5 秒 ≈20 分钟;4×64GB:720P 10 秒 ≈1 小时官方门槛 ≥80GB;失败模式 = 走共享内存后慢到必须中止
OmniAvatar-14B❌ 不可用无任何官方/社区量化档🟢 H100 SXM:3 秒音频/25 步 >7 分钟官方称需 64GB 内存;本机 32GB 不够
FantasyTalking❌ 不可行(有 5070 Ti 16GB 失败报告)社区 GGUF 明确失败并归档🟢 A800 40G:30 秒视频 = 1 小时;1 分钟音频 >19 小时官方最低档 20GB;且官方要求必须装 flash_attn(sm120 大坑)

1.2 完整离线口播链路(推荐方案)

中文文案
   ↓  ① TTS 配音(本机 16GB 内,见 §4)
GPT-SoVITS v2ProPlus       ← MIT|RTF 0.028(4060 Ti)|sm_120 最不易踩坑|5s 克隆/few-shot 微调
   (升级档:IndexTTS-2.5 八维情感控制 / Qwen3-TTS-1.7B 质量上限)
   ↓  ② 音频驱动口型(本机 16GB 内,见 §3)
EchoMimicV3-Flash-pro      ← Apache-2.0|transformer 仅 3.47GiB|768×512 + block_offload
   ↓  ③(可选)口型精修
LatentSync 1.5(最低 8GB,官方明示改善中文)
   ↓
成片(25fps,口型同步)

三步全在本机 16GB 内、全部 Apache-2.0、总权重 < 12 GiB(不含可选的 LatentSync)。 两个模型分时复用显存即可(本机 ComfyUI 已是 --lowvram 档,TTS 只占 ~2GB)。

1.3 三条必须记住的结论

  1. 32GB 内存比 16GB 显存更容易先爆——三个已证实案例:InfiniteTalk 3 分钟视频需 >120GB 内存;OmniAvatar 官方称需 64GB 内存;LongCat 1.5 的 720p 实测 35.3GB RAM。→ 长音频必须切段(建议每段 ≤20 秒)落盘再续接。
  2. sm120 上先解决软件栈,再谈模型选择——torch ≥2.9.1 + CUDA ≥13.0、只装标注 sm120 的 SageAttention wheel、禁用 SageAttention 3、装不上 flash-attn 就用 SDPA。
  3. 8 个模型里真正"官方+第三方双证据支持 16GB"的只有 EchoMimicV3 和(近似)SoulX-FlashHead;其余要么靠第三方量化硬压、要么根本没有成功案例。

2. 8 个重点模型 16GB 速查总表(含各精度体积)

体积口径:官方原始权重与量化档分别列出。「显存」列给的是实测/社区报告的峰值占用,「速度」列必须与 GPU 型号一起看。

模型参数量bf16/fp16 权重fp8 / INT8GGUF实测峰值显存实测速度(GPU+分辨率)16GB 判定
EchoMimicV3-Flash-pro1.3Btransformer 3.47 GiB无无(不需要)🟢 默认 768 档 33,726 MiB(L40S)/🟡 官方低显存档 6.5 GB @768×512/🟢 官方量化档另测到 43,434 MiB(talking head)、63,248 MiB(half body)🟢 官方量化版(app_mm.py):最低 12GB 显存,5 秒视频 7 分钟(作者本人回复)/L40S 3.63s 音频 251.94 s/🟢 未量化 10s 音频 ≈12 分钟(4090)✅ 官方测试 GPU 含 V100 16G;⚠️ 但有 RTX 5090 量化版跑不通的未回复 issue(疑似 sm120)
InfiniteTalkpatch 2.487B + 底座 Wan2.1-14B(14.289B DiT)patch 9.948 GB(fp32)/Kijai fp16 5.125 GB/comfyui/ 版 2.53 GiBKijai fp8_scaled 2.714 GB;全模型 fp8/int8 档各 19.5 GiBpatch Q4_K_M 1.403 / Q6_K 2.044 / Q8 2.646 GB;底座 Q4_K_M 11.34 / Q5_K_M 12.74 / Q8_0 18.14 GB;fp8 底座 16.64 GB🟢 RTX 5080 16GB 可跑;🟢 L40 48GB 28 GB🟢 RTX 5080 16GB:640×640 5 秒 = 1300 秒(20 block swap+SA+compile)/🟢 4090 未量化 10s/480p = 40 分钟/🟢 4090 + FusionX 8步+TeaCache 10s ≈ 15 分钟(2026-09)/🟢 3090 832×480 ≈30 s/秒视频/🟢 8GB 只能跑 81 帧✅ 可跑(5080 16GB 实测 + RTX 5060 16GB 在 torch 2.9.1+cu130 后跑通);⚠️ 4070 Super 12GB OOM
LongCat-Video-Avatar 1.513.6B29.5 GiB(6 shard)官方 INT8 14.81 GiB(4 shard)社区 Q8 17.77 / Q6 14.42 / Q4_K_M 11.24~12.07 / Q3_K_M 9.22 / Q2_K 7.77 GiB🟢 H200 单卡 46,827 MiB;🟢 GB10 block_num=1 8 GB VRAM + 16 GB RAM;🟢 720p 28,040 MiB + 35.3 GB RAM🟢 3.63s 音频 → 233.08 s(H200)/🟢 480p 44 秒视频 ≈ 2 小时(GB10)/🟢 4090D 480p/10步/105帧 ≈60 s/it✅ 可跑(3060 12GB GGUF Q4 已跑通、3090 24GB fp8+block swap 跑通);⚠️ 16GB 无本人实测
Wan2.2-Animate-2-14B14B30.54 GiB(base/distill 各一)INT8_convrot 15.51 GiBTURBO 蒸馏版 Q8_0 16.90 / Q6_K 13.25 / Q5_K_M 11.87 / Q4_K_M 10.56 / Q4_K_S 9.72 / Q3_K_M 8.00 / Q2_K 6.05 GiB🟢 RTX 5060 Ti 16GB:distill int8_convrot 部分卸载 ≈7.3 GB 显存 / 8.6 GB 内存🟢 RTX 5060 Ti 16GB:官方 video_wan_animate2_distilled 动作迁移图,10/10 步、49 帧 @480×854 = 126.8 秒 ← 本次唯一拿到本机型逐秒实测的模型;🟢 上一代 Animate-14B:A800 480P/20步 替换模式 10.76 s/it✅ 能跑;但 ❌ 它不吃音频(输入是参考图+驱动视频),与口播场景不匹配
Wan2.2-S2V-14B14BDiT ≈30.35 GiB(4 shard)+ T5 10.58 GiB + wav2vec 1.18 + VAE 0.47ComfyUI 官方 fp8_scaled 15.27 GiB;Kijai fp8 16.65 GBQ8_0 18.27 / Q6_K 15.10 / Q5_K_M 13.97 / Q4_K_M 12.91 / Q4_K_S 12.07 / IQ4_XS 11.32 / Q2_K 8.86 GiB⚪ 未查到任何消费级卡峰值显存🟡 L40S 48GB:5 秒视频 ≈20 分钟(含约 10 分钟编译+加载);🟡 4×64GB 卡跑 720P 每 10 秒 ≈1 小时;🟢 H200 3.8 秒 → 780 秒❌ 官方要求 ≥80GB;⚪ 无 16GB 成功案例;已知 16GB 失败模式 = 显存填满→走共享内存→慢到必须中止
HunyuanVideo-Avatar13B(Wan2GP 定义)30.51 GB(官方)+ 文本编码器 16.76 GB官方 fp8 24.85 GB;Wan2GP int8 13.41 GB社区实验版(ComfyUI 不支持)Q2_K 4.86 / Q4_K_M 7.42 GiB⚪ 未查到 16GB 实测🟢 5090 未优化:30 步 ≈30 分钟(≈60 s/it)/🟢 3090+CPU offload+fp8:704px/129帧 112.32 s/it(50 步 1h33m 后 OOM)/🟢 4090 24GB+128GB RAM 走 ComfyUI 节点:采样前要等 30+ 分钟预热/🟢 3060 12GB 在 Wan2GP 跑通⚠️ 推断偏不可行:int8 13.41GB 会被 pin 进内存(实测 pin 12,785 MB),而成功案例全带 96/97/192GB RAM,本机仅 32GB
OmniAvatar-14B14BLoRA+音频权重 1.238 GB(底座 Wan2.1-T2V-14B)⚪ 无 fp8/int8/GGUF⚪ 无🟢 第三方 24GB VRAM + 31.3GB RAM 加载即 OOM🟢 官方 A800:bf16 不限 36G/16.0 s/it;7B 常驻 21G/19.4 s/it;全 offload 8G/22.1 s/it;🟢 A800×4 fsdp 4.8 s/it;🟢 H100 SXM 3 秒音频/25 步 >7 分钟;19 秒音频/50 步 >1 小时;🟢 单 B200 5.2 s/it❌ 官方称需 64GB 内存,本机 32GB 不够
FantasyTalking14B(Wan2.1-I2V) + 适配器 1.68 GB适配器 fp16 1.68 GB⚪ 无🔴 社区 GGUF 明确失败并归档🟡 官方 A100 表:40G / 20G / 5G 三档🟡 官方 A100:15.5 / 32.8 / 42.6 s/it(对应 40G/20G/5G)/🟢 A800 40G:30 秒视频 = 1 小时/🟢 另一用户 1 分钟音频 >19 小时❌ 有 RTX 5070 Ti 16GB 明确失败报告("Doesn't work with 16GB VRAM");RTX 5090 32GB 最小设置也 OOM

2.5 🟢 16GB 级显卡实测清单(本次挖到的全部,逐条可查)

这一节回答"别人在 16GB 卡上到底跑通了什么"——比任何厂商宣称都实在。

显卡模型实测结果来源
RTX 5060 Ti 16GB(本机型)Wan2.2-Animate-2distilled int8_convrot 部分卸载 ≈7.3 GB 显存 / 8.6 GB 内存;49 帧 @480×854 126.8 秒ComfyUI-MultiGPU #219
RTX 5060 Ti 16GBInfiniteTalk✅ 跑通(Wan wrapper;升级到 torch 2.9.1 + cu130 后成功)kijai #1875
RTX 5060 Ti 16GBSageAttention 2.2.0🔴 官方 cu130/torch2.10 wheel 缺 sm_120 内核 → cudaErrorNoKernelImageForDevice(本机是源码自建版,已含 sm_120)Comfy-Org/wheels #22
RTX 5060 Ti 16GBSageAttention 3.0🔴 在 Wan wrapper 出马赛克伪影,需强制 per_block_mean 才修好;自述"SA3 与 2.2 速度接近"SageAttention #321
RTX 5060 16GBWan2.2 通用✅ 原生 ComfyUI 用 GGUF Q4_K_M + fp8 文本编码器稳定出 121 帧 @720×960(同参数下 kijai wrapper 超 480×640 就 OOM)kijai #1805
RTX 5080 16GBInfiniteTalk640×640 5 秒 = 1300 秒kijai #1185
RTX 5070 Ti 16GBFantasyTalking🔴 明确失败("Doesn't work with 16GB VRAM")FantasyTalking #37
RTX 5070 Ti 16GBMiniMaxH3 + SageAttention patch🔴 在 sm120 崩KJNodes #736
RTX 4070 Ti 16GB + 32GB RAMHunyuanVideo-Avatar⚪ 提问无人回复HYA #70
RTX 4070 Super 12GBInfiniteTalk🔴 OOMkijai #1186
RTX 3060 12GBLongCat-Avatar 1.5✅ 用 GGUF Q4_K_M 跑通(需升级 WanVideoWrapper nightly)kijai #1780
RTX 3060 12GBHunyuanVideo-Avatar✅ 在 Wan2GP 里跑通Wan2GP #508
RTX 3090 24GBLongCat-Avatar 1.5✅ fp8 + block swap 可跑(832×480/10 步出片正常)kijai #1780
RTX 4090 24GBHunyuanVideo-Avatar⚠️ ComfyUI 节点采样前要等 30+ 分钟预热;需 128GB RAMsmthemex #15
RTX 4090 24GBEchoMimic V3未量化 10 秒音频 ≈12 分钟echomimic_v3
RTX 5090 32GBEchoMimic V3 量化版🔴 跑不通(2025-12-31,0 回复,疑似 sm120)echomimic_v3 #62
RTX 5090 32GBHunyuanVideo-Avatar未优化 30 步 ≈ 30 分钟HYA #61
RTX 5090 32GBFantasyTalking🔴 最小设置 OOMFantasyTalking #17

从这张表能读出的三条规律

  1. "16GB 能跑"与"16GB 跑得动"是两回事——InfiniteTalk、LongCat、Wan-Animate-2 都能跑,但只有 Wan-Animate-2 给出了可接受的速度(49 帧 127 秒),而它偏偏不吃音频。
  2. 12GB 卡在 InfiniteTalk 上直接 OOM,而 16GB 能跑 → 16GB 是 Wan 系 14B 的最低可用门槛,本机刚好卡在门槛上,没有任何余量做"同时加载两个模型"。
  3. sm120 的真实风险不是"报错"而是"静默出错或掉驱动":EchoMimic 在 5090 上"跑不通且无人解答"、SageAttention 3 出马赛克、5060 Ti 上 SageAttention 循环 300–630 次后 GPU 丢失。本机做任何验证都要盯日志 + 小规模先跑。

3. 8 个重点模型逐个深析

3.1 🥇 EchoMimic V3 / V3-Flash(蚂蚁集团 Alipay,AAAI 2026)

项数据
发布方蚂蚁集团 Alipay 终端技术部(论文署名 Terminal Technology Department, Alipay, Ant Group;⚠️ 网传"复旦"在论文与仓库中无出处)
会议 / 论文AAAI 2026(2025-11-09 录用)|arXiv 2507.03905
时间线论文 2025-07-08 → 代码+权重 2025-08-08 → 12G 显存 GradioUI 2025-08-12 → ComfyUI 16G 跑通 2025-08-12 → V3-Flash(8 步 / 12G / 768×768)2026-01-22 → 仓库最后提交 2026-03-18
参数量 / 体积1.3B;echomimicv3-flash-pro/diffusion_pytorch_model.safetensors 3.47 GiB;transformer/... 3.18 GiB;另需 clip_vision_h 1.26 GB、umt5_xxl_fp8 6.74 GB、Wan2.1_VAE 0.51 GB
许可证Apache-2.0(官方原文:"licensed under the Apache 2.0 License. We claim no rights over your generated contents")
GitHub1,061 ★ / 128 fork(2026-09-22)

🟢 显存(官方给了可直接照抄的档位)

版本分辨率显存步数条件
V3(preview)768×76812 G8 步官方 GradioUI app_mm.py
V3(preview)—8 G+—mmgp,partial_video_length=65 或 33
V3-Flash-pro768×76812 G8 步无需 Face Mask
V3-Flash-pro768×5126.5 G8 步需开 block_offload
官方测试过的 GPU—A100 80G / RTX 4090D 24G / V100 16G—🟢 官方把 16GB 写进了测试列表

🟢 ComfyUI 节点作者给的本机参数(smthemex/ComfyUI_EchoMimic,实测环境 12G VRAM):

  • V3 正式上线,测试环境 12G VRAM,OOM 需减少视频分块 partial_video_length:12G 可以跑 65,16 可以试试 97,更高可以试试 113
  • v3 flash:12G、8 步可以推理 768×768;6.5G 可以推理 768×512(需开 block_offload)
  • "need 8G and more(use mmgp, LOW LOW, partial_video_length==65 or 33)"

→ 本机(16GB)的档位 = partial_video_length = 97 + 768×512 + block_offload=on。

🟢 速度(这是 8 个模型里唯一有官方实测耗时的)

✅ 中文(8 个模型里最强)

加速手段:TeaCache(teacache_threshold 推荐 0~0.1,横评称提速 1.5× 且质量无损)|LightX2V LoRA(10 步)|LCM(4 步自动开启)

ComfyUI 两条路径:① smthemex/ComfyUI_EchoMimic(官方 README 亲自致谢推荐;支持 V1/V2/V3 + V3-Flash;lowram=False 可关 mmgp FP8 换质量)② havvk/ComfyUI_AIIA(默认开 TeaCache、自动检测 FlashAttention 2、支持流式;该仓库明确写了"修复了唇形漂移问题")

长视频:README 原文 "Long video generation: If you want to generate a video longer than 138 frames, you can use Long Video CFG";论文消融证明它有效——w/o Long Video CFG 的 FVD 从 496.76 恶化到 530.21

🔴 坑

  1. 厂商口径(12G/6.5G)与第三方默认配置实测(33,726 MiB)差距巨大 → 不调参在 16GB 上必 OOM。必须:Flash-pro + block_offload=on + partial_video_length=97 + TeaCache。
  2. 依赖 retina-face==0.0.17(须外网下载)、mmgp、tensorflow==2.15.0(版本敏感);ffmpeg 报错要 pip uninstall ffmpeg && pip install ffmpeg-python。
  3. 同名文件坑:ComfyUI 目录里 diffusion_pytorch_model.safetensors 有两个同名文件(Wan2.1-Fun 的 3.13G vs EchoMimicV3 的 transformer)→ 放错位置会静默加载错权重。
  4. 1.3B 主干上限:第三方横评称"嘴部和身体动作比 LongCat 更细腻,但全帧变化干扰较少"(偏静态口播)。
  5. ❌ 不支持多人对话;⚪ 5060 Ti 无实测。

🎯 16GB 结论:✅ 能跑,且是本场景首选。 官方测试过 V100 16G;用 768×512 + block_offload + partial_video_length=97;10 秒中文口播预期 10~12 分钟(需自测)。


3.2 ⚠️ LongCat-Video-Avatar 1.5(美团,2026-05-21)

项数据
发布方美团 LongCat 团队|1.5 首发 2026-05-21(1.0 为 2025-12-16)|技术报告 arXiv 2605.26486
参数量13.6B dense DiT;1.5 音频编码器换为 Whisper-large-v3
许可证MIT(模型权重 + 代码均可商用)——8 个模型里最干净的授权
GitHub8,375 ★ / 1,491 fork(2026-09-22)
语言HF 模型卡 language: [en, zh](中英双语)

各精度体积

版本文件体积
1.5 bf16(官方)base_model/* 6 shard29.5 GiB(≈31.71 GB)
1.5 INT8(官方,--use_int8,仅 1.5 支持)base_model_int8/* 4 shard14.78 GiB(≈15.89 GB)
1.5 distill LoRA(1.5 强制需要)lora/dmd_lora.safetensors2.52 GB(ComfyUI 打包版 1.26 GB)
1.5 Whisper-large-v3whisper-large-v3/model.safetensors3.09 GB
共享(LongCat-Video 仓)UMT5 text_encoder 5 shard + VAE22.73 GB + 0.51 GB
社区 GGUFQ8_0 / Q6_K / Q5_K_M / Q4_K_M / Q3_K_M / Q2_K17.77 / 14.42 / 12.78 / 11.24 / 9.22 / 7.77 GiB
社区 INT8 单文件smthem/LongCat-Video-Avatar-1.5-merge15.88 GB

🟢 显存与速度实测

数据GPU来源
第三方横评:单卡(context_parallel_size=1)峰值 46,827 MiB,3.63 秒音频 233.08 秒,480×832@25fpsH200🟢 Tight Studio 2026-08-23
官方示例全部是 2 卡 --nproc_per_node=2 --context_parallel_size=2;官方从未声明最低显存—🟡 README
block_num=1 + 全 offload CPU:8 GB VRAM + 16 GB RAM;但 480p 的 44 秒视频耗时约 2 小时;默认预设吃满 37 GB VRAM + 35 GB RAM 导致系统崩溃GB10(128GB 统一内存)🟢 ComfyUI-LongCat-Avatar issue #2
720p:28,040 MiB VRAM + 35.3 GB RAM → 本机 32GB 内存也会被击穿GB10🟢 同上
480p / 10 步 / 105 帧 ≈60 s/itRTX 4090D🟢 kijai #1806
fp8 + block swap 可跑(24GB);GGUF Q4_K_M 在 3060 12GB 上可跑(需升级 WanVideoWrapper nightly)3090 24GB / 3060 12GB🟢 kijai #1780
🟡 官方效率宣称:DMD 蒸馏 50 步→8 步,"生成 10 秒视频仅需约 1 分钟"(未注明 GPU 型号)未标🟡 美团博客;⚠️ 与第三方 H200 实测(3.63s→233s)严重矛盾,不可用作 16GB 预期

ComfyUI

✅ 能力:原生 多人对话(multi-stream audio,audio_type=para/add)|原生长视频续写(首窗 93 帧,后续 +80 帧,重叠 13 帧)|480p(480×832)/720p(768×1280)@25fps|8 步蒸馏

🔴 坑(这就是它不该当首选的原因)

  1. v1.5 有官方承认但长期未修的质量缺陷:issue #120「Excessive facial expression and motion in v1.5」(2026-05-30 起)——嘴动过大、头部动作不自然、逐帧累积导致面部漂移。官方 2026-06-16:"夸张表情已修复,但唇色累积还在弄……已发布的模型还没有更新";用户 2026-07-02 / 07-13 / 08-19 三次追问,无答复 → 修复版至今未发布。另有 issue #130(口型过夸张)独立复现。社区 workaround:dmd_lora 的 multiplier 从 1.0 降到 0.1。
  2. 🔴 sm_120 专项警告:issue #141(2026-08-26)——Blackwell/GB 架构不要用 FlashAttention2;torch 2.6/2.8 无法 build(最高支持 sm_90),需 torch 2.11 + CUDA 12.8+;新版 torchvision 用 torchcodec 取代 write_video(),仓库里大量代码跑不起来。
  3. ComfyUI 节点的 sageattn_3 是坏的(LongCat varlen cross-attention 未接完),只能用 sageattn → 在 sm120 上正好是雷区 → 建议直接用 sdpa。
  4. 社区仍在求量化版:issue #146(2026-09-18)"We really need quantized model for it"。
  5. 社区反馈长视频约 25~30 秒后开始出现伪影(官方开发者称 480p 推理过 10 分钟无明显色偏,更长没测)。

🎯 16GB 结论:⚠️ 能跑,但只能 480p + 量化 + block_num=1 + 全 CPU offload。


3.3 ⚠️ InfiniteTalk(MeiGen-AI / 美团)

项数据
发布方美团 MeiGen-AI(+ 中科院大学 / NLPR-CASIA / 港科大 / 中山大学)
首次开源2025-08-19(arXiv 2508.14033,与 MultiTalk 为同源,MultiTalk 是 NeurIPS 2025)
许可证Apache-2.0(可商用)
GitHub7,901 ★ / 1,365 fork(2026-09-22);主仓库代码实质停更 2025-09,2026 年推进全在 ComfyUI 官方核心 + 社区 wrapper(wrapper 最后 push 2026-05-24)
架构patch 2.487B 参数 + 底座 Wan2.1-I2V-14B-480P(DiT 14.289B 参数)

各精度体积(必须同时装 patch + 底座)

组件格式体积
InfiniteTalk patchfp32 single/infinitetalk.safetensors9.948 GB
Kijai fp165.125 GB
Kijai fp8_scaled2.714 GB
GGUF Q4_K_M / Q6_K / Q81.403 / 2.044 / 2.646 GB
comfyui/infinitetalk_single.safetensors(F8_E4M3 混合)2.713 GB
底座 Wan2.1-I2V-14B-480Pfp8_e4m3fn_scaled(Kijai)16.64 GB ⚠️ 单文件已超 16GB
GGUF Q4_K_M / Q5_K_M / Q6_K / Q8_0 / bf1611.34 / 12.74 / 14.23 / 18.14 / 33.28 GB
T5 文本编码器fp16 / fp811.37 / 6.74 GB(必须 offload 到 CPU)
音频编码器(中文)wav2vec2-chinese-base_fp160.19 GB

🟢 速度实测(全部来自公开 issue)

GPU实测来源
RTX 4090 24GB未量化/无 LoRA:10 秒 480p 用 40 分钟;8 秒默认 40 步 = 3h56mInfiniteTalk #210 / #187
RTX 4090 24GB2026-09-15 最新:FusionX 8 步 + TeaCache + streaming,10 秒 ≈ 15 分钟同上
RTX 5080 16GB640×640,5 秒 = 1,300 秒(20 block swap + Sage + compile)kijai #1185
RTX 3090 24GB832×480 约 30 秒/秒视频(10 秒 ≈ 5 分钟)kijai #1185
L40 48GB40 秒 480×832 用 16 分钟,峰值 28 GBkijai #1229
H100 80GB15 秒"最好情况 10 分钟";加卡不提速同上
8GB VRAMWan2GP 作者亲测:仅 81 帧(≈3.4 秒)可跑InfiniteTalk #25
RTX 5060 16GB🟢 跑通(Wan wrapper,升级到 torch 2.9.1 + cu130 后成功)kijai #1875
RTX 4070 Super 12GB🔴 OOMkijai #1186
A800fp8/int8 量化档反而慢 2.6 倍(5 小时 vs 1.3 小时)InfiniteTalk #18

ComfyUI(最大优势)

✅ 中文音频:原生支持(TencentGameMate/chinese-wav2vec2-base)

🔴 坑

  1. 🔴 长视频吃爆系统内存:kijai #1088(至今 open)——3 分钟 480P 视频需 >120 GB 系统内存,内存消耗集中在最终解码阶段;另一用户报告 32GB 内存在音频超过 3 分钟时于 60% 进度崩溃。
  2. kijai 的反直觉告警(#1091):满 block swap 时"GGUF Q4 并不真的省显存,只省内存"——真省显存要靠降分辨率/减帧数。
  3. 系统 RAM 被误报成"VRAM OOM"(#1095)。
  4. 分辨率必须能被 16 整除(832×480 ✅;800×456 ❌ 会崩 shape [20,1400,5120] invalid)。
  5. 禁用 SageAttention 3(kijai 亲述画质劣化);RTX 50 系必须 torch ≥2.9.1 + CUDA ≥13.0。
  6. VRAM 泄漏:每轮迭代约泄漏 30MB(#1308)。
  7. 多人对话实测很差:2 人勉强,3~4 人普遍失败(#1944、#1891、#1866)。
  8. 🟡 官方自曝:FusionX LoRA 超 1 分钟加剧色偏;I2V 单图超 1 分钟色偏明显。

🎯 16GB 结论:✅ 可跑,且本机型已有跑通记录(kijai #1875:RTX 5060 在 torch 2.9.1+cu130 后跑通)。但属于"慢速可用"档,且 32GB 内存是真瓶颈(12GB 卡反而直接 OOM,见 kijai #1186)。

底座:   city96/Wan2.1-I2V-14B-480P-gguf  → Q4_K_M (11.34 GB)
patch:  Kijai/WanVideo_comfy_GGUF → Wan2_1-InfiniteTalk_Single_Q4_K_M.gguf (1.403 GB)
音频:   Kijai/wav2vec2_safetensors → wav2vec2-chinese-base_fp16 (0.19 GB,中文)
LoRA:   lightx2v_I2V_14B_480p_cfg_step_distill_rank64 (4~6 步)
Block swap: 30~40 块 | 分辨率 832×480(必须 16 整除)| T5 卸载到 CPU
环境:   torch ≥2.9.1 + CUDA 13.0(本机 2.11.0+cu130 ✅);attention 优先 SDPA,SA2 须含 sm120
长视频: 每 10~20 秒一段落盘,清缓存再续接
预期:   480p、10 秒 ≈ 30~45 分钟(按 RTX 5080 16GB 的 1300 秒/5 秒 @640×640 换算)

3.4 ❌ Wan2.2-S2V-14B(阿里万相)—— 官方门槛 80GB

项数据
发布方阿里巴巴 Wan 团队(通义万相)|首发 2025-08-26|HF 权重最后更新 2025-09-17
参数量14B(Wan2.2 MoE DiT 的单专家 S2V)
许可证Apache-2.0,可商用
GitHub17,585 ★ / 2,257 fork(主仓库 2026-09-21 仍在提交,但 S2V 本体自 2025-09 未再更新)

各精度体积

组件格式体积
DiTbf16(官方 4 shard)≈30.35 GiB
ComfyUI 官方 fp8_scaled15.27 GiB
Kijai fp8_e4m3fn_scaled16.65 GB
GGUF Q8_0 / Q6_K / Q5_K_M / Q4_K_M / Q4_K_S / IQ4_XS / Q2_K18.27 / 15.10 / 13.97 / 12.91 / 12.07 / 11.32 / 8.86 GiB
T5 文本编码器umt5_xxl_fp8_e4m3fn_scaled6.27 GiB(bf16 版 10.58 GiB)
音频编码器wav2vec2_large_xlsr-53_english_fp161.18 GiB(英文)
VAEwan_2.1_vae0.24~0.47 GiB

🔴 算一笔账:官方 fp8 UNet 15.27 GiB + fp8 T5 6.27 GiB = 21.5 GiB,必然超 16GB。所以 16GB 上要么换 GGUF Q4_K_M(12.91 GiB),要么靠 --lowvram 让 ComfyUI 自动把文本编码器换出。

🟢 显存与速度

ComfyUI(官方原生,配法已核实)

🎯 16GB 结论:❌ 不推荐。 官方 80GB、第三方 57.3GB,16GB 属于"理论可行(Q4 GGUF + 分块 offload + 低分辨率 + 短片段)、无任何公开成功案例"区间,且已知失败模式是走共享内存后慢到必须中止。若一定要试:calcuis/wan-s2v-gguf 的 Q4_K_M(12.91 GiB) + ComfyUI-GGUF 的 Unet Loader (GGUF) + T5 换出 + 480P 以下 + 单块 77 帧(4.8 秒)。16fps 输出也是流畅度劣势。

ℹ️ 一个间接的乐观信号:同为 16GB 的 RTX 5060 在原生 ComfyUI 里用 Wan2.2 GGUF Q4_K_M + fp8 文本编码器稳定出了 121 帧 @720×960(kijai #1805)——说明 Wan 系 14B 在 16GB 上"有戏",但 S2V 本身无人验证。

其他坑:🟢 横评记录"官方设置在推理开始前还需要修几个依赖(其音视频读取器用的包)";ComfyUI 博客评论区有用户问"how can I achieve longer video clips than 15 seconds?"(默认模板容易卡在 ~15 秒)。 中文:官方支持 --enable_tts 走 CosyVoice 做中文合成,但音频编码器是英文 wav2vec2-large-xlsr-53-english → 中文唇形精度只有厂商演示,⚪ 未查到中文 LSE 第三方数字。


3.5 ⚠️ HunyuanVideo-Avatar(腾讯混元)

项数据
发布方腾讯混元|2025-05-28 首发|仓库最后 push 2025-12-16(已 9 个月无功能更新)|arXiv 2505.20156
参数量13B(Wan2GP 模型定义明写 "Hunyuan Video Avatar 720p 13B")
许可证🔴 腾讯混元社区协议(非 Apache/MIT),明确写明"本协议不适用于欧盟、英国、韩国",另有 Acceptable Use Policy。ComfyUI 作者原话:"anyone in the european union, uk or south korea is not allowed to use the model"

各精度体积

组件体积
官方 mp_rank_00_model_states.pt(bf16/fp32)30.51 GB
官方 fp824.85 GB
llava 文本编码器(4 shard)16.76 GB
Wan2GP int8「quanto」13.41 GB
Wan2GP bf16 重打包25.98 GB
社区 GGUF 实验版 Q2_K / Q4_K_M / Q5_K_M / Q8_04.86 / 7.97 / 9.55 / 14.14 GB
HF 仓库总计80.77 GiB

🟡🟢 显存与速度

ComfyUI

✅ 能力:中文音频支持(whisper-tiny + LLaVA,多语言)|多人对话(Face-Aware Audio Adapter,按人脸 mask 做 latent 级多角色音频注入)——16GB 可达的低显存模型里唯一支持多人对话的 🟢 第三方 LSE 数据:EMTD 基准 HY-Avatar(12.99B)LSE-C 7.210 / LSE-D 8.494(同表 InfiniteTalk 8.535/7.108、Wan-S2V 6.999/8.292、Hallo3 5.352/9.828)

🔴 坑:显存 issue 密集——#81「CUDA OOM even with 8×24GB VRAM」、#6「80GB H100 still got OOM」、#25(8 卡 4090 OOM)、#61(single 3090 OOM)、#63(WSL2 + 32GB RAM + 4090 OOM);质量吐槽 #78(A100 80GB 质量低)、#79(图像模糊)、#58(low vram 出黑屏);flash-attn 2.6.3 编译失败是高频 issue

🎯 16GB 结论:⚠️→❌ 从"能跑"下调为"推断偏不可行"。


3.6 ⚠️ Wan2.2-Animate-2-14B(阿里)——它不是音频驱动

🔴 选型第一坑:Wan-Animate 系列不吃音频。 它输入的是「参考图 + 驱动视频」,输出角色动画。口播场景需要你先生成/拍摄一段驱动视频,链路变成三段。对本场景不匹配。

项数据
两代关系Wan2.2-Animate-14B(= Wan-Animate,首发 2025-09-19,HF likes 1,261)→ Wan2.2-Animate-2-14B(首发 2026-08-07,arXiv 2608.06009,独立仓库 323★,但 Comfy-Org 重打包 535,555 下载)。不存在第三代。
机制差异上一代有骨架/姿态中间表示;Animate-2 让驱动视频直接进 DiT,取消中间姿态提取器
参数量 / 体积14B;bf16 30.54 GiB(base + distill 各一份)|INT8_convrot 15.51 GiB(base + distill 各一份)|另需 umt5_xxl_fp16 11.37GB / fp8 6.74GB、clip_vision_h 1.26GB(必需)、Wan2.1 VAE 0.25GB、lightx2v LoRA 0.74GB
社区 GGUF(TURBO 蒸馏版)Q8_0 16.90 / Q6_K 13.25 / Q5_K_M 11.87 / Q4_K_M 10.56 / Q4_K_S 9.72 / Q3_K_M 8.00 / Q2_K 6.05 GiB
许可证Apache-2.0,可商用
🟢 显存(本机型实测!)RTX 5060 Ti 16GB:distill int8_convrot 部分卸载 ≈ 7.3 GB 显存 / 8.6 GB 内存 —— 这是本次调研唯一拿到的、与本机同型号显卡的逐项实测数据(来源:ComfyUI-MultiGPU #219)
🟢 速度(本机型实测!)RTX 5060 Ti 16GB:官方 video_wan_animate2_distilled 动作迁移图,10/10 步、49 帧 @480×854 = 126.8 秒 → 按 25fps 折算 49 帧≈2 秒画面,10 秒约 10 分钟;🟢 上一代 Animate-14B:A800 480P/20步 替换模式 10.76 s/it(另一用户 720p 8–10 秒/25 步 ≈40 分钟)
🟡 上一代第三方汇编未量化约 28 GB,量化后约 16 GB;官方模型卡:默认设置调优于 8×A800,480P 在 2×A800 上测过 → 官方只在多卡上验证过

ComfyUI:✅ Day-1 官方原生(2026-08-08 官方博客同日宣布)。两个新节点:WanAnimate2ToVideo(吃参考角色图 + 驱动视频,可控 pose_strength/pose_start_percent/pose_end_percent/reference_image_strength)与 WanAnimate2Cache。生态扩展:wuwukaka/ComfyUI-WanAnimatePlus(413★,2026-09-14 更新,做长视频接缝与多参考图)

🔴 坑(按危险度排序)

① 本机型专属:WanAnimate2Cache 的 device/dtype 组合会静默杀进程 🟢 ComfyUI-MultiGPU #219 已在 5060 Ti 16GB 上复现:WanAnimate2Cache 设 device=gpu + dtype=int8,再配合 MultiGPU 类 patch,会静默杀掉进程(无报错)。 → 正确配置:device=cpu + dtype=default。

② GGUF 静默失败(最阴险) —— 来自 GGUF 量化仓库作者原话:

Wan-Animate-2 不会通过 tensor 名自报家门。ComfyUI 从 safetensors __metadata__ 的 config blob(model_type: "animate2")选择架构,而 GGUF 没有等价字段,所以任何该模型的 GGUF 都会被当成普通 Wan 2.1 I2V 加载。失败是静默的:模型加载、采样运行、出来一段带你参考角色的视频——但驱动视频被完全忽略,随机运动、没有表演迁移,不报任何错。

解法:装 ComfyUI-GGUF + Rebels W3A8 Loader,把 model_type 显式设为 animate2;控制台加载时必须打印 model class=WAN_Animate2 才算成功。

③ 其他坑:GGUF + 自定义节点会在采样期崩(discussions/2,2026-08-22 open,报 TypeError 于 comfy/ldm/wan/model_animate2.py 的 _cross_attn_ffn);参考图必须大致匹配驱动视频的开场姿态(与量化无关,bf16 同样如此);上一代有长视频色偏 issue(#1277)。

🎯 16GB 结论:✅ 技术上完全能跑,而且是本机型唯一有逐秒实测的模型(7.3GB 显存 + 49 帧 126.8 秒)。 ❌ 但它需要「参考图 + 驱动视频」,不吃音频,不符合"一张图 + 一段中文音频"的口播场景。

⚠️ 一个容易被误导的岔路:如果你的素材本来就是"一段视频 + 一段中文音频",那你需要的是 InfiniteTalk / MuseTalk / LatentSync 那类视频重绘配音模型,不是 Animate——Animate 做的是"让参考图里的人做出驱动视频的动作",与"对上录音的嘴型"是两件不同的事。


3.7 ❌ OmniAvatar-14B(浙江大学 + 阿里巴巴)

项数据
发布方浙江大学 + 阿里巴巴(Qijun Gan 等)|arXiv 2506.18866
时间线14B 权重 2025-06-24;1.3B 权重 2025-07-02;GitHub 最后 push 2025-08-06(停更 13.5 个月)
参数量 / 体积14B;OmniAvatar-14B/pytorch_model.pt 仅 1.238 GB(LoRA + 音频条件权重),底座是 Wan2.1-T2V-14B;1.3B 版 0.355 GB
许可证14B Apache-2.0;⚠️ 1.3B 的 HF license 字段为空(未声明)
GitHub1,861 ★ / 168 fork(2026-09-22)
音频编码器facebook/wav2vec2-base-960h(英文 LibriSpeech 960h)

🟡 官方显存表(A800,480p,官方 README)

参数量dtypeGPU 数num_persistent_param_in_dit速度所需显存
14Bbfloat161None(不限)16.0 s/it36 G
14Bbfloat1617e9(7B)19.4 s/it21 G
14Bbfloat161022.1 s/it8 G
14Bbfloat164不限4.8 s/it14.3 G

🟢 第三方实测(决定性)

ComfyUI:❌ 无。feature request kijai #836 自 2025-07-20 提交,至 2026-09-22 仍 open;wrapper 里没有 omniavatar 模块。2025-07 曾有一个"OmniAvatar 1.3B 图生数字人工作流"在微信公众号传播,但被官方仓库 issue 定性为闭源付费推广(作者直接把 issue closed 并注明 "Not open-source. Closed it.")。 量化:⚪ 无 fp8 / int8 / GGUF(HF 上只有 1.238GB 的 LoRA+音频权重) 中文:⚠️ 未查到官方支持(编码器是英文 960h)。网传"支持 31 种语言"在官方 GitHub / HF / 项目页均无出处,不采信。

🎯 16GB 结论:❌ 14B 不可用(官方称需 64GB 内存,本机 32GB 不够);1.3B 能跑(~8GB)但生态为零:无 ComfyUI 节点、无量化、无中文官方支持、项目停更 13.5 个月、RTX 50 系兼容 issue 从未处理。排除。


3.8 ❌ FantasyTalking(阿里高德 Fantasy-AMAP,ACM MM 2025)

项数据
发布方阿里巴巴 AMAP(高德)CV Lab|ACM MM 2025|开源 2025-07-07|最后更新 2025-08-20(停更 13 个月)
参数量 / 体积14B(基于 Wan2.1-I2V-14B-720P)+ 口型适配器 fantasytalking_fp16.safetensors 1.68 GB
许可证Apache-2.0
GitHub1,630 ★

🟡 官方显存/速度表(A100,512×512,81 帧)

torch_dtypenum_persistent_param_in_dit速度需求显存
bfloat16None(不限)15.5 s/it40 G
bfloat167×10⁹(7B 常驻)32.8 s/it20 G
bfloat160(全部 offload)42.6 s/it5 G

→ 唯一能进 16GB 的是"全 offload → 5G"档,但 42.6 s/it。按 30 步算约 21 分钟/帧组,10 秒视频是"小时级"——不可用级慢,不是"稍慢"。

🔴 16GB 上的明确失败证据(本调研新查到)

ComfyUI:✅ 社区路径(kijai/ComfyUI-WanVideoWrapper 的 FantasyTalkingWav2VecEmbeds 节点,30 步 UniPC,CFG=5);⚠️ 该 wrapper 仓库没有 README(raw 全 404)。有 issue #753 "Fantasy Talking VRAM Usage"。SageAttention 支持有用户请求(#69)但未实现。 🔴 量化无解:社区 GGUF 尝试明确失败并归档——kael558/ComfyUI-GGUF-FantasyTalking 的 README 全文只有一句:"P.S. Couldn't quantize the fantasy talking model so this repo doesnt work" 中文:⚠️ 工作流用 facebook/wav2vec2-base-960h(英文 960h),官方 demo 音频也是英文 → 中文口型不可靠 其他:81 帧固定窗口,未见官方长视频/分段续写方案;❌ 不支持多人

🟢 第三方质量(EchoMimicV3 论文 Table 1,512×512 半身):FantasyTalk-14B Sync-C 4.05(全表最低)/ Sync-D 11.01(全表最差),FID 45.03、FVD 603.95 → 唇形同步是它的相对弱项 ⚠️ FantasyTalking2:AAAI 2026 论文,仓库 只有 README.md + assert/ 目录,3 个 commit 全在 2025-08-15~08-18,65★,无 LICENSE 文件,无代码无权重 → 不是"不推荐",是"不存在可用产物"

🎯 16GB 结论:❌ 明确不可行。 有 RTX 5070 Ti 16GB 的失败报告、RTX 5090 32GB 最小设置 OOM、32GB 内存不足、官方要求必须装 flash_attn(sm120 大坑)、量化已失败归档、停更 13 个月、中文前端是英文、唇形同步在其论文对比表里垫底、A800 上 30 秒要 1 小时。八个"不"——直接划掉。


4. 🆕 中文文案 → 配音 TTS(本地首选,16GB 内)

为什么单列一节:口播链路的第一环是配音。中文 TTS 的"像不像人"直接决定成片质量,而许可证问题在这一环比在数字人那一环更严重——多个知名中文 TTS 的权重是 CC-BY-NC 非商用(代码 MIT 掩盖不了权重许可),商用一票否决。

4.0 🔴 本机专属:TTS 的 sm_120 兼容性坑(比数字人模型更需要注意)

问题具体表现应对来源
🔴 CosyVoice 有直击本机的 issueissue #1318 "5060ti 16g 运行 cosyVoice2 无法启动";issue #1815 "Compatibility Issue with PyTorch 2.4+ and RTX 50-series GPUs (sm_120)"必须按 issue 指定的 torch/cu128 组合;不要用旧 pin🟢 GitHub issues
🔴 IndexTTS GPU 检测失败issue #295 "Setting accelerator to CPU... we were unable to detect it" —— 与 Blackwell 新架构高度相关先查 torch 是否 cu128+ 与 CUDA 可见性🟢 GitHub issue
flash-attn 无 sm_120 预编译内核attn_implementation="flash_attention_2" → no kernel image is available for execution on the device改用 eager 或 sdpa;有 4090 用户反馈该模型上 eager 与 FA2 速度相当甚至更好🟢 flash-attention #2168
torch 必须 cu128+默认 pip install torch 会拉 cu121 → sm_120 内核缺失pip install --upgrade torch --index-url https://download.pytorch.org/whl/cu128(本机 2.11.0+cu130 已满足)🟢 多模型 README
SageAttention本机自建版含 sm_120 cubin,但长序列会 GPU 丢失(见 §0)TTS 场景完全不要开 sage_attn,一律 sdpa本机运维记录
OmniVoice 在 Blackwell 有未修 bugissue #155:Blackwell 上输出噪声/乱码(5090 复现,2026-05 仍未修);issue #83:微调撞 sm_120 的 ~99KB shared memory 墙(datacenter Blackwell sm_100 才有 228KB)推理可试;微调不行;建议等修复🟢 GitHub issues
pynini / WeTextProcessingconda 外安装困难(历史性痛点)Linux 上优先 conda 装 pynini,或走模型自带 jieba/cn2an 路径🟢 IndexTTS #61
✅ GPT-SoVITS 对 sm_120 最友好README"测试通过环境"明确列出 PyTorch 2.7.0/CUDA 12.8、2.8.0dev/CUDA 12.8 —— torch 2.7+ 才有完整 Blackwell 内核直接用 bash install.sh --device CU128🟢 GPT-SoVITS README

"能不能在这台机上跑起来"的难度排序(从易到难): GPT-SoVITS ≈ Qwen3-TTS ≈ VoxCPM2 < CosyVoice3 ≈ IndexTTS-2.5 < OmniVoice(有未修 bug)< GLM-TTS / Fun-CineForge(无 ComfyUI 节点,需自行封装)

4.1 🟢 两套第三方中文 TTS 横评(注意两者口径不同)

横评 A:OpenMOSS/MOSS-TTS 官方对比表(来源:MOSS-TTS README_zh)。ZH CER = 中文字错率↓;ZH SIM = 说话人相似度↑

⚠️ 由 OpenMOSS 发布(自家模型在表内),对自家模型可能有正向偏差;但它是唯一同时列闭源与十余个开源模型的表。

模型参数开源EN WER↓EN SIM↑ZH CER↓ZH SIM↑
(闭源)MiniMax-Speech—❌1.6569.20.8378.3
(闭源)Seed-TTS—❌2.2576.21.1279.6
(闭源)CosyVoice31.5B❌2.22721.1278.1
GLM-TTS-RL1.5B✅1.9168.10.8976.4
VoxCPM(1.0)0.5B✅1.8572.90.9377.2
IndexTTS21.5B✅2.2370.61.0376.5
GLM-TTS1.5B✅2.2367.21.0376.1
CosyVoice30.5B✅2.0271.81.1678.0
VibeVoice1.5B✅3.0468.91.1674.4
FireRedTTS-21.5B✅1.9566.51.1473.6
Qwen3-TTS1.7B✅1.5071.451.3376.72
Qwen3-TTS0.6B✅1.6870.391.2376.4
MossTTSLocal1.7B✅1.9373.281.4479.62
CosyVoice20.5B✅3.0965.91.3875.7
F5-TTS0.3B✅2.00671.5376
SparkTTS0.5B✅3.1457.31.5466
CosyVoice0.3B✅4.2960.93.6372.3

横评 B:VoicePing 中文专项基准(🟡 第三方,2026-09-20 更新)——含情感识别与"数字读法"两个 MOSS 表没有的维度

模型中文 CER情感识别↑数字:标识符数字:小数median RTFmedian 峰值显存
Qwen3-TTS-1.7B-CustomVoice9.7%53.3%(最高)0%(30/30 全失败)86.7%1.588.13 GB
VoxCPM2 (2B)4.4%(最低=最好)35.0%——9.8412.79 GB
IndexTTS-2 / 2.5——40%100%(唯一满分)6.97(2.0)7.29 GB
Fish Audio S1-mini—内联标记基本失效综合 79.3%(S2.1,需开厂商正则)—3.4713.05 GB(最高)

🔴 两表口径冲突,必须知道:OpenMOSS 表里 Qwen3-TTS-1.7B 的 ZH CER 是 1.33,VoicePing 测出 9.7%。测试集、文本难度、评测脚本都不同,不能混比。看趋势(谁强谁弱)可以,看绝对值不行。

4.2 🚨 许可证是这个赛道的最大陷阱(务必先看这一栏)

模型许可证能否商用
Qwen3-TTS(全系)Apache-2.0✅ 无附加条件
Fun-CosyVoice3-0.5B-2512 / CosyVoice2 / 300MApache-2.0✅ 无附加条件
VoxCPM / VoxCPM2(面壁+清华)Apache-2.0✅ 无附加条件
GPT-SoVITSMIT(仓库 LICENSE 原文确认)✅ 无附加条件
MOSS-TTS 全系 / OmniVoice / Dots TTS / MegaTTS3 / FireRedTTS2Apache-2.0✅
GLM-TTS(智谱)⚠️ HF 卡写 mit,仓库 LICENSE 原文是 Apache-2.0 → 两者都允许商用,但口径不一致,建议以仓库 LICENSE 为准并留存证据✅
VibeVoice(微软)⚠️ HF 卡 MIT,但第三方 TTS-Audio-Suite 引擎表标注 "MIT (research-only per model card)" → 冲突,商用前自行核对微软条款;且其 HF 表中 VibeVoice-TTS-1.5B 状态为 Disabled⚠️ 需核
IndexTTS-2 / 2.5(B站)⚠️ 不是 Apache-2.0。仓库是 "bilibili Model Use License Agreement":授予全球、非独占、不可转让、免版税许可 → 普通规模可商用;例外:你或关联方上月 MAU > 1 亿,或上一年营收 > 10 亿人民币,须另行申请。附加义务:保留版权声明;不得用本模型改进其他 AI 模型(除非该模型本身非商用);禁止高风险场景(医疗诊断/自动驾驶/军事/关键基础设施/大规模生物识别监控/自动化信贷雇佣)。管辖区:中国法、上海仲裁委✅ 普通规模可商用(比我初稿的判断更宽松);⚠️ 但必须读完全文
F5-TTS🔴 README 原文:代码 MIT,但预训练权重是 CC-BY-NC(因训练数据 Emilia);HF 卡 cc-by-nc-4.0❌ 一票否决
SparkTTS(阿里)🔴 代码 Apache-2.0,权重 cc-by-nc-sa-4.0❌
Fish-Speech / S2 Pro🔴 LICENSE 原文:"Any Commercial use of the Materials requires a separate license from Fish Audio."❌
ChatTTS🔴 代码 AGPL-3.0(强 copyleft)+ 权重 CC-BY-NC-4.0 双杀❌
Higgs Audio v3(Boson)🔴 Research and Non-Commercial License❌
DramaBox⚠️ LTX-2 Community License;需 ~24GB VRAM(fast mode)❌ 硬件不够

⚠️ 教训:不要相信 HF 镜像卡上的 license 字段(IndexTTS-2 就是反例,多个第三方镜像卡误标 apache-2.0)。要核实官方仓库根目录的 LICENSE 文件原文。

4.3 主对比表(16GB + 中文 + 商用 + ComfyUI 视角)

体积口径:HF 仓库 total 含所有量化/备份文件(如 CosyVoice3 同时含 llm.pt 与 llm.rl.pt,IndexTTS 含多版本),实际推理只加载其中一份,故"推理所需"列更贴近真实。

模型参数HF 总体积 / 推理所需许可证16GBComfyUI 节点中文效果音色克隆生成 10s 音频
GPT-SoVITS v2ProPlus0.21B(133M+77M)极小MIT ✅✅ ~6GB 级✅ AIFSH/ComfyUI-GPT_SoVITS中文原生核心场景(g2pW 多音字前端);⚪ 未查到权威第三方 CER/MOS✅ 5s zero-shot / 1min few-shot 微调🟠 ≈0.28 秒(RTF 0.028 @4060 Ti,项目自述);RTF 0.014 @4090
IndexTTS-2.50.8B(官网)/ 1.5B(他表)⚠️5.11 GiB / ~5.1 GiBbilibili 许可 ✅ 普通规模可商用✅ 峰值 ~7.3 GB✅ joyfoxai/ComfyUI-Index-TTS-25(一套节点同支持 2 与 2.5)🟠 ZH CER 3.93(RL);🟡数字小数 100%(唯一满分)、标识符 40%✅ zero-shot + 8 维情感向量🟠 2.1s(RTF 0.2065 @4090 bf16)/🟡 29s(RTF 2.92 @5060 Ti)
Qwen3-TTS-12Hz-1.7B1.7B4.23 GiB / ~4.2 GiBApache-2.0 ✅✅ 峰值 ~8 GB✅ 2 套(ComfyUI-TD-Qwen3TTS / ComfyUI-Qwen-TTS)🟡 第三方综合第一(CER 9.7%、情感识别 53.3% 最高、唯一 anchor margin 为正);🔴 但长数字串 0%(30/30 全失败)✅ zero-shot(3s 参考)🟡 ~15.8s(RTF 1.58)/社区报 RTF 2–4×
Qwen3-TTS-12Hz-0.6B0.6B2.34 GiB / ~2.3 GiBApache-2.0 ✅✅ 余量极大✅ 同上(同代码)🟠 CER 1.23 / SIM 76.4✅未查到(应更快)
VoxCPM2(面壁+清华)2B4.62 GiB / ~4.6 GiBApache-2.0 ✅✅ 官方 ~8 GB✅ starsFriday/ComfyUI-VoxCPM、nkxx188/ComfyUI-VoxCPM-nkxx🟡 中文 CER 4.4%(VoicePing 最低=最好),但情感仅 35.0%✅ zero-shot + 音色设计;支持 LoRA 训练🟠 3.0s(RTF 0.30 @4090)/🟡 98s(RTF 9.84,GPU 未标)
Fun-CosyVoice3-0.5B-25120.5B9.08 GiB / ~4.2–5.2 GiBApache-2.0 ✅✅(5060 Ti 实跑;"6G 勉强、8G 可跑")✅ 4+ 套(ComfyUI_FL-CosyVoice3 ⭐)🟠 CER 0.81(RL)/ SS 77.4;🟡标识符 90% 最佳,但货币错误多✅ 3–30s zero-shot + instruct 情感/方言🟡 18.8s(RTF 1.88 @5060 Ti,第三方);🟠 部分用户报 RTF>2
MOSS-TTS-Local-1.7B / v1.5-8B1.7B / 8B8.49 / 15.83 GiBApache-2.0 ✅✅ 官方称 8B 经 llama.cpp 优化后可跑 8GB GPU✅ richservo/comfyui-moss-tts🟠 Local-1.7B ZH SIM 79.62(表内最高) / CER 1.44✅ 稳定克隆未查到统一数字
OmniVoice(k2-fsa)~0.6B~3.3 GBApache-2.0 ✅✅ 第三方 5060 Ti ~4 GB✅ Saganaki22/ComfyUI-OmniVoice-TTS⚠️ 600+ 语种但长尾;🔴 Blackwell 有未修乱码 bug✅ zero-shot + 音色设计🟡 ~1.2 秒(5060 Ti 上 0.6s / 5s 音频)
VibeVoice-1.5B(微软)1.5B5.04 GiB⚠️ MIT vs research-only 冲突✅✅ bozoyan/ComfyUI-VibeVoice🟠 CER 1.16 / SIM 74.4❌(多说话人长音频)未查到
GLM-TTS / GLM-TTS-RL1.5B / 3B ⚠️8.28 GiBMIT / Apache-2.0 ✅⚠️ 理论可,无实测❌ 未查到任何节点🟠 CER 0.89(RL,表内最低) / SIM 76.4✅ 3–10s未查到
Kokoro-82M-v1.1-zh82M0.37 GiB / 0.31 GiBApache-2.0 ✅✅ <3 GB✅ 2 套⚪ 未查到权威中文 MOS/CER;社区报"Mandarin problem"❌ 不支持克隆未查到
Fun-CineForge(阿里通义)⭐未查到12.68 GiB(主干 ~9.6GB)Apache-2.0 ✅⚠️ 理论可,无 16GB 实测❌ 未查到专为影视配音 + 唇同步时间对齐设计✅未查到
F5-TTS0.3B6.28 GiB / ~1.2 GiB🔴 权重 CC-BY-NC✅✅CER 1.53 / SIM 76✅未查到
SparkTTS0.5B3.67 GiB🔴 权重 CC-BY-NC-SA✅未查到专用CER 1.54 / SIM 66(最低)✅未查到
Fish Audio S2 Pro4B10.26 GiB🔴 商用需单独授权✅✅ TTS-Audio-Suite🟡 数字综合 79.3% 第一(需开厂商正则)✅🟠 2.0s(RTF 0.195)
ChatTTS未查到—🔴 AGPL + CC-BY-NC✅ <4GB⚠️ 仅 LLM_party🔴 音质被官方故意加噪降质❌🟡 ~3s
MegaTTS 3(字节)未查到3.98 GiBApache-2.0 ✅✅ 节点称 ≥4GB✅ 2 套未见第三方中文数字✅(需 WAV+NPY 对)未查到

4.4 🏆 TTS Top3 推荐(针对本机中文口播链路)

排序逻辑:因为这是本机选型,我把 ① sm_120 能否顺利跑起来 ② 速度是否阻塞链路 的权重提到与"效果"同级——配音是链路上游,出 10 秒音频等 30 秒会让整条流水线窒息。

🥇 Top1:GPT-SoVITS v2ProPlus —— 先跑通链路的零风险选择

理由

  1. 🟢 速度断层第一:RTF 0.028 @RTX 4060 Ti(项目自述,给了 GPU 型号)→ 10 秒音频约 0.28 秒;4090 上 RTF 0.014。这是全表唯一能把配音耗时压到"用户无感"的方案。
  2. 🟢 对 sm_120 最友好:README"测试通过环境"明确列出 PyTorch 2.7.0/CUDA 12.8 与 2.8.0dev/CUDA 12.8 —— torch 2.7+ 才有完整 Blackwell 内核。在 8 个候选里它是踩坑概率最低的(对比 CosyVoice 有 #1318「5060ti 无法启动」、IndexTTS 有 #295「GPU 检测失败」)。
  3. ✅ MIT 许可,无任何附加条件(比 bilibili 许可更干净:没有 MAU/营收红线,也没有"不得用于改进其他模型"的条款)。
  4. 音色克隆是绝对强项:5 秒 zero-shot / 1 分钟 few-shot 微调(相似度超 zero-shot)——适合"固定主播音色跨多条视频一致"这一口播刚需。
  5. 中文原生核心场景:文本前端含 g2pW/pypinyin-g2pW,多音字处理是卖点之一。
  6. GitHub 61,999 ★、最后提交 2026-08-18,中文社区生态最厚。

最致命的坑

🥈 Top2:IndexTTS-2.5 —— 中文口播"效果 × 可控性"综合最优

理由

  1. 🟢 音色 + 情感解耦是同级唯一:8 维情感向量(喜怒哀惧厌郁惊平)+ 情感参考音频 + emo_text 文本情感 + duration_factor(0.5–2.0 语速)。口播最缺的就是"同一音色、不同情绪/语速"的稳定可控——CosyVoice 的 instruct 与 GPT-SoVITS(无情感控制)都比不上。
  2. 🟡 中文数字安全性最好:VoicePing 数字基准 小数 100%(唯一满分),明显优于 Qwen3-TTS 的 86.7%。
  3. ✅ 许可证商家友好:bilibili 许可免版税、普通规模免费商用(只有 >1亿 MAU 或 >10亿 RMB 年收入才需单独授权)。
  4. ✅ ComfyUI 节点质量最高:joyfoxai/ComfyUI-Index-TTS-25 一套节点同时支持 2 与 2.5(读 config.yaml 的 version 字段),内置官方源码、5 种情感模式、已兼容 transformers 4.52.1~4.57.x、并修掉了 TorchAudio 2.9 整数 PCM 保存导致的严重削波;README 把依赖坑(fugashi+unidic-lite、WeTextProcessing、g2p-en、jieba、cn2an、descript-audiotools)全列清楚了。
  5. 🟢 官方在推生产化:vLLM recipe 已开源;arXiv 2607.21042 给出 TensorRT/TensorRT-LLM 的 3.6× 端到端加速方案 → 未来提速有明确路径。
  6. 显存峰值 ~7.3 GB,16GB 有一倍余量。

最致命的坑

🥉 Top3:Qwen3-TTS-12Hz-1.7B(Base / CustomVoice) —— 2026 年最大变量、质量上限最高

理由

  1. 🟡 第三方中文评测综合第一:VoicePing(2026-09-20)原文——"Qwen3-TTS CustomVoice 1.7B is the strongest balanced model in this benchmark":中文 CER 9.7%、中文情感识别 53.3%(最高)、唯一中文 anchor margin 为正(+0.0448)、NISQA-TTS 4.007。
  2. ✅ Apache-2.0,无任何附加条款;2026 年下载量最大(1.7B-Base 388 万、0.6B-CustomVoice 102 万)→ 生态活跃、修复快。
  3. ✅ 两套 ComfyUI 节点都成熟:AICoderTudou/ComfyUI-TD-Qwen3TTS、flybirdxx/ComfyUI-Qwen-TTS(后者支持 sage_attn/flash_attn/sdpa/eager 自动降级,并明确提示 no kernel image is available 是 CUDA 内核缺失而非注意力问题,还提供 unload_model_after_generate 释放显存);另有 GGUF(Serveurperso/Qwen3-TTS-GGUF,下载 288,188)。
  4. 支持 VoiceDesign(用一句话描述声音生成音色)——如"沉稳的中年男声、新闻播报感"直接生成,不用找参考音频。
  5. 0.6B 档存在(2.34 GiB)→ 可先用 0.6B 跑通链路再换 1.7B,同一套节点无需改代码。

最致命的坑

📌 值得同步试的第四选项:VoxCPM2(中文文本保真度冠军)

4.5 ❌ TTS 淘汰/降级清单

模型判定原因
F5-TTS❌ 淘汰🔴 权重 CC-BY-NC 非商用(代码 MIT 掩盖不了权重许可)——商用红线一票否决;且 2025-03 之后无新版模型
SparkTTS❌ 淘汰🔴 权重 cc-by-nc-sa-4.0 + 停更 1.5 年 + SIM 66 全场最低;且 wav2vec2 就占 1.2GB,性价比差
Fish-Speech / S2 Pro❌ 淘汰🔴 LICENSE 原文要求任何商业用途需单独授权;VoicePing 峰值显存 13.05GB(最高);情感内联标记基本失效
ChatTTS❌ 淘汰🔴 AGPL-3.0 + 权重 CC-BY-NC 双杀;且音质被官方故意加噪降质(防滥用)→ 对口播是致命的;不支持克隆
Higgs Audio v3❌ 淘汰🔴 Research and Non-Commercial License
DramaBox❌ 淘汰需 ~24GB VRAM(fast mode),官方明说不保证最低 GPU
Step-Audio 2 mini❌ 淘汰HF 总 16.66 GiB,fp16 塞不下 16GB;且定位是语音理解/对话(ASR+S2ST),非纯口播 TTS
Kokoro-82M-v1.1-zh⚠️ 降级为备用Apache-2.0、<3GB、TTS Arena Elo 1178(前十唯一开源小模型);但(a)中文档停更 1.5 年(2025-03-04)(b)❌ 不支持音色克隆 → 无法满足"固定主播音色"这一口播刚需
GLM-TTS⚠️ 降级为跟踪项中文 CER 0.89(RL)全表最强之一、许可可商用、8.28 GiB 可控;但 ❌ 未查到任何 ComfyUI 节点(TTS-Audio-Suite 19 引擎里也没有)+ 参数量口径冲突(1.5B vs 3B)+ 无 16GB 实测
OmniVoice⚠️ 降级待观察速度/Apache/体积都极优(5060 Ti 上 0.6s/5s、~4GB);但 🔴 Blackwell 有未修的乱码 bug(#155,5090 复现)+ sm_120 微调撞 shared memory 墙(#83) → 在你的卡上属高风险。另注:中文报道称"小米开源 OmniVoice",但仓库实为 k2-fsa/OmniVoice(k2-fsa 组织),未查到与小米的官方关联 → 该报道疑似误标
Fun-CineForge⚠️ Phase-2 观察项Apache-2.0、与"配音+唇同步"方向最对口(影视级配音 + 时间模态对齐,基于 CosyVoice3);但仅 48 次下载(极冷)、无 ComfyUI 节点、无 16GB 实测、主干 9.6GiB。且它是"给已有视频配音"的定位,而你的音频是给数字人模型当驱动信号的——能力不完全等价
VibeVoice⚠️ 需自核许可HF 卡 MIT vs 第三方标 research-only 冲突;TTS 侧 2026 年停止推进(近期更新全在 ASR);中文 SIM 74.4 偏低
MegaTTS3⚠️ 降级Apache-2.0 没问题;但停更 1.5 年、克隆需 WAV+NPY 文件对(不如"丢个 wav 就行"方便)、未查到任何第三方中文客观数据
MOSS-TTS / MOSS-TTSD⚠️ 备选 Plan BApache-2.0 + 官方称 8B 经 llama.cpp 优化后可跑 8GB GPU + 节点齐全 + Local-1.7B ZH SIM 79.62(最高);但未查到 16GB/5060Ti 实测 + 基准含大量厂商自测 + 单人场景用不上 TTSD 的对话能力
CosyVoice3⚠️ 从 Top1 降为备选中文效果与生态都很好(4+ 套节点、18+ 方言、5060 Ti 实测 RTF 1.88);但 🔴 有直击本机的 issue:#1318「5060ti 16g 运行 cosyVoice2 无法启动」、#1815「PyTorch 2.4+ & RTX 50-series sm_120 兼容问题」 → 必须按 issue 方案先验证能否启动。另 vllm 版本未给明确 pin(#1847)、pynini 安装困难

4.6 落地顺序建议(针对本机)

Phase 1(1 天内跑通整条链路)
  └─ GPT-SoVITS v2ProPlus(bash install.sh --device CU128)
     → 用 5s~1min 素材做音色;先打通「文案 → 配音 → 数字人口型同步」
     → 选它的原因:MIT、sm_120 最不易踩坑、RTF 0.028 快到不阻塞链路

Phase 2(升级质感)
  └─ IndexTTS-2.5 + joyfoxai/ComfyUI-Index-TTS-25
     → 补上情感/语速控制,做「同一主播、多情绪」的口播矩阵
     → 必做预处理:把数字展开成汉字

Phase 3(追质量上限,A/B 试听)
  └─ Qwen3-TTS-1.7B-CustomVoice(锁 transformers==4.57.3 + eager 注意力)
     或 VoxCPM2(48kHz,中文 CER 4.4%)

全程遵守
  ├─ 参考音频 ≤3.5s(防显存尖峰;OmniVoice 有 >4s 飙到 8GB 的报告)
  ├─ 不开 sage_attn,一律 sdpa / eager
  ├─ torch 用 cu128+(本机 2.11.0+cu130 ✅)
  └─ 与数字人模型串行执行(16GB 绝不同时驻留两个大模型)

⚠️ 一条跨所有 TTS 的通用规则:没有一个中文 TTS 能可靠地读长数字串。Qwen3-TTS 标识符 0%、IndexTTS 标识符 40%、CosyVoice3 标识符 90% 但货币项只有 46.7% 且错误多为把金额本身改掉。 → 把"数字/金额/编号展开成汉字"写进 pipeline 的预处理,这是本链路最容易被忽略、后果最严重的一环。


5. 完整离线口播链路组装(本机 16GB 实测参数建议)

5.1 显存排班(TTS 与数字人模型分时复用)

阶段模型权重常驻峰值显存备注
① 配音GPT-SoVITS v2ProPlus(0.21B)~1 GiB 级≤3 GB可与 ComfyUI 共存;CPU 也能跑;升级档 IndexTTS-2.5 ≈5.1 GiB / Qwen3-TTS-1.7B ≈4.2 GiB
② 口型EchoMimicV3-Flash-pro3.47 GiB6.5~12 GB(768×512 开 block_offload)主战场
③(可选)修嘴LatentSync 1.5~5 GB~8 GB官方最低 8 GB
合计——分时执行,无需同时常驻本机 ComfyUI 已 --lowvram --reserve-vram 1.0,够用

⚠️ 不要同时加载 TTS 与数字人模型:16GB 会被 VAE + 文本编码器挤爆。先出 WAV,再跑口型。

5.2 端到端操作顺序

  1. 写中文文案 → 建议按句切分(每段 ≤20 秒音频,避开 32GB 内存瓶颈)
  2. ComfyUI 里跑 TTS(详见 §4.6 三阶段):
    • Phase 1:GPT-SoVITS v2ProPlus → 5s~1min 参考音频做音色 → 导出 WAV(最快、最不易踩 sm_120 坑)
    • Phase 2:IndexTTS-2.5 → 8 维情感向量 + 语速控制(duration_factor 0.5–2.0)
    • Phase 3:Qwen3-TTS-1.7B-CustomVoice(锁 transformers==4.57.3 + eager 注意力)或 VoxCPM2(48kHz)
    • 🔴 无论用哪个:先把文案里的数字/金额/编号展开成汉字(没有中文 TTS 能可靠读长数字串)
  3. EchoMimicV3-Flash-pro → 768×512 + block_offload=on + partial_video_length=97 + TeaCache → 出片
  4. (可选)LatentSync 1.5 精修口型(注意必须正脸 + 25fps + 全片有人脸)
  5. ffmpeg 拼接多段成片

5.3 关键时间预期(10 秒中文口播,本机)

环节预期耗时依据
TTS 配音约 10~30 秒L40S 上 RTF 0.87 → 10 秒音频 ≈ 8.7 秒;5060 Ti 按 2~3 倍算
口型生成约 10~12 分钟L40S 实测 3.63s→252s 外推(5060 Ti 需自测,可能更慢)
(可选)LatentSync 修嘴约 2~6 分钟🟨 3060 12G 上 10 秒约 2~6 分钟(旧数据)
合计约 12~20 分钟 / 10 秒成片—

6. 客观质量数据汇总

6.1 🟢 跨模型 SyncNet 横比(Avatar-Forever 论文,2026-08)

来源:arXiv 2608.12107(港理工 + 字节 + AMD)。EMTD 数据集,每项为「5 秒 / 30 秒」两档。

模型LLM Judge Overall↑Sync-C↑Sync-D↓FID↓延迟(s)↓
InfiniteTalk3.39 / 3.966.73 / 6.818.00 / 7.9539.25 / 37.6351.5 / 309.2
OmniAvatar3.57 / 2.265.57 / 6.839.47 / 8.5961.62 / 115.84850 / >1 小时
LiveAvatar3.65 / 4.126.67 / 6.628.45 / 8.0839.23 / 61.1753.0 / 321.0
SoulX-FlashTalk3.68 / 3.986.83 / 6.837.97 / 7.9638.91 / 33.4625.4 / 125.3
Avatar-Forever(本文)3.82 / 4.327.56 / 6.857.95 / 7.9438.37 / 33.335.2 / 38.9

🟢 用户盲测投票(Table 2,EMTD 长视频档,20 人,归一化 0–100)

模型得分
Avatar-Forever76.00
SoulX-FlashTalk60.23
LiveAvatar57.68
InfiniteTalk55.33
OmniAvatar40.20(垫底)

⚠️ 局限:论文未标注延迟测量所用 GPU → 延迟绝对值只能相对比较,不能外推到 5060 Ti。该表未包含 MultiTalk / EchoMimic / FlashHead / LongCat / Wan2.2-S2V。

6.2 🟢 跨模型 LSE 横比(arXiv 2608.16220,2026-08)

模型参数量LSE-C↑LSE-D↓
InfiniteTalk—8.5357.108
HunyuanVideo-Avatar12.99B7.2108.494
Wan-S2V—6.9998.292
Hallo3—5.3529.828

来源:arXiv 2608.16220(表 4,EMTD)。⚠️ 量级与经典 SyncNet 不同,只能同表内比较。

6.3 🟢 EchoMimicV3 论文 Table 1(512×512 半身,随机 300 条)

方法Sync-C↑Sync-D↓FID↓FVD↓IQA↑ID↑
EchoMimicV3-1.3B5.499.6742.45(最优)496.76(最优)4.911.0
HunyuanAvatar-14B6.129.1142.54676.284.961.0
OmniAvatar-1.3B5.619.5853.24705.214.920.97
Hallo35.429.6568.6865.324.40.91
FantasyTalk-14B4.05(最低)11.01(最差)45.03603.954.850.96

来源:arXiv 2507.03905v3。读法:EchoMimicV3 用 1.3B 打赢了 14B 的 FantasyTalk,并在 FID/FVD 上全表最优。

6.4 🟢 InfinityHuman 论文的 EMTD / HDTF 对比(arXiv 2508.20210)

EMTD(110 段 720P 半身带手,最长 74 秒):

方法FID↓FVD↓IQA↑Sync-C↑Sync-D↓
Hallo374.10250.121.957.319.30
MultiTalk85.01404.451.788.767.69
OmniAvatar131.69705.141.678.817.76
HunyuanVideo-Avatar100.10662.611.527.228.98
InfinityHuman(本文)69.28239.052.118.597.53

HDTF(100 段 512×512):

方法FID↓FVD↓IQA↑Sync-C↑Sync-D↓
OmniAvatar82.541104.992.165.409.13
MultiTalk103.681040.432.076.348.47
Hallo3104.511256.102.314.2610.22
FantasyTalking133.731307.202.111.1112.88
HunyuanVideo-Avatar139.392160.921.764.899.37

⚠️ 这是 InfinityHuman 作者自己的复现实验,会系统性偏向自研方法;且不含 2026 年新模型。只用于老模型之间的相对排序。

6.5 🟢 静音测试与唇形重绘系对比(HighSync,arXiv 2605.16918,2026-05)

方法HDTF LSE-C↑静音测试(越低越"没在听音频")人类评分:图像/同步
LatentSync7.580.813.95 / 3.68
Wav2Lip7.380.843.78 / 3.22
MuseTalk6.210.68(最差)4.34(最高)/ 3.14(最低)
HighSync(本文)—0.93(最好)— / 4.01

静音测试的含义:给模型一段静音,看嘴动不动。MuseTalk 0.68 说明"不上音频也在动嘴"。

6.6 🟢 EvalTalker 到底是什么 —— 已查明,它不是 LSE 排行榜

结论:不存在"EvalTalker 2026 榜单排名"可引用。 2026 年主流横评用的是 SyncNet 的 Sync-C / Sync-D,不是 LSE-C / LSE-D。


7. 淘汰原因汇总与"未查到"清单

7.1 8 个重点模型的最终判定

模型判定核心原因
EchoMimic V3 / V3-Flash✅ 采用(Top1)官方测试过 V100 16G;768×512 仅 6.5GB;原生中文;Apache-2.0;有 ComfyUI 节点与第三方一键脚本
InfiniteTalk🟡 备选ComfyUI 官方核心原生节点;中文原生;Apache-2.0;但 3 分钟视频吃 >120GB 内存、10 秒要 30~60 分钟
LongCat-Video-Avatar 1.5🟡 中期实验MIT + 13.6B + 原生多人 + 长视频;但 v1.5 夸张表情缺陷至今未修、sm_120 专项警告、480p 44 秒要 2 小时
HunyuanVideo-Avatar🟡 仅在需要多人对话时Wan2GP 10GB 路径;但许可排除 EU/UK/KR、官方 ComfyUI 一年未落地、停更 9 个月
Wan2.2-Animate-2❌ 场景不匹配不吃音频(要驱动视频);且 GGUF 有静默失败陷阱
Wan2.2-S2V-14B❌ 淘汰官方要求 ≥80GB,第三方实测 57.3GB,无 16GB 成功案例;16fps
OmniAvatar❌ 淘汰官方称需 64GB 内存(本机 32GB);1.3B 版生态为零;停更 13.5 个月
FantasyTalking❌ 淘汰官方最低 20GB;5G 档 42.6 s/it 不可用;停更 13 个月;中文前端是英文;量化失败归档;唇形同步垫底

7.2 其余候选的一句话判定(本场景下)

模型判定一句话
SoulX-FlashHead Lite 1.3B✅ 强备选🟢 峰值 5.76 GB(唯一两组第三方独立验证 <16GB)、热块 0.19 秒、Apache-2.0;但画质最弱(英中两组实测均称"不真实")、仅 512×512、中文能力仅厂商宣称未验证
MuseTalk 1.5✅ 仅"给已有视频换嘴型"时4GB 可跑、42FPS 实时、中英日;但静音时也动嘴、256×256、ComfyUI 主节点停更
LatentSync 1.5✅ 可作修嘴环节最低 8GB、官方明示改善中文;但停更一年 + 228 open issues + 必须正脸 25fps
LatentSync 1.6❌官方 18GB > 16GB
daVinci-MagiHuman❌ 场景不匹配文本→(视频+语音)联合生成,不接受外部音频;社区 fp8 分支作者自称跑不起来
LTX-2.5 / JoyAI-Echo echoVid❌ 场景不匹配同上,"renders picture and sound in one pass";许可非标准 OSI
LiveAvatar(ECCV 2026 Spotlight)❌ 硬件不够单卡 ≥80GB,FP8 后 48GB;但第三方横评里质量第一、耗时最短,值得盯盘
SoulX-FlashTalk-14B❌单卡 >64GB,--cpu_offload 后 40GB
HunyuanPortrait❌根本不是音频驱动(参考图 + 驱动视频);仅学术用途禁止商用;零量化方案
MoCha(Meta 版)❌从未开源代码或权重(GitHub 1 星,只有演示 mp4)
MoCha(Orange-3DV 版)❌ 场景不匹配CVPR 2026,AGPL-3.0,是视频换人模型
Wan2.5 / Wan3.0❌🔴 不存在开源权重;"Wan2.5-S2V"不是开源模型
Ditto⚠️8GB+ 可跑但 TRT 引擎按 Ampere_Plus 编译,sm_120 必须重转
Hallo3 / Hallo4❌官方只吃英文;Hallo3 受 CogVideoX LICENSE 约束;Hallo4 无 LICENSE 文件且仅 38★
Sonic❌CC BY-NC-SA 明确不可商用;官方基线是 32G GPU
Wav2Lip❌🚫 明令禁止商用(LRS2 训练)
DreamID-Omni⚪ 可试Apache-2.0、FP8 ~12GB、模型卡写"Recommended for ≤16 GB GPUs";但语言标 en、无第三方实测

7.3 明确"未查到"的清单(不编造)

显存/速度类

  1. EchoMimicV3-Flash 在 5060 Ti / sm_120 上的实测秒数(L40S 与官方 12GB 数据不能直接外推)
  2. HunyuanVideo-Avatar 走 Wan2GP 10GB 路径的任何「N 秒视频耗时」(只有 2025-06 的宣称;2026-01 有用户抱怨"太慢",作者答"没有现成 LoRA 加速器")
  3. HunyuanVideo-Avatar 在 16GB 卡上的任何成功实测(成功/失败都没有,只有 RTX 4070 Ti 16GB + 32GB RAM 的提问)
  4. HunyuanVideo-Avatar 在 32GB 系统内存下能否跑 int8(成功案例全带 96/97/192GB RAM → 本机只能标为推断偏不可行)
  5. Wan2.2-S2V 在 12GB/16GB 卡上的任何成功实测,及任何消费级卡的峰值显存数字
  6. 「S2V 在 16GB 上必须把文本编码器 CPU offload」的明确第三方表述(官方文档不给显存门槛)
  7. Wan-Animate-2 的 GGUF Q4_K_M 在 16GB 上的实测显存与速度(拿到的是 int8_convrot 的 7.3GB / 126.8s,不是 GGUF)
  8. WanAnimate2Cache 的实际加速比——只有官方"约减半"宣称,零第三方 A/B 数字
  9. OmniAvatar 在 16GB 上的任何实测
  10. FantasyTalking 在 16GB 上的任何成功实测(只有 RTX 5070 Ti 16GB 的失败报告)
  11. InfiniteTalk 在 5060 Ti / 4060 Ti 上的具体耗时(5060 Ti 只有"跑通",5080 的 1300s/5s 只能当上界参考)
  12. LongCat 1.5 的官方最低显存数字(官方从未声明)与其 LSE 数字
  13. MoCha(Meta 版)的权重、显存、许可证(从未开源)
  14. 多数中文 TTS 在 5060 Ti 上的实测速度(已拿到 3 个:CosyVoice3 RTF 1.88、IndexTTS-2 RTF 2.92(同一台 5060 Ti 对照)、OmniVoice ~0.6s/5s;但 GPT-SoVITS / Qwen3-TTS / VoxCPM2 / GLM-TTS 在本机型上均无实测)
  15. 各中文 TTS 的 int8 / GGUF 量化后显存与 RTF 对照——只知道存在这些量化仓库(Serveurperso/Qwen3-TTS-GGUF、Richasy/IndexTTS-2.5-GGUF、cstr/cosyvoice3-0.5b-2512-GGUF、DennisHuang648/VoxCPM2-GGUF、OpenMOSS-Team/MOSS-TTS-GGUF、Serveurperso/OmniVoice-GGUF),无任何权威量化对照表
  16. VoicePing 两个基准所用 GPU 型号——其资源表只有 GPU util/power,未给型号,故其 RTF 绝对值可信度受限(已按 🟡 标注)
  17. CosyVoice / IndexTTS 的 sm_120 issue 具体修复命令——只能确认 issue #1815 / #1318 / #295 存在且标题直指问题,但本机 GitHub HTML 与 API 均不可达,无法读正文 → 需在能访问 GitHub 的环境自行核对
  18. GPT-SoVITS 的第三方中文 CER/MOS/SIM——它完全未被 VoicePing 两个基准、MOSS 官方表、CosyVoice 官方表收录
  19. GLM-TTS 的官方或社区 ComfyUI 节点 + Fun-CineForge / Step-Audio 2 的 ComfyUI 节点——多轮检索(含 ComfyUI Manager 生态、TTS-Audio-Suite 19 引擎清单)均未发现
  20. 一份可信的、带 GPU 型号与可复现命令的《2026 中文 TTS 大横评》——知乎那篇《开源语音大模型中文表现三级分级对比报告》返回 HTTP 403 无法核验;其余中文横评多为无 GPU 型号的聚合/AI 生成内容,均不采信

社区/来源类

  1. Reddit r/comfyui、r/StableDiffusion 的原文 —— 本机 reddit.com DNS 被污染,所有 redlib / safereddit 镜像亦超时 → 本次一条 Reddit 原文都没取到;涉及 Reddit 的说法全部来自搜索引擎索引层转述,按二手降级
  2. 知乎 / B站帖文原文 —— 本机 403 / 不可达;社区口碑改用 GitHub Issues + HF 讨论区 + CSDN / SegmentFault / dev.to 替代
  3. 部分 GitHub issue 正文 —— 通过 gh-proxy.com 代理 GitHub API 取得大部分,少量仅能核验编号与标题

⚠️ 已识别并剔除/降级的不可信来源

  • 两篇 CSDN「Wan2.2-S2V-14B 性能基准测试」:AI 批量生成的伪评测,含明显编造(把 4090 写成 16GB 显存、虚构 moe_expert_capacity 参数、编造 L40/A6000/H100 全套数据)→ 本文未采信其任何数字
  • instavar.com/pdf/HunyuanVideo_Avatar_*.pdf、instavar.com/pdf/InfiniteTalk_*.pdf:SEO 聚合站自动生成的 "TL;DR" 页,无原始测量、无 GPU 型号 → 剔除
  • CSDN《数字人EchoMimicV3 落地实践》(2026-08-19):逐段读过——内容实为官方 README 复述 + 环境报错修复,"最低 16G / Flash 版 12G"与官方口径一致,但全文没有任何显卡型号 + 耗时 → 仅作旁证,不作数据源
  • 今日头条《8G显存跑数字人?LongCat 实战指南》等标题党:数据为厂商宣称搬运 → 未采信
  • 一篇 Sonic 显存实测帖(CSDN):行文高度模板化、疑似 AI 生成 → 已标注"可信度低,仅作量级参考"
  • 唯一需注明出处的 AI 参与案例:SageAttention #321 中某用户的修复代码自述"由 Gemini V3 提供"——代码来源存疑,但其硬件/版本事实(5060 Ti / torch 2.9.1 / triton 3.6 / sa3.0 / 马赛克伪影)可用

提醒:2026 年"数字人选型 / TTS 选型"是流量话题,中文平台 AI 伪横评极多。凡未给 GPU 型号 / 未给可复现命令 / 数字过于整齐的表格,先怀疑。


8. 方法与来源

8.1 检索方法

8.2 可信度分级

8.3 主要来源(按主题)

数字人模型:Tight Studio 六模型横评 2026-08 · Avatar-Forever arXiv 2608.12107 · EchoMimicV3 arXiv 2507.03905 · InfinityHuman arXiv 2508.20210 · HighSync arXiv 2605.16918 · PC-Talk arXiv 2503.14295 · LSE 横比 arXiv 2608.16220 · EvalTalker arXiv 2512.01340 · ComfyUI 官方 Wan2.2-S2V 教程 · ComfyUI Wan-Animate-2 博客 · LongCat-Video GitHub · InfiniteTalk GitHub · OmniAvatar GitHub · HunyuanVideo-Avatar GitHub · EchoMimicV3 GitHub · FantasyTalking GitHub

ComfyUI 生态:smthemex/ComfyUI_EchoMimic · vokilook/comfyui-echomimic-setup · rookiestar28/ComfyUI-LongCat-Avatar · kijai/ComfyUI-WanVideoWrapper · ComfyUI PR #10179 · HM-RunningHub/ComfyUI_RH_FlashHead · Wan2GP

sm120 / Blackwell:Rogala/AI_Attention(RTX 5000 系加速包) · woct0rdho/SageAttention · kijai #1875(RTX 5060 修复) · LongCat #141(sm120 警告)

中文 TTS(横评与实测):OpenMOSS/MOSS-TTS 对比表 · VoicePing 中文情感 TTS 基准 · VoicePing 中文数字保真基准 · cosyvoice-docker BENCHMARK(L40S,RTF 0.87) · 托尼不是塔克:CosyVoice3/IndexTTS2 在 5060 Ti 16G 实测 RTF 1.88/2.92 · smeltcore 5060 Ti 配方库 中文 TTS(模型与许可):Fun-CosyVoice3-0.5B-2512 · Qwen3-TTS-1.7B-Base · IndexTTS-2.5 · IndexTTS LICENSE(bilibili 协议原文) · GPT-SoVITS · VoxCPM2 · GLM-TTS · F5-TTS LICENSE(CC-BY-NC) · Fish-Speech LICENSE · ChatTTS LICENSE · VibeVoice-1.5B · Fun-CineForge · OmniVoice(k2-fsa) 中文 TTS(ComfyUI 节点):filliptm/ComfyUI_FL-CosyVoice3 · joyfoxai/ComfyUI-Index-TTS-25 · AICoderTudou/ComfyUI-TD-Qwen3TTS · flybirdxx/ComfyUI-Qwen-TTS · AIFSH/ComfyUI-GPT_SoVITS · nkxx188/ComfyUI-VoxCPM-nkxx · richservo/comfyui-moss-tts · diodiogod/TTS-Audio-Suite(19 引擎) 中文 TTS(sm_120 直击本机的 issue):CosyVoice #1318(5060ti 16g 无法启动) · CosyVoice #1815(PyTorch 2.4+ & RTX50 系 sm_120) · IndexTTS #295(GPU 检测失败) · OmniVoice #155(Blackwell 乱码) · OmniVoice #83(sm_120 shared memory 墙) · flash-attention #2168(sm_120 无内核)


文档生成时间:2026-09-22|范围:2026-09 时点可得公开信息 下载页:http://192.168.31.76:8899/49-数字人选型调研/离线音频驱动数字人模型调研.md?preview=1

下载此文件