调研截止日期:2026-09-22。调研目标:为「实时数字人 / 口播视频」链路选 TTS,重点关注中文自然度、说话人相似度、流式首包延迟、16GB 单卡(RTX 5060 Ti 16GB, sm_120 Blackwell)可跑性、商用许可、与数字人框架的现成集成。
数据纪律:每条关键结论后附实际抓取过的 URL。查不到的字段写「未查到」,不做推测。厂商宣称与第三方实测分开标注。
抓取方式:本机
web_fetch常超时,全部用curl(脚本/tmp/dh/f.sh、/tmp/dh/txt.sh)。GitHub star/license/last-commit 走 shields.io;arXiv 用export.arxiv.org/api/query校验;HuggingFace 官方域名被墙,模型卡走 hf-mirror.com。
数值口径不完全统一(SIM-o / SIM / SS 三种写法),已标注来源。
| 模型 | 参数 | 中文 CER/WER ↓ | 说话人相似度 ↑ | 流式 | 商用许可 | 来源性质 |
|---|---|---|---|---|---|---|
| Fish Audio S2 Pro | 4B | 0.54% | 未查到(表内未给 zh SIM) | ✅ TTFA <100ms | ❌ 需单独授权(HF 门禁强制 "non-commercial use ONLY") | 厂商 |
| Qwen3-TTS-12Hz-1.7B-Base | 1.7B(实 1.93B) | 0.77%(自报)/ 1.22–1.33%(第三方) | 0.799(自报)/ 76.7–77.0(第三方) | ✅ 原生双轨流式,端到端延迟低至 97ms | ✅ Apache-2.0 | 厂商 + 第三方 |
| OmniVoice(小米) | 0.8B | 0.84% | 0.777(SIM-o) | ❌ NAR 非流式 | ❌ 权重 CC-BY-NC | 厂商(论文 Table 1) |
| GLM-TTS-RL | 1.5B | 0.89% | 76.4 | ✅ 支持(需 vLLM) | ⚠️ GitHub Apache-2.0 vs HF mit 冲突 | 厂商 + 第三方(一致) |
| VoxCPM-0.5B | 0.6B | 0.93% | 77.2 | ❌(1.5/2 版才流式) | ✅ Apache-2.0 | 第三方表 |
| IndexTTS2.5-RL | 0.8B | 0.93%(自家表 3.93*) | 77.92 / 76.4 | ❌ 官方无流式 | ⚠️ bilibili 自定义(有条件免费商用) | 厂商 |
| ⭐ VoxCPM2 | 2B(实 2.29B) | 0.97% | 79.5 | ✅ 官方 generate_streaming,RTF ~0.30@4090 / ~0.13 Nano-VLLM | ✅ Apache-2.0(HF 侧 frontmatter 已确认) | 厂商(OpenBMB 表) |
| IndexTTS2(2.5) | 0.8B | 1.03–1.21% | 76.5 / 77.1–78.0 | ❌ 官方无流式 | ⚠️ 同上 | 第三方表 |
| ⭐ LongCat-AudioDiT(美团) | 3.5B(实 3.83B) | 1.09% | 81.8(全场最高) | ❌ 非自回归扩散,非流式 | ✅ MIT | 第三方表 |
| FireRedTTS-2 | 1.5B | 1.14% | 73.6 | ✅ 首包 140ms(L20) | ✅ Apache-2.0 | 第三方三家一致 |
| Fun-CosyVoice3-0.5B-2512 | 0.5B | 1.21%(RL 0.81%) | 78.0(RL 77.4) | ✅ 双向流式,150ms(第三方实测 ~195ms) | ✅ Apache-2.0 | 厂商 |
| MossTTSDelay | 8B | 1.37% | 76.98 | ✅(Realtime 版 TTFB 180ms) | ✅ Apache-2.0 | 厂商 |
| ZipVoice | 123M | 1.40% | 0.751(SIM-o) | ❌ | ✅ Apache-2.0 | OmniVoice 论文 |
| MossTTSLocal | 1.7B | 1.44% | 79.62 | 同上 | ✅ Apache-2.0 | 厂商 |
| MegaTTS3 | 0.3–0.5B | 1.52% | 79.0 | ❌ | ✅ Apache-2.0 | 第三方两源一致 |
| F5-TTS | 0.3–0.4B | 1.52–1.53% | 74.1 / 76.0 | ❌ | ✅ MIT | 第三方表 |
| Spark-TTS | 0.5B | 1.54% | 66.0(最低之一) | ❌ | ❌ 权重 CC-BY-NC-SA-4.0 | 第三方两家一致 |
| GPT-SoVITS v2ProPlus | 229M | 1.6% | 0.737(SIM) | ❌ 无流式 | ✅ MIT | 厂商(官方 wiki) |
| ChatTTS | 未查到 | 未查到 | 未查到 | 部分(句级) | ❌ AGPL-3.0 + 权重 CC-BY-NC | — |
| Kokoro-82M | 82M | 未查到 | 未查到 | ❌ | ✅ Apache-2.0 | — |
| 1.55B | 未查到(官方自述非英语「likely won't do well」) | 未查到 | ❌ | ✅ Apache-2.0(但无中文) | — |
* IndexTTS2.5-RL 的 3.93% 出自其自家 CV3-Eval 表(不同测试集),0.93% 出自第三方对比表,两者不可直接比较。
⚠️ 四个「口径必须标注」的案例(同一模型不同榜单差异巨大):Qwen3-TTS 自报 0.77 vs 第三方 1.22–1.33(1.6–1.7×);Fish Audio S2 Pro 0.54 vs 3.62(6.7×);OmniVoice 0.84 vs 3.41(4×);GPT-SoVITS 1.6 vs 7.34(4.6×)。→ 任何单一数字都不足以定论。
⚠️ 已被排除的模型(许可原因):Spark-TTS 权重 CC-BY-NC-SA-4.0(不可商用)、Higgs Audio v2(HF license
other,主线 v3 明确非商用,且需 ≥24GB 显存)、VibeVoice-TTS-1.5B(微软 2025-09 已下架代码并标 Disabled,官方明文不建议商用)。详见 11.7。⚠️ sm_120 特别提示:Qwen3-TTS 是本次调研中唯一「sm_120 零 issue」的模型;而 GLM-TTS issue #9 直接报告 RTX 5060 Ti 16G 上 GPU 利用率仅 40%;VoxCPM2 有 #250/#282/#326 多个 Blackwell open issue。详见 13.1b / 13.2。
以 OpenBMB/VoxCPM README 的 Seed-TTS-eval 表为准(这是本次找到的覆盖最全的单张第三方表,25 个模型同一口径):
| 模型 | 参数 | test-ZH CER/%↓ | test-ZH SIM/%↑ | test-EN WER↓ | test-EN SIM↑ |
|---|---|---|---|---|---|
| FishAudio S2 | 4B | 0.54 | — | 0.99 | — |
| VoxCPM-0.5B | 0.6B | 0.93 | 77.2 | 1.85 | 72.9 |
| VoxCPM2 | 2B | 0.97 | 79.5 | 1.84 | 75.3 |
| IndexTTS2 | 1.5B | 1.03 | 76.5 | 2.23 | 70.6 |
| Qwen3-Omni | 30B-A3B | 1.07 | — | 1.39 | — |
| LongCat-Audio-DiT | 3.5B | 1.09 | 81.8 | 1.50 | 78.6 |
| Seed-TTS(闭源) | — | 1.12 | 79.6 | 2.25 | 76.2 |
| CosyVoice3 | 1.5B | 1.12 | 78.1 | 2.22 | 72.0 |
| FireRedTTS-2 | 1.5B | 1.14 | 73.6 | 1.95 | 66.5 |
| CosyVoice3 | 0.5B | 1.16 | 78.0 | 2.02 | 71.8 |
| VibeVoice | 1.5B | 1.16 | 74.4 | 3.04 | 68.9 |
| VoxCPM1.5 | 0.8B | 1.18 | 77.0 | 2.12 | 71.4 |
| OpenAudio-s1-mini | 0.5B | 1.18 | 68.5 | 1.94 | 55.0 |
| MOSS-TTS | — | 1.20 | 78.8 | 1.85 | 73.4 |
| Qwen3-TTS | 1.7B | 1.22 | 77.0 | 1.23 | 71.7 |
| CosyVoice2 | 0.5B | 1.38 | 75.7 | 3.09 | 65.9 |
| MegaTTS3 | 0.5B | 1.52 | 79.0 | 2.79 | 77.1 |
| F5-TTS | 0.3B | 1.53 | 76.0 | 2.00 | 67.0 |
| SparkTTS | 0.5B | 1.54 | 66.0 | 3.14 | 57.3 |
| Qwen2.5-Omni | 7B | 1.70 | 75.2 | 2.72 | 63.2 |
| MaskGCT | 1B | 2.27 | 77.4 | 2.62 | 71.7 |
| CosyVoice | 0.3B | 3.63 | 72.3 | 4.29 | 60.9 |
| FireRedTTS | 0.5B | 1.51 | 63.5 | 3.82 | 46.0 |
— OpenBMB/VoxCPM README Seed-TTS-eval 表(⚠️ 厂商侧整理的表,引用需注明来源)
读表要点:
本次调研确认:2026 年没有任何一个第三方 Elo 榜能评中文 TTS。
| 榜单 | 中文 | 关键事实 |
|---|---|---|
| Artificial Analysis TTS(唯一完整第三方 Elo 榜) | ❌ 纯英文(仅 US/UK 口音) | 90 个模型仅 16 个开源权重;中国开源模型(IndexTTS / CosyVoice 开源权重 / GPT-SoVITS / ChatTTS / F5-TTS / MegaTTS3 / OmniVoice / MOSS-TTS / VoxCPM2 / GLM-TTS / FireRedTTS-2)全部不在榜 |
| HuggingFace TTS Arena V2 | ❌ 原文 "Prompts are English-only for now" | 原始 Elo 也取不到(HF 被墙;hf-mirror 拒绝 Spaces) |
| TTS Spaces Arena(原始投票) | ❌ 英文单句朗读 | 我方统计 36,993 票:kokoro 98.4% 第一;GPT-SoVITS-ProPlus 仅 27.5% 垫底 |
| VoiceHub/kadirnar(独立英文 Seed-TTS-Eval) | ❌ 英文 | 33 模型 × 1088 条:Kokoro 0.96% 第一、OmniVoice 0.99%、VoxCPM2 3.35%(靠后)、GPT-SoVITS 2.64% |
三条必须记住的「英文榜陷阱」:
en,中文靠第三方权重,社区报告 C# 版中文「口音很重、听不太清」。→ 绝不能因为英文榜排名高就选它做中文。→ 选型纪律:中文只在 CV3-Eval / Seed-TTS-eval(test-zh)口径下比较(见 0.2b),并最终以自家场景自测为准。
⭐ 本次调研最大的三个「新增发现」(都改变了排序):
- Qwen3-TTS(阿里,Apache-2.0):首包 97ms(官方,全场最低)+ 原生流式 + 可商用 + 本次调研中唯一「sm_120 零 issue」的模型 → 实时链路首选。
- LongCat-AudioDiT(美团,MIT):中文 SIM 81.8(全场最高)+ MIT 最宽松许可,代价是非流式 → 离线口播场景的自定义最优解(离线本来就不需要流式)。
- 三个曾经的「热门候选」被许可/维护状态排除:Spark-TTS(权重 CC-BY-NC-SA-4.0)、Higgs Audio v2(主线转非商用 + 需 ≥24GB)、VibeVoice-TTS-1.5B(微软 2025-09 下架代码并标 Disabled)。
| 场景 | 首选 | 次选 | 理由 |
|---|---|---|---|
| 实时对话链路(要可商用 + 最低首包) | ⭐ Qwen3-TTS(97ms) | VoxCPM2 / Fun-CosyVoice3 | Qwen3-TTS:Apache-2.0 + 97ms + 原生流式 + sm_120 零 issue(唯一);LiveTalking 作者实测 0.6B + vLLM-Omni ~130ms。CosyVoice3:Apache-2.0 + 150ms(第三方 ~195ms)。VoxCPM2:Apache-2.0 + 官方 generate_streaming + RTF 0.13–0.30,但 sm_120 有多个 open issue |
| 离线口播成片(本项目实际形态,不需流式) | ⭐ LongCat-AudioDiT(MIT, SIM 81.8) | IndexTTS-2.5 / VoxCPM2 | LongCat:MIT + 中文 SIM 全场最高 81.8,非流式在离线场景不是缺点;短板是 3.83B F32 权重(16GB 需转半精度,待实测)。IndexTTS-2.5:CER 0.93–1.21% + 情绪/时长强可控 + 官方 6GB VRAM;VoxCPM2:CER 0.97/SIM 79.5 + 48kHz |
| 要商用 + 要最高中文自然度、可接受非流式 | IndexTTS-2.5 | MossTTSLocal 1.7B / MegaTTS3 | IndexTTS-2.5:~6GB 显存 + 情绪/时长强可控(IndexTTS2 的时长控制被第三方明确评价为「对口型同步非常有意义」) |
| 要 Apache-2.0 + 有明确 TTFB 数字 | Qwen3-TTS(97ms) | FireRedTTS-2(140ms)/ MOSS-TTS-Realtime(180ms) | 三者都是 Apache-2.0 + 官方 TTFB。FireRedTTS-2 显存 bf16 9GB,但锁 torch2.7.1+cu126 |
| 显存最省 + 零成本 | Kokoro-82M(82M, 可 CPU,第三方实测仅 480MiB) | GPT-SoVITS(229M, ~6GB) / ZipVoice(123M) | 显存几乎无需求 |
| 要 MIT 最宽松 | LongCat-AudioDiT(MIT) | GPT-SoVITS / F5-TTS | LongCat 中文 SIM 81.8 最强;GPT-SoVITS 229M 最省显存(中文 SIM 0.737,真人 0.750)但无流式 |
| 中文最强但只做研究/学习 | OmniVoice 0.8B(CER 0.84%) | Fish Audio S2 Pro(0.54%) | 均不可商用 |
| 最稳的 2026 新旗舰(显存与效果平衡) | VoxCPM2(~8GB VRAM) | MOSS-TTS(8B 可塞 8GB 卡) | 但注意 VoxCPM2 的 sm_120 open issue |
⚠️ 三个必须避开的坑(本报告新增):
mit 自相矛盾。| 项 | 内容 |
|---|---|
| GitHub | https://github.com/k2-fsa/OmniVoice (14k stars,last-commit = august,license = Apache-2.0)— shields.io 实抓 |
| HuggingFace | https://huggingface.co/k2-fsa/OmniVoice (镜像可读:hf-mirror 模型卡) |
| HF Space | https://huggingface.co/spaces/k2-fsa/OmniVoice |
| Demo 页 | https://zhu-han.github.io/omnivoice |
| 论文 | arXiv:2604.00688 —《OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models》,v3 更新于 2026-04-21(published 2026-04-01)。用户给的 arXiv 号属实。 |
⚠️ 「小米」的说法核实结论:属实,但不在 repo 名下。 论文首页署名机构为 Xiaomi Corp., China,通讯邮箱 {zhuhan3,dpovey}@xiaomi.com(Daniel Povey 为小米语音团队负责人)。代码托管在 k2-fsa(Daniel Povey 系的社区组织),所以从 repo owner 看不出小米。(arXiv:2604.00688 PDF 首页)
"Our code is released under the Apache 2.0 License. The pre-trained model is licensed under the CC-BY-NC due to constraints from its training data (e.g., Emilia)." —— hf-mirror.com/k2-fsa/OmniVoice/raw/main/README.md
论文 Table 1(Seed-TTS test-zh / test-en,baseline 用官方 checkpoint 复现,SIM-o 为 WavLM-based ECAPA-TDNN 余弦相似度):
| 模型 | 参数 | Seed-en SIM-o↑ | Seed-en WER↓ | Seed-en UTMOS↑ | Seed-zh SIM-o↑ | Seed-zh WER↓ | Seed-zh UTMOS↑ |
|---|---|---|---|---|---|---|---|
| Ground-truth | — | 0.734 | 2.14 | 3.52 | 0.755 | 1.25 | 2.78 |
| IndexTTS2 | 1.7B | 0.706 | 2.33 | 3.65 | 0.764 | 1.05 | 3.00 |
| CosyVoice3 | 1.1B | 0.696 | 2.17 | 3.96 | 0.778 | 1.14 | 3.32 |
| VoxCPM | 0.7B | 0.731 | 1.92 | 3.77 | 0.772 | 0.99 | 2.94 |
| Qwen3-TTS | 1.1B | 0.708 | 1.54 | 4.16 | 0.766 | 1.15 | 3.46 |
| F5-TTS | 0.4B | 0.664 | 1.85 | 3.72 | 0.750 | 1.53 | 2.93 |
| MaskGCT | 2.2B | 0.713 | 2.88 | 3.55 | 0.773 | 2.40 | 2.63 |
| OmniVoice | 0.8B | 0.741 | 1.60 | 3.91 | 0.777 | 0.84 | 3.11 |
— arXiv:2604.00688v3 PDF, Table 1
第三方对比(IndexTTS 团队在自家 README 的 CV3-Eval 表里引用的 OmniVoice 数字):OmniVoice 0.8B,zh WER 3.41 / SS 72.99,en 3.62 / 70.13,es 3.52 / 74.14,ja 5.38 / 70.49,ar 17.88 / 64.22。 — index-tts README Table 1
⚠️ 注意口径冲突:OmniVoice 自报 zh WER 0.84%,IndexTTS 团队在同为「中文零样本」的表里给 OmniVoice 记的是 3.41%。两组数不同测试集(Seed-TTS test-zh vs CV3-Eval)且不同 ASR,不能混用。选型时以「自测」为准。
主观评测(论文 Table 2,中文/英文):OmniVoice CMOS 0.44±0.16(高于 Qwen3-TTS 的 0.40±0.16,ZipVoice −0.30,MaskGCT −0.38),SMOS 3.80±0.17(GT 3.02±0.20)。(同 PDF)
omnivoice-server 提供「sentence-level streaming」的 OpenAI 兼容 /v1/audio/speech。(docs/community-projects.md)| 推理步数 | BS=1 | BS=2 | BS=4 | BS=8 |
|---|---|---|---|---|
| 16 | 0.0319 | 0.0263 | 0.0235 | 0.0224 |
| 32 | 0.0598 | 0.0486 | 0.0436 | 0.0414 |
| batch | baseline RTF | FlashInfer RTF | 加速 |
|---|---|---|---|
| 1 | 0.0899 | 0.0430 | 2.1× |
| 1 + CUDA graph | — | 0.0367 | 2.4× |
| 8 | 0.0298 | 0.0115 | 2.6× |
实时交互数字人与TTS调研.md,引社区方案):nf4 量化 LM + fp16 其余 + MAX_VRAM_GB=4 即可跑,约 0.6 s 生成 5 s 音频(≈8× 实时);但长参考音频(>4 s)显存会飙到 8 GB,建议参考音频 <3.5 s 或开 CPU_OFFLOAD=1。⚠️ 该数字来自社区配方,非官方,需自测。OmniVoice 官方维护了一份社区项目清单,尚未见到 LiveTalking / OpenAvatarChat / Fay / Linly-Talker 的官方内置支持(这三家的集成情况见第 12 节)。已确认的集成:
— 全部出自 docs/community-projects.md
requires-python >=3.10,torch>=2.4;uv 配置里钉死 torch==2.8.0 / torchaudio==2.8.0,CUDA 索引为 cu128。(pyproject.toml)pip install flashinfer-python==0.6.15.post1 "flashinfer-jit-cache==0.6.15.post1+cu128" --extra-index-url https://flashinfer.ai/whl/cu128/。(README)--no-asr 也复现,2026-05 仍未修),workaround 是显式传 ref_text。→ 对本项目是硬伤,落地前务必验证。| 项 | 内容 |
|---|---|
| GitHub | https://github.com/index-tts/index-tts (24k stars,last-commit = august;shields 报 license = "not identifiable by github",实际是自定义协议文件) |
| 论文(2.5) | arXiv:2601.03888《IndexTTS 2.5 Technical Report》(v5,2026-08-11) |
| 论文(2) | arXiv:2506.21619《IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot TTS》 |
| 论文(1.x) | arXiv:2502.05512 |
| HF(2.5) | https://huggingface.co/IndexTeam/IndexTTS-2.5 (镜像可读) |
| ModelScope(2.5) | https://modelscope.cn/models/IndexTeam/IndexTTS-2.5 |
| Demo | https://index-tts.github.io/index-tts2-5.github.io/ |
⚠️ 重要:截至 2026-09-22,最新版是 IndexTTS-2.5(2026/08/10 发布),不是 IndexTTS-2。 2.5 新增日语/西班牙语/阿拉伯语、duration_factor 语速控制、更快推理。(index-tts README News)
自定义协议:bilibili Model Use License Agreement(LICENSE 全文)。HF 模型卡里 license 字段标注为 other / license_name: bilibili-model-license。(hf-mirror IndexTTS-2.5 模型卡)
能否商用?——有条件可以。 关键条款:
对比:这是本次调研里唯一「明确允许商用、只对大厂设门槛」的自研协议。比 Fish Audio(一律需授权)和 OmniVoice(权重 CC-BY-NC)宽松得多。
厂商数据 —— IndexTTS-2.5 官方 CV3-Eval 表(zh/en/es/ja/ar,WER↓ / SS↑):
| 模型 | 参数 | zh WER | zh SS | en WER | en SS | ja WER | ja SS | ar WER | ar SS | Avg WER | Avg SS |
|---|---|---|---|---|---|---|---|---|---|---|---|
| VoxCPM2 | 2B | 3.88 | 74.99 | 5.13 | 71.57 | 6.69 | 72.90 | 14.94 | 65.99 | 7.22 | 72.02 |
| OmniVoice | 0.8B | 3.41 | 72.99 | 3.62 | 70.13 | 5.38 | 70.49 | 17.88 | 64.22 | 6.76 | 70.39 |
| Moss-TTS 1.5 | 8B | 4.02 | 72.68 | 4.45 | 67.46 | 10.97 | 68.71 | 23.71 | 62.21 | 9.40 | 68.56 |
| CosyVoice3-0.5B | 0.5B | 3.84 | 80.01 | 4.88 | 74.16 | – | 76.36 | – | – | – | – |
| FireRedTTS-2 | 1.5B | 8.22 | 68.10 | 14.92 | 56.93 | – | – | – | – | – | – |
| Fish Audio S2 Pro | 4B | 3.62 | 67.79 | 3.83 | 61.66 | 5.15 | 66.15 | 14.15 | 59.43 | 5.94 | 64.49 |
| Qwen3-TTS | 1.7B | 3.27 | 73.02 | 5.06 | 67.17 | 5.89 | 70.18 | – | – | – | – |
| IndexTTS2.5 | 0.8B | 4.36 | 77.10 | 5.12 | 68.06 | 5.66 | 74.62 | 14.88 | 69.74 | 6.75 | 73.18 |
| IndexTTS2.5-RL | 0.8B | 3.93 | 77.92 | 3.89 | 67.79 | 5.30 | 75.41 | 13.58 | 70.36 | 6.00 | 73.63 |
第三方数据 —— MOSS-TTS 团队对比表(Seed-TTS-eval):
| 模型 | 参数 | EN WER↓ | EN SIM↑ | ZH CER↓ | ZH SIM↑ |
|---|---|---|---|---|---|
| IndexTTS2 | 1.5B | 2.23 | 70.6 | 1.03 | 76.5 |
| GLM-TTS | 1.5B | 2.23 | 67.2 | 1.03 | 76.1 |
| GLM-TTS-RL | 1.5B | 1.91 | 68.1 | 0.89 | 76.4 |
| VoxCPM | 0.5B | 1.85 | 72.9 | 0.93 | 77.2 |
| Qwen3-TTS | 0.6B | 1.68 | 70.39 | 1.23 | 76.4 |
| CosyVoice3 | 0.5B | 2.02 | 71.8 | 1.16 | 78.0 |
| F5-TTS | 0.3B | 2.00 | 67 | 1.53 | 76 |
| HiggsAudio-v2 | 3B | 2.44 | 67.7 | 1.50 | 74.0 |
「Faster IndexTTS-2」论文(NVIDIA)给的 IndexTTS-2 质量基线(Seed-TTS 测试集,PyTorch 原版):
| test-en FP32 | test-zh FP32 | |
|---|---|---|
| WER (%) | 1.84 | 1.01 |
| SIM-o ↑ | 0.706 | 0.765 |
| UTMOS ↑ | 3.62 | 2.99 |
— arXiv:2607.21042 PDF Table I
⚠️ 结论:官方 index-tts 仓库本身不提供流式推理。 我在官方 README(中英文两版)全文 grep stream|ttfb|first chunk|latency|流式 零命中。(EN / ZH)
流式能力来自 NVIDIA 的独立工作「Faster IndexTTS-2」(arXiv:2607.21042,2026-07-23,作者 Muyang Du / Shuang Yu / Junjie Lai,NVIDIA 上海)。该论文核实属实:用 TensorRT + TensorRT-LLM 加速全部组件并实现分块流式。
首包延迟数字(论文实测,A100 80GB,FP16):
论文 Table II(overlap = 5 codec frames):
| 语言 | 模式 | Chunk (s) | TTFA↓ (ms) | 总延迟 (ms)↓ | RTF↓ | WER (%)↓ | SIM-o↑ | UTMOS↑ |
|---|---|---|---|---|---|---|---|---|
| EN | 非流式 | — | — | 874.5 | 0.24 | 1.97 | 0.698 | 3.53 |
| EN | 流式 | 2 | 608.6 | 1180.4 | 0.32 | 1.86 | 0.699 | 3.45 |
| EN | 流式 | 1 | 405.5 | 1496.7 | 0.40 | 2.07 | 0.700 | 3.36 |
| ZH | 非流式 | — | — | 1211.1 | 0.22 | 1.08 | 0.761 | 2.94 |
| ZH | 流式 | 2 | 596.1 | 1669.3 | 0.30 | 1.10 | 0.765 | 2.81 |
| ZH | 流式 | 1 | 395.9 | 2153.5 | 0.38 | 1.13 | 0.766 | 2.67 |
— arXiv:2607.21042 PDF Table II
→ 中文首包延迟:chunk=2s 时 596.1 ms;chunk=1s 时 395.9 ms。 这就是用户要的「流式首包延迟数字」。 → 增量输出:支持,按可配置 chunk size 增量解码,相邻 chunk 有可配置 overlap,重叠波形用 Hann 窗交叉淡化平滑过渡。
论文 Figure 2 的 chunk/overlap 网格(6 种 overlap 值 × 4 档 chunk)显示 FP16 streaming:
加速比:GPT 最高 5.0×(EN)/ 4.8×(ZH);端到端 3.60×(EN)/ 3.46×(ZH);RTF 从 0.84/0.76 降到 0.24/0.22。W8A16 / W4A16 只对 GPT 量化,额外收益很小。(同 PDF §III-B)
模型构成(1.51B 总参):预处理 788M + 自回归 GPT 512M + flow-matching DiT 96M + BigVGAN vocoder 113M。(同 PDF §III-A)
roughly 6 GB of VRAM for inference(IndexTTS-2.5,Python 3.10–3.11,NVIDIA GPU)。(hf-mirror IndexTTS-2.5 模型卡)kv_cache=True):
| 文本长度 | 2.0 fp16 | 2.0 fp32 | 2.5 bf16 | 2.5 fp32 |
|---|---|---|---|---|
| 7 字 | 0.4004 | 0.3748 | 0.2871 | 0.2547 |
| 200 字 | 0.3244 | 0.3990 | 0.1997 | 0.2144 |
| overall | 0.3257 | 0.3748 | 0.2065 | 0.2060 |
uv sync --all-extras);CUDA Toolkit ≥ 12.8。含可选的 DeepSpeed 与编译 CUDA 内核加速开关。[happy, angry, sad, afraid, disgusted, melancholic, surprised, calm]、文本驱动情感、独立情感描述文本、emo_alpha 强度、duration_factor 0.5–2.0 语速。(README)use_emo_text=True 在 2.5 上必须先 IndexTTS2(..., use_qwen_emo=True),否则抛 RuntimeError。(README 第 5 节)--all-extras)。github.com/index-tts/index-tts 是唯一官方渠道,其他网站/服务不保证安全。(README CAUTION)| 项 | 内容 |
|---|---|
| GitHub | https://github.com/FunAudioLLM/CosyVoice (24k stars,license = Apache-2.0,last-commit = may) |
| 论文 | arXiv:2505.17589《CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training》 |
| 最新权重 | Fun-CosyVoice3-0.5B-2512 |
| ModelScope | https://www.modelscope.cn/models/FunAudioLLM/Fun-CosyVoice3-0.5B-2512 |
| HuggingFace | https://huggingface.co/FunAudioLLM/Fun-CosyVoice3-0.5B-2512 (HF 卡 license: apache-2.0,实抓镜像确认) |
| 评测集 | https://github.com/FunAudioLLM/CV3-Eval (官方开源评测集,难得的可复现第三方基准) |
| Demo | https://funaudiollm.github.io/cosyvoice3/ ⚠️ 本次实测返回 404(README 引用但页面已下线;cosyvoice2 页同样 404) |
许可证:Apache-2.0(代码与权重均为 apache-2.0)→ 可自由商用。 这是本次调研中商用条件最好的之一。 — hf-mirror CosyVoice3 模型卡、GitHub shields
官方评测表(zh/en/hard,CER/WER↓ 与 SS↑):
| 模型 | 开源 | 参数 | test-zh CER↓ | test-zh SS↑ | test-en WER↓ | test-en SS↑ | test-hard CER↓ | test-hard SS↑ |
|---|---|---|---|---|---|---|---|---|
| Human | — | — | 1.26 | 75.5 | 2.14 | 73.4 | – | – |
| Seed-TTS | ❌ | — | 1.12 | 79.6 | 2.25 | 76.2 | 7.59 | 77.6 |
| MiniMax-Speech | ❌ | — | 0.83 | 78.3 | 1.65 | 69.2 | – | – |
| F5-TTS | ✅ | 0.3B | 1.52 | 74.1 | 2.00 | 64.7 | 8.67 | 71.3 |
| CosyVoice2 | ✅ | 0.5B | 1.45 | 75.7 | 2.57 | 65.9 | 6.83 | 72.4 |
| Index-TTS2 | ✅ | 1.5B | 1.03 | 76.5 | 2.23 | 70.6 | 7.12 | 75.5 |
| VoxCPM | ✅ | 0.5B | 0.93 | 77.2 | 1.85 | 72.9 | 8.87 | 73.0 |
| GLM-TTS-RL | ✅ | 1.5B | 0.89 | 76.4 | – | – | – | – |
| Fun-CosyVoice3-0.5B-2512 | ✅ | 0.5B | 1.21 | 78.0 | 2.24 | 71.8 | 6.71 | 75.8 |
| Fun-CosyVoice3-0.5B-2512_RL | ✅ | 0.5B | 0.81 | 77.4 | 1.68 | 69.5 | 5.44 | 75.0 |
第三方交叉验证(MOSS-TTS 表):CosyVoice3 0.5B → EN WER 2.02 / SIM 71.8,ZH CER 1.16 / SIM 78.0。(MOSS-TTS README) 第三方交叉验证(IndexTTS CV3-Eval 表):CosyVoice3-0.5B → zh SS 80.01(该表最高),en SS 74.16,ja SS 76.36。(index-tts README Table 1)
中文说话人相似度 78(SeedTTS)/ 80.01(CV3-Eval)是目前公开可商用模型里的第一梯队。
官方 README 原文:
"Bi-Streaming: Support both text-in streaming and audio-out streaming, and achieves latency as low as 150ms while maintaining high-quality audio output."
— CosyVoice README Highlight · hf-mirror 模型卡同文
实时交互数字人与TTS调研.md,该报告引用了 vLLM-Omni commit 与 LiveTalking 作者实测):
| 路径 | 首包延迟(TTFP/TTFB) | 条件 | 来源等级 |
|---|---|---|---|
| CosyVoice3 + vLLM-Omni | ~195 ms(优化后;此前 ~810 ms) | H100,vLLM-Omni commit | 🟢 第三方 |
| Qwen3-TTS-0.6B + vLLM-Omni | ~130 ms | RTX 3090 单卡,稳态显存 ~13GB | 🟢 LiveTalking 作者实测 |
| Fish Audio S2 Pro + vLLM-Omni | ~100 ms(零样本)/ ~135 ms(克隆) | RTX PRO 6000 | 🟢 第三方 |
| MOSS-TTS-Realtime | 180 ms(RTF 0.51) | 单卡 L20 | 🟡 厂商 |
| IndexTTS-2(Faster 版,未开源) | 395.9 ms(chunk=1s)/ 596.1 ms(chunk=2s) | A100 FP16 | 🟢 论文 |
→ CosyVoice3 的 150 ms 宣称值,第三方在 H100 + vLLM-Omni 上实测到 ~195 ms,量级一致(属可采信)。
sox/libsox-dev(Ubuntu)。(README Install)--recursive 克隆(有 git submodule),否则要反复 git submodule update --init --recursive。(README)ttsfrd 资源可选;不装则回退 wetext。| 项 | 内容 |
|---|---|
| GitHub | https://github.com/RVC-Boss/GPT-SoVITS (62k stars — 本次调研最高,license = MIT,last-commit = august) |
| 官方文档 | 中文 https://www.yuque.com/baicaigongchang1145haoyuangong/ib3g1e ;英文 https://rentry.co/GPT-SoVITS-guide |
| 版本特性 wiki | https://github.com/RVC-Boss/GPT-SoVITS/wiki |
| 权重 | https://huggingface.co/lj1995/GPT-SoVITS |
| 在线 demo | https://lj1995-gpt-sovits-proplus.hf.space/ |
| CPU 优化版 | https://github.com/baicai-1145/GPT-SoVITS-CPUFast |
许可证 MIT → 可自由商用(这是本次调研里唯一主流且完全宽松的开源许可,另一个是 F5-TTS)。(GitHub shields license)
官方 wiki 表格,测试方法明确写了「用的 https://github.com/BytedanceSpeech/seed-tts-eval 官方给的相似度模型和 ASR 模型跑的」:
| 版本 | WER ↓ | SIM ↑ |
|---|---|---|
| v1 | 0.025 | 0.526 |
| v2 | 0.017 | 0.549 |
| v3 (8 steps) | 0.014 | 0.702 |
| v4 (8 steps) | 0.013 | 0.735 |
| v2Pro | 0.016 | 0.709 |
| v2ProPlus | 0.016 | 0.737 |
| GT(真人) | 0.013 | 0.750 |
— GPT-SoVITS wiki: SeedTTS ZeroShot TTS eval testset CN
解读:中文 WER 1.6%(v2ProPlus),说话人相似度 0.737,只比真人 GT 的 0.750 低 1.3 个点 —— 非常强。但自然度/情感无客观数字,官方 wiki 自己也说:「测不了自然性、情感丰富性和音质,前 2 个要人工打分」。
参数量(官方 wiki):
| 版本 | 语种 | GPT 参数量 | SoVITS 参数量 | 推理速度 |
|---|---|---|---|---|
| v1 | 中日英 | 90M | 77M | baseline |
| v2 | 中日英韩粤 | 90M | 77M | 2× v1 |
| v3/v4 | 同 v2 | 330M | 77M | ≈v2 |
| v2Pro | 同 v2 | 133M | 77M | ≈v3 |
| v2ProPlus | 同 v2 | 152M | 77M | ≈v3 |
— 同上 wiki
官方推荐结论(wiki 原文):「从 benchmark 跑分看,没有必要再用 v3v4,因为 v2Pro 系列和 v2 硬件需求一样,但是 zero shot 相似度和 v3v4 同一水平线」。
| 硬件 | RTF |
|---|---|
| RTX 4060 Ti | 0.028 |
| RTX 4090 | 0.014(1400 词 ≈ 4 分钟音频,推理 3.36 s) |
| Apple M4 CPU | 0.526 |
README 还带一句:「请不要尬黑 GPT-SoVITS 推理速度慢,谢谢!」
| Python | PyTorch | 设备 |
|---|---|---|
| 3.10 | 2.5.1 | CUDA 12.4 |
| 3.11 | 2.5.1 | CUDA 12.4 |
| 3.11 | 2.7.0 | CUDA 12.8 |
| 3.9 | 2.8.0dev | CUDA 12.8 |
| 3.9 / 3.11 | 2.5.1 / 2.7.0 | Apple silicon |
| 3.9 | 2.2.2 | CPU |
--device CU128:bash install.sh --device <CU126|CU128|ROCM|CPU> --source <HF|HF-Mirror|ModelScope> —— 对 Blackwell/sm_120 友好。no_proxy 环境变量若含 :: 会触发 httpx 报错(README 明确提示)。(README)| 项 | 内容 |
|---|---|
| GitHub | https://github.com/fishaudio/fish-speech (33k stars,last-commit = last wednesday — 极活跃) |
| 最新模型 | Fish Audio S2 Pro(4B),不是 OpenAudio S1 了 |
| 权重 | https://huggingface.co/fishaudio/s2-pro |
| 论文 | arXiv:2603.08823《Fish Audio S2 Technical Report》(已核实) |
| 博客 | https://fish.audio/blog/fish-audio-open-sources-s2/ |
| 文档 | https://speech.fish.audio/ |
⚠️ 许可证从 CC-BY-NC-SA 换成了自研的 FISH AUDIO RESEARCH LICENSE(Last Updated: 2026-03-07)。
能否商用?—— ❌ 不能(除非单独购买授权)。 LICENSE 第三节原文:
"Any use of the Fish Audio Materials or Derivative Works for a Commercial Purpose requires a separate written license agreement from Fish Audio. No commercial rights are granted under this Agreement." "Commercial Purpose" means ... including but not limited to: (i) creating, modifying, or distributing Your product or service, including via a hosted service or API, (ii) Your business's or organization's internal operations, and (iii) any use in connection with a product or service for which You charge a fee or generate revenue, whether directly or indirectly.
— FISH AUDIO RESEARCH LICENSE 全文
⚠️ 特别注意 (ii):连「企业内部自用」都算 Commercial Purpose。 商务授权联系 business@fish.audio。 另:§IV(b) 禁止用它「创建或改进任何基础生成式 AI 模型」;分发必须显示 "Built with Fish Audio"。
| Benchmark | Fish Audio S2 |
|---|---|
| Seed-TTS Eval — WER (中文) | 0.54%(best overall) |
| Seed-TTS Eval — WER (英文) | 0.99%(best overall) |
| Audio Turing Test(带指令) | 0.515 posterior mean |
| EmergentTTS-Eval — Win Rate | 81.88%(最高) |
| Fish Instruction Benchmark — TAR | 93.3% |
| Fish Instruction Benchmark — Quality | 4.51 / 5.0 |
| Multilingual (MiniMax Testset) — Best WER | 24 种语言中 11 种最优 |
| Multilingual (MiniMax Testset) — Best SIM | 24 种语言中 17 种最优 |
— fish-speech README Benchmark Results
厂商对比话术:Seed-TTS Eval 上 S2 的 WER 低于所有评测模型(含闭源):Qwen3-TTS (0.77/1.24)、MiniMax Speech-02 (0.99/1.90)、Seed-TTS (1.12/2.25)。(同上)
⚠️ 第三方交叉验证有明显落差:MOSS-TTS 团队表里 FishAudio-S1(4B,标注为闭源 ❌)EN WER 1.72 / SIM 62.57,ZH CER 1.22 / SIM 72.1;IndexTTS 团队 CV3-Eval 表里 Fish Audio S2 Pro(4B)zh WER 3.62 / SS 67.79,en 3.83 / 61.66。(MOSS-TTS README、index-tts README) → 厂商自称中文 WER 0.54%,第三方表里 3.62% —— 差距 6.7 倍。说话人相似度(67.79)也明显低于 CosyVoice3(78–80)和 IndexTTS2.5(77.9)。
| 指标 | 数值 |
|---|---|
| RTF | 0.195 |
| TTFA(Time-to-First-Audio) | ~100 ms |
| 吞吐 | 3,000+ acoustic tokens/s(RTF < 0.5) |
| 项 | 内容 |
|---|---|
| GitHub | https://github.com/OpenMOSS/MOSS-TTS (4.1k stars,license = Apache-2.0,last-commit = september — 很活跃) |
| 论文 | arXiv:2603.18090《MOSS-TTS Technical Report》(2026-03-20) |
| 权重集合 | https://huggingface.co/collections/OpenMOSS-Team/moss-tts |
| ModelScope | https://www.modelscope.cn/collections/openmoss/MOSS-TTS |
| Blog | https://mosi.cn/#models |
| 相关论文 | MOSS-TTSD: arXiv:2603.19739;MOSS-VoiceGenerator: arXiv:2603.28086 |
许可证:模型 Apache-2.0,原文「Models in MOSS-TTS Family are licensed under the Apache License 2.0.」→ ✅ 可自由商用。 — MOSS-TTS README LICENSE 段
厂商数据(Seed-TTS-eval):
| 模型 | 参数 | EN WER (%)↓ | EN SIM (%)↑ | ZH CER (%)↓ | ZH SIM (%)↑ |
|---|---|---|---|---|---|
| FishAudio-S1 | 4B | 1.72 | 62.57 | 1.22 | 72.1 |
| CosyVoice3 | 1.5B | 2.22 | 72 | 1.12 | 78.1 |
| Seed-TTS | — | 2.25 | 76.2 | 1.12 | 79.6 |
| MiniMax-Speech | — | 1.65 | 69.2 | 0.83 | 78.3 |
| CosyVoice3 | 0.5B | 2.02 | 71.8 | 1.16 | 78 |
| F5-TTS | 0.3B | 2 | 67 | 1.53 | 76 |
| IndexTTS2 | 1.5B | 2.23 | 70.6 | 1.03 | 76.5 |
| VibeVoice | 1.5B | 3.04 | 68.9 | 1.16 | 74.4 |
| HiggsAudio-v2 | 3B | 2.44 | 67.7 | 1.5 | 74 |
| GLM-TTS-RL | 1.5B | 1.91 | 68.1 | 0.89 | 76.4 |
| VoxCPM | 0.5B | 1.85 | 72.9 | 0.93 | 77.2 |
| Qwen3-TTS | 1.7B | 1.5 | 71.45 | 1.33 | 76.72 |
| MossTTSDelay | 8B | 1.84 | 70.86 | 1.37 | 76.98 |
| MossTTSLocal | 1.7B | 1.93 | 73.28 | 1.44 | 79.62 |
MossTTSLocal(1.7B)的 ZH SIM 79.62 是该表最高,接近 Seed-TTS 的 79.6。
MOSS-TTSD(对话/多说话人)客观评测(含第三方对比闭源):MOSS-TTSD-v1.0 → ZH SIM 0.7949 / ACC 0.9587 / WER 0.0485;EN SIM 0.7326 / ACC 0.9626 / WER 0.0988,多数维度优于 Eleven V3、gemini-2.5-pro-preview-tts、Doubao_Podcast。(MOSS-TTS README MOSS-TTSD 客观评测)
MOSS-TTS-Realtime 官方评测(单张 L20,开启 SDPA + torch.compile,warm up 后):
| 模型 | TTFB (ms) | RTF |
|---|---|---|
| MOSS-TTS-Realtime | 180(warm up 后) | 0.51 |
串联 LLM 的端到端首包:用 vLLM 部署 Qwen3.5-9B 测 T_LLM-first-sentence = 197 ms(生成 12 token = TTS prefill 长度),故 T_LLM-first-sentence + T_MOSS-TTS-Realtime-TTFB = 197 + 180 = 377 ms。 — MOSS-TTS README MOSS-TTS-Realtime 评测
这是「LLM 对话 + TTS」全链路首包延迟的公开可查数字,对数字人项目极有参考价值。
MOSS-TTS-Nano:~100M 参数,支持多语言克隆、48 kHz 立体声,仅 4 个 CPU 核心即可流式输出。(README News 2026.4.13)
Now 8B model fits onto 8GB GPUs!(2026.3.10 的 llama.cpp 显存优化)(README News)/v1/audio/speech、streaming、voice cloning。MossTTSDelay 8B 与 MossTTSLocal 1.7B;但 News 里 2026.6.18 发布的 MOSS-TTS-Local-Transformer-v1.5 是 4B(Qwen3-4B)。版本与参数量对应关系易混淆,落地前需以 HF 卡为准。| 项 | 内容 |
|---|---|
| GitHub | https://github.com/SWivid/F5-TTS (15k stars,license = MIT,last-commit = yesterday — 极活跃) |
| 论文 | arXiv:2410.06885《F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching》(ACL 2025) |
| 权重 | https://huggingface.co/SWivid/F5-TTS ;ModelScope https://www.modelscope.cn/models/SWivid/F5-TTS_Emilia-ZH-EN |
| HF Space | https://huggingface.co/spaces/mrfakename/E2-F5-TTS |
| Demo | https://swivid.github.io/F5-TTS/ |
| 相关论文 | 仓库含强制对齐版《Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis》arXiv:2502.18924 |
许可证 MIT → ✅ 可自由商用。(GitHub shields) 最新模型:v1 base(2025/03/12),其后 README News 无新版本 → 2026 年未发布新版模型。
| 来源 | 中文指标 |
|---|---|
| CosyVoice 官方评测表 | test-zh CER 1.52%,SS 74.1;test-en WER 2.00 / SS 64.7;test-hard CER 8.67 / SS 71.3 |
| MOSS-TTS 评测表 | EN WER 2.00 / SIM 67;ZH CER 1.53 / SIM 76 |
| OmniVoice 论文 Table 1 | Seed-zh SIM-o 0.750 / WER 1.53% / UTMOS 2.93(NAR 组,0.4B) |
— CosyVoice README、MOSS-TTS README、arXiv:2604.00688v3
→ 中文 CER ≈ 1.52–1.53%,SIM ≈ 74.1–76。属于「可用但不是第一梯队」,明显低于 CosyVoice3(78–80)与 IndexTTS2.5(77.9)。
torch==2.8.0+cu128 可选;也支持 ROCm 7.2。pynini 在 macOS Apple Silicon 无 wheel,需 conda install -c conda-forge pynini。t_w 通常比 p_w 高 0–3 点。(README)| 项 | 内容 |
|---|---|
| GitHub | https://github.com/bytedance/MegaTTS3 (6.1k stars,license = Apache-2.0,last-commit = june) |
| 论文 | arXiv:2502.18924《MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis》(v4,2025-03-28;published 2025-02-26)— 已核实 |
| 音频样例 | https://sditdemo.github.io/sditdemo/ |
| HF Space Demo | https://huggingface.co/spaces/ByteDance/MegaTTS3 |
| README 路径 | ⚠️ 是小写 readme.md(README.md 返回 404) |
许可证:Apache-2.0 → ✅ 可自由商用。(GitHub shields、readme.md 顶部 badge 声明)
有趣细节:F5-TTS 仓库里内置的强制对齐版就是 MegaTTS3 的技术路线(F5-TTS README 引用同一篇《Sparse Alignment Enhanced Latent Diffusion Transformer》,arXiv:2502.18924)。(F5-TTS README)
| 模型 | 参数 | test-EN WER/%↓ | test-EN SIM/%↑ | test-ZH CER/%↓ | test-ZH SIM/%↑ |
|---|---|---|---|---|---|
| MegaTTS3 | 0.5B | 2.79 | 77.1 | 1.52 | 79.0 |
| CosyVoice3 | 0.5B | 2.02 | 71.8 | 1.16 | 78.0 |
| Seed-TTS | — | 2.25 | 76.2 | 1.12 | 79.6 |
| F5-TTS | 0.3B | 2.00 | 67.0 | 1.53 | 76.0 |
| IndexTTS2 | 1.5B | 2.23 | 70.6 | 1.03 | 76.5 |
| SparkTTS | 0.5B | 3.14 | 57.3 | 1.54 | 66.0 |
| FireRedTTS-2 | 1.5B | 1.95 | 66.5 | 1.14 | 73.6 |
— OpenBMB/VoxCPM README Seed-TTS-eval 表 → MegaTTS3 中文 CER 1.52% / SIM 79.0:CER 中游,但 SIM 79.0 是这批模型里最高之一(仅次于 LongCat-Audio-DiT 的 81.8 与 VoxCPM2 的 79.5)。
| 模型 | 参数 | SIM-O↑ | SIM-R↑ | WER↓ | CMOS↑ | SMOS↑ | RTF↓ |
|---|---|---|---|---|---|---|---|
| GT | — | 0.68 | — | 1.94% | +0.12 | 3.92 | — |
| VALL-E 2 | 0.4B | 0.64 | 0.68 | 2.44% | — | — | — |
| NaturalSpeech 3 | 0.5B | 0.67 | 0.76 | 1.81% | −0.10 | 3.95 | 0.296 |
| CosyVoice | 0.4B | 0.62 | — | 2.24% | −0.18 | 3.93 | 1.375 |
| F5-TTS | 0.3B | 0.66 | — | 1.96% | −0.12 | 3.96 | 0.307 |
| MegaTTS 3 | 0.3B | 0.71 | 0.78 | 1.82% | 0.00 | 3.98 | 0.188 |
| MegaTTS 3-accelerated | 0.3B | 0.70 | 0.78 | 1.86% | −0.03 | 3.96 | 0.124 |
LibriSpeech-PC test-clean:MegaTTS3 0.70 / 2.31%,优于 F5-TTS(0.66/2.42%)、E2 TTS(0.69/2.95%)、CosyVoice(0.66/3.59%)。 — arXiv:2502.18924v4 Table 1 & 2
[2025-03-22] Our project has been released!,此后无版本更新;last-commit = june(2026)。→ 2025 年 3 月后无模型迭代。PYTHONPATH 指向仓库根。.npy voice latent:README 要求把 ≤24s 的 .wav 上传到指定 Google Drive 目录换回 .npy,本地无法自转换(门槛很高,且 Google Drive 在国内不可达)。WeTextProcessing、改用 pynini==2.1.5 + WeTextProcessing==1.0.3。pydantic 与 gradio 版本必须匹配;no_proxy 含 :: 会引发 httpx 报错。— 全部出自 readme.md
| 项 | 内容 |
|---|---|
| GitHub | https://github.com/hexgrad/kokoro (8.9k stars,license = Apache-2.0,last-commit = august 2025) |
| 模型 | https://huggingface.co/hexgrad/Kokoro-82M |
| 样本 | https://huggingface.co/hexgrad/Kokoro-82M/blob/main/SAMPLES.md |
| G2P 库 | https://github.com/hexgrad/misaki |
| PyPI | https://pypi.org/project/kokoro/ |
许可证:Apache-2.0 → ✅ 可自由商用。(GitHub shields)
🇨🇳 'z' => Mandarin Chinese: pip install misaki[zh],且示例里有中文/粤语样例句(含「中國人民不信邪也不怕邪…」)。(README Advanced Usage)KPipeline 按 split_pattern 切句生成(句级切分,不是增量流式)。首包延迟「未查到」。PYTORCH_ENABLE_MPS_FALLBACK=1 可启用 GPU。(README)apt-get install espeak-ng)。这是最常见的部署坑。| 项 | 内容 |
|---|---|
| GitHub | https://github.com/2noise/ChatTTS (40k stars,last-commit = april) |
| 模型 | https://huggingface.co/2Noise/ChatTTS |
| PyPI | https://pypi.org/project/ChatTTS |
| 扩展索引 | https://github.com/libukai/Awesome-ChatTTS |
⚠️ 许可证是双层的,都不可商用:
| 对象 | 许可 |
|---|---|
| 代码 | AGPLv3+(强 copyleft,商用/网络服务会触发源码开放义务) |
| 模型权重 | CC BY-NC 4.0(明文禁止商用) |
原文:「The code is published under AGPLv3+ license.」「The model is published under CC BY-NC 4.0 license. It is intended for educational and research use, and should not be used for any commercial or illegal purposes.」 — ChatTTS README Licenses
Agent 提醒:AGPL 对「提供网络服务」有特殊约束,即便自用也需谨慎评估。
"DO NOT INSTALL! The adaptation of TransformerEngine is currently under development and CANNOT run properly now." "DO NOT INSTALL! Currently the FlashAttention-2 will slow down the generating speed" — ChatTTS README
(这反而对 sm_120 是好消息 —— 避开了 flash-attn 编译地狱。)
"we added a small amount of high-frequency noise during the training of the 40,000-hour model, and compressed the audio quality as much as possible using MP3 format" — ChatTTS README Disclaimer
这是本次调研里最被低估的候选:2B、Apache-2.0、官方流式、官方宣称 VRAM ~8GB、RTF ~0.30@4090。
| 项 | 内容 |
|---|---|
| GitHub | https://github.com/OpenBMB/VoxCPM (38k stars,license = Apache-2.0) |
| 版本 | VoxCPM2(2026.04 发布) — 2B 参数,2 百万小时以上多语种数据,30 种语言,Voice Design,Controllable Voice Cloning,48 kHz 原生输出 |
| 骨干 | MiniCPM-4 |
| 论文 | arXiv:2606.06928《VoxCPM2 Technical Report》(2026-06-05)— 已核实 |
| 旧版论文 | arXiv:2509.24650《VoxCPM: Tokenizer-Free TTS for Context-Aware Speech Generation and True-to-Life Voice Cloning》 |
| 架构 | 无 tokenizer、扩散自回归;全程在 AudioVAE V2 隐空间:LocEnc → TSLM → RALM → LocDiT |
| LM token rate | 6.25 Hz(对比 CosyVoice 系 12.5 Hz) |
— github.com/OpenBMB/VoxCPM README、GitHub shields
✅ 许可证:Apache-2.0,代码与权重均开源,官方原文「Fully Open-Source & Commercial-Ready — Weights and code released under the Apache-2.0 license, free for commercial use」。→ 可自由商用。(README)
中文效果(Seed-TTS-eval):
| 模型 | 参数 | test-EN WER/%↓ | test-EN SIM/%↑ | test-ZH CER/%↓ | test-ZH SIM/%↑ | test-Hard CER/%↓ | test-Hard SIM/%↑ |
|---|---|---|---|---|---|---|---|
| VoxCPM2 | 2B | 1.84 | 75.3 | 0.97 | 79.5 | 8.13 | 75.3 |
| VoxCPM-0.5B | 0.6B | 1.85 | 72.9 | 0.93 | 77.2 | 8.87 | 73.0 |
| VoxCPM1.5 | 0.8B | 2.12 | 71.4 | 1.18 | 77.0 | 7.74 | 73.1 |
| LongCat-Audio-DiT | 3.5B | 1.50 | 78.6 | 1.09 | 81.8 | 6.04 | 79.7 |
| FishAudio S2 | 4B | 0.99 | — | 0.54 | — | 5.99 | — |
| MegaTTS3 | 0.5B | 2.79 | 77.1 | 1.52 | 79.0 | — | — |
| MOSS-TTS | — | 1.85 | 73.4 | 1.20 | 78.8 | — | — |
| Qwen3-TTS | 1.7B | 1.23 | 71.7 | 1.22 | 77.0 | 6.76 | 74.8 |
| IndexTTS2 | 1.5B | 2.23 | 70.6 | 1.03 | 76.5 | 7.12 | 75.5 |
| Qwen3-Omni | 30B-A3B | 1.39 | — | 1.07 | — | — | — |
| CosyVoice3 | 0.5B | 2.02 | 71.8 | 1.16 | 78.0 | 6.08 | 75.8 |
— OpenBMB/VoxCPM README Seed-TTS-eval 表(注意:这是 OpenBMB 自家整理的对比表,属厂商侧第三方表,引用需注明)
CV3-eval 多语种 CER/WER:VoxCPM2 → zh 3.65 / en 5.00 / hard-zh 8.55 / ja 5.96 / ko 5.69 / de 4.77 / es 3.80 / fr 9.85 / it 4.25 / ru 5.21;Fish Audio S2 在 zh(2.65)/en(2.43) 上明显更好。(同上 README CV3-eval 表)
⚡ 流式能力(本次调研中「真开源 + 官方流式」的最强候选之一):
| 档位 | RTF (RTX 4090)↓ | RTF in Nano-VLLM (RTX 4090)↓ | VRAM |
|---|---|---|---|
| VoxCPM2 | ~0.30 | ~0.13 | ~8 GB |
| VoxCPM1.5 | ~0.15 | ~0.08 | ~6 GB |
| VoxCPM-0.5B | ~0.17 | ~0.10 | ~5 GB |
model.generate_streaming(...) 直接 yield chunk(README 明确给出该 API 与示例代码)。pip install nano-vllm-voxcpm,专为 VoxCPM 做的推理引擎,支持并发请求 + async API,RTF ~0.13@4090。vllm serve openbmb/VoxCPM2 --omni --port 8000,原生 PagedAttention KV cache、continuous batching、OpenAI 兼容 /v1/audio/speech、streaming chunk delivery、多卡。--stream 标志。→ 16GB 单卡(RTX 5060 Ti)可跑性:✅ 官方标 ~8GB VRAM,16GB 余量充足。
其他新模型确定性线索(来自已抓取的第三方表):
_raw_TTS_newmodels.md,105 KB / 1310 行 / 120 条实抓 URL)。| 项 | 内容 |
|---|---|
| GitHub | https://github.com/QwenLM/Qwen3-TTS — 13k stars,License = Apache-2.0(LICENSE 全文已抓),last-commit = march |
| HuggingFace | https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice(同系列另有 -Base / -VoiceDesign / 0.6B-* / Qwen/Qwen3-TTS-Tokenizer-12Hz) |
| 论文 | arXiv:2601.15621 ✅ 已用 arXiv API 核实为真:《Qwen3-TTS Technical Report》,发布 2026-01-22 |
| 参数 | 已发布 1.7B / 0.6B 两档;Qwen3-TTS-12Hz-1.7B-Base 实际张量数 1,928,677,440 ≈ 1.93B(BF16)(HF API 精确值,非估算) |
| tokenizer | 自研 Qwen3-TTS-Tokenizer-12Hz(12 Hz 离散多码本 LM) |
| 语言 | 10 种(中英日韩德法俄葡西意)+ 多方言音色 |
✅ 许可证:Apache-2.0(代码 + HF 权重 tag 均为 Apache-2.0)→ 可自由商用。
中文效果:
| 口径 | 指标 |
|---|---|
| 厂商自报(Seed-TTS test set) | 12Hz-1.7B-Base:test-zh WER 0.77 / test-en WER 1.24;12Hz-0.6B-Base:test-zh 0.92 / test-en 1.32(同表 CosyVoice 3 为 0.71/1.45,MiniMax-Speech 0.83/1.65,Seed-TTS 1.12/2.25) |
| 厂商自报(说话人相似度) | Chinese Speaker Similarity:12Hz-0.6B = 0.811、12Hz-1.7B = 0.799(同表 MiniMax 0.780、ElevenLabs 0.677) |
| 第三方(VoxCPM2 / MOSS-TTS 表) | 1.7B:ZH CER 1.22 / SIM 77.0;MOSS 表 1.7B:ZH CER 1.33 / SIM 76.72;0.6B:ZH CER 1.23 / SIM 76.4 |
⚠️ 口径差异:Qwen 自报 0.77 vs 第三方 1.22–1.33(差约 1.6–1.7 倍)。差异可能来自
language="auto"、max_new_tokens、参考音色选择。选型请按第三方保守估计。 缺失:UTMOS / 自然度、RTF、VRAM 均未查到(README 只说 "recommend using FlashAttention 2 to reduce GPU memory usage")。
⚡ 流式能力:
🟢 sm_120 / Blackwell:本次调研中唯一「零 issue」的模型 —— 专项检索 repo:QwenLM/Qwen3-TTS+sm_120 → total_count = 0。
已知坑:
pip install -U qwen-tts;推荐 FlashAttention 2(MAX_JOBS=4)。attn_implementation="flash_attention_2" → 没装 flash-attn 或硬件不支持 FA2 时开箱即失败(有修复 PR #373)。不微调则不受影响。qkv_attention_manual 未掩码 padding keys、#124/#345 macOS/MPS 支持、#179 微调 Base 每 epoch 语速变快。→ 结论:Qwen3-TTS 是本报告推荐的「实时对话链路」最优候选之一(97ms + 原生流式 + Apache-2.0 + sm_120 零风险)。结合姊妹报告里 LiveTalking 作者实测的「Qwen3-TTS-0.6B + vLLM-Omni 首包 ~130ms @ RTX 3090」,它是唯一同时满足「可商用 + 低延迟 + 无 Blackwell 兼容风险」的选项。
| 项 | 内容 |
|---|---|
| GitHub | https://github.com/meituan-longcat/LongCat-AudioDiT |
| License | MIT(LICENSE 全文已抓,Copyright (c) 2026 Meituan)→ ✅ 可自由商用 |
| HuggingFace | https://huggingface.co/meituan-longcat/LongCat-AudioDiT-3.5B(另有 -1B);HF license tag = mit |
| 论文 | arXiv:2603.29339 ✅《LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space》,2026-03-31 |
| 参数 | 3.83B(HF API 精确张量数),权重 dtype = F32 |
中文效果(Seed-TTS test-zh,第三方表):CER 1.09 / SIM 81.8 ← 本次调研所有表中中文说话人相似度最高;EN WER 1.50 / SIM 78.6;hard-zh CER 6.04 / SIM 79.7。(OpenBMB/VoxCPM 表)
❌ 流式:非自回归扩散架构 → 不支持流式,TTFB / RTF 均未查到。
→ 对本项目(离线口播)的含义(重要):「非流式」在离线口播场景完全不是缺点 —— 下游 A 类音频驱动模型本来就要一段完整音频。「MIT + 中文 SIM 81.8 全场最高 + 3.83B」使它成为离线高质量兜底的最强候选,且许可比 IndexTTS-2.5(有营收门槛)更宽松。 短板:① 显存未公布,3.83B F32 权重意味着磁盘与显存开销偏大(F32 约 15GB 权重 → 16GB 卡需转 bf16/fp16 或量化,有风险,需实测);② sm_120 实测未查到。
| 项 | 内容 |
|---|---|
| GitHub | https://github.com/FireRedTeam/FireRedTTS2 |
| License | Apache-2.0(代码 + HF tag)→ ✅ 可商用 |
| HF | FireRedTTS-2 权重(HF tag = apache-2.0) |
torch 2.7.1 + cu126 → 与本机 cu128/cu130 需对齐(cu126 不含 sm_120)→ 这是它的主要风险;未检索到 sm_120 issue。(完整内容见第 6 节)MOSS-TTS-Realtime:TTFB 180ms / RTF 0.51(单卡 L20),Apache-2.0。⚠️ 需 FlashAttention 2(sm_120 风险),但有 llama.cpp / ONNX 无 torch 路径可绕开。建议纳入候选池。
| 项 | 内容 |
|---|---|
| GitHub | https://github.com/zai-org/GLM-TTS |
| License | ⚠️ 冲突:GitHub LICENSE = Apache-2.0,HF 模型卡 frontmatter = license: mit。两者都可商用,但文档不一致需法务确认 |
| 中文 | GLM-TTS_RL:CER 0.89 / SIM 76.4;GLM-TTS Base:CER 1.03 / SIM 76.1(厂商自报与第三方表完全一致,可信度较高) |
| 流式 | ✅ 支持(需 vLLM 后端);首包延迟 / RTF 未查到 |
🔴 关键坑(与我们的硬件完全一致):GitHub issue #9 —— 「RTX 5060 Ti 16G 上 GPU 利用率仅 40%」,用户质疑是 float32 导致。这是本次调研中唯一一条直接报告在 5060 Ti 16GB 上性能异常的 TTS issue。 若要选它,必须先复现该 issue。
| 模型 | 排除原因(证据) |
|---|---|
| Spark-TTS(SparkAudio) | ⚠️ 许可证致命冲突:GitHub LICENSE = Apache-2.0,但 HF 权重模型卡 license = cc-by-nc-sa-4.0(禁止商用)。→ 代码可商用、权重不可商用 → 整体判定不可商用。(另:中文 SIM 66.0 是本表最低之一;RTF 0.1362@L20 但非流式,平均延迟 876ms;1.5 年未更新) |
| Higgs Audio v2(Boson AI) | ⚠️ 主线已转非商用:仓库 README 现已改推 Higgs Audio v3,其许可为 Boson Higgs Audio v3 Research and Non-Commercial License;v2 文档被挪到 README_V2.md(代码 Apache-2.0,但 HF 权重 license = other(含义不明))。且 v2/v3 均未查到 arXiv 论文(只有博客)。VRAM 要求 ≥24 GB(README 明文)→ 16GB 不可跑。 另有 sm_120 坑:#39 Blackwell Docker 支持(open)、#177 libcudart.so.13 加载失败(open) |
| VibeVoice(Microsoft) | ⚠️ TTS 代码已被微软下架(2025-09-05,理由「被广泛滥用」),官方模型表把 VibeVoice-TTS-1.5B 标为 Disabled;官方 README 明文「不建议用于商业或真实场景」。当前活跃的是 VibeVoice-Realtime-0.5B(仅英文 + 单说话人,首音 ~200/~300ms 官方两处冲突,取保守 300ms)。虽然 LICENSE 是 MIT,但官方明确劝退商用。 |
SesameAILabs/csm,15k stars,Apache-2.0,1.55B F32):官方自述非英语 "likely won't do well";中文 CER/SIM 均未查到;无 arXiv 论文。 sm_120 坑:issue #118 —— RTX 5080 的 sm_120 与当前 PyTorch 不兼容(closed)。→ 不适合中文项目。stepfun-ai/Step-Audio2,Apache-2.0,8.32B):TTS 侧中文 CER/SIM 均未查到(只有 ASR 指标);需 vLLM 后端;显存未查到(8.32B → 16GB 紧张)。→ 本项目不推荐,但Step Audio EditX 在 Artificial Analysis 上开源 Elo 1094(英文),值得关注。| 模型 | 厂商自报 | 第三方 | 差异 |
|---|---|---|---|
| Qwen3-TTS-1.7B | ZH CER 0.77 | ZH CER 1.22–1.33 | 差 1.6–1.7× |
| Fish Audio S2 Pro | ZH WER 0.54 | CV3-Eval 3.62 | 差 6.7× |
| OmniVoice | SeedTTS ZH CER 0.84 | CV3-Eval ZH WER 3.41 | 差 4× |
| GPT-SoVITS | SeedTTS ZH WER 1.6 | CV3-Eval ZH CER 7.34 | 差 4.6× |
→ 「哪个中文 TTS 最强」高度依赖榜单与自测条件。任何单一数字都不足以定论。
✅ 本节已完成:完整证据见
_raw_TTS_digitalhuman_integration.md(64 KB / 1174 行;位于本目录,另有_scratch/副本,含 101 条实抓 URL + 「未查到项汇总」)。 另可交叉参考同目录姊妹报告实时交互数字人与TTS调研.md(另一个 DSH agent 产出,含数字人驱动框架与 TTS 的配对方案)。
| 框架 | 星标 · 许可证 · last-commit | 原生支持的 TTS(原文枚举) | 可插拔 | TTS 输出格式约束 |
|---|---|---|---|---|
LiveTalking lipku/LiveTalking | 9.6k · Apache-2.0 · september | edgetts / gpt-sovits / cosyvoice / fishtts / tencent / doubao / indextts2 / azuretts / qwentts(config.yaml 原注释);代码另有 xtts、omnitts | ✅ 完全可插拔:registry.py 的 @register("tts", name) | 硬编码 16000 Hz 单声道 int16;chunk = 16000//(fps*2) = 320 samples = 20 ms;REF_FILE 要求 "wav, 16kHz, mono" |
OpenAvatarChat HumanAIGC-Engineering/OpenAvatarChat | 3.8k · Apache-2.0 · july | 仅 3 个:EdgeTTS / CosyVoice(本地)/ 百炼 CosyVoice(API)(Qwen-Omni 模式下 TTS 由模型本体出) | ✅ Handler 插件(handler_search_path + module:) | sample_rate 默认 24000,单声道,可配 |
Fay xszyou/Fay | 14k · GPL-3.0 · yesterday | azure / ali / gptsovits / volcano / gptsovits_v3(system.conf.bak 原注释) | ⚠️ 仅配置切换(tts_module),换新引擎要改代码 | Azure Riff16Khz16BitMonoPcm;阿里 16 kHz 单声道 WAV;Edge 出 mp3 → pydub 转 wav |
Linly-Talker Kedreamix/Linly-Talker | 3.5k · MIT · february | Edge TTS / PaddleTTS / GPT-SoVITS(README 标 Recommend)/ XTTS / CosyVoice | ⚠️ 模块化流水线,无配置式注册表 | 未查到 |
Duix.Heygem(已改名 duixcom/Duix.Avatar) | 16k · not identifiable · april | 仅 fish-speech-ziming(guiji2025/fish-speech-ziming Docker);致谢原文 "TTS based on fish-speech-ziming" | ❌ 固定 Docker 微服务,无替换机制 | "format": "wav" 标 Fixed parameter;"streaming": false 固定关闭流式 |
aigcpanel modstart-lib/aigcpanel | 5.6k · Apache-2.0 · last friday | CosyVoice-300M / -300M-Instruct / CosyVoice2-0.5b / FishSpeech / IndexTTS / SparkTTS / GPT-SoVITS | ✅ 模型市场启动包 + 远程 API | 未查到 |
SoulX-FlashTalk Soul-AILab/SoulX-FlashTalk | 1.5k · Apache-2.0 · july | 无任何 TTS(grep "tts" = 0 次);纯 audio-driven | ❌ 无 TTS 层 | 输入音频 16000 Hz 单声道,按帧切 640 samples(=40ms@25fps),cached_audio_duration: 8 |
Ultralight-Digital-Human anliyuan/… | 2.6k · not specified · july | 无任何 TTS(grep "tts" = 0 次);wav→.npy 特征驱动 | ❌ 无 TTS 层 | 16000 Hz;wenet→20fps / hubert→25fps(默认分支是 master 不是 main) |
| Open-LLM-VTuber(参考,插拔性最好) | 14k · not identifiable · may | sherpa-onnx / pyttsx3 / MeloTTS / Coqui-TTS / GPTSoVITS / Bark / CosyVoice / Edge TTS / Fish Audio / Azure TTS(+ "etc.") | ✅✅ 配置切换 + 可自行新增模块 | 未查到 |
— 完整出处(每个都实抓):LiveTalking README · LiveTalking config.yaml · LiveTalking OmniTTS 文档 · OAC 预置模式 · Fay system.conf.bak · Linly-Talker README · aigcpanel README · SoulX infer_params.yaml
HumanAIGC/OpenAvatarChat 不存在 → 正确是 HumanAIGC-Engineering/OpenAvatarChat(shields.io 返回 repo not found)Korvo-AI/Linly-Talker 不存在 → 正确是 Kedreamix/Linly-Talkerduixcom/Duix.Heygem 已改名 → duixcom/Duix.Avatar(两者 stars/license/last-commit 三项完全一致,README 正文即 "Duix.Avatar")(modstart-lib/aigcpanel 确认无误。)
LiveTalking 硬编码 sample_rate = 16000、chunk = 16000//(fps*2) = 320 samples = 20 ms,且参考音频要求 "wav, 16kHz, mono"。 → 任何自定义 TTS 必须能输出 16 kHz 单声道 int16、按 20 ms 分块。而本报告里多数模型原生输出 22.05 kHz(IndexTTS-2.5)/ 24 kHz(OmniVoice、Kokoro、ChatTTS)/ 48 kHz(VoxCPM2、GPT-SoVITS v4、MOSS-Audio-Tokenizer-v2) → 接入前必须做重采样(CosyVoice 系列原生 24 kHz 也需转)。 纯 audio-driven 项目(SoulX-FlashTalk sample_rate: 16000、Ultralight「音频采样率需要是 16000」)同样收敛到 16 kHz 单声道。 → 本项目走「离线口播成片」,下游 A 类音频驱动模型一律吃 16 kHz 单声道 WAV,所以 TTS 侧的采样率差异不是障碍,只需一次 ffmpeg 重采样。
"streaming": false 固定关闭流式 → 离线任务式,无实时要求(与本项目的离线口播形态一致)。| 结论 | 依据 |
|---|---|
| 数字人驱动层几乎都不带 TTS,TTS 由你自由选 | SoulX-FlashTalk 与 Ultralight 的 README 中 "tts" 命中数均为 0 |
| 「现成集成」只在实时框架里才重要 | LiveTalking / OpenAvatarChat / Fay / Linly-Talker / aigcpanel 有内置枚举;纯音频驱动项目没有 TTS 层,因此不存在「不支持某 TTS」的问题 |
| 只需要 16 kHz 单声道 WAV | LiveTalking / SoulX-FlashTalk / Ultralight 三处独立确认 |
| 许可证是更该担心的 | Fay 是 GPL-3.0(README 自称「商用免责」只是作者口头承诺,不是许可证授予的额外权利);Duix.Avatar 许可字段不可识别;OmniVoice 权重 CC-BY-NC、Fish Audio S2 Pro 均不可商用 |
| 流式只在接实时框架时才是硬门槛 | 离线口播用「整段音频」即可,非流式的 IndexTTS-2.5 / OmniVoice / F5-TTS / GPT-SoVITS 都可用 |
⚠️ 另一处与本报告相关的坑(来自姊妹报告
实时交互数字人与TTS调研.md,需自行复核):OpenAvatarChat的pyproject.toml钉 PyTorch 2.4.1 + CUDA 12.4(不含 sm_120 kernel),Blackwell 上必须自行升到 cu128/cu130;MOSS-TTS/OpenAvatarChat/SoulX-FlashHead都要求 flash-attn,而 flash-attn 无 sm_120 预编译 kernel。
本次调研的硬约束是「RTX 5060 Ti 16GB,sm_120(Blackwell)」。
flash_attn nvcc fatal : Unsupported gpu architecture 'compute_120'
— 博客园(2026-04-03)记录安装 flash-attention 时的这个报错,并提到「CUDA 版本不匹配」与「显卡架构不被支持」两类原因。cnblogs.com/xyz/p/19817397
相关上游修复线索(说明 sm_120 支持是 2026 年才在补的):
补齐的 sm_120 坑清单(来自同目录姊妹报告 实时交互数字人与TTS调研.md 第 3.1 节,标注其来源等级):
| 坑 | 现象 | 证据 |
|---|---|---|
| FlashAttention-2 无 sm_120 预编译 kernel | no kernel image is available for execution on the device;源码编译 nvcc fatal: Unsupported gpu architecture 'compute_120' | 🟢 Dao-AILab/flash-attention#2168;cnblogs 2026-04-03 |
| SageAttention 2.2.0 官方构建无 sm_120 内核 | 超长序列走 triton JIT → GSP 挂死 → GPU 掉总线 | 🟢 本机 2026-09-14 实测(H3 场景,一夜 4 次掉总线全部走 SageAttention 路径) |
| onnxruntime-gpu 官方 wheel 缺 sm_120 | LivePortrait 硬钉 onnxruntime-gpu==1.18.0(2024 构建);onnxruntime#27621 报告 Blackwell 上 CUDA EP 静默死锁 | 🟢 |
| torch 必须 cu128 及以上 | cu121/cu124 wheel 不含 sm_120 → 加载即报 no kernel image | 🟢 本机实测 torch 2.11.0+cu130 的 arch_list 含 sm_120(本机已就绪) |
libnvrtc-builtins.so 版本错配 | torch 是 cu130 而系统 CUDA 是 13.1 → 找不到 libnvrtc-builtins.so.13.0 | 🟢 本机 2026-09 实测 |
对本报告 TTS 清单的直接影响:
flashinfer-jit-cache==...+cu128)→ 需确认有 sm_120 内核结论先行:没有一个 TTS 框架是「天生不支持 sm_120」,全部是「整合包 / requirements 钉死了旧 torch(≤2.3/2.4,只编到 sm_90)」导致的。换 cu128 的 torch ≥2.7 基本都能解。(来自 _raw_TTS_benchmarks.md)
| 框架 | 具体 issue | 报错原文 / 现象 |
|---|---|---|
| CosyVoice | issue #1815 直接点名 RTX 5060 Ti | Error A = torch 2.4+ 移除 ProcessGroup.options;Error B(按 requirements 降级)= sm_120 … supports up to sm_90. Note: **RTX 50-series cards require modern CUDA toolkits and PyTorch versions not covered by the current requirements**;Error C = hyperpyyaml/ruamel.yaml 依赖冲突。→ 升 torch 2.7/2.8 + cu128 可解(requirements 里 torch 2.3.1 只到 sm_90) |
| GPT-SoVITS | issue #2205 / #2514 / #2393 / #2394,并有开着的 DDP 修复 PR #2774 | sm_120 is not compatible with the current PyTorch installation…supports sm_37…compute_37(#2205);RuntimeError: no kernel image is available(#2514,该用户误装 cu121 nightly);⚠️ 在 5060 Ti 上「GPT 模型可以训练、SoVITS 模型训练报错」(#2393/#2394,卡在 s2_train.py 的 mp.spawn)→ 推理不受影响,只有训练受影响 |
| ChatTTS | jianchang512/ChatTTS-ui 整合包 issue #290 | 5070 Ti 报同样的 sm_120 不兼容 |
| Fish-Speech S2 Pro | 上游 vLLM-Omni 配方在 sm_120 上确实是坏的 | "FlashAttention-3 ships kernels only for Hopper sm90a / Blackwell-Ultra sm120a, and SGLang is blocked on sm_120" → 第三方 Genesis1231/fish-s2-rtx 给出可用容器(vLLM-Omni 0.22 + torch 2.11 + cu130 + sm_120 kernels),并提示 prefix caching 会产生空音频需关闭 |
| flash-attn | issue #2016 给出免编译可用组合 | Python 3.10 + CUDA 12.8 + torch 2.7.1,然后 pip install flash_attn==2.8.0.post2 torch==2.7.1 --no-build-isolation |
| IndexTTS / F5-TTS / MegaTTS3 / MOSS-TTS | sm_120 实测未查到 | index-tts issue #242「能用 RTX50 系显卡跑吗?」与 sneekes.app 的 RTX5070 F5-TTS 安装指南两次抓取均超时 |
→ 对本项目的落地含义(很重要):
- CosyVoice 在国内流传的 requirements 是「装了就在 5060 Ti 上必挂」的。本报告推荐 Fun-CosyVoice3 时,必须显式把 torch 升到 ≥2.7 + cu128/cu130,不要照抄 requirements。
- GPT-SoVITS 在 5060 Ti 上推理可用、训练会崩(
s2_train.py的mp.spawn)→ 若只需推理(本项目正是如此),风险可控。- Fish Audio S2 Pro 的流式路径(vLLM-Omni/SGLang)在 sm_120 上被 FA3 阻断 —— 又一个不利因素(叠加其不可商用)。
- 需要 flash-attn 的项目,先用 flash-attention#2016 的免编译组合试,别一上来就源码编译。
| 模型 | 参数 | 16GB 可跑 | sm_120 实测/issue | 主要风险 |
|---|---|---|---|---|
| ⭐ Qwen3-TTS | 1.7B(实 1.93B)/ 0.6B | 未查到 VRAM(需实测) | 🟢 专项检索 total_count = 0 —— 本次调研中唯一「零 sm_120 issue」的模型 | 微调脚本硬编码 FA2(issue #372,不微调则无影响) |
| ⭐ LongCat-AudioDiT | 3.83B(F32) | ⚠️ F32 权重约 15GB+,需转 bf16/fp16 或量化才能进 16GB,未查到实测 | 未查到 | 非流式(离线场景无妨);F32 权重体积大 |
| FireRedTTS-2 | 1.5B | ✅ bf16 9GB / fp32 14GB(厂商自报) | 未检索到 sm_120 issue | ⚠️ 锁 torch 2.7.1 + cu126(cu126 不含 sm_120)→ 需对齐 CUDA 版本 |
| GLM-TTS | 1.5B | 未查到 | 🔴 issue #9:RTX 5060 Ti 16G 上 GPU 利用率仅 40%(用户质疑 float32)—— 与本次目标硬件完全一致 | 许可冲突(Apache-2.0 vs MIT) |
| VoxCPM2 | 2.29B(标称 2B) | ✅ ~8GB(厂商自报) | 🔴 #250 Blackwell/sm_120 Docker 支持(open)、#326 Blackwell CUDA graph 音质劣化、#282 Blackwell 比 4090 慢、#102 4090 segfault | 多个 Blackwell open issue,需预留调试时间 |
| Higgs Audio v2 | 5.77B(HF)/ "3.6B LLM + 2.2B adapter" | ❌ 需 ≥24GB(README 明示) | 🔴 #39 Blackwell Docker(open)、#177 libcudart.so.13 加载失败(open) | 且许可不可推定可商用 |
| Sesame CSM | 1.55B(F32) | 未查到 | 🔴 #118 RTX 5080 的 sm_120 与当前 PyTorch 不兼容(closed) | 无中文支持 |
| OmniVoice | 0.8B | ✅ 余量很大(官方甚至支持 4GB Intel Arc;第三方实测峰值 2,207 MiB) | 未查到 | FlashInfer 需匹配 cu128 wheel;flash_attn 有 SDPA 回退;微调撞 sm_120 共享内存墙 |
| IndexTTS-2.5 | 0.8B | ✅ 官方称 ~6GB VRAM | 未查到(要求 CUDA ≥12.8) | 可选「compiled CUDA kernels」可能无 sm_120 预编译;sm_120 实测未查到 |
| Fun-CosyVoice3 | 0.5B | ✅ 余量很大 | 未查到 | ⚠️ requirements 里 torch 2.3.1 只到 sm_90 → 官方 requirements 在 5060 Ti 上必挂(issue #1815 点名);vLLM 版本窗口窄(0.9.0 或 ≥0.11.0);建议独立 conda 环境 + torch≥2.7/cu128 |
| GPT-SoVITS | 229M | ✅ 最省显存之一 | 未查到,但install.sh 有 CU128 档 + 官方测过 torch2.7/CUDA12.8 | 5060 Ti 上训练崩(#2393/#2394)、推理可用;无流式 |
| Fish Audio S2 Pro | 4B | ⚠️ 理论可跑(fp16 ≈8GB)但官方未给 VRAM | 未查到 | 低延迟需 SGLang-Omni/vLLM-Omni;且不可商用 |
| MOSS-TTS | 8B / 4B / 1.7B / 100M | ✅ 官方称 8B 已能塞进 8GB 卡(llama.cpp) | 未查到 | 需 FlashAttention 2(sm_120 高风险);有 llama.cpp/ONNX 无 torch 路径可绕开 |
| F5-TTS | 0.3–0.4B | ✅ 余量很大 | 未查到 | pynini 在部分平台无 wheel |
| MegaTTS3 | 0.45B | ✅ | 未查到 | 需 Google Drive 转 .npy voice latent(国内不可达);Windows 支持未完成 |
| Kokoro | 82M | ✅ 几乎无需求(可 CPU) | N/A | 需 espeak-ng;项目 2025-08 后停更 |
| ChatTTS | 未查到 | ✅(官方:30s 音频 ≥4GB) | N/A(官方明确禁用 flash-attn/TransformerEngine) | AGPL + CC-BY-NC 双重不可商用;音质被官方故意劣化 |
16GB 显存对本清单里绝大多数模型都不是瓶颈(最大的 Fish Audio S2 Pro 4B 与 MOSS-TTS 8B 才有压力,而 MOSS-TTS 有 llama.cpp 8GB 路径)。 真正的风险是 sm_120 的算子/编译生态:需要 flash-attn 或 triton 自定义内核的项目(MOSS-TTS、OmniVoice 的 FlashInfer 路径、可能含 IndexTTS 的 compiled kernels)在 Blackwell 消费卡上要预留调试时间。规避策略:优先选有 SDPA/flash-attn 回退、或提供 llama.cpp/ONNX CPU 路径的项目(MOSS-TTS、OmniVoice、ChatTTS 天然避开)。
✅ 本节已完成:完整证据见
_raw_TTS_benchmarks.md(73 KB / 732 行,151 个实抓 URL;位于本目录,另有_scratch/副本,抓取日 2026-09-22)。 核心结论:2026 年没有任何一个第三方 Elo 榜能评中文 TTS。 详见 14.1。
| 榜单 | 能否评中文 | 是否可抓取 | 覆盖了本报告哪些模型 |
|---|---|---|---|
| Artificial Analysis TTS Leaderboard | ❌ 纯英文(只有 US/UK 口音,locale=en) | ✅ 可抓(页面内嵌 JSON-LD + Next.js payload) | 90 个模型中仅 16 个开源权重;中国开源模型(IndexTTS / CosyVoice 开源权重 / GPT-SoVITS / ChatTTS / F5-TTS / MegaTTS3 / OmniVoice / MOSS-TTS / VoxCPM2 / GLM-TTS / FireRedTTS-2)全部不在榜 |
| HuggingFace TTS Arena V2 | ❌ 原文 "Prompts are English-only for now, capped at 1,000 characters" | ❌ 原始 Elo 本轮取不到(huggingface.co 被墙;hf-mirror 明确拒绝 Spaces:「本站暂不支持访问 Spaces 空间」) | — |
| TTS Spaces Arena(原始投票数据) | ❌ 英文单句朗读 | ✅ 原始投票公开(HF dataset Pendrokar/TTS_Arena,2026-09-21 更新) | Kokoro、MOSS-TTS、MegaTTS3、GPT-SoVITS、F5-TTS、fish-speech、SparkTTS、IndexTTS |
| VoiceHub Arena / kadirnar 独立 Seed-TTS-Eval | ❌ 英文(Seed-TTS test-en,1088 条) | ✅ CSV 可抓 | Kokoro、OmniVoice、F5-TTS、MOSS-TTS、CosyVoice3、GPT-SoVITS、VoxCPM2、FishTTS、VibeVoice、Qwen3-TTS、HiggsTTS 等 33 个 |
| CV3-Eval / Seed-TTS-eval | ✅ 中文 | ✅ 代码与数据开源 | 见第 0.2b 节(这才是中文选型的依据) |
→ 结论:选中文 TTS 只能靠 CV3-Eval / Seed-TTS-eval 这类「厂商也参与贡献、但测试集与 ASR/SIM 模型公开」的基准 + 自测。英文 Elo 榜对中文选型几乎无参考价值(它会把 Kokoro 这种英文强、中文无官方支持的模型排到开源第一梯队)。
页面 FAQ 原文数字(AA TTS Leaderboard · open-weights):
| 类别 | 模型 | Elo |
|---|---|---|
| 榜首(闭源) | Sonic 3.6 | 1272 |
| 闭源 | Alibaba Qwen-Audio-3.0-TTS-Plus(页面归入 cosyvoice-tts 家族,openWeights: false) | 1260 |
| 开源第一 | Breeze TTS 2 | 1204 |
| 开源 | Fish Audio S2 Pro | 1121 |
| 开源 | Step Audio EditX | 1094 |
| 开源 | Voxtral TTS | 1075 |
| 开源 | Magpie-Multilingual 357M | 1063 |
| 开源 | Kokoro 82M v1.0(CI 1050–1072,5224 次投票;且最便宜:$0.65/1M 字符) | 1060.98 |
| 开源 | Higgs Audio V3 | 1032.15 |
| 开源 | Chatterbox | 1020.54 |
| 开源 | VibeVoice 1.5B | 950.85 |
| 开源 | Qwen3 TTS | 925.98 |
| 开源 | XTTS v2 | 913.81 |
| 开源 | StyleTTS2 | 891.24 |
⚠️ 读这张表必须注意:① 纯英文;② 开源口径与「中文能力」无关(Kokoro 排 1060 是因为英文朗读好,它中文无官方支持);③ 中文强模型(IndexTTS2.5 / CosyVoice3 / OmniVoice / MOSS-TTS)不在榜,不是因为弱,而是没提交。 第三方转述:sovgrid.org(2026-05-12)与 theaibench.ai(2026-09)两处独立转述称 Fish Audio S2 Pro 为开源第一 ELO 1128;Kokoro-82M 已从 #1 掉到中游。
数据源:HF dataset Pendrokar/TTS_Arena(2026-09-21 更新,tts_arena_vote_summary_all.tsv)。subagent 自行统计 36,993 次投票事件。 ⚠️ 这是 [我方推导] 的胜率(wins 会高估),不是官方 Elo,且为英文单句朗读:
| 模型 | 胜率 |
|---|---|
| kokoro / Kokoro-API | 98.4% / 96.7%(第一梯队) |
| Orpheus-TTS | 95.0% |
| MOSS-TTS | 86.2% |
| fish-speech-1 | 81.3% |
| MegaTTS3 | 79.4% |
| GPT-SoVITS-v2 | 74.7% |
| IndexTTS | 72.7% |
| SparkTTS | 71.1% |
| F5-TTS(E2-F5-TTS) | 67.4% |
| GPT-SoVITS-ProPlus | 27.5%(垫底) |
→ 与 GPT-SoVITS 官方 wiki 的中文结论(v2ProPlus 中文 SIM 最高 0.737)方向相反 —— 再次证明英文榜不能外推到中文。
条件:33 个模型 × 1088 条 Seed-TTS test-en,单台 A100 40GB,2026-09-15 完成;ASR = faster-whisper-large-v3 fp16 beam5 seed42;作者明确声明不测 SIM / MOS。 数据:voicehub-arena-seed-tts-eval leaderboard.csv
WER%(英文)(节选;注意含质量存疑项):
| 模型 | WER% |
|---|---|
| Kokoro | 0.9629(第一) |
| Supertonic | 0.9797 |
| OmniVoice | 0.9880 |
| SpeechT5 | 1.0131 |
| F5-TTS | 1.0550 |
| FishTTS(S2 Pro) | 1.1471 |
| Chatterbox | 1.2308 |
| MOSS-TTS | 1.2308 |
| VibeVoice | 1.3146 |
| Qwen3-TTS | 1.3816 |
| CosyVoice3(修正后 = Fun-CosyVoice3-0.5B-2512) | 1.7416 |
| HiggsTTS | 1.7416 |
| GPT-SoVITS | 2.6375(第 22/33) |
| VoxCPM2 | 3.3492 |
| Llasa / Dia | 73.99 / 67.35(已标注质量存疑) |
⚠️ 榜上无 ChatTTS / MegaTTS3 / IndexTTS。
第二个 campaign 提供 speaker SIM(WavLM-large ECAPA)+ 效率(环境 torch 2.8.0+cu128,RTX 6000 Ada):
| 模型 | SIM | WER% | RTF | 峰值显存 |
|---|---|---|---|---|
| OmniVoice(克隆) | 0.7385 | 1.0718 | 0.223 | 2,207 MiB |
| F5-TTS(克隆) | 0.6691 | 1.2643 | — | — |
| Kokoro | N/A(无参考音频,不支持零样本克隆) | — | 0.042(最快) | 480 MiB |
| VibeVoice-Realtime-0.5B | — | 1.3481 | 0.629 | — |
Kokoro 的三个「第一」很有意思:UTMOS22 4.5037 / DNSMOS 3.4267 最高、RTF 0.042 最快、显存仅 480 MiB。以 82M 参数做到这点非常惊人 —— 但代价是不支持零样本克隆,且中文无官方支持。 ⭐ OmniVoice 的 2,207 MiB 峰值显存是本次调研拿到的唯一第三方实测显存数字(此前只能标注「官方未给」)→ 进一步确认 16GB 卡对它绰绰有余。
sovgrid.org(2026-05-12,独立第三方,真实生产环境 DGX Spark / GB10 Blackwell) 把候选按「多说话人 + 表现力 + 克隆 + 速度控制 + 开源许可 + SM12.1 兼容」筛完后,只留三个 spike:VibeVoice(社区 fork)、Higgs Audio v2、IndexTTS-2,并明确指出:
"VibeVoice, Higgs Audio v2, and IndexTTS-2 are either too new or have not been submitted(到 AA 榜)";"top-of-leaderboard for a different use case is not the same as best fit"
→ 这是本次调研中唯一一条「按 sm_12x Blackwell 生产环境实测 + 商用许可」筛出来的第三方建议,与我们的结论(IndexTTS-2.5 / MOSS / CosyVoice3 优先)部分吻合(都看重 IndexTTS 系列)。 另注:VibeVoice 原仓库 2025-09 被微软下架(deepfake 风险),且它是唯一有公开 DGX Spark CUDA13/aarch64 部署记录的引擎。
| 模型 | 缺什么 |
|---|---|
| ChatTTS | 任何 SeedTTS WER/CER/SIM 都未查到(官方无论文,第三方榜也未收录) |
| Kokoro | test-zh CER / SIM-o 未查到(无官方论文,第三方只测英文);官方模型卡 language tag 只有 en → 中文靠第三方权重 hexgrad/Kokoro-82M-v1.1-zh(HF 镜像 downloads 22,373)与 onnx-community/Kokoro-82M-v1.1-zh-ONNX;社区报告(KokoroSharp issue #5)C# 版中文「口音很重、听不太清」,Python 版正常 |
| GPT-SoVITS | SeedTTS test-zh/test-en 的正式第三方数字未查到;只有 CV3-eval 口径的 ZH-CER 7.34 / EN-WER 12.5(VoxCPM 论文 arXiv:2509.24650 Table 4;同表 CosyVoice2 4.08/6.32、IndexTTS2 3.58/4.45、CosyVoice3-0.5B 3.89/5.24)。⚠️ CV3-eval 数值远高于 SeedTTS test-zh,绝不可混用口径 —— 这也说明 GPT-SoVITS 在 CV3-eval 口径下中文很弱(7.34),与其官方 wiki 的 SeedTTS 0.016 差距极大,是本次调研最大的口径冲突案例 |
| MegaTTS3 | 中文数字只有转引:VoxCPM 论文 Table 3 给 ZH-CER 1.52 / SIM 79.0、EN-WER 2.79 / SIM 77.1;RobustSpeechFlow(arXiv:2605.22083)Table 7 给同值 2.79/0.77 → 两个独立来源互相印证,可信度较高 |
| IndexTTS / F5-TTS / MegaTTS3 / MOSS-TTS | sm_120 实机实测均未查到(index-tts issue #242「能用 RTX50 系显卡跑吗?」与 sneekes.app 的 RTX5070 F5-TTS 指南两次抓取均超时) |
| 中文 Arena 排名 | 发现唯一的中文 Arena 原始投票数据 JacobLinCool/zh-tw-tts-arena-votes(2026-07-24,4 个 jsonl),本轮只读了 README 未统计 → 中文 Arena 排名仍是「未查到」(值得后续补做) |
| 评测资产 | URL | 性质 |
|---|---|---|
| Seed-TTS-eval(字节官方评测代码/模型) | https://github.com/BytedanceSpeech/seed-tts-eval | 事实标准,GPT-SoVITS wiki、多篇论文都用它 |
| CV3-Eval(阿里 CosyVoice3 官方开源评测集) | https://github.com/FunAudioLLM/CV3-Eval | 阿里开源,被 IndexTTS2.5 采用 |
| Seed-TTS 论文 | arXiv:2406.02430 | 测试集来源 |
| VoiceHub/kadirnar 英文榜 | https://hf-mirror.com/datasets/kadirnar/voicehub-arena-seed-tts-eval/raw/main/leaderboard.csv | 独立第三方大规模复现(英文) |
| TTS Spaces Arena 原始投票 | HF dataset Pendrokar/TTS_Arena | 原始投票,非官方 Elo |
| AA TTS Leaderboard | https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice/open-weights | 第三方 Elo(英文) |
⚠️ 重要方法学警告(来自 GPT-SoVITS 官方 wiki,很有价值):
「这个 benchmark 有啥用:测合成发音和目标发音的匹配度(WER),和音色相似度(SIM)。测不了自然性、情感丰富性和音质,前 2 个要人工打分。同时测试集的音色也有局限性。分数仅供参考,如果需要准确的结论请你用自己的实际场景训练集去微调和测试集去测试。论文里的分数、业界的情报和媒体宣传都是浮云,请永远相信,只有你自己的测试结论才是最真实的。」 — GPT-SoVITS wiki
→ 本报告全部数字都应在此前提下使用。中文选型请以 CV3-Eval / Seed-TTS-eval + 自家场景自测为准。
| 模型 | 代码 | 权重 | 能否商用 | 关键约束 |
|---|---|---|---|---|
| ⭐ Qwen3-TTS(阿里) | Apache-2.0 | apache-2.0(HF tag 已确认,gated: False) | ✅ 自由商用 | 微调脚本需自行改 FA2 设置 |
| ⭐ LongCat-AudioDiT(美团) | MIT | MIT(HF tag = mit) | ✅ 自由商用 | 最宽松许可之一 |
| FireRedTTS-2(小红书) | Apache-2.0 | Apache-2.0 | ✅ 自由商用 | 锁 torch2.7.1+cu126 |
| ZipVoice(k2-fsa/小米) | Apache-2.0 | Apache-2.0 | ✅ 自由商用 | cu12.x 预编译,CUDA13 需自编 |
| Step-Audio 2 mini(阶跃) | Apache-2.0 | Apache-2.0 | ✅ 自由商用 | 仅 mini 开源;8.32B 显存未查到 |
| GLM-TTS(智谱) | ⚠️ Apache-2.0 | ⚠️ HF 标 mit(与仓库冲突) | ⚠️ 大概率可,但文档冲突需书面确认 | + 5060 Ti issue #9 |
| VibeVoice(微软) | MIT | MIT | ⚠️ 法律上可(MIT),但官方明文「不建议商用/仅限研发」 | TTS 代码已被下架 |
| Sesame CSM | Apache-2.0 | Apache-2.0 | ✅ 可(附 Misuse 条款) | 但无中文支持 |
| ❌ Spark-TTS | Apache-2.0 | ⚠️ CC-BY-NC-SA-4.0 | ❌ 权重不可商用 | 代码/权重许可自相矛盾 |
| ❌ Higgs Audio v2 | Apache-2.0(仓库) | ⚠️ license: other(含义不明) | ❌ 不可推定可商用 | 主线 v3 明确非商用;需 ≥24GB |
| ⭐ VoxCPM2(OpenBMB) | Apache-2.0 | Apache-2.0 | ✅ 自由商用 | 官方原文 "free for commercial use" |
| Fun-CosyVoice3-0.5B-2512 | Apache-2.0 | apache-2.0 | ✅ 自由商用 | 无 |
| MOSS-TTS 全家族 | Apache-2.0 | Apache-2.0 | ✅ 自由商用 | 无 |
| F5-TTS | MIT | MIT | ✅ 自由商用 | 无 |
| GPT-SoVITS | MIT | MIT | ✅ 自由商用 | 无 |
| MegaTTS3 | Apache-2.0 | Apache-2.0 | ✅ 自由商用 | 需 Google Drive 转 latent |
| Kokoro | Apache-2.0 | Apache-2.0 | ✅ 自由商用 | 无 |
| IndexTTS-2.5 | bilibili 自定义 | bilibili Model Use License | ⚠️ 有条件商用 | 月活 >1 亿 或 年营收 >10 亿人民币须另行授权;禁高风险场景;禁用于改进他人 AI 模型;上海仲裁 |
| OmniVoice | Apache-2.0 | CC-BY-NC | ❌ 权重不可商用 | 训练数据(Emilia)导致 |
| Fish Audio S2 Pro | Fish Audio Research License | 同左 | ❌ 一律需单独授权 | 连企业内部自用也算商用;商务联系 business@fish.audio |
| ChatTTS | AGPLv3+ | CC BY-NC 4.0 | ❌ 不可商用 | AGPL 对网络服务有源码开放义务;官方故意劣化音质 |
一句话结论:要商用 → VoxCPM2 / CosyVoice3 / MOSS-TTS / F5-TTS / GPT-SoVITS / MegaTTS3 / Kokoro(全部宽松许可)或 IndexTTS-2.5(中小企业免费)。避开 OmniVoice、Fish Audio S2、ChatTTS。
⚠️ 前提澄清(重要,会改变权重):结合同目录
数字人选型结论-20260922.md,本项目的实际形态是 「离线口播成片」(一张图/一段视频 + 现成人声音频 → 口型同步视频),走 A 类音频驱动路线(MuseTalk 1.5 / SoulX-FlashHead Lite / EchoMimicV3-Flash / LongCat-Video-Avatar 1.5)。 这意味着 TTS 只需产出「一段完整音频文件」,下游数字人模型拿现成音频对口型 —— 因此:
- 流式 / TTFB 的重要性大幅下降(不是实时对话链路,不需要边生成边驱动口型);
- 权重上升的是:中文自然度、说话人相似度、音色/情绪可控性、单次生成稳定性、许可证、显存占用(要和数字人模型抢同一张 16GB 卡)。
- 但任务书明确要求核查流式能力与数字人框架集成,故两项都保留。若后续要接实时数字人(LiveTalking / OpenAvatarChat / Fay 那类),流式项就是硬门槛。
| 排名 | 模型 | 核心理由 | 短板 |
|---|---|---|---|
| 🥇 | ⭐ Qwen3-TTS(阿里,Apache-2.0) | 首包 97ms(官方,全场最低) + 原生双轨流式 + Apache-2.0 可商用 + sm_120 零 issue(本次唯一) + LiveTalking 作者实测 0.6B+vLLM-Omni ~130ms | VRAM 未公布需实测;微调脚本硬编码 FA2(不微调无影响) |
| 🥈 | Fun-CosyVoice3-0.5B-2512 | Apache-2.0 + 流式 150ms(第三方实测 ~195ms)+ 中文 SS 78/80 + 9 语言 18 方言 + vLLM/TRT-LLM 生产路径 | 主仓库 last-commit=may(活跃度下降);⚠️ 官方 requirements 的 torch 2.3.1 在 5060 Ti 上必挂(issue #1815 点名),需自行升 torch≥2.7/cu128 |
| 🥉 | VoxCPM2(2B, OpenBMB) | Apache-2.0(HF 侧已确认) + 官方 generate_streaming() + 中文 CER 0.97 / SIM 79.5 + 48kHz + ~8GB VRAM | 未公布 TTFB;sm_120 多个 open issue(#250/#282/#326) |
| 4 | FireRedTTS-2 | Apache-2.0 + 首包 140ms + bf16 9GB + 4 说话人长对话 | 锁 torch2.7.1+cu126(cu126 不含 sm_120);单句 CER 1.14 一般 |
| 5 | MOSS-TTS-Realtime | Apache-2.0 + TTFB 180ms + ZH SIM 79.62 + 8B 能塞 8GB 卡 | 需 FlashAttention 2(sm_120 风险);家族档位多 |
| 排名 | 模型 | 核心理由 | 短板 |
|---|---|---|---|
| 🥇 | ⭐ LongCat-AudioDiT(美团,MIT) | MIT 最宽松许可 + 中文 SIM 81.8(全场最高);非流式在离线场景不是缺点 | 3.83B F32 权重(需转半精度进 16GB,待实测);sm_120 未查到 |
| 🥈 | IndexTTS-2.5 | 中文 CER 0.93–1.21% + SS 77.9 + 情绪/时长强可控(第三方评价「对口型同步非常有意义」)+ 官方 6GB VRAM + 中小企业免费商用 | 大厂需另行授权;无流式(离线无妨) |
| 🥉 | VoxCPM2 | 中文 CER 0.97 / SIM 79.5 + 48kHz + ~8GB | sm_120 open issue |
| 4 | MegaTTS3 | Apache-2.0 + 中文 SIM 79.0 + RTF 0.124(加速版) | 必须用 Google Drive 转 .npy latent(国内不可达);2025-03 后停更 |
| 5 | GPT-SoVITS v2ProPlus | MIT + 中文 SIM 0.737(接近真人 0.750)+ 229M 最省显存 | 自然度无客观数字 |
| 模型 | 排除原因 |
|---|---|
| OmniVoice(小米) | 权重 CC-BY-NC(不可商用);且有输出乱码 bug(Issue #155 未修) |
| Fish Audio S2 Pro | 一律需单独授权,HF 门禁强制勾「non-commercial use ONLY」;且 sm_120 上 vLLM-Omni 配方被 FA3 阻断 |
| Spark-TTS | HF 权重 CC-BY-NC-SA-4.0 → 商用踩雷;中文 SIM 66.0 最低之一 |
| Higgs Audio v2 | HF license other 含义不明;主线 v3 明确非商用;需 ≥24GB;无 arXiv 论文 |
| VibeVoice-TTS-1.5B | 微软 2025-09-05 下架代码并标 Disabled,官方明文不建议商用;仅 Realtime-0.5B 存活(仅英文单说话人) |
| GLM-TTS | 许可 GitHub Apache-2.0 vs HF mit 冲突;issue #9 报告 RTX 5060 Ti 16G 利用率仅 40%(与本机硬件一致) |
| Sesame CSM | 无中文支持(官方自述非英语「likely won't do well」);无 arXiv 论文;sm_120 #118 |
| Step-Audio 2 | 8.32B 显存未查到(16GB 紧张);TTS 侧中文指标未查到 |
| ChatTTS | 代码 AGPL-3.0 + 权重 CC BY-NC 4.0 双重不可商用;官方故意加噪+MP3 压缩劣化音质 |
| Kokoro | 官方 language tag 只有 en;中文无任何客观数字;2025-08 后停更;不支持零样本克隆 |
| MiniMax-Speech / Qwen3-TTS-Flash | 前者无开源仓库;后者闭源 API 无权重 |
export.arxiv.org/api/query 校验)flash_attn nvcc fatal : Unsupported gpu architecture 'compute_120'_raw_TTS_newmodels.md)README_V2.md;issue #39 Blackwell Docker、#177 libcudart.so.13| 文件 | 内容 | 规模 |
|---|---|---|
_raw_TTS_benchmarks.md | 第三方榜单与实测:Artificial Analysis TTS Elo、HuggingFace TTS Arena V2、TTS Spaces Arena 原始投票统计、VoiceHub/kadirnar 独立英文 Seed-TTS-Eval、中文实测帖、sm_120 全框架 issue 清单 | 73 KB / 732 行 / 151 个实抓 URL |
_raw_TTS_digitalhuman_integration.md | LiveTalking / OpenAvatarChat / Fay / Linly-Talker / Duix.Avatar / aigcpanel / SoulX-FlashTalk / Ultralight-Digital-Human / Open-LLM-VTuber 的原生 TTS 支持、可插拔性、采样率与 chunk 约束 | 64 KB / 1174 行 / 101 条实抓 URL |
另可交叉参考同目录姊妹报告 实时交互数字人与TTS调研.md(另一个 DSH agent 产出,含数字人驱动框架 + TTS 配对方案与端到端延迟测算)。
_raw_TTS_newmodels.md 已完成(105 KB / 1310 行 / 120 条实抓 URL):FireRedTTS-2 / Step-Audio / Spark-TTS / Higgs Audio v2 / VibeVoice / Sesame CSM / GLM-TTS / LongCat-AudioDiT / Qwen3-TTS / VoxCPM2 的 repo、HF 卡、许可证、显存均已核实,结论已并入本报告第 11 节。三个曾经的缺口(Qwen3-TTS 的 HF+许可、LongCat 的 owner、VoxCPM2 的 HF 侧许可)全部已坐实。 其中 Qwen3-TTS 的 HF repo 与许可证、LongCat-Audio-DiT 的 owner(疑似美团)、VoxCPM2 的 HF 侧许可证字段 是三个明确缺口(已解决:hf-mirror 抓 openbmb/VoxCPM 返回 401 是因为 repo 名错了——正确名是 openbmb/VoxCPM2(含 2,owner 全小写),返回 200,模型卡 frontmatter 第 33 行 license: apache-2.0,HF API tags = license:apache-2.0,gated: False → 与 GitHub 声明一致,「free for commercial use」成立)。JacobLinCool/zh-tw-tts-arena-votes(2026-07-24,4 个 jsonl),本轮只读了 README 未统计 → 排名仍为「未查到」。本文件由 DSH agent 于 2026-09-22 生成。所有 URL 均为实际抓取验证;查不到的字段一律标注「未查到」,未做任何推测填充。 工作副本位于 _scratch/_raw_TTS.md(父 agent 的清理流程会把 _raw_*.md 扫入 _scratch/);同内容副本保留在本目录 _raw_TTS.md。