_raw_TTS.md

开源 TTS / 语音克隆选型调研(2026 年 9 月最新状态)

调研截止日期:2026-09-22。调研目标:为「实时数字人 / 口播视频」链路选 TTS,重点关注中文自然度、说话人相似度、流式首包延迟、16GB 单卡(RTX 5060 Ti 16GB, sm_120 Blackwell)可跑性、商用许可、与数字人框架的现成集成。

数据纪律:每条关键结论后附实际抓取过的 URL。查不到的字段写「未查到」,不做推测。厂商宣称与第三方实测分开标注。

抓取方式:本机 web_fetch 常超时,全部用 curl(脚本 /tmp/dh/f.sh、/tmp/dh/txt.sh)。GitHub star/license/last-commit 走 shields.io;arXiv 用 export.arxiv.org/api/query 校验;HuggingFace 官方域名被墙,模型卡走 hf-mirror.com。


0. 一页速查(TL;DR)

0.1 2026 年格局:三件必须先知道的事

  1. IndexTTS 已迭代到 2.5(2026-08-10 发布),不是「IndexTTS-2」了。中文 CER 1.21%→0.93%(RL 版 0.81%),官方未内置流式。(index-tts README)
  2. Fish-Speech 已改名/升代为 Fish Audio S2 Pro(4B),许可证从 CC-BY-NC-SA 换成自研的 FISH AUDIO RESEARCH LICENSE(2026-03-07),明文规定商用必须单独授权。(LICENSE)
  3. OmniVoice 确为小米(Xiaomi Corp.),但托管在 k2-fsa 社区组织下;论文 arXiv:2604.00688 属实。代码 Apache-2.0,但模型权重是 CC-BY-NC(不可商用)。(HF 模型卡)

0.2 中文核心指标总表(SeedTTS test-zh,WER/CER↓ 与说话人相似度↑)

数值口径不完全统一(SIM-o / SIM / SS 三种写法),已标注来源。

模型参数中文 CER/WER ↓说话人相似度 ↑流式商用许可来源性质
Fish Audio S2 Pro4B0.54%未查到(表内未给 zh SIM)✅ TTFA <100ms❌ 需单独授权(HF 门禁强制 "non-commercial use ONLY")厂商
Qwen3-TTS-12Hz-1.7B-Base1.7B(实 1.93B)0.77%(自报)/ 1.22–1.33%(第三方)0.799(自报)/ 76.7–77.0(第三方)✅ 原生双轨流式,端到端延迟低至 97ms✅ Apache-2.0厂商 + 第三方
OmniVoice(小米)0.8B0.84%0.777(SIM-o)❌ NAR 非流式❌ 权重 CC-BY-NC厂商(论文 Table 1)
GLM-TTS-RL1.5B0.89%76.4✅ 支持(需 vLLM)⚠️ GitHub Apache-2.0 vs HF mit 冲突厂商 + 第三方(一致)
VoxCPM-0.5B0.6B0.93%77.2❌(1.5/2 版才流式)✅ Apache-2.0第三方表
IndexTTS2.5-RL0.8B0.93%(自家表 3.93*)77.92 / 76.4❌ 官方无流式⚠️ bilibili 自定义(有条件免费商用)厂商
⭐ VoxCPM22B(实 2.29B)0.97%79.5✅ 官方 generate_streaming,RTF ~0.30@4090 / ~0.13 Nano-VLLM✅ Apache-2.0(HF 侧 frontmatter 已确认)厂商(OpenBMB 表)
IndexTTS2(2.5)0.8B1.03–1.21%76.5 / 77.1–78.0❌ 官方无流式⚠️ 同上第三方表
⭐ LongCat-AudioDiT(美团)3.5B(实 3.83B)1.09%81.8(全场最高)❌ 非自回归扩散,非流式✅ MIT第三方表
FireRedTTS-21.5B1.14%73.6✅ 首包 140ms(L20)✅ Apache-2.0第三方三家一致
Fun-CosyVoice3-0.5B-25120.5B1.21%(RL 0.81%)78.0(RL 77.4)✅ 双向流式,150ms(第三方实测 ~195ms)✅ Apache-2.0厂商
MossTTSDelay8B1.37%76.98✅(Realtime 版 TTFB 180ms)✅ Apache-2.0厂商
ZipVoice123M1.40%0.751(SIM-o)❌✅ Apache-2.0OmniVoice 论文
MossTTSLocal1.7B1.44%79.62同上✅ Apache-2.0厂商
MegaTTS30.3–0.5B1.52%79.0❌✅ Apache-2.0第三方两源一致
F5-TTS0.3–0.4B1.52–1.53%74.1 / 76.0❌✅ MIT第三方表
Spark-TTS0.5B1.54%66.0(最低之一)❌❌ 权重 CC-BY-NC-SA-4.0第三方两家一致
GPT-SoVITS v2ProPlus229M1.6%0.737(SIM)❌ 无流式✅ MIT厂商(官方 wiki)
ChatTTS未查到未查到未查到部分(句级)❌ AGPL-3.0 + 权重 CC-BY-NC—
Kokoro-82M82M未查到未查到❌✅ Apache-2.0—
Sesame CSM1.55B未查到(官方自述非英语「likely won't do well」)未查到❌✅ Apache-2.0(但无中文)—

* IndexTTS2.5-RL 的 3.93% 出自其自家 CV3-Eval 表(不同测试集),0.93% 出自第三方对比表,两者不可直接比较。

⚠️ 四个「口径必须标注」的案例(同一模型不同榜单差异巨大):Qwen3-TTS 自报 0.77 vs 第三方 1.22–1.33(1.6–1.7×);Fish Audio S2 Pro 0.54 vs 3.62(6.7×);OmniVoice 0.84 vs 3.41(4×);GPT-SoVITS 1.6 vs 7.34(4.6×)。→ 任何单一数字都不足以定论。

⚠️ 已被排除的模型(许可原因):Spark-TTS 权重 CC-BY-NC-SA-4.0(不可商用)、Higgs Audio v2(HF license other,主线 v3 明确非商用,且需 ≥24GB 显存)、VibeVoice-TTS-1.5B(微软 2025-09 已下架代码并标 Disabled,官方明文不建议商用)。详见 11.7。

⚠️ sm_120 特别提示:Qwen3-TTS 是本次调研中唯一「sm_120 零 issue」的模型;而 GLM-TTS issue #9 直接报告 RTX 5060 Ti 16G 上 GPU 利用率仅 40%;VoxCPM2 有 #250/#282/#326 多个 Blackwell open issue。详见 13.1b / 13.2。

0.2b 各家 Seed-TTS-eval 中文口径的横向对照(同一张表内,可直接比)

以 OpenBMB/VoxCPM README 的 Seed-TTS-eval 表为准(这是本次找到的覆盖最全的单张第三方表,25 个模型同一口径):

模型参数test-ZH CER/%↓test-ZH SIM/%↑test-EN WER↓test-EN SIM↑
FishAudio S24B0.54—0.99—
VoxCPM-0.5B0.6B0.9377.21.8572.9
VoxCPM22B0.9779.51.8475.3
IndexTTS21.5B1.0376.52.2370.6
Qwen3-Omni30B-A3B1.07—1.39—
LongCat-Audio-DiT3.5B1.0981.81.5078.6
Seed-TTS(闭源)—1.1279.62.2576.2
CosyVoice31.5B1.1278.12.2272.0
FireRedTTS-21.5B1.1473.61.9566.5
CosyVoice30.5B1.1678.02.0271.8
VibeVoice1.5B1.1674.43.0468.9
VoxCPM1.50.8B1.1877.02.1271.4
OpenAudio-s1-mini0.5B1.1868.51.9455.0
MOSS-TTS—1.2078.81.8573.4
Qwen3-TTS1.7B1.2277.01.2371.7
CosyVoice20.5B1.3875.73.0965.9
MegaTTS30.5B1.5279.02.7977.1
F5-TTS0.3B1.5376.02.0067.0
SparkTTS0.5B1.5466.03.1457.3
Qwen2.5-Omni7B1.7075.22.7263.2
MaskGCT1B2.2777.42.6271.7
CosyVoice0.3B3.6372.34.2960.9
FireRedTTS0.5B1.5163.53.8246.0

— OpenBMB/VoxCPM README Seed-TTS-eval 表(⚠️ 厂商侧整理的表,引用需注明来源)

读表要点:

0.2c ⚠️ 第三方 Elo 榜对中文完全无用(必读,避免被英文榜误导)

本次调研确认:2026 年没有任何一个第三方 Elo 榜能评中文 TTS。

榜单中文关键事实
Artificial Analysis TTS(唯一完整第三方 Elo 榜)❌ 纯英文(仅 US/UK 口音)90 个模型仅 16 个开源权重;中国开源模型(IndexTTS / CosyVoice 开源权重 / GPT-SoVITS / ChatTTS / F5-TTS / MegaTTS3 / OmniVoice / MOSS-TTS / VoxCPM2 / GLM-TTS / FireRedTTS-2)全部不在榜
HuggingFace TTS Arena V2❌ 原文 "Prompts are English-only for now"原始 Elo 也取不到(HF 被墙;hf-mirror 拒绝 Spaces)
TTS Spaces Arena(原始投票)❌ 英文单句朗读我方统计 36,993 票:kokoro 98.4% 第一;GPT-SoVITS-ProPlus 仅 27.5% 垫底
VoiceHub/kadirnar(独立英文 Seed-TTS-Eval)❌ 英文33 模型 × 1088 条:Kokoro 0.96% 第一、OmniVoice 0.99%、VoxCPM2 3.35%(靠后)、GPT-SoVITS 2.64%

三条必须记住的「英文榜陷阱」:

  1. Kokoro 在英文榜上是开源第一梯队(AA Elo 1060.98 / TTS Arena 98.4% / VoiceHub WER 0.96% 第一),但它的官方模型卡 language tag 只有 en,中文靠第三方权重,社区报告 C# 版中文「口音很重、听不太清」。→ 绝不能因为英文榜排名高就选它做中文。
  2. GPT-SoVITS-ProPlus 在英文 Arena 垫底(27.5%),但在中文 SeedTTS 官方 wiki 上 SIM 0.737(接近真人 0.750)。→ 英文榜排名与中文能力可能反相关。
  3. VoxCPM2 在英文 Seed-TTS-Eval 上是 3.35%(非常靠后),但在中文 SeedTTS-eval 上是 CER 0.97 / SIM 79.5(双优)。→ 同一个模型的中英能力可以差很多。

→ 选型纪律:中文只在 CV3-Eval / Seed-TTS-eval(test-zh)口径下比较(见 0.2b),并最终以自家场景自测为准。

0.3 面向「16GB 单卡 + 数字人」的结论(TL;DR 建议)

⭐ 本次调研最大的三个「新增发现」(都改变了排序):

  1. Qwen3-TTS(阿里,Apache-2.0):首包 97ms(官方,全场最低)+ 原生流式 + 可商用 + 本次调研中唯一「sm_120 零 issue」的模型 → 实时链路首选。
  2. LongCat-AudioDiT(美团,MIT):中文 SIM 81.8(全场最高)+ MIT 最宽松许可,代价是非流式 → 离线口播场景的自定义最优解(离线本来就不需要流式)。
  3. 三个曾经的「热门候选」被许可/维护状态排除:Spark-TTS(权重 CC-BY-NC-SA-4.0)、Higgs Audio v2(主线转非商用 + 需 ≥24GB)、VibeVoice-TTS-1.5B(微软 2025-09 下架代码并标 Disabled)。
场景首选次选理由
实时对话链路(要可商用 + 最低首包)⭐ Qwen3-TTS(97ms)VoxCPM2 / Fun-CosyVoice3Qwen3-TTS:Apache-2.0 + 97ms + 原生流式 + sm_120 零 issue(唯一);LiveTalking 作者实测 0.6B + vLLM-Omni ~130ms。CosyVoice3:Apache-2.0 + 150ms(第三方 ~195ms)。VoxCPM2:Apache-2.0 + 官方 generate_streaming + RTF 0.13–0.30,但 sm_120 有多个 open issue
离线口播成片(本项目实际形态,不需流式)⭐ LongCat-AudioDiT(MIT, SIM 81.8)IndexTTS-2.5 / VoxCPM2LongCat:MIT + 中文 SIM 全场最高 81.8,非流式在离线场景不是缺点;短板是 3.83B F32 权重(16GB 需转半精度,待实测)。IndexTTS-2.5:CER 0.93–1.21% + 情绪/时长强可控 + 官方 6GB VRAM;VoxCPM2:CER 0.97/SIM 79.5 + 48kHz
要商用 + 要最高中文自然度、可接受非流式IndexTTS-2.5MossTTSLocal 1.7B / MegaTTS3IndexTTS-2.5:~6GB 显存 + 情绪/时长强可控(IndexTTS2 的时长控制被第三方明确评价为「对口型同步非常有意义」)
要 Apache-2.0 + 有明确 TTFB 数字Qwen3-TTS(97ms)FireRedTTS-2(140ms)/ MOSS-TTS-Realtime(180ms)三者都是 Apache-2.0 + 官方 TTFB。FireRedTTS-2 显存 bf16 9GB,但锁 torch2.7.1+cu126
显存最省 + 零成本Kokoro-82M(82M, 可 CPU,第三方实测仅 480MiB)GPT-SoVITS(229M, ~6GB) / ZipVoice(123M)显存几乎无需求
要 MIT 最宽松LongCat-AudioDiT(MIT)GPT-SoVITS / F5-TTSLongCat 中文 SIM 81.8 最强;GPT-SoVITS 229M 最省显存(中文 SIM 0.737,真人 0.750)但无流式
中文最强但只做研究/学习OmniVoice 0.8B(CER 0.84%)Fish Audio S2 Pro(0.54%)均不可商用
最稳的 2026 新旗舰(显存与效果平衡)VoxCPM2(~8GB VRAM)MOSS-TTS(8B 可塞 8GB 卡)但注意 VoxCPM2 的 sm_120 open issue

⚠️ 三个必须避开的坑(本报告新增):


1. OmniVoice(小米 / k2-fsa)

1.1 来源与真实性核查

项内容
GitHubhttps://github.com/k2-fsa/OmniVoice (14k stars,last-commit = august,license = Apache-2.0)— shields.io 实抓
HuggingFacehttps://huggingface.co/k2-fsa/OmniVoice (镜像可读:hf-mirror 模型卡)
HF Spacehttps://huggingface.co/spaces/k2-fsa/OmniVoice
Demo 页https://zhu-han.github.io/omnivoice
论文arXiv:2604.00688 —《OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models》,v3 更新于 2026-04-21(published 2026-04-01)。用户给的 arXiv 号属实。

⚠️ 「小米」的说法核实结论:属实,但不在 repo 名下。 论文首页署名机构为 Xiaomi Corp., China,通讯邮箱 {zhuhan3,dpovey}@xiaomi.com(Daniel Povey 为小米语音团队负责人)。代码托管在 k2-fsa(Daniel Povey 系的社区组织),所以从 repo owner 看不出小米。(arXiv:2604.00688 PDF 首页)

1.2 许可证与商用

1.3 中文效果(具体数字,均为厂商论文数据)

论文 Table 1(Seed-TTS test-zh / test-en,baseline 用官方 checkpoint 复现,SIM-o 为 WavLM-based ECAPA-TDNN 余弦相似度):

模型参数Seed-en SIM-o↑Seed-en WER↓Seed-en UTMOS↑Seed-zh SIM-o↑Seed-zh WER↓Seed-zh UTMOS↑
Ground-truth—0.7342.143.520.7551.252.78
IndexTTS21.7B0.7062.333.650.7641.053.00
CosyVoice31.1B0.6962.173.960.7781.143.32
VoxCPM0.7B0.7311.923.770.7720.992.94
Qwen3-TTS1.1B0.7081.544.160.7661.153.46
F5-TTS0.4B0.6641.853.720.7501.532.93
MaskGCT2.2B0.7132.883.550.7732.402.63
OmniVoice0.8B0.7411.603.910.7770.843.11

— arXiv:2604.00688v3 PDF, Table 1

第三方对比(IndexTTS 团队在自家 README 的 CV3-Eval 表里引用的 OmniVoice 数字):OmniVoice 0.8B,zh WER 3.41 / SS 72.99,en 3.62 / 70.13,es 3.52 / 74.14,ja 5.38 / 70.49,ar 17.88 / 64.22。 — index-tts README Table 1

⚠️ 注意口径冲突:OmniVoice 自报 zh WER 0.84%,IndexTTS 团队在同为「中文零样本」的表里给 OmniVoice 记的是 3.41%。两组数不同测试集(Seed-TTS test-zh vs CV3-Eval)且不同 ASR,不能混用。选型时以「自测」为准。

主观评测(论文 Table 2,中文/英文):OmniVoice CMOS 0.44±0.16(高于 Qwen3-TTS 的 0.40±0.16,ZipVoice −0.30,MaskGCT −0.38),SMOS 3.80±0.17(GT 3.02±0.20)。(同 PDF)

1.4 流式能力

1.5 速度 / 显存

1.6 与数字人框架的现成集成

OmniVoice 官方维护了一份社区项目清单,尚未见到 LiveTalking / OpenAvatarChat / Fay / Linly-Talker 的官方内置支持(这三家的集成情况见第 12 节)。已确认的集成:

— 全部出自 docs/community-projects.md

1.7 已知坑


2. IndexTTS-2 / IndexTTS-2.5(B 站 / bilibili)

2.1 来源与真实性核查

项内容
GitHubhttps://github.com/index-tts/index-tts (24k stars,last-commit = august;shields 报 license = "not identifiable by github",实际是自定义协议文件)
论文(2.5)arXiv:2601.03888《IndexTTS 2.5 Technical Report》(v5,2026-08-11)
论文(2)arXiv:2506.21619《IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot TTS》
论文(1.x)arXiv:2502.05512
HF(2.5)https://huggingface.co/IndexTeam/IndexTTS-2.5 (镜像可读)
ModelScope(2.5)https://modelscope.cn/models/IndexTeam/IndexTTS-2.5
Demohttps://index-tts.github.io/index-tts2-5.github.io/

⚠️ 重要:截至 2026-09-22,最新版是 IndexTTS-2.5(2026/08/10 发布),不是 IndexTTS-2。 2.5 新增日语/西班牙语/阿拉伯语、duration_factor 语速控制、更快推理。(index-tts README News)

2.2 许可证与商用

自定义协议:bilibili Model Use License Agreement(LICENSE 全文)。HF 模型卡里 license 字段标注为 other / license_name: bilibili-model-license。(hf-mirror IndexTTS-2.5 模型卡)

能否商用?——有条件可以。 关键条款:

对比:这是本次调研里唯一「明确允许商用、只对大厂设门槛」的自研协议。比 Fish Audio(一律需授权)和 OmniVoice(权重 CC-BY-NC)宽松得多。

2.3 中文效果(具体数字)

厂商数据 —— IndexTTS-2.5 官方 CV3-Eval 表(zh/en/es/ja/ar,WER↓ / SS↑):

模型参数zh WERzh SSen WERen SSja WERja SSar WERar SSAvg WERAvg SS
VoxCPM22B3.8874.995.1371.576.6972.9014.9465.997.2272.02
OmniVoice0.8B3.4172.993.6270.135.3870.4917.8864.226.7670.39
Moss-TTS 1.58B4.0272.684.4567.4610.9768.7123.7162.219.4068.56
CosyVoice3-0.5B0.5B3.8480.014.8874.16–76.36––––
FireRedTTS-21.5B8.2268.1014.9256.93––––––
Fish Audio S2 Pro4B3.6267.793.8361.665.1566.1514.1559.435.9464.49
Qwen3-TTS1.7B3.2773.025.0667.175.8970.18––––
IndexTTS2.50.8B4.3677.105.1268.065.6674.6214.8869.746.7573.18
IndexTTS2.5-RL0.8B3.9377.923.8967.795.3075.4113.5870.366.0073.63

— index-tts README Table 1

第三方数据 —— MOSS-TTS 团队对比表(Seed-TTS-eval):

模型参数EN WER↓EN SIM↑ZH CER↓ZH SIM↑
IndexTTS21.5B2.2370.61.0376.5
GLM-TTS1.5B2.2367.21.0376.1
GLM-TTS-RL1.5B1.9168.10.8976.4
VoxCPM0.5B1.8572.90.9377.2
Qwen3-TTS0.6B1.6870.391.2376.4
CosyVoice30.5B2.0271.81.1678.0
F5-TTS0.3B2.00671.5376
HiggsAudio-v23B2.4467.71.5074.0

— MOSS-TTS README Evaluation

「Faster IndexTTS-2」论文(NVIDIA)给的 IndexTTS-2 质量基线(Seed-TTS 测试集,PyTorch 原版):

test-en FP32test-zh FP32
WER (%)1.841.01
SIM-o ↑0.7060.765
UTMOS ↑3.622.99

— arXiv:2607.21042 PDF Table I

2.4 流式能力与首包延迟(重点)

⚠️ 结论:官方 index-tts 仓库本身不提供流式推理。 我在官方 README(中英文两版)全文 grep stream|ttfb|first chunk|latency|流式 零命中。(EN / ZH)

流式能力来自 NVIDIA 的独立工作「Faster IndexTTS-2」(arXiv:2607.21042,2026-07-23,作者 Muyang Du / Shuang Yu / Junjie Lai,NVIDIA 上海)。该论文核实属实:用 TensorRT + TensorRT-LLM 加速全部组件并实现分块流式。

首包延迟数字(论文实测,A100 80GB,FP16):

论文 Table II(overlap = 5 codec frames):

语言模式Chunk (s)TTFA↓ (ms)总延迟 (ms)↓RTF↓WER (%)↓SIM-o↑UTMOS↑
EN非流式——874.50.241.970.6983.53
EN流式2608.61180.40.321.860.6993.45
EN流式1405.51496.70.402.070.7003.36
ZH非流式——1211.10.221.080.7612.94
ZH流式2596.11669.30.301.100.7652.81
ZH流式1395.92153.50.381.130.7662.67

— arXiv:2607.21042 PDF Table II

→ 中文首包延迟:chunk=2s 时 596.1 ms;chunk=1s 时 395.9 ms。 这就是用户要的「流式首包延迟数字」。 → 增量输出:支持,按可配置 chunk size 增量解码,相邻 chunk 有可配置 overlap,重叠波形用 Hann 窗交叉淡化平滑过渡。

论文 Figure 2 的 chunk/overlap 网格(6 种 overlap 值 × 4 档 chunk)显示 FP16 streaming:

加速比:GPT 最高 5.0×(EN)/ 4.8×(ZH);端到端 3.60×(EN)/ 3.46×(ZH);RTF 从 0.84/0.76 降到 0.24/0.22。W8A16 / W4A16 只对 GPT 量化,额外收益很小。(同 PDF §III-B)

模型构成(1.51B 总参):预处理 788M + 自回归 GPT 512M + flow-matching DiT 96M + BigVGAN vocoder 113M。(同 PDF §III-A)

2.5 显存需求

2.6 部署 / 集成

2.7 已知坑


3. CosyVoice 3(阿里 FunAudioLLM)

3.1 来源

项内容
GitHubhttps://github.com/FunAudioLLM/CosyVoice (24k stars,license = Apache-2.0,last-commit = may)
论文arXiv:2505.17589《CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training》
最新权重Fun-CosyVoice3-0.5B-2512
ModelScopehttps://www.modelscope.cn/models/FunAudioLLM/Fun-CosyVoice3-0.5B-2512
HuggingFacehttps://huggingface.co/FunAudioLLM/Fun-CosyVoice3-0.5B-2512 (HF 卡 license: apache-2.0,实抓镜像确认)
评测集https://github.com/FunAudioLLM/CV3-Eval (官方开源评测集,难得的可复现第三方基准)
Demohttps://funaudiollm.github.io/cosyvoice3/ ⚠️ 本次实测返回 404(README 引用但页面已下线;cosyvoice2 页同样 404)

许可证:Apache-2.0(代码与权重均为 apache-2.0)→ 可自由商用。 这是本次调研中商用条件最好的之一。 — hf-mirror CosyVoice3 模型卡、GitHub shields

3.2 中文效果(具体数字)

官方评测表(zh/en/hard,CER/WER↓ 与 SS↑):

模型开源参数test-zh CER↓test-zh SS↑test-en WER↓test-en SS↑test-hard CER↓test-hard SS↑
Human——1.2675.52.1473.4––
Seed-TTS❌—1.1279.62.2576.27.5977.6
MiniMax-Speech❌—0.8378.31.6569.2––
F5-TTS✅0.3B1.5274.12.0064.78.6771.3
CosyVoice2✅0.5B1.4575.72.5765.96.8372.4
Index-TTS2✅1.5B1.0376.52.2370.67.1275.5
VoxCPM✅0.5B0.9377.21.8572.98.8773.0
GLM-TTS-RL✅1.5B0.8976.4––––
Fun-CosyVoice3-0.5B-2512✅0.5B1.2178.02.2471.86.7175.8
Fun-CosyVoice3-0.5B-2512_RL✅0.5B0.8177.41.6869.55.4475.0

— CosyVoice README Evaluation

第三方交叉验证(MOSS-TTS 表):CosyVoice3 0.5B → EN WER 2.02 / SIM 71.8,ZH CER 1.16 / SIM 78.0。(MOSS-TTS README) 第三方交叉验证(IndexTTS CV3-Eval 表):CosyVoice3-0.5B → zh SS 80.01(该表最高),en SS 74.16,ja SS 76.36。(index-tts README Table 1)

中文说话人相似度 78(SeedTTS)/ 80.01(CV3-Eval)是目前公开可商用模型里的第一梯队。

3.3 流式能力(本次调研中最好的商用流式方案)

官方 README 原文:

"Bi-Streaming: Support both text-in streaming and audio-out streaming, and achieves latency as low as 150ms while maintaining high-quality audio output."

— CosyVoice README Highlight · hf-mirror 模型卡同文

3.4 显存 / 部署

3.5 语言/方言与可控性

3.6 已知坑


4. GPT-SoVITS(RVC-Boss)

4.1 来源与许可

项内容
GitHubhttps://github.com/RVC-Boss/GPT-SoVITS (62k stars — 本次调研最高,license = MIT,last-commit = august)
官方文档中文 https://www.yuque.com/baicaigongchang1145haoyuangong/ib3g1e ;英文 https://rentry.co/GPT-SoVITS-guide
版本特性 wikihttps://github.com/RVC-Boss/GPT-SoVITS/wiki
权重https://huggingface.co/lj1995/GPT-SoVITS
在线 demohttps://lj1995-gpt-sovits-proplus.hf.space/
CPU 优化版https://github.com/baicai-1145/GPT-SoVITS-CPUFast

许可证 MIT → 可自由商用(这是本次调研里唯一主流且完全宽松的开源许可,另一个是 F5-TTS)。(GitHub shields license)

4.2 中文效果(具体数字 —— 官方 wiki 给出 SeedTTS CN 跑分)

官方 wiki 表格,测试方法明确写了「用的 https://github.com/BytedanceSpeech/seed-tts-eval 官方给的相似度模型和 ASR 模型跑的」:

版本WER ↓SIM ↑
v10.0250.526
v20.0170.549
v3 (8 steps)0.0140.702
v4 (8 steps)0.0130.735
v2Pro0.0160.709
v2ProPlus0.0160.737
GT(真人)0.0130.750

— GPT-SoVITS wiki: SeedTTS ZeroShot TTS eval testset CN

解读:中文 WER 1.6%(v2ProPlus),说话人相似度 0.737,只比真人 GT 的 0.750 低 1.3 个点 —— 非常强。但自然度/情感无客观数字,官方 wiki 自己也说:「测不了自然性、情感丰富性和音质,前 2 个要人工打分」。

参数量(官方 wiki):

版本语种GPT 参数量SoVITS 参数量推理速度
v1中日英90M77Mbaseline
v2中日英韩粤90M77M2× v1
v3/v4同 v2330M77M≈v2
v2Pro同 v2133M77M≈v3
v2ProPlus同 v2152M77M≈v3

— 同上 wiki

官方推荐结论(wiki 原文):「从 benchmark 跑分看,没有必要再用 v3v4,因为 v2Pro 系列和 v2 硬件需求一样,但是 zero shot 相似度和 v3v4 同一水平线」。

4.3 流式能力

4.4 显存 / 部署

4.5 已知坑


5. Fish-Speech / Fish Audio S2 Pro

5.1 来源与许可(重大变化)

项内容
GitHubhttps://github.com/fishaudio/fish-speech (33k stars,last-commit = last wednesday — 极活跃)
最新模型Fish Audio S2 Pro(4B),不是 OpenAudio S1 了
权重https://huggingface.co/fishaudio/s2-pro
论文arXiv:2603.08823《Fish Audio S2 Technical Report》(已核实)
博客https://fish.audio/blog/fish-audio-open-sources-s2/
文档https://speech.fish.audio/

⚠️ 许可证从 CC-BY-NC-SA 换成了自研的 FISH AUDIO RESEARCH LICENSE(Last Updated: 2026-03-07)。

能否商用?—— ❌ 不能(除非单独购买授权)。 LICENSE 第三节原文:

"Any use of the Fish Audio Materials or Derivative Works for a Commercial Purpose requires a separate written license agreement from Fish Audio. No commercial rights are granted under this Agreement." "Commercial Purpose" means ... including but not limited to: (i) creating, modifying, or distributing Your product or service, including via a hosted service or API, (ii) Your business's or organization's internal operations, and (iii) any use in connection with a product or service for which You charge a fee or generate revenue, whether directly or indirectly.

— FISH AUDIO RESEARCH LICENSE 全文

⚠️ 特别注意 (ii):连「企业内部自用」都算 Commercial Purpose。 商务授权联系 business@fish.audio。 另:§IV(b) 禁止用它「创建或改进任何基础生成式 AI 模型」;分发必须显示 "Built with Fish Audio"。

5.2 中文效果(具体数字,厂商宣称)

BenchmarkFish Audio S2
Seed-TTS Eval — WER (中文)0.54%(best overall)
Seed-TTS Eval — WER (英文)0.99%(best overall)
Audio Turing Test(带指令)0.515 posterior mean
EmergentTTS-Eval — Win Rate81.88%(最高)
Fish Instruction Benchmark — TAR93.3%
Fish Instruction Benchmark — Quality4.51 / 5.0
Multilingual (MiniMax Testset) — Best WER24 种语言中 11 种最优
Multilingual (MiniMax Testset) — Best SIM24 种语言中 17 种最优

— fish-speech README Benchmark Results

厂商对比话术:Seed-TTS Eval 上 S2 的 WER 低于所有评测模型(含闭源):Qwen3-TTS (0.77/1.24)、MiniMax Speech-02 (0.99/1.90)、Seed-TTS (1.12/2.25)。(同上)

⚠️ 第三方交叉验证有明显落差:MOSS-TTS 团队表里 FishAudio-S1(4B,标注为闭源 ❌)EN WER 1.72 / SIM 62.57,ZH CER 1.22 / SIM 72.1;IndexTTS 团队 CV3-Eval 表里 Fish Audio S2 Pro(4B)zh WER 3.62 / SS 67.79,en 3.83 / 61.66。(MOSS-TTS README、index-tts README) → 厂商自称中文 WER 0.54%,第三方表里 3.62% —— 差距 6.7 倍。说话人相似度(67.79)也明显低于 CosyVoice3(78–80)和 IndexTTS2.5(77.9)。

5.3 流式能力

5.4 架构 / 显存

5.5 已知坑


6. MOSS-TTS(OpenMOSS / MOSI.AI)

6.1 来源与许可

项内容
GitHubhttps://github.com/OpenMOSS/MOSS-TTS (4.1k stars,license = Apache-2.0,last-commit = september — 很活跃)
论文arXiv:2603.18090《MOSS-TTS Technical Report》(2026-03-20)
权重集合https://huggingface.co/collections/OpenMOSS-Team/moss-tts
ModelScopehttps://www.modelscope.cn/collections/openmoss/MOSS-TTS
Bloghttps://mosi.cn/#models
相关论文MOSS-TTSD: arXiv:2603.19739;MOSS-VoiceGenerator: arXiv:2603.28086

许可证:模型 Apache-2.0,原文「Models in MOSS-TTS Family are licensed under the Apache License 2.0.」→ ✅ 可自由商用。 — MOSS-TTS README LICENSE 段

6.2 中文效果(具体数字)

厂商数据(Seed-TTS-eval):

模型参数EN WER (%)↓EN SIM (%)↑ZH CER (%)↓ZH SIM (%)↑
FishAudio-S14B1.7262.571.2272.1
CosyVoice31.5B2.22721.1278.1
Seed-TTS—2.2576.21.1279.6
MiniMax-Speech—1.6569.20.8378.3
CosyVoice30.5B2.0271.81.1678
F5-TTS0.3B2671.5376
IndexTTS21.5B2.2370.61.0376.5
VibeVoice1.5B3.0468.91.1674.4
HiggsAudio-v23B2.4467.71.574
GLM-TTS-RL1.5B1.9168.10.8976.4
VoxCPM0.5B1.8572.90.9377.2
Qwen3-TTS1.7B1.571.451.3376.72
MossTTSDelay8B1.8470.861.3776.98
MossTTSLocal1.7B1.9373.281.4479.62

— MOSS-TTS README Evaluation

MossTTSLocal(1.7B)的 ZH SIM 79.62 是该表最高,接近 Seed-TTS 的 79.6。

MOSS-TTSD(对话/多说话人)客观评测(含第三方对比闭源):MOSS-TTSD-v1.0 → ZH SIM 0.7949 / ACC 0.9587 / WER 0.0485;EN SIM 0.7326 / ACC 0.9626 / WER 0.0988,多数维度优于 Eleven V3、gemini-2.5-pro-preview-tts、Doubao_Podcast。(MOSS-TTS README MOSS-TTSD 客观评测)

6.3 流式能力(有明确 TTFB 数字)

MOSS-TTS-Realtime 官方评测(单张 L20,开启 SDPA + torch.compile,warm up 后):

模型TTFB (ms)RTF
MOSS-TTS-Realtime180(warm up 后)0.51

串联 LLM 的端到端首包:用 vLLM 部署 Qwen3.5-9B 测 T_LLM-first-sentence = 197 ms(生成 12 token = TTS prefill 长度),故 T_LLM-first-sentence + T_MOSS-TTS-Realtime-TTFB = 197 + 180 = 377 ms。 — MOSS-TTS README MOSS-TTS-Realtime 评测

这是「LLM 对话 + TTS」全链路首包延迟的公开可查数字,对数字人项目极有参考价值。

MOSS-TTS-Nano:~100M 参数,支持多语言克隆、48 kHz 立体声,仅 4 个 CPU 核心即可流式输出。(README News 2026.4.13)

6.4 显存 / 部署(对 16GB 卡非常友好)

6.5 已知坑


7. F5-TTS(SWivid / SJTU X-LANCE)

7.1 来源与许可

项内容
GitHubhttps://github.com/SWivid/F5-TTS (15k stars,license = MIT,last-commit = yesterday — 极活跃)
论文arXiv:2410.06885《F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching》(ACL 2025)
权重https://huggingface.co/SWivid/F5-TTS ;ModelScope https://www.modelscope.cn/models/SWivid/F5-TTS_Emilia-ZH-EN
HF Spacehttps://huggingface.co/spaces/mrfakename/E2-F5-TTS
Demohttps://swivid.github.io/F5-TTS/
相关论文仓库含强制对齐版《Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis》arXiv:2502.18924

许可证 MIT → ✅ 可自由商用。(GitHub shields) 最新模型:v1 base(2025/03/12),其后 README News 无新版本 → 2026 年未发布新版模型。

7.2 中文效果(具体数字,第三方表)

来源中文指标
CosyVoice 官方评测表test-zh CER 1.52%,SS 74.1;test-en WER 2.00 / SS 64.7;test-hard CER 8.67 / SS 71.3
MOSS-TTS 评测表EN WER 2.00 / SIM 67;ZH CER 1.53 / SIM 76
OmniVoice 论文 Table 1Seed-zh SIM-o 0.750 / WER 1.53% / UTMOS 2.93(NAR 组,0.4B)

— CosyVoice README、MOSS-TTS README、arXiv:2604.00688v3

→ 中文 CER ≈ 1.52–1.53%,SIM ≈ 74.1–76。属于「可用但不是第一梯队」,明显低于 CosyVoice3(78–80)与 IndexTTS2.5(77.9)。

7.3 流式 / 架构 / 显存

7.4 已知坑


8. MegaTTS3(字节跳动 / ByteDance)

8.1 来源与许可

项内容
GitHubhttps://github.com/bytedance/MegaTTS3 (6.1k stars,license = Apache-2.0,last-commit = june)
论文arXiv:2502.18924《MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis》(v4,2025-03-28;published 2025-02-26)— 已核实
音频样例https://sditdemo.github.io/sditdemo/
HF Space Demohttps://huggingface.co/spaces/ByteDance/MegaTTS3
README 路径⚠️ 是小写 readme.md(README.md 返回 404)

许可证:Apache-2.0 → ✅ 可自由商用。(GitHub shields、readme.md 顶部 badge 声明)

有趣细节:F5-TTS 仓库里内置的强制对齐版就是 MegaTTS3 的技术路线(F5-TTS README 引用同一篇《Sparse Alignment Enhanced Latent Diffusion Transformer》,arXiv:2502.18924)。(F5-TTS README)

8.2 效果与规模(中文数字已找到)

8.3 流式 / 显存 / 坑

— 全部出自 readme.md


9. Kokoro(hexgrad)

9.1 来源与许可

项内容
GitHubhttps://github.com/hexgrad/kokoro (8.9k stars,license = Apache-2.0,last-commit = august 2025)
模型https://huggingface.co/hexgrad/Kokoro-82M
样本https://huggingface.co/hexgrad/Kokoro-82M/blob/main/SAMPLES.md
G2P 库https://github.com/hexgrad/misaki
PyPIhttps://pypi.org/project/kokoro/

许可证:Apache-2.0 → ✅ 可自由商用。(GitHub shields)

9.2 效果 / 中文支持

9.3 流式 / 显存 / 坑


10. ChatTTS(2noise)

10.1 来源与许可(双重限制)

项内容
GitHubhttps://github.com/2noise/ChatTTS (40k stars,last-commit = april)
模型https://huggingface.co/2Noise/ChatTTS
PyPIhttps://pypi.org/project/ChatTTS
扩展索引https://github.com/libukai/Awesome-ChatTTS

⚠️ 许可证是双层的,都不可商用:

对象许可
代码AGPLv3+(强 copyleft,商用/网络服务会触发源码开放义务)
模型权重CC BY-NC 4.0(明文禁止商用)

原文:「The code is published under AGPLv3+ license.」「The model is published under CC BY-NC 4.0 license. It is intended for educational and research use, and should not be used for any commercial or illegal purposes.」 — ChatTTS README Licenses

Agent 提醒:AGPL 对「提供网络服务」有特殊约束,即便自用也需谨慎评估。

10.2 效果 / 规模

10.3 流式 / 显存

10.4 已知坑


11. 2026 年新出的 / 其他主流开源中文 TTS

11.1 ⭐ VoxCPM2(OpenBMB / 面壁智能)—— 本次调研的重大遗漏补充

这是本次调研里最被低估的候选:2B、Apache-2.0、官方流式、官方宣称 VRAM ~8GB、RTF ~0.30@4090。

项内容
GitHubhttps://github.com/OpenBMB/VoxCPM (38k stars,license = Apache-2.0)
版本VoxCPM2(2026.04 发布) — 2B 参数,2 百万小时以上多语种数据,30 种语言,Voice Design,Controllable Voice Cloning,48 kHz 原生输出
骨干MiniCPM-4
论文arXiv:2606.06928《VoxCPM2 Technical Report》(2026-06-05)— 已核实
旧版论文arXiv:2509.24650《VoxCPM: Tokenizer-Free TTS for Context-Aware Speech Generation and True-to-Life Voice Cloning》
架构无 tokenizer、扩散自回归;全程在 AudioVAE V2 隐空间:LocEnc → TSLM → RALM → LocDiT
LM token rate6.25 Hz(对比 CosyVoice 系 12.5 Hz)

— github.com/OpenBMB/VoxCPM README、GitHub shields

✅ 许可证:Apache-2.0,代码与权重均开源,官方原文「Fully Open-Source & Commercial-Ready — Weights and code released under the Apache-2.0 license, free for commercial use」。→ 可自由商用。(README)

中文效果(Seed-TTS-eval):

模型参数test-EN WER/%↓test-EN SIM/%↑test-ZH CER/%↓test-ZH SIM/%↑test-Hard CER/%↓test-Hard SIM/%↑
VoxCPM22B1.8475.30.9779.58.1375.3
VoxCPM-0.5B0.6B1.8572.90.9377.28.8773.0
VoxCPM1.50.8B2.1271.41.1877.07.7473.1
LongCat-Audio-DiT3.5B1.5078.61.0981.86.0479.7
FishAudio S24B0.99—0.54—5.99—
MegaTTS30.5B2.7977.11.5279.0——
MOSS-TTS—1.8573.41.2078.8——
Qwen3-TTS1.7B1.2371.71.2277.06.7674.8
IndexTTS21.5B2.2370.61.0376.57.1275.5
Qwen3-Omni30B-A3B1.39—1.07———
CosyVoice30.5B2.0271.81.1678.06.0875.8

— OpenBMB/VoxCPM README Seed-TTS-eval 表(注意:这是 OpenBMB 自家整理的对比表,属厂商侧第三方表,引用需注明)

CV3-eval 多语种 CER/WER:VoxCPM2 → zh 3.65 / en 5.00 / hard-zh 8.55 / ja 5.96 / ko 5.69 / de 4.77 / es 3.80 / fr 9.85 / it 4.25 / ru 5.21;Fish Audio S2 在 zh(2.65)/en(2.43) 上明显更好。(同上 README CV3-eval 表)

⚡ 流式能力(本次调研中「真开源 + 官方流式」的最强候选之一):

档位RTF (RTX 4090)↓RTF in Nano-VLLM (RTX 4090)↓VRAM
VoxCPM2~0.30~0.13~8 GB
VoxCPM1.5~0.15~0.08~6 GB
VoxCPM-0.5B~0.17~0.10~5 GB

— OpenBMB/VoxCPM README 对比表

→ 16GB 单卡(RTX 5060 Ti)可跑性:✅ 官方标 ~8GB VRAM,16GB 余量充足。

其他新模型确定性线索(来自已抓取的第三方表):

11.2 ⭐⭐ Qwen3-TTS(阿里巴巴 Qwen)—— 本次调研的「sm_120 零风险 + 可商用 + 97ms」冠军

项内容
GitHubhttps://github.com/QwenLM/Qwen3-TTS — 13k stars,License = Apache-2.0(LICENSE 全文已抓),last-commit = march
HuggingFacehttps://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice(同系列另有 -Base / -VoiceDesign / 0.6B-* / Qwen/Qwen3-TTS-Tokenizer-12Hz)
论文arXiv:2601.15621 ✅ 已用 arXiv API 核实为真:《Qwen3-TTS Technical Report》,发布 2026-01-22
参数已发布 1.7B / 0.6B 两档;Qwen3-TTS-12Hz-1.7B-Base 实际张量数 1,928,677,440 ≈ 1.93B(BF16)(HF API 精确值,非估算)
tokenizer自研 Qwen3-TTS-Tokenizer-12Hz(12 Hz 离散多码本 LM)
语言10 种(中英日韩德法俄葡西意)+ 多方言音色

✅ 许可证:Apache-2.0(代码 + HF 权重 tag 均为 Apache-2.0)→ 可自由商用。

中文效果:

口径指标
厂商自报(Seed-TTS test set)12Hz-1.7B-Base:test-zh WER 0.77 / test-en WER 1.24;12Hz-0.6B-Base:test-zh 0.92 / test-en 1.32(同表 CosyVoice 3 为 0.71/1.45,MiniMax-Speech 0.83/1.65,Seed-TTS 1.12/2.25)
厂商自报(说话人相似度)Chinese Speaker Similarity:12Hz-0.6B = 0.811、12Hz-1.7B = 0.799(同表 MiniMax 0.780、ElevenLabs 0.677)
第三方(VoxCPM2 / MOSS-TTS 表)1.7B:ZH CER 1.22 / SIM 77.0;MOSS 表 1.7B:ZH CER 1.33 / SIM 76.72;0.6B:ZH CER 1.23 / SIM 76.4

⚠️ 口径差异:Qwen 自报 0.77 vs 第三方 1.22–1.33(差约 1.6–1.7 倍)。差异可能来自 language="auto"、max_new_tokens、参考音色选择。选型请按第三方保守估计。 缺失:UTMOS / 自然度、RTF、VRAM 均未查到(README 只说 "recommend using FlashAttention 2 to reduce GPU memory usage")。

⚡ 流式能力:

🟢 sm_120 / Blackwell:本次调研中唯一「零 issue」的模型 —— 专项检索 repo:QwenLM/Qwen3-TTS+sm_120 → total_count = 0。

已知坑:

→ 结论:Qwen3-TTS 是本报告推荐的「实时对话链路」最优候选之一(97ms + 原生流式 + Apache-2.0 + sm_120 零风险)。结合姊妹报告里 LiveTalking 作者实测的「Qwen3-TTS-0.6B + vLLM-Omni 首包 ~130ms @ RTX 3090」,它是唯一同时满足「可商用 + 低延迟 + 无 Blackwell 兼容风险」的选项。

11.3 ⭐⭐ LongCat-AudioDiT(美团)—— 中文相似度最高(81.8)+ MIT,但非流式

项内容
GitHubhttps://github.com/meituan-longcat/LongCat-AudioDiT
LicenseMIT(LICENSE 全文已抓,Copyright (c) 2026 Meituan)→ ✅ 可自由商用
HuggingFacehttps://huggingface.co/meituan-longcat/LongCat-AudioDiT-3.5B(另有 -1B);HF license tag = mit
论文arXiv:2603.29339 ✅《LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space》,2026-03-31
参数3.83B(HF API 精确张量数),权重 dtype = F32

中文效果(Seed-TTS test-zh,第三方表):CER 1.09 / SIM 81.8 ← 本次调研所有表中中文说话人相似度最高;EN WER 1.50 / SIM 78.6;hard-zh CER 6.04 / SIM 79.7。(OpenBMB/VoxCPM 表)

❌ 流式:非自回归扩散架构 → 不支持流式,TTFB / RTF 均未查到。

→ 对本项目(离线口播)的含义(重要):「非流式」在离线口播场景完全不是缺点 —— 下游 A 类音频驱动模型本来就要一段完整音频。「MIT + 中文 SIM 81.8 全场最高 + 3.83B」使它成为离线高质量兜底的最强候选,且许可比 IndexTTS-2.5(有营收门槛)更宽松。 短板:① 显存未公布,3.83B F32 权重意味着磁盘与显存开销偏大(F32 约 15GB 权重 → 16GB 卡需转 bf16/fp16 或量化,有风险,需实测);② sm_120 实测未查到。

11.4 FireRedTTS-2(小红书 FireRedTeam)

项内容
GitHubhttps://github.com/FireRedTeam/FireRedTTS2
LicenseApache-2.0(代码 + HF tag)→ ✅ 可商用
HFFireRedTTS-2 权重(HF tag = apache-2.0)

11.5 MOSS-TTS 家族(补充:Realtime 档)

(完整内容见第 6 节)MOSS-TTS-Realtime:TTFB 180ms / RTF 0.51(单卡 L20),Apache-2.0。⚠️ 需 FlashAttention 2(sm_120 风险),但有 llama.cpp / ONNX 无 torch 路径可绕开。建议纳入候选池。

11.6 GLM-TTS(智谱 / zai-org)⚠️ 许可文档冲突 + 5060 Ti 专项 issue

项内容
GitHubhttps://github.com/zai-org/GLM-TTS
License⚠️ 冲突:GitHub LICENSE = Apache-2.0,HF 模型卡 frontmatter = license: mit。两者都可商用,但文档不一致需法务确认
中文GLM-TTS_RL:CER 0.89 / SIM 76.4;GLM-TTS Base:CER 1.03 / SIM 76.1(厂商自报与第三方表完全一致,可信度较高)
流式✅ 支持(需 vLLM 后端);首包延迟 / RTF 未查到

🔴 关键坑(与我们的硬件完全一致):GitHub issue #9 —— 「RTX 5060 Ti 16G 上 GPU 利用率仅 40%」,用户质疑是 float32 导致。这是本次调研中唯一一条直接报告在 5060 Ti 16GB 上性能异常的 TTS issue。 若要选它,必须先复现该 issue。

11.7 ⚠️ 因许可证被排除的三个「曾经很热」的模型

模型排除原因(证据)
Spark-TTS(SparkAudio)⚠️ 许可证致命冲突:GitHub LICENSE = Apache-2.0,但 HF 权重模型卡 license = cc-by-nc-sa-4.0(禁止商用)。→ 代码可商用、权重不可商用 → 整体判定不可商用。(另:中文 SIM 66.0 是本表最低之一;RTF 0.1362@L20 但非流式,平均延迟 876ms;1.5 年未更新)
Higgs Audio v2(Boson AI)⚠️ 主线已转非商用:仓库 README 现已改推 Higgs Audio v3,其许可为 Boson Higgs Audio v3 Research and Non-Commercial License;v2 文档被挪到 README_V2.md(代码 Apache-2.0,但 HF 权重 license = other(含义不明))。且 v2/v3 均未查到 arXiv 论文(只有博客)。VRAM 要求 ≥24 GB(README 明文)→ 16GB 不可跑。 另有 sm_120 坑:#39 Blackwell Docker 支持(open)、#177 libcudart.so.13 加载失败(open)
VibeVoice(Microsoft)⚠️ TTS 代码已被微软下架(2025-09-05,理由「被广泛滥用」),官方模型表把 VibeVoice-TTS-1.5B 标为 Disabled;官方 README 明文「不建议用于商业或真实场景」。当前活跃的是 VibeVoice-Realtime-0.5B(仅英文 + 单说话人,首音 ~200/~300ms 官方两处冲突,取保守 300ms)。虽然 LICENSE 是 MIT,但官方明确劝退商用。

11.8 ⚠️ Sesame CSM / Step-Audio 2(数据缺口较大)

11.9 ZipVoice(k2-fsa / 小米)—— 超轻量但非流式

11.10 新模型诚实性对照:四个「口径必须标注」的坑

模型厂商自报第三方差异
Qwen3-TTS-1.7BZH CER 0.77ZH CER 1.22–1.33差 1.6–1.7×
Fish Audio S2 ProZH WER 0.54CV3-Eval 3.62差 6.7×
OmniVoiceSeedTTS ZH CER 0.84CV3-Eval ZH WER 3.41差 4×
GPT-SoVITSSeedTTS ZH WER 1.6CV3-Eval ZH CER 7.34差 4.6×

→ 「哪个中文 TTS 最强」高度依赖榜单与自测条件。任何单一数字都不足以定论。


12. 与实时数字人框架的现成集成

✅ 本节已完成:完整证据见 _raw_TTS_digitalhuman_integration.md(64 KB / 1174 行;位于本目录,另有 _scratch/ 副本,含 101 条实抓 URL + 「未查到项汇总」)。 另可交叉参考同目录姊妹报告 实时交互数字人与TTS调研.md(另一个 DSH agent 产出,含数字人驱动框架与 TTS 的配对方案)。

12.1 框架 → 原生支持的 TTS 清单(按源码/README 原文)

框架星标 · 许可证 · last-commit原生支持的 TTS(原文枚举)可插拔TTS 输出格式约束
LiveTalking lipku/LiveTalking9.6k · Apache-2.0 · septemberedgetts / gpt-sovits / cosyvoice / fishtts / tencent / doubao / indextts2 / azuretts / qwentts(config.yaml 原注释);代码另有 xtts、omnitts✅ 完全可插拔:registry.py 的 @register("tts", name)硬编码 16000 Hz 单声道 int16;chunk = 16000//(fps*2) = 320 samples = 20 ms;REF_FILE 要求 "wav, 16kHz, mono"
OpenAvatarChat HumanAIGC-Engineering/OpenAvatarChat3.8k · Apache-2.0 · july仅 3 个:EdgeTTS / CosyVoice(本地)/ 百炼 CosyVoice(API)(Qwen-Omni 模式下 TTS 由模型本体出)✅ Handler 插件(handler_search_path + module:)sample_rate 默认 24000,单声道,可配
Fay xszyou/Fay14k · GPL-3.0 · yesterdayazure / ali / gptsovits / volcano / gptsovits_v3(system.conf.bak 原注释)⚠️ 仅配置切换(tts_module),换新引擎要改代码Azure Riff16Khz16BitMonoPcm;阿里 16 kHz 单声道 WAV;Edge 出 mp3 → pydub 转 wav
Linly-Talker Kedreamix/Linly-Talker3.5k · MIT · februaryEdge TTS / PaddleTTS / GPT-SoVITS(README 标 Recommend)/ XTTS / CosyVoice⚠️ 模块化流水线,无配置式注册表未查到
Duix.Heygem(已改名 duixcom/Duix.Avatar)16k · not identifiable · april仅 fish-speech-ziming(guiji2025/fish-speech-ziming Docker);致谢原文 "TTS based on fish-speech-ziming"❌ 固定 Docker 微服务,无替换机制"format": "wav" 标 Fixed parameter;"streaming": false 固定关闭流式
aigcpanel modstart-lib/aigcpanel5.6k · Apache-2.0 · last fridayCosyVoice-300M / -300M-Instruct / CosyVoice2-0.5b / FishSpeech / IndexTTS / SparkTTS / GPT-SoVITS✅ 模型市场启动包 + 远程 API未查到
SoulX-FlashTalk Soul-AILab/SoulX-FlashTalk1.5k · Apache-2.0 · july无任何 TTS(grep "tts" = 0 次);纯 audio-driven❌ 无 TTS 层输入音频 16000 Hz 单声道,按帧切 640 samples(=40ms@25fps),cached_audio_duration: 8
Ultralight-Digital-Human anliyuan/…2.6k · not specified · july无任何 TTS(grep "tts" = 0 次);wav→.npy 特征驱动❌ 无 TTS 层16000 Hz;wenet→20fps / hubert→25fps(默认分支是 master 不是 main)
Open-LLM-VTuber(参考,插拔性最好)14k · not identifiable · maysherpa-onnx / pyttsx3 / MeloTTS / Coqui-TTS / GPTSoVITS / Bark / CosyVoice / Edge TTS / Fish Audio / Azure TTS(+ "etc.")✅✅ 配置切换 + 可自行新增模块未查到

— 完整出处(每个都实抓):LiveTalking README · LiveTalking config.yaml · LiveTalking OmniTTS 文档 · OAC 预置模式 · Fay system.conf.bak · Linly-Talker README · aigcpanel README · SoulX infer_params.yaml

12.2 ⚠️ 三处必须更正的仓库 owner(任务书给的有误)

  1. HumanAIGC/OpenAvatarChat 不存在 → 正确是 HumanAIGC-Engineering/OpenAvatarChat(shields.io 返回 repo not found)
  2. Korvo-AI/Linly-Talker 不存在 → 正确是 Kedreamix/Linly-Talker
  3. duixcom/Duix.Heygem 已改名 → duixcom/Duix.Avatar(两者 stars/license/last-commit 三项完全一致,README 正文即 "Duix.Avatar")

(modstart-lib/aigcpanel 确认无误。)

12.3 对 TTS 选型的硬约束(最可操作的一条)

LiveTalking 硬编码 sample_rate = 16000、chunk = 16000//(fps*2) = 320 samples = 20 ms,且参考音频要求 "wav, 16kHz, mono"。 → 任何自定义 TTS 必须能输出 16 kHz 单声道 int16、按 20 ms 分块。而本报告里多数模型原生输出 22.05 kHz(IndexTTS-2.5)/ 24 kHz(OmniVoice、Kokoro、ChatTTS)/ 48 kHz(VoxCPM2、GPT-SoVITS v4、MOSS-Audio-Tokenizer-v2) → 接入前必须做重采样(CosyVoice 系列原生 24 kHz 也需转)。 纯 audio-driven 项目(SoulX-FlashTalk sample_rate: 16000、Ultralight「音频采样率需要是 16000」)同样收敛到 16 kHz 单声道。 → 本项目走「离线口播成片」,下游 A 类音频驱动模型一律吃 16 kHz 单声道 WAV,所以 TTS 侧的采样率差异不是障碍,只需一次 ffmpeg 重采样。

12.4 各框架的延迟 / 流式要求

12.5 2026 社区推荐(第三方转述,未回溯原始模型卡,引自 subagent 报告)

12.6 本项目(离线口播)的实际含义

结论依据
数字人驱动层几乎都不带 TTS,TTS 由你自由选SoulX-FlashTalk 与 Ultralight 的 README 中 "tts" 命中数均为 0
「现成集成」只在实时框架里才重要LiveTalking / OpenAvatarChat / Fay / Linly-Talker / aigcpanel 有内置枚举;纯音频驱动项目没有 TTS 层,因此不存在「不支持某 TTS」的问题
只需要 16 kHz 单声道 WAVLiveTalking / SoulX-FlashTalk / Ultralight 三处独立确认
许可证是更该担心的Fay 是 GPL-3.0(README 自称「商用免责」只是作者口头承诺,不是许可证授予的额外权利);Duix.Avatar 许可字段不可识别;OmniVoice 权重 CC-BY-NC、Fish Audio S2 Pro 均不可商用
流式只在接实时框架时才是硬门槛离线口播用「整段音频」即可,非流式的 IndexTTS-2.5 / OmniVoice / F5-TTS / GPT-SoVITS 都可用

⚠️ 另一处与本报告相关的坑(来自姊妹报告 实时交互数字人与TTS调研.md,需自行复核):OpenAvatarChat 的 pyproject.toml 钉 PyTorch 2.4.1 + CUDA 12.4(不含 sm_120 kernel),Blackwell 上必须自行升到 cu128/cu130;MOSS-TTS / OpenAvatarChat / SoulX-FlashHead 都要求 flash-attn,而 flash-attn 无 sm_120 预编译 kernel。


13. 横切问题:sm_120 / Blackwell / RTX 5060 Ti 16GB 兼容性

本次调研的硬约束是「RTX 5060 Ti 16GB,sm_120(Blackwell)」。

13.1 已知的真实报错(第三方来源)

flash_attn nvcc fatal : Unsupported gpu architecture 'compute_120'

— 博客园(2026-04-03)记录安装 flash-attention 时的这个报错,并提到「CUDA 版本不匹配」与「显卡架构不被支持」两类原因。cnblogs.com/xyz/p/19817397

相关上游修复线索(说明 sm_120 支持是 2026 年才在补的):

补齐的 sm_120 坑清单(来自同目录姊妹报告 实时交互数字人与TTS调研.md 第 3.1 节,标注其来源等级):

坑现象证据
FlashAttention-2 无 sm_120 预编译 kernelno kernel image is available for execution on the device;源码编译 nvcc fatal: Unsupported gpu architecture 'compute_120'🟢 Dao-AILab/flash-attention#2168;cnblogs 2026-04-03
SageAttention 2.2.0 官方构建无 sm_120 内核超长序列走 triton JIT → GSP 挂死 → GPU 掉总线🟢 本机 2026-09-14 实测(H3 场景,一夜 4 次掉总线全部走 SageAttention 路径)
onnxruntime-gpu 官方 wheel 缺 sm_120LivePortrait 硬钉 onnxruntime-gpu==1.18.0(2024 构建);onnxruntime#27621 报告 Blackwell 上 CUDA EP 静默死锁🟢
torch 必须 cu128 及以上cu121/cu124 wheel 不含 sm_120 → 加载即报 no kernel image🟢 本机实测 torch 2.11.0+cu130 的 arch_list 含 sm_120(本机已就绪)
libnvrtc-builtins.so 版本错配torch 是 cu130 而系统 CUDA 是 13.1 → 找不到 libnvrtc-builtins.so.13.0🟢 本机 2026-09 实测

对本报告 TTS 清单的直接影响:

13.1b ⭐ TTS 专属:点名 RTX 5060 Ti 的实测 issue(最高价值证据)

结论先行:没有一个 TTS 框架是「天生不支持 sm_120」,全部是「整合包 / requirements 钉死了旧 torch(≤2.3/2.4,只编到 sm_90)」导致的。换 cu128 的 torch ≥2.7 基本都能解。(来自 _raw_TTS_benchmarks.md)

框架具体 issue报错原文 / 现象
CosyVoiceissue #1815 直接点名 RTX 5060 TiError A = torch 2.4+ 移除 ProcessGroup.options;Error B(按 requirements 降级)= sm_120 … supports up to sm_90. Note: **RTX 50-series cards require modern CUDA toolkits and PyTorch versions not covered by the current requirements**;Error C = hyperpyyaml/ruamel.yaml 依赖冲突。→ 升 torch 2.7/2.8 + cu128 可解(requirements 里 torch 2.3.1 只到 sm_90)
GPT-SoVITSissue #2205 / #2514 / #2393 / #2394,并有开着的 DDP 修复 PR #2774sm_120 is not compatible with the current PyTorch installation…supports sm_37…compute_37(#2205);RuntimeError: no kernel image is available(#2514,该用户误装 cu121 nightly);⚠️ 在 5060 Ti 上「GPT 模型可以训练、SoVITS 模型训练报错」(#2393/#2394,卡在 s2_train.py 的 mp.spawn)→ 推理不受影响,只有训练受影响
ChatTTSjianchang512/ChatTTS-ui 整合包 issue #2905070 Ti 报同样的 sm_120 不兼容
Fish-Speech S2 Pro上游 vLLM-Omni 配方在 sm_120 上确实是坏的"FlashAttention-3 ships kernels only for Hopper sm90a / Blackwell-Ultra sm120a, and SGLang is blocked on sm_120" → 第三方 Genesis1231/fish-s2-rtx 给出可用容器(vLLM-Omni 0.22 + torch 2.11 + cu130 + sm_120 kernels),并提示 prefix caching 会产生空音频需关闭
flash-attnissue #2016 给出免编译可用组合Python 3.10 + CUDA 12.8 + torch 2.7.1,然后 pip install flash_attn==2.8.0.post2 torch==2.7.1 --no-build-isolation
IndexTTS / F5-TTS / MegaTTS3 / MOSS-TTSsm_120 实测未查到index-tts issue #242「能用 RTX50 系显卡跑吗?」与 sneekes.app 的 RTX5070 F5-TTS 安装指南两次抓取均超时

→ 对本项目的落地含义(很重要):

  1. CosyVoice 在国内流传的 requirements 是「装了就在 5060 Ti 上必挂」的。本报告推荐 Fun-CosyVoice3 时,必须显式把 torch 升到 ≥2.7 + cu128/cu130,不要照抄 requirements。
  2. GPT-SoVITS 在 5060 Ti 上推理可用、训练会崩(s2_train.py 的 mp.spawn)→ 若只需推理(本项目正是如此),风险可控。
  3. Fish Audio S2 Pro 的流式路径(vLLM-Omni/SGLang)在 sm_120 上被 FA3 阻断 —— 又一个不利因素(叠加其不可商用)。
  4. 需要 flash-attn 的项目,先用 flash-attention#2016 的免编译组合试,别一上来就源码编译。

13.2 各模型对 16GB / sm_120 的适配评估

模型参数16GB 可跑sm_120 实测/issue主要风险
⭐ Qwen3-TTS1.7B(实 1.93B)/ 0.6B未查到 VRAM(需实测)🟢 专项检索 total_count = 0 —— 本次调研中唯一「零 sm_120 issue」的模型微调脚本硬编码 FA2(issue #372,不微调则无影响)
⭐ LongCat-AudioDiT3.83B(F32)⚠️ F32 权重约 15GB+,需转 bf16/fp16 或量化才能进 16GB,未查到实测未查到非流式(离线场景无妨);F32 权重体积大
FireRedTTS-21.5B✅ bf16 9GB / fp32 14GB(厂商自报)未检索到 sm_120 issue⚠️ 锁 torch 2.7.1 + cu126(cu126 不含 sm_120)→ 需对齐 CUDA 版本
GLM-TTS1.5B未查到🔴 issue #9:RTX 5060 Ti 16G 上 GPU 利用率仅 40%(用户质疑 float32)—— 与本次目标硬件完全一致许可冲突(Apache-2.0 vs MIT)
VoxCPM22.29B(标称 2B)✅ ~8GB(厂商自报)🔴 #250 Blackwell/sm_120 Docker 支持(open)、#326 Blackwell CUDA graph 音质劣化、#282 Blackwell 比 4090 慢、#102 4090 segfault多个 Blackwell open issue,需预留调试时间
Higgs Audio v25.77B(HF)/ "3.6B LLM + 2.2B adapter"❌ 需 ≥24GB(README 明示)🔴 #39 Blackwell Docker(open)、#177 libcudart.so.13 加载失败(open)且许可不可推定可商用
Sesame CSM1.55B(F32)未查到🔴 #118 RTX 5080 的 sm_120 与当前 PyTorch 不兼容(closed)无中文支持
OmniVoice0.8B✅ 余量很大(官方甚至支持 4GB Intel Arc;第三方实测峰值 2,207 MiB)未查到FlashInfer 需匹配 cu128 wheel;flash_attn 有 SDPA 回退;微调撞 sm_120 共享内存墙
IndexTTS-2.50.8B✅ 官方称 ~6GB VRAM未查到(要求 CUDA ≥12.8)可选「compiled CUDA kernels」可能无 sm_120 预编译;sm_120 实测未查到
Fun-CosyVoice30.5B✅ 余量很大未查到⚠️ requirements 里 torch 2.3.1 只到 sm_90 → 官方 requirements 在 5060 Ti 上必挂(issue #1815 点名);vLLM 版本窗口窄(0.9.0 或 ≥0.11.0);建议独立 conda 环境 + torch≥2.7/cu128
GPT-SoVITS229M✅ 最省显存之一未查到,但install.sh 有 CU128 档 + 官方测过 torch2.7/CUDA12.85060 Ti 上训练崩(#2393/#2394)、推理可用;无流式
Fish Audio S2 Pro4B⚠️ 理论可跑(fp16 ≈8GB)但官方未给 VRAM未查到低延迟需 SGLang-Omni/vLLM-Omni;且不可商用
MOSS-TTS8B / 4B / 1.7B / 100M✅ 官方称 8B 已能塞进 8GB 卡(llama.cpp)未查到需 FlashAttention 2(sm_120 高风险);有 llama.cpp/ONNX 无 torch 路径可绕开
F5-TTS0.3–0.4B✅ 余量很大未查到pynini 在部分平台无 wheel
MegaTTS30.45B✅未查到需 Google Drive 转 .npy voice latent(国内不可达);Windows 支持未完成
Kokoro82M✅ 几乎无需求(可 CPU)N/A需 espeak-ng;项目 2025-08 后停更
ChatTTS未查到✅(官方:30s 音频 ≥4GB)N/A(官方明确禁用 flash-attn/TransformerEngine)AGPL + CC-BY-NC 双重不可商用;音质被官方故意劣化

13.3 结论

16GB 显存对本清单里绝大多数模型都不是瓶颈(最大的 Fish Audio S2 Pro 4B 与 MOSS-TTS 8B 才有压力,而 MOSS-TTS 有 llama.cpp 8GB 路径)。 真正的风险是 sm_120 的算子/编译生态:需要 flash-attn 或 triton 自定义内核的项目(MOSS-TTS、OmniVoice 的 FlashInfer 路径、可能含 IndexTTS 的 compiled kernels)在 Blackwell 消费卡上要预留调试时间。规避策略:优先选有 SDPA/flash-attn 回退、或提供 llama.cpp/ONNX CPU 路径的项目(MOSS-TTS、OmniVoice、ChatTTS 天然避开)。


14. 第三方榜单与实测

✅ 本节已完成:完整证据见 _raw_TTS_benchmarks.md(73 KB / 732 行,151 个实抓 URL;位于本目录,另有 _scratch/ 副本,抓取日 2026-09-22)。 核心结论:2026 年没有任何一个第三方 Elo 榜能评中文 TTS。 详见 14.1。

14.1 四个第三方榜单的覆盖范围(这是最重要的一张表)

榜单能否评中文是否可抓取覆盖了本报告哪些模型
Artificial Analysis TTS Leaderboard❌ 纯英文(只有 US/UK 口音,locale=en)✅ 可抓(页面内嵌 JSON-LD + Next.js payload)90 个模型中仅 16 个开源权重;中国开源模型(IndexTTS / CosyVoice 开源权重 / GPT-SoVITS / ChatTTS / F5-TTS / MegaTTS3 / OmniVoice / MOSS-TTS / VoxCPM2 / GLM-TTS / FireRedTTS-2)全部不在榜
HuggingFace TTS Arena V2❌ 原文 "Prompts are English-only for now, capped at 1,000 characters"❌ 原始 Elo 本轮取不到(huggingface.co 被墙;hf-mirror 明确拒绝 Spaces:「本站暂不支持访问 Spaces 空间」)—
TTS Spaces Arena(原始投票数据)❌ 英文单句朗读✅ 原始投票公开(HF dataset Pendrokar/TTS_Arena,2026-09-21 更新)Kokoro、MOSS-TTS、MegaTTS3、GPT-SoVITS、F5-TTS、fish-speech、SparkTTS、IndexTTS
VoiceHub Arena / kadirnar 独立 Seed-TTS-Eval❌ 英文(Seed-TTS test-en,1088 条)✅ CSV 可抓Kokoro、OmniVoice、F5-TTS、MOSS-TTS、CosyVoice3、GPT-SoVITS、VoxCPM2、FishTTS、VibeVoice、Qwen3-TTS、HiggsTTS 等 33 个
CV3-Eval / Seed-TTS-eval✅ 中文✅ 代码与数据开源见第 0.2b 节(这才是中文选型的依据)

→ 结论:选中文 TTS 只能靠 CV3-Eval / Seed-TTS-eval 这类「厂商也参与贡献、但测试集与 ASR/SIM 模型公开」的基准 + 自测。英文 Elo 榜对中文选型几乎无参考价值(它会把 Kokoro 这种英文强、中文无官方支持的模型排到开源第一梯队)。

14.2 Artificial Analysis TTS Elo(2026 唯一完整第三方 Elo 榜,英文)

页面 FAQ 原文数字(AA TTS Leaderboard · open-weights):

类别模型Elo
榜首(闭源)Sonic 3.61272
闭源Alibaba Qwen-Audio-3.0-TTS-Plus(页面归入 cosyvoice-tts 家族,openWeights: false)1260
开源第一Breeze TTS 21204
开源Fish Audio S2 Pro1121
开源Step Audio EditX1094
开源Voxtral TTS1075
开源Magpie-Multilingual 357M1063
开源Kokoro 82M v1.0(CI 1050–1072,5224 次投票;且最便宜:$0.65/1M 字符)1060.98
开源Higgs Audio V31032.15
开源Chatterbox1020.54
开源VibeVoice 1.5B950.85
开源Qwen3 TTS925.98
开源XTTS v2913.81
开源StyleTTS2891.24

⚠️ 读这张表必须注意:① 纯英文;② 开源口径与「中文能力」无关(Kokoro 排 1060 是因为英文朗读好,它中文无官方支持);③ 中文强模型(IndexTTS2.5 / CosyVoice3 / OmniVoice / MOSS-TTS)不在榜,不是因为弱,而是没提交。 第三方转述:sovgrid.org(2026-05-12)与 theaibench.ai(2026-09)两处独立转述称 Fish Audio S2 Pro 为开源第一 ELO 1128;Kokoro-82M 已从 #1 掉到中游。

14.3 TTS Spaces Arena 原始投票(我方统计,非官方 Elo)

数据源:HF dataset Pendrokar/TTS_Arena(2026-09-21 更新,tts_arena_vote_summary_all.tsv)。subagent 自行统计 36,993 次投票事件。 ⚠️ 这是 [我方推导] 的胜率(wins 会高估),不是官方 Elo,且为英文单句朗读:

模型胜率
kokoro / Kokoro-API98.4% / 96.7%(第一梯队)
Orpheus-TTS95.0%
MOSS-TTS86.2%
fish-speech-181.3%
MegaTTS379.4%
GPT-SoVITS-v274.7%
IndexTTS72.7%
SparkTTS71.1%
F5-TTS(E2-F5-TTS)67.4%
GPT-SoVITS-ProPlus27.5%(垫底)

→ 与 GPT-SoVITS 官方 wiki 的中文结论(v2ProPlus 中文 SIM 最高 0.737)方向相反 —— 再次证明英文榜不能外推到中文。

14.4 VoiceHub / kadirnar 独立大规模英文 Seed-TTS-Eval(最接近「第三方复现」的资产)

条件:33 个模型 × 1088 条 Seed-TTS test-en,单台 A100 40GB,2026-09-15 完成;ASR = faster-whisper-large-v3 fp16 beam5 seed42;作者明确声明不测 SIM / MOS。 数据:voicehub-arena-seed-tts-eval leaderboard.csv

WER%(英文)(节选;注意含质量存疑项):

模型WER%
Kokoro0.9629(第一)
Supertonic0.9797
OmniVoice0.9880
SpeechT51.0131
F5-TTS1.0550
FishTTS(S2 Pro)1.1471
Chatterbox1.2308
MOSS-TTS1.2308
VibeVoice1.3146
Qwen3-TTS1.3816
CosyVoice3(修正后 = Fun-CosyVoice3-0.5B-2512)1.7416
HiggsTTS1.7416
GPT-SoVITS2.6375(第 22/33)
VoxCPM23.3492
Llasa / Dia73.99 / 67.35(已标注质量存疑)

⚠️ 榜上无 ChatTTS / MegaTTS3 / IndexTTS。

第二个 campaign 提供 speaker SIM(WavLM-large ECAPA)+ 效率(环境 torch 2.8.0+cu128,RTX 6000 Ada):

模型SIMWER%RTF峰值显存
OmniVoice(克隆)0.73851.07180.2232,207 MiB
F5-TTS(克隆)0.66911.2643——
KokoroN/A(无参考音频,不支持零样本克隆)—0.042(最快)480 MiB
VibeVoice-Realtime-0.5B—1.34810.629—

Kokoro 的三个「第一」很有意思:UTMOS22 4.5037 / DNSMOS 3.4267 最高、RTF 0.042 最快、显存仅 480 MiB。以 82M 参数做到这点非常惊人 —— 但代价是不支持零样本克隆,且中文无官方支持。 ⭐ OmniVoice 的 2,207 MiB 峰值显存是本次调研拿到的唯一第三方实测显存数字(此前只能标注「官方未给」)→ 进一步确认 16GB 卡对它绰绰有余。

14.5 一条对本项目最有价值的外部判断

sovgrid.org(2026-05-12,独立第三方,真实生产环境 DGX Spark / GB10 Blackwell) 把候选按「多说话人 + 表现力 + 克隆 + 速度控制 + 开源许可 + SM12.1 兼容」筛完后,只留三个 spike:VibeVoice(社区 fork)、Higgs Audio v2、IndexTTS-2,并明确指出:

"VibeVoice, Higgs Audio v2, and IndexTTS-2 are either too new or have not been submitted(到 AA 榜)";"top-of-leaderboard for a different use case is not the same as best fit"

→ 这是本次调研中唯一一条「按 sm_12x Blackwell 生产环境实测 + 商用许可」筛出来的第三方建议,与我们的结论(IndexTTS-2.5 / MOSS / CosyVoice3 优先)部分吻合(都看重 IndexTTS 系列)。 另注:VibeVoice 原仓库 2025-09 被微软下架(deepfake 风险),且它是唯一有公开 DGX Spark CUDA13/aarch64 部署记录的引擎。

14.6 数字缺口(必须承认「未查到」的项)

模型缺什么
ChatTTS任何 SeedTTS WER/CER/SIM 都未查到(官方无论文,第三方榜也未收录)
Kokorotest-zh CER / SIM-o 未查到(无官方论文,第三方只测英文);官方模型卡 language tag 只有 en → 中文靠第三方权重 hexgrad/Kokoro-82M-v1.1-zh(HF 镜像 downloads 22,373)与 onnx-community/Kokoro-82M-v1.1-zh-ONNX;社区报告(KokoroSharp issue #5)C# 版中文「口音很重、听不太清」,Python 版正常
GPT-SoVITSSeedTTS test-zh/test-en 的正式第三方数字未查到;只有 CV3-eval 口径的 ZH-CER 7.34 / EN-WER 12.5(VoxCPM 论文 arXiv:2509.24650 Table 4;同表 CosyVoice2 4.08/6.32、IndexTTS2 3.58/4.45、CosyVoice3-0.5B 3.89/5.24)。⚠️ CV3-eval 数值远高于 SeedTTS test-zh,绝不可混用口径 —— 这也说明 GPT-SoVITS 在 CV3-eval 口径下中文很弱(7.34),与其官方 wiki 的 SeedTTS 0.016 差距极大,是本次调研最大的口径冲突案例
MegaTTS3中文数字只有转引:VoxCPM 论文 Table 3 给 ZH-CER 1.52 / SIM 79.0、EN-WER 2.79 / SIM 77.1;RobustSpeechFlow(arXiv:2605.22083)Table 7 给同值 2.79/0.77 → 两个独立来源互相印证,可信度较高
IndexTTS / F5-TTS / MegaTTS3 / MOSS-TTSsm_120 实机实测均未查到(index-tts issue #242「能用 RTX50 系显卡跑吗?」与 sneekes.app 的 RTX5070 F5-TTS 指南两次抓取均超时)
中文 Arena 排名发现唯一的中文 Arena 原始投票数据 JacobLinCool/zh-tw-tts-arena-votes(2026-07-24,4 个 jsonl),本轮只读了 README 未统计 → 中文 Arena 排名仍是「未查到」(值得后续补做)

14.7 本次已确认的「可复现第三方评测资产」

评测资产URL性质
Seed-TTS-eval(字节官方评测代码/模型)https://github.com/BytedanceSpeech/seed-tts-eval事实标准,GPT-SoVITS wiki、多篇论文都用它
CV3-Eval(阿里 CosyVoice3 官方开源评测集)https://github.com/FunAudioLLM/CV3-Eval阿里开源,被 IndexTTS2.5 采用
Seed-TTS 论文arXiv:2406.02430测试集来源
VoiceHub/kadirnar 英文榜https://hf-mirror.com/datasets/kadirnar/voicehub-arena-seed-tts-eval/raw/main/leaderboard.csv独立第三方大规模复现(英文)
TTS Spaces Arena 原始投票HF dataset Pendrokar/TTS_Arena原始投票,非官方 Elo
AA TTS Leaderboardhttps://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice/open-weights第三方 Elo(英文)

⚠️ 重要方法学警告(来自 GPT-SoVITS 官方 wiki,很有价值):

「这个 benchmark 有啥用:测合成发音和目标发音的匹配度(WER),和音色相似度(SIM)。测不了自然性、情感丰富性和音质,前 2 个要人工打分。同时测试集的音色也有局限性。分数仅供参考,如果需要准确的结论请你用自己的实际场景训练集去微调和测试集去测试。论文里的分数、业界的情报和媒体宣传都是浮云,请永远相信,只有你自己的测试结论才是最真实的。」 — GPT-SoVITS wiki

→ 本报告全部数字都应在此前提下使用。中文选型请以 CV3-Eval / Seed-TTS-eval + 自家场景自测为准。


15. 商用许可速查(法务视角)

模型代码权重能否商用关键约束
⭐ Qwen3-TTS(阿里)Apache-2.0apache-2.0(HF tag 已确认,gated: False)✅ 自由商用微调脚本需自行改 FA2 设置
⭐ LongCat-AudioDiT(美团)MITMIT(HF tag = mit)✅ 自由商用最宽松许可之一
FireRedTTS-2(小红书)Apache-2.0Apache-2.0✅ 自由商用锁 torch2.7.1+cu126
ZipVoice(k2-fsa/小米)Apache-2.0Apache-2.0✅ 自由商用cu12.x 预编译,CUDA13 需自编
Step-Audio 2 mini(阶跃)Apache-2.0Apache-2.0✅ 自由商用仅 mini 开源;8.32B 显存未查到
GLM-TTS(智谱)⚠️ Apache-2.0⚠️ HF 标 mit(与仓库冲突)⚠️ 大概率可,但文档冲突需书面确认+ 5060 Ti issue #9
VibeVoice(微软)MITMIT⚠️ 法律上可(MIT),但官方明文「不建议商用/仅限研发」TTS 代码已被下架
Sesame CSMApache-2.0Apache-2.0✅ 可(附 Misuse 条款)但无中文支持
❌ Spark-TTSApache-2.0⚠️ CC-BY-NC-SA-4.0❌ 权重不可商用代码/权重许可自相矛盾
❌ Higgs Audio v2Apache-2.0(仓库)⚠️ license: other(含义不明)❌ 不可推定可商用主线 v3 明确非商用;需 ≥24GB
⭐ VoxCPM2(OpenBMB)Apache-2.0Apache-2.0✅ 自由商用官方原文 "free for commercial use"
Fun-CosyVoice3-0.5B-2512Apache-2.0apache-2.0✅ 自由商用无
MOSS-TTS 全家族Apache-2.0Apache-2.0✅ 自由商用无
F5-TTSMITMIT✅ 自由商用无
GPT-SoVITSMITMIT✅ 自由商用无
MegaTTS3Apache-2.0Apache-2.0✅ 自由商用需 Google Drive 转 latent
KokoroApache-2.0Apache-2.0✅ 自由商用无
IndexTTS-2.5bilibili 自定义bilibili Model Use License⚠️ 有条件商用月活 >1 亿 或 年营收 >10 亿人民币须另行授权;禁高风险场景;禁用于改进他人 AI 模型;上海仲裁
OmniVoiceApache-2.0CC-BY-NC❌ 权重不可商用训练数据(Emilia)导致
Fish Audio S2 ProFish Audio Research License同左❌ 一律需单独授权连企业内部自用也算商用;商务联系 business@fish.audio
ChatTTSAGPLv3+CC BY-NC 4.0❌ 不可商用AGPL 对网络服务有源码开放义务;官方故意劣化音质

一句话结论:要商用 → VoxCPM2 / CosyVoice3 / MOSS-TTS / F5-TTS / GPT-SoVITS / MegaTTS3 / Kokoro(全部宽松许可)或 IndexTTS-2.5(中小企业免费)。避开 OmniVoice、Fish Audio S2、ChatTTS。


16. 推荐排序(针对「16GB 单卡数字人 + 中文 + 可商用」)

⚠️ 前提澄清(重要,会改变权重):结合同目录 数字人选型结论-20260922.md,本项目的实际形态是 「离线口播成片」(一张图/一段视频 + 现成人声音频 → 口型同步视频),走 A 类音频驱动路线(MuseTalk 1.5 / SoulX-FlashHead Lite / EchoMimicV3-Flash / LongCat-Video-Avatar 1.5)。 这意味着 TTS 只需产出「一段完整音频文件」,下游数字人模型拿现成音频对口型 —— 因此:

  • 流式 / TTFB 的重要性大幅下降(不是实时对话链路,不需要边生成边驱动口型);
  • 权重上升的是:中文自然度、说话人相似度、音色/情绪可控性、单次生成稳定性、许可证、显存占用(要和数字人模型抢同一张 16GB 卡)。
  • 但任务书明确要求核查流式能力与数字人框架集成,故两项都保留。若后续要接实时数字人(LiveTalking / OpenAvatarChat / Fay 那类),流式项就是硬门槛。

16.1 实时对话链路排序

排名模型核心理由短板
🥇⭐ Qwen3-TTS(阿里,Apache-2.0)首包 97ms(官方,全场最低) + 原生双轨流式 + Apache-2.0 可商用 + sm_120 零 issue(本次唯一) + LiveTalking 作者实测 0.6B+vLLM-Omni ~130msVRAM 未公布需实测;微调脚本硬编码 FA2(不微调无影响)
🥈Fun-CosyVoice3-0.5B-2512Apache-2.0 + 流式 150ms(第三方实测 ~195ms)+ 中文 SS 78/80 + 9 语言 18 方言 + vLLM/TRT-LLM 生产路径主仓库 last-commit=may(活跃度下降);⚠️ 官方 requirements 的 torch 2.3.1 在 5060 Ti 上必挂(issue #1815 点名),需自行升 torch≥2.7/cu128
🥉VoxCPM2(2B, OpenBMB)Apache-2.0(HF 侧已确认) + 官方 generate_streaming() + 中文 CER 0.97 / SIM 79.5 + 48kHz + ~8GB VRAM未公布 TTFB;sm_120 多个 open issue(#250/#282/#326)
4FireRedTTS-2Apache-2.0 + 首包 140ms + bf16 9GB + 4 说话人长对话锁 torch2.7.1+cu126(cu126 不含 sm_120);单句 CER 1.14 一般
5MOSS-TTS-RealtimeApache-2.0 + TTFB 180ms + ZH SIM 79.62 + 8B 能塞 8GB 卡需 FlashAttention 2(sm_120 风险);家族档位多

16.2 离线口播成片排序(本项目实际形态,不需流式)

排名模型核心理由短板
🥇⭐ LongCat-AudioDiT(美团,MIT)MIT 最宽松许可 + 中文 SIM 81.8(全场最高);非流式在离线场景不是缺点3.83B F32 权重(需转半精度进 16GB,待实测);sm_120 未查到
🥈IndexTTS-2.5中文 CER 0.93–1.21% + SS 77.9 + 情绪/时长强可控(第三方评价「对口型同步非常有意义」)+ 官方 6GB VRAM + 中小企业免费商用大厂需另行授权;无流式(离线无妨)
🥉VoxCPM2中文 CER 0.97 / SIM 79.5 + 48kHz + ~8GBsm_120 open issue
4MegaTTS3Apache-2.0 + 中文 SIM 79.0 + RTF 0.124(加速版)必须用 Google Drive 转 .npy latent(国内不可达);2025-03 后停更
5GPT-SoVITS v2ProPlusMIT + 中文 SIM 0.737(接近真人 0.750)+ 229M 最省显存自然度无客观数字

16.3 不推荐 / 已排除

模型排除原因
OmniVoice(小米)权重 CC-BY-NC(不可商用);且有输出乱码 bug(Issue #155 未修)
Fish Audio S2 Pro一律需单独授权,HF 门禁强制勾「non-commercial use ONLY」;且 sm_120 上 vLLM-Omni 配方被 FA3 阻断
Spark-TTSHF 权重 CC-BY-NC-SA-4.0 → 商用踩雷;中文 SIM 66.0 最低之一
Higgs Audio v2HF license other 含义不明;主线 v3 明确非商用;需 ≥24GB;无 arXiv 论文
VibeVoice-TTS-1.5B微软 2025-09-05 下架代码并标 Disabled,官方明文不建议商用;仅 Realtime-0.5B 存活(仅英文单说话人)
GLM-TTS许可 GitHub Apache-2.0 vs HF mit 冲突;issue #9 报告 RTX 5060 Ti 16G 利用率仅 40%(与本机硬件一致)
Sesame CSM无中文支持(官方自述非英语「likely won't do well」);无 arXiv 论文;sm_120 #118
Step-Audio 28.32B 显存未查到(16GB 紧张);TTS 侧中文指标未查到
ChatTTS代码 AGPL-3.0 + 权重 CC BY-NC 4.0 双重不可商用;官方故意加噪+MP3 压缩劣化音质
Kokoro官方 language tag 只有 en;中文无任何客观数字;2025-08 后停更;不支持零样本克隆
MiniMax-Speech / Qwen3-TTS-Flash前者无开源仓库;后者闭源 API 无权重

16.4 落地建议路径(最终版)

  1. 本项目(离线口播)首选链路:
    • 先试 LongCat-AudioDiT(MIT + 中文 SIM 81.8 最高)→ 唯一顾虑是 3.83B F32 权重能否塞进 16GB;第一步就是验证显存与 fp16/bf16 转换后的音质。
    • 并行验证 IndexTTS-2.5(官方 6GB VRAM 明确 + 情绪/时长可控)作为稳妥兜底。
    • 若两者都有问题,退到 VoxCPM2(~8GB,中文 0.97/79.5)或 MegaTTS3(注意 .npy 门槛)。
  2. 若后续接实时数字人:Qwen3-TTS 是唯一「可商用 + 97ms + sm_120 零 issue」的选择;备选 Fun-CosyVoice3(需先解决 torch/cu128)。
  3. 务必自测:用 Seed-TTS-eval(https://github.com/BytedanceSpeech/seed-tts-eval )在自家场景音频上跑 WER/SIM。同一模型在不同榜单里中文 WER 能差 6–7 倍(见 0.2 的四个案例),任何单一公开数字都不足以定论。
  4. sm_120 部署纪律:不要照抄任何项目的官方 requirements(多数钉死 torch≤2.4,只编到 sm_90);统一用 torch ≥2.7 + cu128/cu130;需要 flash-attn 时先用 flash-attention#2016 的免编译组合。

来源清单(全部为本次实际抓取过的 URL;共 157 条编号 + 每条内的并列 URL,实际约 220+ 个 URL)

论文 / arXiv(经 export.arxiv.org/api/query 校验)

  1. https://arxiv.org/abs/2604.00688 — OmniVoice(小米),v3 2026-04-21
  2. https://arxiv.org/pdf/2604.00688v3 — OmniVoice 全文(Table 1/2/8、机构署名)
  3. https://export.arxiv.org/api/query?id_list=2604.00688
  4. https://arxiv.org/abs/2607.21042 — Faster IndexTTS-2(NVIDIA),2026-07-23
  5. https://arxiv.org/pdf/2607.21042v1 — Faster IndexTTS-2 全文(Table I/II/III、Fig.2)
  6. https://export.arxiv.org/api/query?id_list=2607.21042
  7. https://arxiv.org/abs/2601.03888 — IndexTTS 2.5 Technical Report
  8. https://export.arxiv.org/api/query?search_query=ti:%22IndexTTS%202.5%22
  9. https://export.arxiv.org/api/query?search_query=all:IndexTTS&sortBy=submittedDate
  10. https://arxiv.org/abs/2506.21619 — IndexTTS2
  11. https://arxiv.org/abs/2502.05512 — IndexTTS
  12. https://arxiv.org/abs/2505.17589 — CosyVoice 3
  13. https://arxiv.org/abs/2412.10117 — CosyVoice 2
  14. https://arxiv.org/abs/2407.05407 — CosyVoice 1
  15. https://arxiv.org/abs/2603.08823 — Fish Audio S2 Technical Report
  16. https://export.arxiv.org/api/query?id_list=2603.08823
  17. https://arxiv.org/abs/2603.18090 — MOSS-TTS Technical Report
  18. https://arxiv.org/pdf/2603.19739 — MOSS-TTSD
  19. https://arxiv.org/pdf/2603.28086 — MOSS-VoiceGenerator
  20. https://arxiv.org/abs/2410.06885 — F5-TTS
  21. https://arxiv.org/abs/2502.18924 — Sparse Alignment Enhanced Latent Diffusion Transformer(F5-TTS 仓库内)
  22. https://arxiv.org/abs/2406.18009 — E2 TTS
  23. https://arxiv.org/abs/2406.02430 — Seed-TTS
  24. https://arxiv.org/pdf/2601.15621 — Qwen3-TTS Technical Report(已核实,streaming + 3s 克隆 + 双轨 LM)
  25. https://export.arxiv.org/api/query?id_list=2601.15621
  26. https://arxiv.org/abs/2502.18924 — MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer(v4,2025-03-28)— 论文正文 Table 1/2 已抓取
  27. https://arxiv.org/pdf/2502.18924v4 — MegaTTS3 全文
  28. https://arxiv.org/abs/2606.06928 — VoxCPM2 Technical Report(2026-06-05)
  29. https://arxiv.org/abs/2509.24650 — VoxCPM: Tokenizer-Free TTS(2025-09-29)
  30. https://arxiv.org/abs/2502.03930 — DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation
  31. https://export.arxiv.org/api/query?id_list=2606.06928,2509.24650,2502.03930
  32. https://export.arxiv.org/api/query?search_query=all:MegaTTS
  33. https://sditdemo.github.io/sditdemo/ — MegaTTS3 音频样例

GitHub 仓库 README / 原始文件

  1. https://raw.githubusercontent.com/k2-fsa/OmniVoice/main/README.md
  2. https://raw.githubusercontent.com/k2-fsa/OmniVoice/master/docs/community-projects.md
  3. https://raw.githubusercontent.com/k2-fsa/OmniVoice/master/docs/tips.md
  4. https://raw.githubusercontent.com/k2-fsa/OmniVoice/master/pyproject.toml
  5. https://raw.githubusercontent.com/index-tts/index-tts/main/README.md
  6. https://raw.githubusercontent.com/index-tts/index-tts/main/docs/README_zh.md
  7. https://raw.githubusercontent.com/index-tts/index-tts/main/LICENSE
  8. https://raw.githubusercontent.com/index-tts/index-tts/main/DISCLAIMER
  9. https://raw.githubusercontent.com/FunAudioLLM/CosyVoice/main/README.md
  10. https://raw.githubusercontent.com/RVC-Boss/GPT-SoVITS/main/README.md
  11. https://raw.githubusercontent.com/wiki/RVC-Boss/GPT-SoVITS/GPT%E2%80%90SoVITS%E2%80%90features-%28%E5%90%84%E7%89%88%E6%9C%AC%E7%89%B9%E6%80%A7%29.md
  12. https://raw.githubusercontent.com/fishaudio/fish-speech/main/README.md
  13. https://raw.githubusercontent.com/fishaudio/fish-speech/main/docs/en/index.md
  14. https://github.com/fishaudio/fish-speech/blob/main/LICENSE — FISH AUDIO RESEARCH LICENSE 全文
  15. https://raw.githubusercontent.com/OpenMOSS/MOSS-TTS/main/README.md
  16. https://raw.githubusercontent.com/OpenMOSS/MOSS-TTS/main/LICENSE
  17. https://raw.githubusercontent.com/SWivid/F5-TTS/main/README.md
  18. https://raw.githubusercontent.com/bytedance/MegaTTS3/main/readme.md
  19. https://raw.githubusercontent.com/hexgrad/kokoro/main/README.md
  20. https://raw.githubusercontent.com/2noise/ChatTTS/main/README.md
  21. https://raw.githubusercontent.com/chenpipi0807/ComfyUI-Index-TTS/main/README.md
  22. https://raw.githubusercontent.com/fengin/Fun-CosyVoice3-0.5B-2512-Deploy/main/README.md

HuggingFace 模型卡(经 hf-mirror.com 镜像)

  1. https://hf-mirror.com/k2-fsa/OmniVoice/raw/main/README.md — 权重 CC-BY-NC 声明在此
  2. https://hf-mirror.com/IndexTeam/IndexTTS-2.5/raw/main/README.md — ~6GB VRAM、license: other / bilibili-model-license
  3. https://hf-mirror.com/FunAudioLLM/Fun-CosyVoice3-0.5B-2512/raw/main/README.md — license: apache-2.0、150ms 流式

shields.io 徽章(stars / license / last-commit)

  1. https://img.shields.io/github/stars/k2-fsa/OmniVoice.json · https://img.shields.io/github/license/k2-fsa/OmniVoice.json · https://img.shields.io/github/last-commit/k2-fsa/OmniVoice.json
  2. https://img.shields.io/github/stars/index-tts/index-tts.json · .../license/index-tts/index-tts.json · .../last-commit/index-tts/index-tts.json
  3. https://img.shields.io/github/stars/FunAudioLLM/CosyVoice.json · .../license/FunAudioLLM/CosyVoice.json · .../last-commit/FunAudioLLM/CosyVoice.json
  4. https://img.shields.io/github/stars/RVC-Boss/GPT-SoVITS.json · .../license/RVC-Boss/GPT-SoVITS.json · .../last-commit/RVC-Boss/GPT-SoVITS.json
  5. https://img.shields.io/github/stars/fishaudio/fish-speech.json · .../license/fishaudio/fish-speech.json · .../last-commit/fishaudio/fish-speech.json
  6. https://img.shields.io/github/stars/OpenMOSS/MOSS-TTS.json · .../license/OpenMOSS/MOSS-TTS.json · .../last-commit/OpenMOSS/MOSS-TTS.json
  7. https://img.shields.io/github/stars/SWivid/F5-TTS.json · .../license/SWivid/F5-TTS.json · .../last-commit/SWivid/F5-TTS.json
  8. https://img.shields.io/github/stars/bytedance/MegaTTS3.json · .../license/bytedance/MegaTTS3.json · .../last-commit/bytedance/MegaTTS3.json
  9. https://img.shields.io/github/stars/hexgrad/kokoro.json · .../license/hexgrad/kokoro.json · .../last-commit/hexgrad/kokoro.json
  10. https://img.shields.io/github/stars/2noise/ChatTTS.json · .../license/2noise/ChatTTS.json · .../last-commit/2noise/ChatTTS.json

项目主页 / 演示 / 生态

  1. https://github.com/k2-fsa/OmniVoice
  2. https://github.com/index-tts/index-tts
  3. https://github.com/FunAudioLLM/CosyVoice
  4. https://github.com/RVC-Boss/GPT-SoVITS
  5. https://github.com/fishaudio/fish-speech
  6. https://github.com/OpenMOSS/MOSS-TTS
  7. https://github.com/SWivid/F5-TTS
  8. https://github.com/bytedance/MegaTTS3
  9. https://github.com/hexgrad/kokoro
  10. https://github.com/2noise/ChatTTS
  11. https://zhu-han.github.io/omnivoice
  12. https://huggingface.co/spaces/k2-fsa/OmniVoice
  13. https://index-tts.github.io/index-tts2-5.github.io/
  14. https://funaudiollm.github.io/cosyvoice3/
  15. https://swivid.github.io/F5-TTS/
  16. https://huggingface.co/spaces/ByteDance/MegaTTS3
  17. https://mosi.cn/#models
  18. https://studio.mosi.cn
  19. https://speech.fish.audio/install/
  20. https://fish.audio/blog/fish-audio-open-sources-s2/
  21. https://lj1995-gpt-sovits-proplus.hf.space/
  22. https://www.yuque.com/baicaigongchang1145haoyuangong/ib3g1e
  23. https://rentry.co/GPT-SoVITS-guide
  24. https://recipes.vllm.ai/IndexTeam/IndexTTS-2.5
  25. https://faster-indextts-2.github.io
  26. https://github.com/BytedanceSpeech/seed-tts-eval
  27. https://github.com/FunAudioLLM/CV3-Eval
  28. https://github.com/baicai-1145/GPT-SoVITS-CPUFast
  29. https://github.com/sgl-project/sglang-omni
  30. https://github.com/vllm-project/vllm-omni
  31. https://github.com/hexgrad/misaki
  32. https://github.com/libukai/Awesome-ChatTTS
  33. https://huggingface.co/spaces/OpenMOSS-Team/MOSS-TTS
  34. https://huggingface.co/collections/OpenMOSS-Team/moss-tts
  35. https://www.modelscope.cn/collections/openmoss/MOSS-TTS
  36. https://www.modelscope.cn/models/FunAudioLLM/Fun-CosyVoice3-0.5B-2512
  37. https://modelscope.cn/models/IndexTeam/IndexTTS-2.5
  38. https://huggingface.co/fishaudio/s2-pro
  39. https://huggingface.co/hexgrad/Kokoro-82M
  40. https://huggingface.co/hexgrad/Kokoro-82M/blob/main/SAMPLES.md
  41. https://huggingface.co/Compumacy/kokoro/blob/main/VOICES.md
  42. https://huggingface.co/2Noise/ChatTTS
  43. https://huggingface.co/SWivid/F5-TTS
  44. https://huggingface.co/lj1995/GPT-SoVITS
  45. https://huggingface.co/OpenMOSS-Team/MOSS-TTS-GGUF
  46. https://huggingface.co/OpenMOSS-Team/MOSS-Audio-Tokenizer-ONNX

sm_120 / Blackwell 兼容性

  1. https://www.cnblogs.com/xyz/p/19817397 — flash_attn nvcc fatal : Unsupported gpu architecture 'compute_120'
  2. https://github.com/triton-lang/triton/pull/9734 — Fix PTX codegen segfaults on consumer Blackwell (sm_120)
  3. https://github.com/sgl-project/sglang/pull/36566 — allow trtllm sparse decode on SM120/SM121

第三方中文实测 / 二手来源(仅作线索,未作为硬结论)

  1. https://blog.csdn.net/weixin_33562004/article/details/156601470 — RTX 3060 跑 IndexTTS 2.0 实测
  2. https://blog.csdn.net/weixin_28771751/article/details/159594796 — GPT-SoVITS 6GB 显存部署(该域名返回 521,未取到正文,未采信)

VoxCPM2 / 其他新模型来源(补充)

  1. https://github.com/OpenBMB/VoxCPM — VoxCPM2 README(2B、30 语言、48kHz、Apache-2.0、generate_streaming、VRAM ~8GB、RTF 表、Seed-TTS-eval 全表、CV3-eval 表)
  2. https://img.shields.io/github/stars/OpenBMB/VoxCPM.json · https://img.shields.io/github/license/OpenBMB/VoxCPM.json
  3. https://img.shields.io/github/stars/microsoft/VibeVoice.json · https://img.shields.io/github/license/microsoft/VibeVoice.json
  4. https://img.shields.io/github/stars/SesameAILabs/csm.json · https://img.shields.io/github/license/SesameAILabs/csm.json
  5. https://img.shields.io/github/stars/SparkAudio/Spark-TTS.json · https://img.shields.io/github/license/SparkAudio/Spark-TTS.json
  6. https://img.shields.io/github/stars/boson-ai/higgs-audio.json · https://img.shields.io/github/license/boson-ai/higgs-audio.json
  7. https://hf-mirror.com/openbmb/VoxCPM/raw/main/README.md — (返回 401 Invalid username or password,未能读取,改用 GitHub 页面)
  8. https://github.com/vllm-project/vllm-omni — VoxCPM2 官方 vLLM-Omni 支持
  9. https://github.com/OpenBMB/Nano-vLLM-VoxCPM — Nano-vLLM 推理引擎(RTF ~0.13@4090)

第三方榜单 / 实测来源(补充,均由 subagent 实抓)

  1. https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice/open-weights — AA TTS Elo 榜(2026 唯一完整第三方 Elo 榜,纯英文)
  2. https://hf-mirror.com/datasets/kadirnar/voicehub-arena-seed-tts-eval/raw/main/leaderboard.csv — VoiceHub 独立英文 Seed-TTS-Eval(33 模型 × 1088 条,A100 40GB,2026-09-15)
  3. https://huggingface.co/datasets/Pendrokar/TTS_Arena — TTS Spaces Arena 原始投票(2026-09-21 更新)
  4. https://docs.ttsarena.org — TTS Arena 文档(原文 "Prompts are English-only for now")
  5. https://sovgrid.org — 2026-05-12 独立第三方 DGX Spark/GB10 Blackwell 生产环境选型(只留 VibeVoice / Higgs Audio v2 / IndexTTS-2)
  6. https://hf-mirror.com/hexgrad/Kokoro-82M-v1.1-zh — Kokoro 中文第三方权重
  7. https://hf-mirror.com/onnx-community/Kokoro-82M-v1.1-zh-ONNX
  8. https://github.com/Dao-AILab/flash-attention/issues/2168 — flash-attn sm_120 报错
  9. https://github.com/Dao-AILab/flash-attention/issues/2016 — flash-attn sm_120 免编译可用组合
  10. https://github.com/FunAudioLLM/CosyVoice/issues/1815 — 直接点名 RTX 5060 Ti(requirements torch 2.3.1 只到 sm_90)
  11. https://github.com/RVC-Boss/GPT-SoVITS/issues/2205 · /2514 · /2393 · /2394 · PR /2774 — GPT-SoVITS sm_120 / 5060 Ti 问题
  12. https://github.com/jianchang512/ChatTTS-ui/issues/290 — ChatTTS-ui 5070 Ti sm_120
  13. https://github.com/Genesis1231/fish-s2-rtx — Fish S2 Pro 的 sm_120 可用容器(vLLM-Omni 0.22 + torch 2.11 + cu130)
  14. https://blog.csdn.net/jacke121/article/details/157323875 — LiveTalking 专属 TTS 选型表(第三方)
  15. https://juejin.cn/post/7649764223339495475 — 掘金 2026 开源 TTS 横向对比(第三方转述)
  16. https://github.com/lipku/LiveTalking · https://github.com/HumanAIGC-Engineering/OpenAvatarChat · https://github.com/Kedreamix/Linly-Talker · https://github.com/duixcom/Duix.Avatar · https://github.com/modstart-lib/aigcpanel
  17. https://doc.livetalking.ai/docs/tts/omnitts/ — LiveTalking OmniTTS 文档(各 TTS 显存/延迟:Qwen3 12G、VoxCPM2 13G、Fish 18G、IndexTTS 17G/延时4s、CosyVoice 14G)

2026 新模型来源(第 11 节证据,均由 subagent 实抓;完整 120 条见 _raw_TTS_newmodels.md)

  1. https://github.com/QwenLM/Qwen3-TTS — Qwen3-TTS 官方仓库(13k stars / Apache-2.0 / last-commit march)
  2. https://cdn.jsdelivr.net/gh/QwenLM/Qwen3-TTS@main/LICENSE — Apache-2.0 全文(11343 B)
  3. https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice · https://hf-mirror.com/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/raw/main/README.md(200,57846 B)
  4. https://hf-mirror.com/api/models/Qwen/Qwen3-TTS-12Hz-1.7B-Base?blobs=false — 精确张量数 1,928,677,440;license apache-2.0;gated False
  5. https://huggingface.co/collections/Qwen/qwen3-tts — Qwen3-TTS 合集
  6. https://export.arxiv.org/api/query?id_list=2601.15621 — arXiv 2601.15621 核验为真(Qwen3-TTS Technical Report,2026-01-22)
  7. https://github.com/QwenLM/Qwen3-TTS/issues/372 · /373 · /350 · /369 · /370 · /124 · /345 · /179 — Qwen3-TTS 已知 issue(#372 微调硬编码 FA2)
  8. https://github.com/meituan-longcat/LongCat-AudioDiT — LongCat-AudioDiT 官方仓库(owner = 美团)
  9. https://cdn.jsdelivr.net/gh/meituan-longcat/LongCat-AudioDiT@main/LICENSE — MIT License(1064 B,Copyright (c) 2026 Meituan)
  10. https://hf-mirror.com/meituan-longcat/LongCat-AudioDiT-3.5B/raw/main/README.md(200,9756 B);https://hf-mirror.com/api/models/meituan-longcat/LongCat-AudioDiT-3.5B?blobs=false(F32,3,833,985,217;license:mit)
  11. https://arxiv.org/abs/2603.29339 — LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space(2026-03-31)
  12. https://github.com/FireRedTeam/FireRedTTS2 — FireRedTTS-2 官方仓库(Apache-2.0)
  13. https://github.com/stepfun-ai/Step-Audio2 — Step-Audio 2(Apache-2.0,8.32B mini)
  14. https://github.com/zai-org/GLM-TTS — GLM-TTS 官方仓库;⚠️ issue #9:RTX 5060 Ti 16G 利用率仅 40%
  15. https://github.com/SparkAudio/Spark-TTS — ⚠️ 代码 Apache-2.0 但 HF 权重 cc-by-nc-sa-4.0:https://hf-mirror.com/api/models/SparkAudio/Spark-TTS-0.5B?blobs=false
  16. https://github.com/boson-ai/higgs-audio — ⚠️ 主 README 已转推 v3(Research and Non-Commercial),v2 文档在 README_V2.md;issue #39 Blackwell Docker、#177 libcudart.so.13
  17. https://github.com/microsoft/VibeVoice — ⚠️ VibeVoice-TTS 代码已下架(2025-09-05),VibeVoice-TTS-1.5B 标 Disabled;仅 Realtime-0.5B 存活
  18. https://github.com/SesameAILabs/csm — Sesame CSM(Apache-2.0,无中文);issue #118:RTX 5080 sm_120 与 PyTorch 不兼容
  19. https://github.com/k2-fsa/ZipVoice — ZipVoice(123M,Apache-2.0,非流式)
  20. https://hf-mirror.com/openbmb/VoxCPM2/raw/main/README.md — VoxCPM2 的 HF 侧 license: apache-2.0,gated: False(修正此前 401 —— repo 名应为 openbmb/VoxCPM2)
  21. https://github.com/OpenBMB/Nano-vLLM-VoxCPM · https://github.com/vllm-project/vllm-omni — VoxCPM2 推理/部署

附:配套子报告与待补项

已完成的两个配套子报告(同目录)

文件内容规模
_raw_TTS_benchmarks.md第三方榜单与实测:Artificial Analysis TTS Elo、HuggingFace TTS Arena V2、TTS Spaces Arena 原始投票统计、VoiceHub/kadirnar 独立英文 Seed-TTS-Eval、中文实测帖、sm_120 全框架 issue 清单73 KB / 732 行 / 151 个实抓 URL
_raw_TTS_digitalhuman_integration.mdLiveTalking / OpenAvatarChat / Fay / Linly-Talker / Duix.Avatar / aigcpanel / SoulX-FlashTalk / Ultralight-Digital-Human / Open-LLM-VTuber 的原生 TTS 支持、可插拔性、采样率与 chunk 约束64 KB / 1174 行 / 101 条实抓 URL

另可交叉参考同目录姊妹报告 实时交互数字人与TTS调研.md(另一个 DSH agent 产出,含数字人驱动框架 + TTS 配对方案与端到端延迟测算)。

待补(未完成项,如实列出)


本文件由 DSH agent 于 2026-09-22 生成。所有 URL 均为实际抓取验证;查不到的字段一律标注「未查到」,未做任何推测填充。 工作副本位于 _scratch/_raw_TTS.md(父 agent 的清理流程会把 _raw_*.md 扫入 _scratch/);同内容副本保留在本目录 _raw_TTS.md。

下载此文件