_raw_TTS_benchmarks.md

第三方 TTS 评测榜单与中文实测调研(原始资料)


0. 十条最重要结论(速览)

  1. Artificial Analysis 的 TTS 榜单是 2026 年唯一"活的、有完整数字、可抓取"的第三方 Elo 榜,但它 只测英文(US/UK 口音),且 90 个模型里只有 16 个开源权重;中国开源模型(IndexTTS、CosyVoice 开源权重、GPT-SoVITS、ChatTTS、F5-TTS、MegaTTS3)全部不在榜。榜上最靠前的开源模型是 Breeze TTS 2(Elo 1204)、Fish Audio S2 Pro(1121)。Kokoro 82M v1.0 = Elo 1060.98(CI 1050–1072),是榜上最便宜($0.65/1M 字符)。
  2. HuggingFace TTS Arena V2 的 Elo 数字本轮未能从原始页面取得(Space 被镜像拒绝)。但找到两篇第三方文章转述其 2026 年数字:Fish Audio S2 Pro 为开源第一(ELO 1128)。
  3. Kokoro README 里提到的 "TTS Spaces Arena" 的完整投票数据是公开的(HF dataset Pendrokar/TTS_Arena,2026-09-21 更新)。我自行统计 36,993 次投票事件:Kokoro 系(hexgrad/kokoro 98.4%、hexgrad/Kokoro-API 96.7%)长期第一梯队;GPT-SoVITS-ProPlus 仅 27.5% 垫底(标签:[我方推导])。
  4. 独立大规模英文 Seed-TTS-Eval 实测(VoiceHub Arena) 给出了 33 个模型 × 1088 条英文文本的 WER/CER:Kokoro 0.96% WER 第一,GPT-SoVITS 2.64%(第 22/33);该 campaign 明确声明不测 SIM/MOS。
  5. 第二个 VoiceHub campaign 提供 WavLM speaker SIM:OmniVoice 克隆 SIM 0.7385、F5-TTS 克隆 SIM 0.6691(英文 Seed-TTS-Eval,1088 条)。
  6. GPT-SoVITS 的中文 SeedTTS 数字只有一处找到:VoxCPM 论文(arXiv 2509.24650)在 CV3-eval 表里列 GPT-Sovits ZH-CER 7.34% / EN-WER 12.5%(明显落后于 CosyVoice2 4.08/6.32、IndexTTS2 3.58/4.45)。该数字与论文自身 Seed-TTS-eval 表的口径不同,不可与 test-zh CER 直接对比。
  7. MegaTTS3:厂商论文(S-DiT,arXiv 2502.18924)自评英文 SIM-O 0.70–0.71 / WER 1.82–1.86%(LibriSpeech-PC);第三方论文转引其在 Seed-TTS-eval 上 EN-WER 2.79 / EN-SIM 77.1 / ZH-CER 1.52 / ZH-SIM 79.0(VoxCPM 论文 Table 3;另见 RobustSpeechFlow 表)。ChatTTS 与 Kokoro 的 test-zh/test-en WER/SIM-o 正式数字:未查到。
  8. Kokoro 官方只支持英文(HF 模型卡 language tag = en),中文需用第三方 hexgrad/Kokoro-82M-v1.1-zh;社区报告 KokoroSharp 版中文「口音很重、听不清」,Python 版正常。
  9. sm_120 / Blackwell:GPT-SoVITS、CosyVoice、ChatTTS 三大框架都有 50 系显卡的真实报错记录(no kernel image is available / sm_120 is not compatible with the current PyTorch installation),根因是整合包/requirements 里钉死的旧 PyTorch(≤2.3/2.4,只编到 sm_90);升级到 cu128 的 torch 2.7/2.8 可解。索引型结论:没有一个是"sm_120 天生不支持",都是 torch/flash-attn 版本问题。
  10. flash-attn 在 Blackwell 上通常仍需源码编译,但有实测可行的免编译组合(Python 3.10 + CUDA 12.8 + torch 2.7.1 + flash_attn==2.8.0.post2 --no-build-isolation);Fish Audio S2 Pro 在 Blackwell 上(RTX 5090 / RTX PRO 6000)有第三方容器方案(vLLM-Omni 0.22 + torch 2.11 + cu130 + sm_120 kernel),但上游默认配方在 sm_120 上是坏的。

1. HuggingFace TTS Arena / TTS Spaces Arena

1.1 TTS Arena V2(TTS-AGI)——榜单存在但原始页面取不到

项目结果
Space 地址https://huggingface.co/spaces/TTS-AGI/TTS-Arena-V2
本网络可读性❌ 官方域名超时;hf-mirror.com 返回明确拒绝页("本站暂不支持访问 Spaces 空间,可前往 Hugging Face 官网查看")
镜像可读到的唯一内容https://hf-mirror.com/spaces/TTS-AGI/TTS-Arena-V2/raw/main/README.md(176 B)内容仅为:# TTS Arena V2 + > Source: https://github.com/TTS-AGI/TTS-Arena
源码仓库https://github.com/TTS-AGI/TTS-Arena(可访问;Bun monorepo:apps/web(Next.js)、apps/router、apps/docs;Apache-2.0)
文档站https://docs.ttsarena.org(可访问)

docs.ttsarena.org 明确写出的评测条件([第三方] 榜单方自述):

"TTS Arena ranks text-to-speech models by ear. You type a line, two anonymous models read it back, and you pick the one that sounds more human." Quick facts:Sign in with Hugging Face to vote; accounts must be at least 30 days old. Prompts are English-only for now, capped at 1,000 characters. Models are revealed only after you vote. TTS Arena is open source under Apache 2.0.

→ 关键限制:TTS Arena V2 的提示词目前只有英文(English-only),上限 1000 字符,因此它不能用来评估中文 TTS 质量。且本轮未查到任何可直接抓取的 2026 年 TTS Arena V2 原始 Elo 表。

1.2 第三方文章转述的 TTS Arena V2 数字([第三方-引用])

来源 A:Sovereign AI Blog,"Voxtral Capped at 3/10: Picking the Next Open TTS",2026-05-12 URL:https://sovgrid.org/blog/strategy-tts-pivot-voxtral-ceiling/

原文(Quick Take):

"TTS Arena V2 ranks Fish Audio S2 Pro as the top open-weights model at ELO 1128, behind five closed engines (Realtime TTS 1.5 Max at 1208, Gemini 3.1 Flash TTS at 1206, StepAudio 2.5 TTS at 1187, ElevenLabs v3 at 1178, Inworld TTS 1 Max at 1164). Arena measures general preference, not podcast multi-speaker dialog fitness." "Filtered for podcast (multi-speaker, expressivity, voice clone, Blackwell SM12.1 compatibility, open weights), the top three are different: VibeVoice, Higgs Audio v2, IndexTTS-2."

同文 "(2026-05-13 update)" 一节(作者把 TTS Arena 数字与 artificialanalysis.ai 做对照):

"Voxtral is on that leaderboard at ELO 1056, roughly tied with Kokoro-82M v1.0. Fish Audio S2 Pro tops the open-weight column at 1128. Top closed models cluster around 1180-1208…" "My three spike candidates are not on the AA TTS leaderboard at all. VibeVoice, Higgs Audio v2, and IndexTTS-2 are either too new or have not been submitted. This is meaningful: there is no third-party benchmark to anchor the spike result against." "AA's leaderboard measures preference on isolated single-sentence prompts … It does not measure 30-second podcast monologue prosody, multi-speaker dialog turn-taking…"

⚠️ 注意:该文把 "TTS Arena V2" 与 "artificialanalysis.ai" 的数字混用过(1128 这个值在两个榜里都出现),因此 1128 → Fish Audio S2 Pro 这一条在本报告中按「第三方转述,榜单归属存疑」处理;而 1056 = Voxtral / Kokoro 这条明确标注为 AA 榜。

来源 B:The AI Bench,"Best local AI voice models in 2026",页面标注 VERIFIED SEPTEMBER 2026 URL:https://theaibench.ai/use-cases/voice/

原文:

"TTS Arena went multi-polar in March 2026 — Fish Audio S2 Pro now leads at Elo 1128 but is non-commercial; Kokoro-82M (Apache 2.0) dropped from #1 to mid-pack on quality but remains the practical choice for English narration on CPU." "…Fish Audio S2 Pro (5B, non-commercial) if quality outranks license cleanliness." Verdict 推荐:Chatterbox-Turbo (Resemble AI, MIT, Dec 15 2025) 用于 voice cloning;Sesame CSM-1B (Apache 2.0) 用于 realtime conversational。

1.3 TTS Spaces Arena(Pendrokar,即 Kokoro README 提到的那个)——原始投票数据可抓取

这是另一个榜(早期由 Pendrokar/TTS-Spaces-Arena Space 运营),其投票汇总数据以 HF dataset 形式完全公开:

TSV 结构(我实际下载的 tts_arena_vote_summary_all.tsv,350,051 B): spokentext | rejected(被淘汰的模型)| votes(票数)| chosen("<数量> <击败它的模型列表>")| lastvote

[我方推导] 由我统计的全时段相对偏好胜率(方法:每一行代表"在某个句子上,模型 R 被投票淘汰了 V 次,且至少有 chosen 列表中的那些模型赢过它";因此 wins 会被高估 —— 列表是按"曾赢过"记录的集合,不代表每次都赢;losses 精确。这与官方 Elo 不是一回事,只能看相对量级)。全库 36,993 次投票事件,46 个模型变体,仅列 ≥200 events:

胜率(推导)eventswinslosses模型
98.39%3,7263,66660hexgrad/kokoro(原版)
96.73%21,55620,852704hexgrad/Kokoro-API
94.97%16,55215,720832MohamedRashad/Orpheus-TTS
93.89%1,9321,814118Qwen/Qwen3-TTS-Voice-Design
88.31%9,7578,6161,141coqui/xtts
88.16%8,5677,5531,014innoai/Edge-TTS
86.17%1,8441,589255OpenMOSS-Team/MOSS-TTS
85.83%6,5935,659934ResembleAI/Chatterbox
81.33%3,2302,627603fishaudio/fish-speech-1
80.73%5,4334,3861,047parler-tts/parler_tts
80.26%1,7681,419349Svngoku/maskgct-audio-lab
79.66%6,4855,1661,319Qwen/Qwen3-TTS
79.40%3,0102,390620parler-tts/parler_tts/large
79.35%2,7702,198572ByteDance/MegaTTS3
78.74%3,1042,444660smallest-ai-tts-lightning v3.1
77.05%3,1112,397714parler-tts-expresso
76.01%792602190srinivasbilla/llasa-8b-tts
75.27%2,3861,796590fishaudio/openaudio-s1-mini
74.73%1,7891,337452lj1995/GPT-SoVITS-v2
74.44%1,7881,331457sesame/csm-1b
73.87%4,1453,0621,083srinivasbilla/llasa-3b-tts
73.52%2,7762,041735Pendrokar/style-tts-2
73.17%1,189870319Steveeeeeeen/Zonos
72.67%2,4991,816683IndexTeam/IndexTTS
72.05%1,7211,240481Steveeeeeeen/Zonos/hybrid
71.08%2,8152,001814thunnai/SparkTTS
68.07%1,331906425OuteAI/OuteTTS-0.3-1B-Demo
67.37%16,41611,0595,357mrfakename/E2-F5-TTS(F5-TTS)
65.01%623405218nineninesix/KaniTTS
63.59%4,1672,6501,517CAMB-AI/mars6-turbo-demo
59.81%6,8604,1032,757ResembleAI/chatterbox-turbo-demo
56.33%774436338Flux9665/EnglishToucan
55.51%780433347nineninesix/kanitts-2-en
50.10%1,024513511collabora/WhisperSpeech
48.79%1,818887931Pendrokar/xVASynth-TTS
48.43%762369393LeeSangHoon/HierSpeech_TTS
47.63%674321353PHBJT/multi_parler_tts
43.66%820358462Pendrokar/xVASynth-TTS/NoDeepMoji
40.74%815332483HKUST-Audio/Llasa-1B-ft-two-speakers
40.64%1,181480701ameerazam08/OuteTTS-0.2-500M-Demo
27.54%5,9761,6464,330lj1995/GPT-SoVITS-ProPlus

解读:Kokoro 系在"单说话人 Arena"里是最强的一档(与该 Arena 的历史结论一致);GPT-SoVITS 的两个变体差距极大(v2 74.7% vs ProPlus 27.5%,ProPlus 有 4330 次被淘汰,是这个 Arena 里最弱的主流模型之一);MegaTTS3 79.4% 反而高于 F5-TTS 67.4%。这与科技媒体上常见的排名直觉相反,很可能因为该 Arena 是英文单句朗读(见下),而 ProPlus 版本是中文向微调。

旁证(Kokoro 官方模型卡,经 Replicate 转载):https://replicate.com/kjjk10/kokoro-82m/readme

"In the weeks leading up to its release, Kokoro v0.19 was the #1🥇 ranked model in TTS Spaces Arena. Kokoro achieved higher Elo in this single-voice Arena setting over other models, using fewer parameters and less data: Kokoro v0.19: 82M params, Apache, trained on <100 hours of audio; XTTS v2: 467M, CPML, >10k hours; Edge TTS: Microsoft, proprietary; MetaVoice: 1.2B, Apache, 100k hours; Parler Mini: 880M, Apache, 45k hours; Fish Speech: ~500M, CC-BY-NC-SA, 1M hours."

(注意措辞:"single-voice Arena",即 单说话人 榜单。这是 [第三方-引用]/厂商模型卡转述。)

1.4 ❌ 不能用的"2026 快照":tensorfeed 聚合文件


2. Artificial Analysis —— 2026 年唯一可抓取的完整第三方 TTS Elo 榜

抓取 URL(均实际抓取,2026-09-22):

榜单口径(页面原文,[第三方]):

页面内嵌 FAQ(JSON-LD,[第三方],可直接引用):

  • "Sonic 3.6 currently leads the Text to Speech Arena with an Elo score of 1272."
  • Top 5:1. Sonic 3.6 (1272)、2. Qwen-Audio-3.0-TTS-Plus (1260)、3. Realtime TTS-2 (1245)、4. Simba 3.2 (1237)、5. Luna TTS (1230)。
  • "Kokoro 82M v1.0 is the most affordable at $0.65 per 1M characters with an Elo score of 1061. Other affordable options include StyleTTS 2 at $2.82 per 1M characters."
  • "Breeze TTS 2 is the highest-ranked open weights model on the Text to Speech Leaderboard with an Elo score of 1204. There are 16 open weights models out of 90 total."
  • "The top 5 open weights Text to Speech models are: 1. Breeze TTS 2 (Elo 1204), 2. Fish Audio S2 Pro (Elo 1121), 3. Step Audio EditX (Mar 2026) (Elo 1094), 4. Voxtral TTS (Elo 1075), and 5. Magpie-Multilingual 357M (Feb 2026) (Elo 1063)."

2.1 全部 16 个开源权重模型(Provider Voice Arena,英文 US&UK,All categories)

数据来自页面内嵌 payload 中每个模型的默认视图行(同一模型在页面上有多个筛选切片的 Elo,我取默认视图那一条),含 95% 置信区间与投票出现次数:

EloCI95appearances模型权重来源 URL(页面内 openWeightsUrl)
1204.031188–12201,374Breeze TTS 2 (BreezeBlue, 2026-08-23)https://huggingface.co/BreezeBlue/Breeze-TTS-2
1121.031108–11342,205Fish Audio S2 Pro (Fish Audio, 2026-03-10, 4B)https://huggingface.co/fishaudio/s2-pro
1093.76——Step Audio EditX (Mar 2026) (StepFun)https://huggingface.co/stepfun-ai/Step-Audio-EditX
1075.061062–10882,028Voxtral TTS (Mistral, 2026-03-26)https://huggingface.co/mistralai/Voxtral-4B-TTS-2603
1062.54——Magpie-Multilingual 357M (Feb 2026) (NVIDIA)https://huggingface.co/nvidia/magpie_tts_multilingual_357m
1060.981050–10725,224Kokoro 82M v1.0 (Kokoro, 2025-01-27)https://huggingface.co/hexgrad/Kokoro-82M
1040.561021–10611,681OpenAudio S1 Mini (Fish Audio, 2025-06-03)https://huggingface.co/fishaudio/s1-mini
1039.88——Maya1 (Maya Research)https://huggingface.co/maya-research/maya1
1032.151018–10461,957Higgs Audio V3 TTS (Boson AI, 2026-06-04, 4B)https://huggingface.co/bosonai/higgs-audio-v3-tts-4b
1020.541009–10334,595Chatterbox (Resemble AI, 2025-05-28)https://github.com/resemble-ai/chatterbox
1000.001000–10004,792Zonos-v0.1 (Zyphra, 2025-02-10)https://github.com/Zyphra/Zonos
950.85——VibeVoice 1.5B (Microsoft)https://huggingface.co/microsoft/VibeVoice-1.5B
946.34932–9602,959OpenVoice v2 (2024-04-01)https://huggingface.co/myshell-ai/OpenVoiceV2
913.81899–9292,514XTTS v2 (Coqui, 2023-11-08)https://huggingface.co/coqui/XTTS-v2
891.24876–9062,424StyleTTS 2 (2023-06-13)https://github.com/yl4579/StyleTTS2
842.56——MetaVoice v1https://github.com/metavoiceio/metavoice-src

2.2 相关闭源条目(同一默认视图,共 90 行中的关键项)

rankEloCI95appearances模型厂商
01271.981255–12891,740Sonic 3.6Cartesia
11260.381243–12771,438Qwen-Audio-3.0-TTS-PlusAlibaba(页面 url 为 /text-to-speech/model-families/cosyvoice-tts,即归入 CosyVoice 家族;openWeights: false)
21244.941227–12631,229Realtime TTS-2Inworld
31236.881223–12512,381Simba 3.2Speechify
41230.201216–12442,502Luna TTSVUI Labs
71198.971182–12161,262StepAudio 2.5 TTS (Aug 2026)StepFun
81198.861187–12113,415Gemini 3.1 Flash TTSGoogle
181137.901125–11512,147Fish Audio S2.1 ProFish Audio
301096.351083–11092,295Chatterbox HDResemble AI
76940.30——Qwen3 TTS FlashAlibaba(closed)
79925.98913–9392,854Qwen3 TTSAlibaba(closed)

榜上没有的(关键空缺,未查到):IndexTTS / IndexTTS-2 / IndexTTS-2.5、CosyVoice 2/3 的开源权重版、GPT-SoVITS、ChatTTS、F5-TTS、MegaTTS3、Spark-TTS、GLM-TTS、FireRedTTS-2、OmniVoice、MOSS-TTS、VoxCPM2、Fish-Speech 的 v1.x 开源版。

注:AA 页面的 Controlled Voice Arena(同样 8 个克隆音色)也内嵌在同一页 payload 中,但我抓到的 payload 里同一模型存在 ~12 个不同的筛选切片 Elo(按 类别×口音 切分),无法确定哪一条是"总榜",因此本报告不引用该板的数字,以免误标。若要引用,必须补抓该板页面并确认筛选状态。


3. 2026 年的其他第三方对比 / 基准

3.1 VoiceHub Arena —— 独立、大规模、可复现的英文 Seed-TTS-Eval 实测(★最有价值)

来源:[第三方] 独立研究者 kadirnar 的 VoiceHub Arena,不隶属任何 TTS 厂商。

协议(README 原文,条件非常明确):

完整 33 模型榜(leaderboard.csv,按 WER 升序;我把小数换算成 %)

#模型checkpointscoredWER%↓CER%↓exact_match%RTF峰值显存 MiB
1Kokorohexgrad/Kokoro-82M10880.96290.244091.360.019478
2SupertonicSupertone/supertonic-310880.97970.266390.990.064419
3OmniVoicek2-fsa/OmniVoice10880.98800.264891.540.3293,229
4SpeechT5microsoft/speecht5_tts10881.01310.294690.630.162726
5F5-TTSF5TTS_v1_Base10881.05500.319990.900.7821,516
6StyleTTS2styletts2 epochs_2nd_0002010881.08850.299190.440.0421,068
7EchoTTSjordand/echo-tts-base10881.12200.348290.350.5729,363
8FishTTS (S2 Pro)fishaudio/s2-pro10881.14710.316989.713.74314,653
9XTTSartifacts/xtts210881.17220.392889.800.3772,045
10Zonos2Zyphra/ZONOS210881.18060.421190.356.22815,766
11ChatterboxResembleAI/chatterbox10881.23080.352688.510.8223,244
12MOSS-TTSOpenMOSS-Team/MOSS-TTS-v1.510881.23080.431590.811.39025,009
13OuteTTSLlama-OuteTTS-1.0-1B10881.23920.437489.343.1654,374
14VibeVoicemicrosoft/VibeVoice-Realtime-0.5B10881.31460.415188.240.6212,034
15Qwen3-TTSQwen3-TTS-12Hz-1.7B-CustomVoice10881.38160.438988.331.7704,351
16NeuTTSneuphonic/neutts-2e10881.47370.620488.881.7043,476
17CosyVoice 3(修正后)artifacts/cosyvoice3(=Fun-CosyVoice3-0.5B-2512 base llm.pt)10881.74160.623485.480.7033,430
18HiggsTTSbosonai/higgs-tts-2-3b-base10881.74160.671085.941.17211,947
19InflectTTSowensong/Inflect-Micro-v210881.75840.589285.660.014174
20OrpheusTTScanopylabs/orpheus-3b-0.1-ft10882.00120.769283.732.5836,410
21ZonosZyphra/Zonos-v0.1-transformer10882.30260.964180.241.7684,145
22GPT-SoVITSlj1995/GPT-SoVITS10882.63750.870482.260.322764
23MeloTTSEN10882.63751.065377.670.020507
24ParlerTTSparler-tts-mini-v110882.65431.446280.791.8774,507
25CSMsesame/csm-1b10882.67101.487880.882.2534,331
26VoxCPMopenbmb/VoxCPM210883.34922.599283.640.8745,568
27OpenVoicemyshell-ai/OpenVoiceV210883.68421.590572.060.042753
28Vitsfacebook/mms-tts-eng10886.22962.673660.850.036162
29Barksuno/bark-small10887.73674.964964.611.3511,867
30ConversationTTSartifacts/conversationtts10888.71648.247076.562.6724,321
31Vuivui-abraham-100m.pt108812.14948.397349.630.4123,021
32Dianari-labs/Dia-1.6B-0626108867.353359.282645.223.1899,101
33LlasaHKUSTAudio/Llasa-1B-Multilingual108873.993151.43433.130.8675,498

质量审计(README 原文,重要):

"CosyVoice is Fun-CosyVoice3-0.5B-2512, base llm.pt. The archived 13.82% WER is affected by a confirmed HiFT implementation defect and is excluded from ranking. The corrected full 1,088-text evaluation is verified: WER 1.7416%, CER 0.6234%." "Llasa and Dia remain under quality review after independent LM/codec checks." "Dia and Llasa have high error rates with unresolved root causes."

同一 33 模型榜里没有的:ChatTTS、MegaTTS3、IndexTTS、Spark-TTS、GLM-TTS、FireRedTTS-2(→ 这几个在该英文基准上 未查到)。

3.2 VoiceHub 的第二个 campaign:带 WavLM speaker SIM / DNSMOS / UTMOS22

我实际抓取并聚合的 4 个 full-run(1088 条英文 Seed-TTS-Eval,全部 evaluated=1088, generation_failures=0):

实验repoWERCERexact_matchDNSMOS-OVRLUTMOS22WavLM SIMRTF峰值显存
omnivoice--voice_clonek2-fsa/OmniVoice1.0718%0.2782%90.81%3.19333.91320.7385 (n=1088, CI 0.7341–0.7428)0.2232,207 MiB
f5tts--voice_cloneSWivid/F5-TTS1.2643%0.3853%88.69%3.07833.70260.6691 (n=1088, CI 0.6643–0.6744)0.606781 MiB
kokoro--preset_voicehexgrad/Kokoro-82M0.9462%0.2410%91.45%3.42674.5037N/A(无参考音频)0.042480 MiB
vibevoice--preset_voice_streammicrosoft/VibeVoice-Realtime-0.5B1.3481%0.4538%87.78%3.33814.4490N/A(无参考音频)0.6292,912 MiB

⚠️ 注意:同一模型在 3.1 的长表与 3.2 的 campaign 里 WER 略有差异(如 Kokoro 0.9629% vs 0.9462%,OmniVoice 0.9880% vs 1.0718%),因为两个 campaign 是不同的运行批次/方法契约;引用时须带 campaign 名。 另外 README 特别警告:native-ada-20260916 里的 8 条文本 pilot 分数不得当作 full 分数(我下载的 native-comparison.csv 18 行全部是 pilot,故不引用其数值)。

3.3 SwanBench-Speech —— 第三方学术长语音基准(浙江大學 + ByteDance)

3.4 中文第三方实测/文章(含可信度评价)

(a) 博客园 sensorsen《语音模型 2026 开源 TTS 选型指南:六款主流语音合成模型实测对比》(2026) [第三方](个人博客,非严谨实测) URL:https://www.cnblogs.com/sensorsen/p/21367537

(b) CSDN《和GPT-SoVITS比如何?两款热门中文TTS横向对比》(2026-05-28) [第三方,低可信/AI 生成痕迹明显] URL:https://blog.csdn.net/weixin_42602241/article/details/156922929

(c) 博客园 kacoro《tts哪家强?》(2025-07-10) [第三方](真实使用日志) URL:https://www.cnblogs.com/kacoro/p/18977125

(d) 腾讯云开发者社区《我们把 Kokoro 1.1 量化到 FP16,并用它替换了浏览器里的中文 Piper 配音》(2026-08-08) [第三方] URL:https://cloud.tencent.cn/developer/article/2722884

(e) SiliconFlow《终极指南 — 2026年最佳开源 Text-to-Speech 模型》 [厂商内容营销] URL:https://www.siliconflow.com/zh/articles/best-open-source-text-to-speech-models

(f) 中文 Arena 的公开数据(未被充分利用的线索) [第三方原始数据]

3.5 英文第三方对比文章

(a) The AI Bench — "Best local AI voice models in 2026"(VERIFIED SEPTEMBER 2026) [第三方] URL:https://theaibench.ai/use-cases/voice/

(b) Sovereign AI Blog(2026-05-12) [第三方] — 见 1.2 来源 A;另有重要的工程现实结论:

(c) Pinggy / Replicate 等其他英文页:https://pinggy.io/blog/best_open_source_self_hosted_text_to_speech_models/(本轮未抓取正文);https://replicate.com/kjjk10/kokoro-82m/readme(已抓,见 1.3)


4. SeedTTS test-zh / test-en 的 WER/CER 与 SIM-o / SIM-r 数字

先给结论(针对指定的 4 个老模型):

  • GPT-SoVITS:Seed-TTS test-zh/test-en 的 WER/SIM 未查到;只查到 CV3-eval 上的 ZH-CER 7.34% / EN-WER 12.5%(VoxCPM 论文,见 4.1);另有 VoiceHub 的英文 WER 2.6375%/CER 0.8704%(见 3.1)。
  • MegaTTS3:厂商论文给的是 LibriSpeech-PC 的 SIM-O / WER(英文,非 SeedTTS);SeedTTS 口径的 EN-WER 2.79 / EN-SIM 77.1 / ZH-CER 1.52 / ZH-SIM 79.0 来自他人论文的转引表(见 4.1、4.2)。
  • Kokoro:SeedTTS 的 WER/CER/SIM-o 未查到(Kokoro 无官方论文);最接近的是 VoiceHub 的英文 Seed-TTS-Eval WER 0.9629%(见 3.1)与 KaniTTS 的英文 MOS/WER/CER(见 4.4)。
  • ChatTTS:SeedTTS 的 WER/CER/SIM 完全未查到(本轮在所有抓取的论文表格中都没有出现 ChatTTS)。

4.1 VoxCPM 论文(OpenBMB)—— 含 MegaTTS3 与 GPT-Sovits 的两张关键表 [厂商自评](论文作者是 VoxCPM 方)

URL:https://arxiv.org/html/2509.24650v1(arXiv 2509.24650,标题 VoxCPM: Tokenizer-Free TTS for Context-Aware Speech Generation and True-to-Life Voice Cloning)

Table 3: Performance on Seed-TTS-eval Benchmark(原文表头:Model | Params | Open-Source | EN WER↓ SIM↑ | ZH CER↓ SIM↑ | Hard CER↓ SIM↑) 所有 SIM 为百分数(0-100),与其它论文的 0-1 口径不同,注意换算:

ModelParamsOSEN-WER↓EN-SIM↑ZH-CER↓ZH-SIM↑Hard-CER↓Hard-SIM↑
MegaTTS3 (Jiang et al., 2025)0.5B✗2.7977.11.5279.0––
DiTAR0.6B✗1.6973.51.0275.3––
CosyVoice3 (0.5B)0.5B✗2.0271.81.1678.06.0875.8
CosyVoice3 (1.5B)1.5B✗2.2272.01.1278.15.8375.8
Seed-TTS–✗2.2576.21.1279.67.5977.6
MiniMax-Speech–✗1.6569.20.8378.3––
F5-TTS0.3B✓2.0067.01.5376.08.6771.3
MaskGCT–✓2.6271.72.2777.4––
CosyVoice0.3B✓4.2960.93.6372.311.7570.9
CosyVoice20.5B✓3.0965.91.3875.76.8372.4
SparkTTS0.5B✓3.1457.31.5466.0––
FireRedTTS0.5B✓3.8246.01.5163.517.4562.1
FireRedTTS-2–✓1.9566.51.1473.6––
Qwen2.5-Omni7B✓2.7263.21.7075.27.9774.7
OpenAudio-s1-mini0.5B✓1.9455.01.1868.523.3764.3
IndexTTS 21.5B✓2.2370.61.0376.57.1275.5
VibeVoice1.5B✓3.0468.91.1674.4––
HiggsAudio-v23B✓2.4467.71.5074.055.0765.6
VoxCPM-Emilia0.5B✓2.3468.11.1174.012.4669.8
VoxCPM0.5B✓1.8572.90.9377.28.8773.0

Table 4: Performance on CV3-eval Benchmark(*denotes close-sourced systems)——这是唯一找到的 GPT-Sovits 数字:

ModelCV3-EVAL ZH-CER↓CV3-EVAL EN-WER↓CV3-Hard-ZH CER↓SIM↑DNSMOS↑CV3-Hard-EN WER↓SIM↑DNSMOS↑
F5-TTS5.478.90––––––
SparkTTS5.1511.0––––––
GPT-Sovits7.3412.5––––––
CosyVoice24.086.3212.5872.63.8111.9666.73.95
OpenAudio-s1-mini4.005.5418.158.23.7712.455.73.89
IndexTTS23.584.4512.874.63.658.7874.53.80
HiggsAudio-v29.547.8941.060.23.3910.361.83.68
CosyVoice3-0.5B*3.895.2414.1578.63.759.0475.93.92
CosyVoice3-1.5B*3.914.999.7778.53.7910.5576.13.95
VoxCPM-Emilia4.475.2322.262.63.4710.0062.63.68
VoxCPM3.404.0412.966.13.597.8964.33.74

口径警告:CV3-eval 的 CER 数值(4~8%)远高于 Seed-TTS-eval test-zh 的 CER(1~2%),两套测试集的正文长度/难度不同。不能用 CV3-eval 的 7.34% 去和 test-zh 的 1.5% 对比。

4.2 MegaTTS3 官方论文(S-DiT)—— 厂商自评,英文 LibriSpeech-PC [厂商自评]

URL:https://arxiv.org/html/2502.18924v1(标题 Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis,即 MegaTTS3 / S-DiT)

主表(Table 5,英文 LibriSpeech-PC 类测试集):

Model#ParamsTraining DataSIM-O↑SIM-R↑WER↓CMOS↑SMOS↑RTF↓
GT––0.68–1.94%+0.123.92–
VALL-E 2*0.4BLibriHeavy0.640.682.44%–––
VoiceBox†0.4BCollected (60kh)0.640.672.03%−0.203.810.340
DiTTo-TTS*0.7BCollected (55kh)0.620.652.56%–––
NaturalSpeech 3†0.5BLibriLight0.670.761.81%−0.103.950.296
CosyVoice0.4BCollected (172kh)0.62–2.24%−0.183.931.375
MaskGCT1.0BEmilia (100kh)0.69–2.63%–––
F5-TTS0.3BEmilia (100kh)0.66–1.96%−0.123.960.307
S-DiT(=MegaTTS3)0.3BLibriLight0.710.781.82%0.003.980.188
S-DiT-accelerated0.3BLibriLight0.700.781.86%−0.033.960.124

其余表(同一论文):Table 6 SIM-O 0.70 / WER 2.31%;Table 11 Ours 0.71 / 1.82%;Table 12 规模消融(0.5B: SIM-O 0.66 / WER 2.10%;1.5B: 0.72 / 1.98%;7.0B: 0.74 / 1.90%);Table 14 长文本 WER 2.39%(vs CosyVoice 5.52%、VoiceCraft 12.81%)。

4.3 第三方论文转引的 MegaTTS3(SeedTTS 口径)

(a) RobustSpeechFlow(arXiv 2605.22083)的 Table 7 [第三方学术] URL:https://arxiv.org/html/2605.22083v1(RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching)

表头:Model | Params | WER↓ | SIM↑ MegaTTS3 [23] | 0.5B | 2.79 | 0.77;Seed-TTS DiT [21] | – | 1.73 | 0.79;DiTAR [5] | 0.6B | 1.69 | 0.74;MiniMax-Speech [24] | – | 1.65 | 0.69;F5-TTS [2] | 0.3B | 2.00 | 0.67;CosyVoice3 [25] | 1.5B | 2.22 | 0.72;Spark-TTS [26] | 0.5B | 3.14 | 0.57;OpenAudio S1-Mini [27] | 0.5B | 1.94 | 0.55;IndexTTS2 [28] | 1.5B | 2.23 | 0.71;VibeVoice [7] | 1.5B | 3.04 | 0.69;VoxCPM-Emilia [6] | 0.5B | 2.34 | 0.68;VoxCPM [6] | 0.5B | 1.85 | 0.73

(b) WavTTS(arXiv 2606.03455)Table 10 —— Seed-TTS test-en / test-zh [第三方学术] URL:https://arxiv.org/html/2606.03455v1(WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling) 表头:Model | Params | Data(hrs) | Seed-TTS test-en: WER%↓ SIM-o↑ UTMOS↑ | Seed-TTS test-zh: CER%↓ SIM-o↑ UTMOS↑

ModelParamsDataen WER%en SIM-oen UTMOSzh CER%zh SIM-ozh UTMOS
Ground Truth––1.790.733.531.250.752.78
CosyVoice416M170K Multi.4.290.61–3.630.72–
CosyVoice 2618M167K Multi.2.570.65–1.450.75–
Llasa-1B1370M250K Multi.3.220.57–1.890.67–
Spark-TTS507M102K Multi.1.980.58–1.200.67–
MaskGCT1048M100K Emilia2.360.713.572.480.772.64
E2-TTS333M100K Emilia2.210.713.201.970.732.27
F5-TTS336M100K Emilia1.650.663.731.550.752.94
ZipVoice123M100K Emilia1.600.703.831.400.753.15
LongCat-AudioDiT1420M100K Multi.1.940.763.801.100.813.16
WavTTS673M100K Emilia1.500.653.921.590.733.08

(无 GPT-SoVITS / MegaTTS3 / Kokoro / ChatTTS)

(c) CaT-TTS(arXiv 2509.22062)Table 11 [第三方学术] URL:https://arxiv.org/html/2509.22062v1(Comprehend and Talk: Text to Speech Synthesis via Dual Language Modeling) 表头 Model | test-zh WER%↓ SIM↑ | test-en WER%↓ SIM↑ | test-hard WER%↓ SIM↑:

Modelzh WER%zh SIMen WER%en SIMhard WER%hard SIM
MaskGCT2.270.7742.620.71410.270.748
E2 TTS (32 NFE)1.970.7302.190.710––
F5-TTS (32 NFE)1.560.7411.830.6478.670.713
Seed-TTS1.120.7962.250.7627.590.776
FireRedTTS1.510.6353.820.46017.450.621
CosyVoice3.630.7234.290.60911.750.709
CosyVoice 21.450.7482.570.6526.830.724
CosyVoice 3-0.5B1.160.7802.020.7186.080.758
QTTS1.660.6483.170.65214.450.641
Spark-TTS1.200.6721.980.584––
Llasa-1B/3B/8B-250k1.89/1.60/1.590.668/0.675/0.6843.22/3.14/2.970.572/0.579/0.57412.13/13.37/11.090.638/0.652/0.660
CaT-TTS1.560.6782.350.6689.750.674

(无 GPT-SoVITS / MegaTTS3 / Kokoro / ChatTTS)

4.4 Kokoro 专项

model(Kokoro 英文音色)nMOSUTMOSWERCER
kokoro_82m_en_am_fenrir7204.9863.7600.0130.005
kokoro_82m_en_af_heart7204.9813.7590.0130.004
kokoro_82m_en_am_michael7204.9233.8140.0120.004
kokoro_82m_en_af_bella7204.5383.1220.0100.004
kokoro_82m_en_bf_emma7204.4533.5010.0120.004

(MOS ≈ 4.45–4.99 偏高,疑似非严格人工 MOS;WER/CER 为比例值,×100 即百分数:1.0–1.3% WER、0.4–0.5% CER。注意这是英文。)

4.5 其它厂商自评表(不满足"第三方"要求,但含关键竞品横排,供交叉验证)

(a) CosyVoice README 官方表(Alibaba FunAudioLLM) [厂商自评] URL:https://raw.githubusercontent.com/FunAudioLLM/CosyVoice/main/README.md 表头:Model | Open-Source | Size | test-zh CER%↓ SS%↑ | test-en WER%↓ SS%↑ | test-hard CER%↓ SS%↑

ModelOSSizetest-zh CERtest-zh SStest-en WERtest-en SStest-hard CERtest-hard SS
Human––1.2675.52.1473.4––
Seed-TTS❌–1.1279.62.2576.27.5977.6
MiniMax-Speech❌–0.8378.31.6569.2––
F5-TTS✅0.3B1.5274.12.0064.78.6771.3
Spark TTS✅0.5B1.266.01.9857.3––
CosyVoice2✅0.5B1.4575.72.5765.96.8372.4
FireRedTTS2✅1.5B1.1473.21.9566.5––
Index-TTS2✅1.5B1.0376.52.2370.67.1275.5
VibeVoice-1.5B✅1.5B1.1674.43.0468.9––
VibeVoice-Realtime✅0.5B––2.0563.3––
HiggsAudio-v2✅3B1.5074.02.4467.7––
VoxCPM✅0.5B0.9377.21.8572.98.8773.0
GLM-TTS✅1.5B1.0376.1––––
GLM-TTS RL✅1.5B0.8976.4––––
Fun-CosyVoice3-0.5B-2512✅0.5B1.2178.02.2471.86.7175.8
Fun-CosyVoice3-0.5B-2512_RL✅0.5B0.8177.41.6869.55.4475.0

(无 GPT-SoVITS / MegaTTS3 / Kokoro / ChatTTS)

(b) IndexTTS 官方 README(bilibili) [厂商自评] URL:https://raw.githubusercontent.com/index-tts/index-tts/main/README.md(同表亦可从 https://raw.githubusercontent.com/T8mars/indextts25-desktop-t8/main/README.md 得到同内容并含 Table 2)

"Table 1: Zero-shot TTS on CV3-Eval (Arabic uses an in-house test set). †Cited from the original paper."

ModelParamszh WER%zh SS%en WER%en SS%es WER%es SS%ja WER%ja SS%ar WER%ar SS%Avg WER%Avg SS%
VoxCPM22B3.8874.995.1371.575.4974.676.6972.9014.9465.997.2272.02
OmniVoice0.8B3.4172.993.6270.133.5274.145.3870.4917.8864.226.7670.39
Moss-TTS 1.58B4.0272.684.4567.463.8371.7510.9768.7123.7162.219.4068.56
CosyVoice3-0.5B0.5B3.8480.014.8874.164.0478.85–76.36––––
CosyVoice3-1.5B1.5B3.91†–4.99†–4.47†–7.57†–––––
FireRedTTS-21.5B8.2268.1014.9256.93––––––––
Fish Audio S2 Pro4B3.6267.793.8361.662.9367.445.1566.1514.1559.435.9464.49
Qwen3-TTS1.7B3.2773.025.0667.172.8773.175.8970.18––––
IndexTTS2.50.8B4.3677.105.1268.063.7576.395.6674.6214.8869.746.7573.18
IndexTTS2.5-RL0.8B3.9377.923.8967.793.3376.685.3075.4113.5870.366.0073.63

Table 2(跨语言,中文 prompt → 目标语言)关键行:OmniVoice zh→en WER 3.74 / SS 64.91;zh→es 5.84 / 62.08;zh→ja 9.09 / 69.06;zh→ar 19.80 / 65.27;平均 9.62 / 65.33。IndexTTS2.5-RL 平均 6.17 / 70.20。 (注:这套表是 IndexTTS 团队做的,把 OmniVoice / VoxCPM2 / CosyVoice3 / Fish S2 Pro / Qwen3-TTS 都排了进去 → 属于厂商对比,不是第三方中立评测;其中带 † 的来自原论文,其余应为该团队自测。)

(c) VoxCPM 官方 README(含 zh 版) [厂商自评] — URL:https://raw.githubusercontent.com/OpenBMB/VoxCPM/main/README.md 提供 Seed-TTS-eval 表(VoxCPM2 2B:zh 1.84 / SIM 75.3;en 0.97 / SIM 79.5;hard 8.13 / 75.3;FishAudio S2 4B:zh 0.99、en 0.54;LongCat-Audio-DiT 3.5B:zh 1.50 / SIM 78.6、en 1.09 / 81.8;Qwen3-TTS 1.7B:zh 1.23、en 1.22;MOSS-TTS:zh 1.85 / SIM 73.4、en 1.20 / 78.8) 及 CV3-eval 多语表(VoxCPM2: zh 3.65 / en 5.00 / hard-zh 8.55 / hard-en 8.48;Fish Audio S2: 2.65 / 2.43 / 9.10 / 4.40) 及 MiniMax-Multilingual-Test(Chinese: FishAudio S2 0.730、Qwen3-TTS 0.928、VoxCPM2 1.136、MiniMax 2.252、ElevenLabs 16.026)

(d) OmniVoice README(k2-fsa) [厂商自评] — URL:https://raw.githubusercontent.com/k2-fsa/OmniVoice/main/README.md

(e) Fish Speech README(fishaudio) [厂商自评] — URL:https://raw.githubusercontent.com/fishaudio/fish-speech/main/README.md


5. sm_120 / Blackwell / RTX 50 系(含 5060 Ti 16GB)兼容性实况

5.1 结论速查表(全部有 URL 证据)

框架是否需 flash-attnsm_120 现成 wheel?已知报错(原文)可行 workaround证据 URL
GPT-SoVITS否(核心路径不用)是(用 cu128 官方 torch wheel 即可)NVIDIA GeForce RTX 5070 Ti with CUDA capability sm_120 is not compatible with the current PyTorch installation. The current PyTorch install supports CUDA capabilities sm_37 sm_50 sm_60 sm_61 sm_70 sm_75 sm_80 sm_86 sm_90 compute_37;RuntimeError: "no kernel image is available" on new NVIDIA GPUs (e.g., RTX 5090 / sm_120);5060 Ti 上 s2_train.py 的 mp.spawn 报错换 cu128 的 torch(≥2.7);整合包自带旧 torch 是根因。另有 PR #2774「Fix s1_train DDP crash on Windows single-GPU (sm_120 / Blackwell)」见 5.2
CosyVoice / Fun-CosyVoice3否(官方路径用 SDPA;有 triton-TRTLLM 可选)是Error A: 'torch.distributed_c10d.ProcessGroup' object has no attribute 'options'(torch 2.4+ 移除);Error B(按 requirements 降到 torch 2.3.1 时):NVIDIA GeForce RTX 5060 Ti with CUDA capability sm_120 is not compatible with the current PyTorch installation (supports up to sm_90). Note: RTX 50-series cards require modern CUDA toolkits and PyTorch versions not covered by the current requirements.;Error C: ERROR: Cannot install hyperpyyaml==1.2.2 and ruamel.yaml<=0.17.21 because these package versions have conflicting dependencies升级到 torch 2.7/2.8+cu128,不要按老 requirements 降级;ruamel.yaml 冲突需手工解https://github.com/QwenAudio/CosyVoice/issues/1815
ChatTTS(jianchang512/ChatTTS-ui 整合包)否是(但整合包内置旧 torch)NVIDIA GeForce RTX 5070 Ti with CUDA capability sm_120 is not compatible with the current PyTorch installation…(整合包换 50 系卡后运行 app.exe 即报)换掉整合包内 torch 为 cu128 版https://github.com/jianchang512/ChatTTS-ui/issues/290
Fish-Speech / Fish Audio S2 Pro是(上游配方在 sm_120 会坏)需用预置容器"the standard way to add S2-Pro's DAC codec to it breaks on new RTX 5090 / RTX PRO 6000 Blackwell cards (FlashAttention-3 ships kernels only for Hopper sm90a / Blackwell-Ultra sm120a, and SGLang is blocked on sm_120)"第三方项目 Genesis1231/fish-s2-rtx:容器 pinned 到 vLLM-Omni 0.22 的 torch 2.11 + cu130 + sm_120 kernels;另注"Prefix caching is intentionally off — it intermittently produces empty audio in vLLM-Omni 0.22"https://github.com/Genesis1231/fish-s2-rtx
index-tts / IndexTTS2未查到确切结论–有 issue「能用RTX50系显卡跑吗?」(#242,本轮抓取超时,正文未取得 → 未查到);另有 torch.AcceleratorError: CUDA error: operation not permitted when stream is capturing (#677)未查到issue 列表来自 GitHub 搜索 API 结果:https://github.com/index-tts/index-tts/issues/242(正文未获取)
flash-attn(通用)—有可用的免编译组合"many people struggle with building (or installing) flash attention"实测可行:Python=3.10 + CUDA=12.8 + torch 2.7.1(pip install torch==2.7.1 torchvision==0.22.1 torchaudio==2.7.1 --index-url https://download.pytorch.org/whl/cu128)然后 pip install flash_attn==2.8.0.post2 torch==2.7.1 --no-build-isolationhttps://github.com/Dao-AILab/flash-attention/issues/2016
F5-TTS––未查到(sneekes.app 的 "F5-TTS Installation Guide for RTX 5070 on WSL2" 两次抓取均超时,正文未取得)未查到线索 URL(未成功抓取,不得引用其内容):https://sneekes.app/posts/f5-tts-installation-guide-for-rtx-5070-on-wsl2/
MegaTTS3 / MOSS-TTS––未查到未查到—

5.2 GPT-SoVITS 细节(逐个 issue)

5.3 其他 Blackwell 相关实况


6. 明确"未查到"的项(供后续补做)

  1. TTS Arena V2 的原始 Elo 榜单页(HF Space 被镜像拒绝;本网络无法读取)——只有第三方转述(Fish Audio S2 Pro 1128)。
  2. Chinese / 中文 Arena 的正式排名——只有 JacobLinCool/zh-tw-tts-arena-votes 的原始 jsonl(未统计)。
  3. ChatTTS 的任何 SeedTTS WER/CER/SIM 数字(本轮所有抓取的论文表、benchmark 表中均无 ChatTTS)。
  4. Kokoro 的 test-zh CER / SIM-o(Kokoro 无官方论文;第三方 benchmark 只覆盖英文)。
  5. GPT-SoVITS 的 SeedTTS test-zh CER / test-en WER 正式数字(只有 CV3-eval 口径的 7.34 / 12.5)。
  6. MegaTTS3 的 SeedTTS test-zh SIM-o 原始出处(只有 VoxCPM 论文与 RobustSpeechFlow 的转引)。
  7. F5-TTS 在 RTX 5070 上的安装实录(sneekes.app 两次抓取超时)。
  8. index-tts issue #242「能用RTX50系显卡跑吗?」正文(两次抓取超时)→ IndexTTS 在 sm_120 上的实测结论缺口。
  9. MOSS-TTS / MegaTTS3 / GLM-TTS 的 sm_120 记录。
  10. SwanBench-Speech 的逐模型分数表(HTML 中表格未以可解析文本呈现)。

7. 来源清单(本文实际抓取过的全部 URL)

7.1 TTS Arena / 榜单

  1. https://hf-mirror.com/spaces/TTS-AGI/TTS-Arena-V2(镜像拒绝页)
  2. https://hf-mirror.com/spaces/TTS-AGI/TTS-Arena-V2/raw/main/README.md(176 B)
  3. https://huggingface.co/spaces/TTS-AGI/TTS-Arena-V2(官方域名,超时不可达)
  4. https://ttsarena.org、https://ttsarena.org/leaderboard、https://ttsarena.org/api/leaderboard(均为静态 TTS-AGI 项目页)
  5. https://docs.ttsarena.org
  6. https://github.com/TTS-AGI/TTS-Arena
  7. https://raw.githubusercontent.com/TTS-AGI/TTS-Arena/main/README.md
  8. https://artificialanalysis.ai/text-to-speech
  9. https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice/open-weights
  10. https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice
  11. https://artificialanalysis.ai/api/text-to-speech/leaderboard(404)
  12. https://hf-mirror.com/datasets/tensorfeed/ai-ecosystem-daily/raw/main/2026-05-23/voice-leaderboards.jsonl
  13. https://hf-mirror.com/datasets/tensorfeed/ai-ecosystem-daily/raw/main/2026-06-02/voice-leaderboards.jsonl
  14. https://hf-mirror.com/datasets/tensorfeed/ai-ecosystem-daily/raw/main/2026-06-18/voice-leaderboards.jsonl
  15. https://hf-mirror.com/datasets/tensorfeed/ai-ecosystem-daily/raw/main/2026-08-01/voice-leaderboards.jsonl
  16. https://hf-mirror.com/datasets/tensorfeed/ai-ecosystem-daily/raw/main/2026-09-01/voice-leaderboards.jsonl
  17. https://hf-mirror.com/datasets/tensorfeed/ai-ecosystem-daily/raw/main/2026-09-20/voice-leaderboards.jsonl
  18. https://hf-mirror.com/datasets/Pendrokar/TTS_Arena/raw/main/README.md
  19. https://hf-mirror.com/datasets/Pendrokar/TTS_Arena/raw/main/tts_arena_vote_summary_all.tsv
  20. https://hf-mirror.com/api/datasets/Pendrokar/TTS_Arena
  21. https://replicate.com/kjjk10/kokoro-82m/readme

7.2 独立 benchmark 数据集(HF,经镜像)

  1. https://hf-mirror.com/datasets/kadirnar/voicehub-arena-seed-tts-eval/raw/main/README.md
  2. https://hf-mirror.com/datasets/kadirnar/voicehub-arena-seed-tts-eval/raw/main/leaderboard.csv
  3. https://hf-mirror.com/api/datasets/kadirnar/voicehub-arena-seed-tts-eval
  4. https://hf-mirror.com/datasets/VoiceHub/voicehub-arena-seed-tts-eval/raw/main/README.md
  5. https://hf-mirror.com/datasets/VoiceHub/voicehub-arena-seed-tts-eval/raw/main/experiments/native-ada-20260916/native-comparison.csv
  6. https://hf-mirror.com/datasets/VoiceHub/voicehub-arena-seed-tts-eval/raw/main/experiments/native-ada-full-20260916/full/omnivoice--voice_clone/result.json
  7. https://hf-mirror.com/datasets/VoiceHub/voicehub-arena-seed-tts-eval/raw/main/experiments/native-ada-full-20260916/full/f5tts--voice_clone/result.json
  8. https://hf-mirror.com/datasets/VoiceHub/voicehub-arena-seed-tts-eval/raw/main/experiments/native-ada-full-20260916/full/kokoro--preset_voice/result.json
  9. https://hf-mirror.com/datasets/VoiceHub/voicehub-arena-seed-tts-eval/raw/main/experiments/native-ada-full-20260916/full/vibevoice--preset_voice_stream/result.json
  10. https://hf-mirror.com/api/datasets/VoiceHub/voicehub-arena-seed-tts-eval
  11. https://hf-mirror.com/datasets/KaniTTS-research-team/kokoro_banchmark/raw/main/README.md
  12. https://hf-mirror.com/api/datasets/KaniTTS-research-team/kokoro_banchmark
  13. https://hf-mirror.com/datasets/KaniTTS-research-team/kokoro_banchmark/resolve/main/data/train-00000-of-00001.parquet
  14. https://hf-mirror.com/datasets/JacobLinCool/zh-tw-tts-arena-votes/raw/main/README.md
  15. https://hf-mirror.com/api/datasets?search=tts+arena&limit=30、https://hf-mirror.com/api/datasets?search=TTS-AGI&limit=30
  16. https://hf-mirror.com/api/models/hexgrad/Kokoro-82M
  17. https://hf-mirror.com/api/models?search=Kokoro&limit=40&sort=downloads&direction=-1
  18. https://hf-mirror.com/api/datasets/VoiceHub/voicehub-arena-seed-tts-eval(文件清单)
  19. https://hf-mirror.com/api/datasets/kadirnar/voicehub-arena-seed-tts-eval(文件清单)

7.3 论文 / README(原始文件)

  1. https://arxiv.org/html/2509.24650v1(VoxCPM;含 Table 3 Seed-TTS-eval、Table 4 CV3-eval 及 GPT-Sovits)
  2. https://arxiv.org/html/2502.18924v1(MegaTTS3 / S-DiT 官方论文,英文 LibriSpeech-PC SIM-O/WER)
  3. https://arxiv.org/html/2509.22062v1(CaT-TTS,SeedTTS test-zh/en/hard)
  4. https://arxiv.org/html/2605.22083v1(RobustSpeechFlow,含 MegaTTS3 转引)
  5. https://arxiv.org/html/2606.03455v1(WavTTS,Seed-TTS test-en/zh SIM-o)
  6. https://ar5iv.labs.arxiv.org/html/2605.28618(SwanBench-Speech 长语音基准)
  7. https://raw.githubusercontent.com/FunAudioLLM/CosyVoice/main/README.md
  8. https://raw.githubusercontent.com/k2-fsa/OmniVoice/main/README.md
  9. https://raw.githubusercontent.com/fishaudio/fish-speech/main/README.md
  10. https://raw.githubusercontent.com/index-tts/index-tts/main/README.md
  11. https://raw.githubusercontent.com/T8mars/indextts25-desktop-t8/main/README.md(IndexTTS 官方 Table 1/Table 2 全文)
  12. https://raw.githubusercontent.com/OpenBMB/VoxCPM/main/README.md
  13. https://github.com/T8mars/indextts25-desktop-t8
  14. https://github.com/FunAudioLLM/CV3-Eval(页面已抓,本报告未引用其内容)

7.4 sm_120 / Blackwell

  1. https://github.com/RVC-Boss/GPT-SoVITS/issues/2514
  2. https://github.com/RVC-Boss/GPT-SoVITS/issues/2192
  3. https://github.com/RVC-Boss/GPT-SoVITS/issues/2205
  4. https://github.com/RVC-Boss/GPT-SoVITS/issues/2393
  5. https://github.com/RVC-Boss/GPT-SoVITS/pull/2774(经 GitHub 搜索 API 结果发现;正文未单独抓取)
  6. https://github.com/RVC-Boss/GPT-SoVITS/issues/2626(经搜索发现;正文未抓取)
  7. https://github.com/QwenAudio/CosyVoice/issues/1815
  8. https://github.com/jianchang512/ChatTTS-ui/issues/290
  9. https://github.com/Dao-AILab/flash-attention/issues/2016
  10. https://github.com/Genesis1231/fish-s2-rtx
  11. https://api.github.com/search/issues?q=repo:RVC-Boss/GPT-SoVITS+sm_120(搜索 API,仅用于发现;后触发速率限制)
  12. https://api.github.com/search/issues?q=repo:RVC-Boss/GPT-SoVITS+5060
  13. https://api.github.com/search/issues?q=repo:index-tts/index-tts+5060
  14. https://huggingface.co/2Noise/ChatTTS/discussions/38(仅搜索结果中出现,未抓取)

7.5 第三方文章 / 中文来源

  1. https://sovgrid.org/blog/strategy-tts-pivot-voxtral-ceiling/
  2. https://theaibench.ai/use-cases/voice/
  3. https://www.cnblogs.com/sensorsen/p/21367537
  4. https://blog.csdn.net/weixin_42602241/article/details/156922929
  5. https://www.cnblogs.com/kacoro/p/18977125
  6. https://www.siliconflow.com/zh/articles/best-open-source-text-to-speech-models
  7. https://cloud.tencent.cn/developer/article/2722884
  8. https://github.com/Lyrcaxis/KokoroSharp/issues/5
  9. https://pinggy.io/blog/best_open_source_self_hosted_text_to_speech_models/(未抓取正文)
  10. https://sneekes.app/posts/f5-tts-installation-guide-for-rtx-5070-on-wsl2/(两次抓取均超时,内容未取得)
  11. https://huggingface.co/spaces/Pendrokar/TTS-Spaces-Arena(README 中引用的原 Space 地址;本网络不可达)

7.6 辅助


本文件为原始资料汇编,未做结论提炼;所有数字均标注了来源与"厂商自评/第三方"属性,未标注者请在引用前回溯到 7 节对应 URL 二次核对。

下载此文件