# 开源 TTS / 语音克隆选型调研（2026 年 9 月最新状态）

> 调研截止日期：**2026-09-22**。调研目标：为「实时数字人 / 口播视频」链路选 TTS，重点关注**中文自然度、说话人相似度、流式首包延迟、16GB 单卡（RTX 5060 Ti 16GB, sm_120 Blackwell）可跑性、商用许可、与数字人框架的现成集成**。
>
> **数据纪律**：每条关键结论后附**实际抓取过的** URL。查不到的字段写「未查到」，不做推测。厂商宣称与第三方实测**分开标注**。
>
> 抓取方式：本机 `web_fetch` 常超时，全部用 `curl`（脚本 `/tmp/dh/f.sh`、`/tmp/dh/txt.sh`）。GitHub star/license/last-commit 走 shields.io；arXiv 用 `export.arxiv.org/api/query` 校验；HuggingFace 官方域名被墙，模型卡走 **hf-mirror.com**。

---

## 0. 一页速查（TL;DR）

### 0.1 2026 年格局：三件必须先知道的事

1. **IndexTTS 已迭代到 2.5**（2026-08-10 发布），不是「IndexTTS-2」了。中文 CER 1.21%→**0.93%**（RL 版 0.81%），官方未内置流式。([index-tts README](https://raw.githubusercontent.com/index-tts/index-tts/main/README.md))
2. **Fish-Speech 已改名/升代为 Fish Audio S2 Pro（4B）**，许可证从 CC-BY-NC-SA 换成自研的 **FISH AUDIO RESEARCH LICENSE（2026-03-07）**，明文规定**商用必须单独授权**。([LICENSE](https://github.com/fishaudio/fish-speech/blob/main/LICENSE))
3. **OmniVoice 确为小米（Xiaomi Corp.）**，但托管在 k2-fsa 社区组织下；论文 arXiv:2604.00688 属实。**代码 Apache-2.0，但模型权重是 CC-BY-NC（不可商用）**。([HF 模型卡](https://hf-mirror.com/k2-fsa/OmniVoice/raw/main/README.md))

### 0.2 中文核心指标总表（SeedTTS test-zh，WER/CER↓ 与说话人相似度↑）

数值口径不完全统一（SIM-o / SIM / SS 三种写法），**已标注来源**。

| 模型 | 参数 | 中文 CER/WER ↓ | 说话人相似度 ↑ | 流式 | 商用许可 | 来源性质 |
|---|---|---|---|---|---|---|
| **Fish Audio S2 Pro** | 4B | **0.54%** | 未查到（表内未给 zh SIM） | ✅ **TTFA <100ms** | ❌ 需单独授权（HF 门禁强制 "non-commercial use ONLY"） | 厂商 |
| **Qwen3-TTS-12Hz-1.7B-Base** | 1.7B（实 1.93B） | **0.77%（自报）/ 1.22–1.33%（第三方）** | **0.799（自报）/ 76.7–77.0（第三方）** | ✅ **原生双轨流式，端到端延迟低至 97ms** | ✅ **Apache-2.0** | 厂商 + 第三方 |
| **OmniVoice**（小米） | 0.8B | **0.84%** | **0.777**（SIM-o） | ❌ NAR 非流式 | ❌ 权重 CC-BY-NC | 厂商（论文 Table 1） |
| **GLM-TTS-RL** | 1.5B | 0.89% | 76.4 | ✅ 支持（需 vLLM） | ⚠️ **GitHub Apache-2.0 vs HF `mit` 冲突** | 厂商 + 第三方（一致） |
| **VoxCPM-0.5B** | 0.6B | 0.93% | 77.2 | ❌（1.5/2 版才流式） | ✅ Apache-2.0 | 第三方表 |
| **IndexTTS2.5-RL** | 0.8B | 0.93%（自家表 3.93*） | 77.92 / 76.4 | ❌ 官方无流式 | ⚠️ bilibili 自定义（有条件免费商用） | 厂商 |
| **⭐ VoxCPM2** | **2B**（实 2.29B） | **0.97%** | **79.5** | ✅ **官方 generate_streaming**，RTF ~0.30@4090 / **~0.13 Nano-VLLM** | ✅ **Apache-2.0（HF 侧 frontmatter 已确认）** | 厂商（OpenBMB 表） |
| **IndexTTS2（2.5）** | 0.8B | 1.03–1.21% | 76.5 / 77.1–78.0 | ❌ 官方无流式 | ⚠️ 同上 | 第三方表 |
| **⭐ LongCat-AudioDiT**（美团） | 3.5B（实 3.83B） | 1.09% | **81.8（全场最高）** | ❌ 非自回归扩散，**非流式** | ✅ **MIT** | 第三方表 |
| **FireRedTTS-2** | 1.5B | 1.14% | 73.6 | ✅ **首包 140ms（L20）** | ✅ Apache-2.0 | 第三方三家一致 |
| **Fun-CosyVoice3-0.5B-2512** | 0.5B | **1.21%**（RL 0.81%） | **78.0**（RL 77.4） | ✅ 双向流式，**150ms**（第三方实测 ~195ms） | ✅ Apache-2.0 | 厂商 |
| **MossTTSDelay** | 8B | 1.37% | 76.98 | ✅（Realtime 版 TTFB 180ms） | ✅ Apache-2.0 | 厂商 |
| **ZipVoice** | **123M** | 1.40% | 0.751（SIM-o） | ❌ | ✅ Apache-2.0 | OmniVoice 论文 |
| **MossTTSLocal** | 1.7B | 1.44% | **79.62** | 同上 | ✅ Apache-2.0 | 厂商 |
| **MegaTTS3** | 0.3–0.5B | **1.52%** | **79.0** | ❌ | ✅ Apache-2.0 | 第三方两源一致 |
| **F5-TTS** | 0.3–0.4B | 1.52–1.53% | 74.1 / 76.0 | ❌ | ✅ **MIT** | 第三方表 |
| **Spark-TTS** | 0.5B | 1.54% | **66.0（最低之一）** | ❌ | ❌ **权重 CC-BY-NC-SA-4.0** | 第三方两家一致 |
| **GPT-SoVITS v2ProPlus** | 229M | 1.6% | 0.737（SIM） | ❌ 无流式 | ✅ **MIT** | 厂商（官方 wiki） |
| **ChatTTS** | 未查到 | 未查到 | 未查到 | 部分（句级） | ❌ AGPL-3.0 + 权重 CC-BY-NC | — |
| **Kokoro-82M** | 82M | 未查到 | 未查到 | ❌ | ✅ Apache-2.0 | — |
| ~~Sesame CSM~~ | 1.55B | 未查到（官方自述非英语「likely won't do well」） | 未查到 | ❌ | ✅ Apache-2.0（但无中文） | — |

\* IndexTTS2.5-RL 的 3.93% 出自其自家 CV3-Eval 表（不同测试集），0.93% 出自第三方对比表，两者**不可直接比较**。

> **⚠️ 四个「口径必须标注」的案例（同一模型不同榜单差异巨大）**：Qwen3-TTS 自报 0.77 vs 第三方 1.22–1.33（**1.6–1.7×**）；Fish Audio S2 Pro 0.54 vs 3.62（**6.7×**）；OmniVoice 0.84 vs 3.41（**4×**）；GPT-SoVITS 1.6 vs 7.34（**4.6×**）。→ **任何单一数字都不足以定论。**
>
> **⚠️ 已被排除的模型（许可原因）**：**Spark-TTS 权重 CC-BY-NC-SA-4.0（不可商用）**、**Higgs Audio v2（HF license `other`，主线 v3 明确非商用，且需 ≥24GB 显存）**、**VibeVoice-TTS-1.5B（微软 2025-09 已下架代码并标 Disabled，官方明文不建议商用）**。详见 11.7。
>
> **⚠️ sm_120 特别提示**：**Qwen3-TTS 是本次调研中唯一「sm_120 零 issue」的模型**；而 **GLM-TTS issue #9 直接报告 RTX 5060 Ti 16G 上 GPU 利用率仅 40%**；VoxCPM2 有 #250/#282/#326 多个 Blackwell open issue。详见 13.1b / 13.2。

### 0.2b 各家 Seed-TTS-eval 中文口径的横向对照（同一张表内，可直接比）

以 **OpenBMB/VoxCPM README** 的 Seed-TTS-eval 表为准（这是本次找到的**覆盖最全的单张第三方表**，25 个模型同一口径）：

| 模型 | 参数 | **test-ZH CER/%↓** | **test-ZH SIM/%↑** | test-EN WER↓ | test-EN SIM↑ |
|---|---|---|---|---|---|
| FishAudio S2 | 4B | **0.54** | — | 0.99 | — |
| VoxCPM-0.5B | 0.6B | 0.93 | 77.2 | 1.85 | 72.9 |
| **VoxCPM2** | **2B** | **0.97** | **79.5** | 1.84 | 75.3 |
| IndexTTS2 | 1.5B | 1.03 | 76.5 | 2.23 | 70.6 |
| Qwen3-Omni | 30B-A3B | 1.07 | — | 1.39 | — |
| LongCat-Audio-DiT | 3.5B | 1.09 | **81.8** | 1.50 | 78.6 |
| Seed-TTS（闭源） | — | 1.12 | 79.6 | 2.25 | 76.2 |
| CosyVoice3 | 1.5B | 1.12 | 78.1 | 2.22 | 72.0 |
| FireRedTTS-2 | 1.5B | 1.14 | 73.6 | 1.95 | 66.5 |
| CosyVoice3 | 0.5B | 1.16 | 78.0 | 2.02 | 71.8 |
| VibeVoice | 1.5B | 1.16 | 74.4 | 3.04 | 68.9 |
| VoxCPM1.5 | 0.8B | 1.18 | 77.0 | 2.12 | 71.4 |
| OpenAudio-s1-mini | 0.5B | 1.18 | 68.5 | 1.94 | 55.0 |
| MOSS-TTS | — | 1.20 | 78.8 | 1.85 | 73.4 |
| Qwen3-TTS | 1.7B | 1.22 | 77.0 | 1.23 | 71.7 |
| CosyVoice2 | 0.5B | 1.38 | 75.7 | 3.09 | 65.9 |
| **MegaTTS3** | 0.5B | **1.52** | **79.0** | 2.79 | 77.1 |
| F5-TTS | 0.3B | 1.53 | 76.0 | 2.00 | 67.0 |
| SparkTTS | 0.5B | 1.54 | 66.0 | 3.14 | 57.3 |
| Qwen2.5-Omni | 7B | 1.70 | 75.2 | 2.72 | 63.2 |
| MaskGCT | 1B | 2.27 | 77.4 | 2.62 | 71.7 |
| CosyVoice | 0.3B | 3.63 | 72.3 | 4.29 | 60.9 |
| FireRedTTS | 0.5B | 1.51 | 63.5 | 3.82 | 46.0 |

— [OpenBMB/VoxCPM README Seed-TTS-eval 表](https://github.com/OpenBMB/VoxCPM)（⚠️ 厂商侧整理的表，引用需注明来源）

**读表要点**：
- **中文 CER 最低**：FishAudio S2 (0.54) > VoxCPM-0.5B (0.93) > **VoxCPM2 (0.97)** > IndexTTS2 (1.03)。
- **中文音色相似度最高**：**LongCat-Audio-DiT 81.8** > Seed-TTS 79.6 > **VoxCPM2 79.5** > **MegaTTS3 79.0** > MOSS-TTS 78.8。
- **「CER 低 + SIM 高」双优**：**VoxCPM2**、**MegaTTS3**、**MOSS-TTS**、**LongCat-Audio-DiT**。
- FishAudio S2 中文 CER 0.54 极低，但**该表 SIM 列为空**，无法判断音色；且**不可商用**。
- **GPT-SoVITS / Kokoro / ChatTTS 未收录在此表** → 前三者需看各自官方 wiki（见第 4/9/10 节）。

### 0.2c ⚠️ 第三方 Elo 榜对中文**完全无用**（必读，避免被英文榜误导）

本次调研确认：**2026 年没有任何一个第三方 Elo 榜能评中文 TTS。**

| 榜单 | 中文 | 关键事实 |
|---|---|---|
| **Artificial Analysis TTS**（唯一完整第三方 Elo 榜） | ❌ 纯英文（仅 US/UK 口音） | 90 个模型仅 16 个开源权重；**中国开源模型（IndexTTS / CosyVoice 开源权重 / GPT-SoVITS / ChatTTS / F5-TTS / MegaTTS3 / OmniVoice / MOSS-TTS / VoxCPM2 / GLM-TTS / FireRedTTS-2）全部不在榜** |
| **HuggingFace TTS Arena V2** | ❌ 原文 "**Prompts are English-only for now**" | 原始 Elo 也取不到（HF 被墙；hf-mirror 拒绝 Spaces） |
| **TTS Spaces Arena**（原始投票） | ❌ 英文单句朗读 | 我方统计 36,993 票：kokoro 98.4% 第一；**GPT-SoVITS-ProPlus 仅 27.5% 垫底** |
| **VoiceHub/kadirnar**（独立英文 Seed-TTS-Eval） | ❌ 英文 | 33 模型 × 1088 条：**Kokoro 0.96% 第一**、OmniVoice 0.99%、**VoxCPM2 3.35%（靠后）**、GPT-SoVITS 2.64% |

**三条必须记住的「英文榜陷阱」**：
1. **Kokoro 在英文榜上是开源第一梯队（AA Elo 1060.98 / TTS Arena 98.4% / VoiceHub WER 0.96% 第一）**，但它的**官方模型卡 language tag 只有 `en`，中文靠第三方权重**，社区报告 C# 版中文「口音很重、听不太清」。→ **绝不能因为英文榜排名高就选它做中文。**
2. **GPT-SoVITS-ProPlus 在英文 Arena 垫底（27.5%）**，但在**中文 SeedTTS 官方 wiki 上 SIM 0.737（接近真人 0.750）**。→ **英文榜排名与中文能力可能反相关。**
3. **VoxCPM2 在英文 Seed-TTS-Eval 上是 3.35%（非常靠后）**，但在**中文 SeedTTS-eval 上是 CER 0.97 / SIM 79.5（双优）**。→ **同一个模型的中英能力可以差很多。**

**→ 选型纪律：中文只在 CV3-Eval / Seed-TTS-eval（test-zh）口径下比较（见 0.2b），并最终以自家场景自测为准。**

### 0.3 面向「16GB 单卡 + 数字人」的结论（TL;DR 建议）

> **⭐ 本次调研最大的三个「新增发现」**（都改变了排序）：
> 1. **Qwen3-TTS（阿里，Apache-2.0）**：**首包 97ms（官方，全场最低）+ 原生流式 + 可商用 + 本次调研中唯一「sm_120 零 issue」的模型** → **实时链路首选**。
> 2. **LongCat-AudioDiT（美团，MIT）**：**中文 SIM 81.8（全场最高）+ MIT 最宽松许可**，代价是**非流式** → **离线口播场景的自定义最优解**（离线本来就不需要流式）。
> 3. **三个曾经的「热门候选」被许可/维护状态排除**：**Spark-TTS（权重 CC-BY-NC-SA-4.0）**、**Higgs Audio v2（主线转非商用 + 需 ≥24GB）**、**VibeVoice-TTS-1.5B（微软 2025-09 下架代码并标 Disabled）**。

| 场景 | 首选 | 次选 | 理由 |
|---|---|---|---|
| **实时对话链路（要可商用 + 最低首包）** | **⭐ Qwen3-TTS**（97ms） | **VoxCPM2** / **Fun-CosyVoice3** | Qwen3-TTS：**Apache-2.0 + 97ms + 原生流式 + sm_120 零 issue（唯一）**；LiveTalking 作者实测 0.6B + vLLM-Omni **~130ms**。CosyVoice3：Apache-2.0 + 150ms（第三方 ~195ms）。VoxCPM2：Apache-2.0 + 官方 `generate_streaming` + RTF 0.13–0.30，但 **sm_120 有多个 open issue** |
| **离线口播成片（本项目实际形态，不需流式）** | **⭐ LongCat-AudioDiT**（MIT, SIM 81.8） | **IndexTTS-2.5** / **VoxCPM2** | LongCat：**MIT + 中文 SIM 全场最高 81.8**，非流式在离线场景不是缺点；短板是 3.83B **F32** 权重（16GB 需转半精度，待实测）。IndexTTS-2.5：CER 0.93–1.21% + 情绪/时长强可控 + **官方 6GB VRAM**；VoxCPM2：CER 0.97/SIM 79.5 + 48kHz |
| **要商用 + 要最高中文自然度、可接受非流式** | **IndexTTS-2.5** | MossTTSLocal 1.7B / MegaTTS3 | IndexTTS-2.5：~6GB 显存 + 情绪/时长强可控（**IndexTTS2 的时长控制被第三方明确评价为「对口型同步非常有意义」**） |
| **要 Apache-2.0 + 有明确 TTFB 数字** | **Qwen3-TTS**（97ms） | **FireRedTTS-2**（140ms）/ **MOSS-TTS-Realtime**（180ms） | 三者都是 Apache-2.0 + 官方 TTFB。FireRedTTS-2 显存 bf16 **9GB**，但锁 torch2.7.1+cu126 |
| **显存最省 + 零成本** | **Kokoro-82M**（82M, 可 CPU，第三方实测仅 480MiB） | GPT-SoVITS（229M, ~6GB） / ZipVoice（123M） | 显存几乎无需求 |
| **要 MIT 最宽松** | **LongCat-AudioDiT**（MIT） | GPT-SoVITS / F5-TTS | LongCat 中文 SIM 81.8 最强；GPT-SoVITS 229M 最省显存（中文 SIM 0.737，真人 0.750）但**无流式** |
| **中文最强但只做研究/学习** | **OmniVoice 0.8B**（CER 0.84%） | Fish Audio S2 Pro（0.54%） | **均不可商用** |
| **最稳的 2026 新旗舰（显存与效果平衡）** | **VoxCPM2**（~8GB VRAM） | MOSS-TTS（8B 可塞 8GB 卡） | 但注意 VoxCPM2 的 **sm_120 open issue** |

**⚠️ 三个必须避开的坑（本报告新增）**：
- **GLM-TTS**：尽管中文 CER 0.89 很好，但 **issue #9 直接报告在 RTX 5060 Ti 16G 上 GPU 利用率仅 40%**，且**许可证 GitHub Apache-2.0 vs HF `mit` 自相矛盾**。
- **Spark-TTS**：GitHub 写 Apache-2.0，**但 HF 权重是 CC-BY-NC-SA-4.0** → 商用踩雷。
- **VoxCPM2**：虽然可商用且效果好，但 **sm_120 有 #250/#282/#326 多个 open issue**（Blackwell Docker 支持、CUDA graph 音质劣化、比 4090 慢）→ 在本机需预留调试时间。

---

## 1. OmniVoice（小米 / k2-fsa）

### 1.1 来源与真实性核查

| 项 | 内容 |
|---|---|
| GitHub | https://github.com/k2-fsa/OmniVoice （**14k stars**，last-commit = august，license = **Apache-2.0**）— shields.io 实抓 |
| HuggingFace | https://huggingface.co/k2-fsa/OmniVoice （镜像可读：[hf-mirror 模型卡](https://hf-mirror.com/k2-fsa/OmniVoice/raw/main/README.md)） |
| HF Space | https://huggingface.co/spaces/k2-fsa/OmniVoice |
| Demo 页 | https://zhu-han.github.io/omnivoice |
| **论文** | **arXiv:2604.00688** —《OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models》，v3 更新于 **2026-04-21**（published 2026-04-01）。**用户给的 arXiv 号属实**。 |

**⚠️ 「小米」的说法核实结论：属实，但不在 repo 名下。** 论文首页署名机构为 **`Xiaomi Corp., China`**，通讯邮箱 `{zhuhan3,dpovey}@xiaomi.com`（Daniel Povey 为小米语音团队负责人）。代码托管在 k2-fsa（Daniel Povey 系的社区组织），所以从 repo owner 看不出小米。([arXiv:2604.00688 PDF 首页](https://arxiv.org/pdf/2604.00688v3))

### 1.2 许可证与商用

- **代码：Apache-2.0**（HF 模型卡与 GitHub shields 一致）。
- **模型权重：CC-BY-NC（不可商用）**。原文：

  > "Our code is released under the Apache 2.0 License. **The pre-trained model is licensed under the CC-BY-NC** due to constraints from its training data (e.g., Emilia)."
  > —— [hf-mirror.com/k2-fsa/OmniVoice/raw/main/README.md](https://hf-mirror.com/k2-fsa/OmniVoice/raw/main/README.md)

- **结论：权重非商用。** 若产品要商用，OmniVoice 只能用于内部评测/研究。

### 1.3 中文效果（具体数字，均为厂商论文数据）

论文 Table 1（Seed-TTS test-zh / test-en，baseline 用官方 checkpoint 复现，SIM-o 为 WavLM-based ECAPA-TDNN 余弦相似度）：

| 模型 | 参数 | Seed-en SIM-o↑ | Seed-en WER↓ | Seed-en UTMOS↑ | **Seed-zh SIM-o↑** | **Seed-zh WER↓** | Seed-zh UTMOS↑ |
|---|---|---|---|---|---|---|---|
| Ground-truth | — | 0.734 | 2.14 | 3.52 | 0.755 | 1.25 | 2.78 |
| IndexTTS2 | 1.7B | 0.706 | 2.33 | 3.65 | 0.764 | 1.05 | 3.00 |
| CosyVoice3 | 1.1B | 0.696 | 2.17 | 3.96 | 0.778 | 1.14 | 3.32 |
| VoxCPM | 0.7B | 0.731 | 1.92 | 3.77 | 0.772 | 0.99 | 2.94 |
| Qwen3-TTS | 1.1B | 0.708 | 1.54 | 4.16 | 0.766 | 1.15 | 3.46 |
| F5-TTS | 0.4B | 0.664 | 1.85 | 3.72 | 0.750 | 1.53 | 2.93 |
| MaskGCT | 2.2B | 0.713 | 2.88 | 3.55 | 0.773 | 2.40 | 2.63 |
| **OmniVoice** | **0.8B** | **0.741** | **1.60** | 3.91 | **0.777** | **0.84** | 3.11 |

— [arXiv:2604.00688v3 PDF, Table 1](https://arxiv.org/pdf/2604.00688v3)

**第三方对比（IndexTTS 团队在自家 README 的 CV3-Eval 表里引用的 OmniVoice 数字）**：OmniVoice 0.8B，zh **WER 3.41 / SS 72.99**，en 3.62 / 70.13，es 3.52 / 74.14，ja 5.38 / 70.49，ar 17.88 / 64.22。
— [index-tts README Table 1](https://raw.githubusercontent.com/index-tts/index-tts/main/README.md)

> **⚠️ 注意口径冲突**：OmniVoice 自报 zh WER **0.84%**，IndexTTS 团队在同为「中文零样本」的表里给 OmniVoice 记的是 **3.41%**。两组数**不同测试集**（Seed-TTS test-zh vs CV3-Eval）且**不同 ASR**，不能混用。选型时以「自测」为准。

主观评测（论文 Table 2，中文/英文）：OmniVoice CMOS **0.44±0.16**（高于 Qwen3-TTS 的 0.40±0.16，ZipVoice −0.30，MaskGCT −0.38），SMOS **3.80±0.17**（GT 3.02±0.20）。([同 PDF](https://arxiv.org/pdf/2604.00688v3))

### 1.4 流式能力

- **❌ 不是流式模型**。架构为 **discrete NAR（离散非自回归）+ diffusion language model 风格**，直接 text → multi-codebook acoustic tokens，**整句并行解码**，全篇论文未出现 streaming / TTFA / first-chunk 字眼。
- 论文明确其优势是「NAR 的并行解码速度与鲁棒性」。([arXiv:2604.00688v3 §1](https://arxiv.org/pdf/2604.00688v3))
- **社区有句级流式的封装**（不是模型原生流式）：`omnivoice-server` 提供「sentence-level streaming」的 OpenAI 兼容 `/v1/audio/speech`。([docs/community-projects.md](https://raw.githubusercontent.com/k2-fsa/OmniVoice/master/docs/community-projects.md))

### 1.5 速度 / 显存

- 论文 Table 8（**H20 GPU**，PyTorch，3s 参考音频生成 10s 音频）：

  | 推理步数 | BS=1 | BS=2 | BS=4 | BS=8 |
  |---|---|---|---|---|
  | 16 | **0.0319** | 0.0263 | 0.0235 | **0.0224** |
  | 32 | 0.0598 | 0.0486 | 0.0436 | 0.0414 |

  — [arXiv:2604.00688v3 Table 8](https://arxiv.org/pdf/2604.00688v3)
- README 宣称 **RTF 低至 0.025（40× 实时）**。([GitHub README](https://raw.githubusercontent.com/k2-fsa/OmniVoice/main/README.md))
- README 的 FlashInfer 基准（**seed-tts zh testset，2020 条 / 3.3h，H100，fp16，num_step=32**）：

  | batch | baseline RTF | FlashInfer RTF | 加速 |
  |---|---|---|---|
  | 1 | 0.0899 | 0.0430 | 2.1× |
  | 1 + CUDA graph | — | **0.0367** | 2.4× |
  | 8 | 0.0298 | **0.0115** | 2.6× |

  — [GitHub README](https://raw.githubusercontent.com/k2-fsa/OmniVoice/main/README.md)
- **参数量 0.8B**（由 **Qwen3-0.6B** 权重初始化，声学 tokenizer 用 **Higgs-audio tokenizer，8 codebook**）。([arXiv:2604.00688v3 §3](https://arxiv.org/pdf/2604.00688v3))
- **16GB 卡能否跑**：0.8B + fp16 ≈ 1.6GB 权重，叠加 tokenizer/vocoder，**16GB 完全够**（README 甚至给出 Intel Arc A310 **4GB** 的实测支持）。但**官方未给明确 VRAM 数字 → 「未查到」精确显存占用**。
- **✅ 补：社区在 RTX 5060 Ti（同本机型号）上的实测配方**（来自同目录姊妹报告 `实时交互数字人与TTS调研.md`，引社区方案）：**nf4 量化 LM + fp16 其余 + `MAX_VRAM_GB=4`** 即可跑，**约 0.6 s 生成 5 s 音频（≈8× 实时）**；但**长参考音频（>4 s）显存会飙到 8 GB**，建议参考音频 <3.5 s 或开 `CPU_OFFLOAD=1`。⚠️ 该数字来自社区配方，非官方，需自测。

### 1.6 与数字人框架的现成集成

OmniVoice 官方维护了一份社区项目清单，**尚未见到 LiveTalking / OpenAvatarChat / Fay / Linly-Talker 的官方内置支持**（这三家的集成情况见第 12 节）。已确认的集成：

- **RealtimeTTS**（KoljaB/RealtimeTTS）—— 实时 TTS 框架，已支持 OmniVoice 作为 TTS 引擎
- **pyVideoTrans**（jianchang512/pyvideotrans）—— 视频翻译配音
- **ComfyUI-OmniVoice-TTS**（Saganaki22）
- **vLLM-Omni**、**audio.cpp**（GGML 纯 C++）、**MLX-Audio / OmniVoice-MLX**（Apple Silicon）
- **omnivoice-server**（OpenAI 兼容 HTTP + 句级流式）、**omnivoice-rs**（Rust+Candle）、**omnivoice-trtllm**
- **TTS-WebUI**、**LA Studio**、**Auris**、**LocalText2Voice**

— 全部出自 [docs/community-projects.md](https://raw.githubusercontent.com/k2-fsa/OmniVoice/master/docs/community-projects.md)

### 1.7 已知坑

- **依赖**：`requires-python >=3.10`，`torch>=2.4`；uv 配置里**钉死 `torch==2.8.0` / `torchaudio==2.8.0`，CUDA 索引为 `cu128`**。([pyproject.toml](https://raw.githubusercontent.com/k2-fsa/OmniVoice/master/pyproject.toml))
- **flash_attn 非必需**：XPU 后端上「flash_attn is not available on XPU; the model automatically falls back to SDPA」——说明有 SDPA 回退路径。([README](https://raw.githubusercontent.com/k2-fsa/OmniVoice/main/README.md))
- **FlashInfer 加速需要按 CUDA 版本挑 wheel**：`pip install flashinfer-python==0.6.15.post1 "flashinfer-jit-cache==0.6.15.post1+cu128" --extra-index-url https://flashinfer.ai/whl/cu128/`。([README](https://raw.githubusercontent.com/k2-fsa/OmniVoice/main/README.md))
- **粤语 WER 偏高**是 ASR 选型问题，换 SenseVoice-Small 后降到 2.273%。([arXiv:2604.00688v3](https://arxiv.org/pdf/2604.00688v3))
- **短音频不可靠**：无参考音频时难以稳定生成 1–2 秒短片段；闽南语只能用 Tâi-lô 罗马字输入，不支持汉字。([docs/tips.md](https://raw.githubusercontent.com/k2-fsa/OmniVoice/master/docs/tips.md))
- **sm_120（RTX 5060 Ti）**：官方未声明 sm_120 支持情况 → **「未查到」**。cu128 torch 2.8 本身支持 Blackwell；但若启用 FlashInfer/flash_attn 需注意编译目标。
- **✅ 补：两个已知 issue（来自同目录姊妹报告引用，需自行复核 issue 号）**：
  1. **微调在 sm_120 上撞共享内存墙**：消费级/工作站 Blackwell（sm_120）每 block 共享内存上限约 99KB，微调需 128KB → 报错（**Issue #83**）。**仅影响微调，推理不受影响**（推理用更小 block）。
  2. **输出乱码 bug**：**Issue #155**（5090 用户报告，`--no-asr` 也复现，2026-05 仍未修），workaround 是**显式传 `ref_text`**。→ 对本项目是硬伤，落地前务必验证。

---

## 2. IndexTTS-2 / IndexTTS-2.5（B 站 / bilibili）

### 2.1 来源与真实性核查

| 项 | 内容 |
|---|---|
| GitHub | https://github.com/index-tts/index-tts （**24k stars**，last-commit = august；shields 报 license = "not identifiable by github"，实际是自定义协议文件） |
| 论文（2.5） | **arXiv:2601.03888**《IndexTTS 2.5 Technical Report》（v5，2026-08-11） |
| 论文（2） | arXiv:2506.21619《IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot TTS》 |
| 论文（1.x） | arXiv:2502.05512 |
| HF（2.5） | https://huggingface.co/IndexTeam/IndexTTS-2.5 （镜像可读） |
| ModelScope（2.5） | https://modelscope.cn/models/IndexTeam/IndexTTS-2.5 |
| Demo | https://index-tts.github.io/index-tts2-5.github.io/ |

**⚠️ 重要：截至 2026-09-22，最新版是 IndexTTS-2.5（2026/08/10 发布），不是 IndexTTS-2。** 2.5 新增日语/西班牙语/阿拉伯语、`duration_factor` 语速控制、更快推理。([index-tts README News](https://raw.githubusercontent.com/index-tts/index-tts/main/README.md))

### 2.2 许可证与商用

**自定义协议：bilibili Model Use License Agreement**（[LICENSE 全文](https://raw.githubusercontent.com/index-tts/index-tts/main/LICENSE)）。HF 模型卡里 license 字段标注为 `other` / `license_name: bilibili-model-license`。([hf-mirror IndexTTS-2.5 模型卡](https://hf-mirror.com/IndexTeam/IndexTTS-2.5/raw/main/README.md))

**能否商用？——有条件可以。** 关键条款：

- §2.1 授予「worldwide, non-exclusive, non-transferable, royalty-free limited license」，即**免费授权商用**。
- **§2.2 规模门槛**：若你或关联方 **月活 > 1 亿**，**或上一年度营收 > 人民币 10 亿元**，必须另行申请授权（由 bilibili 单方决定是否授予）。→ **中小企业/个人可免费商用。**
- **§3.4(c)**：不得用 IndexTTS2 或其衍生品去改进其他 AI 模型（改进自身/衍生品/非商用模型除外）。
- **§4.2**：禁止用于医疗诊断、自动驾驶、军事、关键基础设施、大规模生物特征监控、自动决策等高风险场景。
- **§6**：适用中华人民共和国法律，争议提交**上海仲裁委员会**。

> 对比：这是本次调研里**唯一「明确允许商用、只对大厂设门槛」的自研协议**。比 Fish Audio（一律需授权）和 OmniVoice（权重 CC-BY-NC）宽松得多。

### 2.3 中文效果（具体数字）

**厂商数据 —— IndexTTS-2.5 官方 CV3-Eval 表**（zh/en/es/ja/ar，WER↓ / SS↑）：

| 模型 | 参数 | zh WER | zh SS | en WER | en SS | ja WER | ja SS | ar WER | ar SS | Avg WER | Avg SS |
|---|---|---|---|---|---|---|---|---|---|---|---|
| VoxCPM2 | 2B | 3.88 | 74.99 | 5.13 | 71.57 | 6.69 | 72.90 | 14.94 | 65.99 | 7.22 | 72.02 |
| OmniVoice | 0.8B | 3.41 | 72.99 | 3.62 | 70.13 | 5.38 | 70.49 | 17.88 | 64.22 | 6.76 | 70.39 |
| Moss-TTS 1.5 | 8B | 4.02 | 72.68 | 4.45 | 67.46 | 10.97 | 68.71 | 23.71 | 62.21 | 9.40 | 68.56 |
| CosyVoice3-0.5B | 0.5B | 3.84 | **80.01** | 4.88 | 74.16 | – | 76.36 | – | – | – | – |
| FireRedTTS-2 | 1.5B | 8.22 | 68.10 | 14.92 | 56.93 | – | – | – | – | – | – |
| Fish Audio S2 Pro | 4B | 3.62 | 67.79 | 3.83 | 61.66 | 5.15 | 66.15 | 14.15 | 59.43 | 5.94 | 64.49 |
| Qwen3-TTS | 1.7B | **3.27** | 73.02 | 5.06 | 67.17 | 5.89 | 70.18 | – | – | – | – |
| **IndexTTS2.5** | 0.8B | 4.36 | 77.10 | 5.12 | 68.06 | 5.66 | 74.62 | 14.88 | 69.74 | 6.75 | 73.18 |
| **IndexTTS2.5-RL** | 0.8B | 3.93 | **77.92** | 3.89 | 67.79 | 5.30 | 75.41 | 13.58 | 70.36 | 6.00 | **73.63** |

— [index-tts README Table 1](https://raw.githubusercontent.com/index-tts/index-tts/main/README.md)

**第三方数据 —— MOSS-TTS 团队对比表**（Seed-TTS-eval）：

| 模型 | 参数 | EN WER↓ | EN SIM↑ | **ZH CER↓** | **ZH SIM↑** |
|---|---|---|---|---|---|
| IndexTTS2 | 1.5B | 2.23 | 70.6 | **1.03** | 76.5 |
| GLM-TTS | 1.5B | 2.23 | 67.2 | 1.03 | 76.1 |
| GLM-TTS-RL | 1.5B | 1.91 | 68.1 | **0.89** | 76.4 |
| VoxCPM | 0.5B | 1.85 | 72.9 | 0.93 | 77.2 |
| Qwen3-TTS | 0.6B | 1.68 | 70.39 | 1.23 | 76.4 |
| CosyVoice3 | 0.5B | 2.02 | 71.8 | 1.16 | 78.0 |
| F5-TTS | 0.3B | 2.00 | 67 | 1.53 | 76 |
| HiggsAudio-v2 | 3B | 2.44 | 67.7 | 1.50 | 74.0 |

— [MOSS-TTS README Evaluation](https://raw.githubusercontent.com/OpenMOSS/MOSS-TTS/main/README.md)

**「Faster IndexTTS-2」论文（NVIDIA）给的 IndexTTS-2 质量基线**（Seed-TTS 测试集，PyTorch 原版）：

| | test-en FP32 | test-zh FP32 |
|---|---|---|
| WER (%) | 1.84 | **1.01** |
| SIM-o ↑ | 0.706 | **0.765** |
| UTMOS ↑ | 3.62 | 2.99 |

— [arXiv:2607.21042 PDF Table I](https://arxiv.org/pdf/2607.21042v1)

### 2.4 流式能力与首包延迟（重点）

**⚠️ 结论：官方 index-tts 仓库本身不提供流式推理。** 我在官方 README（中英文两版）全文 grep `stream|ttfb|first chunk|latency|流式` **零命中**。([EN](https://raw.githubusercontent.com/index-tts/index-tts/main/README.md) / [ZH](https://raw.githubusercontent.com/index-tts/index-tts/main/docs/README_zh.md))

**流式能力来自 NVIDIA 的独立工作「Faster IndexTTS-2」**（arXiv:2607.21042，2026-07-23，作者 Muyang Du / Shuang Yu / Junjie Lai，**NVIDIA 上海**）。该论文核实属实：用 TensorRT + TensorRT-LLM 加速全部组件并实现分块流式。

**首包延迟数字（论文实测，A100 80GB，FP16）：**

论文 Table II（overlap = 5 codec frames）：

| 语言 | 模式 | Chunk (s) | **TTFA↓ (ms)** | 总延迟 (ms)↓ | RTF↓ | WER (%)↓ | SIM-o↑ | UTMOS↑ |
|---|---|---|---|---|---|---|---|---|
| EN | 非流式 | — | — | 874.5 | 0.24 | 1.97 | 0.698 | 3.53 |
| EN | 流式 | 2 | **608.6** | 1180.4 | 0.32 | 1.86 | 0.699 | 3.45 |
| EN | 流式 | 1 | **405.5** | 1496.7 | 0.40 | 2.07 | 0.700 | 3.36 |
| ZH | 非流式 | — | — | 1211.1 | 0.22 | 1.08 | 0.761 | 2.94 |
| ZH | 流式 | 2 | **596.1** | 1669.3 | 0.30 | 1.10 | 0.765 | 2.81 |
| ZH | 流式 | 1 | **395.9** | 2153.5 | 0.38 | 1.13 | 0.766 | 2.67 |

— [arXiv:2607.21042 PDF Table II](https://arxiv.org/pdf/2607.21042v1)

**→ 中文首包延迟：chunk=2s 时 596.1 ms；chunk=1s 时 395.9 ms。** 这就是用户要的「流式首包延迟数字」。
**→ 增量输出：支持**，按可配置 chunk size 增量解码，相邻 chunk 有可配置 overlap，重叠波形用 **Hann 窗交叉淡化**平滑过渡。

论文 Figure 2 的 chunk/overlap 网格（6 种 overlap 值 × 4 档 chunk）显示 FP16 streaming：
- chunk 25 frames → 首包 299–310 ms（EN）/ 299–307 ms（ZH），RTF 0.53–0.63
- chunk 100 frames → 首包 592–610 ms，RTF 0.30–0.32
- 结论：**chunk 越大 WER 越低、UTMOS 越高，但 TTFA 越高**；overlap 只在小 chunk 时改善质量；**SIM-o 在所有配置下稳定**（流式不影响音色）。([同 PDF Fig.2](https://arxiv.org/pdf/2607.21042v1))

**加速比**：GPT 最高 **5.0×**（EN）/ 4.8×（ZH）；端到端 **3.60×**（EN）/ **3.46×**（ZH）；RTF 从 0.84/0.76 降到 0.24/0.22。W8A16 / W4A16 只对 GPT 量化，额外收益很小。([同 PDF §III-B](https://arxiv.org/pdf/2607.21042v1))

**模型构成（1.51B 总参）**：预处理 788M + 自回归 GPT 512M + flow-matching DiT 96M + BigVGAN vocoder 113M。([同 PDF §III-A](https://arxiv.org/pdf/2607.21042v1))

- ⚠️ **这套加速是 NVIDIA 的参考实现，不是 index-tts 官方发布物**。是否开源 → **「未查到」**（论文只给了 samples 页 [faster-indextts-2.github.io](https://faster-indextts-2.github.io)）。要用到自己机器上需自行复现 TRT/TRT-LLM 工程。

### 2.5 显存需求

- **官方 HF 模型卡明确写：`roughly 6 GB of VRAM for inference`**（IndexTTS-2.5，Python 3.10–3.11，NVIDIA GPU）。([hf-mirror IndexTTS-2.5 模型卡](https://hf-mirror.com/IndexTeam/IndexTTS-2.5/raw/main/README.md))
- 参数量 **~0.8B（GPT backbone）**，输出 22.05 kHz。([同上](https://hf-mirror.com/IndexTeam/IndexTTS-2.5/raw/main/README.md))
- **→ 16GB 单卡完全够，且余量很大。** 官方建议开 BF16（2.5）/ FP16（2）进一步降显存。
- 官方 RTF 实测（**RTX 4090**，`kv_cache=True`）：

  | 文本长度 | 2.0 fp16 | 2.0 fp32 | **2.5 bf16** | 2.5 fp32 |
  |---|---|---|---|---|
  | 7 字 | 0.4004 | 0.3748 | 0.2871 | 0.2547 |
  | 200 字 | 0.3244 | 0.3990 | 0.1997 | 0.2144 |
  | **overall** | 0.3257 | 0.3748 | **0.2065** | 0.2060 |

  — [index-tts README Inference Speed](https://raw.githubusercontent.com/index-tts/index-tts/main/README.md)

### 2.6 部署 / 集成

- 生产部署官方推荐 **vLLM recipe**：https://recipes.vllm.ai/IndexTeam/IndexTTS-2.5 。([README](https://raw.githubusercontent.com/index-tts/index-tts/main/README.md))
- 依赖管理强制用 **uv**（`uv sync --all-extras`）；**CUDA Toolkit ≥ 12.8**。含可选的 **DeepSpeed** 与编译 CUDA 内核加速开关。
- 情绪控制能力丰富：参考音频情感、8 维情绪向量 `[happy, angry, sad, afraid, disgusted, melancholic, surprised, calm]`、文本驱动情感、独立情感描述文本、`emo_alpha` 强度、`duration_factor` 0.5–2.0 语速。([README](https://raw.githubusercontent.com/index-tts/index-tts/main/README.md))
- 官方也提供 **ComfyUI 节点**（社区）：[chenpipi0807/ComfyUI-Index-TTS](https://raw.githubusercontent.com/chenpipi0807/ComfyUI-Index-TTS/main/README.md)

### 2.7 已知坑

- **`use_emo_text=True` 在 2.5 上必须先 `IndexTTS2(..., use_qwen_emo=True)`**，否则抛 `RuntimeError`。([README 第 5 节](https://raw.githubusercontent.com/index-tts/index-tts/main/README.md))
- Windows 上 **DeepSpeed 很难装**（官方建议去掉 `--all-extras`）。
- 官方警告：**只有 `github.com/index-tts/index-tts` 是唯一官方渠道**，其他网站/服务不保证安全。([README CAUTION](https://raw.githubusercontent.com/index-tts/index-tts/main/README.md))
- **sm_120 / RTX 5060 Ti**：官方要求 CUDA ≥ 12.8，理论上覆盖 Blackwell；但**官方未明确声明 sm_120 验证 → 「未查到」**。风险点是「compiled CUDA kernels」可选加速项可能没有 sm_120 预编译版本。

---

## 3. CosyVoice 3（阿里 FunAudioLLM）

### 3.1 来源

| 项 | 内容 |
|---|---|
| GitHub | https://github.com/FunAudioLLM/CosyVoice （**24k stars**，license = **Apache-2.0**，last-commit = **may**） |
| 论文 | **arXiv:2505.17589**《CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training》 |
| 最新权重 | **Fun-CosyVoice3-0.5B-2512** |
| ModelScope | https://www.modelscope.cn/models/FunAudioLLM/Fun-CosyVoice3-0.5B-2512 |
| HuggingFace | https://huggingface.co/FunAudioLLM/Fun-CosyVoice3-0.5B-2512 （HF 卡 license: **apache-2.0**，实抓镜像确认） |
| 评测集 | https://github.com/FunAudioLLM/CV3-Eval （官方开源评测集，难得的可复现第三方基准） |
| Demo | https://funaudiollm.github.io/cosyvoice3/ ⚠️ **本次实测返回 404**（README 引用但页面已下线；cosyvoice2 页同样 404） |

**许可证：Apache-2.0（代码与权重均为 apache-2.0）→ 可自由商用。** 这是本次调研中**商用条件最好的之一**。
— [hf-mirror CosyVoice3 模型卡](https://hf-mirror.com/FunAudioLLM/Fun-CosyVoice3-0.5B-2512/raw/main/README.md)、[GitHub shields](https://img.shields.io/github/license/FunAudioLLM/CosyVoice.json)

### 3.2 中文效果（具体数字）

官方评测表（zh/en/hard，CER/WER↓ 与 SS↑）：

| 模型 | 开源 | 参数 | test-zh CER↓ | **test-zh SS↑** | test-en WER↓ | test-en SS↑ | test-hard CER↓ | test-hard SS↑ |
|---|---|---|---|---|---|---|---|---|
| Human | — | — | 1.26 | 75.5 | 2.14 | 73.4 | – | – |
| Seed-TTS | ❌ | — | 1.12 | 79.6 | 2.25 | 76.2 | 7.59 | 77.6 |
| MiniMax-Speech | ❌ | — | 0.83 | 78.3 | 1.65 | 69.2 | – | – |
| F5-TTS | ✅ | 0.3B | 1.52 | 74.1 | 2.00 | 64.7 | 8.67 | 71.3 |
| CosyVoice2 | ✅ | 0.5B | 1.45 | 75.7 | 2.57 | 65.9 | 6.83 | 72.4 |
| Index-TTS2 | ✅ | 1.5B | 1.03 | 76.5 | 2.23 | 70.6 | 7.12 | 75.5 |
| VoxCPM | ✅ | 0.5B | 0.93 | 77.2 | 1.85 | 72.9 | 8.87 | 73.0 |
| GLM-TTS-RL | ✅ | 1.5B | 0.89 | 76.4 | – | – | – | – |
| **Fun-CosyVoice3-0.5B-2512** | ✅ | 0.5B | **1.21** | **78.0** | 2.24 | 71.8 | 6.71 | 75.8 |
| **Fun-CosyVoice3-0.5B-2512_RL** | ✅ | 0.5B | **0.81** | 77.4 | **1.68** | 69.5 | **5.44** | 75.0 |

— [CosyVoice README Evaluation](https://raw.githubusercontent.com/FunAudioLLM/CosyVoice/main/README.md)

第三方交叉验证（MOSS-TTS 表）：CosyVoice3 0.5B → EN WER 2.02 / SIM 71.8，**ZH CER 1.16 / SIM 78.0**。([MOSS-TTS README](https://raw.githubusercontent.com/OpenMOSS/MOSS-TTS/main/README.md))
第三方交叉验证（IndexTTS CV3-Eval 表）：CosyVoice3-0.5B → zh SS **80.01**（该表最高），en SS 74.16，ja SS 76.36。([index-tts README Table 1](https://raw.githubusercontent.com/index-tts/index-tts/main/README.md))

> **中文说话人相似度 78（SeedTTS）/ 80.01（CV3-Eval）是目前公开可商用模型里的第一梯队。**

### 3.3 流式能力（本次调研中最好的商用流式方案）

官方 README 原文：

> "**Bi-Streaming**: Support both text-in streaming and audio-out streaming, and **achieves latency as low as 150ms** while maintaining high-quality audio output."

— [CosyVoice README Highlight](https://raw.githubusercontent.com/FunAudioLLM/CosyVoice/main/README.md) · [hf-mirror 模型卡同文](https://hf-mirror.com/FunAudioLLM/Fun-CosyVoice3-0.5B-2512/raw/main/README.md)

- **首包延迟：150 ms（厂商宣称）**。
- **✅ 第三方实测（交叉来源，来自同目录姊妹报告 `实时交互数字人与TTS调研.md`，该报告引用了 vLLM-Omni commit 与 LiveTalking 作者实测）**：

  | 路径 | 首包延迟（TTFP/TTFB） | 条件 | 来源等级 |
  |---|---|---|---|
  | **CosyVoice3 + vLLM-Omni** | **~195 ms**（优化后；此前 ~810 ms） | H100，vLLM-Omni commit | 🟢 第三方 |
  | **Qwen3-TTS-0.6B + vLLM-Omni** | **~130 ms** | RTX 3090 单卡，稳态显存 ~13GB | 🟢 LiveTalking 作者实测 |
  | **Fish Audio S2 Pro + vLLM-Omni** | **~100 ms**（零样本）/ ~135 ms（克隆） | RTX PRO 6000 | 🟢 第三方 |
  | **MOSS-TTS-Realtime** | 180 ms（RTF 0.51） | 单卡 L20 | 🟡 厂商 |
  | **IndexTTS-2（Faster 版，未开源）** | **395.9 ms**（chunk=1s）/ **596.1 ms**（chunk=2s） | A100 FP16 | 🟢 论文 |

  → **CosyVoice3 的 150 ms 宣称值，第三方在 H100 + vLLM-Omni 上实测到 ~195 ms，量级一致（属可采信）。**
- **双向流式**：文本可增量输入，音频可增量输出。
- 流式基础来自 CosyVoice2（"Scalable streaming speech synthesis with large language models"），**CosyVoice2 支持 kv cache + SDPA 优化 RTF**（Roadmap 2024/08 条目）。([README Roadmap](https://raw.githubusercontent.com/FunAudioLLM/CosyVoice/main/README.md))
- 流式 RL（GRPO）训练支持已在 2025/08 由 NVIDIA 贡献者加入。

### 3.4 显存 / 部署

- 模型 **0.5B**，官方另有 1.5B 档（CosyVoice3-1.5B，未开源，见 IndexTTS 表标注 ❌/†）。**16GB 单卡绰绰有余**。精确 VRAM → 「未查到」（官方未给数字）。
- **vLLM 支持**：CosyVoice2/3 支持 **vLLM 0.11.x+（V1 engine）** 与 **vLLM 0.9.0（legacy）**；0.10.x 未测试，<0.9.0 不支持。([README vLLM Usage](https://raw.githubusercontent.com/FunAudioLLM/CosyVoice/main/README.md))
- **TensorRT-LLM**：官方称用它加速 CosyVoice2 的 LLM 可得 **4× 加速**（对比 HF transformers）。([README](https://raw.githubusercontent.com/FunAudioLLM/CosyVoice/main/README.md))
- 支持 **gRPC / FastAPI** 两种服务化，含 Dockerfile。
- 依赖：conda 建 py3.10 环境，需 `sox`/`libsox-dev`（Ubuntu）。([README Install](https://raw.githubusercontent.com/FunAudioLLM/CosyVoice/main/README.md))

### 3.5 语言/方言与可控性

- **9 种语言**（中英日韩德西法意俄）+ **18+ 中文方言/口音**（广东、闽南、四川、东北、陕西、山西、上海、天津、山东、宁夏、甘肃…），支持跨语种零样本克隆。([README](https://raw.githubusercontent.com/FunAudioLLM/CosyVoice/main/README.md))
- **发音 inpainting**：中文拼音 + 英文 CMU 音素。
- **文本归一化**：数字/特殊符号无需传统前端模块。
- **Instruct 支持**：语言、方言、情感、语速、音量。

### 3.6 已知坑

- **必须 `--recursive` 克隆（有 git submodule）**，否则要反复 `git submodule update --init --recursive`。([README](https://raw.githubusercontent.com/FunAudioLLM/CosyVoice/main/README.md))
- vLLM 版本窗口很窄（0.9.0 或 ≥0.11.0），**中间版本不可用**——建议单独开 conda 环境免得污染主环境。
- `ttsfrd` 资源可选；不装则回退 **wetext**。
- **last-commit = may（2026-05）**，主仓库近 4 个月无提交 → 活跃度下降（但 2025/12 仍发布了 Fun-CosyVoice3-0.5B-2512 权重）。
- **sm_120**：官方未声明 → 「未查到」。

---

## 4. GPT-SoVITS（RVC-Boss）

### 4.1 来源与许可

| 项 | 内容 |
|---|---|
| GitHub | https://github.com/RVC-Boss/GPT-SoVITS （**62k stars — 本次调研最高**，license = **MIT**，last-commit = august） |
| 官方文档 | 中文 https://www.yuque.com/baicaigongchang1145haoyuangong/ib3g1e ；英文 https://rentry.co/GPT-SoVITS-guide |
| 版本特性 wiki | https://github.com/RVC-Boss/GPT-SoVITS/wiki |
| 权重 | https://huggingface.co/lj1995/GPT-SoVITS |
| 在线 demo | https://lj1995-gpt-sovits-proplus.hf.space/ |
| CPU 优化版 | https://github.com/baicai-1145/GPT-SoVITS-CPUFast |

**许可证 MIT → 可自由商用**（这是本次调研里**唯一主流且完全宽松的开源许可**，另一个是 F5-TTS）。([GitHub shields license](https://img.shields.io/github/license/RVC-Boss/GPT-SoVITS.json))

### 4.2 中文效果（具体数字 —— 官方 wiki 给出 SeedTTS CN 跑分）

官方 wiki 表格，测试方法明确写了「用的 https://github.com/BytedanceSpeech/seed-tts-eval 官方给的相似度模型和 ASR 模型跑的」：

| 版本 | **WER ↓** | **SIM ↑** |
|---|---|---|
| v1 | 0.025 | 0.526 |
| v2 | 0.017 | 0.549 |
| v3 (8 steps) | 0.014 | 0.702 |
| v4 (8 steps) | 0.013 | 0.735 |
| v2Pro | 0.016 | 0.709 |
| **v2ProPlus** | **0.016** | **0.737** |
| GT（真人） | 0.013 | 0.750 |

— [GPT-SoVITS wiki: SeedTTS ZeroShot TTS eval testset CN](https://raw.githubusercontent.com/wiki/RVC-Boss/GPT-SoVITS/GPT%E2%80%90SoVITS%E2%80%90features-%28%E5%90%84%E7%89%88%E6%9C%AC%E7%89%B9%E6%80%A7%29.md)

**解读**：中文 WER 1.6%（v2ProPlus），**说话人相似度 0.737，只比真人 GT 的 0.750 低 1.3 个点** —— 非常强。但**自然度/情感无客观数字**，官方 wiki 自己也说：「测不了自然性、情感丰富性和音质，前 2 个要人工打分」。

**参数量（官方 wiki）**：

| 版本 | 语种 | GPT 参数量 | SoVITS 参数量 | 推理速度 |
|---|---|---|---|---|
| v1 | 中日英 | 90M | 77M | baseline |
| v2 | 中日英韩粤 | 90M | 77M | 2× v1 |
| v3/v4 | 同 v2 | 330M | 77M | ≈v2 |
| v2Pro | 同 v2 | 133M | 77M | ≈v3 |
| **v2ProPlus** | 同 v2 | **152M** | **77M** | ≈v3 |

— [同上 wiki](https://raw.githubusercontent.com/wiki/RVC-Boss/GPT-SoVITS/GPT%E2%80%90SoVITS%E2%80%90features-%28%E5%90%84%E7%89%88%E6%9C%AC%E7%89%B9%E6%80%A7%29.md)

**官方推荐结论（wiki 原文）**：「从 benchmark 跑分看，**没有必要再用 v3v4**，因为 v2Pro 系列和 v2 硬件需求一样，但是 zero shot 相似度和 v3v4 同一水平线」。

### 4.3 流式能力

- **❌ 官方无流式推理**。README 未提及任何 streaming / 增量输出接口；架构为「GPT + SoVITS(vits)」两段式，按句/段生成。→ **首包延迟「未查到」**。
- **但 RTF 极低**，官方实测（v2 ProPlus）：

  | 硬件 | RTF |
  |---|---|
  | **RTX 4060 Ti** | **0.028** |
  | **RTX 4090** | **0.014**（1400 词 ≈ 4 分钟音频，推理 3.36 s） |
  | Apple M4 CPU | 0.526 |

  — [GPT-SoVITS README Features](https://raw.githubusercontent.com/RVC-Boss/GPT-SoVITS/main/README.md)

  README 还带一句：「请不要尬黑 GPT-SoVITS 推理速度慢，谢谢！」

### 4.4 显存 / 部署

- 官方 README **未直接给 VRAM 数字** → 精确值「未查到」。但 v2Pro 官方描述「比 v2 显存占用稍高一点点」，v3/v4 时代社区普遍在**6–8GB 卡**上跑（CSDN 有「仅需 6GB 显存！GPT-SoVITS 部署指南」类文章，但为二手来源，**不作为硬结论**）。
- **显存需求是本次调研中最低的之一**（模型仅 152M+77M ≈ 229M 参数）。
- **官方测试过的环境矩阵**（难得地完整）：

  | Python | PyTorch | 设备 |
  |---|---|---|
  | 3.10 | 2.5.1 | CUDA 12.4 |
  | 3.11 | 2.5.1 | CUDA 12.4 |
  | **3.11** | **2.7.0** | **CUDA 12.8** |
  | 3.9 | 2.8.0dev | CUDA 12.8 |
  | 3.9 / 3.11 | 2.5.1 / 2.7.0 | Apple silicon |
  | 3.9 | 2.2.2 | CPU |

  — [GPT-SoVITS README Tested Environments](https://raw.githubusercontent.com/RVC-Boss/GPT-SoVITS/main/README.md)

- **一键安装脚本支持 `--device CU128`**：`bash install.sh --device <CU126|CU128|ROCM|CPU> --source <HF|HF-Mirror|ModelScope>` —— **对 Blackwell/sm_120 友好**。

### 4.5 已知坑

- **需要一个「参考音频 + 参考文本」对**；zero-shot 5 秒克隆，few-shot 1 分钟微调。
- **不能流式 → 数字人实时对话链路需要自己做句子切分 + 预生成**。
- **`no_proxy` 环境变量若含 `::` 会触发 httpx 报错**（README 明确提示）。([README](https://raw.githubusercontent.com/RVC-Boss/GPT-SoVITS/main/README.md))
- **sm_120**：官方测试矩阵最高到 CUDA 12.8（覆盖 Blackwell），且 install.sh 有 CU128 档 → **兼容性风险低**。但官方未点名 RTX 50 系 → 「未查到」直接实测证据。

---

## 5. Fish-Speech / Fish Audio S2 Pro

### 5.1 来源与许可（**重大变化**）

| 项 | 内容 |
|---|---|
| GitHub | https://github.com/fishaudio/fish-speech （**33k stars**，last-commit = **last wednesday** — 极活跃） |
| 最新模型 | **Fish Audio S2 Pro（4B）**，不是 OpenAudio S1 了 |
| 权重 | https://huggingface.co/fishaudio/s2-pro |
| 论文 | **arXiv:2603.08823**《Fish Audio S2 Technical Report》（已核实） |
| 博客 | https://fish.audio/blog/fish-audio-open-sources-s2/ |
| 文档 | https://speech.fish.audio/ |

**⚠️ 许可证从 CC-BY-NC-SA 换成了自研的 `FISH AUDIO RESEARCH LICENSE`（Last Updated: 2026-03-07）。**

**能否商用？—— ❌ 不能（除非单独购买授权）。** LICENSE 第三节原文：

> "**Any use of the Fish Audio Materials or Derivative Works for a Commercial Purpose requires a separate written license agreement from Fish Audio. No commercial rights are granted under this Agreement.**"
> "**Commercial Purpose**" means ... including but not limited to: (i) creating, modifying, or distributing Your product or service, including via a hosted service or API, (ii) **Your business's or organization's internal operations**, and (iii) any use in connection with a product or service for which You charge a fee or generate revenue, whether directly or indirectly.

— [FISH AUDIO RESEARCH LICENSE 全文](https://github.com/fishaudio/fish-speech/blob/main/LICENSE)

**⚠️ 特别注意 (ii)：连「企业内部自用」都算 Commercial Purpose。** 商务授权联系 `business@fish.audio`。
另：§IV(b) 禁止用它「创建或改进任何基础生成式 AI 模型」；分发必须显示 "Built with Fish Audio"。

### 5.2 中文效果（具体数字，厂商宣称）

| Benchmark | Fish Audio S2 |
|---|---|
| **Seed-TTS Eval — WER (中文)** | **0.54%**（best overall） |
| Seed-TTS Eval — WER (英文) | **0.99%**（best overall） |
| Audio Turing Test（带指令） | 0.515 posterior mean |
| EmergentTTS-Eval — Win Rate | 81.88%（最高） |
| Fish Instruction Benchmark — TAR | 93.3% |
| Fish Instruction Benchmark — Quality | 4.51 / 5.0 |
| Multilingual (MiniMax Testset) — Best WER | 24 种语言中 11 种最优 |
| Multilingual (MiniMax Testset) — Best SIM | 24 种语言中 17 种最优 |

— [fish-speech README Benchmark Results](https://raw.githubusercontent.com/fishaudio/fish-speech/main/README.md)

**厂商对比话术**：Seed-TTS Eval 上 S2 的 WER 低于所有评测模型（含闭源）：Qwen3-TTS (0.77/1.24)、MiniMax Speech-02 (0.99/1.90)、Seed-TTS (1.12/2.25)。([同上](https://raw.githubusercontent.com/fishaudio/fish-speech/main/README.md))

**⚠️ 第三方交叉验证有明显落差**：MOSS-TTS 团队表里 FishAudio-S1（4B，标注为闭源 ❌）EN WER 1.72 / SIM 62.57，**ZH CER 1.22 / SIM 72.1**；IndexTTS 团队 CV3-Eval 表里 **Fish Audio S2 Pro（4B）zh WER 3.62 / SS 67.79**，en 3.83 / 61.66。([MOSS-TTS README](https://raw.githubusercontent.com/OpenMOSS/MOSS-TTS/main/README.md)、[index-tts README](https://raw.githubusercontent.com/index-tts/index-tts/main/README.md))
→ **厂商自称中文 WER 0.54%，第三方表里 3.62% —— 差距 6.7 倍。说话人相似度（67.79）也明显低于 CosyVoice3（78–80）和 IndexTTS2.5（77.9）。**

### 5.3 流式能力

- **✅ 支持，而且是本次调研中宣称延迟最低的**。官方数据（**单张 NVIDIA H200**，SGLang 推理引擎）：

  | 指标 | 数值 |
  |---|---|
  | RTF | **0.195** |
  | **TTFA（Time-to-First-Audio）** | **~100 ms** |
  | 吞吐 | 3,000+ acoustic tokens/s（RTF < 0.5） |

  — [fish-speech README Extreme Streaming Performance](https://raw.githubusercontent.com/fishaudio/fish-speech/main/README.md)

- 论文摘要同口径：「The inference engine is production-ready for streaming, achieving an RTF of 0.195 and a time-to-first-audio below 100 ms.」([arXiv:2603.08823](https://export.arxiv.org/api/query?id_list=2603.08823))
- 架构对 LLM 同构，因此**原生化支持 SGLang 全套**：Continuous Batching、Paged KV Cache、CUDA Graph、RadixAttention 前缀缓存。

### 5.4 架构 / 显存

- **Dual-AR（主从双自回归）**：Slow AR **4B**（时间轴，预测主语义 codebook）+ Fast AR **400M**（每步生成其余 9 个残差 codebook），RVQ codec **10 codebooks @ ~21 Hz**。([README](https://raw.githubusercontent.com/fishaudio/fish-speech/main/README.md))
- **训练数据 1000 万小时音频、80+ 语言**。
- **16GB 单卡能否跑**：4B 模型 fp16 ≈ 8GB 权重，**理论可跑但余量不大**；官方未给 VRAM 数字 → **「未查到」**。生产部署官方指向 **SGLang-Omni / vLLM-Omni**（都需要较大显存）。

### 5.5 已知坑

- **商用许可已锁死**（见 5.1）—— 这可能是 2026 年选型里最容易踩的坑，因为很多老文章还写「CC-BY-NC-SA」。
- 必须走 **SGLang-Omni 或 vLLM-Omni** 才能拿到低延迟流式；普通 PyTorch 路径的性能 → 「未查到」。
- 有 sub-agent 独立任务处理 new models，此处 4B 档显存未查到。

---

## 6. MOSS-TTS（OpenMOSS / MOSI.AI）

### 6.1 来源与许可

| 项 | 内容 |
|---|---|
| GitHub | https://github.com/OpenMOSS/MOSS-TTS （**4.1k stars**，license = **Apache-2.0**，last-commit = **september** — 很活跃） |
| 论文 | **arXiv:2603.18090**《MOSS-TTS Technical Report》（2026-03-20） |
| 权重集合 | https://huggingface.co/collections/OpenMOSS-Team/moss-tts |
| ModelScope | https://www.modelscope.cn/collections/openmoss/MOSS-TTS |
| Blog | https://mosi.cn/#models |
| 相关论文 | MOSS-TTSD: arXiv:2603.19739；MOSS-VoiceGenerator: arXiv:2603.28086 |

**许可证：模型 Apache-2.0**，原文「Models in MOSS-TTS Family are licensed under the Apache License 2.0.」→ **✅ 可自由商用。**
— [MOSS-TTS README LICENSE 段](https://raw.githubusercontent.com/OpenMOSS/MOSS-TTS/main/README.md)

### 6.2 中文效果（具体数字）

**厂商数据（Seed-TTS-eval）**：

| 模型 | 参数 | EN WER (%)↓ | EN SIM (%)↑ | **ZH CER (%)↓** | **ZH SIM (%)↑** |
|---|---|---|---|---|---|
| FishAudio-S1 | 4B | 1.72 | 62.57 | 1.22 | 72.1 |
| CosyVoice3 | 1.5B | 2.22 | 72 | 1.12 | 78.1 |
| Seed-TTS | — | 2.25 | 76.2 | 1.12 | 79.6 |
| MiniMax-Speech | — | 1.65 | 69.2 | 0.83 | 78.3 |
| CosyVoice3 | 0.5B | 2.02 | 71.8 | 1.16 | 78 |
| F5-TTS | 0.3B | 2 | 67 | 1.53 | 76 |
| IndexTTS2 | 1.5B | 2.23 | 70.6 | 1.03 | 76.5 |
| VibeVoice | 1.5B | 3.04 | 68.9 | 1.16 | 74.4 |
| HiggsAudio-v2 | 3B | 2.44 | 67.7 | 1.5 | 74 |
| GLM-TTS-RL | 1.5B | 1.91 | 68.1 | **0.89** | 76.4 |
| VoxCPM | 0.5B | 1.85 | 72.9 | 0.93 | 77.2 |
| Qwen3-TTS | 1.7B | **1.5** | 71.45 | 1.33 | 76.72 |
| **MossTTSDelay** | **8B** | 1.84 | 70.86 | 1.37 | 76.98 |
| **MossTTSLocal** | **1.7B** | 1.93 | **73.28** | 1.44 | **79.62** |

— [MOSS-TTS README Evaluation](https://raw.githubusercontent.com/OpenMOSS/MOSS-TTS/main/README.md)

**MossTTSLocal（1.7B）的 ZH SIM 79.62 是该表最高**，接近 Seed-TTS 的 79.6。

**MOSS-TTSD（对话/多说话人）客观评测**（含第三方对比闭源）：MOSS-TTSD-v1.0 → ZH SIM 0.7949 / ACC 0.9587 / WER 0.0485；EN SIM 0.7326 / ACC 0.9626 / WER 0.0988，多数维度优于 Eleven V3、gemini-2.5-pro-preview-tts、Doubao_Podcast。([MOSS-TTS README MOSS-TTSD 客观评测](https://raw.githubusercontent.com/OpenMOSS/MOSS-TTS/main/README.md))

### 6.3 流式能力（**有明确 TTFB 数字**）

**MOSS-TTS-Realtime** 官方评测（**单张 L20**，开启 SDPA + torch.compile，warm up 后）：

| 模型 | **TTFB (ms)** | RTF |
|---|---|---|
| **MOSS-TTS-Realtime** | **180**（warm up 后） | **0.51** |

串联 LLM 的端到端首包：用 vLLM 部署 Qwen3.5-9B 测 `T_LLM-first-sentence` = **197 ms**（生成 12 token = TTS prefill 长度），故
**`T_LLM-first-sentence` + `T_MOSS-TTS-Realtime-TTFB` = 197 + 180 = 377 ms**。
— [MOSS-TTS README MOSS-TTS-Realtime 评测](https://raw.githubusercontent.com/OpenMOSS/MOSS-TTS/main/README.md)

> **这是「LLM 对话 + TTS」全链路首包延迟的公开可查数字，对数字人项目极有参考价值。**

**MOSS-TTS-Nano**：~100M 参数，支持多语言克隆、48 kHz 立体声，**仅 4 个 CPU 核心即可流式输出**。([README News 2026.4.13](https://raw.githubusercontent.com/OpenMOSS/MOSS-TTS/main/README.md))

### 6.4 显存 / 部署（对 16GB 卡非常友好）

- **官方明确：`Now 8B model fits onto 8GB GPUs!`**（2026.3.10 的 llama.cpp 显存优化）([README News](https://raw.githubusercontent.com/OpenMOSS/MOSS-TTS/main/README.md))
- **PyTorch-free 推理路径**：llama.cpp + ONNX Runtime，GGUF 权重在 https://huggingface.co/OpenMOSS-Team/MOSS-TTS-GGUF ，ONNX tokenizer 在 https://huggingface.co/OpenMOSS-Team/MOSS-Audio-Tokenizer-ONNX 。([README](https://raw.githubusercontent.com/OpenMOSS/MOSS-TTS/main/README.md))
- **vLLM-Omni / SGLang-Omni 全系支持**（2026.6.2 / 2026.6.18），含 OpenAI 兼容 `/v1/audio/speech`、streaming、voice cloning。
- 模型档位：**MOSS-TTS（8B, Delay 架构）**、**MOSS-TTS-Local-Transformer-v1.5（4B, Qwen3-4B 骨干 + MOSS-Audio-Tokenizer-v2 原生 48kHz 立体声）**、**MOSS-TTS-v1.5**、**MOSS-TTSD**、**MOSS-VoiceGenerator**、**MOSS-TTS-Realtime**、**MOSS-TTS-Nano（~100M）**、**MOSS-SoundEffect-v2**。
- ⚠️ **注意 8B vs 1.7B 的口径**：README 表里 `MossTTSDelay 8B` 与 `MossTTSLocal 1.7B`；但 News 里 2026.6.18 发布的 `MOSS-TTS-Local-Transformer-v1.5` 是 **4B**（Qwen3-4B）。**版本与参数量对应关系易混淆，落地前需以 HF 卡为准。**

### 6.5 已知坑

- 需要 **FlashAttention 2**（README 有 "(Optional) Install FlashAttention 2" 段）→ **sm_120 上是已知风险点**（见第 13 节）。
- 家族模型众多（8 个以上），**容易选错档位**；LLM-ASR 与双流式（TTSD）需要不同代码路径。
- 未查到针对 RTX 5060 Ti / sm_120 的官方验证。

---

## 7. F5-TTS（SWivid / SJTU X-LANCE）

### 7.1 来源与许可

| 项 | 内容 |
|---|---|
| GitHub | https://github.com/SWivid/F5-TTS （**15k stars**，license = **MIT**，last-commit = **yesterday** — 极活跃） |
| 论文 | **arXiv:2410.06885**《F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching》（ACL 2025） |
| 权重 | https://huggingface.co/SWivid/F5-TTS ；ModelScope https://www.modelscope.cn/models/SWivid/F5-TTS_Emilia-ZH-EN |
| HF Space | https://huggingface.co/spaces/mrfakename/E2-F5-TTS |
| Demo | https://swivid.github.io/F5-TTS/ |
| 相关论文 | 仓库含强制对齐版《Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis》arXiv:2502.18924 |

**许可证 MIT → ✅ 可自由商用。**([GitHub shields](https://img.shields.io/github/license/SWivid/F5-TTS.json))
**最新模型：v1 base（2025/03/12）**，其后 README News 无新版本 → **2026 年未发布新版模型**。

### 7.2 中文效果（具体数字，第三方表）

| 来源 | 中文指标 |
|---|---|
| CosyVoice 官方评测表 | test-zh **CER 1.52%**，**SS 74.1**；test-en WER 2.00 / SS 64.7；test-hard CER 8.67 / SS 71.3 |
| MOSS-TTS 评测表 | EN WER 2.00 / SIM 67；**ZH CER 1.53 / SIM 76** |
| OmniVoice 论文 Table 1 | Seed-zh SIM-o **0.750** / WER **1.53%** / UTMOS 2.93（NAR 组，0.4B） |

— [CosyVoice README](https://raw.githubusercontent.com/FunAudioLLM/CosyVoice/main/README.md)、[MOSS-TTS README](https://raw.githubusercontent.com/OpenMOSS/MOSS-TTS/main/README.md)、[arXiv:2604.00688v3](https://arxiv.org/pdf/2604.00688v3)

**→ 中文 CER ≈ 1.52–1.53%，SIM ≈ 74.1–76。属于「可用但不是第一梯队」，明显低于 CosyVoice3（78–80）与 IndexTTS2.5（77.9）。**

### 7.3 流式 / 架构 / 显存

- **❌ 无流式**。F5-TTS 是 **NAR（非自回归）+ flow matching + Diffusion Transformer + ConvNeXt V2**，整句并行生成，README 无 streaming 接口。→ 首包延迟「未查到」。
- **参数量 0.3–0.4B**（CosyVoice 表标 0.3B，OmniVoice 论文标 0.4B）。([CosyVoice README](https://raw.githubusercontent.com/FunAudioLLM/CosyVoice/main/README.md)、[arXiv:2604.00688v3](https://arxiv.org/pdf/2604.00688v3))
- **16GB 完全够**（0.3B 级）；官方未给 VRAM 数字 → 「未查到」。
- **⚠️ 支持 CPU 推理，但慢**：官方称「10 步推理约需 30 秒」。([F5-TTS README](https://raw.githubusercontent.com/SWivid/F5-TTS/main/README.md))
- **依赖**：Python ≥3.10（推荐 3.11），`torch==2.8.0+cu128` 可选；也支持 ROCm 7.2。
- **⚠️ `pynini` 在 macOS Apple Silicon 无 wheel**，需 `conda install -c conda-forge pynini`。

### 7.4 已知坑

- **无流式 → 数字人实时对话需要自己切句**。
- **v1 之后的版本停滞**（最新 2025/03），但仓库本身提交极活跃（昨天有 commit）→ 可能主要是工程/子模块维护。
- 推理步数（10 步）与 p_w/t_w 权重需要调参才能兼顾可懂度与相似度；README 给出经验：`t_w` 通常比 `p_w` 高 0–3 点。([README](https://raw.githubusercontent.com/SWivid/F5-TTS/main/README.md))

---

## 8. MegaTTS3（字节跳动 / ByteDance）

### 8.1 来源与许可

| 项 | 内容 |
|---|---|
| GitHub | https://github.com/bytedance/MegaTTS3 （**6.1k stars**，license = **Apache-2.0**，last-commit = **june**） |
| **论文** | **arXiv:2502.18924**《MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis》（v4，2025-03-28；published 2025-02-26）— 已核实 |
| 音频样例 | https://sditdemo.github.io/sditdemo/ |
| HF Space Demo | https://huggingface.co/spaces/ByteDance/MegaTTS3 |
| README 路径 | ⚠️ 是**小写 `readme.md`**（`README.md` 返回 404） |

**许可证：Apache-2.0 → ✅ 可自由商用。**([GitHub shields](https://img.shields.io/github/license/bytedance/MegaTTS3.json)、[readme.md](https://raw.githubusercontent.com/bytedance/MegaTTS3/main/readme.md) 顶部 badge 声明)

> 有趣细节：**F5-TTS 仓库里内置的强制对齐版就是 MegaTTS3 的技术路线**（F5-TTS README 引用同一篇《Sparse Alignment Enhanced Latent Diffusion Transformer》，arXiv:2502.18924）。([F5-TTS README](https://raw.githubusercontent.com/SWivid/F5-TTS/main/README.md))

### 8.2 效果与规模（**中文数字已找到**）

- 参数：README 称骨干 TTS Diffusion Transformer「only **0.45B** parameters」；论文 Table 1/2 记 **0.3B**；第三方表记 **0.5B** → **口径不一，约 0.3–0.5B**。([readme.md](https://raw.githubusercontent.com/bytedance/MegaTTS3/main/readme.md)、[arXiv:2502.18924v4](https://arxiv.org/pdf/2502.18924v4))
- 训练数据：**LibriLight**（英文为主）。([arXiv:2502.18924v4 Table 1](https://arxiv.org/pdf/2502.18924v4))
- **双语：中文 + 英文，支持 code-switching**；支持**口音强度控制**；细粒度发音/时长调整标为 "coming soon"。
- **✅ 中文 Seed-TTS-eval 数字（第三方表，OpenBMB VoxCPM2 README）**：

  | 模型 | 参数 | test-EN WER/%↓ | test-EN SIM/%↑ | **test-ZH CER/%↓** | **test-ZH SIM/%↑** |
  |---|---|---|---|---|---|
  | **MegaTTS3** | 0.5B | 2.79 | 77.1 | **1.52** | **79.0** |
  | CosyVoice3 | 0.5B | 2.02 | 71.8 | 1.16 | 78.0 |
  | Seed-TTS | — | 2.25 | 76.2 | 1.12 | 79.6 |
  | F5-TTS | 0.3B | 2.00 | 67.0 | 1.53 | 76.0 |
  | IndexTTS2 | 1.5B | 2.23 | 70.6 | 1.03 | 76.5 |
  | SparkTTS | 0.5B | 3.14 | 57.3 | 1.54 | 66.0 |
  | FireRedTTS-2 | 1.5B | 1.95 | 66.5 | 1.14 | 73.6 |

  — [OpenBMB/VoxCPM README Seed-TTS-eval 表](https://github.com/OpenBMB/VoxCPM)
  **→ MegaTTS3 中文 CER 1.52% / SIM 79.0：CER 中游，但 SIM 79.0 是这批模型里最高之一（仅次于 LongCat-Audio-DiT 的 81.8 与 VoxCPM2 的 79.5）。**
- **英文（论文原始数据，LibriSpeech test-clean，NaturalSpeech 3 口径）**：

  | 模型 | 参数 | SIM-O↑ | SIM-R↑ | WER↓ | CMOS↑ | SMOS↑ | **RTF↓** |
  |---|---|---|---|---|---|---|---|
  | GT | — | 0.68 | — | 1.94% | +0.12 | 3.92 | — |
  | VALL-E 2 | 0.4B | 0.64 | 0.68 | 2.44% | — | — | — |
  | NaturalSpeech 3 | 0.5B | 0.67 | 0.76 | 1.81% | −0.10 | 3.95 | 0.296 |
  | CosyVoice | 0.4B | 0.62 | — | 2.24% | −0.18 | 3.93 | 1.375 |
  | F5-TTS | 0.3B | 0.66 | — | 1.96% | −0.12 | 3.96 | 0.307 |
  | **MegaTTS 3** | 0.3B | **0.71** | **0.78** | 1.82% | 0.00 | **3.98** | **0.188** |
  | **MegaTTS 3-accelerated** | 0.3B | 0.70 | 0.78 | 1.86% | −0.03 | 3.96 | **0.124** |

  LibriSpeech-PC test-clean：MegaTTS3 **0.70 / 2.31%**，优于 F5-TTS（0.66/2.42%）、E2 TTS（0.69/2.95%）、CosyVoice（0.66/3.59%）。
  — [arXiv:2502.18924v4 Table 1 & 2](https://arxiv.org/pdf/2502.18924v4)
- **速度亮点**：论文摘要明确「our system can generate high-quality **one-minute speech with only 8 sampling steps**」；PeRFlow 加速版 RTF 0.124（**NVIDIA V100，batch size 1**）。([arXiv:2502.18924v4](https://arxiv.org/pdf/2502.18924v4))
- **Roadmap 最后一条是 `[2025-03-22] Our project has been released!`，此后无版本更新**；last-commit = june（2026）。→ **2025 年 3 月后无模型迭代。**

### 8.3 流式 / 显存 / 坑

- **❌ 无流式**，README 无 streaming 接口。首包延迟「未查到」。
- **0.45B 骨干 → 16GB 单卡非常轻松**；官方未给 VRAM 数字 → 「未查到」。
- **依赖**：**Python 3.10 + PyTorch 2.6.0**（badge 声明）；需 `PYTHONPATH` 指向仓库根。
- **⚠️ 明显的坑**：
  - **必须先用官方 Google Drive 服务把参考音频转成 `.npy` voice latent**：README 要求把 ≤24s 的 .wav 上传到指定 Google Drive 目录换回 .npy，本地无法自转换（门槛很高，且 Google Drive 在国内不可达）。
  - Windows 版**仍在测试中**，需注释掉 `WeTextProcessing`、改用 `pynini==2.1.5` + `WeTextProcessing==1.0.3`。
  - `pydantic` 与 `gradio` 版本必须匹配；`no_proxy` 含 `::` 会引发 httpx 报错。

— 全部出自 [readme.md](https://raw.githubusercontent.com/bytedance/MegaTTS3/main/readme.md)

---

## 9. Kokoro（hexgrad）

### 9.1 来源与许可

| 项 | 内容 |
|---|---|
| GitHub | https://github.com/hexgrad/kokoro （**8.9k stars**，license = **Apache-2.0**，last-commit = **august 2025**） |
| 模型 | https://huggingface.co/hexgrad/Kokoro-82M |
| 样本 | https://huggingface.co/hexgrad/Kokoro-82M/blob/main/SAMPLES.md |
| G2P 库 | https://github.com/hexgrad/misaki |
| PyPI | https://pypi.org/project/kokoro/ |

**许可证：Apache-2.0 → ✅ 可自由商用。**([GitHub shields](https://img.shields.io/github/license/hexgrad/kokoro.json))

### 9.2 效果 / 中文支持

- **参数量 82M**（「open-weight TTS model with 82 million parameters」）。([kokoro README](https://raw.githubusercontent.com/hexgrad/kokoro/main/README.md))
- 官方称「Despite its lightweight architecture, it delivers comparable quality to larger models」。**无任何 WER/SIM 客观数字**。
- **中文支持：✅ 有，但走 misaki 的 pinyin 路线**。README 明确列出 `🇨🇳 'z' => Mandarin Chinese: pip install misaki[zh]`，且示例里有中文/粤语样例句（含「中國人民不信邪也不怕邪…」）。([README Advanced Usage](https://raw.githubusercontent.com/hexgrad/kokoro/main/README.md))
- **⚠️ 官方无中文 WER/CER/SIM 数字，第三方对比表也全部未收录 Kokoro → 「未查到」。** 已知它进了 TTS Spaces Arena（README 致谢里提到 @Pendrokar 把 Kokoro 加进 arena）。
- **合成质量**：基于 **StyleTTS 2** 架构（致谢 @yl4579）。

### 9.3 流式 / 显存 / 坑

- **❌ 无流式**；`KPipeline` 按 `split_pattern` 切句生成（**句级切分，不是增量流式**）。首包延迟「未查到」。
- **显存需求几乎为零**：82M 参数，可纯 CPU 跑；Mac 上设 `PYTORCH_ENABLE_MPS_FALLBACK=1` 可启用 GPU。([README](https://raw.githubusercontent.com/hexgrad/kokoro/main/README.md))
- **⚠️ 依赖 espeak-ng**：非英语语言和英文 OOD 回退都依赖它（`apt-get install espeak-ng`）。这是最常见的部署坑。
- **⚠️ 项目活跃度低：last-commit = august 2025**（一年多无提交）。
- **音色数量**：社区整理了 VOICES.md（如 https://huggingface.co/Compumacy/kokoro/blob/main/VOICES.md ，为 hexgrad/Kokoro-82M 的 VOICES 镜像）。

---

## 10. ChatTTS（2noise）

### 10.1 来源与许可（**双重限制**）

| 项 | 内容 |
|---|---|
| GitHub | https://github.com/2noise/ChatTTS （**40k stars**，last-commit = **april**） |
| 模型 | https://huggingface.co/2Noise/ChatTTS |
| PyPI | https://pypi.org/project/ChatTTS |
| 扩展索引 | https://github.com/libukai/Awesome-ChatTTS |

**⚠️ 许可证是双层的，都不可商用：**

| 对象 | 许可 |
|---|---|
| **代码** | **AGPLv3+**（强 copyleft，商用/网络服务会触发源码开放义务） |
| **模型权重** | **CC BY-NC 4.0**（明文禁止商用） |

原文：「The code is published under `AGPLv3+` license.」「The model is published under `CC BY-NC 4.0` license. **It is intended for educational and research use, and should not be used for any commercial or illegal purposes.**」
— [ChatTTS README Licenses](https://raw.githubusercontent.com/2noise/ChatTTS/main/README.md)

**Agent 提醒：AGPL 对「提供网络服务」有特殊约束，即便自用也需谨慎评估。**

### 10.2 效果 / 规模

- **⚠️ 中文自然度与相似度具体数字：未查到。** README 只有定性描述「ChatTTS surpasses most of open-source TTS models in terms of prosody」；本次调研检索到的所有第三方对比表**均未收录 ChatTTS**。
- 训练数据：**中英 100,000+ 小时**；**开源的只是 40,000 小时预训练模型（未做 SFT）**。([README Dataset & Model](https://raw.githubusercontent.com/2noise/ChatTTS/main/README.md))
- **参数量：未查到**（README 未给）。
- **语言**：英文 ✅、中文 ✅（"Coming Soon" 指其他语言）。

### 10.3 流式 / 显存

- **部分支持**：Roadmap 勾选了「Streaming audio generation」，但 README **未给流式 API 示例或延迟数字** → 首包延迟「未查到」。**不是为低延迟实时对话设计的接口。**
- **显存（官方 FAQ 原文）**：「For a 30-second audio clip, **at least 4GB of GPU memory is required**. For the 4090 GPU, it can generate audio corresponding to approximately 7 semantic tokens per second. **The Real-Time Factor (RTF) is around 0.3.**」([ChatTTS README FAQ 1](https://raw.githubusercontent.com/2noise/ChatTTS/main/README.md))
- **→ 16GB 单卡轻松。** 但 **RTF 0.3 意味着实时对话余量不大**。

### 10.4 已知坑

- **官方明确警告不要装 TransformerEngine 和 FlashAttention-2**：

  > "**DO NOT INSTALL!** The adaptation of TransformerEngine is currently under development and CANNOT run properly now."
  > "**DO NOT INSTALL!** Currently the FlashAttention-2 will slow down the generating speed"
  > — [ChatTTS README](https://raw.githubusercontent.com/2noise/ChatTTS/main/README.md)

  （这反而对 sm_120 是好消息 —— 避开了 flash-attn 编译地狱。）
- **稳定性差（官方自承）**：会出现多说话人/音质问题，「This is a problem that typically occurs with autoregressive models」，「One can try multiple samples to find a suitable result」。([README FAQ 2](https://raw.githubusercontent.com/2noise/ChatTTS/main/README.md))
- **⚠️ 官方在训练时故意加了高频噪声并用 MP3 压缩音质**，以限制滥用 —— **这直接损害音质，做数字人口播是硬伤**：

  > "we added a small amount of high-frequency noise during the training of the 40,000-hour model, and compressed the audio quality as much as possible using MP3 format"
  > — [ChatTTS README Disclaimer](https://raw.githubusercontent.com/2noise/ChatTTS/main/README.md)

- **last-commit = april（2026-04）**，Roadmap 里「Multi-emotion controlling」和「ChatTTS.cpp」仍未完成 → 项目基本停滞。

---

## 11. 2026 年新出的 / 其他主流开源中文 TTS

### 11.1 ⭐ VoxCPM2（OpenBMB / 面壁智能）—— 本次调研的**重大遗漏补充**

**这是本次调研里最被低估的候选：2B、Apache-2.0、官方流式、官方宣称 VRAM ~8GB、RTF ~0.30@4090。**

| 项 | 内容 |
|---|---|
| GitHub | https://github.com/OpenBMB/VoxCPM （**38k stars**，license = **Apache-2.0**） |
| 版本 | **VoxCPM2（2026.04 发布）** — 2B 参数，2 百万小时以上多语种数据，**30 种语言**，Voice Design，Controllable Voice Cloning，**48 kHz 原生输出** |
| 骨干 | **MiniCPM-4** |
| 论文 | **arXiv:2606.06928**《VoxCPM2 Technical Report》（2026-06-05）— 已核实 |
| 旧版论文 | **arXiv:2509.24650**《VoxCPM: Tokenizer-Free TTS for Context-Aware Speech Generation and True-to-Life Voice Cloning》 |
| 架构 | 无 tokenizer、扩散自回归；全程在 **AudioVAE V2** 隐空间：`LocEnc → TSLM → RALM → LocDiT` |
| LM token rate | 6.25 Hz（对比 CosyVoice 系 12.5 Hz） |

— [github.com/OpenBMB/VoxCPM README](https://github.com/OpenBMB/VoxCPM)、[GitHub shields](https://img.shields.io/github/license/OpenBMB/VoxCPM.json)

**✅ 许可证：Apache-2.0，代码与权重均开源，官方原文「Fully Open-Source & Commercial-Ready — Weights and code released under the Apache-2.0 license, **free for commercial use**」。→ 可自由商用。**([README](https://github.com/OpenBMB/VoxCPM))

**中文效果（Seed-TTS-eval）**：

| 模型 | 参数 | test-EN WER/%↓ | test-EN SIM/%↑ | **test-ZH CER/%↓** | **test-ZH SIM/%↑** | test-Hard CER/%↓ | test-Hard SIM/%↑ |
|---|---|---|---|---|---|---|---|
| **VoxCPM2** | **2B** | 1.84 | 75.3 | **0.97** | **79.5** | 8.13 | 75.3 |
| VoxCPM-0.5B | 0.6B | 1.85 | 72.9 | 0.93 | 77.2 | 8.87 | 73.0 |
| VoxCPM1.5 | 0.8B | 2.12 | 71.4 | 1.18 | 77.0 | 7.74 | 73.1 |
| **LongCat-Audio-DiT** | 3.5B | 1.50 | **78.6** | 1.09 | **81.8** | 6.04 | **79.7** |
| FishAudio S2 | 4B | **0.99** | — | **0.54** | — | 5.99 | — |
| MegaTTS3 | 0.5B | 2.79 | 77.1 | 1.52 | 79.0 | — | — |
| MOSS-TTS | — | 1.85 | 73.4 | 1.20 | 78.8 | — | — |
| Qwen3-TTS | 1.7B | 1.23 | 71.7 | 1.22 | 77.0 | 6.76 | 74.8 |
| IndexTTS2 | 1.5B | 2.23 | 70.6 | 1.03 | 76.5 | 7.12 | 75.5 |
| Qwen3-Omni | 30B-A3B | 1.39 | — | 1.07 | — | — | — |
| CosyVoice3 | 0.5B | 2.02 | 71.8 | 1.16 | 78.0 | 6.08 | 75.8 |

— [OpenBMB/VoxCPM README Seed-TTS-eval 表](https://github.com/OpenBMB/VoxCPM)（**注意：这是 OpenBMB 自家整理的对比表，属厂商侧第三方表，引用需注明**）

**CV3-eval 多语种 CER/WER**：VoxCPM2 → zh 3.65 / en 5.00 / hard-zh 8.55 / ja 5.96 / ko 5.69 / de 4.77 / es 3.80 / fr 9.85 / it 4.25 / ru 5.21；**Fish Audio S2 在 zh(2.65)/en(2.43) 上明显更好**。([同上 README CV3-eval 表](https://github.com/OpenBMB/VoxCPM))

**⚡ 流式能力（本次调研中「真开源 + 官方流式」的最强候选之一）**：

| 档位 | RTF (RTX 4090)↓ | RTF in Nano-VLLM (RTX 4090)↓ | **VRAM** |
|---|---|---|---|
| **VoxCPM2** | **~0.30** | **~0.13** | **~8 GB** |
| VoxCPM1.5 | ~0.15 | ~0.08 | ~6 GB |
| VoxCPM-0.5B | ~0.17 | ~0.10 | ~5 GB |

— [OpenBMB/VoxCPM README 对比表](https://github.com/OpenBMB/VoxCPM)

- **有官方流式 API**：`model.generate_streaming(...)` 直接 yield chunk（README 明确给出该 API 与示例代码）。
- **Nano-vLLM**：`pip install nano-vllm-voxcpm`，专为 VoxCPM 做的推理引擎，支持并发请求 + async API，**RTF ~0.13@4090**。
- **vLLM-Omni 官方支持**：`vllm serve openbmb/VoxCPM2 --omni --port 8000`，原生 **PagedAttention KV cache、continuous batching、OpenAI 兼容 `/v1/audio/speech`、streaming chunk delivery、多卡**。
- **llama.cpp / GGUF 路径**：RTF ~1.76（Q8_0, Apple M4 Pro / Metal），有 `--stream` 标志。
- **⚠️ 官方未给 TTFB（首包延迟）毫秒数 → 「未查到」**（只给了 RTF）。RTF ~0.13（Nano-vLLM）意味着生成速度是实时的 7.7 倍，首包延迟主要取决于 chunk 策略。

**→ 16GB 单卡（RTX 5060 Ti）可跑性：✅ 官方标 ~8GB VRAM，16GB 余量充足。**

**其他新模型确定性线索**（来自已抓取的第三方表）：
- **VoxCPM2 / Qwen3-TTS / FireRedTTS-2 / Step-Audio / Spark-TTS / Higgs Audio v2 / VibeVoice / Sesame CSM / GLM-TTS / LongCat-AudioDiT 的仓库、许可证、显存已核实完毕** → 见下方 11.2 – 11.9（完整证据另见 `_raw_TTS_newmodels.md`，105 KB / 1310 行 / 120 条实抓 URL）。

### 11.2 ⭐⭐ Qwen3-TTS（阿里巴巴 Qwen）—— **本次调研的「sm_120 零风险 + 可商用 + 97ms」冠军**

| 项 | 内容 |
|---|---|
| GitHub | **https://github.com/QwenLM/Qwen3-TTS** — **13k stars**，**License = Apache-2.0**（LICENSE 全文已抓），last-commit = **march** |
| HuggingFace | **https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice**（同系列另有 `-Base` / `-VoiceDesign` / `0.6B-*` / `Qwen/Qwen3-TTS-Tokenizer-12Hz`） |
| **论文** | **arXiv:2601.15621** ✅ 已用 arXiv API 核实为真：《Qwen3-TTS Technical Report》，发布 **2026-01-22** |
| 参数 | 已发布 **1.7B / 0.6B** 两档；`Qwen3-TTS-12Hz-1.7B-Base` 实际张量数 **1,928,677,440 ≈ 1.93B（BF16）**（HF API 精确值，非估算） |
| tokenizer | 自研 **Qwen3-TTS-Tokenizer-12Hz**（12 Hz 离散多码本 LM） |
| 语言 | 10 种（中英日韩德法俄葡西意）+ 多方言音色 |

**✅ 许可证：Apache-2.0（代码 + HF 权重 tag 均为 Apache-2.0）→ 可自由商用。**

**中文效果**：

| 口径 | 指标 |
|---|---|
| **厂商自报**（Seed-TTS test set） | 12Hz-**1.7B**-Base：test-zh WER **0.77** / test-en WER 1.24；12Hz-0.6B-Base：test-zh **0.92** / test-en 1.32（同表 CosyVoice 3 为 0.71/1.45，MiniMax-Speech 0.83/1.65，Seed-TTS 1.12/2.25） |
| **厂商自报**（说话人相似度） | Chinese Speaker Similarity：12Hz-**0.6B = 0.811**、12Hz-1.7B = 0.799（同表 MiniMax 0.780、ElevenLabs 0.677） |
| **第三方**（VoxCPM2 / MOSS-TTS 表） | 1.7B：**ZH CER 1.22 / SIM 77.0**；MOSS 表 1.7B：ZH CER 1.33 / SIM 76.72；0.6B：ZH CER 1.23 / SIM 76.4 |

> **⚠️ 口径差异**：Qwen 自报 **0.77** vs 第三方 **1.22–1.33**（差约 1.6–1.7 倍）。差异可能来自 `language="auto"`、max_new_tokens、参考音色选择。**选型请按第三方保守估计。**
> **缺失**：UTMOS / 自然度、RTF、VRAM **均未查到**（README 只说 "recommend using FlashAttention 2 to reduce GPU memory usage"）。

**⚡ 流式能力**：
- **✅ 原生流式**：「Dual-Track hybrid streaming generation architecture，单个模型同时支持流式与非流式」。
- **首包延迟：低至 97 ms** —— 官方原文："It can output the first audio packet immediately after a single character is input, with **end-to-end synthesis latency as low as 97ms**"。**这是本次调研中最低的官方数字。**
- RTF：「未查到」。

**🟢 sm_120 / Blackwell：本次调研中唯一「零 issue」的模型** —— 专项检索 `repo:QwenLM/Qwen3-TTS+sm_120` → **total_count = 0**。

**已知坑**：
- 环境：Python 3.12 fresh conda env；`pip install -U qwen-tts`；**推荐 FlashAttention 2**（`MAX_JOBS=4`）。
- ⚠️ **issue #372（open）：官方微调脚本硬编码 `attn_implementation="flash_attention_2"`** → 没装 flash-attn 或硬件不支持 FA2 时**开箱即失败**（有修复 PR #373）。**不微调则不受影响。**
- 其他 open issue：#350 多并发推理不支持、#369/#370 25Hz tokenizer 的 `qkv_attention_manual` 未掩码 padding keys、#124/#345 macOS/MPS 支持、#179 微调 Base 每 epoch 语速变快。
- **VRAM 未公布 → 必须实测。**

**→ 结论：Qwen3-TTS 是本报告推荐的「实时对话链路」最优候选之一**（97ms + 原生流式 + Apache-2.0 + **sm_120 零风险**）。结合姊妹报告里 LiveTalking 作者实测的「**Qwen3-TTS-0.6B + vLLM-Omni 首包 ~130ms @ RTX 3090**」，它是**唯一同时满足「可商用 + 低延迟 + 无 Blackwell 兼容风险」的选项**。

### 11.3 ⭐⭐ LongCat-AudioDiT（美团）—— **中文相似度最高（81.8）+ MIT，但非流式**

| 项 | 内容 |
|---|---|
| GitHub | **https://github.com/meituan-longcat/LongCat-AudioDiT** |
| License | **MIT**（LICENSE 全文已抓，Copyright (c) 2026 Meituan）→ **✅ 可自由商用** |
| HuggingFace | **https://huggingface.co/meituan-longcat/LongCat-AudioDiT-3.5B**（另有 `-1B`）；HF license tag = **`mit`** |
| **论文** | **arXiv:2603.29339** ✅《LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space》，**2026-03-31** |
| 参数 | **3.83B**（HF API 精确张量数），权重 dtype = **F32** |

**中文效果（Seed-TTS test-zh，第三方表）**：**CER 1.09 / SIM 81.8 ← 本次调研所有表中中文说话人相似度最高**；EN WER 1.50 / SIM 78.6；hard-zh CER 6.04 / SIM 79.7。([OpenBMB/VoxCPM 表](https://github.com/OpenBMB/VoxCPM))

**❌ 流式：非自回归扩散架构 → 不支持流式**，TTFB / RTF **均未查到**。

**→ 对本项目（离线口播）的含义（重要）**：**「非流式」在离线口播场景完全不是缺点** —— 下游 A 类音频驱动模型本来就要一段完整音频。**「MIT + 中文 SIM 81.8 全场最高 + 3.83B」使它成为离线高质量兜底的最强候选**，且许可比 IndexTTS-2.5（有营收门槛）更宽松。
**短板**：① 显存未公布，3.83B **F32** 权重意味着磁盘与显存开销偏大（F32 约 15GB 权重 → **16GB 卡需转 bf16/fp16 或量化，有风险，需实测**）；② sm_120 实测未查到。

### 11.4 FireRedTTS-2（小红书 FireRedTeam）

| 项 | 内容 |
|---|---|
| GitHub | **https://github.com/FireRedTeam/FireRedTTS2** |
| License | **Apache-2.0**（代码 + HF tag）→ ✅ **可商用** |
| HF | FireRedTTS-2 权重（HF tag = apache-2.0） |

- **参数 1.5B**；**显存：bf16 9GB / fp32 14GB**（厂商自报）→ **16GB 可跑（bf16 余量约 7GB）**。
- **中文（第三方三家一致）**：test-zh **CER 1.14 / SIM 73.6**；EN WER 1.95 / SIM 66.5。
- **⚡ 流式：✅ 支持；首包延迟 140 ms（L20，厂商自报）**。支持 **4 说话人 3 分钟对话**。
- **已知坑**：⚠️ **锁 `torch 2.7.1 + cu126`** → 与本机 cu128/cu130 需对齐（cu126 不含 sm_120）→ **这是它的主要风险**；未检索到 sm_120 issue。
- 定位：**长对话/多说话人场景强**，适合播客、多人对白。

### 11.5 MOSS-TTS 家族（补充：Realtime 档）

（完整内容见第 6 节）**MOSS-TTS-Realtime：TTFB 180ms / RTF 0.51（单卡 L20），Apache-2.0**。**⚠️ 需 FlashAttention 2**（sm_120 风险），但有 **llama.cpp / ONNX 无 torch 路径**可绕开。**建议纳入候选池。**

### 11.6 GLM-TTS（智谱 / zai-org）⚠️ 许可文档冲突 + 5060 Ti 专项 issue

| 项 | 内容 |
|---|---|
| GitHub | **https://github.com/zai-org/GLM-TTS** |
| License | ⚠️ **冲突**：GitHub `LICENSE` = **Apache-2.0**，HF 模型卡 frontmatter = **`license: mit`**。两者都可商用，但**文档不一致需法务确认** |
| 中文 | **GLM-TTS_RL：CER 0.89 / SIM 76.4**；GLM-TTS Base：CER 1.03 / SIM 76.1（**厂商自报与第三方表完全一致**，可信度较高） |
| 流式 | ✅ 支持（需 vLLM 后端）；**首包延迟 / RTF 未查到** |

**🔴 关键坑（与我们的硬件完全一致）**：**GitHub issue #9 —— 「RTX 5060 Ti 16G 上 GPU 利用率仅 40%」**，用户质疑是 float32 导致。**这是本次调研中唯一一条直接报告在 5060 Ti 16GB 上性能异常的 TTS issue。** 若要选它，必须先复现该 issue。

### 11.7 ⚠️ 因许可证被排除的三个「曾经很热」的模型

| 模型 | 排除原因（**证据**） |
|---|---|
| **Spark-TTS**（SparkAudio） | ⚠️ **许可证致命冲突**：GitHub `LICENSE` = **Apache-2.0**，但 **HF 权重模型卡 license = `cc-by-nc-sa-4.0`（禁止商用）**。→ **代码可商用、权重不可商用 → 整体判定不可商用。**（另：中文 SIM 66.0 是本表最低之一；RTF 0.1362@L20 但**非流式**，平均延迟 876ms；1.5 年未更新） |
| **Higgs Audio v2**（Boson AI） | ⚠️ **主线已转非商用**：仓库 README 现已改推 **Higgs Audio v3**，其许可为 *Boson Higgs Audio v3 Research and **Non-Commercial** License*；v2 文档被挪到 `README_V2.md`（代码 Apache-2.0，但 HF 权重 license = **`other`（含义不明）**）。**且 v2/v3 均未查到 arXiv 论文**（只有博客）。**VRAM 要求 ≥24 GB（README 明文）→ 16GB 不可跑。** 另有 sm_120 坑：#39 Blackwell Docker 支持（open）、#177 `libcudart.so.13` 加载失败（open） |
| **VibeVoice**（Microsoft） | ⚠️ **TTS 代码已被微软下架**（**2025-09-05**，理由「被广泛滥用」），官方模型表把 **VibeVoice-TTS-1.5B 标为 `Disabled`**；官方 README 明文「**不建议用于商业或真实场景**」。当前活跃的是 **VibeVoice-Realtime-0.5B**（**仅英文 + 单说话人**，首音 ~200/~300ms 官方两处冲突，取保守 300ms）。**虽然 LICENSE 是 MIT，但官方明确劝退商用。** |

### 11.8 ⚠️ Sesame CSM / Step-Audio 2（数据缺口较大）

- **Sesame CSM**（`SesameAILabs/csm`，15k stars，Apache-2.0，1.55B F32）：**官方自述非英语 "likely won't do well"；中文 CER/SIM 均未查到；无 arXiv 论文。** sm_120 坑：**issue #118 —— RTX 5080 的 sm_120 与当前 PyTorch 不兼容（closed）**。→ **不适合中文项目。**
- **Step-Audio 2 / mini**（`stepfun-ai/Step-Audio2`，Apache-2.0，**8.32B**）：**TTS 侧中文 CER/SIM 均未查到**（只有 ASR 指标）；需 vLLM 后端；**显存未查到**（8.32B → 16GB 紧张）。→ 本项目不推荐，但**Step Audio EditX 在 Artificial Analysis 上开源 Elo 1094**（英文），值得关注。
- **MiniMax-Speech**：**无开源仓库**（repo not found）。**Qwen3-TTS-Flash**：**闭源 API，无权重**。

### 11.9 ZipVoice（k2-fsa / 小米）—— 超轻量但非流式

- **参数量仅 123M**，Apache-2.0（可商用），NAR flow-matching。Seed-zh **SIM-o 0.751 / WER 1.40 / UTMOS 3.15**（OmniVoice 论文 Table 1）。
- **❌ 非流式**；**k2 预编译包主要面向 cu12.x → CUDA 13 / sm_120 大概率需自行编译**（风险中高）。

### 11.10 新模型诚实性对照：四个「口径必须标注」的坑

| 模型 | 厂商自报 | 第三方 | 差异 |
|---|---|---|---|
| **Qwen3-TTS-1.7B** | ZH CER **0.77** | ZH CER **1.22–1.33** | 差 1.6–1.7× |
| **Fish Audio S2 Pro** | ZH WER **0.54** | CV3-Eval **3.62** | 差 **6.7×** |
| **OmniVoice** | SeedTTS ZH CER **0.84** | CV3-Eval ZH WER **3.41** | 差 **4×** |
| **GPT-SoVITS** | SeedTTS ZH WER **1.6** | CV3-Eval ZH CER **7.34** | 差 **4.6×** |

→ **「哪个中文 TTS 最强」高度依赖榜单与自测条件。任何单一数字都不足以定论。**

---

## 12. 与实时数字人框架的现成集成

> ✅ **本节已完成**：完整证据见 `_raw_TTS_digitalhuman_integration.md`（64 KB / 1174 行；位于本目录，另有 `_scratch/` 副本，含 101 条实抓 URL + 「未查到项汇总」）。
> 另可交叉参考同目录姊妹报告 `实时交互数字人与TTS调研.md`（另一个 DSH agent 产出，含数字人驱动框架与 TTS 的配对方案）。

### 12.1 框架 → 原生支持的 TTS 清单（**按源码/README 原文**）

| 框架 | 星标 · 许可证 · last-commit | **原生支持的 TTS（原文枚举）** | 可插拔 | TTS 输出格式约束 |
|---|---|---|---|---|
| **LiveTalking** `lipku/LiveTalking` | 9.6k · **Apache-2.0** · september | `edgetts / gpt-sovits / cosyvoice / fishtts / tencent / doubao / indextts2 / azuretts / qwentts`（config.yaml 原注释）；代码另有 `xtts`、`omnitts` | ✅ **完全可插拔**：`registry.py` 的 `@register("tts", name)` | **硬编码 16000 Hz 单声道 int16；chunk = 16000//(fps*2) = 320 samples = 20 ms**；REF_FILE 要求 "wav, 16kHz, mono" |
| **OpenAvatarChat** `HumanAIGC-Engineering/OpenAvatarChat` | 3.8k · **Apache-2.0** · july | **仅 3 个**：EdgeTTS / CosyVoice（本地）/ 百炼 CosyVoice（API）（Qwen-Omni 模式下 TTS 由模型本体出） | ✅ Handler 插件（`handler_search_path` + `module:`） | `sample_rate` 默认 **24000**，单声道，可配 |
| **Fay** `xszyou/Fay` | 14k · **GPL-3.0** · yesterday | `azure / ali / gptsovits / volcano / gptsovits_v3`（system.conf.bak 原注释） | ⚠️ 仅配置切换（`tts_module`），换新引擎要改代码 | Azure `Riff16Khz16BitMonoPcm`；阿里 16 kHz 单声道 WAV；Edge 出 mp3 → pydub 转 wav |
| **Linly-Talker** `Kedreamix/Linly-Talker` | 3.5k · **MIT** · february | **Edge TTS / PaddleTTS / GPT-SoVITS（README 标 Recommend）/ XTTS / CosyVoice** | ⚠️ 模块化流水线，无配置式注册表 | 未查到 |
| **Duix.Heygem**（**已改名 `duixcom/Duix.Avatar`**） | 16k · not identifiable · april | **仅 `fish-speech-ziming`**（`guiji2025/fish-speech-ziming` Docker）；致谢原文 "TTS based on fish-speech-ziming" | ❌ 固定 Docker 微服务，无替换机制 | `"format": "wav"` 标 Fixed parameter；**`"streaming": false` 固定关闭流式** |
| **aigcpanel** `modstart-lib/aigcpanel` | 5.6k · **Apache-2.0** · last friday | **CosyVoice-300M / -300M-Instruct / CosyVoice2-0.5b / FishSpeech / IndexTTS / SparkTTS / GPT-SoVITS** | ✅ 模型市场启动包 + 远程 API | 未查到 |
| **SoulX-FlashTalk** `Soul-AILab/SoulX-FlashTalk` | 1.5k · Apache-2.0 · july | **无任何 TTS**（grep "tts" = **0 次**）；纯 audio-driven | ❌ 无 TTS 层 | 输入音频 **16000 Hz 单声道**，按帧切 640 samples（=40ms@25fps），`cached_audio_duration: 8` |
| **Ultralight-Digital-Human** `anliyuan/…` | 2.6k · not specified · july | **无任何 TTS**（grep "tts" = **0 次**）；wav→.npy 特征驱动 | ❌ 无 TTS 层 | **16000 Hz**；wenet→20fps / hubert→25fps（默认分支是 **master** 不是 main） |
| **Open-LLM-VTuber**（参考，插拔性最好） | 14k · not identifiable · may | sherpa-onnx / pyttsx3 / MeloTTS / Coqui-TTS / GPTSoVITS / Bark / CosyVoice / Edge TTS / Fish Audio / Azure TTS（+ "etc."） | ✅✅ 配置切换 + 可自行新增模块 | 未查到 |

— 完整出处（每个都实抓）：[LiveTalking README](https://raw.githubusercontent.com/lipku/LiveTalking/main/README.md) · [LiveTalking config.yaml](https://cdn.jsdelivr.net/gh/lipku/LiveTalking@main/config.yaml) · [LiveTalking OmniTTS 文档](https://doc.livetalking.ai/docs/tts/omnitts/) · [OAC 预置模式](https://humanaigc-engineering.github.io/OpenAvatarChat/reference/preset-modes) · [Fay system.conf.bak](https://raw.githubusercontent.com/xszyou/Fay/master/system.conf.bak) · [Linly-Talker README](https://raw.githubusercontent.com/Kedreamix/Linly-Talker/main/README.md) · [aigcpanel README](https://raw.githubusercontent.com/modstart-lib/aigcpanel/main/README.md) · [SoulX infer_params.yaml](https://cdn.jsdelivr.net/gh/Soul-AILab/SoulX-FlashTalk@main/flash_talk/configs/infer_params.yaml)

### 12.2 ⚠️ 三处必须更正的仓库 owner（任务书给的有误）

1. **`HumanAIGC/OpenAvatarChat` 不存在** → 正确是 **`HumanAIGC-Engineering/OpenAvatarChat`**（shields.io 返回 repo not found）
2. **`Korvo-AI/Linly-Talker` 不存在** → 正确是 **`Kedreamix/Linly-Talker`**
3. **`duixcom/Duix.Heygem` 已改名** → **`duixcom/Duix.Avatar`**（两者 stars/license/last-commit 三项完全一致，README 正文即 "Duix.Avatar"）

（`modstart-lib/aigcpanel` 确认无误。）

### 12.3 对 TTS 选型的硬约束（**最可操作的一条**）

**LiveTalking 硬编码 `sample_rate = 16000`、`chunk = 16000//(fps*2) = 320 samples = 20 ms`，且参考音频要求 "wav, 16kHz, mono"。**
→ **任何自定义 TTS 必须能输出 16 kHz 单声道 int16、按 20 ms 分块**。而本报告里多数模型原生输出 **22.05 kHz（IndexTTS-2.5）/ 24 kHz（OmniVoice、Kokoro、ChatTTS）/ 48 kHz（VoxCPM2、GPT-SoVITS v4、MOSS-Audio-Tokenizer-v2）** → **接入前必须做重采样**（CosyVoice 系列原生 24 kHz 也需转）。
纯 audio-driven 项目（SoulX-FlashTalk `sample_rate: 16000`、Ultralight「音频采样率需要是 16000」）同样收敛到 **16 kHz 单声道**。
→ **本项目走「离线口播成片」，下游 A 类音频驱动模型一律吃 16 kHz 单声道 WAV，所以 TTS 侧的采样率差异不是障碍，只需一次 ffmpeg 重采样。**

### 12.4 各框架的延迟 / 流式要求

- **LiveTalking**：官方**无 TTFB 硬阈值**（FAQ 未涉及 TTS），但架构**强制流式 + 20 ms 帧**（所有云端实现都打印 "Time to first chunk"）。官方 OmniTTS 文档给出各模型显存/延迟：**Qwen3 12G、VoxCPM2 13G、Fish Speech 18G、IndexTTS 17G「延时 4s」、CosyVoice 14G**。
- **OpenAvatarChat**：只给**系统级**「平均响应时间仅 2.2 秒」，无 TTS 级指标；内部按标点切句流式提交。([OAC 预置模式文档](https://humanaigc-engineering.github.io/OpenAvatarChat/reference/preset-modes))
- **Duix.Avatar**：`"streaming": false` **固定关闭流式** → 离线任务式，**无实时要求**（与本项目的离线口播形态一致）。

### 12.5 2026 社区推荐（第三方转述，**未回溯原始模型卡，引自 subagent 报告**）

- **CSDN《LiveTalking 部署笔记》**（2026-01-24 / 03-30 更新）给出 LiveTalking 专用 tts 选型排序：
  **IndexTTS2（首包 ≈1.2 s、8 GB，✅非常适合）≈ FishTTS/FishSpeech（首帧 <500 ms、3.2 GB，✅非常适合）> CosyVoice（流式首包 <150 ms、≈6 GB，⭐可考虑）> XTTS（⚠️）> SoVITS / EdgeTTS（❌）**
  — 这些**全部都在 LiveTalking 原生枚举内**。([CSDN jacke121](https://blog.csdn.net/jacke121/article/details/157323875))
- **掘金《开源 TTS 模型横向对比（2026 版）》**（2026-06-12）：首包延迟 —— **Qwen3-TTS 97 ms、CosyVoice2 150 ms、Qwen TTS Realtime <200 ms、Fish Audio S2 <150 ms**；并明确 **IndexTTS2 的时长控制「对口型同步 / 虚拟人字幕对齐非常有意义」**，CosyVoice 是「最适合作为本地中文 TTS 工程底座」。
  — ⚠️ **该文许可证/延迟为第三方转述，subagent 未回溯原始模型卡**。([掘金](https://juejin.cn/post/7649764223339495475))

### 12.6 本项目（离线口播）的实际含义

| 结论 | 依据 |
|---|---|
| **数字人驱动层几乎都不带 TTS，TTS 由你自由选** | SoulX-FlashTalk 与 Ultralight 的 README 中 "tts" 命中数均为 **0** |
| **「现成集成」只在实时框架里才重要** | LiveTalking / OpenAvatarChat / Fay / Linly-Talker / aigcpanel 有内置枚举；纯音频驱动项目没有 TTS 层，因此**不存在「不支持某 TTS」的问题** |
| **只需要 16 kHz 单声道 WAV** | LiveTalking / SoulX-FlashTalk / Ultralight 三处独立确认 |
| **许可证是更该担心的** | `Fay 是 GPL-3.0`（README 自称「商用免责」只是作者口头承诺，**不是许可证授予的额外权利**）；`Duix.Avatar` 许可字段不可识别；`OmniVoice 权重 CC-BY-NC`、`Fish Audio S2 Pro` 均不可商用 |
| **流式只在接实时框架时才是硬门槛** | 离线口播用「整段音频」即可，非流式的 IndexTTS-2.5 / OmniVoice / F5-TTS / GPT-SoVITS 都可用 |

> **⚠️ 另一处与本报告相关的坑（来自姊妹报告 `实时交互数字人与TTS调研.md`，需自行复核）**：`OpenAvatarChat` 的 `pyproject.toml` 钉 **PyTorch 2.4.1 + CUDA 12.4（不含 sm_120 kernel）**，Blackwell 上必须自行升到 cu128/cu130；`MOSS-TTS` / `OpenAvatarChat` / `SoulX-FlashHead` 都要求 **flash-attn**，而 flash-attn **无 sm_120 预编译 kernel**。

---

## 13. 横切问题：sm_120 / Blackwell / RTX 5060 Ti 16GB 兼容性

本次调研的**硬约束**是「RTX 5060 Ti 16GB，sm_120（Blackwell）」。

### 13.1 已知的真实报错（第三方来源）

```
flash_attn nvcc fatal : Unsupported gpu architecture 'compute_120'
```
— 博客园（2026-04-03）记录安装 flash-attention 时的这个报错，并提到「CUDA 版本不匹配」与「显卡架构不被支持」两类原因。[cnblogs.com/xyz/p/19817397](https://www.cnblogs.com/xyz/p/19817397)

**相关上游修复线索**（说明 sm_120 支持是 2026 年才在补的）：
- Triton PR #9734「[NVIDIA] Fix PTX codegen segfaults on consumer Blackwell (sm_120)」— https://github.com/triton-lang/triton/pull/9734
- SGLang PR #36566「fix(qsa): allow trtllm sparse decode on SM120/SM121」— https://github.com/sgl-project/sglang/pull/36566

**补齐的 sm_120 坑清单（来自同目录姊妹报告 `实时交互数字人与TTS调研.md` 第 3.1 节，标注其来源等级）**：

| 坑 | 现象 | 证据 |
|---|---|---|
| **FlashAttention-2 无 sm_120 预编译 kernel** | `no kernel image is available for execution on the device`；源码编译 `nvcc fatal: Unsupported gpu architecture 'compute_120'` | 🟢 [Dao-AILab/flash-attention#2168](https://github.com/Dao-AILab/flash-attention/issues/2168)；[cnblogs 2026-04-03](https://www.cnblogs.com/xyz/p/19817397) |
| **SageAttention 2.2.0 官方构建无 sm_120 内核** | 超长序列走 triton JIT → **GSP 挂死 → GPU 掉总线** | 🟢 本机 2026-09-14 实测（H3 场景，一夜 4 次掉总线全部走 SageAttention 路径） |
| **onnxruntime-gpu 官方 wheel 缺 sm_120** | LivePortrait 硬钉 `onnxruntime-gpu==1.18.0`（2024 构建）；[onnxruntime#27621](https://github.com/microsoft/onnxruntime/issues/27621) 报告 Blackwell 上 CUDA EP **静默死锁** | 🟢 |
| **torch 必须 cu128 及以上** | cu121/cu124 wheel 不含 sm_120 → 加载即报 no kernel image | 🟢 本机实测 `torch 2.11.0+cu130` 的 arch_list 含 `sm_120`（**本机已就绪**） |
| **`libnvrtc-builtins.so` 版本错配** | torch 是 cu130 而系统 CUDA 是 13.1 → 找不到 `libnvrtc-builtins.so.13.0` | 🟢 本机 2026-09 实测 |

**对本报告 TTS 清单的直接影响**：
- **MOSS-TTS**（要求 FlashAttention 2）→ **sm_120 上必须自行编译或绕开**（可走 llama.cpp / ONNX 无 torch 路径规避）
- **OmniVoice** 的 FlashInfer 加速路径（`flashinfer-jit-cache==...+cu128`）→ 需确认有 sm_120 内核
- **GPT-SoVITS / ChatTTS / Kokoro**：**天然规避**（官方明确禁用 flash-attn，或有 SDPA/CPU 回退）
- **Fun-CosyVoice3**：有 SDPA 路径，风险低

### 13.1b ⭐ TTS 专属：**点名 RTX 5060 Ti 的实测 issue**（最高价值证据）

**结论先行：没有一个 TTS 框架是「天生不支持 sm_120」，全部是「整合包 / requirements 钉死了旧 torch（≤2.3/2.4，只编到 sm_90）」导致的。换 cu128 的 torch ≥2.7 基本都能解。**（来自 `_raw_TTS_benchmarks.md`）

| 框架 | 具体 issue | 报错原文 / 现象 |
|---|---|---|
| **CosyVoice** | **issue #1815 直接点名 RTX 5060 Ti** | Error A = torch 2.4+ 移除 `ProcessGroup.options`；Error B（按 requirements 降级）= `sm_120 … supports up to sm_90. Note: **RTX 50-series cards require modern CUDA toolkits and PyTorch versions not covered by the current requirements**`；Error C = hyperpyyaml/ruamel.yaml 依赖冲突。→ **升 torch 2.7/2.8 + cu128 可解**（requirements 里 torch 2.3.1 只到 sm_90） |
| **GPT-SoVITS** | issue **#2205 / #2514 / #2393 / #2394**，并有开着的 DDP 修复 PR **#2774** | `sm_120 is not compatible with the current PyTorch installation…supports sm_37…compute_37`（#2205）；`RuntimeError: no kernel image is available`（#2514，该用户误装 cu121 nightly）；**⚠️ 在 5060 Ti 上「GPT 模型可以训练、SoVITS 模型训练报错」**（#2393/#2394，卡在 `s2_train.py` 的 `mp.spawn`）→ **推理不受影响，只有训练受影响** |
| **ChatTTS** | `jianchang512/ChatTTS-ui` 整合包 issue **#290** | 5070 Ti 报同样的 sm_120 不兼容 |
| **Fish-Speech S2 Pro** | 上游 vLLM-Omni 配方在 sm_120 上**确实是坏的** | "FlashAttention-3 ships kernels only for **Hopper sm90a / Blackwell-Ultra sm120a**, and SGLang is blocked on sm_120" → 第三方 `Genesis1231/fish-s2-rtx` 给出可用容器（vLLM-Omni 0.22 + **torch 2.11 + cu130 + sm_120 kernels**），并提示 **prefix caching 会产生空音频需关闭** |
| **flash-attn** | issue **#2016** 给出**免编译可用组合** | **Python 3.10 + CUDA 12.8 + torch 2.7.1**，然后 `pip install flash_attn==2.8.0.post2 torch==2.7.1 --no-build-isolation` |
| **IndexTTS / F5-TTS / MegaTTS3 / MOSS-TTS** | **sm_120 实测未查到** | index-tts issue #242「能用 RTX50 系显卡跑吗？」与 sneekes.app 的 RTX5070 F5-TTS 安装指南两次抓取均超时 |

> **→ 对本项目的落地含义（很重要）**：
> 1. **CosyVoice 在国内流传的 requirements 是「装了就在 5060 Ti 上必挂」的**。本报告推荐 Fun-CosyVoice3 时，必须**显式把 torch 升到 ≥2.7 + cu128/cu130**，不要照抄 requirements。
> 2. **GPT-SoVITS 在 5060 Ti 上推理可用、训练会崩**（`s2_train.py` 的 `mp.spawn`）→ 若只需推理（本项目正是如此），风险可控。
> 3. **Fish Audio S2 Pro 的流式路径（vLLM-Omni/SGLang）在 sm_120 上被 FA3 阻断** —— 又一个不利因素（叠加其不可商用）。
> 4. 需要 flash-attn 的项目，**先用 flash-attention#2016 的免编译组合试**，别一上来就源码编译。

### 13.2 各模型对 16GB / sm_120 的适配评估

| 模型 | 参数 | 16GB 可跑 | sm_120 实测/issue | 主要风险 |
|---|---|---|---|---|
| **⭐ Qwen3-TTS** | 1.7B（实 1.93B）/ 0.6B | 未查到 VRAM（需实测） | 🟢 **专项检索 total_count = 0 —— 本次调研中唯一「零 sm_120 issue」的模型** | 微调脚本硬编码 FA2（issue #372，不微调则无影响） |
| **⭐ LongCat-AudioDiT** | 3.83B（F32） | ⚠️ F32 权重约 15GB+，**需转 bf16/fp16 或量化才能进 16GB，未查到实测** | 未查到 | 非流式（离线场景无妨）；F32 权重体积大 |
| **FireRedTTS-2** | 1.5B | ✅ **bf16 9GB / fp32 14GB（厂商自报）** | 未检索到 sm_120 issue | ⚠️ **锁 torch 2.7.1 + cu126**（cu126 不含 sm_120）→ 需对齐 CUDA 版本 |
| **GLM-TTS** | 1.5B | 未查到 | 🔴 **issue #9：RTX 5060 Ti 16G 上 GPU 利用率仅 40%**（用户质疑 float32）—— **与本次目标硬件完全一致** | 许可冲突（Apache-2.0 vs MIT） |
| **VoxCPM2** | 2.29B（标称 2B） | ✅ **~8GB（厂商自报）** | 🔴 **#250 Blackwell/sm_120 Docker 支持（open）、#326 Blackwell CUDA graph 音质劣化、#282 Blackwell 比 4090 慢、#102 4090 segfault** | 多个 Blackwell open issue，需预留调试时间 |
| **Higgs Audio v2** | 5.77B（HF）/ "3.6B LLM + 2.2B adapter" | ❌ **需 ≥24GB（README 明示）** | 🔴 #39 Blackwell Docker（open）、#177 `libcudart.so.13` 加载失败（open） | 且许可不可推定可商用 |
| **Sesame CSM** | 1.55B（F32） | 未查到 | 🔴 **#118 RTX 5080 的 sm_120 与当前 PyTorch 不兼容（closed）** | 无中文支持 |
| **OmniVoice** | 0.8B | ✅ 余量很大（官方甚至支持 4GB Intel Arc；**第三方实测峰值 2,207 MiB**） | 未查到 | FlashInfer 需匹配 cu128 wheel；flash_attn 有 SDPA 回退；**微调撞 sm_120 共享内存墙** |
| **IndexTTS-2.5** | 0.8B | ✅ **官方称 ~6GB VRAM** | 未查到（要求 CUDA ≥12.8） | 可选「compiled CUDA kernels」可能无 sm_120 预编译；**sm_120 实测未查到** |
| **Fun-CosyVoice3** | 0.5B | ✅ 余量很大 | 未查到 | ⚠️ **requirements 里 torch 2.3.1 只到 sm_90 → 官方 requirements 在 5060 Ti 上必挂（issue #1815 点名）**；vLLM 版本窗口窄（0.9.0 或 ≥0.11.0）；建议独立 conda 环境 + torch≥2.7/cu128 |
| **GPT-SoVITS** | 229M | ✅ 最省显存之一 | 未查到，但**install.sh 有 CU128 档 + 官方测过 torch2.7/CUDA12.8** | **5060 Ti 上训练崩（#2393/#2394）、推理可用**；无流式 |
| **Fish Audio S2 Pro** | 4B | ⚠️ 理论可跑（fp16 ≈8GB）但官方未给 VRAM | 未查到 | 低延迟需 SGLang-Omni/vLLM-Omni；**且不可商用** |
| **MOSS-TTS** | 8B / 4B / 1.7B / 100M | ✅ **官方称 8B 已能塞进 8GB 卡**（llama.cpp） | 未查到 | 需 FlashAttention 2（**sm_120 高风险**）；有 llama.cpp/ONNX 无 torch 路径可绕开 |
| **F5-TTS** | 0.3–0.4B | ✅ 余量很大 | 未查到 | `pynini` 在部分平台无 wheel |
| **MegaTTS3** | 0.45B | ✅ | 未查到 | **需 Google Drive 转 .npy voice latent**（国内不可达）；Windows 支持未完成 |
| **Kokoro** | 82M | ✅ 几乎无需求（可 CPU） | N/A | 需 espeak-ng；项目 2025-08 后停更 |
| **ChatTTS** | 未查到 | ✅（官方：30s 音频 ≥4GB） | N/A（官方**明确禁用** flash-attn/TransformerEngine） | AGPL + CC-BY-NC 双重不可商用；音质被官方故意劣化 |

### 13.3 结论

**16GB 显存对本清单里绝大多数模型都不是瓶颈**（最大的 Fish Audio S2 Pro 4B 与 MOSS-TTS 8B 才有压力，而 MOSS-TTS 有 llama.cpp 8GB 路径）。
**真正的风险是 sm_120 的算子/编译生态**：需要 flash-attn 或 triton 自定义内核的项目（MOSS-TTS、OmniVoice 的 FlashInfer 路径、可能含 IndexTTS 的 compiled kernels）在 Blackwell 消费卡上要预留调试时间。**规避策略**：优先选有 SDPA/flash-attn 回退、或提供 llama.cpp/ONNX CPU 路径的项目（MOSS-TTS、OmniVoice、ChatTTS 天然避开）。

---

## 14. 第三方榜单与实测

> ✅ **本节已完成**：完整证据见 `_raw_TTS_benchmarks.md`（73 KB / 732 行，**151 个实抓 URL**；位于本目录，另有 `_scratch/` 副本，抓取日 2026-09-22）。
> **核心结论：2026 年没有任何一个第三方 Elo 榜能评中文 TTS。** 详见 14.1。

### 14.1 四个第三方榜单的覆盖范围（这是最重要的一张表）

| 榜单 | 能否评中文 | 是否可抓取 | 覆盖了本报告哪些模型 |
|---|---|---|---|
| **Artificial Analysis TTS Leaderboard** | ❌ **纯英文**（只有 US/UK 口音，locale=en） | ✅ 可抓（页面内嵌 JSON-LD + Next.js payload） | 90 个模型中仅 16 个开源权重；**中国开源模型（IndexTTS / CosyVoice 开源权重 / GPT-SoVITS / ChatTTS / F5-TTS / MegaTTS3 / OmniVoice / MOSS-TTS / VoxCPM2 / GLM-TTS / FireRedTTS-2）全部不在榜** |
| **HuggingFace TTS Arena V2** | ❌ 原文 **"Prompts are English-only for now, capped at 1,000 characters"** | ❌ 原始 Elo 本轮取不到（huggingface.co 被墙；**hf-mirror 明确拒绝 Spaces**：「本站暂不支持访问 Spaces 空间」） | — |
| **TTS Spaces Arena（原始投票数据）** | ❌ 英文单句朗读 | ✅ 原始投票公开（HF dataset `Pendrokar/TTS_Arena`，2026-09-21 更新） | Kokoro、MOSS-TTS、MegaTTS3、GPT-SoVITS、F5-TTS、fish-speech、SparkTTS、IndexTTS |
| **VoiceHub Arena / kadirnar 独立 Seed-TTS-Eval** | ❌ 英文（Seed-TTS **test-en**，1088 条） | ✅ CSV 可抓 | Kokoro、OmniVoice、F5-TTS、MOSS-TTS、CosyVoice3、GPT-SoVITS、VoxCPM2、FishTTS、VibeVoice、Qwen3-TTS、HiggsTTS 等 33 个 |
| **CV3-Eval / Seed-TTS-eval** | ✅ **中文** | ✅ 代码与数据开源 | 见第 0.2b 节（**这才是中文选型的依据**） |

> **→ 结论：选中文 TTS 只能靠 CV3-Eval / Seed-TTS-eval 这类「厂商也参与贡献、但测试集与 ASR/SIM 模型公开」的基准 + 自测。英文 Elo 榜对中文选型几乎无参考价值**（它会把 Kokoro 这种英文强、**中文无官方支持**的模型排到开源第一梯队）。

### 14.2 Artificial Analysis TTS Elo（2026 唯一完整第三方 Elo 榜，**英文**）

页面 FAQ 原文数字（[AA TTS Leaderboard · open-weights](https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice/open-weights)）：

| 类别 | 模型 | Elo |
|---|---|---|
| 榜首（闭源） | Sonic 3.6 | **1272** |
| 闭源 | Alibaba **Qwen-Audio-3.0-TTS-Plus**（页面归入 `cosyvoice-tts` 家族，`openWeights: false`） | 1260 |
| **开源第一** | **Breeze TTS 2** | **1204** |
| 开源 | **Fish Audio S2 Pro** | **1121** |
| 开源 | Step Audio EditX | 1094 |
| 开源 | Voxtral TTS | 1075 |
| 开源 | Magpie-Multilingual 357M | 1063 |
| 开源 | **Kokoro 82M v1.0**（**CI 1050–1072，5224 次投票；且最便宜：$0.65/1M 字符**） | **1060.98** |
| 开源 | **Higgs Audio V3** | 1032.15 |
| 开源 | Chatterbox | 1020.54 |
| 开源 | **VibeVoice 1.5B** | 950.85 |
| 开源 | Qwen3 TTS | 925.98 |
| 开源 | XTTS v2 | 913.81 |
| 开源 | StyleTTS2 | 891.24 |

**⚠️ 读这张表必须注意**：① 纯英文；② 开源口径与「中文能力」无关（Kokoro 排 1060 是因为英文朗读好，它**中文无官方支持**）；③ 中文强模型（IndexTTS2.5 / CosyVoice3 / OmniVoice / MOSS-TTS）**不在榜，不是因为弱，而是没提交**。
**第三方转述**：sovgrid.org（2026-05-12）与 theaibench.ai（2026-09）两处独立转述称 **Fish Audio S2 Pro 为开源第一 ELO 1128**；**Kokoro-82M 已从 #1 掉到中游**。

### 14.3 TTS Spaces Arena 原始投票（**我方统计，非官方 Elo**）

数据源：HF dataset `Pendrokar/TTS_Arena`（2026-09-21 更新，`tts_arena_vote_summary_all.tsv`）。subagent 自行统计 **36,993 次投票事件**。
**⚠️ 这是 [我方推导] 的胜率（wins 会高估），不是官方 Elo，且为英文单句朗读**：

| 模型 | 胜率 |
|---|---|
| kokoro / Kokoro-API | **98.4% / 96.7%（第一梯队）** |
| Orpheus-TTS | 95.0% |
| **MOSS-TTS** | **86.2%** |
| fish-speech-1 | 81.3% |
| **MegaTTS3** | **79.4%** |
| GPT-SoVITS-v2 | 74.7% |
| IndexTTS | 72.7% |
| SparkTTS | 71.1% |
| F5-TTS（E2-F5-TTS） | 67.4% |
| **GPT-SoVITS-ProPlus** | **27.5%（垫底）** |

→ 与 GPT-SoVITS **官方 wiki 的中文结论**（v2ProPlus 中文 SIM 最高 0.737）**方向相反** —— 再次证明**英文榜不能外推到中文**。

### 14.4 VoiceHub / kadirnar 独立大规模英文 Seed-TTS-Eval（**最接近「第三方复现」的资产**）

条件：**33 个模型 × 1088 条 Seed-TTS test-en，单台 A100 40GB，2026-09-15 完成**；ASR = faster-whisper-large-v3 fp16 beam5 seed42；**作者明确声明不测 SIM / MOS**。
数据：[voicehub-arena-seed-tts-eval leaderboard.csv](https://hf-mirror.com/datasets/kadirnar/voicehub-arena-seed-tts-eval/raw/main/leaderboard.csv)

**WER%（英文）**（节选；注意含质量存疑项）：

| 模型 | WER% |
|---|---|
| **Kokoro** | **0.9629（第一）** |
| Supertonic | 0.9797 |
| **OmniVoice** | **0.9880** |
| SpeechT5 | 1.0131 |
| **F5-TTS** | **1.0550** |
| FishTTS（S2 Pro） | 1.1471 |
| Chatterbox | 1.2308 |
| **MOSS-TTS** | **1.2308** |
| VibeVoice | 1.3146 |
| Qwen3-TTS | 1.3816 |
| **CosyVoice3（修正后 = Fun-CosyVoice3-0.5B-2512）** | **1.7416** |
| HiggsTTS | 1.7416 |
| **GPT-SoVITS** | **2.6375（第 22/33）** |
| **VoxCPM2** | **3.3492** |
| Llasa / Dia | 73.99 / 67.35（**已标注质量存疑**） |

**⚠️ 榜上无 ChatTTS / MegaTTS3 / IndexTTS。**

**第二个 campaign 提供 speaker SIM（WavLM-large ECAPA）+ 效率**（环境 torch 2.8.0+cu128，**RTX 6000 Ada**）：

| 模型 | SIM | WER% | RTF | 峰值显存 |
|---|---|---|---|---|
| **OmniVoice**（克隆） | **0.7385** | 1.0718 | 0.223 | **2,207 MiB** |
| **F5-TTS**（克隆） | 0.6691 | 1.2643 | — | — |
| **Kokoro** | N/A（无参考音频，**不支持零样本克隆**） | — | **0.042（最快）** | **480 MiB** |
| VibeVoice-Realtime-0.5B | — | 1.3481 | 0.629 | — |

> **Kokoro 的三个「第一」很有意思**：**UTMOS22 4.5037 / DNSMOS 3.4267 最高、RTF 0.042 最快、显存仅 480 MiB**。以 **82M** 参数做到这点非常惊人 —— 但代价是**不支持零样本克隆，且中文无官方支持**。
> **⭐ OmniVoice 的 2,207 MiB 峰值显存是本次调研拿到的唯一第三方实测显存数字**（此前只能标注「官方未给」）→ **进一步确认 16GB 卡对它绰绰有余**。

### 14.5 一条对本项目最有价值的外部判断

**sovgrid.org（2026-05-12，独立第三方，真实生产环境 DGX Spark / GB10 Blackwell）** 把候选按「多说话人 + 表现力 + 克隆 + 速度控制 + 开源许可 + **SM12.1 兼容**」筛完后，**只留三个 spike：VibeVoice（社区 fork）、Higgs Audio v2、IndexTTS-2**，并明确指出：

> "VibeVoice, Higgs Audio v2, and IndexTTS-2 are either too new or have not been submitted（到 AA 榜）"；"top-of-leaderboard for a different use case is not the same as best fit"

→ **这是本次调研中唯一一条「按 sm_12x Blackwell 生产环境实测 + 商用许可」筛出来的第三方建议**，与我们的结论（IndexTTS-2.5 / MOSS / CosyVoice3 优先）部分吻合（都看重 IndexTTS 系列）。
另注：**VibeVoice 原仓库 2025-09 被微软下架**（deepfake 风险），且它是**唯一有公开 DGX Spark CUDA13/aarch64 部署记录**的引擎。

### 14.6 数字缺口（必须承认「未查到」的项）

| 模型 | 缺什么 |
|---|---|
| **ChatTTS** | **任何 SeedTTS WER/CER/SIM 都未查到**（官方无论文，第三方榜也未收录） |
| **Kokoro** | **test-zh CER / SIM-o 未查到**（无官方论文，第三方只测英文）；官方模型卡 language tag **只有 `en`** → **中文靠第三方权重 `hexgrad/Kokoro-82M-v1.1-zh`**（HF 镜像 downloads 22,373）与 `onnx-community/Kokoro-82M-v1.1-zh-ONNX`；社区报告（KokoroSharp issue #5）C# 版中文「口音很重、听不太清」，Python 版正常 |
| **GPT-SoVITS** | SeedTTS test-zh/test-en 的**正式第三方数字未查到**；只有 **CV3-eval 口径**的 ZH-CER **7.34** / EN-WER **12.5**（VoxCPM 论文 arXiv:2509.24650 Table 4；同表 CosyVoice2 4.08/6.32、IndexTTS2 3.58/4.45、CosyVoice3-0.5B 3.89/5.24）。**⚠️ CV3-eval 数值远高于 SeedTTS test-zh，绝不可混用口径** —— 这也说明 **GPT-SoVITS 在 CV3-eval 口径下中文很弱（7.34），与其官方 wiki 的 SeedTTS 0.016 差距极大**，是本次调研最大的口径冲突案例 |
| **MegaTTS3** | 中文数字只有**转引**：VoxCPM 论文 Table 3 给 **ZH-CER 1.52 / SIM 79.0、EN-WER 2.79 / SIM 77.1**；**RobustSpeechFlow（arXiv:2605.22083）Table 7 给同值 2.79/0.77** → **两个独立来源互相印证，可信度较高** |
| **IndexTTS / F5-TTS / MegaTTS3 / MOSS-TTS** | **sm_120 实机实测均未查到**（index-tts issue #242「能用 RTX50 系显卡跑吗？」与 sneekes.app 的 RTX5070 F5-TTS 指南两次抓取均超时） |
| **中文 Arena 排名** | 发现**唯一的中文 Arena 原始投票数据** `JacobLinCool/zh-tw-tts-arena-votes`（2026-07-24，4 个 jsonl），**本轮只读了 README 未统计 → 中文 Arena 排名仍是「未查到」**（值得后续补做） |

### 14.7 本次已确认的「可复现第三方评测资产」

| 评测资产 | URL | 性质 |
|---|---|---|
| **Seed-TTS-eval**（字节官方评测代码/模型） | https://github.com/BytedanceSpeech/seed-tts-eval | 事实标准，GPT-SoVITS wiki、多篇论文都用它 |
| **CV3-Eval**（阿里 CosyVoice3 官方开源评测集） | https://github.com/FunAudioLLM/CV3-Eval | 阿里开源，被 IndexTTS2.5 采用 |
| Seed-TTS 论文 | arXiv:2406.02430 | 测试集来源 |
| VoiceHub/kadirnar 英文榜 | https://hf-mirror.com/datasets/kadirnar/voicehub-arena-seed-tts-eval/raw/main/leaderboard.csv | 独立第三方大规模复现（英文） |
| TTS Spaces Arena 原始投票 | HF dataset `Pendrokar/TTS_Arena` | 原始投票，非官方 Elo |
| AA TTS Leaderboard | https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice/open-weights | 第三方 Elo（英文） |

**⚠️ 重要方法学警告（来自 GPT-SoVITS 官方 wiki，很有价值）**：

> 「这个 benchmark 有啥用：测合成发音和目标发音的匹配度（WER），和音色相似度（SIM）。**测不了自然性、情感丰富性和音质**，前 2 个要人工打分。同时**测试集的音色也有局限性**。分数仅供参考，如果需要准确的结论请你用自己的实际场景训练集去微调和测试集去测试。**论文里的分数、业界的情报和媒体宣传都是浮云，请永远相信，只有你自己的测试结论才是最真实的。**」
> — [GPT-SoVITS wiki](https://raw.githubusercontent.com/wiki/RVC-Boss/GPT-SoVITS/GPT%E2%80%90SoVITS%E2%80%90features-%28%E5%90%84%E7%89%88%E6%9C%AC%E7%89%B9%E6%80%A7%29.md)

**→ 本报告全部数字都应在此前提下使用。中文选型请以 CV3-Eval / Seed-TTS-eval + 自家场景自测为准。**

---

## 15. 商用许可速查（法务视角）

| 模型 | 代码 | 权重 | **能否商用** | 关键约束 |
|---|---|---|---|---|
| **⭐ Qwen3-TTS（阿里）** | Apache-2.0 | **apache-2.0**（HF tag 已确认，`gated: False`） | ✅ **自由商用** | 微调脚本需自行改 FA2 设置 |
| **⭐ LongCat-AudioDiT（美团）** | **MIT** | **MIT**（HF tag = `mit`） | ✅ **自由商用** | 最宽松许可之一 |
| **FireRedTTS-2（小红书）** | Apache-2.0 | Apache-2.0 | ✅ **自由商用** | 锁 torch2.7.1+cu126 |
| **ZipVoice（k2-fsa/小米）** | Apache-2.0 | Apache-2.0 | ✅ **自由商用** | cu12.x 预编译，CUDA13 需自编 |
| **Step-Audio 2 mini（阶跃）** | Apache-2.0 | Apache-2.0 | ✅ **自由商用** | 仅 mini 开源；8.32B 显存未查到 |
| **GLM-TTS（智谱）** | ⚠️ **Apache-2.0** | ⚠️ **HF 标 `mit`（与仓库冲突）** | ⚠️ **大概率可，但文档冲突需书面确认** | + 5060 Ti issue #9 |
| **VibeVoice（微软）** | MIT | MIT | ⚠️ **法律上可（MIT），但官方明文「不建议商用/仅限研发」** | TTS 代码已被下架 |
| **Sesame CSM** | Apache-2.0 | Apache-2.0 | ✅ 可（附 Misuse 条款） | **但无中文支持** |
| **❌ Spark-TTS** | Apache-2.0 | ⚠️ **CC-BY-NC-SA-4.0** | ❌ **权重不可商用** | **代码/权重许可自相矛盾** |
| **❌ Higgs Audio v2** | Apache-2.0（仓库） | ⚠️ `license: other`（含义不明） | ❌ **不可推定可商用** | 主线 v3 明确非商用；需 ≥24GB |
| **⭐ VoxCPM2（OpenBMB）** | **Apache-2.0** | **Apache-2.0** | ✅ **自由商用** | 官方原文 "free for commercial use" |
| **Fun-CosyVoice3-0.5B-2512** | Apache-2.0 | **apache-2.0** | ✅ **自由商用** | 无 |
| **MOSS-TTS 全家族** | Apache-2.0 | **Apache-2.0** | ✅ **自由商用** | 无 |
| **F5-TTS** | MIT | MIT | ✅ **自由商用** | 无 |
| **GPT-SoVITS** | MIT | MIT | ✅ **自由商用** | 无 |
| **MegaTTS3** | Apache-2.0 | Apache-2.0 | ✅ **自由商用** | 需 Google Drive 转 latent |
| **Kokoro** | Apache-2.0 | Apache-2.0 | ✅ **自由商用** | 无 |
| **IndexTTS-2.5** | bilibili 自定义 | bilibili Model Use License | ⚠️ **有条件商用** | **月活 >1 亿 或 年营收 >10 亿人民币**须另行授权；禁高风险场景；禁用于改进他人 AI 模型；上海仲裁 |
| **OmniVoice** | Apache-2.0 | **CC-BY-NC** | ❌ **权重不可商用** | 训练数据（Emilia）导致 |
| **Fish Audio S2 Pro** | Fish Audio Research License | 同左 | ❌ **一律需单独授权** | **连企业内部自用也算商用**；商务联系 business@fish.audio |
| **ChatTTS** | **AGPLv3+** | **CC BY-NC 4.0** | ❌ **不可商用** | AGPL 对网络服务有源码开放义务；官方故意劣化音质 |

> **一句话结论**：要商用 → **VoxCPM2 / CosyVoice3 / MOSS-TTS / F5-TTS / GPT-SoVITS / MegaTTS3 / Kokoro**（全部宽松许可）或 **IndexTTS-2.5**（中小企业免费）。**避开 OmniVoice、Fish Audio S2、ChatTTS。**

---

## 16. 推荐排序（针对「16GB 单卡数字人 + 中文 + 可商用」）

> **⚠️ 前提澄清（重要，会改变权重）**：结合同目录 `数字人选型结论-20260922.md`，本项目的实际形态是 **「离线口播成片」**（一张图/一段视频 + 现成人声音频 → 口型同步视频），走 **A 类音频驱动**路线（MuseTalk 1.5 / SoulX-FlashHead Lite / EchoMimicV3-Flash / LongCat-Video-Avatar 1.5）。
> 这意味着 **TTS 只需产出「一段完整音频文件」，下游数字人模型拿现成音频对口型** —— 因此：
> - **流式 / TTFB 的重要性大幅下降**（不是实时对话链路，不需要边生成边驱动口型）；
> - **权重上升的是**：中文自然度、说话人相似度、音色/情绪可控性、单次生成稳定性、**许可证**、**显存占用**（要和数字人模型抢同一张 16GB 卡）。
> - 但任务书明确要求核查流式能力与数字人框架集成，故两项都保留。**若后续要接实时数字人**（LiveTalking / OpenAvatarChat / Fay 那类），流式项就是硬门槛。

### 16.1 实时对话链路排序

| 排名 | 模型 | 核心理由 | 短板 |
|---|---|---|---|
| 🥇 | **⭐ Qwen3-TTS（阿里，Apache-2.0）** | **首包 97ms（官方，全场最低）** + 原生双轨流式 + **Apache-2.0 可商用** + **sm_120 零 issue（本次唯一）** + LiveTalking 作者实测 0.6B+vLLM-Omni ~130ms | **VRAM 未公布需实测**；微调脚本硬编码 FA2（不微调无影响） |
| 🥈 | **Fun-CosyVoice3-0.5B-2512** | Apache-2.0 + 流式 150ms（第三方实测 ~195ms）+ 中文 SS 78/80 + 9 语言 18 方言 + vLLM/TRT-LLM 生产路径 | 主仓库 last-commit=may（活跃度下降）；⚠️ **官方 requirements 的 torch 2.3.1 在 5060 Ti 上必挂（issue #1815 点名）**，需自行升 torch≥2.7/cu128 |
| 🥉 | **VoxCPM2（2B, OpenBMB）** | **Apache-2.0（HF 侧已确认）** + 官方 `generate_streaming()` + 中文 **CER 0.97 / SIM 79.5** + **48kHz** + **~8GB VRAM** | **未公布 TTFB**；**sm_120 多个 open issue（#250/#282/#326）** |
| 4 | **FireRedTTS-2** | Apache-2.0 + **首包 140ms** + bf16 **9GB** + 4 说话人长对话 | **锁 torch2.7.1+cu126**（cu126 不含 sm_120）；单句 CER 1.14 一般 |
| 5 | **MOSS-TTS-Realtime** | Apache-2.0 + **TTFB 180ms** + ZH SIM 79.62 + 8B 能塞 8GB 卡 | 需 FlashAttention 2（sm_120 风险）；家族档位多 |

### 16.2 离线口播成片排序（**本项目实际形态，不需流式**）

| 排名 | 模型 | 核心理由 | 短板 |
|---|---|---|---|
| 🥇 | **⭐ LongCat-AudioDiT（美团，MIT）** | **MIT 最宽松许可 + 中文 SIM 81.8（全场最高）**；**非流式在离线场景不是缺点** | 3.83B **F32** 权重（需转半精度进 16GB，**待实测**）；sm_120 未查到 |
| 🥈 | **IndexTTS-2.5** | 中文 CER 0.93–1.21% + SS 77.9 + **情绪/时长强可控**（第三方评价「对口型同步非常有意义」）+ **官方 6GB VRAM** + 中小企业免费商用 | 大厂需另行授权；无流式（离线无妨） |
| 🥉 | **VoxCPM2** | 中文 CER 0.97 / SIM 79.5 + 48kHz + ~8GB | sm_120 open issue |
| 4 | **MegaTTS3** | Apache-2.0 + 中文 SIM **79.0** + RTF 0.124（加速版） | **必须用 Google Drive 转 .npy latent（国内不可达）**；2025-03 后停更 |
| 5 | **GPT-SoVITS v2ProPlus** | **MIT** + 中文 SIM 0.737（接近真人 0.750）+ 229M 最省显存 | 自然度无客观数字 |

### 16.3 不推荐 / 已排除

| 模型 | 排除原因 |
|---|---|
| **OmniVoice（小米）** | 权重 CC-BY-NC（不可商用）；**且有输出乱码 bug（Issue #155 未修）** |
| **Fish Audio S2 Pro** | 一律需单独授权，**HF 门禁强制勾「non-commercial use ONLY」**；且 sm_120 上 vLLM-Omni 配方被 FA3 阻断 |
| **Spark-TTS** | **HF 权重 CC-BY-NC-SA-4.0** → 商用踩雷；中文 SIM 66.0 最低之一 |
| **Higgs Audio v2** | HF license `other` 含义不明；**主线 v3 明确非商用**；**需 ≥24GB**；无 arXiv 论文 |
| **VibeVoice-TTS-1.5B** | **微软 2025-09-05 下架代码并标 Disabled**，官方明文不建议商用；仅 Realtime-0.5B 存活（**仅英文单说话人**） |
| **GLM-TTS** | 许可 GitHub Apache-2.0 vs HF `mit` **冲突**；**issue #9 报告 RTX 5060 Ti 16G 利用率仅 40%**（与本机硬件一致） |
| **Sesame CSM** | **无中文支持**（官方自述非英语「likely won't do well」）；无 arXiv 论文；sm_120 #118 |
| **Step-Audio 2** | 8.32B 显存未查到（16GB 紧张）；TTS 侧中文指标未查到 |
| **ChatTTS** | 代码 AGPL-3.0 + 权重 CC BY-NC 4.0 双重不可商用；**官方故意加噪+MP3 压缩劣化音质** |
| **Kokoro** | 官方 language tag 只有 `en`；**中文无任何客观数字**；2025-08 后停更；不支持零样本克隆 |
| **MiniMax-Speech / Qwen3-TTS-Flash** | 前者无开源仓库；后者闭源 API 无权重 |

### 16.4 落地建议路径（最终版）

1. **本项目（离线口播）首选链路**：
   - **先试 LongCat-AudioDiT**（MIT + 中文 SIM 81.8 最高）→ 唯一顾虑是 3.83B **F32** 权重能否塞进 16GB；**第一步就是验证显存与 fp16/bf16 转换后的音质**。
   - **并行验证 IndexTTS-2.5**（官方 6GB VRAM 明确 + 情绪/时长可控）作为稳妥兜底。
   - 若两者都有问题，退到 **VoxCPM2**（~8GB，中文 0.97/79.5）或 **MegaTTS3**（注意 .npy 门槛）。
2. **若后续接实时数字人**：**Qwen3-TTS** 是唯一「可商用 + 97ms + sm_120 零 issue」的选择；备选 Fun-CosyVoice3（需先解决 torch/cu128）。
3. **务必自测**：用 **Seed-TTS-eval**（https://github.com/BytedanceSpeech/seed-tts-eval ）在自家场景音频上跑 WER/SIM。**同一模型在不同榜单里中文 WER 能差 6–7 倍**（见 0.2 的四个案例），任何单一公开数字都不足以定论。
4. **sm_120 部署纪律**：不要照抄任何项目的官方 requirements（多数钉死 torch≤2.4，只编到 sm_90）；统一用 **torch ≥2.7 + cu128/cu130**；需要 flash-attn 时先用 flash-attention#2016 的免编译组合。

## 来源清单（全部为本次实际抓取过的 URL；共 157 条编号 + 每条内的并列 URL，实际约 220+ 个 URL）

### 论文 / arXiv（经 `export.arxiv.org/api/query` 校验）
1. https://arxiv.org/abs/2604.00688 — OmniVoice（小米），v3 2026-04-21
2. https://arxiv.org/pdf/2604.00688v3 — OmniVoice 全文（Table 1/2/8、机构署名）
3. https://export.arxiv.org/api/query?id_list=2604.00688
4. https://arxiv.org/abs/2607.21042 — Faster IndexTTS-2（NVIDIA），2026-07-23
5. https://arxiv.org/pdf/2607.21042v1 — Faster IndexTTS-2 全文（Table I/II/III、Fig.2）
6. https://export.arxiv.org/api/query?id_list=2607.21042
7. https://arxiv.org/abs/2601.03888 — IndexTTS 2.5 Technical Report
8. https://export.arxiv.org/api/query?search_query=ti:%22IndexTTS%202.5%22
9. https://export.arxiv.org/api/query?search_query=all:IndexTTS&sortBy=submittedDate
10. https://arxiv.org/abs/2506.21619 — IndexTTS2
11. https://arxiv.org/abs/2502.05512 — IndexTTS
12. https://arxiv.org/abs/2505.17589 — CosyVoice 3
13. https://arxiv.org/abs/2412.10117 — CosyVoice 2
14. https://arxiv.org/abs/2407.05407 — CosyVoice 1
15. https://arxiv.org/abs/2603.08823 — Fish Audio S2 Technical Report
16. https://export.arxiv.org/api/query?id_list=2603.08823
17. https://arxiv.org/abs/2603.18090 — MOSS-TTS Technical Report
18. https://arxiv.org/pdf/2603.19739 — MOSS-TTSD
19. https://arxiv.org/pdf/2603.28086 — MOSS-VoiceGenerator
20. https://arxiv.org/abs/2410.06885 — F5-TTS
21. https://arxiv.org/abs/2502.18924 — Sparse Alignment Enhanced Latent Diffusion Transformer（F5-TTS 仓库内）
22. https://arxiv.org/abs/2406.18009 — E2 TTS
23. https://arxiv.org/abs/2406.02430 — Seed-TTS
24. https://arxiv.org/pdf/2601.15621 — Qwen3-TTS Technical Report（已核实，**streaming + 3s 克隆 + 双轨 LM**）
25. https://export.arxiv.org/api/query?id_list=2601.15621
26. **https://arxiv.org/abs/2502.18924 — MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer**（v4，2025-03-28）— 论文正文 Table 1/2 已抓取
27. https://arxiv.org/pdf/2502.18924v4 — MegaTTS3 全文
28. **https://arxiv.org/abs/2606.06928 — VoxCPM2 Technical Report**（2026-06-05）
29. https://arxiv.org/abs/2509.24650 — VoxCPM: Tokenizer-Free TTS（2025-09-29）
30. https://arxiv.org/abs/2502.03930 — DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation
31. https://export.arxiv.org/api/query?id_list=2606.06928,2509.24650,2502.03930
32. https://export.arxiv.org/api/query?search_query=all:MegaTTS
33. https://sditdemo.github.io/sditdemo/ — MegaTTS3 音频样例

### GitHub 仓库 README / 原始文件
25. https://raw.githubusercontent.com/k2-fsa/OmniVoice/main/README.md
26. https://raw.githubusercontent.com/k2-fsa/OmniVoice/master/docs/community-projects.md
27. https://raw.githubusercontent.com/k2-fsa/OmniVoice/master/docs/tips.md
28. https://raw.githubusercontent.com/k2-fsa/OmniVoice/master/pyproject.toml
29. https://raw.githubusercontent.com/index-tts/index-tts/main/README.md
30. https://raw.githubusercontent.com/index-tts/index-tts/main/docs/README_zh.md
31. https://raw.githubusercontent.com/index-tts/index-tts/main/LICENSE
32. https://raw.githubusercontent.com/index-tts/index-tts/main/DISCLAIMER
33. https://raw.githubusercontent.com/FunAudioLLM/CosyVoice/main/README.md
34. https://raw.githubusercontent.com/RVC-Boss/GPT-SoVITS/main/README.md
35. https://raw.githubusercontent.com/wiki/RVC-Boss/GPT-SoVITS/GPT%E2%80%90SoVITS%E2%80%90features-%28%E5%90%84%E7%89%88%E6%9C%AC%E7%89%B9%E6%80%A7%29.md
36. https://raw.githubusercontent.com/fishaudio/fish-speech/main/README.md
37. https://raw.githubusercontent.com/fishaudio/fish-speech/main/docs/en/index.md
38. https://github.com/fishaudio/fish-speech/blob/main/LICENSE — FISH AUDIO RESEARCH LICENSE 全文
39. https://raw.githubusercontent.com/OpenMOSS/MOSS-TTS/main/README.md
40. https://raw.githubusercontent.com/OpenMOSS/MOSS-TTS/main/LICENSE
41. https://raw.githubusercontent.com/SWivid/F5-TTS/main/README.md
42. https://raw.githubusercontent.com/bytedance/MegaTTS3/main/readme.md
43. https://raw.githubusercontent.com/hexgrad/kokoro/main/README.md
44. https://raw.githubusercontent.com/2noise/ChatTTS/main/README.md
45. https://raw.githubusercontent.com/chenpipi0807/ComfyUI-Index-TTS/main/README.md
46. https://raw.githubusercontent.com/fengin/Fun-CosyVoice3-0.5B-2512-Deploy/main/README.md

### HuggingFace 模型卡（经 hf-mirror.com 镜像）
47. https://hf-mirror.com/k2-fsa/OmniVoice/raw/main/README.md — **权重 CC-BY-NC 声明在此**
48. https://hf-mirror.com/IndexTeam/IndexTTS-2.5/raw/main/README.md — **~6GB VRAM、license: other / bilibili-model-license**
49. https://hf-mirror.com/FunAudioLLM/Fun-CosyVoice3-0.5B-2512/raw/main/README.md — **license: apache-2.0、150ms 流式**

### shields.io 徽章（stars / license / last-commit）
50. https://img.shields.io/github/stars/k2-fsa/OmniVoice.json · https://img.shields.io/github/license/k2-fsa/OmniVoice.json · https://img.shields.io/github/last-commit/k2-fsa/OmniVoice.json
51. https://img.shields.io/github/stars/index-tts/index-tts.json · .../license/index-tts/index-tts.json · .../last-commit/index-tts/index-tts.json
52. https://img.shields.io/github/stars/FunAudioLLM/CosyVoice.json · .../license/FunAudioLLM/CosyVoice.json · .../last-commit/FunAudioLLM/CosyVoice.json
53. https://img.shields.io/github/stars/RVC-Boss/GPT-SoVITS.json · .../license/RVC-Boss/GPT-SoVITS.json · .../last-commit/RVC-Boss/GPT-SoVITS.json
54. https://img.shields.io/github/stars/fishaudio/fish-speech.json · .../license/fishaudio/fish-speech.json · .../last-commit/fishaudio/fish-speech.json
55. https://img.shields.io/github/stars/OpenMOSS/MOSS-TTS.json · .../license/OpenMOSS/MOSS-TTS.json · .../last-commit/OpenMOSS/MOSS-TTS.json
56. https://img.shields.io/github/stars/SWivid/F5-TTS.json · .../license/SWivid/F5-TTS.json · .../last-commit/SWivid/F5-TTS.json
57. https://img.shields.io/github/stars/bytedance/MegaTTS3.json · .../license/bytedance/MegaTTS3.json · .../last-commit/bytedance/MegaTTS3.json
58. https://img.shields.io/github/stars/hexgrad/kokoro.json · .../license/hexgrad/kokoro.json · .../last-commit/hexgrad/kokoro.json
59. https://img.shields.io/github/stars/2noise/ChatTTS.json · .../license/2noise/ChatTTS.json · .../last-commit/2noise/ChatTTS.json

### 项目主页 / 演示 / 生态
60. https://github.com/k2-fsa/OmniVoice
61. https://github.com/index-tts/index-tts
62. https://github.com/FunAudioLLM/CosyVoice
63. https://github.com/RVC-Boss/GPT-SoVITS
64. https://github.com/fishaudio/fish-speech
65. https://github.com/OpenMOSS/MOSS-TTS
66. https://github.com/SWivid/F5-TTS
67. https://github.com/bytedance/MegaTTS3
68. https://github.com/hexgrad/kokoro
69. https://github.com/2noise/ChatTTS
70. https://zhu-han.github.io/omnivoice
71. https://huggingface.co/spaces/k2-fsa/OmniVoice
72. https://index-tts.github.io/index-tts2-5.github.io/
73. https://funaudiollm.github.io/cosyvoice3/
74. https://swivid.github.io/F5-TTS/
75. https://huggingface.co/spaces/ByteDance/MegaTTS3
76. https://mosi.cn/#models
77. https://studio.mosi.cn
78. https://speech.fish.audio/install/
79. https://fish.audio/blog/fish-audio-open-sources-s2/
80. https://lj1995-gpt-sovits-proplus.hf.space/
81. https://www.yuque.com/baicaigongchang1145haoyuangong/ib3g1e
82. https://rentry.co/GPT-SoVITS-guide
83. https://recipes.vllm.ai/IndexTeam/IndexTTS-2.5
84. https://faster-indextts-2.github.io
85. https://github.com/BytedanceSpeech/seed-tts-eval
86. https://github.com/FunAudioLLM/CV3-Eval
87. https://github.com/baicai-1145/GPT-SoVITS-CPUFast
88. https://github.com/sgl-project/sglang-omni
89. https://github.com/vllm-project/vllm-omni
90. https://github.com/hexgrad/misaki
91. https://github.com/libukai/Awesome-ChatTTS
92. https://huggingface.co/spaces/OpenMOSS-Team/MOSS-TTS
93. https://huggingface.co/collections/OpenMOSS-Team/moss-tts
94. https://www.modelscope.cn/collections/openmoss/MOSS-TTS
95. https://www.modelscope.cn/models/FunAudioLLM/Fun-CosyVoice3-0.5B-2512
96. https://modelscope.cn/models/IndexTeam/IndexTTS-2.5
97. https://huggingface.co/fishaudio/s2-pro
98. https://huggingface.co/hexgrad/Kokoro-82M
99. https://huggingface.co/hexgrad/Kokoro-82M/blob/main/SAMPLES.md
100. https://huggingface.co/Compumacy/kokoro/blob/main/VOICES.md
101. https://huggingface.co/2Noise/ChatTTS
102. https://huggingface.co/SWivid/F5-TTS
103. https://huggingface.co/lj1995/GPT-SoVITS
104. https://huggingface.co/OpenMOSS-Team/MOSS-TTS-GGUF
105. https://huggingface.co/OpenMOSS-Team/MOSS-Audio-Tokenizer-ONNX

### sm_120 / Blackwell 兼容性
106. https://www.cnblogs.com/xyz/p/19817397 — `flash_attn nvcc fatal : Unsupported gpu architecture 'compute_120'`
107. https://github.com/triton-lang/triton/pull/9734 — Fix PTX codegen segfaults on consumer Blackwell (sm_120)
108. https://github.com/sgl-project/sglang/pull/36566 — allow trtllm sparse decode on SM120/SM121

### 第三方中文实测 / 二手来源（仅作线索，未作为硬结论）
109. https://blog.csdn.net/weixin_33562004/article/details/156601470 — RTX 3060 跑 IndexTTS 2.0 实测
110. https://blog.csdn.net/weixin_28771751/article/details/159594796 — GPT-SoVITS 6GB 显存部署（**该域名返回 521，未取到正文，未采信**）

### VoxCPM2 / 其他新模型来源（补充）
111. https://github.com/OpenBMB/VoxCPM — VoxCPM2 README（2B、30 语言、48kHz、Apache-2.0、generate_streaming、VRAM ~8GB、RTF 表、Seed-TTS-eval 全表、CV3-eval 表）
112. https://img.shields.io/github/stars/OpenBMB/VoxCPM.json · https://img.shields.io/github/license/OpenBMB/VoxCPM.json
113. https://img.shields.io/github/stars/microsoft/VibeVoice.json · https://img.shields.io/github/license/microsoft/VibeVoice.json
114. https://img.shields.io/github/stars/SesameAILabs/csm.json · https://img.shields.io/github/license/SesameAILabs/csm.json
115. https://img.shields.io/github/stars/SparkAudio/Spark-TTS.json · https://img.shields.io/github/license/SparkAudio/Spark-TTS.json
116. https://img.shields.io/github/stars/boson-ai/higgs-audio.json · https://img.shields.io/github/license/boson-ai/higgs-audio.json
117. https://hf-mirror.com/openbmb/VoxCPM/raw/main/README.md — （返回 401 Invalid username or password，**未能读取**，改用 GitHub 页面）
118. https://github.com/vllm-project/vllm-omni — VoxCPM2 官方 vLLM-Omni 支持
119. https://github.com/OpenBMB/Nano-vLLM-VoxCPM — Nano-vLLM 推理引擎（RTF ~0.13@4090）

### 第三方榜单 / 实测来源（补充，均由 subagent 实抓）
120. https://artificialanalysis.ai/text-to-speech/leaderboard/provider-voice/open-weights — **AA TTS Elo 榜（2026 唯一完整第三方 Elo 榜，纯英文）**
121. https://hf-mirror.com/datasets/kadirnar/voicehub-arena-seed-tts-eval/raw/main/leaderboard.csv — **VoiceHub 独立英文 Seed-TTS-Eval（33 模型 × 1088 条，A100 40GB，2026-09-15）**
122. https://huggingface.co/datasets/Pendrokar/TTS_Arena — TTS Spaces Arena 原始投票（2026-09-21 更新）
123. https://docs.ttsarena.org — TTS Arena 文档（原文 "Prompts are English-only for now"）
124. https://sovgrid.org — 2026-05-12 独立第三方 DGX Spark/GB10 Blackwell 生产环境选型（只留 VibeVoice / Higgs Audio v2 / IndexTTS-2）
125. https://hf-mirror.com/hexgrad/Kokoro-82M-v1.1-zh — Kokoro 中文第三方权重
126. https://hf-mirror.com/onnx-community/Kokoro-82M-v1.1-zh-ONNX
127. https://github.com/Dao-AILab/flash-attention/issues/2168 — flash-attn sm_120 报错
128. https://github.com/Dao-AILab/flash-attention/issues/2016 — flash-attn sm_120 **免编译可用组合**
129. https://github.com/FunAudioLLM/CosyVoice/issues/1815 — **直接点名 RTX 5060 Ti**（requirements torch 2.3.1 只到 sm_90）
130. https://github.com/RVC-Boss/GPT-SoVITS/issues/2205 · /2514 · /2393 · /2394 · PR /2774 — GPT-SoVITS sm_120 / 5060 Ti 问题
131. https://github.com/jianchang512/ChatTTS-ui/issues/290 — ChatTTS-ui 5070 Ti sm_120
132. https://github.com/Genesis1231/fish-s2-rtx — Fish S2 Pro 的 sm_120 可用容器（vLLM-Omni 0.22 + torch 2.11 + cu130）
133. https://blog.csdn.net/jacke121/article/details/157323875 — LiveTalking 专属 TTS 选型表（第三方）
134. https://juejin.cn/post/7649764223339495475 — 掘金 2026 开源 TTS 横向对比（第三方转述）
135. https://github.com/lipku/LiveTalking · https://github.com/HumanAIGC-Engineering/OpenAvatarChat · https://github.com/Kedreamix/Linly-Talker · https://github.com/duixcom/Duix.Avatar · https://github.com/modstart-lib/aigcpanel
136. https://doc.livetalking.ai/docs/tts/omnitts/ — LiveTalking OmniTTS 文档（各 TTS 显存/延迟：Qwen3 12G、VoxCPM2 13G、Fish 18G、IndexTTS 17G/延时4s、CosyVoice 14G）

### 2026 新模型来源（第 11 节证据，均由 subagent 实抓；完整 120 条见 `_raw_TTS_newmodels.md`）
137. https://github.com/QwenLM/Qwen3-TTS — **Qwen3-TTS 官方仓库（13k stars / Apache-2.0 / last-commit march）**
138. https://cdn.jsdelivr.net/gh/QwenLM/Qwen3-TTS@main/LICENSE — Apache-2.0 全文（11343 B）
139. https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice · https://hf-mirror.com/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice/raw/main/README.md（200，57846 B）
140. https://hf-mirror.com/api/models/Qwen/Qwen3-TTS-12Hz-1.7B-Base?blobs=false — 精确张量数 1,928,677,440；license apache-2.0；gated False
141. https://huggingface.co/collections/Qwen/qwen3-tts — Qwen3-TTS 合集
142. https://export.arxiv.org/api/query?id_list=2601.15621 — **arXiv 2601.15621 核验为真（Qwen3-TTS Technical Report，2026-01-22）**
143. https://github.com/QwenLM/Qwen3-TTS/issues/372 · /373 · /350 · /369 · /370 · /124 · /345 · /179 — Qwen3-TTS 已知 issue（#372 微调硬编码 FA2）
144. https://github.com/meituan-longcat/LongCat-AudioDiT — **LongCat-AudioDiT 官方仓库（owner = 美团）**
145. https://cdn.jsdelivr.net/gh/meituan-longcat/LongCat-AudioDiT@main/LICENSE — **MIT License（1064 B，Copyright (c) 2026 Meituan）**
146. https://hf-mirror.com/meituan-longcat/LongCat-AudioDiT-3.5B/raw/main/README.md（200，9756 B）；https://hf-mirror.com/api/models/meituan-longcat/LongCat-AudioDiT-3.5B?blobs=false（F32，3,833,985,217；license:mit）
147. https://arxiv.org/abs/2603.29339 — **LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space（2026-03-31）**
148. https://github.com/FireRedTeam/FireRedTTS2 — FireRedTTS-2 官方仓库（Apache-2.0）
149. https://github.com/stepfun-ai/Step-Audio2 — Step-Audio 2（Apache-2.0，8.32B mini）
150. https://github.com/zai-org/GLM-TTS — GLM-TTS 官方仓库；⚠️ **issue #9：RTX 5060 Ti 16G 利用率仅 40%**
151. https://github.com/SparkAudio/Spark-TTS — ⚠️ 代码 Apache-2.0 **但 HF 权重 cc-by-nc-sa-4.0**：https://hf-mirror.com/api/models/SparkAudio/Spark-TTS-0.5B?blobs=false
152. https://github.com/boson-ai/higgs-audio — ⚠️ 主 README 已转推 **v3（Research and Non-Commercial）**，v2 文档在 `README_V2.md`；issue #39 Blackwell Docker、#177 `libcudart.so.13`
153. https://github.com/microsoft/VibeVoice — ⚠️ **VibeVoice-TTS 代码已下架（2025-09-05）**，VibeVoice-TTS-1.5B 标 Disabled；仅 Realtime-0.5B 存活
154. https://github.com/SesameAILabs/csm — Sesame CSM（Apache-2.0，无中文）；**issue #118：RTX 5080 sm_120 与 PyTorch 不兼容**
155. https://github.com/k2-fsa/ZipVoice — ZipVoice（123M，Apache-2.0，非流式）
156. https://hf-mirror.com/openbmb/VoxCPM2/raw/main/README.md — **VoxCPM2 的 HF 侧 license: apache-2.0，gated: False（修正此前 401 —— repo 名应为 openbmb/VoxCPM2）**
157. https://github.com/OpenBMB/Nano-vLLM-VoxCPM · https://github.com/vllm-project/vllm-omni — VoxCPM2 推理/部署

---

## 附：配套子报告与待补项

### 已完成的两个配套子报告（同目录）

| 文件 | 内容 | 规模 |
|---|---|---|
| **`_raw_TTS_benchmarks.md`** | 第三方榜单与实测：Artificial Analysis TTS Elo、HuggingFace TTS Arena V2、TTS Spaces Arena 原始投票统计、VoiceHub/kadirnar 独立英文 Seed-TTS-Eval、中文实测帖、**sm_120 全框架 issue 清单** | 73 KB / 732 行 / **151 个实抓 URL** |
| **`_raw_TTS_digitalhuman_integration.md`** | LiveTalking / OpenAvatarChat / Fay / Linly-Talker / Duix.Avatar / aigcpanel / SoulX-FlashTalk / Ultralight-Digital-Human / Open-LLM-VTuber 的原生 TTS 支持、可插拔性、采样率与 chunk 约束 | 64 KB / 1174 行 / **101 条实抓 URL** |

另可交叉参考同目录姊妹报告 **`实时交互数字人与TTS调研.md`**（另一个 DSH agent 产出，含数字人驱动框架 + TTS 配对方案与端到端延迟测算）。

### 待补（未完成项，如实列出）

- ✅ **`_raw_TTS_newmodels.md` 已完成**（105 KB / 1310 行 / **120 条实抓 URL**）：FireRedTTS-2 / Step-Audio / Spark-TTS / Higgs Audio v2 / VibeVoice / Sesame CSM / GLM-TTS / LongCat-AudioDiT / Qwen3-TTS / VoxCPM2 的 repo、HF 卡、许可证、显存**均已核实**，结论已并入本报告第 11 节。三个曾经的缺口（Qwen3-TTS 的 HF+许可、LongCat 的 owner、VoxCPM2 的 HF 侧许可）**全部已坐实**。
  其中 **Qwen3-TTS 的 HF repo 与许可证**、**LongCat-Audio-DiT 的 owner（疑似美团）**、**VoxCPM2 的 HF 侧许可证字段** 是三个明确缺口（**已解决**：hf-mirror 抓 `openbmb/VoxCPM` 返回 401 是因为 **repo 名错了**——正确名是 **`openbmb/VoxCPM2`**（含 `2`，owner 全小写），返回 200，模型卡 frontmatter 第 33 行 `license: apache-2.0`，HF API tags = `license:apache-2.0`，`gated: False` → **与 GitHub 声明一致，「free for commercial use」成立**）。
- **中文 Arena 排名**：已发现唯一的中文 Arena 原始投票数据 `JacobLinCool/zh-tw-tts-arena-votes`（2026-07-24，4 个 jsonl），**本轮只读了 README 未统计 → 排名仍为「未查到」**。
- **Qwen3-TTS / VoxCPM2 / GLM-TTS / Step-Audio 2 / VibeVoice / Spark-TTS / Sesame CSM / LongCat-AudioDiT 的显存**：官方均未公布 → **未查到**（VoxCPM2 的 ~8GB 与 FireRedTTS-2 的 9GB 为厂商自报）。
- **IndexTTS / F5-TTS / MegaTTS3 / MOSS-TTS 的 sm_120 实机实测**：index-tts issue #242 与 sneekes.app 的 RTX5070 F5-TTS 指南两次抓取均超时 → 未查到。
- **Kokoro 中文客观指标（test-zh CER / SIM-o）**：无官方论文、第三方只测英文 → 未查到。
- **ChatTTS 任何客观指标**：官方无论文，第三方榜未收录 → 未查到。

---
*本文件由 DSH agent 于 2026-09-22 生成。所有 URL 均为实际抓取验证；查不到的字段一律标注「未查到」，未做任何推测填充。*
*工作副本位于 `_scratch/_raw_TTS.md`（父 agent 的清理流程会把 `_raw_*.md` 扫入 `_scratch/`）；同内容副本保留在本目录 `_raw_TTS.md`。*
