# 开源的「带音色克隆的歌曲生成 AI」调研

**调研日期**：2026-09-16
**调研人**：DSH（DeepSeek Harness）
**给谁看**：本机（GPU 机 RTX 5060 Ti 16GB）上的 AI 音乐落地选型
**结论一句话**：**目前没有任何一个开源模型能「一次点击 = 我要的歌 + 我要的歌手音色 + 可商用」。**
工程上最靠谱的是**两段式**：先用歌曲生成模型出歌（推荐 ACE-Step 1.5，MIT 可商用），再用**歌声转换（SVC）**把音色换成目标人声（SoulX-Singer-SVC / Applio-RVC / Seed-VC）。
若追求「一步到位、原厂就带零样本音色克隆」，**腾讯 LeVo 2（SongGeneration 2）**最强，但**许可证禁止商用**；**YuE v1** 的 ICL 双轨模式是 Apache 2.0 里唯一能靠参考音频带出音色的。

---

## 一、总览对照表

| 模型 | 类型 | 音色克隆方式 | 显存 | 许可证（权重） | 一句话评价 |
|---|---|---|---|---|---|
| **ACE-Step 1.5**（ACE Studio + StepFun） | 端到端歌曲生成（LM 规划 + DiT） | `reference_audio` 参考音频控音色；Cover / Repaint 可「基于上下文克隆音色」；要 100% 像某人需 LoRA 微调 | 2B：<4GB 可跑；XL(4B)：≥12GB（带 offload） | **MIT（含权重，明确可商用）** | 🏆 **工程首选**：快、可编辑能力最全、许可最干净；代价是第三方实测有「金属味」音染 |
| **LeVo 2 / SongGeneration 2**（腾讯） | 端到端歌曲生成（LeLM + Codec DiT） | **零样本音色克隆，3 秒参考音频**；支持人声/伴奏双轨输出 | 10 / 22 / 28GB 三档 | ⚠️ 腾讯自定义：**仅学术/研究/教育，禁止商用与生产** | 音质口碑第一（独立实测），但许可证最死；权重挂在个人 HF 账号（`lglg666/SongGeneration-v2-large`） |
| **YuE v1**（HKUST / M-A-P） | 端到端（LM-only，7B+1B） | **ICL 双轨模式**：给 30s 参考歌的「人声轨 + 伴奏轨」→ 生成同风格/相近音色的新歌（社区已验证可做音色克隆翻唱） | 24GB 以下只能跑 2 段 | **Apache 2.0（含权重）** | 老牌开源王；慢（4090 出 30s 要 ~6 分钟），音色克隆是「风格迁移式」而非精准身份锁定 |
| **YuE2**（同团队，2026-09） | 端到端（符号乐谱 + 音频） | 零样本**翻唱**：音频→SheetSage2 转 ABC 乐谱→新风格重渲染（保旋律，不锁歌手音色） | **24GB 起** | ⚠️ 权重 **CC BY-NC 4.0**（禁商用） | 质量已接近 Suno v5/v6，乐谱可编辑是独门优势；**本机已在 16GB 上通过 ComfyUI fork 跑通**（见 `dl-hub/18-YuE2音乐生成/`） |
| **HeartMuLa**（2026） | 端到端（3B LM） | 本体无音色克隆；衍生 **MuLaCover**（2026-09-16）参考音频/MIDI→翻唱 remix | 3B，单卡可跑 | 本体 **Apache 2.0**；**MuLaCover 权重与产出 CC BY-NC** | 歌词可控性好、许可友好；翻唱模块权重禁商用 |
| **DiffRhythm 2**（西工大 ASLP + 小米） | 端到端（Block Flow Matching） | DiffRhythm+ 起有 speaker similarity 路线，偏「像」而非锁身份 | 单卡可跑 | **Apache 2.0** | 快、许可好；但整体音质/人声伴奏和谐度在 2026 横评里排后段 |
| **Muse**（复旦，0.6B） | 端到端（Qwen3 LM + MuCodec） | ❌ | 极低 | 开源（含 7771h 合成训练集） | 可复现性最好，适合研究；无音色克隆 |
| **SongBloom**（腾讯 + 港中深） | 端到端（AR + diffusion 交错） | ✅ **推理时必须给参考音频**（最接近「参考音色驱动」的原生设计） | 单卡 | 需自查 | 架构独特，但依赖参考音频，未进主流对比 |
| **UniSinger**（西工大 + 快手，arXiv 2606.07015） | 统一「音色克隆歌曲生成 + 带伴奏 SVC」 | ✅ 跨任务说话人嵌入空间，Spk-Sim 68.85%（超 YuE 65.15、ACE-Step 52.32） | — | ❌ **未开源**（只有论文 + 匿名 demo） | 学术上最对题的一个，但**现在用不了**，值得盯 |
| **SoulX-Singer / -SVC**（Soul App + 天大/西工大等） | **歌声合成 + 歌声转换（不是整首歌生成）** | ✅ **零样本音色克隆**（SVS 用 F0/MIDI 谱 + 3~10s 参考；SVC 免转写 wav→wav） | **8GB 可跑**（社区整合包） | **Apache 2.0** | 🏆 **「换音色」环节的首选**，中英粤，42k 小时训练；2026-03 起支持免转写 SVC |
| **Seed-VC** | 语音/歌声转换 | ✅ 零样本，1~30s 参考，免训练 | 低 | 开源 | 通用 VC/SVC，效果稳、可微调；比 RVC 更「零样本」 |
| **RVC / Applio** | 歌声转换 | ✅ 需小样本训练（10 分钟级） | 低（8GB 够） | **MIT** | 音色相似度天花板高、生态最成熟；Applio 已转维护模式 |
| **so-vits-svc** | 歌声转换 | ✅ 需训练 | 低 | 开源（已停更） | 老牌基准，2026 横评仍在被对比，但不再更新 |

> 说明：上表「显存」指官方推荐值；「许可证」指**权重**，代码许可可能不同（如 MuLaCover 代码 Apache-2.0、权重 CC BY-NC）。

---

## 二、三条技术路线（怎么选）

### 路线 A：一步到位 —— 生成时就带参考音色
用模型自带的参考音频/ICL 通道。
- **能商用**：ACE-Step 1.5（参考音频控音色 + Cover/Repaint 克隆音色）、YuE v1（Apache 2.0，ICL 双轨）。
- **不能商用但效果最好**：LeVo 2（3 秒克隆，音质第一）、YuE2（翻唱）、MuLaCover。
- 现实预期：这一路的「音色克隆」多是**软控制**——音色方向对，但不像本人。要真像 → 路线 B 或对 ACE-Step 做 LoRA。

### 路线 B：两段式（★ 最推荐、最可控）
```
歌曲生成（ACE-Step 1.5 / YuE2 / LeVo2）
   ↓ 出完整歌（人声+伴奏）
人声分离（UVR5 / Demucs：取干声）
   ↓
歌声转换（SoulX-Singer-SVC / Seed-VC / Applio-RVC）
   ↓ 换成目标音色（3~30s 参考，或 10 分钟训练 RVC 模型）
混回伴奏 → 成品
```
- 优点：每一步都有成熟开源工具、可单独调参、音色相似度天花板最高。
- 覆盖率：这是目前 B 站/抖音「AI 翻唱」的实际主流链路。

### 路线 C：纯歌声合成（需要乐谱/MIDI）
「改歌词保旋律」的场景：
- **SoulX-Singer**：歌词 + MIDI 谱（或 F0 旋律）→ 目标音色演唱，可只改歌词保留原曲演唱细节；8GB 显存可跑。
- **DiffSinger / OpenUtau / NNSVS**：需自训声库，控制力最强、门槛最高。
- **TCSinger2**（ACL 2025）：多语言零样本定制 SVS，学术向。

---

## 三、重点模型卡片

### 1) ACE-Step 1.5 —— 本机首选（MIT、快、可编辑）
- 架构：Qwen3 系 **5Hz LM 规划器** + **DiT 渲染器**（2B 标准 / 4B XL），48kHz 立体声，8 步 turbo。
- 速度：A100 上一首 <2s；3090 上 <10s；显存 <4GB 可跑（2B turbo + CPU offload）。
- 音色相关能力（官方中文教程原文口径）：
  - `reference_audio`：控制**音色、混音、演奏/演唱风格**等全局声学特征；
  - `src_audio` + Cover：控制旋律结构，改风格/改歌词；
  - **Repaint：「克隆音色：基于上下文克隆源音频的音色特征」**（3~90s 区间操作）；
  - Base 模型独占 `extract / lego / complete`（分离人声、加轨、给人声配伴奏）。
- LoRA：**8 首歌 / 3090 上 1 小时**即可训专属音色/风格 LoRA（这是「真正锁定某个音色」的正路）。
- 许可：**MIT，代码与权重均含，HF 卡片明确「可用于商业用途」**。
- 短板：第三方横评（IT-JIM，2026-05）指出持续元音与镲片上可听到**金属质感的 shimmer 音染**（推测与 5Hz FSQ tokenizer 或低步数去噪有关），音质纯听感不如 LeVo 2；歌词对齐/结构在 2026 对比里也属中游。

### 2) LeVo 2 / SongGeneration 2 —— 质量第一，但禁商用
- 零样本音色克隆：**3 秒参考音频**即可复刻音色、音调、情感、韵律；支持**人声/伴奏双轨**生成（便于后期混音）。
- 参数约 4B（LeLM），三档显存（10/22/28GB），最长 4 分 30 秒。
- 独立横评（IT-JIM）判定其**音质与自然度全场第一**。
- ⚠️ 许可证原文（v1/v2 共用）：*"use the SongGeneration only for academic, research and education purposes, and refrain from using it for any commercial or production purposes under any circumstances."* → **只能研究/学习/自娱**。
- 附带坑：v2 至今**没有论文**，README 即文档；HF 权重挂在个人账号，卡片标 `license: unknown`。

### 3) YuE 系
- **YuE v1（Apache 2.0，含权重）**：真正的「一句歌词 → 完整歌（人声+伴奏）」。音色克隆靠 **ICL**：给 30s 参考音频（**双轨模式效果最好**，需先用 UVR 分出人声/伴奏两轨），模型写同风格新歌。24GB 以下限制 2 段，速度慢。
- **YuE2（CC BY-NC 权重）**：符号乐谱（ABC）中间层，可读、可改、可复用；**零样本翻唱**是「音频 → SheetSage2 转谱 → 新风格重渲染」，保旋律结构、**不锁歌手音色**。需 24GB。
- **本机现状**：已通过 `ScryptHunter/ComfyUI-YuE2` fork 在 **16GB 卡**上跑通（`memory_budget_gib=16` + offload + tiled VAE，峰值 9.26~10.05GiB），并已跑通参考音频转谱（SheetSage2）。记录见 `dl-hub/18-YuE2音乐生成/YuE2部署与实测记录-2026-09-13.md`。
- ⚠️ 注意：第三方魔改版（如 B 站「T8 魔改版 YuE2 支持音色参考翻唱」）属于社区二次开发，与本机当前 fork 不是一套，混用会踩坑。

### 4) SoulX-Singer / SoulX-Singer-SVC —— 「换音色」环节的主力（Apache 2.0）
- SVS：歌词 +（F0 旋律 | MIDI 谱）→ 目标音色演唱；**零样本音色克隆**，跨语言（中/英/粤），训练数据 42,000+ 小时；支持「改歌词保自然韵律」。
- SVC（2026-03 发布）：**免转写 wav→wav**，直接把一段歌声换成参考音色，保留原旋律/节奏/歌词。
- 显存：社区实测 **8GB 可跑**（FP16、batch 1~2），4 分钟歌 1~2 分钟出结果。
- 官方 WebUI：`webui.py`（SVS）/ `webui_svc.py`（SVC）；HF 上有在线 demo 与 MIDI Editor。
- 许可：**Apache 2.0（代码 + 权重）**，比 RVC 系更适合直接集成。

---

## 四、本机（RTX 5060 Ti 16GB）落地建议

**推荐组合（都可商用/许可干净）：**
1. **ACE-Step 1.5**（`acestep-v15-turbo` 2B + `acestep-5Hz-lm-1.7B`）→ 出整首歌；16GB 上 XL 需 offload，2B 毫无压力。
2. 需要「就是某人的声音」时，二选一：
   - **零样本**：SoulX-Singer-SVC 或 Seed-VC（给 3~30s 参考即换）；
   - **最高相似度**：Applio/RVC 训一个该音色的模型（10 分钟级，MIT）。
3. 要「同一个新音色反复出歌」→ 直接给 ACE-Step 训 **LoRA**（8 首歌 1 小时），一次投入长期复用。

**不建议作为生产链路**：LeVo 2（禁商用）、YuE2 权重（CC BY-NC）、MuLaCover 权重（CC BY-NC）——只适合研究/自娱/对比试验。
**可以盯**：UniSinger（统一音色克隆歌曲生成 + 带伴奏 SVC，SOTA 指标）目前未放权重；一旦开源，是唯一能一步到位且质量对标 YuE 的方案。

**若在本机装 ACE-Step**：与现有 ComfyUI 共存需注意 16GB 显存分配（ComfyUI 常驻 + ACE-Step XL 会紧张；建议跑 2B turbo 档，或先 `bash ~/stop-ridge.sh` 释放显存，参考 `dl-hub/06-ComfyUI-H3运维记录/` 的显存管理记录）。社区有 ComfyUI 节点（`ComfyUI-ACEStep` 等）。

---

## 五、合规提醒（别跳过）

1. **声音权/人格权**：中国《民法典》第 1023 条明确保护自然人声音（参照肖像权）；已有 AI 配音/声音侵权判赔案例。**克隆真人音色用于公开发布/商业用途，需本人书面授权**，即使是「自己训练自己听」也建议不外传。
2. **训练数据与产出**：用他人歌曲做参考/翻唱，词曲版权与录音制作者权仍在；「AI 改词翻唱」比「原词翻唱」争议小，但不等于无风险。
3. **平台要求**：主流平台要求 AI 生成内容标注；音频类建议在简介/元数据中声明 AI 参与。
4. **许可证红线**：LeVo 2 / YuE2 权重 / MuLaCover 权重都明令**非商用**——不要拿它们做产品、接商单、上架平台变现。

---

## 六、参考链接

- ACE-Step 1.5：<https://github.com/ace-step/ACE-Step-1.5> ｜ 中文教程 <https://github.com/ace-step/ACE-Step-1.5/blob/main/docs/zh/Tutorial.md> ｜ 项目页 <https://ace-step.github.io/ace-step-v1.5.github.io/>
- ACE-Step v1（v1 论文/音色克隆表述）：<https://github.com/ace-step/ACE-Step> ｜ <https://arxiv.org/abs/2506.00045>
- LeVo / SongGeneration 2：<https://levo-demo.github.io/> ｜ 权重 <https://huggingface.co/lglg666/SongGeneration-v2-large> ｜ 技术解析（中文）<https://www.chinaz.com/ainews/19001.shtml>
- YuE v1：<https://github.com/multimodal-art-projection/YuE/tree/YuE-v1> ｜ YuE2：<https://github.com/multimodal-art-projection/YuE> ｜ 论文 <https://arxiv.org/abs/2503.08638>
- HeartMuLa：<https://github.com/HeartMuLa/heartlib> ｜ MuLaCover：<https://github.com/HeartMuLa/MuLaCover>
- DiffRhythm 2：<https://github.com/ASLP-lab/DiffRhythm2> ｜ 论文 <https://arxiv.org/pdf/2510.22950>
- SoulX-Singer：<https://github.com/Soul-AILab/SoulX-Singer> ｜ 论文 <https://arxiv.org/abs/2602.07803>
- Seed-VC：<https://github.com/Plachtaa/seed-vc> ｜ Applio：<https://github.com/IAHispano/Applio>
- UniSinger（未开源）：<https://arxiv.org/html/2606.07015v1>
- 独立横评（2026-05，8 个开源模型实听对比 + 许可证梳理）：<https://www.it-jim.com/blog/best-open-source-ai-music-generator/>
- YuE2 官方基准（含 LeVo 2 / HeartMuLa / ACE-Step 1.5 / DiffRhythm 2 对照组）：<https://huggingface.co/datasets/m-a-p/WildSongBench>

---

*本报告基于 2026-09-17 的公开资料与官方仓库 README/文档，未在本机对除 YuE2 外的模型做实测；「音质排名」引自第三方横评，非本机复现。*
