开源歌曲生成AI与音色克隆-调研-20260916.md

开源的「带音色克隆的歌曲生成 AI」调研

调研日期:2026-09-16 调研人:DSH(DeepSeek Harness) 给谁看:本机(GPU 机 RTX 5060 Ti 16GB)上的 AI 音乐落地选型 结论一句话:目前没有任何一个开源模型能「一次点击 = 我要的歌 + 我要的歌手音色 + 可商用」。 工程上最靠谱的是两段式:先用歌曲生成模型出歌(推荐 ACE-Step 1.5,MIT 可商用),再用歌声转换(SVC)把音色换成目标人声(SoulX-Singer-SVC / Applio-RVC / Seed-VC)。 若追求「一步到位、原厂就带零样本音色克隆」,腾讯 LeVo 2(SongGeneration 2)最强,但许可证禁止商用;YuE v1 的 ICL 双轨模式是 Apache 2.0 里唯一能靠参考音频带出音色的。


一、总览对照表

模型类型音色克隆方式显存许可证(权重)一句话评价
ACE-Step 1.5(ACE Studio + StepFun)端到端歌曲生成(LM 规划 + DiT)reference_audio 参考音频控音色;Cover / Repaint 可「基于上下文克隆音色」;要 100% 像某人需 LoRA 微调2B:<4GB 可跑;XL(4B):≥12GB(带 offload)MIT(含权重,明确可商用)🏆 工程首选:快、可编辑能力最全、许可最干净;代价是第三方实测有「金属味」音染
LeVo 2 / SongGeneration 2(腾讯)端到端歌曲生成(LeLM + Codec DiT)零样本音色克隆,3 秒参考音频;支持人声/伴奏双轨输出10 / 22 / 28GB 三档⚠️ 腾讯自定义:仅学术/研究/教育,禁止商用与生产音质口碑第一(独立实测),但许可证最死;权重挂在个人 HF 账号(lglg666/SongGeneration-v2-large)
YuE v1(HKUST / M-A-P)端到端(LM-only,7B+1B)ICL 双轨模式:给 30s 参考歌的「人声轨 + 伴奏轨」→ 生成同风格/相近音色的新歌(社区已验证可做音色克隆翻唱)24GB 以下只能跑 2 段Apache 2.0(含权重)老牌开源王;慢(4090 出 30s 要 ~6 分钟),音色克隆是「风格迁移式」而非精准身份锁定
YuE2(同团队,2026-09)端到端(符号乐谱 + 音频)零样本翻唱:音频→SheetSage2 转 ABC 乐谱→新风格重渲染(保旋律,不锁歌手音色)24GB 起⚠️ 权重 CC BY-NC 4.0(禁商用)质量已接近 Suno v5/v6,乐谱可编辑是独门优势;本机已在 16GB 上通过 ComfyUI fork 跑通(见 dl-hub/18-YuE2音乐生成/)
HeartMuLa(2026)端到端(3B LM)本体无音色克隆;衍生 MuLaCover(2026-09-16)参考音频/MIDI→翻唱 remix3B,单卡可跑本体 Apache 2.0;MuLaCover 权重与产出 CC BY-NC歌词可控性好、许可友好;翻唱模块权重禁商用
DiffRhythm 2(西工大 ASLP + 小米)端到端(Block Flow Matching)DiffRhythm+ 起有 speaker similarity 路线,偏「像」而非锁身份单卡可跑Apache 2.0快、许可好;但整体音质/人声伴奏和谐度在 2026 横评里排后段
Muse(复旦,0.6B)端到端(Qwen3 LM + MuCodec)❌极低开源(含 7771h 合成训练集)可复现性最好,适合研究;无音色克隆
SongBloom(腾讯 + 港中深)端到端(AR + diffusion 交错)✅ 推理时必须给参考音频(最接近「参考音色驱动」的原生设计)单卡需自查架构独特,但依赖参考音频,未进主流对比
UniSinger(西工大 + 快手,arXiv 2606.07015)统一「音色克隆歌曲生成 + 带伴奏 SVC」✅ 跨任务说话人嵌入空间,Spk-Sim 68.85%(超 YuE 65.15、ACE-Step 52.32)—❌ 未开源(只有论文 + 匿名 demo)学术上最对题的一个,但现在用不了,值得盯
SoulX-Singer / -SVC(Soul App + 天大/西工大等)歌声合成 + 歌声转换(不是整首歌生成)✅ 零样本音色克隆(SVS 用 F0/MIDI 谱 + 3~10s 参考;SVC 免转写 wav→wav)8GB 可跑(社区整合包)Apache 2.0🏆 「换音色」环节的首选,中英粤,42k 小时训练;2026-03 起支持免转写 SVC
Seed-VC语音/歌声转换✅ 零样本,1~30s 参考,免训练低开源通用 VC/SVC,效果稳、可微调;比 RVC 更「零样本」
RVC / Applio歌声转换✅ 需小样本训练(10 分钟级)低(8GB 够)MIT音色相似度天花板高、生态最成熟;Applio 已转维护模式
so-vits-svc歌声转换✅ 需训练低开源(已停更)老牌基准,2026 横评仍在被对比,但不再更新

说明:上表「显存」指官方推荐值;「许可证」指权重,代码许可可能不同(如 MuLaCover 代码 Apache-2.0、权重 CC BY-NC)。


二、三条技术路线(怎么选)

路线 A:一步到位 —— 生成时就带参考音色

用模型自带的参考音频/ICL 通道。

路线 B:两段式(★ 最推荐、最可控)

歌曲生成(ACE-Step 1.5 / YuE2 / LeVo2)
   ↓ 出完整歌(人声+伴奏)
人声分离(UVR5 / Demucs:取干声)
   ↓
歌声转换(SoulX-Singer-SVC / Seed-VC / Applio-RVC)
   ↓ 换成目标音色(3~30s 参考,或 10 分钟训练 RVC 模型)
混回伴奏 → 成品

路线 C:纯歌声合成(需要乐谱/MIDI)

「改歌词保旋律」的场景:


三、重点模型卡片

1) ACE-Step 1.5 —— 本机首选(MIT、快、可编辑)

2) LeVo 2 / SongGeneration 2 —— 质量第一,但禁商用

3) YuE 系

4) SoulX-Singer / SoulX-Singer-SVC —— 「换音色」环节的主力(Apache 2.0)


四、本机(RTX 5060 Ti 16GB)落地建议

推荐组合(都可商用/许可干净):

  1. ACE-Step 1.5(acestep-v15-turbo 2B + acestep-5Hz-lm-1.7B)→ 出整首歌;16GB 上 XL 需 offload,2B 毫无压力。
  2. 需要「就是某人的声音」时,二选一:
    • 零样本:SoulX-Singer-SVC 或 Seed-VC(给 3~30s 参考即换);
    • 最高相似度:Applio/RVC 训一个该音色的模型(10 分钟级,MIT)。
  3. 要「同一个新音色反复出歌」→ 直接给 ACE-Step 训 LoRA(8 首歌 1 小时),一次投入长期复用。

不建议作为生产链路:LeVo 2(禁商用)、YuE2 权重(CC BY-NC)、MuLaCover 权重(CC BY-NC)——只适合研究/自娱/对比试验。 可以盯:UniSinger(统一音色克隆歌曲生成 + 带伴奏 SVC,SOTA 指标)目前未放权重;一旦开源,是唯一能一步到位且质量对标 YuE 的方案。

若在本机装 ACE-Step:与现有 ComfyUI 共存需注意 16GB 显存分配(ComfyUI 常驻 + ACE-Step XL 会紧张;建议跑 2B turbo 档,或先 bash ~/stop-ridge.sh 释放显存,参考 dl-hub/06-ComfyUI-H3运维记录/ 的显存管理记录)。社区有 ComfyUI 节点(ComfyUI-ACEStep 等)。


五、合规提醒(别跳过)

  1. 声音权/人格权:中国《民法典》第 1023 条明确保护自然人声音(参照肖像权);已有 AI 配音/声音侵权判赔案例。克隆真人音色用于公开发布/商业用途,需本人书面授权,即使是「自己训练自己听」也建议不外传。
  2. 训练数据与产出:用他人歌曲做参考/翻唱,词曲版权与录音制作者权仍在;「AI 改词翻唱」比「原词翻唱」争议小,但不等于无风险。
  3. 平台要求:主流平台要求 AI 生成内容标注;音频类建议在简介/元数据中声明 AI 参与。
  4. 许可证红线:LeVo 2 / YuE2 权重 / MuLaCover 权重都明令非商用——不要拿它们做产品、接商单、上架平台变现。

六、参考链接


本报告基于 2026-09-17 的公开资料与官方仓库 README/文档,未在本机对除 YuE2 外的模型做实测;「音质排名」引自第三方横评,非本机复现。

下载此文件