调研日期:2026-09-16 调研人:DSH(DeepSeek Harness) 给谁看:本机(GPU 机 RTX 5060 Ti 16GB)上的 AI 音乐落地选型 结论一句话:目前没有任何一个开源模型能「一次点击 = 我要的歌 + 我要的歌手音色 + 可商用」。 工程上最靠谱的是两段式:先用歌曲生成模型出歌(推荐 ACE-Step 1.5,MIT 可商用),再用歌声转换(SVC)把音色换成目标人声(SoulX-Singer-SVC / Applio-RVC / Seed-VC)。 若追求「一步到位、原厂就带零样本音色克隆」,腾讯 LeVo 2(SongGeneration 2)最强,但许可证禁止商用;YuE v1 的 ICL 双轨模式是 Apache 2.0 里唯一能靠参考音频带出音色的。
| 模型 | 类型 | 音色克隆方式 | 显存 | 许可证(权重) | 一句话评价 |
|---|---|---|---|---|---|
| ACE-Step 1.5(ACE Studio + StepFun) | 端到端歌曲生成(LM 规划 + DiT) | reference_audio 参考音频控音色;Cover / Repaint 可「基于上下文克隆音色」;要 100% 像某人需 LoRA 微调 | 2B:<4GB 可跑;XL(4B):≥12GB(带 offload) | MIT(含权重,明确可商用) | 🏆 工程首选:快、可编辑能力最全、许可最干净;代价是第三方实测有「金属味」音染 |
| LeVo 2 / SongGeneration 2(腾讯) | 端到端歌曲生成(LeLM + Codec DiT) | 零样本音色克隆,3 秒参考音频;支持人声/伴奏双轨输出 | 10 / 22 / 28GB 三档 | ⚠️ 腾讯自定义:仅学术/研究/教育,禁止商用与生产 | 音质口碑第一(独立实测),但许可证最死;权重挂在个人 HF 账号(lglg666/SongGeneration-v2-large) |
| YuE v1(HKUST / M-A-P) | 端到端(LM-only,7B+1B) | ICL 双轨模式:给 30s 参考歌的「人声轨 + 伴奏轨」→ 生成同风格/相近音色的新歌(社区已验证可做音色克隆翻唱) | 24GB 以下只能跑 2 段 | Apache 2.0(含权重) | 老牌开源王;慢(4090 出 30s 要 ~6 分钟),音色克隆是「风格迁移式」而非精准身份锁定 |
| YuE2(同团队,2026-09) | 端到端(符号乐谱 + 音频) | 零样本翻唱:音频→SheetSage2 转 ABC 乐谱→新风格重渲染(保旋律,不锁歌手音色) | 24GB 起 | ⚠️ 权重 CC BY-NC 4.0(禁商用) | 质量已接近 Suno v5/v6,乐谱可编辑是独门优势;本机已在 16GB 上通过 ComfyUI fork 跑通(见 dl-hub/18-YuE2音乐生成/) |
| HeartMuLa(2026) | 端到端(3B LM) | 本体无音色克隆;衍生 MuLaCover(2026-09-16)参考音频/MIDI→翻唱 remix | 3B,单卡可跑 | 本体 Apache 2.0;MuLaCover 权重与产出 CC BY-NC | 歌词可控性好、许可友好;翻唱模块权重禁商用 |
| DiffRhythm 2(西工大 ASLP + 小米) | 端到端(Block Flow Matching) | DiffRhythm+ 起有 speaker similarity 路线,偏「像」而非锁身份 | 单卡可跑 | Apache 2.0 | 快、许可好;但整体音质/人声伴奏和谐度在 2026 横评里排后段 |
| Muse(复旦,0.6B) | 端到端(Qwen3 LM + MuCodec) | ❌ | 极低 | 开源(含 7771h 合成训练集) | 可复现性最好,适合研究;无音色克隆 |
| SongBloom(腾讯 + 港中深) | 端到端(AR + diffusion 交错) | ✅ 推理时必须给参考音频(最接近「参考音色驱动」的原生设计) | 单卡 | 需自查 | 架构独特,但依赖参考音频,未进主流对比 |
| UniSinger(西工大 + 快手,arXiv 2606.07015) | 统一「音色克隆歌曲生成 + 带伴奏 SVC」 | ✅ 跨任务说话人嵌入空间,Spk-Sim 68.85%(超 YuE 65.15、ACE-Step 52.32) | — | ❌ 未开源(只有论文 + 匿名 demo) | 学术上最对题的一个,但现在用不了,值得盯 |
| SoulX-Singer / -SVC(Soul App + 天大/西工大等) | 歌声合成 + 歌声转换(不是整首歌生成) | ✅ 零样本音色克隆(SVS 用 F0/MIDI 谱 + 3~10s 参考;SVC 免转写 wav→wav) | 8GB 可跑(社区整合包) | Apache 2.0 | 🏆 「换音色」环节的首选,中英粤,42k 小时训练;2026-03 起支持免转写 SVC |
| Seed-VC | 语音/歌声转换 | ✅ 零样本,1~30s 参考,免训练 | 低 | 开源 | 通用 VC/SVC,效果稳、可微调;比 RVC 更「零样本」 |
| RVC / Applio | 歌声转换 | ✅ 需小样本训练(10 分钟级) | 低(8GB 够) | MIT | 音色相似度天花板高、生态最成熟;Applio 已转维护模式 |
| so-vits-svc | 歌声转换 | ✅ 需训练 | 低 | 开源(已停更) | 老牌基准,2026 横评仍在被对比,但不再更新 |
说明:上表「显存」指官方推荐值;「许可证」指权重,代码许可可能不同(如 MuLaCover 代码 Apache-2.0、权重 CC BY-NC)。
用模型自带的参考音频/ICL 通道。
歌曲生成(ACE-Step 1.5 / YuE2 / LeVo2)
↓ 出完整歌(人声+伴奏)
人声分离(UVR5 / Demucs:取干声)
↓
歌声转换(SoulX-Singer-SVC / Seed-VC / Applio-RVC)
↓ 换成目标音色(3~30s 参考,或 10 分钟训练 RVC 模型)
混回伴奏 → 成品
「改歌词保旋律」的场景:
reference_audio:控制音色、混音、演奏/演唱风格等全局声学特征;src_audio + Cover:控制旋律结构,改风格/改歌词;extract / lego / complete(分离人声、加轨、给人声配伴奏)。license: unknown。ScryptHunter/ComfyUI-YuE2 fork 在 16GB 卡上跑通(memory_budget_gib=16 + offload + tiled VAE,峰值 9.26~10.05GiB),并已跑通参考音频转谱(SheetSage2)。记录见 dl-hub/18-YuE2音乐生成/YuE2部署与实测记录-2026-09-13.md。webui.py(SVS)/ webui_svc.py(SVC);HF 上有在线 demo 与 MIDI Editor。推荐组合(都可商用/许可干净):
acestep-v15-turbo 2B + acestep-5Hz-lm-1.7B)→ 出整首歌;16GB 上 XL 需 offload,2B 毫无压力。不建议作为生产链路:LeVo 2(禁商用)、YuE2 权重(CC BY-NC)、MuLaCover 权重(CC BY-NC)——只适合研究/自娱/对比试验。 可以盯:UniSinger(统一音色克隆歌曲生成 + 带伴奏 SVC,SOTA 指标)目前未放权重;一旦开源,是唯一能一步到位且质量对标 YuE 的方案。
若在本机装 ACE-Step:与现有 ComfyUI 共存需注意 16GB 显存分配(ComfyUI 常驻 + ACE-Step XL 会紧张;建议跑 2B turbo 档,或先 bash ~/stop-ridge.sh 释放显存,参考 dl-hub/06-ComfyUI-H3运维记录/ 的显存管理记录)。社区有 ComfyUI 节点(ComfyUI-ACEStep 等)。
本报告基于 2026-09-17 的公开资料与官方仓库 README/文档,未在本机对除 YuE2 外的模型做实测;「音质排名」引自第三方横评,非本机复现。