一个约 3.6B 的开源模型,把"给段歌词就出一整首歌"这件事从云端搬回了自己的电脑。
YuE2-3B 是 m-a-p 团队 2026 年 9 月开源的整曲音乐生成模型。你给它一段歌词、一句风格描述,它先写出一份能看懂、也能动手改的乐谱,再把这份乐谱渲染成带人声和伴奏的 48kHz 立体声歌曲。想把一首老歌翻新、把中文流行改成英文爵士,走的还是同一套权重、同一套流程。现在它已经打包成 AIGCPanel 的一键运行包,下载导入就能在本机跑。
▶ 大多数 AI 音乐把成品黑盒交给你;YuE2-3B 先把一份可以改的乐谱摊开给你看。
亮点一:一句风格 + 一段歌词,出一首完整的歌
要填的只有两样。歌词 里可以用 [Intro] [Verse] [Chorus] [Bridge] [Outro] 段落标签,模型会按真实歌曲的"前奏---主歌---副歌---尾奏"结构编曲;风格 描述语言、曲风、乐器、人声特点和速度,中英文都认。默认输出就是人声加伴奏的 48kHz 立体声,一次成型。
它也不是"一步出音频"的模型:骨干是 AR--NAR 混合的 Mixture-of-Transformers,先自回归写出乐谱和语义 token,再用 flow matching 生成声学 latent,最后交给 VAE 解码成音频。生成模式分三档------完整规划(旋律 + 和弦)、仅旋律规划、直接生成;想可控就开规划,想快就直接生成。

▶ 它把作曲拆成了两步:先把想法写成符号,再把符号变成声音。两步之间,人随时能插手。
亮点二:乐谱是能读、也能改的
规划出来的乐谱是标准 ABC 记谱,旋律与和弦都是显式文本。下面这段来自项目自带示例:V: Vocal 是人声旋律,V: Ins 是伴奏,带引号的 "C" "G" 是和弦。
abc
X:1
M:4/4
L:1/16
Q:1/4=88
V: Vocal clef=treble name="Vocal Melody" snm="Vocal"
V: Ins clef=treble name="Ins Melody" snm="Inst."
K:C
% verse
V: Vocal
"C"E2G2A2G2E2D2C4|"G"D2E2G2E2D2C2D4|
V: Ins
Z4|
想改就改这份文本,再把改完的乐谱当成新的输入去渲染。官方做过一组编辑实验:在 10 首作品、380 条整曲录音上,改动音符后局部旋律达成度从 0.0083 提到 0.9375,改动时值后和声达成度从 0 提到 0.8313。改的是你指的那一处,不是整首推倒重来。
▶ 乐谱即接口:能读、能改,才谈得上"这段是我说了算"。
亮点三:上传一段原曲,换一种风格翻唱
翻唱是一条链:原曲音频先进 SheetSage2 转谱,得到旋律 ABC;再配上新歌词和目标风格,交给 YuE2 渲染出翻唱版。在 AIGCPanel 里,这一整条链就是一个「歌曲翻唱」任务,两个环境不用你自己拼。
官方翻唱评测覆盖 948 首作品,每首 2 种目标风格 × 2 个随机种子(每个方法 3792 条输出):给完整乐谱时 YuE2 的 CLEWS mAP 达到 0.647、Hit@1 71.3%,完全不给乐谱只有 0.006。翻唱推荐用「旋律翻唱」模式------保留原曲旋律、伴奏放开跟着新风格改;想让和声也固定,就选「完整谱面」。
亮点四:质量对标 Suno v5/v6
WildSongBench 在 2026-09-12 的评测覆盖 192 条提示词、17 个系统,几个关键结果:
| 系统 | SongBench Avg ↑ | AudioBox PQ ↑ | PER ↓ |
|---|---|---|---|
| YuE2(best-of-8) | 6.9632 | 8.2714 | 9.79% |
| Mureka 9 | 6.9377 | 8.0226 | 11.69% |
| Suno v5 | 6.8721 | 8.1698 | 8.10% |
| YuE2 | 6.7316 | 8.2598 | 8.44% |
| Suno v6 | 6.5562 | 8.1296 | 7.58% |
单次生成的 YuE2 拿到 6.7316,已经落在闭源商业模型的区间里;best-of-8 的 6.9632 是这次评测里最高的观察均值。不同指标各有领先者------Suno v6 在 SongEval 和音素错误率上更好,而且这些均值之间的差距属于描述性结果,不构成统计显著性结论。

在 AIGCPanel 里一键跑起来
- 到 AIGCPanel 官网下载桌面端(Windows / macOS / Linux 都有,软件本身不挑显卡)。
- 打开「模型」→ 模型市场,按「歌曲生成」或「歌曲翻唱」筛选,找到 YuE2-3B 模型一键运行包。
- 下载导入后启动模型,进「歌曲生成」填歌词与风格,或进「歌曲翻唱」上传原曲音频。
- 显存按精度分档:Q8_0 约 12G,Q4_0 约 8G,显存紧张就选 Q4_0;内存建议 32G 以上。
模型详情:aigcpanel.com/zh/asset/Yu... | 软件下载:aigcpanel.com/zh/download

其他要点
- 代码 Apache 2.0,模型权重 CC BY-NC 4.0,仅限非商业使用。
- 支持中英文歌曲,同一套权重同时负责创作、翻唱与编辑,翻唱不用再下一个模型。
- 生成过程会把乐谱、语义 token、latent 与配置一起留下,方便复现和对比不同版本。
结尾
如果你手边正好有一段自己写的词,或者一首想换个味道的老歌,可以先在 AIGCPanel 里跑一首短的听听。
▶ 不注册、不排队、不按首付费,你更想让它写首新歌,还是把老歌改成另一种曲风?评论区聊聊。