近期,香港科技大学联合 M-A-P、NOIZ AI、斯坦福等机构发布并开源了一个统一符号与音频音乐生成的模型YuE2,将开源音乐生成的质量推向与前沿闭源模型正面竞争的位置。
在 WildSongBench 的 192 个 prompts 评测中,YuE2 已逼近 Suno v5、Mureka 9,同时超过 Suno 最新一代闭源模型 v6 及 v6 Wild;八选一后更以 6.9632 拿下 17 组参评系统最高分,遥遥领先多款前沿闭源模型。
△YuE2 登顶 GitHub Trending 榜
△AI 垂直领域博主 AI Search 发帖介绍 YuE2
但 YuE2 的野心远不止把开源音乐生成推到 frontier 水平。它还试图解决 AI 音乐创作长期存在的另一个难题:如何让一次性的生成结果,变成一个可以被理解、定位、修改,并持续迭代的创作过程。
如果说过去用户更多是在一次次 " 抽卡 " 中寻找满意的结果;那么 YuE2 希望把一首生成出来的歌,真正变成可以继续打磨的作品。
开源 SOTA,逼近闭源 Suno v5,超越最新 Suno v6
采用 WildSongBench 进行评测,在 192 个 prompts 上,YuE2 的 SongBench 平均分达到 6.7316,逼近 Suno v5 的 6.8721 和 Mureka 9 的 6.9377;同时超过 Suno 最新一代模型 v6(6.5562)及 v6 Wild(6.4195)。在八选一设置下,YuE2 得分进一步提升至 6.9632,超过包括 Suno v5、v6、MiniMax Music 2.6、Mureka 9 在内的多款前沿闭源音乐模型。

△歌曲质量综合了 SongBench 和 SongEval 的评估结果;文本对齐综合了 MuLan、AllMusicCaps 以及 Qwen3-Omni Judger 的结果。两个坐标轴均显示归一化的比较指数。气泡面积代表 AudioBox 的生成质量。Agentic Music Editing:用一句话,精细修改已经生成的音乐
不只是生成一首歌,YuE2 把音乐变成一份可以继续被修改的 " 工程文件 "。在生成音频之前,模型会先规划一份包含人声旋律、器乐旋律、和弦和段落结构的双轨曲稿,并以 ABC 文本记谱形式保存。这种 " 先写下作曲安排,再生成最终声音 " 的方式,就是 YuE2 引入的核心机制创新——symbolic planning(乐谱规划)。音频中的旋律和和声不再是黑盒结果,而是能够被创作者定位、修改,再重新演绎。
这也使得 YuE2 能够支持 Agentic Music Editing。比如,用户可以直接说:" 保留副歌的人声旋律,但插入一段《小星星》萨克斯 solo,和声变得更现代一些。" 接入 YuE2 的 Agent 可以读取原曲的旋律与和弦,结合乐理提出修改方案,定位并改写对应的和弦或音符,再调用 YuE2 生成新的完整版本。用户不需要自己理解乐谱,也可以通过自然语言持续调整已有的歌曲。
对于专业音乐人,同一套机制则提供更直接的控制。例如,一首副歌原本采用 4 – 5 – 3 – 6 – 2 – 5 – 1 的和声进行,音乐人可以保留原有 Vocal 与 Ins 两条旋律,只将其中一个和弦修改为减七和弦,再让 YuE2 重新演绎。改动进入声音的同时,没有修改的旋律与和声可以被尽量保留。
实验也验证了这种编辑能力。研究者对完整作品中的旋律与和弦进行定向修改后,目标音高匹配率由 0.83% 提升至 93.75%,目标和弦一致率由 0 提升至 83.13%;未修改部分的旋律和和弦相似度分别保持在 0.96 和 0.93 以上。重新生成整曲时,改动能够进入声音,其他部分的主要旋律与和弦内容也能得到较好保留。
YuE2 的 symbolic planning 创新,使歌曲先以可读、可编辑的曲稿表示,再由模型将修改后的作曲安排重新演绎为完整音频,从而把过去偏 " 黑盒 " 的音乐生成,变成可以定位、修改、验证并持续迭代的创作过程。
Cover Song:让一首歌重新长成另一种样子
一首已经完成的歌,也可以成为下一轮创作的起点。与直接基于音频模仿的翻唱方式不同,YuE2 首先理解歌曲中的旋律、和声和结构,再重新组织声音表达。借助 SheetSage2,已有录音被还原成包含旋律、和弦、节拍等信息的可编辑曲稿,再基于这份曲稿重新生成新的演绎版本。
这意味着,创作者可以保留原曲最有辨识度的人声主题或旋律框架,同时按照创作意愿重新安排器乐、和声、唱法和整体风格。比如,同一段旋律可以从原本的编配切换成另一种曲风,也可以保留主旋律,只重做伴奏和演唱方式。Cover 不再只是 " 照着原曲再唱一遍 ",而是可以在保留作品核心辨识度的同时,做新的编排和再创作。
团队在948首作品上进行了零样本 Cover Song 评测,每种方法共生成3792个结果,且不进行候选筛选,YuE2 也没有针对翻唱任务进行专项微调。在完整曲谱条件下,生成结果在 CLEWS 检索系统中的首位命中率达到71.3%;去掉曲谱后仅为0.3%。在两套检索系统的八项指标中,完整曲谱条件下的 YuE2 均高于 SongEcho 和 ACE-Step 1.5。
更关键的是,Cover Song 和前面的编辑能力并不是两套割裂的流程。已有歌曲被转成曲稿后,创作者还可以继续修改旋律、和弦或编配,再交给 YuE2 重新演绎。从翻唱到改编,再到生成新的版本,可以发生在同一套创作流程里。音乐不再是一次生成、一次抽卡的结果,而是一首可以被创作者持续修改和打磨的作品。
从曲稿到声音:YuE2 背后的一套完整音乐技术栈
为了让一首歌既能被理解和修改,又能最终生成完整音频,YuE2 同时开源了 MERT2、SheetSage2 以及配套的 tokenizer/codec。
MERT2是整个系统底层的音乐理解模型。它把连续音频编码到一个有结构的向量空间中,让旋律、和弦、节奏等具有相似音乐属性的内容在表示空间里彼此更接近,为后续的音乐理解、检索和生成提供基础。在 MARBLE 的 10 项任务、15 个指标中,MERT2 系列有 14 项领先报告中的对照模型;基于 MERT2 构建的低码率音乐 token,在与 MuCodec 和 EnCodec 的六项对比指标中也有五项取得最高分。
在 MERT2 的基础上进一步微调得到的SheetSage2,则负责把已有录音还原成旋律、和弦、节拍和结构等可编辑的曲稿信息,为 Cover Song 和后续编辑提供入口。在技术报告列出的 13 组转谱评测中,SheetSage2 有 10 组取得最高分,覆盖旋律、和弦、调性、节拍与结构等任务。
这些能力最终汇入 YuE2 约 36 亿参数的 Mixture-of-Transformers 架构:模型先生成 ABC 曲稿和音乐语义表示,再进一步生成声学信息并解码为 48kHz 立体声音频。
在训练数据方面,YuE2 使用了由 TokenWave.AI 提供的 CC0 授权数据与合成数据。
从写一首新歌,到修改已有作品,再到重新演绎,YuE2 用一个模型串起了从生成到编辑的完整音乐创作流程。

YuE2 模型现已开放下载,并支持在消费级游戏显卡(4090)上一分钟出歌。欢迎音乐人和开发者亲自体验、微调和探索。
这仅仅是一个开始。团队期待来自社区的真实使用和反馈,并将持续迭代模型能力与创作体验,让 YuE2 在更多音乐场景中变得更好用、更可控。
体验 YuE2:
Demo:https://map-yue2.github.io/
GitHub:https://github.com/multimodal-art-projection/YuE
Hugging Face:https://huggingface.co/m-a-p/YuE2-3B




登录后才可以发布评论哦
打开小程序可以发布评论哦