AI 音乐开始进入 " 审美竞争 " 阶段。
作者|周悦
编辑|栗子
7 月 19 日,昆仑万维在 2026 世界人工智能大会(WAIC 2026)上举办了 " 世界模型与多模态范式跃迁 " 论坛。
这场论坛的嘉宾横跨学术、产业和文娱领域。从中国科学院院士周志华、Reactor AI CEO Alberto Taiuti,到清华大学交叉信息研究院助理教授、破壳机器人创始人许华哲、黎曼机器人创始人刘扬,再到黄晓明、王珞丹、《消失的她》导演崔睿、爱奇艺高级副总裁杨海涛和甲子光年创始人兼 CEO 张一甲,不同背景的嘉宾围绕技术突破、内容生产和产业落地展开讨论。
当天,昆仑万维发布和升级了三款模型:可交互世界模型 Matrix-3.5、AI 音乐大模型 Mureka V9.5,以及具身智能机器人模型 Riemann-1.0,分别覆盖可交互世界、音乐生成和具身智能。
其中,Mureka V9.5 的升级最容易被现场观众感知。现场展示的 Funk 音乐一响,台下观众整齐抬起头。十几部手机很快举了起来,前排还有观众跟着节奏用脚打拍子。
Mureka V9.5 配乐 MV,视频来源:昆仑万维
圆桌上,黄晓明谈起一次录歌经历,AI 演唱的 Demo" 太完美了 ",没有换气,也没有呼吸感,听起来反而 " 没有人味 "。他提到,真人不必再和 AI 比谁更完美,独特的个性和表达才更重要。
国家一级演员、中国电影家协会副主席黄晓明,图片来源:昆仑万维
黄晓明还分享了今早使用 Mureka 的经历。他让模型生成了两首歌,一首参考杨宗纬《空白格》的抒情气质,另一首则借鉴他最近喜欢的颜人中,主题是 " 中年危机 "。" 还不错,词还挺触动人心的。" 他说。
王珞丹则认为,AI 可以给自己的想法 " 增加很多翅膀 ",但 " 决定往哪飞的权利要在我手里 "。
" 世界模型与多模态范式跃迁 " 论坛圆桌讨论,图片来源:昆仑万维(从左至右分别为:甲子光年创始人张一甲,昆仑万维董事长兼 CEO 方汉,中国电影家协会副主席黄晓明,演员王珞丹,爱奇艺高级副总裁杨海涛,青年导演崔睿)
在随后接受「甲子光年」在内媒体采访时,昆仑万维董事长兼 CEO 方汉反复强调的关键词是 " 克制 "。
这也是 Mureka V9.5 此次升级的重点。过去,一些 AI 音乐模型习惯通过增加声部、加厚音色和持续推高情绪来制造完成感,容易出现人声被伴奏遮盖、编曲拥挤、歌曲缺少起伏等问题。
Mureka V9.5 没有继续增加音乐的复杂度,而是改善人声、编配和曲风控制,让生成结果更自然,也更贴合用户的创作意图。方汉将这一方向概括为 " 克制、真实、贴合创作意图 "。
与 V9.5 同时亮相的,还有基于这一底座的 O3 音乐推理扩展方案。前者提高生成质量和稳定性,后者通过推理时选优,让更多作品接近模型的能力上限。
「甲子光年」认为,AI音乐已经跨过 " 能不能写歌 " 的第一道门槛。下一阶段的竞争,是模型能否作出更好的音乐选择。
1.Mureka V9.5,让 AI 音乐少一点 "AI 味 "
一些 AI 音乐模型擅长通过密集声部和厚重音色制造完成感,容易出现人声被遮盖、编曲拥挤和情绪缺少起伏等问题。
Mureka V9.5 没有继续追求 " 更满 ",而是把重点放在人声、编配和情绪之间的关系上。
中文流行歌曲《夜色缓缓》是其中一例。
它的提示词包括柔和钢琴、氛围合成器、渐进式弦乐和贴近演唱的男声,想要呈现的是 " 雨夜里未说出口的告别 ",忧伤但温柔,情绪从低声诉说逐渐走向释放,又不能显得过分煽情。
这类歌曲考验的是模型对分寸的控制。伴奏太重,人声会被压住;情绪推进太快,后半段便失去变化;弦乐进入得过早,也容易让整首歌显得用力过猛。
从这首 Demo 呈现的效果看,V9.5 试图让伴奏、人声和情绪层次保持更自然的关系。编配既要托住人声,也要为人声留出空间。
另一首《Melted Chrome》,重点变成了模型对复杂曲风的理解和还原。
提示词要求的是迷幻的西海岸 G-Funk 街头说唱,并进一步限定了滑动合成器低音、Moog 哨音、Talkbox、Rhodes 电钢琴、哇音吉他和复古磁带质感。鼓点要略微落后于节拍,人声则要保持沙哑、松弛的质感。
提示词还明确排除了 Trap 踩镲、Drill 节奏和 EDM 式落点。模型不仅要识别 G-Funk 的核心元素,还要理解这些元素如何组合,才能形成低底盘夜间巡游般的迷幻氛围。
对 AI 音乐来说,理解 " 不要什么 ",有时和理解 " 要什么 " 同样重要。识别一个曲风标签并不困难,难的是让音色、节奏、人声和整体氛围始终指向同一种表达。
前两首作品主要展示 V9.5 对人声、编配和曲风的控制,与之同时亮相的 O3,则把重点放在全曲结构和情绪推进上。
《误差》是一首极简电子与 Cosmic Pop 风格的无人声作品。提示词以晶莹的合成器脉冲、低频氛围和空间混响,描绘一座漂浮在轨道上的空间站,要求整首歌保持冰冷、空旷和缓慢的基调。
《Still in the Room》则转向 Dream Pop。混响吉他、漂浮感男声、柔和的氛围合成器,加上温暖贝斯和松弛鼓组,构成一个独处于房间中的夜晚。提示词同时要求作品保留亲密感和距离感,让情绪缓慢展开。
这两首作品都不依赖密集编配或明显的副歌爆发,更看重氛围能否贯穿全曲,以及局部变化是否破坏整体表达。O3 所做的,是在 V9.5 提供的音乐基础上,进一步检查和调整这些选择。
从中文流行到 G-Funk,再到极简电子和 Dream Pop,四首 Demo 分别对应人声与情绪、曲风控制和全曲一致性。Mureka V9.5 展示的变化,不是加入更多声音,而是让每一种声音更好地服务整体表达。
2.V9.5 打底,O3 提高优质结果的稳定性
Mureka 此次升级包含两个层次。
Mureka V9.5 是音乐生成的底座模型,决定人声、编配、曲风和情绪表达的基础质量;O3 建立在 V9.5 之上,通过推理阶段的持续比较和选优,提高单次生成接近模型能力上限的概率。
简单来说,V9.5 负责抬高模型的基础水平,O3 则尽量减少优质结果对单次采样运气的依赖。两者共同指向一个问题:如何降低 AI 音乐生成的随机性。
这也是 Mureka V9.5 和 O3 此次最重要的亮点。它想做的不是偶尔生成一首好歌,而是把 " 好听 " 拆解为可评测、可训练、可部署,并能在推理阶段继续优化的系统能力。
在训练阶段,V9.5 通过强化学习,同时改善整体听感、创作控制和生成稳定性。在 MusiCoT 音乐思维链的基础上,模型会先确定全曲的结构、曲风和情绪方向,再安排段落推进、乐器进出和强弱变化。
Mureka V9.5/O3 发布,图片来源:昆仑万维
这种变化首先体现在结构与编配上。
主旋律需要突出时,其他声部会相应退后;情绪尚未发展到高潮时,编配也不会提前加码。所有音乐元素不再各自追求存在感,而是共同服务整首歌的表达。
第二项能力,是对复杂创作意图的控制。一首歌的主歌、副歌和桥段承担着不同作用。主歌通常负责叙事,副歌集中释放情绪,桥段则完成转折。模型如果只理解单句歌词,便容易出现歌词内容与音乐推进脱节。
V9.5 需要判断每段歌词在全曲中的位置,再安排旋律、节奏和编配的变化。它不仅要把歌词唱出来,还要让音乐结构跟随语义自然推进。
第三项能力,是人声表达与情绪的匹配。AI 人声是否可信,并不只取决于音准和音质。同一句歌词,在低声讲述和情绪释放时,需要采用不同的唱腔和力度;伴奏也要随之变化,不能始终保持相同的密度。
模型不仅要保证音准和音质,还要处理唱腔、情绪与伴奏之间的关系。例如,演唱方式是否符合歌曲氛围,伴奏是否给人声留下足够空间,人声的力度能否随着段落自然变化。
第四项能力,是对复杂创作意图的控制。用户输入的 Prompt 通常不只包含曲风和乐器,还可能同时涉及演唱方式、情绪变化、段落结构,甚至明确要求避开某些节奏和音色。模型需要判断这些条件之间的主次,再把它们落实到旋律、节奏、人声和编配中。
这是 V9.5 区别于关键词拼接式生成的地方。识别出 "G-Funk""Dream Pop" 或 " 中文流行 " 等标签只是第一步,模型还要让整首歌在音色、节奏、唱腔和整体氛围上保持一致。
根据昆仑万维的数据,在歌曲的主观评分中,V9.5 的指令精准度从 6.92 提高至 7.62,旋律、人声、音质和编曲等维度也有所改善。这说明模型不仅需要生成一首结构完整的歌,还要更准确地理解用户究竟想创作什么。
Mureka V9.5 等模型生成歌曲的主观评分,图片来源:昆仑万维
底座模型的能力提高后,O3 进一步处理生成过程中的偏差。
O3 通过 test-time scaling 扩展 MusiCoT 的推理过程。模型不会按照最初的选择一路生成到底,而是在生成过程中比较候选方案,并检查局部旋律是否仍然服务全曲、编配是否遮盖人声、情绪是否提前释放,以及段落结构是否偏离最初的提示词。
发现偏差后,模型可以调整后续决策,让旋律发展、编曲结构和情绪推进逐步回到全曲目标上。
由此,V9.5 和 O3 形成了一条相互衔接的技术路径:V9.5 通过训练提高底座质量与稳定性,O3 再通过推理时优化,提高优质结果出现的概率。
Mureka 形成了一条可以随版本持续迭代的技术路径,而不是依赖少数 Demo 或某一次采样的运气。
从这个意义上看,Mureka 在模型层面的差异,不只是 " 能不能生成音乐 ",而是能否把 " 好听 " 从偶然结果,转化为可评测、可训练、可复现,并能在推理阶段继续优化的系统能力。
稳定生成更好的音乐只是第一步。Mureka 的完整差异还包括版本化创作工具和平台分发能力。模型负责提高作品质量,工具承接比较与修改,平台则连接创作、发布和消费。
3.AI 音乐开始进入 " 审美竞争 " 阶段
过去,AI 音乐最先吸引人的,是速度——几十秒生成一首完整歌曲。但当 " 会写歌 " 逐渐成为基础能力,行业竞争也开始转向更难的问题:模型能否理解取舍。
旋律什么时候推进,什么时候留白;什么元素应该保留,什么需要删掉;同一个创意,能否沿着不同方向继续发展。下一阶段的差距,不只在生成速度,也在音乐判断和创作控制。
「甲子光年」认为,AI 音乐的 " 审美竞争 ",并不是让模型替用户决定什么是好音乐,而是让用户的取舍和判断更持续地作用于作品。
多数 AI 音乐工具仍以 " 一次生成 " 为基本单位。结果不满意,用户往往只能重新生成,此前满意的旋律、人声或段落也可能被全部改写。
方汉强调,作为模型厂商,他们希望 " 让提示词写得不好的人,也能做出更好的作品 ",把模型的遵从性和易用性继续往前推,降低普通人的创作门槛。
Mureka 希望把创作从一次性生成,转向版本化工作流。围绕同一个创意,用户可以快速生成不同版本,比较旋律、唱腔、编配和结构;满意的部分可以保留,不合适的部分则可以单独替换。
在产品层面,Mureka Studio 承接了这套工作流。传统数字音频工作站需要创作者熟悉轨道、插件、混音和大量参数。Studio 试图把部分操作转化为更直接的创作指令。
它改变的不只是操作方式,也是人与工具之间的分工。创作者的重心,也由执行具体操作转向比较方案和作出审美判断,也就是从 " 操作 DAW" 走向 " 指挥创作 "。
对专业音乐人来说,V9.5 生成的旋律、编曲和人声可以成为继续发展的素材;对普通用户来说,不熟悉编曲和混音,也可以围绕一个想法逐步完成作品。音乐由此不再只是供人收听的内容,也可以用来记录一段关系、一种情绪或一段记忆。
在产业端,游戏、短剧、影视和有声内容需要大量稳定、可控的音乐素材。昆仑万维也将游戏工业化、短剧量产、音乐创作平民化和影视降本增效列为重点落地场景。
Mureka 此前已经开放 API,服务于短视频、游戏、播客和影视配乐等场景。 V9.5 和 O3 进一步提高作品质量与生成稳定性后,模型能力也更容易通过 Studio 和 API 进入真实的内容生产流程。
Mureka 的差异因此不只来自某一次生成效果,而来自模型训练、推理时选优、版本化创作工具和平台分发能力的组合。
当 " 会写歌 " 不再稀奇,谁能让用户持续比较、修改和使用作品,才可能建立下一阶段的优势。
Mureka V9.5 只是昆仑万维此次 WAIC 发布中的一个模型,却提供了一个更容易被感知的观察窗口。
从 Matrix-3.5 到 Mureka V9.5,再到 Riemann-1.0,昆仑万维试图连接可交互世界、内容生成和现实行动。对 Mureka 而言,下一步也不只是生成更多歌曲,而是让模型、工具与分发共同进入真实的创作流程。
(封面图及文中视频、音频、配图素材均来自昆仑万维)


登录后才可以发布评论哦
打开小程序可以发布评论哦