新浪财经 1小时前
阿里巴巴造出了一台“AI音乐工厂”,一次就能生成5分钟完整歌曲
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

(来源:科技行者)

这项由阿里巴巴集团 Wan 团队完成的研究,于 2026 年 7 月 17 日以技术报告形式发布,论文编号为 arXiv:2607.14749,感兴趣的读者可通过该编号在 arXiv 平台查阅完整原文。

平时用 AI 生成一段音乐,你可能会发现一个令人头疼的现象:歌手唱着唱着跑调了,背景音乐越到后面越稀碎,或者人声把伴奏完全压住,整体听起来像是一个没调好音量的卡拉 OK 现场。这不是你的耳朵挑剔,而是目前绝大多数 AI 音乐生成系统在技术架构上就存在的根本性缺陷。阿里巴巴的研究团队深入分析了这个问题,并拿出了一套他们称之为 WanSong v1.0 的解决方案——一个纯粹基于扩散模型、能一口气生成长达 5 分钟商业级歌曲、并且同步输出人声和伴奏两条独立音轨的系统。

一、为什么现有的 AI 音乐系统听起来总差那么一口气

要理解 WanSong 解决了什么问题,得先明白 AI 音乐生成领域目前的主流做法是怎么运作的。

以 Suno 和 Mureka 这类已经颇具声誉的商业级 AI 音乐平台为例,它们的核心技术是 " 自回归模型 "(Autoregressive Model,简称 AR 模型)。自回归模型的工作方式,就像一个逐字写信的人——它先生成第一个字,然后根据第一个字决定第二个字,再根据前两个字决定第三个字,以此类推,一个音频片段一个音频片段地接续下去。这种方式有一个很大的优点:逻辑严谨,每一步都有据可依。但它的缺点同样明显:速度慢,而且越到后面,累积误差越大,就像用多米诺骨牌搭建一栋大楼,前面一块倒歪了,后面整栋楼都会歪。对于一首只有 20 秒的片段来说还勉强能撑住,但要生成 5 分钟的完整歌曲,这个累积误差就足以让整首歌的质量急剧下降。

另一些系统走的是 "AR 加扩散 " 的组合路线——先用 AR 模型生成一个粗糙的音频骨架,再用扩散模型(Diffusion Model)来打磨细节、提升音质。这种方式虽然比纯 AR 有所改进,但本质上仍是多阶段流水线:前一个阶段的错误会传递给下一个阶段,整个系统变得复杂难以控制,生成效率也依然受限。

阿里巴巴的团队决定绕开这条弯路。他们的思路是:既然扩散模型在图像生成领域(比如 Stable Diffusion、FLUX 等)已经证明了自己能以端到端的方式生成极高质量的内容,为什么不直接把同样的逻辑搬到音乐生成上?不要 AR,不要多阶段流水线,纯粹用扩散模型一步到位。

扩散模型的工作逻辑和 AR 完全不同。扩散模型更像一个雕塑家——它先把一块毫无形状的大理石(纯随机噪音)放在面前,然后通过一系列精细的雕刻步骤,逐渐让形状从噪音中浮现出来,直到最终雕刻出一件完整的作品。整个过程是整体性的,而不是逐片段拼接的,因此天然更擅长维持全局一致性。对于长达 5 分钟的歌曲来说,这个特性至关重要。

二、把声音当作 " 连续的水流 " 而不是 " 离散的砖块 "

在技术实现上,WanSong 做了一个根本性的选择:把音频视为连续的数值序列(即 " 连续 token"),而不是离散的符号序列。

这个区别听起来抽象,用一个具体的比喻来理解:假设你要记录一段钢琴曲的音高变化。离散化的做法,是把所有音高归类到钢琴键盘上固定的几十个键位上—— C 调、D 调、E 调……每个音符对应一个整数编号,整首曲子就是一串整数数列。这种方式简单,但会损失掉键与键之间那些微妙的音调变化和演奏情感。连续化的做法,则是直接记录音高的实际频率值(比如 441.2 赫兹、440.0 赫兹……),保留所有的细微差异。WanSong 选择的就是后者。

为了让扩散模型能高效处理这些连续音频信号,团队专门训练了一个叫做 " 变分自编码器 "(VAE)的压缩模块。它的职责,就像一个翻译官:把原始的高采样率立体声音频(44100 赫兹的立体声波形),压缩成一个体积更小但保留关键特征的 " 浓缩表示 ",然后把这个浓缩表示喂给扩散模型处理;生成完成后,再由 VAE 反向解码,还原成可以播放的音频文件。

这个 VAE 的具体参数是:输入一段双声道、44100 赫兹的音频,输出一个 64 维度的连续隐向量序列,压缩比为 1024 倍——也就是说,原始音频中每 1024 个采样点,被压缩成隐空间中的一帧,最终的隐向量帧率约为每秒 43.1 帧。

为什么压缩比选 1024 而不是更大?这背后有一个精心设计的权衡。团队做了严格的对比实验,分别测试了压缩比 2048 和压缩比 1024 两种方案。结果清楚地显示:压缩比为 2048 时,模型在发音错误率(PER,即 AI 唱歌时唱错字的比例)上达到 19.2%,音质评分(满分 5 分)只有 2.1 分;而压缩比为 1024 时,发音错误率下降到 15.0%,音质评分跃升至 3.2 分。团队还测试了一种折中方案:用 1024 的 VAE,但在送入扩散模型之前再把相邻两帧拼接成一帧(相当于等效压缩比变回 2048),结果发音错误率反而升到 20.6% ——说明表面上看起来等效的压缩比,其信息损失方式并不一样,直接用更低压缩比的 VAE 是更优解。当然,团队也没有无限制地降低压缩比,因为压缩比越低,token 数量越多,计算量和内存消耗就会成倍增长,生成速度也会急剧下降。1024 这个数字,是在质量和效率之间找到的最佳平衡点。

VAE 的训练本身也相当复杂。团队使用了约 2.6 亿条音频片段来训练它,数据构成刻意按照音乐 50%、语音 40%、环境声音 10% 的比例进行平衡。这个比例设计颇具深意:如果只用音乐训练,VAE 会擅长处理乐器声,但面对人声的爆破音(如 "p""b" 音)和摩擦音(如 "s""sh" 音)时就会力不从心;加入大量语音数据,能让 VAE 在保持音乐质量的同时,把人声中的细节也还原得更清晰。训练时采用的损失函数组合了多分辨率频谱损失、特征匹配损失、对抗损失和 KL 散度约束四个部分,在 32 块英伟达 A100 显卡上跑了 150 万步。

与同类产品 Stable Audio 2 相比,WanSong 的 VAE 在所有指标上均有明显优势。在内部音乐测试集上,STFT 频谱距离(越低越好)从 1.430 降至 1.029,梅尔频谱距离从 0.856 降至 0.629,尺度不变信噪比(越高越好)从 4.386dB 提升至 7.246dB。在语音测试集上的提升幅度更大:信噪比从 8.653dB 跃升至 12.922dB,提升了近 4.3dB。

三、人声和伴奏为什么不能塞进同一个箱子

VAE 解决了音频压缩的问题,但真正的核心挑战还在后面。

团队在早期实验中发现了一个棘手的现象:当把人声和背景音乐(BGM)混合在一起,作为一个整体去训练扩散模型时,模型会表现出明显的 " 偏科 " ——它更倾向于把注意力集中在人声上,而把 BGM 的学习置于次要位置,导致生成结果中 BGM 质量普遍偏差。

更麻烦的是,调整 " 分类引导强度 "(Classifier-Free Guidance,简称 CFG)这个参数也无法解决这个问题。CFG 可以理解为一个总音量旋钮:把它拧大,人声会变得更准确、发音更清晰,但 BGM 同时会被压弱;把它拧小,BGM 的质量会改善,但人声的准确性又会下降。无论旋钮放在哪个位置,总有一方会受委屈。这就像用同一个锅同时煮清蒸鱼和红烧肉——火候对清蒸鱼来说刚好,对红烧肉来说就不够;两种食材对烹饪条件的要求不同,放在一起必然顾此失彼。

WanSong 的解决方案被命名为 " 双茎(Dual-Stem)建模 "。" 茎 " 这个词来自音频制作领域的 "stem",指的是一首歌的独立分轨文件。简单来说,就是让模型在最终输出时,把人声和 BGM 作为两条完全独立的音频流分开生成,每条流都有自己专属的 token 序列和独立的扩散训练目标。

但这里有一个微妙之处:独立输出,并不意味着完全隔离学习。如果人声和 BGM 在整个训练过程中完全独立、互不相知,它们之间的音调协调、节奏配合、情感呼应就无从建立。一首好歌之所以好听,正是因为人声和伴奏之间存在大量的内在关联——主唱在高音区域演唱时,伴奏往往会有相应的和声呼应;歌词进入副歌时,鼓点和弦乐往往同步爆发。

为此,WanSong 采用了 " 在层内联合学习 " 的策略:在 Transformer 模型的每一个计算层(block)内部,人声 token 和 BGM token 被当作同一个 token 的不同通道来处理,让它们在内部信息流通时互相感知对方的状态;但在模型的最终输出层,它们被分开,各自预测自己独立的音频目标。用工厂流水线来类比:零件 A 和零件 B 在组装车间(模型内部各层)会彼此感知、相互配合,但最终出厂时分装在两个独立的包装盒里(两条独立的输出 stem)。

这一设计的好处不仅在于生成质量的提升,还有一个非常实用的附加价值:既然生成时就是分轨输出的,那么用户拿到的结果天然就是一个 " 人声轨 + 伴奏轨 " 的组合,可以直接用于后期制作——比如单独调整人声音量、替换伴奏风格、或者提取干声用于混音。这个功能在传统 AI 音乐工具中往往需要额外的 " 音源分离 " 步骤,费时费力且会有质量损失,WanSong 从根本上消除了这个需求。

模型的损失函数也体现了这种双目标结构。训练时,总损失是人声损失和 BGM 损失的加权求和,权重系数 α vocal 和 α bgm 可以分别调节,用来控制模型对两个方向的学习力度。

四、搭建这台 " 音乐工厂 " 的骨架结构

WanSong 的扩散模型主干采用的是 " 混合 MMDiT" 架构。MMDiT(Multi-Modal Diffusion Transformer,多模态扩散 Transformer)是 Stability AI 在图像生成领域提出的一种设计,核心思想是让来自不同模态(比如文字和图像)的 token 在 Transformer 内部通过独立的参数流进行交互。WanSong 在音乐领域沿用了这个思路,让文字描述的 token 和音频 token 能够在模型内部充分交流。

但团队发现,没有必要在每一层都为不同模态维护完全独立的参数——这样做参数量会急剧膨胀,而收益并不成比例。受 FLUX 图像生成模型的启发,他们设计了一种 " 混合 " 方案:模型由两类 block 组成,前 N 层是 " 双流 block"(Double Stream Block),文字 token 和音频 token 分别走各自的注意力计算路径,充分交换跨模态信息;后 K 层是 " 单流 block"(Single Stream Block),两种 token 合并成一条统一的流,通过标准的自注意力机制进行处理。最终确定 N/ ( N+K ) 的比例为 0.3,即约 30% 的层是双流结构,70% 是单流结构,整个模型的总参数量接近 250 亿(25B)。

在整个推理过程中,文字输入(比如 " 一首充满活力的流行英文歌,描述夏日海边 ")先由一个大型语言模型(LLM)编码成文字 token;人声和 BGM 各自由 VAE 编码成连续音频 token;这三类 token 被拼接成一条统一的长序列,送入混合 MMDiT 主干进行扩散去噪;最终输出两条分离的隐向量序列,由 VAE 解码为可播放的人声音频和伴奏音频。

为了在处理不同长度、不同批次的样本时提高效率,团队还引入了 " 序列打包 "(token packing)技术——把来自不同样本的 token 序列直接拼接在一起,填满一个批次的计算窗口,减少无效的 padding 浪费。在每个 block 中,他们沿用了 Wan2.1 视频生成模型中的 " 完全共享 AdaLN" 技术,让时间步的条件调制参数在所有 block 间共享,在不影响性能的前提下显著减少了参数量。

五、从短曲到长歌:分阶段喂养这台机器

训练如此大规模的模型,不可能一步到位。WanSong 的预训练被分成三个阶段,像训练一名马拉松运动员一样,从短距离开始,逐步拉长训练距离。

第一阶段专注于 90 秒以内的歌曲片段,让模型先学会在短时间内生成连贯、高质量的音频。第二阶段把训练长度延长至 300 秒(即 5 分钟),让模型学习如何维持更长时间跨度的音乐结构一致性。第三阶段则是有监督精调(SFT),用精心筛选的高质量歌曲样本对模型进行针对性的质量提升。

整个训练框架采用的是 " 流匹配 "(Flow Matching)技术,具体是 " 修正流 "(Rectified Flow)的变体。其原理是在纯噪音和目标音频之间建立一条 " 直线路径 " ——给定时间步 t(从 0 到 1),训练目标 Xt 就是目标音频 X1 和纯噪音 X0 的线性插值:Xt = t × X1 + ( 1-t ) × X0。模型的学习任务,就是在任意时间步 t 上,准确预测 " 速度向量 "Vt(即 Vt = X1 - X0),这个速度向量告诉扩散模型应该以多快的速度、朝哪个方向从噪音状态向目标音频移动。

六、用人类偏好来 " 调口味 "

即便经过了三阶段预训练和有监督精调,AI 生成的歌曲在人类听起来还是会有一些难以量化、难以用损失函数直接描述的 " 差一口气 " 感——比如整体旋律流畅度不够,歌词和曲调的情感搭配不自然,或者生成结果没有很好地贴合用户给出的文字描述。

为了填补这个最后一公里的差距,团队引入了强化学习人类反馈(RLHF)技术。具体思路是:针对三个最能影响听感的维度分别建立独立的评估模型——音乐性(旋律、和声、结构等音乐本身的质量),歌词准确性(AI 唱出的词是否和输入的歌词一致),以及提示词对齐度(生成的歌曲风格是否符合文字描述)。

每个维度的评估模型都通过 " 对比学习 " 训练:收集大量人类标注的正向样本(听起来好的歌曲)和负向样本(听起来差的歌曲),让奖励模型学会区分好坏。损失函数的形式是:L = -E [ log σ ( R ( 好样本 ) - R ( 差样本 ) ) ] ,本质是最大化好样本和差样本在奖励分数上的差距。

三个奖励模型训练完成后,团队采用了两种强化学习方式的组合。第一种是 DPO(Direct Preference Optimization,直接偏好优化),它直接基于正负样本对来优化模型,覆盖扩散过程的每一个时间步,因此更适合改善音频的全局结构和整体层面的质量;但 DPO 的缺点是它的目标是优化正负样本之间的相对关系,而不是直接把样本推向更高的奖励分数,因此优化信号中包含较多噪音。第二种是 ReFL(Reward Feedback Learning),它直接利用奖励模型的评分信号来优化生成模型,更精准,更适合改善细节层面的质量;但 ReFL 只在扩散过程的低噪音阶段有效,对全局结构影响有限,且容易出现 " 钻空子 "(reward hacking)的问题——模型会找到一些能骗过奖励模型评分、但实际上并不好听的 " 捷径 "。两种方法互补:先用 DPO 打好全局结构的底子,再用 ReFL 精雕细琢局部细节,形成接力。

七、6 百万小时数据背后的数据工程

一切算法的前提,是数据。WanSong 的训练数据集最终规模超过 600 万小时的多语言歌曲数据,这个数字背后是一条复杂的五阶段数据流水线。

数据收集阶段,团队广泛采集涵盖多种语言、多种音乐风格(从流行、摇滚、爵士到 EDM)、不同时长的音频内容,同时包含有人声的歌曲和纯器乐曲目。

数据预处理阶段,每条原始音频都要经过一系列自动分析处理:音频类型分类(这是歌曲还是语音还是噪音?),音质评估(这段录音的清晰度够不够?),结构解析(这首歌的前奏、主歌、副歌、尾声在哪里?),语音活动检测(VAD,判断哪些时间段有人在唱歌),语言识别(这首歌是中文、英文、日文还是韩文?),以及音轨分离(把混合音频分成人声轨和伴奏轨)。

数据过滤阶段,综合音频类别和音质评分,过滤掉质量不达标的样本,构建出一个高质量的子数据集。团队还设计了多维度的标注分类体系,使得训练数据可以在不同训练阶段灵活调度——早期阶段可以多用相对普通的数据建立基础能力,后期精调阶段再用最高质量的数据进行冲刺。

数据标注阶段,这是整个流水线中被重点强调的一环。团队对每首歌曲进行了极为细致的人工和自动标注,包括音乐风格、人声特征、使用的乐器种类、调式和音调、演唱语言、混响效果、情感色彩,乃至完整的歌词文本。标注质量直接决定了模型能否根据文字描述准确生成对应风格的歌曲。

数据采样阶段,由于不同类别的数据量天然不均衡(比如流行音乐的数量可能是爵士乐的几十倍),团队设计了细粒度的平衡采样策略,确保模型在每个训练阶段都能均匀接触各种音乐风格、语言和音质层次的样本,避免在某些风格上过拟合。

八、实际测试中表现如何

为了系统评估 WanSong 的生成质量,团队专门建立了一个测试基准,包含 200 首样本,覆盖中文、英文、日文、韩文四种语言,跨越流行、放克、电子舞曲、摇滚、乡村、爵士等十余种一级音乐风格,每首样本时长约 4 分钟。

在发音错误率(PER)这个指标上,WanSong 的表现尤为突出。PER 衡量的是 AI 在唱歌时把歌词唱错的比例,越低越好。LeVo(另一款国内 AI 音乐模型)的 PER 高达 27.11%,意味着约四分之一的音节都被唱错了;Suno V5 的 PER 为 22.80%;Mureka V7.6 达到 12.7%,已经相当不错;而 WanSong 以 7.43% 的 PER 位列最优,远低于其他所有参与比较的系统。

在 SongEval 这套歌曲质量评估框架(包含清晰度、连贯性、记忆度、音乐性、自然度五个维度)的测试中,各系统的分数差距相对较小,WanSong 在多个维度上取得最高或并列最高分,但由于 SongEval 只基于约 2000 首歌曲训练,其泛化能力存在一定局限。

为了更准确地评估音乐性,团队自行开发了一套综合音乐质量评估模型,基于 80000 首人工标注歌曲训练,从旋律(权重 0.4)、结构(权重 0.25)、整体听感(包含和声、织体、编曲、情感、人声、混响等,权重 0.35)三个维度进行加权评分,满分 10 分。在这个自研评测维度上,结果差异显著:LeVo 得 1.69 分,Mureka V7.6 得 3.83 分,Suno V5 得 4.18 分,WanSong 以 5.49 分领先,优势明显。

另外,在 Muq 文本对齐度(衡量生成歌曲与输入文字描述的相关性)上,WanSong 以 0.44 分与 Suno V5 并列最高,高于 Mureka V7.6 的 0.43 分和 LeVo 的 0.34 分。

说到底,WanSong v1.0 证明了一件事:在 AI 音乐生成这个领域,扩散模型完全有能力独当一面,不需要借助自回归模型的 " 拐杖 "。一次运行、一步生成、直接出两条分轨——这种简洁性本身就是一种竞争力。当然,这份技术报告更像是一张成绩单和一扇半开的门,而不是一个终点。更多语言、更复杂的编曲风格、更精细的用户自定义控制,仍然是摆在前面的挑战。不过对于普通用户来说,最直接的意义或许是:以后想把一首 AI 生成的歌拿去后期处理,不必再费心手动分离人声和伴奏了——它生成出来就是分好的,可以直接用。这一点,对内容创作者来说实实在在省去了不少麻烦。

有兴趣深入了解技术细节的读者,可以通过 arXiv 编号 2607.14749 找到 WanSong v1.0 的完整技术报告。

Q1:WanSong 生成的歌曲最长能有多久?支持哪些语言?

A:WanSong v1.0 可以生成最长 5 分钟(300 秒)的完整歌曲,一次运行即可完成,不需要分段拼接。目前支持中文、英文、日文、韩文四种语言,测试基准中已覆盖这四种语言的歌曲生成任务。

Q2:双茎建模和普通的音源分离技术有什么区别?

A:普通的音源分离是在歌曲生成完成之后,再用另一个模型把混合音频 " 拆开 ",这个过程会有额外的信息损失。WanSong 的双茎建模是在生成过程中就直接输出两条独立音轨,人声和伴奏从来没有真正混合在一起,因此不存在 " 分离损失 ",质量更高,也更适合直接用于后期制作。

Q3:WanSong 在发音准确率上为什么比其他模型好这么多?

A:核心原因在于双茎建模策略解决了 CFG 参数调节时人声和 BGM 相互干扰的问题,让模型可以在不压制 BGM 的前提下专注优化人声发音准确性。此外,VAE 采用 1024 压缩比而非更大的 2048,保留了更多音频细节,也对发音准确率有直接贡献。在 7.43% 的发音错误率下,大约每 100 个音节中不到 8 个出错,明显优于其他参与比较的系统。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

音乐 ai 阿里巴巴 ar 歌手
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论