LeVo 2:通过层级表征建模与渐进式后训练实现稳定且旋律优美的歌曲生成

LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training

arXiv: 2606.30642v1

论文信息

标题: LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training

作者: Shun Lei, Huaicheng Zhang, Dapeng Wu, et al.

发布日期: 2026-06-29

arXiv ID: 2606.30642v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决完整歌曲生成中全局音乐协调与局部音轨保真度之间的矛盾。现有语言模型要么采用混合令牌保住协调性但损失细节,要么双轨预测提升音质但拉长序列、削弱全局规划,LeVo 2 试图用一个统一框架同时优化这两方面。
  • 核心方法:LeVo 2 提出层级式语言模型 LeLM,用混合语义 LM 做全局语义规划,再用轨道特定 LM 并行预测人声与伴奏令牌,最后由扩散音乐编解码器重建波形。训练上采用美学引导的解耦式渐进后训练,分阶段分别处理音乐性、可控性与声学精炼。
  • 关键结果:专家主观评测中,LeVo 2 在整体音乐性、旋律、编曲、人声音质、伴奏音质、结构六个维度全部超越所有开源基线,部分指标接近领先商业系统(例如伴奏音质 7.10,与 Suno v5 的 7.10 持平),歌词对齐的音素错误率降至 8.55%,情感控制得分 8.72 为所有系统最高(见论文表 I)。
  • 主要局限:论文坦言音频质量仍受训练数据规模限制,与最强商业系统尚存差距;可控性受制于标注资源的不足,文本描述多样性有限,歌词提取、结构识别等环节的累积误差也影响了指令对齐精度(见论文第六节)。
  • 适合读者:从事音频生成、语言模型架构设计、多目标偏好对齐的研究者,以及对音乐 AI 产品化感兴趣的工程师都能从本文的层级建模和解耦训练策略中获得启发。

论文背景和研究动机

音乐生成近年来成为 AIGC 领域的研究热点,但完整歌曲的自动生成远难于纯音乐或纯歌声合成。一首完整的歌需要同时合成表情丰富的人声与高保真的伴奏,并保证歌词对齐、曲式结构的长期连贯性以及人声与乐器的协调。早期工作如 Jukebox 采用语言模型预测混合音频的离散令牌(mixed token),虽然能保留人声-伴奏的协调关系,却因离散词汇量受限和音轨间的相互声学掩蔽而丢失细粒度细节,难以实现高保真。后续系统如 YuE 引入双轨令牌独立建模人声和伴奏,提升了单轨音质,但这种交错预测机制显著增加了序列长度,使模型难以维持音乐性和指令跟随能力,人声与乐器的和谐也常被破坏。

与此同时,扩散模型(如 DiffRhythm、ACE-Step 系列)绕过了离散化,却在长时歌曲中难以准确捕捉音素-声学的时间对齐和长期结构一致性。并且,目前出现的商业工具虽表现出众,但训练策略和架构细节均未公开。另一个关键瓶颈在于高质量标注数据极为稀缺,而嘈杂的标注会诱发歌词幻觉和控制不稳定的问题。

LeVo 2 的核心动机正是用一个统一框架化解上述互补性困境:它把全局歌曲一致性与音轨级声学细节之间的权衡形式化为一个层级建模问题,同时通过分阶段的偏好对齐策略解耦音乐性学习、可控性对齐和声学精炼,避免多目标优化中的梯度冲突和静态离线偏好对的限制。

核心方法和技术细节

LeVo 2 采取混合 LLM-Diffusion 架构,核心组件为层级语言模型 LeLM 和扩散式音乐编解码器。音乐编解码器的编码器部分源自 MuCodec,从混合音频中提取混合令牌 Sm\mathbf{S}_m,从分离后的人声和伴奏音轨分别提取人声令牌 Sv\mathbf{S}_v 和伴奏令牌 Sa\mathbf{S}_a。解码器基于扩散变换器和 VAE,直接从令牌重建波形,避免梅尔频谱作为中间步骤带来的损耗。

LeLM 的层级设计是解决协同与保真度权衡的关键。它的混合语义 LM 是一个 36 层、隐尺寸 2048 的解码器专用 Transformer,负责预测混合令牌,扮演全局语义规划者:它捕捉旋律、节奏、速度和人声-伴奏协调等高阶信息,相当于生成过程的 “伪思维链”。轨道特定 LM 是一个轻量的 12 层 Transformer,条件化于混合语义 LM 的隐状态而非离散令牌,并行预测人声和伴奏令牌,恢复细粒度声学细节。为了避免交错预测带来的序列长度膨胀,论文引入延迟模式机制,让轨道特定 LM 在预测第 tt 步双轨令牌时能看到混合语义 LM 直到第 t+kt+k 步的隐状态,其中 kk 为延迟步数。这一设计在保持双轨音质优势的同时将序列长度控制在与混合建模相当的水平。

训练上,LeVo 2 提出了美学引导的三阶段范式。第一阶段对混合语义 LM 进行美学条件化预训练:所有训练数据经由一个基于 MuQ 表征的自动化音乐美学评估框架标注音乐性层级(按百分位阈划分五个等级),模型以该层级标签作为额外条件,从而在大量噪声数据中注入音乐性先验,并解锁推理时音乐性感知的无分类器引导(CFG)。第二阶段是解耦式渐进后训练,仅作用于混合语义 LM:先用 SFT 和最高层级标签(前 0.5% 的歌曲)收窄生成分布;再用大规模离线 DPO 改善歌词对齐和提示一致性,构造偏好对时优先惩罚幻觉和指令不符;最后用闭环半在线 DPO 提升音乐性,生成器每 100 步与训练模型同步,动态采样新数据,偏好对聚焦音乐性差距,同时强制获胜样本无幻觉且指令相似度高于失败样本。第三阶段冻结混合语义 LM,仅训练轨道特定 LM,并引入声学增强策略:先用少量扩散步重建低质量混合令牌再从中提取,迫使轨道特定 LM 学会恢复细化声学细节。

这一分层解耦设计把全局语义规划与局部声学精炼的训练目标完全分离,避免了多目标联合优化时的梯度冲突。

创新点和贡献

LeVo 2 有三层递进式创新。第一层是架构上的层级并行建模:以往工作要么在混合令牌中丢失细节,要么用交错双轨导致序列爆炸,LeLM 通过混合语义规划加双轨并行精炼的组合,在保持序列长度可控的前提下同时优化整体和谐与局部音质。延迟模式进一步为轨道特定 LM 提供了更充分的语义上下文。

第二层是训练范式上的美学注入与解耦:论文构建的自动化美学评估框架贯穿整个训练周期——预训练时提供音乐性层级条件,SFT 时充当数据过滤器,DPO 时转为奖励信号。这种贯穿式的美学引导让模型在接触海量数据时就习得质量排序的先验。更关键的是,SFT→离线 DPO→半在线 DPO 的分阶段设计把可控性(客观指令对齐)和音乐性(主观艺术表达)解耦,先稳定可控性再利用动态采样的在线优势突破静态数据的能力上限,有效缓解了多偏好对齐中长期存在的梯度冲突和平均化效应。

第三层是规模化验证与详尽消融:论文展示了模型容量缩放(2B→4B 参数)、数据量缩放(200k 小时→500k 小时)和纯器乐数据引入对伴奏建模和流派多样性的实质提升(见表 IV),验证了层级架构中轨道特定 LM、延迟模式和声学增强各自不可或缺的作用。

实验结果分析

主观评测方面,20 位音乐专业人士在 100 首中文和 100 首英文歌曲上对 LeVo 2 和 8 个对比系统(3 个商业系统、5 个开源系统)打分,维度涵盖整体音乐性 OVL、旋律 MEL、编曲 ARR、伴奏音质 SQ-A、人声音质 SQ-V 和结构 STR。LeVo 2 在所有六个维度显著优于所有开源基线,且超越商业系统 MiniMax Music 2.5+;在伴奏音质上与 Suno v5 持平(7.10),编曲(6.42)和结构(6.11)接近 Mureka v8(见表 I)。

客观评测采用 Gemini 做自动化评估,LeVo 2 的情感控制得分 8.72 为所有系统最高;音素错误率 PER 为 8.55%,是所有开源模型中最低的,大幅领先其他开源系统(如 YuE 为 20.09%,ACE-Step 1.5 为 19.35%)。流派控制和乐器生成准确率略低于 ACE-Step 1.5,论文归因于标注精确度和规模上的差距(见表 I)。

分阶段训练的有效性在表 II 中得到验证:仅预训练时 OVL 为 4.61,SFT 后升至 5.02,离线 DPO 后 PER 从 10.59% 降至 9.19%,半在线 DPO 后 OVL 进一步升至 5.37,最后模块化扩展将人声音质从 6.32 提至 6.53、伴奏音质从 6.91 提至 7.10。

解耦后训练策略的优势在表 III 中尤为明显:单独优化歌词对齐或提示一致性会严重损害音乐性(OVL 分别降至 4.77 和 4.71),混合训练和插值方法受制于平均化效应(OVL 仅 4.91 和 5.17),而论文的分阶段策略以 OVL 5.37、MEL 6.03、ARR 6.34 达到最优平衡。

实践建议

对正在开发音乐生成系统的团队,LeVo 2 的工程经验有几点可直接借鉴:

第一,层级解耦的建模思路适用于任何多模态或多轨道生成任务。可以将全局协调建模和局部细节精炼分配给不同子网络,用隐状态而非离散令牌传递语义信息,既避免序列膨胀又减少跨模态干扰。在实际部署时,混合语义 LM 可独立部署作为轻量生成主干,轨道特定 LM 按需加载进行增强,便于计算资源的分级调配。

第二,美学评估框架的贯穿式使用是一套低成本的质量管控方案。即便没有大规模人工标注,利用自监督模型(如 MuQ)构建领域特定的多维度评分器,就能在数据筛选、SFT 过滤、DPO 奖励构造等多个环节自动化。建议团队在数据积累初期就训练此类评估器,并在后续迭代中持续用人工评测的少量样本校准其评分分布。

第三,解耦式渐进后训练的策略值得在具有多重优化目标的项目中推广。优先用低成本的离线 DPO 稳定可控性(如指令跟随、事实准确性),再利用半在线 DPO 推进主观质量(如流畅度、表现力),这种分步走的方式能显著降低超参调优的复杂度,避免多奖励信号相互干扰导致模型在各维度都 “中庸”。

第四,纯器乐数据的补充和声学增强训练是提升伴奏质量和曲风多样性的两个低成本手段。前者简单有效,后者通过有意降低输入质量迫使模型学习修复能力,可迁移到其他需要精细细节建模的生成任务中。