LeVo 2:通过层次化表示建模与渐进式后训练实现稳定且悦耳的歌曲生成
论文信息
标题: LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training
作者: Shun Lei, Huaicheng Zhang, Dapeng Wu, et al.
发布日期: 2026-06-29
arXiv ID: 2606.30642v1
PDF 链接: 下载 PDF
从 “混合” 到 “层次”:LeVo 2 如何突破全曲生成的瓶颈
一、背景与动机:歌曲生成的 “不可能三角”
在人工智能生成内容(AIGC)的浪潮中,音乐生成始终是极具吸引力的研究方向。然而,当我们谈论的不是简单的旋律片段或纯器乐演奏,而是一首真正的、完整的歌曲——那种人声与伴奏交织、情感与结构并存的艺术作品——技术的边界便开始显露。
现有方案普遍面临一个结构性困境,我们可以称之为歌曲生成的 “不可能三角”:音质细节、声乐协调与长程连贯性,三者难以兼得。
早期的语言模型方案(如 Jukebox)采用 “混合令牌” 的方式,将人声与伴奏的离散编码融合在一起预测。这种方法天然保持了人声与乐器的协调,但因为两种声音互相掩蔽,细节难以呈现;而后续出现的 “双轨预测” 方法(如 YuE、SongGen)虽然提升了单轨音质,却因独立建模导致人声与伴奏的和谐度下降,且序列长度翻倍,使得模型在长曲生成中难以维持全局结构和歌词对齐。
LeVo 2 的提出,正是为了打破这一困境。研究团队将 “全局协调与局部细节” 的矛盾重新定义为一个层次化的建模问题,而非简单的技术取舍。
二、核心方法:层次化语义规划与美学引导的训练范式
2.1 两层语言模型的分工设计
LeVo 2 的核心架构名为 LeLM,包含两个协同工作的 Transformer 模块:混合语义语言模型(Mixed Semantic LM)和音轨专用语言模型(Track-Specific LM)。
第一个模块担任 “全局语义规划者” 的角色。它基于混合令牌(来自整首歌曲的综合编码)进行下一令牌预测,捕捉旋律走向、节奏模式、速度变化等高层次音乐结构信息。这个过程可形式化为:
其中 代表歌词、文本描述、音频提示等条件输入。这一步的核心价值在于:它为整首歌曲提供了一个 “思维链式” 的蓝图,确保人声与伴奏从生成之初就保持内在和谐。
第二个模块则专注于 “音轨级声学精炼”。它接收来自第一模块最后一层的隐藏状态作为上下文条件,并行地预测人声令牌和伴奏令牌。通过一种 “延迟模式” 机制,该模块在当前时间步能 “看到” 未来几步的全局语义信息,从而更精准地恢复音色、表现力等局部细节:
这种层次化设计的精妙之处在于:全局协调被留在混合语义层完成,序列长度不会膨胀;音轨细节在第二层并行生成,避免了直接混合带来的干扰。这从根本上绕开了此前 “双轨交错预测” 导致的长度灾难和协调性问题。
2.2 从离散令牌到高保真音频的桥梁
LeVo 2 的另一个关键组件是扩散模型驱动的音乐编解码器(Music Codec)。它负责完成最后的 “渲染” 工作:编码器将训练用的歌曲音频压缩为混合令牌和双轨令牌供 LeLM 学习,解码器则将 LeLM 预测出的令牌序列重构为 48kHz 高保真波形。
值得关注的是,编解码器的训练被拆分为两个阶段:先预训练变分自编码器将音频压缩到低帧率潜在空间,再冻结编码器、联合训练向量量化模块和扩散解码器。这种策略既保证了重建质量,又降低了解码计算量,为后续扩展到全曲生成奠定了基础。
三、训练范式的突破:美学引导的渐进式后训练
如果说层次化架构解决了 “怎么生成” 的问题,那么 LeVo 2 在训练策略上的贡献则回答了 “如何生成得更好”。
传统多偏好对齐方法常试图用一个统一的目标函数同时优化音乐性、歌词准确度、指令遵循等多维度,这极易引发梯度冲突——提升某一方面可能损害另一指标,最终陷入 “平均化” 陷阱。LeVo 2 的答案是解耦与渐进。
3.1 预训练阶段的美学条件注入
第一步发生在预训练之前。团队构建了一个自动化音乐美学评估框架,基于自监督学习模型 MuQ 提取的表征,从人声音质、伴奏音质、旋律性、结构感、编曲质量等多个维度对训练数据进行评分。
所有歌曲数据按分数划分为五个美学等级标签,并作为条件注入模型。这带来了两个关键收益:其一,为模型提供了 “音乐性先验”——即便数据中存在大量嘈杂样本,模型仍能通过标签区分质量层级;其二,解锁了推理阶段的 “音乐性感知分类器自由引导” 技术,通过调整引导强度系数,可以显式控制生成质量的偏向。
3.2 从 SFT 到闭环半在线 DPO 的三阶段递进
进入后训练阶段,优化目标被进一步拆解。
第一阶段:监督微调(SFT)。利用美学框架筛选每个类别前 0.5% 的顶级样本进行训练,快速收缩生成分布,建立高质量基线。实验数据显示,仅这一步就将总体音乐性 MOS 分从 4.61 提升至 5.02。
第二阶段:大规模离线 DPO 提升可控性。团队生成了 15 万条多样化歌词,为每条歌词生成 8 个候选样本,通过歌词对齐度(基于音素错误率)、提示一致性和美学评分三个维度构建偏好对。配对策略优先惩罚幻觉样本和低相似度样本,显著降低了音素错误率(从 10.59% 降至 9.19%)。
第三阶段:闭环半在线 DPO 最大化艺术表现力。这是最具创新性的环节。不同于传统方法依赖固定的离线数据集,LeVo 2 每 100 步同步一次生成器权重,利用不断进化的策略模型实时采样新数据。偏好对构建聚焦于音乐性差距(要求 MOS 差距大于 0.2),同时强制约束获胜样本必须无幻觉且指令相似度更高。这种 “自博弈” 式优化让模型逐步超越原始数据分布的能力上限,在主观指标上获得全面跃升。
四、实验结果:逼近商业系统的开源里程碑
大规模主观评测中,20 位音乐专业人士在六个维度上对中英文各 100 首全曲进行评分。LeVo 2 在所有维度均显著领先于全部五个开源基线模型(YuE、DiffRhythm 2 等),并在人声音质(6.53)、伴奏音质(7.10)等关键指标上超越闭源系统 MiniMax Music 2.5+,部分逼近 Suno v5 和 Mureka v8。
客观评测同样亮眼:音素错误率 8.55% 为所有开源系统最低,情感控制得分 8.72 甚至超越了所有评测商业系统。唯一的弱项在风格/乐器控制精度上,团队坦承这源于自动标注流水线的规模和精度限制——是数据问题而非架构缺陷。
消融实验进一步验证了核心设计的有效性。移除美学引导机制使主观评分全面下降;去除非纯歌曲的器乐数据导致伴奏音质和风格对齐度显著下滑;关闭延迟模式或去除音轨专用语言模型甚至导致音素错误率飙升至 47%。
五、实践启示与未来展望
对于从事音乐生成研究和应用开发的团队,LeVo 2 提供了几个值得借鉴的思路:
首先,面对复杂多目标优化,解耦优于混合。 将全局规划、可控性对齐、音质精炼分配给不同阶段和不同模块,能有效规避梯度冲突,让每个阶段集中解决一个核心问题。
其次,数据质量标签本身就是强大的先验。 即便训练集充满噪声,通过自动美学评估框架标记 “质量等级”,就能让模型学会区分优劣,这比简单扩大数据量更高效。
第三,闭环采样策略或许是突破离线数据瓶颈的钥匙。 在算力允许的情况下,引入自我博弈机制让模型不断挑战自身生成能力的上限,是提升艺术创造力的关键路径。
未来方向方面,LeVo 2 团队指出的标注瓶颈值得整个社区关注。当前高度依赖开源模型进行伪标签生成的模式,限制了提示多样性和精确度。更智能的自动标注方案,或人机协同的高效标注范式,可能是下一代模型突破风格控制天花板的关键。
此外,尽管 LeVo 2 在全曲生成上取得长足进步,但距离人类作曲家在 “创意惊喜” 层面的能力仍有距离。如何让模型不仅 “合规” 而且 “出彩”,可能是生成式音乐 AI 面临的下一个哲学性挑战。
六、总结
LeVo 2 通过层次化表示建模和美学引导的渐进式后训练,系统性地解决了全曲生成中长期存在的协调性-细节性-连贯性权衡。它的成功不止于 benchmark 数字的跃升,更在于提供了一套可复现的、解耦的训练哲学——这或许是这份工作留给社区最宝贵的资产。当开源模型开始在多项指标上追赶闭源巨头,我们有理由相信,高质量的音乐创作工具正走向普惠化。