一层就够了吗?训练单个 Transformer 层便能媲美全参数强化学习训练
Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training
论文信息
标题: Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training
作者: Zijian Zhang, Rizhen Hu, Athanasios Glentis, et al.
发布日期: 2026-07-01
arXiv ID: 2607.01232v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:这篇论文要解决什么问题? 研究强化学习(RL)对大语言模型(LLM)进行后训练时,收益是否均匀分布在不同网络层上。论文挑战了 “所有层贡献相似” 的隐含假设。
-
核心方法:用什么办法解决? 逐层独立训练,即冻结模型其余所有参数,仅对单一 Transformer 层进行 RL 训练(GRPO 算法及其变体),并定义 “层贡献度” 指标,衡量单层训练能恢复多少全参数训练的增益(见论文第 2.2 节)。
-
关键结果:最重要的一个结论或数字。 在多个模型上,训练单一中间层即可恢复甚至超过全参数 RL 训练的全部增益。例如,Qwen3-1.7B-Base 的第 10 层贡献度达到 1.14,意味着其单层训练效果超越了全参数训练的 114%(见表 2)。
-
主要局限:作者自己承认的、或方法本身固有的限制。 作者指出,基于层贡献度的指导性训练策略仅在数学推理任务上得到验证,向编程和智能体任务的推广留待未来工作;此外,为何中间层在 RL 中贡献突出,仍缺乏深层的理论解释(见论文第 7 节)。
-
适合读者:什么背景的人值得读。 对大型语言模型的高效微调、强化学习(尤其是 RLHF/RLVR)、模型可解释性以及计算资源优化感兴趣的研究者和工程师。
论文背景和研究动机
强化学习与可验证奖励(RLVR)已成为后训练大语言模型的核心技术,在数学推理、代码生成和智能体决策等任务中驱动了显著性能提升。现有方法普遍更新所有模型参数,这背后隐含着一个直觉:RL 带来的改进是网络中所有层协同适应的结果。然而,这一直觉从未被系统性地验证过。
此前的研究已揭示,预训练 LLM 的各层角色存在高度非均匀性。例如,某些层被移除后会导致模型性能崩溃,而另一些层的移除影响甚微。类似的结构异质性也出现在监督微调(SFT)阶段。这些发现催生了分层采样、自适应层选择等优化策略。但它们主要关注推理时行为或 SFT,RL 后训练是否具备类似的结构化模式,是一个未被探索的根本问题。
论文正是为了回答 “RL 收益在网络中何处产生” 这一核心问题,旨在揭示 RL 对预训练模型的改造是否存在一种底层的、可被利用的结构。
核心方法和技术细节
论文的核心方法论是 “单层隔离训练”,其严谨性和控制性设计是该研究的关键技术亮点。
单层训练与层贡献度量框架
对于一个有 层的 LLM,标准全参数 GRPO 会更新所有参数集合 。单层训练框架则仅隔离出某一层 进行更新,而冻结所有其他参数(包括嵌入层和输出头),更新规则为:
关键在于,梯度 是通过整个网络反向传播计算得到的,它包含了所有层的依赖信息;仅仅是参数更新被限制在目标层 上。研究中对每层独立重复此过程。
为量化每层的学习能力,论文定义了 “层贡献度” :
其中, 是仅训练第 层的模型性能, 是无任何 RL 训练的基模型性能, 是全参数 RL 训练的性能。 表示单层训练完全匹配全参数训练的增益,大于 1 表示超越,接近 0 则表示无法捕获有效改进。
公平比较协议
为确保比较的公平性,研究遵循一套严格的超参数协议:(1)为全参数基线精心调优学习率等,确保其性能最优;(2)对所有单层训练实验统一使用该全参数基线的调优后学习率,不额外为单层调参;(3)所有其他超参数(如批次大小、KL 散度系数)严格一致。这保证了单层训练的任何优势都非来自更优的超参数设置。
创新点和贡献
-
发现 RL 适配的集中化现象:论文首次系统性地证明,LLM 在 RL 后训练中的收益高度集中,训练单个 Transformer 层就能恢复大部分甚至全部性能增益,挑战了 “全网络协调适应” 的传统直觉。
-
定义并验证 “层贡献度” 的稳定结构:论文不仅引入层贡献度指标,还发现其呈现一种极为稳定的模式——高贡献层集中于网络中部(约 40%-60% 深度),而靠近输入和输出端的层贡献较小。该模式在跨模型家族(Qwen3, Qwen2.5)、跨 RL 算法(GRPO, Dr. GRPO, GiGPO)、跨任务领域(数学、编程、智能体)时均保持一致(见图 1)。层贡献排名在不同数据集和任务间也高度相关,例如数学与代码任务的排名相关系数达到 0.59(Spearman , p<0.001)(见论文第 3.3 节)。这表明层贡献是模型的内在属性。
-
开辟 RL 后训练效率提升新路径:基于观察,论文开发了简单而有效的分层感知训练策略,如仅训练高贡献层或为其提升学习率。这些策略在同等计算量下,能够持续超越标准的全参数 RL 训练。例如,在 Qwen3-8B 上仅训练 10 个最优层,平均数学精度达到 69.1%,显著优于全参数训练的 66.4%(见论文第 4.2 节)。
实验结果分析
实验结果围绕 “结构一致性” 和 “应用价值” 展开,结论有力:
层贡献的戏剧性差异与稳定模式。 在 Qwen3-1.7B-Base 上,最优单层(第 10 层)贡献度为 1.14,而最差单层(第 24 层)仅为 0.28,差距超 4 倍(表 2)。此模式在 7 个模型上普适存在,最佳层贡献度均达到或超过 1.0,最差层则在 0.17 至 0.42 之间(表 7)。所有模型的贡献剖面均呈现倒 U 型结构,峰值位于网络中部。
权重变化与贡献度的解耦。 一个有趣的分析发现,在全参数训练中,所有层的权重变化幅度()其实是相对均匀的,这与高度非均匀的层贡献形成鲜明对比。而在单层训练中,无论高低贡献层,其参数移动幅度相似,但产生的性能结果却有天壤之别(图 9)。这有力地证明了,层贡献反映的是该层参数子空间捕获 RL 改进的 “有效性”,而非参数变化的 “量”。
模型多样性与集成增益。 研究还发现,不同高贡献层训练的模型,其解决的问题集合重叠度很低(平均 Jaccard 相似度仅 34.1%)。利用这种互补性,通过对 7 个层专精模型进行多数投票,在 OlympiadBench 上的集成精度达到 33.6%,不仅超过了最佳单层模型(28.3%),也超过了集成 7 个基模型生成的样本的自我一致性策略(31.3%)(图 8)。这揭示了单层训练可作为探索预训练权重附近多样化专家模型的一种结构化方法。
实践建议
本研究的发现为 LLM 的 RL 后训练提供了直接且高效的工程指导,尤其适用于计算资源敏感的场景。
-
采用层选择性训练策略:对于新任务进行 RL 微调时,可不必更新所有参数。根据论文结论,一个简单而强大的策略是 “仅训练中间层”。在 Qwen3-8B 上,仅基于位置启发式地训练中部 5 个层,无需任何预分析,其性能(68.19%)就超过了全参数训练(66.43%),实现了 21% 的额外 RL 增益(见论文第 4.3 节)。这能显著降低训练时的显存占用和计算开销。
-
使用差异化学习率:如果不能仅训练部分层,也可以为不同层分配差异化的学习率。论文建议,对中部的高贡献层使用更高的学习率(如 ),而对输入和输出端的低贡献层使用较低的基础学习率(如 )。此方法在多个模型上均带来了稳定的性能提升,且比全参数训练更优(图 7)。
-
利用层贡献的可迁移性:层贡献排名在不同数据集甚至不同任务间具有强相关性。这意味着,在实施 RL 后训练时,无需在昂贵的目标数据集上重新进行全量层贡献分析。可在一个小型、廉价的通用数学数据集(如 NuminaMath-CoT 的子集)上执行一次层扫描,得到的层重要性排序即可指导其他数据集(如数学竞赛题)甚至其他任务(如代码生成)的层选择策略(见论文第 3.3 节)。这极大地降低了使用层感知训练的门槛。