一层就够了吗?训练单个 Transformer 层可媲美全参数强化学习训练
论文信息
标题: Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training
作者: Zijian Zhang, Rizhen Hu, Athanasios Glentis, et al.
发布日期: 2026-07-01
arXiv ID: 2607.01232v1
PDF 链接: 下载 PDF
当一层胜过全部:RL 后训练中层级贡献的惊人集中现象
大型语言模型的强化学习后训练(RL post-training)如 GRPO 等方法,已成为提升模型数学推理、代码生成和智能体决策能力的核心手段。然而,一个根本性问题长期被忽视:RL 带来的性能增益到底分布在模型的哪些地方?传统做法对所有 Transformer 层一视同仁地更新参数,隐含假设每一层都对最终收益贡献相似。近期一篇研究《Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training》系统性地挑战了这一假设,发现事实远非如此:仅训练单个 Transformer 层就能恢复绝大部分全参数训练的增益,有时甚至超越全参数训练。这一发现揭示出 RL 后训练中一种高度结构化的层级贡献模式,并为更高效的训练策略带来了全新思路。
从全参数更新到单层隔离实验
为了量化层级的贡献,作者设计了一个干净的单层训练框架。对于一个具有 层的 LLM,保持嵌入层、输出头以及所有其他层参数冻结,仅对某一层 进行 RL 更新。梯度仍然沿着整个网络反向传播,因此该层接收到的信号包含全局上下文,但参数更新仅限于这一层。由此得到的模型在领域内基准上的表现记为 。通过与基础模型性能 和全参数训练性能 对比,定义层贡献:
表示单层训练完全达到了全参数训练的增益;大于 1 则意味着超越全参数训练;接近 0 则表明该层几乎无法吸收 RL 信号。
实验覆盖了七个模型(Qwen3 1.7B/4B/8B,Qwen2.5-Math 1.5B,Qwen2.5-Instruct 1.5B/3B,DeepSeek-Distilled-Qwen-7B),三种 RL 算法(GRPO、Dr.GRPO、GiGPO),以及数学推理、代码生成、智能体决策等多个任务领域。为保证公平,全参数基线经过学习率精细调优,而所有单层训练则统一使用相同的超参数,确保任何差异来自层本身的适应性而非调参偏差。
层贡献的非均匀与结构性集中
实验结果展示出一幅极不均衡的图景。在 Qwen3-1.7B 上,第 10 层的贡献高达 1.14,即单层训练完全恢复了全参数训练的增益并超出 14%;而第 24 层仅有 0.28。最佳层贡献是最差层的四倍以上。更惊人的是,在所有模型中,贡献最高的层几乎都集中在网络的中间部分(约 40%~60% 深度),而靠近输入和输出的层贡献相对较低。例如 Qwen3-8B 的最佳层是第 16 层(共 36 层),Qwen2.5-Math-1.5B 的最佳层为第 14 层(共 28 层),智能体任务中 Qwen2.5-1.5B-Instruct 的最佳层同样是第 14 层。
这种模式还表现出极强的稳定性:对于同一模型,在不同数学数据集(NuminaMath-CoT 与 DeepScaleR)得到的层贡献排名 Spearman 相关系数高达 0.76;甚至跨任务(数学与编程)的排名相关性仍达 0.59。这表明层贡献不是由特定训练数据或任务驱动的偶然现象,而是预训练模型自身固有的结构属性。
进一步分析发现,高贡献层带来的不仅仅是领域内指标的提升,同时还能改善代码、推理和语言等分布外能力,说明学习到的是通用而非过拟合的技能。此外,权重变化幅度与层贡献并不成正比:在全参数训练中,各层的参数变化量相差不大(L2 范数在 0.5~0.8 之间),却产生截然不同的贡献;单层训练时,无论是高贡献层还是低贡献层,其参数移动量都明显大于全参数训练中的相应层,但只有高贡献层能有效利用这种更大的参数变化空间。换句话说,层贡献衡量的是 “参数子空间的有效性” 而非 “参数移动量的大小”。
将发现转化为可操作的训练策略
基于上述洞察,研究探索了三种利用层贡献指导训练的方法,均在数学推理任务上取得了优于全参数基线的结果。
-
层自适应学习率:将贡献最高的 5 或 10 层的学习率提高至 (基础学习率为 ),其他层保持不变。在 Qwen3-1.7B 上,提升前 10 层的学习率使数学平均准确率从 50.8% 提升至 53.7%,额外获取了全参数训练总增益的 43%;在 4B 和 8B 模型上也分别有显著提升。反之,若提升最低贡献层的学习率,性能反而下降,证明提升效果确实来自对高贡献层的差异化处理。
-
选择性训练:直接冻结其他层,只训练贡献最高的 5 或 10 层。对于 Qwen3-8B,仅训练最佳 10 层便达到 69.1% 的平均准确率,超越全参数训练的 66.4%,在 4B 模型上同样高出 2.9 个百分点。这一策略不仅性能更强,还大幅减少了可训练参数量。
-
基于位置的启发式方法:由于层贡献总是呈中部凸起,研究发现只需简单挑选模型中间的几个层进行训练(无需任何贡献分析步骤),也能稳定超过全参数基线。例如在 Qwen3-8B 上,选择中间 5 层训练得到的数学准确率为 68.2%,虽然略低于基于贡献的选择(69.0%),但已获得全参数训练增益的 21%,且完全免去了逐层扫描的计算开销。
另一项有趣发现是,即使贡献值相近的不同层,训练出的模型在解决具体问题时表现出显著的互补性。对 Qwen3-1.7B 的前 7 个高贡献层模型进行多数投票,在奥赛数学题 (OlympiadBench) 上准确率从最佳单层的 28.3% 提升至 33.6%,远超全参数模型的 26.9% 以及其自身的自一致采样投票(31.3%)。这说明不同层捕捉到了 RL 改善的不同方面,通过集成可以收获额外的增益。
实践应用建议与未来展望
这项研究给 RL 后训练的实践者带来了几条直接可行的启示:
- 优先训练中间层:在没有计算资源进行层级贡献度扫描时,直接冻结首尾,集中训练中部 30%~70% 的层,通常就能获得高质量的结果,且可能减少过拟合。
- 差异化学习率配置:可以对已知的高贡献层使用更大的学习率,而对首尾层使用较低学习率甚至冻结,既提升效果又保留全参数微调的灵活性。
- 层集成增强:虽然独立训练多个单层模型并集成的成本较高,但这一思路可以启发更高效的集成方法,例如在训练过程中同时维护多个不同层主导的子网络,或在推理时通过模型合并技术融合不同层的知识。
- 理论探索方向:为什么中间层成为 RL 适应的 “重心”?这可能与中间层编码了更抽象的语义表征、更接近奖励信号与动作空间的映射有关。未来可结合可解释性工具进一步剖析,并将层贡献概念拓展到 RLHF、DPO 等对齐方法中。
目前的验证主要集中在数学推理,对编程和智能体任务的训练策略优化仍有待完善。此外,层贡献的定义本身依赖于特定的全参数基线,其在不同 RL 目标、不同模型结构下的稳定边界尚需更广泛检验。然而,这项研究已经有力地动摇了 “RL 需要整个网络协调适应” 的直觉,为我们理解大型模型的学习动态打开了一扇新的窗口。
总结
该论文通过系统性的单层 RL 训练实验,证明了强化学习后训练中的增益高度集中在少数的中间 Transformer 层上,单层即能恢复甚至超越全参数训练效果。这种结构化模式跨越了模型族、算法和任务,成为一种稳定且可预测的属性。基于此开发的层感知训练策略不仅大幅提升了训练效率,还带来了额外的性能收益。这一发现不仅深化了我们对 LLM 内部知识组织的理解,也为未来的高效训练范式提供了崭新的设计哲学:有时,少即是多,关键在于找对那 “一层”。