均衡推理器:学习吸引子实现可扩展推理
Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning
论文信息
标题: Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning
作者: Benhao Huang, Zhengyang Geng, Zico Kolter
发布日期: 2026-05-20
arXiv ID: 2605.21488v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题: 这篇论文试图解释,为什么在推理模型中增加测试时计算(例如多迭代几步、多生成几条轨迹)有时能提升性能,有时却会失效。它要揭示这类迭代推理模型内部可扩展和可泛化的机制。
- 核心方法: 论文提出了 “均衡推理器”,将迭代推理过程建模为在隐空间中向 “吸引子” 的动态演化。训练目标是塑造一个 “内部景观”,使其稳定点(吸引子)与任务的正确解对齐。这通过两项干预实现:对初始隐状态随机初始化,以及向迭代过程注入噪声。
- 关键结果: 在极难的数独任务上,通过将隐状态迭代规模扩展至相当于 4 万层的有效深度,并结合从多个随机初始化出发的轨迹聚合,均衡推理器的准确率从传统前馈网络的 2.6% 提升到超过 99%(见图 1,表 4)。
- 主要局限: 论文在受控的结构化推理任务(数独、迷宫)上验证,向更通用、开放域的推理任务(如大规模语言模型)的迁移尚待研究。此外,论文未深入探讨当任务本身存在多个有效解时,如何塑造吸引子景观。
- 适合读者: 适合关注深度学习可解释性、测试时计算扩展、隐式模型和复杂推理任务的研究者。任何希望理解迭代推理模型内部工作机制的读者都能从中受益。
论文背景和研究动机
近年来,通过增加 “测试时计算” 来提升 AI 模型性能,已从游戏智能体、思维链推理等场景中显现出强大力量。然而,“算得越多越好” 并非放之四海皆准的真理。研究观察到,更多的推理计算有时会带来收益递减,甚至性能下降,这表明其背后必然存在着特定的、可支持可扩展推理的内部机制。
为此,本文探索了一个根本问题:“什么样的内部机制能够实现可扩展和可泛化的推理?” 作者将目光投向一类新兴的迭代推理模型(如 HRM, TRM),它们通过在隐空间中反复使用同一个参数模块更新状态,来解决数独、迷宫等结构化问题。这种重复更新天然地定义了一个隐空间中的动态系统。
作者的核心洞见在于,将这种泛化推理能力归因于模型学会了 “任务条件化的吸引子”(见图 2)。通俗地说,模型学习了一个动态过程,如同在脑海中构建了一个起伏的地形(即 “内部景观”)。正确的问题解对应着这个地形的低洼盆地(即 “有利吸引子”),而错误的解则对应着假盆地(即 “伪吸引子”)。推理过程就像在这个地形上滚下一个小球,若能落入正确的盆地并稳定下来,模型就找到了答案。测试时计算(增加迭代次数)之所以能提升性能,是因为它让 “小球” 有更多时间滚向盆地底部,从而更接近正确解。
核心方法和技术细节
为了实现上述理念,论文逐步将一个普通的前馈网络转变为一个可扩展的迭代推理器,即 “均衡推理器”。这个过程包含三个关键步骤:
1. 构建迭代动力学基础(第 3 节) 研究首先探索了将前馈模型转化为迭代模型的关键设计选择。这包括:使用权值共享,让模型的不同层重复使用同一模块,将深度转化为迭代次数;引入截断梯度和分段在线训练(SOT),以稳定对长迭代轨迹的优化,降低内存开销。SOT 的核心是交替进行隐状态更新和参数更新,避免了在整个长轨迹上反向传播的稳定性问题,并使优化更贴近当前模型能力所能达到的轨迹。
2. 塑造吸引子景观(第 5 节) 有了稳定的迭代模型后,关键便是塑造一个 “好的” 内部景观,即让正确的吸引子盆地宽广、稳定且易于抵达。论文提出了两项任务无关的干预:
- 随机状态初始化(RI): 不同于以往使用固定初始隐状态的做法,EqR 在训练时随机采样初始状态。这就像在推理时会有多条来自不同起点的 “小球” 滚落,训练时让模型见识更多起始区域,能确保有利的盆地能更容易被各种路径抵达。
- 路径随机性(NI): 向每一步的迭代更新中注入少量噪声。这能防止 “小球” 过早陷入伪吸引子,增加其探索力度,最终落入更优盆地的概率。更新公式为:,其中 是注入的高斯噪声。
3. 两轴测试时计算扩展 基于上述塑造的景观,EqR 可沿两个维度扩展推理计算(见图 3):
- 深度扩展: 增加单条轨迹的迭代步数 。这允许一个已经落入正确盆地的轨迹进行更精细的收敛,逼近盆地底部的稳定点。
- 广度扩展: 从不同的随机初始化出发,运行独立的轨迹 条。这增加了覆盖不同盆地的概率,是解决存在多个伪吸引子问题的关键。最终通过多数投票或收敛性选择(选择平均残差 最小的轨迹)来聚合结果。
创新点和贡献
-
提出吸引子景观的理论框架: 论文首次将迭代推理明确解释为向隐空间吸引子的收敛过程。它将测试时计算的收益归因于收敛,并指出失败的两种模式:“任务失配”(无可抵达的正确吸引子)和 “盆地选择错误”(存在多个吸引子,落入了错误的一个),为模型诊断和改进提供了直观的语言(见图 6)。
-
建立训练与吸引子塑造的联系: 论文将 SOT、随机初始化、噪声注入等训练技巧,与塑造吸引子盆地的宽度、深度和可抵达性直接关联起来,为这类模型的设计提供了原理性指导,而非仅仅经验性的堆砌。
-
实现大规模的测试时扩展: 研究证明,即使在训练时仅使用最多 16 次迭代,学到的吸引子动态能够在测试时泛化到超过 1024 次迭代(图 1)。在数独任务上,这等效于展开一个超过 40000 层的网络,并将准确率从 2.6% 提升至 99.8%(表 4),这在以往是从未实现的。
-
揭示广度与深度的协同作用: 论文通过详尽的 “帕累托热力图”(图 3)揭示,广度扩展仅在深度达到一定阈值(例如 )后才变得有效。这正符合其理论:轨迹需要足够的深度才能先抵达某个盆地,然后再通过广度探索更多盆地。
实验结果分析
实验主要在两个受控基准,数独极致版和唯一解迷宫,上进行。
- 迭代模型 vs 前馈模型: 在相同的层评估预算下,引入权值共享并迭代的计算方式,就能将数独准确率从 2.6% 大幅提升至 32.6%(表 8(a)),证明了这种动力学机制的优势。
- 景观塑造的有效性: 加入随机状态初始化和噪声注入后,即使在基础的推理预算下(),迷宫准确率就从 44.9% 蹿升至 82.2%,数独准确率也从 84.8% 提升至 86.4%(表 3)。这表明,景观塑造本身就能让更多问题在相同算力下被解决。
- 测试时扩展的惊人天花板: 将深度从 扩展到 ,并结合广度 ,数独准确率最终达到 99.8%,迷宫准确率达到 93.0%(表 4)。
- 收敛性成为可靠信号: 实验表明,在良好塑造的景观中,固定点残差(衡量收敛程度的指标 )与任务误差高度相关。因此,在多条轨迹中选择收敛性最好的那条(Top-1 Converged),其效率和准确性甚至可以超越简单的多数投票(图 8)。
实践建议
对于希望在复杂推理或优化任务中应用此类技术的从业者,这篇论文提供了几点明确的指导:
-
诊断你的模型动力学: 不要只关注最终准确率。追踪迭代过程中的残差 。如果残差下降与任务错误率下降不同步,说明你可能遇到了 “伪吸引子” 或 “无反曲点” 的景观(模式 (b) 或 (a)),单纯增加迭代或重启可能无效。
-
优先塑造景观而非堆计算: 在砸大量算力做测试时扩展之前,应先用 “随机化初始值” 和 “注入少量噪声” 这类低成本方式塑造模型的内部动力学。这能提升基本性能,并使后续的算力投入更可靠。论文显示,这项投资能够显著提升测试时扩展的上限。
-
采用两轴扩展策略: 在分配推理预算时,同时考虑深度和广度。对于容易收敛的简单问题,增加深度即可;对于存在多解或易出错的复杂问题,先提供足够的深度(比如 4-8 步),再增加广度(重启次数),性价比最高。
-
用收敛性做后筛选: 在有多条推理路径的情况下,与其依赖外部验证器,不如直接利用内部的收敛性信号(残差)来选择最佳轨迹。在吸引子景观被良好塑造后,这是一个极其强大且任务无关的筛选器。
-
审视任务和数据的定义: 本研究特别指出(附录 C),如果任务本身定义模糊(如迷宫存在多个有效最短路径),就会天然制造出多个正确的吸引子,但被错误地施加单一解监督,从而导致景观失配,破坏可扩展性。在设计任务和收集数据时,务必确保解的唯一性或提供相对宽松的监督信号。