递归多智能体系统

Recursive Multi-Agent Systems

arXiv: 2604.25917v1

论文信息

标题: Recursive Multi-Agent Systems

作者: Xiyuan Yang, Jiaru Zou, Rui Pan, et al.

发布日期: 2026-04-28

arXiv ID: 2604.25917v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:多智能体系统(MAS)如何通过系统级的递归计算实现性能扩展,而不是仅优化单个智能体或通过文本交互传递信息。
  • 核心方法:提出 RecursiveMAS 框架,使用轻量级的 RecursiveLink 模块连接异构智能体,在隐空间(latent space)内进行循环交互和优化,无需更新完整的模型参数。
  • 关键结果:与先进基线相比,RecursiveMAS 平均准确率提升 8.3%,端到端推理速度提升 1.2–2.4 倍,Token 使用量减少 34.6%–75.6%(见论文第 5.2 节与表 2)。
  • 主要局限:论文未讨论在超大规模智能体集群下的通信带宽瓶颈,也未涉及 RecursiveLink 在极度异构模型(如不同模态、不同架构)间的泛化能力。
  • 适合读者:从事大语言模型、多智能体系统、以及关注推理效率和系统级优化的研究人员与工程师。

论文背景和研究动机

单一大语言模型(LLM)在处理复杂任务时,常因能力有限、生成短视或解空间探索不足而受限(论文引言)。为此,研究者将多个专业化智能体组织成多智能体系统(MAS),通过互补协作来提升整体表现。然而,现有的优化主流方案存在两难:基于提示(prompt)的适应性改良只能微调交互上下文,无法改善智能体自身能力;端到端地微调所有智能体参数又极为昂贵,且文本交互的顺序依赖性带来显著延迟。论文提出一个核心洞见:能否将单一模型的递归计算思想扩展到整个多智能体系统,实现系统级的性能缩放?

此前,递归语言模型(RLM)通过反复应用同一组层来增加推理深度,完全在隐空间中完成。论文将这一理念提升至系统层面,视整个多智能体系统为一个统一的递归计算单元,让异构智能体在隐空间中循环传递信息、迭代优化,从而避免反复的文本解码/编码开销。

核心方法和技术细节

为推动隐空间递归,论文设计了两种 RecursiveLink 模块(见 3.1 节):

  • 内部链接(Inner RecursiveLink) 在每个智能体内部工作,将自回归生成的最后层隐状态 hh 映射回输入嵌入空间,形成下一步的 “隐式思维”(latent thought)。其核心是一个带残差连接的两层 MLP: Rin(h)=h+W2σ(W1h)\mathcal{R}_{\text{in}}(h) = h + W_2 \sigma(W_1 h) 残差分支保留了原始语义,让网络专注对齐分布差异。

  • 外部链接(Outer RecursiveLink) 用于连接尺寸、类型不同的异构智能体。它在残差分支中额外引入线性层 W3W_3 进行维度变换: Rout(h)=W3h+W2σ(W1h)\mathcal{R}_{\text{out}}(h) = W_3 h + W_2 \sigma(W_1 h)

系统整体循环架构

论文将每个智能体类比为递归模型中的一层(见 3.2 节)。首个智能体接收输入,通过内部链接产生连续的隐式思维 HA1H_{A_1};随后外部链接将其传递至下一智能体 A2A_2 作为条件,A2A_2 再产生新的隐状态,直至最后一个智能体 ANA_N。ANA_N 的隐输出通过内部-外部链接传递回首个智能体,形成递归闭环。所有中间交互都在隐空间中完成,只有末轮递归才将最终隐状态解码为文本答案。

内-外环训练范式

训练只更新 RecursiveLink,不修改智能体模型参数(见第 4 节)。整个流程包含两个阶段:

  1. 内环训练(模型级):为每个智能体预热内部链接。目标是最小化内部链接输出与真实答案文本嵌入的余弦距离: Lin=1−cos⁡(Rin(H),Embθi(y))\mathcal{L}_{\text{in}} = 1 - \cos(\mathcal{R}_{\text{in}}(H), \text{Emb}_{\theta_i}(y)) 这使智能体学会在不显式解码的情况下,将隐状态对齐到与文本嵌入相似的语义分布。

  2. 外环训练(系统级):将整个系统按递归轮次 nn 展开,最后一轮产生文本预测,通过交叉熵损失联合优化所有外部链接。梯度沿完整递归路径回传,整个系统作为一体进行信用分配和优化。

理论保证

论文提供了两个理论分析(见命题 3.1 与定理 4.1):

  • 运行复杂度:RecursiveMAS 避免了文本交互中昂贵的词汇表解码操作 m∣V∣dhm|V|d_h,仅需隐空间转换 mdh2m d_h^2,由于 dh≪∣V∣d_h \ll |V|,显著降低成本。
  • 梯度稳定性:文本递归中的 softmax 解码头在高置信度(低熵)时会导致梯度消失;而 RecursiveLink 的残差 MLP 结构能维持近似于 1 的梯度范数,保证训练稳定有效。

创新点和贡献

  1. 系统级递归范式的首次实践:将单一模型的隐空间递归思想推广至多智能体系统,使得异构智能体间的协作本身成为可缩放的计算维度。

  2. 隐空间交互设计:通过轻量级的内部/外部 RecursiveLink,在无需更新大模型的前提下,实现高效、语义对齐的跨智能体通信,从根本上避免了反复的文本编解码开销。

  3. 一体化训练策略:内-外环训练让整个系统作为整体协同优化,梯度在递归路径上稳定传播,这是纯文本交互所无法实现的(定理 4.1)。

  4. 通用性与适应性:RecursiveMAS 被成功实例化于四种典型的 MAS 协作模式:顺序式、混合专家组、知识蒸馏、工具赋能反思,覆盖数学、科学、医学、搜索、代码生成等 9 个基准。

实验结果分析

实验部分全面评估了 RecursiveMAS 的性能、效率、缩放行为与泛化能力:

  • 递归深度缩放(表 2):在 r=1,2,3r=1,2,3 三种递归轮次下,轻量和扩展版 RecursiveMAS 准确率持续提升,同时实现 1.2×1.2\times 至 2.4×2.4\times 的推理加速和 34.6%34.6\%–75.6%75.6\% 的 Token 缩减。文本递归基线则随轮次增加出现性能衰退和资源开销剧增。

  • 训练与推理的互补缩放(图 1 上):更深的训练轮次推动整体性能前沿上移,而更深的推理轮次可进一步榨取训练所得递归结构的额外收益,两者形成协同。

  • 多结构化对比(表 3):RecursiveMAS 在同等训练预算下,以平均 8.3% 的优势超越最强基线(包括 LoRA 微调单智能体、全参数 SFT、MoA、TextGrad 和 LoopLM)。

  • 跨模式泛化(图 1 下):在混合专家组模式中,RecursiveMAS 比最强单一专家平均提升 6.2%;在蒸馏模式中,以 1.5×1.5\times 速度优势将学习者性能提升 8.0%;在工具模式中,提升原工具调用智能体 4.8%。

  • 架构选择与消融(表 4、图 8):带残差的 2 层 RecursiveLink 在所有基准上表现最佳。隐式思维长度在约 80 步后性能饱和,显示仅需适度的隐状态预算即可实现有效协作。

  • 训练性价比(表 5):RecursiveMAS 的可训练参数仅占总模型的 0.31%,GPU 内存占用、训练成本均低于 LoRA 和全参数微调,但平均准确率最高,展现出极强的成本-性能均衡优势。

实践建议

对于希望在实际系统中部署 RecursiveMAS 或类似隐空间递归多智能体方案的工程师和研究者,以下建议值得关注:

  1. 优先在复杂推理密集型任务中部署:实验显示 RecursiveMAS 在 AIME、GPQA 等高难度推理任务上优势尤其明显(提升幅度高达 18.1%);在纯文本生成或简单 QA 上的收益可能相对有限,需权衡引入的架构复杂度。

  2. 合理设置递归轮次和隐状态长度:根据图 8,隐式思维长度在 64–80 步即可达到性能平台,过长的隐状态不会带来显著额外增益。递归轮次方面,r=3r=3 在多数基准上表现最优,但具体任务可在 2–4 轮间搜索最优值。

  3. 选择适当的低资源训练策略:RecursiveMAS 仅训练 0.31% 的参数即可获得超越全参数微调的性能;对于需要快速迭代、或计算预算有限的团队,可冻结所有模型骨干,仅微调 RecursiveLink。

  4. 谨慎处理模型异构性:论文中外部链接通过 W3W_3 层完成维度对齐,要求智能体均基于 Transformer 架构。若引入非 Transformer 模型或不同模态,恐怕需要重新设计投影层,或在预对齐阶段引入额外损耗。

  5. 监控并利用梯度稳定性:定理 4.1 保证 RecursiveLink 在递归训练中梯度范数接近 1;实践中可用梯度监控工具验证训练是否出现梯度膨胀,必要时应引入梯度裁剪以配合理论上维持的稳定信号。