LLM-in-Sandbox 激发通用智能体智能

LLM-in-Sandbox Elicits General Agentic Intelligence

arXiv: 2601.16206v1

论文信息

标题: LLM-in-Sandbox Elicits General Agentic Intelligence

作者: Daixuan Cheng, Shaohan Huang, Yuxian Gu, et al.

发布日期: 2026-01-22

arXiv ID: 2601.16206v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:论文探索一种新范式——让大语言模型(LLM)在一个代码沙盒(虚拟计算机)中自主探索,以期在非代码领域(数学、物理、化学等)激发通用智能,解决纯文本生成难以应对的复杂约束和长上下文任务。
  • 核心方法:提供一个仅含基本 Python 环境的轻量沙盒,赋予 LLM 执行 bash 命令、文件编辑和外部资源访问的能力;模型通过多轮交互(ReAct 框架)自由探索解决方案。进一步提出 LLM-in-Sandbox 强化学习(LLM-in-Sandbox-RL),用通用上下文任务数据训练模型有效利用沙盒。
  • 关键结果:在无需额外训练的情况下,强 agentic 模型在六个非代码领域均获性能提升,例如 Qwen3-Coder 在数学任务上提升 +24.2%(见表 2)。经过 LLM-in-Sandbox-RL 训练后,原先在沙盒中表现差的小模型 Qwen3-4B-Instruct 在数学上提升 +14.8%(见表 6),且沙盒模式下训练的模型在普通 LLM 模式下也有所增强。
  • 主要局限:弱模型在没有专门训练时,在沙盒中反而性能下降;沙盒生成的多媒体产物(视频、音乐)质量有限且简单;训练数据仅限通用上下文任务,未涉及更复杂的多模态场景。
  • 适合读者:从事 LLM 智能体、工具使用、强化学习、系统效率的研究者和工程师,以及关注通用人工智能范式的读者。

论文背景和研究动机

近年来,解锁大语言模型能力的范式不断演进:从上下文学习(in-context learning)到思维链提示(chain-of-thought),再到让模型调用多种工具的 agentic 框架。沿着这条路径,一个自然的问题是:如何进一步释放 LLM 的潜能?本文提出的 LLM-in-Sandbox 正是对此的回应。

计算机是人类历史上最通用的平台,其核心能力可归结为三类元能力:外部资源访问(互联网)、文件管理、以及代码执行。如果把 LLM 与这样一个虚拟计算机结合,它或许能突破纯文本生成的限制,完成过去难以处理的任务。论文观察到,当前代码 agent(如 Claude Code)所用沙盒主要用于软件工程,但其潜力远不止编码——几乎任何任务都可以在计算机中完成。因此,论文假设:将 LLM 放入一个通用代码沙盒,有望激发出跨领域的通用智能。

核心方法和技术细节

轻量通用沙盒设计

与软件工程任务中为每个项目定制复杂环境的做法不同,LLM-in-Sandbox 采用最小化通用设计:沙盒仅预装 Python 解释器和少量科学计算库(如 NumPy、SciPy),域特定工具由模型自主安装。这带来两个优势:(1)通用性,一套环境适应所有任务;(2)可伸缩性,单一镜像仅约 1.1 GB,避免了数千个任务镜像带来的 TB 级存储开销(见表 12 左侧对比)。

沙盒提供三个基本工具:execute_bash 执行任意终端命令,str_replace_editor 进行文件查看、创建和编辑,以及 submit 表示任务完成。这种极简工具集蕴含了计算机的全部元能力。

基于探索的工作流

流程基于 ReAct 框架:模型接收任务提示,在沙盒内进行多步 “思考‑行动‑观察” 循环。一旦调用 submit 或达到最大轮次,交互结束。论文设计的关键在于鼓励探索的提示:系统提示明确要求模型借助程序执行导出答案,避免在自然语言中硬编码结果,并强调沙盒是安全的隔离环境,可以大胆尝试各种方法。

对于不同任务的输入输出,沙盒的文件系统被充分复用:长文档直接作为文件放入 /testbed/documents/,模型通过 shell 命令(如 grep、sed)或编写脚本进行局部处理和检索;最终答案统一输出到 /testbed/answer.txt,从而干净地分离探索过程和最终结果。

基于沙盒的强化学习(LLM-in-Sandbox-RL)

并非所有模型都能天生利用沙盒。弱小模型在沙盒中往往 “漫无目的” 地游走,性能反而下降。为此,论文提出 LLM-in-Sandbox-RL:使用通用、非 agentic 的上下文任务数据训练模型有效探索沙盒。具体做法是,将任务背景材料(如百科文章、学术论文)以文本文件形式放置在沙盒内,模型需要主动搜索和利用这些文件来完成任务。为了增加难度,引入多文档切割和无关干扰文件等策略。训练使用结果导向的奖励(如答案正确性、ROUGE‑L 分数),整个轨迹在沙盒交互中生成。这种方法仅需通用领域数据,避免了软件开发任务数据的收集难度,并利于扩展。

创新点和贡献

论文的贡献体现在三个层面。

范式创新:首次系统性地将通用代码沙盒作为 LLM 的默认推理环境,证明强 agentic 模型能够自发利用其元能力解决非编码任务,例如自动安装 RDKit 进行化学分子转换、用 grep 在超长文档中定位信息、编写迭代脚本满足严格指令格式(见论文第 2.4 节案例)。这为 LLM 应用提供了全新的架构思路。

训练方法创新:提出的 LLM-in-Sandbox-RL 仅用通用上下文数据训练沙盒探索技能,即可显著提升模型在沙盒中的表现,并且这种提升能泛化到多个未见领域(见表 6),甚至回传至普通 LLM 模式(见表 9)。这表明沙盒交互可以成为可迁移的基础能力,类似于一种 “元技能”。

系统效率分析与开源:论文从 token 消耗和吞吐量角度分析了部署可行性,发现在长上下文任务中,沙盒模式最多可减少 8 倍的 token 开销(如 Qwen3-4B 从 100K 降至 13K,见表 10),且环境 token 大量通过快速的 Prefill 处理,端到端吞吐量具有竞争力。同时,开源的 Python 包集成 vLLM 和 SGLang 等推理框架,降低了实际部署门槛。

实验结果分析

无训练下的通用智能激发

在数学、物理、化学、生物医学、长上下文理解和指令跟随六个领域中,多个前沿模型使用沙盒后性能普遍提高(见表 2)。其中,数学任务增幅尤为突出:GPT-5 提升 +10.1%,DeepSeek‑V3.2‑Thinking 提升 +7.9%。但弱模型如 Qwen3‑4B‑Instruct 在沙盒中反而下降,这为后续 RL 训练提供了动机。

对沙盒利用模式的分析显示,强模型在数学中的计算操作频率高达 43.4%,在化学中对外部资源的利用频率达 18.4%(图 2)。与之相比,弱模型的总平均轮次更多(23.7 vs 12.6),但三类能力的使用率均不到 3%(表 4),说明它们未能有效利用环境。

RL 训练带来的泛化增强

LLM-in-Sandbox-RL 使弱模型脱颖而出:Qwen3‑4B‑Instruct 在经过训练后,沙盒模式在数学上从 35.4 跃升至 50.2(+14.8),在生物医学上从 10.6 升至 14.4(+3.8,见表 6)。更重要的是,沙盒模式下训练的技能还能迁移到纯 LLM 模式:模型在生成文本时出现了更多结构化的分步推理和自我验证行为(见表 9),从而在没有沙盒的场合下也提高了准确度。对于已经较强的 Qwen3‑Coder 模型,训练也带来了全领域的小幅但一致的提升。

数据源影响

消融实验(表 7)比较了四种训练数据:纯数学数据、SWE 数据、通用上下文(提示中直接提供)和通用上下文(文件放入沙盒)。结果表明,通用上下文 + 沙盒设置取得了最好的总体效果,并且明显优于将上下文直接放入提示的变体。这验证了沙盒交互(主动探索文件)本身就是一种重要的学习信号,能够逼迫模型掌握信息检索和工具使用的策略。

计算效率与基础设施

在 token 消耗上,除长上下文任务外,沙盒模式通常需要更多 token,但长上下文的节省极为可观。整体聚合后,LLM-in-Sandbox 的总 token 量仅为纯 LLM 模式的 0.5–0.84 倍(见表 10)。在速度方面,由于大量 token 来自环境输出,通过高速 Prefill 处理,环境执行时间占比低于 4%,多数模型的查询吞吐量比持平或更快(表 11)。沙盒镜像仅 1.1 GB,单个容器内存消耗约 50 MB(空闲)至 200 MB(峰值),在一台 DGX 节点上运行 512 个并发沙盒也只占用约 5% 系统内存(表 12),证明该范式的工程可行性。

实践建议

  1. 构建轻量通用沙盒作为 LLM 默认后端:将 LLM 推向生产环境时,可考虑为每个请求分配一个最小化沙盒,仅预装通用 Python 环境,让模型自行安装依赖。这能统一处理计算密集型、长上下文和特殊格式要求等不同任务,避免为每类任务单独开发推理管道。

  2. 利用文件系统处理超长上下文:当文档超过模型窗口限制时,不要全部塞入 prompt,而是将其作为文件存入沙盒,通过 grep、sed 和自定义脚本让模型按需提取信息。实验表明这种方法在保持准确性的同时,可大幅减少 token 消耗(见表 10),降低成本。

  3. 采用 RL 赋予弱模型沙盒技能:如果使用的开源小模型在沙盒中表现不佳,可参考 LLM-in-Sandbox-RL 策略,用易于获取的通用上下文数据(如维基百科文章、书籍片段)构造基于文件探索的任务,结合结果奖励进行训练。该训练不仅提升沙盒模式能力,还能迁移到纯文本推理,性价比高。

  4. 部署时注意并发与内存规划:论文的数据显示,沙盒容器开销极低,可轻松在单个节点上运行数百个并发沙盒。建议结合 vLLM 或 SGLang 的高吞吐推理框架,并利用论文开源的 Python 包快速搭建服务,将 LLM 从文本生成器转化为可操作文件、执行代码的通用数字工作者。