SpatialClaw:重新思考代理空间推理的动作接口

SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

arXiv: 2606.13673v1

论文信息

标题: SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

作者: Seokju Cho, Ryo Hachiuma, Abhishek Badki, et al.

发布日期: 2026-06-11

arXiv ID: 2606.13673v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决什么 现有视觉‑语言模型(VLM)在三维/四维空间推理(物体位置、运动、多视角关系)上仍很薄弱,工具增强的代理虽能调用感知模块,但受限于僵硬的动作接口(单次代码执行或结构化工具调用),难以完成灵活、多步的几何推理。

  • 核心方法:用什么办法解决 提出 SpatialClaw,一种无需额外训练的框架,将 Python 代码本身作为动作接口。它在一个持久化内核中预载图像和感知/几何原语,让 VLM 代理每步写一个可执行单元,根据上一步的文本、变量和可视化图像逐步组合、检查、修正推理。

  • 关键结果:最重要的一个结论或数字 在 20 个空间推理基准上,SpatialClaw 平均准确率达 59.9%,比最近的同类空间代理(SpaceTools)高出 +11.2 个百分点(图 1),且在两个模型家族的六种 VLM 骨干上均保持增益,未做任何基准或模型特化。

  • 主要局限:作者自己承认的、或方法本身固有的限制 主要瓶颈是底层感知模型(VLM、深度估计、分割)的质量,以及代理在几何推理中处理三维坐标、距离、角度时仍频繁出错;工具选择与覆盖不足也导致部分失败(图 7)。

  • 适合读者:什么背景的人值得读 对视觉‑语言模型、具身智能、多模态代理以及需要复杂空间理解(机器人、自动驾驶、增强现实)的研究者和工程师非常有参考价值,特别是关注如何通过接口设计释放 VLM 空间推理能力的读者。


论文背景和研究动机

空间推理——判断物体在三维空间中的位置、相互关系与运动——始终是视觉‑语言模型(VLM)的短板。即使最先进的模型,回答 “汽车是否正朝向相机?”“哪件物体离桌子最近?” 这类问题仍很吃力,因为它们需要将深度、相机位姿、时间对应等多源证据组合成连贯的几何论证,而 VLM 难以仅从像素可靠地完成这一结构化分析。

常见的补救思路是为 VLM 配备专业感知工具(检测器、分割器、深度估计器等)。然而,工具增强代理的能力不仅取决于工具本身,更取决于调用这些工具的动作接口。现有工作主要采用两种接口:

  • 单次代码执行:代理一次性编写完整 Python 程序并运行,能够灵活调用工具,但必须在看到任何中间结果(掩膜、深度图、轨迹)之前就敲定全部分析策略。
  • 结构化工具调用:通过 JSON/XML 等模式按名称选择工具、填写类型化参数,接口清晰但难以按需组合工具输出,尤其无法在测试时动态形成如 SciPy 空间索引、RANSAC 平面拟合等即时计算。

这两种设计在面对复杂、开放式 3D/4D 空间推理时都存在灵活性不足的问题。SpatialClaw 的出发点正是:代码不应只是一次性程序或预定义工具的调度接口,而应成为代理排序、组合和诊断感知工具的编排空间。


核心方法和技术细节

SpatialClaw 的核心是将 Python 代码作为动作接口,并通过两个关键组件实现:持久化内核工作区和五阶段代理循环。

持久化内核工作区

为每个样本创建一个独立的、有状态的 Python 内核,预加载输入帧和一系列原语:

  1. 感知工具:Reconstruct(基于 Depth Anything 3 输出深度、相机内参/外参和稠密点云)以及 SAM3(通过文本、点或框进行图像/视频分割)。
  2. 科学计算库:NumPy、SciPy、Matplotlib,使代理可随时调用 KDTree、向量范数、点积、RANSAC 等几何运算。
  3. 辅助工具模块:包括掩膜操作、几何计算、可视化绘制等轻量包装(见附录 G)。

内核中还提供 show() 函数,允许代理将掩膜、深度图或绘制的图示直接注入上下文进行目视检查;vlm.locate() 和 vlm.ask_with_thinking() 则分别调用独立的 VLM 会话实现视觉定位和推理。

关键设计是状态持久化:每一步产生的所有变量(分割掩膜、深度数组、相机几何体)在后续步骤中均可直接访问、组合或修正,无需重新计算。

空间推理循环:编码、检查与修正

围绕内核,SpatialClaw 构建了一个五阶段循环(图 3):

  1. 规划:在一个与主代理隔离的 LLM 会话中,根据问题和工具文档(不看图像)生成分析计划,计划会注入主代理的系统提示中。
  2. 代码生成:主 VLM 代理根据问题、计划、执行历史和上一步反馈,生成包含 purpose、reasoning、next goal 和 code 的结构化响应。
  3. 代码执行:静态 AST 检查拒绝不安全代码后,代码单元在内核中执行。
  4. 反馈组装:收集标准输出、异常回溯、新变量摘要和通过 show() 注册的图像,将其附加到下一轮上下文。
  5. 答案提交:代理通过 ReturnAnswer() 提交答案;若答案格式合规,循环终止。

系统提示编码了一般空间推理原则(如优先使用度量计算、多证据交叉验证、检查数值量级等),对所有基准和骨干模型完全复用,无任何基准或模型特化。


创新点和贡献

  1. 重新思考空间代理的动作接口 首次系统性地对比了三种动作接口(无工具、单次代码、结构化工具调用),并提出以持久 Python 内核为中介的 “代码作为动作接口” 范式。它让每步都成为组合感知输出与数值原语、检查中间状态并修正分析的机会(图 2)。

  2. 训练无关、跨模型泛化的设计 SpatialClaw 不修改任何 VLM 参数,也不进行微调。它在两个模型家族(Qwen、Gemma)的六种骨干(27B–397B)上均带来一致的提升(表 1),证实了接口本身而非模型特化推动了增益。

  3. 大规模实证验证 在 20 个基准(涵盖静态/动态、单图/多视角/视频、一般空间理解等)上全面评估,并提供了与 SpaceTools、pySpatial、VADAR 等最新空间代理的对比(表 3),平均准确率提升超过 11 个百分点。

  4. 揭示接口增益的来源 通过 LLM-as-Judge 的归因分析(图 6)发现,超过 50% 的胜例归因于代码组合(在一个连贯程序中链式调用多个工具),19.5% 归因于控制流(条件分支或循环)。这直接验证了组合灵活性是超越结构化接口的主要原因。


实验结果分析

主要结果

在全部 20 个基准上,SpatialClaw 的平均准确率达到 59.9%,比结构化接口的 SpaceTools 高出 +11.2 个百分点,比单次代码的 pySpatial 高出 +12.1 个百分点(表 3)。增益在视频/4D 推理(如 DSI‑Bench 平均提升 +18.3pp)和多视角推理(如 MindCube 平均提升 +14.3pp)上尤为突出,这正是最需要跨帧、跨视点链式几何计算的领域。

即使移除所有预定义工具包,仅保留 numpy、scipy 并移除感知工具,SpatialClaw 仍比无工具基线高出 +2.7pp(表 4),显示出代码作为接口本身的独立价值。

接口消融对比

控制同一工具集条件下,仅改变动作接口格式(表 2):

  • 无工具推理(纯语言):53.4%
  • 单次代码执行:55.2%
  • 结构化工具调用:56.7%
  • SpatialClaw(逐步代码):59.9%

逐步接口在所有类别上均最优,验证了观察中间反馈并动态调整推理的必要性。

工具使用模式分析

对基元(NumPy、SciPy 操作)使用频率按元类别统计(图 5):距离类问题高频使用 KDTree 和向量范数,方向类问题则大量运用点积和角度运算。这种适应性组合是代理自发形成的,无任何类别特定提示,表明代码接口允许根据问题语义动态选择最合适的几何原语。

失败模式分析

对 1000 个失败案例的 LLM 判断(图 7)表明,几何推理错误(处理 3D 坐标、距离、角度等)是主要失败模式;其次是由 VLM 幻觉或工具限制导致的感知错误,以及工具选择/覆盖不足。这表明未来增强感知质量和几何操作的编码能力将是重点方向。


实践建议

SpatialClaw 的设计为构建高性能空间推理代理提供了明确的工程指引:

  1. 优先选择逐步代码接口而非一次性程序或固定工具模式 无论是自主机器人、AR 辅助还是自动驾驶仿真,需要空间推理的系统都应允许代理在获得深度图、分割掩膜等中间证据后,再决定下一步计算。实现上,可以为每个任务维持一个轻量内核,确保状态持久化。

  2. 工具集应以通用科学计算库为核心,而非过度封装 API 预定义工具固然方便,但真正灵活的推理来自 numpy、scipy 的组合——工作中发现即使去掉所有定制工具包,仅靠科学计算库也能维持性能(表 4)。建议代理框架预置这些库,并鼓励模型自行组合,而非只暴露少量高层 API。

  3. 将反馈回路与可视化嵌入代理循环 每步执行后立刻将变量摘要和 matplotlib 渲染的图像注入上下文,能让 VLM 直观发现错误掩膜或不合理轨迹。工程中应支持类似 show() 的机制,并配合 AST 安全检查与异常反馈,提高纠错鲁棒性。

  4. 跨模型复用的统一提示模板 SpatialClaw 的系统提示仅包含一般空间推理原则(优先度量单位、多证据交叉验证等),并未针对任何基准或模型调整,却能在六种 VLM 上稳定获益。实践中可预先设计一套领域通用的推理规范,避免为每个任务或模型手工编写专门提示。

  5. 关注感知质量与几何编码能力 失败案例中感知错误和几何推理错误是主要瓶颈。部署时建议选用更强的深度估计、分割模型,同时对于几何计算代码可采用断言检查和单元测试风格的环境自检,防止静默的坐标系错误。