面向安全机器人操作的具备障碍物感知安全约束框架的编码智能体

Coding Agents with an Obstacle-Aware Harness for Safe Robot Manipulation

arXiv: 2609.20822v1

论文信息

标题: Coding Agents with an Obstacle-Aware Harness for Safe Robot Manipulation

作者: Bingxin Xu, Yuzhang Shang, Zhen Dong, et al.

发布日期: 2026-09-17

arXiv ID: 2609.20822v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文研究 “编码智能体” 驱动的机器人操作在安全约束下是否可靠,即在完成任务的同时避免触碰障碍物。
  • 核心方法:提出 SafeHarness,把操作分解为自由空间路线阶段和接触执行阶段,分别增加障碍物感知的路线规划与接触执行两类机制。
  • 关键结果:在 SafeLIBERO 基准上,SafeHarness(GPT-6) 达到 71.9% 任务成功率和 87.5% 碰撞避免率,两项均高于此前方法 AEGIS(见表 1)。
  • 主要局限:论文遵循 SafeLIBERO 协议,只处理单个轴对齐障碍物;接触侧测试面向平行爪夹持器;评估是仿真优先。
  • 适合读者:机器人操作、VLA/编码智能体、机器人安全控制的研究者和工程师,尤其是关注 LLM 智能体安全落地的人。

论文背景和研究动机

编码智能体已经成为机器人操作的一种重要范式:语言模型写出机器人控制器程序,程序本身即策略,无需机器人专属训练。此前工作如 Code as Policies 建立了这一模式,后续工作则让编码智能体在失败后重写代码、维护技能库、增加测试时计算。但论文指出,现有编码智能体机器人操作研究几乎只评估 “目标是否完成”,从不测量机器人途中碰到了什么。

这种缺失并非小事。杂乱环境中的一次碰撞可能损坏硬件、伤害人员或破坏财产。论文引入 SafeLIBERO 基准,在该基准中每个任务不光有操作目标,还有一个不能触碰的障碍物。作者发现,编码智能体能完成任务,但在多数情况下会撞上障碍物。问题不在感知:智能体通常能正确识别障碍物;也不在指令:即使提示词已经写明 “不能触碰障碍物”,智能体只是复述约束,随后仍然违反它。

作者将失败归因于规划阶段的安全优先级缺失。具体地,路线阶段缺少 “清障路径” 概念,也不会在路线中途不可行时重规划;接触阶段则没有意识到接触动作本身也受障碍物约束。作者推测,这与长上下文场景中模型对早期指令的遗忘有关:一个几百步任务中,写在第零步的安全约束,到关键执行步时已经被大量观测和工具调用稀释。

核心方法和技术细节

SafeHarness 的核心设计是:把 “安全约束” 从提示词里拿出来,放进训练自由、无梯度的 harness 中,使其在每一步被外部机制重新施加。论文将任务按接触事件切成若干阶段,每个阶段又分成自由空间路线和接触执行两部分;两个 harness 分别负责这两部分。

障碍物感知的路线规划先做视觉 grounding:用分割模型 SAM-3 把目标和障碍物表示为轴对齐包围盒。语言模型根据这些盒子提出一条由路径点组成的候选路线,要求终点落在目标处,且路线不能穿过障碍物盒。候选路线并非直接执行,而是先由语言模型外部的校验器检查:抓持器以及已抓取物体是否侵入障碍物盒。只有通过校验的路线才会被释放执行。若执行中机器人卡住或接近障碍物比预期更近,执行会暂停,并从停止位姿重新规划。此外,为控制上下文长度,论文限制了路线规划图像的读取次数。

障碍物感知的接触执行处理路线终点以下的抓取/释放动作。接触动作被锚定在目标附近,无法像路线那样绕开障碍物。SafeHarness 对每次接触先做障碍物与目标的邻接测试:若障碍物不邻接,则默认策略可用;若邻接,则从能保持间隙的方向接近目标,并优先选择离障碍物最远的方向。如果这些方向都不满足,则调整手腕旋转方向,使抓持器开合轴与障碍物相切,并采取垂直下降方式。

两个组件在每个阶段各运行一次。因此,一个包含两个子目标的长程任务会重复执行两次完整的 “规划—校验—执行—接触” 循环。

创新点和贡献

这篇论文的主要贡献不在于提出新的 VLA 模型,而在于把安全从一个训练目标或后置过滤器,变成一个编码智能体 harness 中的一等约束。

第一,它将安全约束嵌入 “运动产生之前” 的决策。AEGIS 等障碍物过滤层位于策略之后,只能否决已经产生的指令,无法提出更好的路线或抓取方向。SafeHarness 则在路线和接触位置尚未确定时就把障碍物纳入选择。

第二,它不修改冻结 VLA,也不需要梯度训练。论文复用了 Harness VLA 的编码智能体循环、冻结的 π0.5\pi_{0.5} 检查点和 LIBERO 技能记忆,只增加两个 harness。

第三,它提供了一种针对长上下文安全约束失效的工程解决方案。作者认为,必须持续有效的约束不应依赖写在对话开头的句子,而应由无状态的校验工具在每次运动前重新施加。这个观察对机器人以外的 LLM 智能体安全设计也有借鉴意义。

实验结果分析

论文在 SafeLIBERO 的全部 32 个任务上、每个任务 10 个随机种子进行评估。表 1 显示,SafeHarness(GPT-6) 的平均任务成功率(TSR)为 71.9%,碰撞避免率(CAR)为 87.5%;AEGIS 为 67.5% 和 68.9%;冻结策略 π0.5\pi_{0.5} 为 57.8% 和 17.1%;OpenVLA-OFT 为 26.2% 和 5.7%。在该实验设置下,SafeHarness 两项指标都高于 AEGIS,并且不是以牺牲成功率为代价换取安全。

表 2 的消融实验进一步定位了安全提升来源。GPT-6 的 Model + Skills 基线只有 31.0% TSR 和 59.0% CAR;加入两个 harness 后,同一智能体达到 71.9% TSR 和 87.5% CAR,分别约为原来的 2.3 倍和 1.5 倍。论文认为,这支持 “安全来自 harness 而非模型本身” 的结论。

分 Level 看,无 harness 的 Model + Skills 在两个层级间 CAR 差异明显,而 SafeHarness 让 Level I 和 Level II 的 CAR 都稳定在 85.0% 以上。论文指出,这表明障碍物感知 harness 减少了安全水平对模型规模的依赖。但任务成功率在 Level II 仍低于 Level I,作者推测原因是绕行路线拉长了轨迹,在固定步数预算下留下更少完成裕度。

定性分析中,论文给出了同一场景的对比:任务是把橙汁放入篮子且不碰酒瓶。无 SafeHarness 的智能体在推理中提到了酒瓶,但随后选择最短直线路径,从瓶身穿过;SafeHarness 则规划了一条绕行路线,完成任务且未碰撞。该示例展示了 “读过约束” 和 “执行时遵守约束” 之间的差距。

实践建议

对于希望在编码智能体或 VLA 操作系统中加入安全约束的团队,可以从这篇论文中提炼几条可操作思路。

第一,不要把长期安全约束只放在提示词里。如果约束必须在第 300 步仍然有效,就应当在第 300 步由外部校验器重新施加,而不是依赖模型记住第 0 步的句子。校验工具应当是无状态的:不依赖对话历史,不给模型增加记忆负担。

第二,在运动执行前做路线校验,而不是执行后过滤。先对自由空间路线做 “计划—校验—执行”,只有通过包围盒检查的路线才执行;执行中一旦发现卡住或过近,就停止并从当前位置重规划。这样安全约束进入决策阶段,而不是等错误动作出现后再补救。

第三,把接触动作和自由空间路线分开对待。路线可以绕行,接触动作则被目标位置约束住。因此接触阶段应单独做障碍物邻接测试,并据此选择抓取/释放方向和手腕位姿,而不是沿用默认策略。

第四,安全指标必须与任务成功率一起上报。论文显示,许多基线在任务成功上表现尚可,但碰撞避免率很低。如果只报告成功率,安全退化会被完全掩盖。

落地时需要注意的是,论文的障碍物模型只支持单个轴对齐盒,接触侧选择针对平行爪夹持器设计,评估也主要在仿真中进行。多障碍物、复杂形状末端执行器以及真机部署前,仍需要更丰富的规划器和更多实验验证。