别丢掉 BATON:基于智能体式子任务探索与过渡感知记忆的长时程机器人操作

Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory

arXiv: 2608.16889v1

论文信息

标题: Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory

作者: Bingxin Xu, Yuzhang Shang, Emilio Ferrara

发布日期: 2026-08-17

arXiv ID: 2608.16889v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:论文要解决长视界机器人操作中 “单技能可靠、链条失败” 的问题:错误在阶段之间累积,且一个子任务的执行方式会约束后续子任务。
  • 核心方法:提出 Baton,以子任务为探索单位,通过分层探索与 “过渡感知记忆” 显式管理三类过渡——VLA 调用、子任务交接、前瞻策略选择,全程不更新任何模型参数。
  • 关键结果:在 RoboMemArena 基准上,Baton 平均任务成功率为 57.7%、累积成功率为 78.8%,分别比最强已报告系统 FrameSamp+Modul 高 11.6 和 14.9 个百分点(表 1)。
  • 主要局限:方法依赖长任务可被分解为可检查的交接边界;在 Transferring 类别上仍落后于 FrameSamp+Modul,作者将部分原因归为某个任务在评估种子上的 BDDL 场景定义缺陷(见第 4 节实验部分)。
  • 适合读者:从事机器人操作、视觉语言动作模型、LLM 编码代理、长视界任务规划与记忆机制研究的技术人员和研究者。

论文背景和研究动机

当前 VLA 与 WAM 在单个接触密集技能上越来越强,但长视界任务不是单技能的简单拼接。论文指出,端到端策略通常从精心整理的初始状态学习,部署到链式任务时,每一阶段都从前一阶段的终止状态开始,分布漂移不断累积;同时,一个子任务即使局部成功,也可能因为抓取方式、物体姿态或夹具状态,使后继子任务无法执行。

Harness VLA 给出了一条吸引人的路线:冻结 VLA,让 LLM 编码代理在自由空间中用解析原语移动,仅在接触密集段调用 VLA。短视界任务上这一方案已经可靠,但直接拉到长视界会出现两个问题。第一,整体任务探索成本按 TKT^K 量级增长,而且失败无法归因到具体阶段;第二,现有系统缺乏对 “过渡” 的表示:VLA 原语有退出条件,却没有进入条件;前一个子任务的残留状态会扰动后一个子任务的入口,前一个子任务的局部成功形式也可能无法被后继使用。

论文的核心判断是:长视界失败不是单个技能不够好,而是阶段之间的过渡没有被当作一等对象处理。这也解释了为什么回顾性记忆不完全够用:表 1 中 ground-truth oracle 仍只把 64.8% CSR 转换为 46.1% TSR。

核心方法和技术细节

Baton 保持 Harness VLA 的底层结构:一个 LLM 代理控制解析原语,并在接触密集处调用冻结 VLA。任何提供同样调用接口的接触密集策略都可替换 VLA,但论文统一写作 VLA。系统没有任何参数更新,所有角色由同一个 LLM 代理扮演。

分层子任务探索

给定长视界指令,Baton 先把它分解为子任务和交接边界:

u1▹σ1,2▹u2▹σ2,3▹⋯▹σK−1,K▹uKu_1 \triangleright \sigma_{1,2} \triangleright u_2 \triangleright \sigma_{2,3} \triangleright \cdots \triangleright \sigma_{K-1,K} \triangleright u_K

这样探索被限定在短视界区间。每个子任务在廉价的短视界环境中单独试错,失败写入失败记忆,首次成功被整理为粗轨迹,包含分级路径点、就绪条件、VLA 调用和终止检查。单个子任务平均 TT 次成功后,KK 阶段的成本约为 KTK T,而不是 TKT^K;失败也可以归因到具名阶段。

随后系统做层级组合:先验证相邻子任务,再把已验证单元继续向外组合,直到构成完整任务。组合阶段不新增技能,只有交接处发生问题时才写入边界记忆。作者强调,每一轮只检查新形成的边界,因此该阶段成本也保持加性。

过渡感知记忆

这是 Baton 的核心。记忆不再只存节点,也存边;三类过渡各有一种条目。

调用过渡发生在子任务内部。Baton 在 uku_k 中显式写下:

uk=ak▹σkact▹vku_k = a_k \triangleright \sigma^{\mathrm{act}}_k \triangleright v_k

其中 σkact\sigma^{\mathrm{act}}_k 是一个条件化过渡:只有腕部相机确认场景就绪,verifier 才允许调用 VLA。例如打开微波炉门时,两个夹爪必须出现在把手两侧;放入容器时,夹爪两侧必须出现在容器边缘内。失败时先用解析原语重新分级,不让未就绪状态进入接触段。

交接过渡处理前驱子任务留下的残留。边界记录 entry condition,例如后继需要夹具恢复竖直、打开且位于罐上方。verifier 在边界处用解析原语恢复状态,而不是重新探索某个技能。这个条件存在边上而非节点上,因为哪些残留重要既取决于前驱,也取决于后继。

前瞻过渡从后向前传递约束。同一子任务 “拿起番茄罐头” 可能有侧抓、浅边捏取、深顶抓等竞争策略。哪一个正确不是当前子任务的属性,而是由剩余计划决定。scheduler 读取 P>k=⟨uk+1,…,uK⟩\mathcal{P}_{>k} = \langle u_{k+1}, \dots, u_K \rangle,检索满足后继约束的策略;没有合适策略时,把约束加入目标,重新交给 Explorer。

记忆最终以图结构组织:节点存失败条目和粗轨迹,边存 entry condition 与执行约束,合起来称为交接合同。竞争策略不会被合并删除,而是保留并注释适用边界;边按过渡类型而非任务索引,因此同一 “放入窄口容器” 的约束可跨任务复用。

创新点和贡献

论文的主要贡献不是发明 LoRA、新 VLA 或新规划器,而是把 “过渡” 从副产物提升为独立对象。在此之前,Harness VLA 只把成功策略写入任务级记忆,未记录调用时刻和交接约束;HiMe 这类记忆系统甚至会删除冲突策略来保持一致性,而 Baton 反而保留竞争策略,因为它认为哪一个策略正确写在边上,而不是节点上。

第二个贡献是探索成本结构。作者用数量级分析说明整体探索是 TKT^K,而分阶段探索是 KTK T。这不等同于任何实验数字,但实验对比展示了两种预算支出的差异:同样在 seed 50 上探索,whole-task Harness VLA 在遮挡类别上没有解决任何任务,平均 TSR 仅为 26.9%;Baton 达到 57.7%(表 1)。

第三个贡献是语言化合同的可检查性。交接条件不是训练出来的价值函数,而是可以在执行时用视觉验证、在失败后改写并写回的句子。这让记忆可审计、可迁移,也让失败能写回过渡而不是浪费在整条轨迹上。

实验结果分析

表 1 显示,Baton 在平均 TSR 和 CSR 上均优于所有已报告系统和自行运行的 Harness VLA。值得注意的是,所有方法 CSR 都明显高于 TSR,说明阶段完成率高于整体任务完成率。作者据此认为,困难集中在阶段之间的衔接,而不是单个技能内部。

类别差异更清楚。Baton 在 Occlusion 上达到 50.0% TSR,而 FrameSamp+Modul 为 39.1%,whole-task Harness VLA 为 0.0%;在 Counting 上 Baton 为 68.8%,FrameSamp+Modul 为 31.4%。Sequence 类也略有领先。Baton 的平均 TSR/CSR 比约 73%,论文称之为表中最高转换比,可解释为剩余失败更少集中在边界处。

唯一落后的是 Transferring,Baton TSR 39.4% 对 FrameSamp+Modul 63.8%。作者认为这主要是评估 artifact:四个 transferring 任务中有一个任务的 BDDL 场景定义在 held-out seeds 上有缺陷,导致该任务所有 rollout 得零分。论文没有报告剔除该任务后的修正值,因此这一类别结论应保持谨慎。

实践建议

对构建长视界机器人操作或 VLA 代理系统的团队,可以借鉴以下思路:

首先,把长任务分解到可检查边界。不要只在语义上分解,还要让每个交接点具备视觉或符号条件。接口越可验证,后续的失败定位与记忆复用越容易。

其次,给接触密集策略增加进入条件,而不是只关心退出条件。调用 VLA 前用实时相机或状态检查确认夹具姿态、物体位置、容器边界等,避免把分布外状态送进策略。

第三,保留同一子任务的多种执行策略。不要在记忆库里只用第一个成功策略覆盖该技能;应根据剩余计划选择满足后继约束的策略。记忆索引不应只看当前指令,还要看接下来要做什么。

第四,失败写回边界而非任务。若一次执行在交接处违反了合同,就把违规记录到对应的 transfer type 或边界上,这样后续任务如果经过相同过渡,可以直接继承教训,而不是重新探索。

最后,评估时同时关注 TSR 与 CSR 的差距。如果 CSR 明显高于 TSR,说明失败集中在交接处;可以按边界类型记录违规统计,决定下一步是增加视觉验证、调整 entry condition,还是引入新的竞争策略。