重建、实践、走向真实:具身智能体的引导式自我改进

Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents

arXiv: 2610.02204v1

论文信息

标题: Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents

作者: Yen-Jen Wang, Haozhe Jiang, Shuying Deng, et al.

发布日期: 2026-10-01

arXiv ID: 2610.02204v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题: 如何让机器人执行系统在不更新模型权重的前提下,通过自主练习持续修复技能、改进提示,并跨任务复用这些改进。
  • 核心方法: RPG 三阶段框架:从离线数据集 “Reconstruct” 构建仿真练习任务;“Practice” 中用 Runtime Agent 与 Privileged Agent 并行执行、诊断失败并修订共享技能与系统提示;“Go Real” 校准并冻结后部署到真机。
  • 关键结果: 在 22 个操作任务的 held-out 初始条件上,RPG 成功率从第 1 轮的 28.6% 提升到第 15 轮的 95.0%,超过 ASPIRE 的 75.5% 和最佳 CaP-Agent0 的 60.0%(表 2)。
  • 主要局限: 作者承认 API 速率限制约束并行 rollout 效率;共享技能的重复修订和依赖关系使集成变复杂;毛巾折叠等变形物体任务在该设置下仍不可靠。
  • 适合读者: 研究具身智能、机器人学习、LLM 智能体、技能库管理及仿真到现实迁移的工程师和研究者。

论文背景和研究动机

大模型驱动的机器人在感知、任务推理和代码生成方面进步明显,但构建可靠机器人能力仍依赖大量人工:设计奖励、维护技能、集成感知与控制。论文关注的核心问题是:能否让机器人在给定离线数据后,通过仿真中的自主练习,持续改进一个可复用的执行系统,而不是训练神经网络权重。

这涉及 Code-as-Policy 与 Agent-as-Policy 两种路线的权衡。代码式策略执行高效、可组合,但程序逻辑和感知接口决定其鲁棒性;Agent 式策略让多模态模型留在控制环中,视觉和语义判断更灵活,但频繁调用模型使底层决策较慢。RPG 的目标是将可重复执行委托给符号技能代码,同时只在需要视觉或语义判断的环节使用多模态推理。为此,论文选择把 “共享技能库 + 系统提示” 作为持久改进的对象:它们可以在 episode 之间保留,并能被其他任务复用。

核心方法和技术细节

RPG 包含 Reconstruct、Practice、Go Real 三个阶段,整个过程中模型权重、任务定义和评估标准保持固定。

Reconstruct 由一个 Constructor Agent 从离线数据集中选择具备操作能力的源任务。论文使用 ABC 数据集,包含 193 个多样化任务。Constructor 观看视频和文字描述,识别可练习的操作能力,并在 MuJoCo 中为 YAM 双向臂机器人搭建仿真练习任务。这里的关键是:练习任务不必复现源任务的轨迹或场景,而是覆盖相同或类似的操作能力。例如,源任务 “整理太阳镜” 被重构为 “合上已经打开并装载好的眼镜盒”,前置操作被编码进初始状态(表 1)。每个任务配有固定的成功判定函数,形成练习集合后冻结,不再变化。

Practice 是自我改进循环。每一轮开始时,Runtime Agent 用当前系统对每个任务尝试 5 次;同时,Privileged Agent 在相同初始状态上运行,使用相同的模型和技能库,但额外接收模拟器真值状态,如物体名称、位姿、尺寸、速度和布料角点。二者调用同样的部署兼容技能,技能本身不接触特权状态。

失败分析由 Video Analyzer 完成。它比较 Runtime Agent、Privileged Agent 的执行记录和可用的数据集视频,结合采样帧、技能调用、感知结果、机器人状态和评估器指标,定位首个可观察失败并给出具体修改建议。Implementor 据此提出新技能、修改已有技能或修订系统提示。每个开发任务每轮最多产生一个候选修订,并且所有候选都从当前系统独立分支。

候选修订不能直接进入主系统。论文设置了跨任务验证门:在一个候选上运行所有 22 个任务的完整 Runtime Agent episode,要求平均成功率上升,且任何单任务成功率下降不超过 20 个百分点。公式为候选通过条件 ΔJ^>0\Delta \hat J > 0 且 min⁡iΔq^i≥−0.20\min_i \Delta \hat q_i \ge -0.20。通过候选再被逐步贪心合并,合并后的系统还要再次通过同样的跨任务验证,否则回滚。这套机制用于防止共享技能修订在改进某个任务时损害其他任务。

Go Real 阶段将最终系统做统一硬件校准,包括坐标标定、夹爪偏移和空夹爪开度,然后冻结。物理部署只使用 Runtime Agent,Privileged Agent 和 Video Analyzer 不参与。

创新点和贡献

论文的主要贡献有三方面。

第一,它把离线数据、仿真练习和系统提示/符号技能库改进串成完整闭环。与直接生成仿真任务或训练神经策略不同,RPG 利用已有任务视频构造相关练习环境,并把可执行技能和提示作为可跨任务保留的改进媒介。

第二,它引入 Privileged Agent 作为诊断参考,而不是用于训练。与 Asymmetric Actor-Critic 不同,这里特权信息只存在于诊断环节,部署端技能仍只使用真实机器人可获得的观测。这种不对称设计能让成功执行指导 Runtime Agent 修订,同时避免把特权依赖泄漏进可部署技能。

第三,它建立了针对共享系统的 “候选验证—合并—再验证” 机制。由于一个技能修改可能影响多个任务,论文不仅评估单候选,还评估合并后的综合系统,并采用回归阈值防止局部改进导致整体退化。这一设计在技能库可复用代码场景中具有实际工程价值。

实验结果分析

在主模拟评测中,RPG 使用 Gemini 3.8 Flash 做在线执行,使用 Fable 5.1 做离线代码修订。22 个任务每个 10 个 held-out 种子,共 220 个 episode。第 1 轮保存系统成功 63/220(28.6%),第 15 轮达到 209/220(95.0%)(表 2、图 4A)。同表显示,ASPIRE 为 166/220(75.5%),CaP-Agent0 使用 GPT-6 Astra Pro 时为 132/220(60.0%),使用 Gemini 3.8 Flash 时为 107/220(48.6%),RATs 为 92/220(41.8%)。在该实验设置下,RPG 对最佳基线的优势主要来自夹具插入、瓶子放置等难任务;其 11 个失败中有 7 个发生在毛巾折叠。

改进曲线不是严格单调的。第 3 轮到第 4 轮成功率从 43.2% 跳到 73.6%,这一轮没有技能代码修改,而是系统提示引入了有界感知–行动循环和交互预算跟踪(图 4A、正文第 IV-B 节)。此后到第 15 轮又提升 21.4 个百分点,主要来自 60 次技能修改。论文还在图 4B 统计了 23 个新增技能和 66 次技能修改,提示主要在 1–4 轮被修订。

消融实验回答了诊断输入的作用。五轮消融中,完整 RPG 达到 172/220(78.2%);去掉 Video Analyzer 后为 114/220(51.8%);去掉 Privileged Agent 后为 112/220(50.9%);两者都去掉同样为 112/220(50.9%)(表 3)。单一组件移除后性能接近双移除结果,说明两个诊断来源在功能上是互补的。

技能库本身是否有效?论文做了隔离比较:固定 runtime 模型、提示和观察预算,只替换技能库。在四个任务的 40 个 paired 初始化上,修订前为 26/40(65.0%),修订后为 37/40(92.5%)(表 4)。其分析指出,原先 lift 技能报告了命令位移而非实际位移,修订后加入实际位移验证、抓持保持和物体水平检查。该修复对目标任务有效,但论文也发现修订库在 ABC 排序的附加测试中从 6/6 略降到 5/6,作者据此强调共享技能修订必须通过完整任务级验证,不能只看技能级调用结果。

物理实验在 YAM 机器人上进行三个任务,每个方法每任务 10 次。RPG 完成全部 30/30 次;CaP-Agent0 在 Gemini 3.8 Flash 下总体完整任务成功明显更低,GPT-6 Astra Pro 下 “装球并关抽屉” 为 4/10,“转移碗” 为 1/10,“折毛巾” 为 9/10(表 5)。RPG 的优势在两步任务上最大。作者推测,改进共享执行系统带来的收益可能大于仅替换 runtime 模型。另有五项零样本物理部署定性展示,没有纳入定量对比。

实践建议

对于构建面向真实机器人的 LLM 智能体系统,RPG 有几条可操作的工程经验。

首先,把 “可执行技能” 和 “如何使用技能的提示” 分开维护。在 RPG 中,第 4 轮的大幅提升来自提示行为变化,而后续提升更多来自技能修复。将策略性知识写进提示、将可重复操作封装为符号技能,能让系统在不同抽象级别上独立演进。

其次,在仿真中引入一个特权诊断 Agent 来辅助失败定位,但严格禁止特权状态进入部署技能。这样的不对称设计适合仿真到现实迁移:诊断侧可以用更多信息定位问题,部署侧不会因此依赖不可获得的真值。类似设计也可用于其他拥有仿真器的具身系统。

第三,对共享库的任何修订都应做跨任务回归,而不是只验证目标任务。论文的候选门和合并后再验证机制能降低共享代码修改带来的隐性损害。对于任务数量较多的系统,可以设置开发任务、验证任务和反馈隔离任务,区分哪些任务可以提供改进信号,哪些只用于检查泛化和回归。

第四,部署前冻结系统并只做统一校准。RPG 的 30 次物理试验在冻结后完成,除坐标标定和夹爪偏移外没有对象或任务特定调参。这提示在仿真中尽可能完成行为修订,把真机环节留给必要的传感器和机械标定,有助于减少物理调试的人工负担。

最后,需要在实践中优先处理变形物体和长时序操作。论文中毛巾折叠的硬标准在 15 轮内始终为 0/10(附录 F、表 9),说明当前以刚性物体技能为核心的符号库不能直接覆盖柔软材料的状态估计与接触保持。对于涉及布、绳或柔性容器的场景,应及早引入更明确的变形状态表征,而不是只依赖现有抓取、放置和路径验证技能。