面向自主机器人策略改进的技能空间射击
Skill-Space Shooting for Autonomous Robot Policy Improvement
论文信息
标题: Skill-Space Shooting for Autonomous Robot Policy Improvement
作者: Zihang Rui, Renhao Wang, Haoxu Huang, et al.
发布日期: 2026-09-29
arXiv ID: 2609.38178v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决机器人在部署后如何不依赖持续人类示范,而是自主从执行失败中改进任务策略的问题。
- 核心方法:用价值模型检测可能失败,用基础模型在可重用短程技能库中选择纠正技能,仅保留被验证成功的修复段,以 DAgger 式模仿学习更新任务策略。
- 关键结果:在四个真实机器人任务中,无辅助策略的最高观察 plateau 均高于所有基线;Drawer 任务从初始 0/20 成功,经过一轮更新达到 7/20(论文第 4.1 节、表 1)。
- 主要局限:仍需要人工提供初始任务与技能演示,训练采集时场景需要人工重置;失败检测器需要按任务训练。
- 适合读者:关注机器人学习、模仿学习、基础模型与具身智能、以及自改进策略系统的研究人员与工程师。
论文背景和研究动机
机器人从初始训练部署后,面对新物体、场景变化和微小执行误差会暴露弱点。仅靠更多尝试不会自动产生改进经验,因为策略可能重复同样错误。强化学习可以利用奖励进行改进,但在长时程、稀疏奖励任务下,物理探索成本可能过高。交互式模仿学习如 DAgger 需要人类在策略实际访问的状态提供纠正,随任务扩展会持续增加监督成本。近年来 agentic 机器人系统让基础模型组合已学技能完成任务,减少对人类引导的依赖,但论文作者指出:这类 “完成任务” 的能力本身不会教会任务策略克服自己的失败,因为成功辅助执行并未转化为可学习的纠正信号。
论文的核心洞察是:许多局部纠正行为本身是短程、可复用的技能,它们跨任务重复出现,并且基础模型可以从场景和语言描述中推理选择这些行为。这使技能不仅可用于执行,还可以成为纠正监督来源。论文由此提出 skill-space shooting,在任务策略 rollout 的失败状态上 “射击” 技能作为候选延续,由基础模型引导选择并验证修复,将成功修复段用于策略改进。
核心方法和技术细节
系统从一个由行为克隆训练的不完美任务策略,以及一个由短程技能组成的库开始。技能针对任务阶段单独演示训练,例如打开抽屉、放置物体、关闭抽屉。每个技能学习局部行为,而不必掌握整个任务。论文使用手持 UMI 演示训练技能,任务策略和技能策略采用同类 VLA 架构,以便交接。
循环包含三个关键决策。
第一,何时介入。价值模型 根据当前观测和策略提出的 步动作块打分。当 时触发技能试验。实现中,观测用 DINOv2 图像特征,动作经编码 token,条件一个流匹配头,预测动作块之后机器人状态和一个标量值。训练目标为成功执行 +0.5,在记录失败前一个动作视野开始为 -0.5,以便提前标记接近失败。论文统一使用 、阈值 ,每个任务的检测器用初始标注回合训练后冻结。
第二,选择哪个技能。检测到风险时,基础模型 Gemini 2.5 Pro 接收当前场景、任务指令和可用技能描述,选择要尝试的技能。论文设置中每个阶段对应一个原语,因此识别阶段通常就确定了技能。技能随后接管控制。
第三,验证修复并学习。技能执行期间价值模型持续监控。连续 次非负检查或动作数达到 后,基础模型判断该阶段是否被修复。接受则交还任务策略;否则同一技能从当前状态重试,最多三次。论文在 Stack-3、Drawer、Sweeping 使用 ,Coffee 使用 ,。只有被基础模型确认整个 rollout 完成,并且属于接受修复段的技能执行数据才被保留;策略自身动作和失败的试验被排除。第 轮更新使用初始任务演示与所有历史修复段聚合:
更新后的策略继续采集下一轮经验。
创新点和贡献
论文的主要贡献是把已会局部执行的技能转化为纠正监督,而不是仅将其作为 agent 执行工具。这使基础模型的高层推理可以落回到可学习的策略改进:价值模型判断何时需要干预,基础模型判断试哪个技能、是否修复、是否完成任务,技能执行提供 DAgger 式监督。最终评估时系统移除了价值模型、基础模型和技能库,任务策略必须独立完成任务,这表明技能纠正被策略内化而非依赖在线辅助。
另一个贡献是技能库的跨任务复用。论文不仅用同一库支持多轮改进,还表明已有技能数据可微调适配新的运动原语或对象,减少新任务所需的演示数量。这使初始教学可在任务间延续。
实验结果分析
论文在四个真实机器人任务上评测:Stack-3、Drawer、Coffee、Sweeping。评估阶段不使用价值模型或技能库。基线包括潜空间强化学习 dsrl、人类高层引导下的原语组合 cop,以及增加等量完整任务演示的 human。
结果显示,skill-space shooting 在多次迭代后提高了无辅助策略表现,所有四个任务的最高观察 plateau 均高于基线(表 1)。其中 Stack-3 达到 0.833 成功率,Drawer 达到 0.600 成功率,Coffee 平均时间进度为 71.25%,Sweeping 为 83.75%。Coffee 和 Sweeping 相对基线的优势尤其明显(表 1,图 3)。Drawer 初始策略 20 次评估中 0 成功;仅依赖终端稀疏奖励的 dsrl 在首轮更新后仍为 0,最高只到 2/20,而 skill-space shooting 一轮更新后达到 7/20(论文第 4.1 节)。这表明局部技能能力可以在完整任务成功很难通过随机探索获得时,构造出可用的纠正经验。
干预可靠性方面,价值模型触发准确率为 0.71–0.83,基础模型判断阶段或技能准确率为 0.90–1.00,技能修复成功率为 0.70–0.77,完成判断准确率为 0.90–0.95(表 2)。这些结果是论文实验设置下的表现,不构成跨环境保证。
跨任务复用实验中,将 Stack-3 的立方体抓取数据用于微调抓取海绵技能:在 10 个新演示时,共享条件下抓取成功率从 5% 升至 70%;用 30 个新演示时,共享条件达到的水平接近无共享条件下近两倍演示的效果(图 4a)。在 Sponge Wiping 任务中,共享的 pick/place 原语让系统从 45% 进度提升至观察到的全部任务成功,且比无共享早一个迭代达到该水平(图 4b)。
实践建议
对于希望搭建机器人策略自改进系统的团队,这篇论文给出了几条可落地的设计原则。
第一,不要把所有纠正都建模成完整任务示范。把任务分解为阶段原语,并为每个原语单独采集短程演示。论文的设置中,技能库覆盖抓取、放置、扫动、挂取等行为,使纠正选择空间有明确语义。实际系统可以先从高频失败阶段开始建立小技能库。
第二,把 “何时帮助” 和 “如何帮助” 分开。论文用轻量价值模型做低延迟失败预判,用基础模型做技能选择和完成验证。这样基础模型不必实时控制每个动作,而只需在关键节点判断。价值模型可以用少量成功与失败标注按统一阈值训练,不必为每个任务单独调超参数。
第三,只保留高质量修复段,排除策略正确执行段和失败试验。论文的 DAgger 式聚合很克制:只有被技能执行、被基础模型确认修复、并且所在 rollout 完成的数据才进入训练集。实践建议可以为修复数据打上任务指令标签,并与初始演示混合更新,避免灾难性遗忘。
第四,技能库应当按可复用对象和动作组织,而不是按任务专有。论文的共享实验表明,已有抓取数据在适配新对象时能明显减少新演示需求。如果团队跨任务部署,可统一技能接口,如观测、动作、交接协议,并在新任务上微调共享 checkpoint。
最后,评估改进时应移除在线辅助。论文的评估方式值得借鉴:最终测试只运行任务策略本身,以确认技能纠正已被策略内化。否则可能误把 agentic 组合能力当作策略能力改进。落地时可以先应用于重置成本较低、技能边界清晰的任务,并逐步探索无重置操作或由基础模型统一预测失败和选择技能。