InSight:通过可操控 VLA 实现自我引导技能习得

arXiv: 2606.24884v1

论文信息

标题: InSight: Self-Guided Skill Acquisition via Steerable VLAs

作者: Maggie Wang, Lars Osterberg, Stephen Tian, et al.

发布日期: 2026-06-23

arXiv ID: 2606.24884v1

PDF 链接: 下载 PDF

论文背景与研究动机

让机器人学会新的操作技能一直是一项代价高昂的工作。传统方法需要为每个新任务收集大量人类示范数据并对策略进行微调,这严重制约了机器人系统的可扩展性。虽然视觉-语言-动作(VLA)模型在通用操作方面取得了进展,但其能力始终受限于训练数据中包含的技能范围。

论文作者提出了一个发人深省的火星探测场景:一台训练有素的机器人只会铲取岩石样本,当沙尘暴在太阳能板上堆积碎屑时,它无法执行清扫行为——因为训练数据中没有清扫示范。这个场景揭示了现有 VLA 系统的一个根本缺陷:缺乏自主获取新技能的能力。

然而,作者敏锐地洞察到操作技能本质上具有组合性。新操作技能很少是全新的,它们往往以新方式组合已见过的原语(primitive)。例如,清扫和铲取共享接近和下降原语,区别仅在于横向推扫原语。这一发现意味着现有 VLA 可能已经编码了可复用的原语,但这些原语因纠缠在完整的任务指令中而无法被灵活操控。

论文的核心理念由此产生:高效获取新技能不仅需要执行原语的能力,更需要识别完成新任务缺少哪些原语的能力。这正如人类面对新场景时的思维方式——理解已有技能,识别能力缺口,通过有针对性的练习习得新能力,并将其存储为可复用资源。

核心方法:两阶段自主技能获取框架

InSight 框架包含两个关键阶段,实现了从人类示范到自主技能获取的完整闭环。

阶段一:自动原语分割与可操控 VLA 构建

在这一阶段,系统首先需要将人类遥操作示范自动分解为带标签的原语序列。具体过程是:给定任务描述,VLM(视觉语言模型)生成有序的预期原语序列。然后,系统将原语边界定位在夹爪开合转换点,并将末端执行器的姿态、运动幅度和主导轴(xy 平面平移、z 轴平移或旋转)信息传递给 VLM,由 VLM 将每一帧与对应的原语名称匹配。

这种自动分割方法的精妙之处在于完全避免了人工标注。分割后的每个原语片段成为独立的训练 episode,并以其原语标签作为语言提示进行条件化。系统还引入了学习进度通道作为终止信号,在原语内部采用[0, 1)范围的进度标签,使 VLA 能够判断何时完成当前原语并过渡到下一个。

阶段二:VLM 引导的技能获取循环

阶段二构成了论文的核心创新——一个自主技能获取的数据飞轮。当系统面对一个需要缺失原语的新任务时,流程如下:

  1. 原语缺口识别:VLM 将任务分解为原语序列,并与已知原语词汇表 mathcalV\\mathcal{V} 进行对比。不在词汇表中的原语被标记为原语缺口(primitive gap)。规划器被约束为每个缺口返回一个单轴运动,确保多阶段动作产生多个缺口而非一个复合缺口。

  2. 原语参数化:对每个缺口,VLM 分析当前场景并提议执行参数——运动轴(平移 dx,dy,dz\\{dx, dy, dz\\} 或旋转 drx,dry,drz\\{drx, dry, drz\\})和有符号的幅度。对于链条式的缺口,前一个缺口的参数会传递到 VLM 以保证配对运动的一致性。

  3. 自主执行与验证:机器人在已知原语上调用 VLA,在原语缺口上使用 VLM 参数化的低层控制器执行单轴运动。任务完成后,VLM 神谕(Oracle)比较场景前后图像,判断任务成功与否。

  4. 数据整合与重训练:成功的原语执行被添加到训练数据集中,与现有原语数据联合重新训练 VLA,使 mathcalV\\mathcal{V} 得到扩展。

关键创新点与技术贡献

InSight 的创新之处体现在以下几个层面:

从可操控性到技能获取的范式跃迁。现有方法(如 STEER、Steerable Policies)将原语级操控性视为测试时控制接口,原语集是固定的。InSight 则将其转化为持续扩展可复用技能集的机制,使可操控性成为技能获取的基础而非终点。

VLM 角色重新定位。不同于将 VLM 仅用作测试时规划器的方法(如 SayCan、Code-as-Policies),InSight 赋予 VLM 主动代理的角色:识别缺失原语、生成成功执行、并将执行结果送回 VLA 训练。VLM 从规划者变成了数据获取循环的引擎。

以原语为单位的精简获取粒度。与全任务轨迹级别的获取方法不同,InSight 聚焦于更小的原语单元。这使得获取的技能可以通过组合复用来完成多样的新任务,极大提高了获取效率。这种设计契合了技能组合性的直觉,并为持续终身学习提供了实用基础。

数据驱动的统一策略架构。与采用多策略混合或知识空间分离的方法(如 Stellar VLA、SkillsCrafter)不同,InSight 在原始和新获取的原语上联合重训练单一 VLA。这意味着已有原语在词汇增长的过程中保持受监督状态,自然实现了灾难性遗忘的规避。

结合几何信号的 VLM 理解。在自动分割中,InSight 不仅依赖语义理解,还结合了夹爪状态转换和主导运动轴等几何信号,提高了分割的准确性和可靠性。这种语义与几何的融合是工程实践中的重要贡献。

实验结果与性能分析

论文在仿真和真实世界环境中进行了系统评估,涵盖了多种操作任务:

仿真环境中的样本效率优势。在方块翻转任务中,InSight 仅使用 246 个自主获取的原语执行和 479 次总尝试,就达到了 75% 的成功率。相比之下,在同等计算预算下,强化学习 SAC 基线完全无法完成翻转。这证明了原语驱动的自主获取方法在样本效率上的显著优势。在抽屉关闭任务中,尽管面临分布外初始状态(抽屉初始打开),InSight 仍通过 VLM 完成检查桥接了不完美的原语终止,最终策略达到 100% 关闭成功率和 25 次评估试验的完美保持率。

真实世界的多种技能获取。在硬件上,InSight 在拧瓶盖、倾倒和长时域组合任务上表现优异。单技能端到端成功率达到 92%(拧盖)和 96%(倾倒),远超 CaP-X 的 32% 和 16%。在需要串联 14 个原语的组合任务(拧盖后倾倒)中,InSight 达到 80% 成功率,而 CaP-X 仅为 4%。每原语的高可靠性通过组合累积为端到端成功,充分验证了原语级操控性的价值。

高效的数据获取成本。拧盖任务仅需 23 次试验就获得 20 个成功原语,倾倒任务需要 31 次。总机器人运动时间不到 50 分钟(拧盖 23.8 分钟,倾倒 49.6 分钟),VLM 调用时间分别仅 8.4 和 26.9 分钟。这种数据效率使得 InSight 在实际部署中切实可行。

训练后的泛化与保持。在添加新原语之后,统一 VLA 保持了对原有技能 100% 的成功率(顶抓放和侧抓放),证明联合重训练策略有效避免了灾难性遗忘。在清扫任务验证中,InSight 成功从铲取示范中获取了横向推扫原语,在接触丰富的非抓取运动中展示了框架的可扩展性。

实践应用建议与未来方向

对于在量化交易、机器人学习等领域探索自主系统和持续学习的从业者,InSight 的方法论提供了重要启示:

原语化思维。将复杂能力分解为可组合的原语单元,不仅有利于现有的策略学习,更为持续扩展能力提供了架构基础。在设计系统时,应充分考虑能力的组合性和可复用性。

自主数据获取循环。构建从能力缺口识别、参数化执行到成功验证的闭环,可以显著减少人类监督需求。这在数据收集成本高昂的领域(如精密操作、长时域任务)尤其有价值。

大型模型的主动代理角色。不应将 VLM/LLM 局限于推理和规划,而应让其参与数据生成、质量验证和策略更新的完整循环。这种角色扩展可以支撑更广泛的自动化流程。

论文作者也坦诚指出了当前局限和未来方向:

  • 原语复杂度限制:当前仅限于单轴运动,限制了可获取原语的复杂度。未来可通过 VLM 生成路点、轨迹优化或在线 RL 获取更丰富的原语。

  • 失败利用不足:当前系统仅筛选成功执行,未分析失败原因。引入失败分析和 VLM 反馈可实现更高样本效率的获取。

  • 环境重置依赖:目前仍需人工重置环境。通过真实到仿真再回真实(real-to-sim-to-real)的流程或学习世界模型来预筛选候选执行,可降低重置成本并提升安全性。

  • 形态可扩展性:框架可扩展到更高自由度的形态,如移动操作臂或人形机器人。

总结与展望

InSight 通过 VLM 引导的原语级操控,将 VLA 的技能获取从依赖人类示范转变为自主过程,实现了零人类示范的新技能习得。其核心贡献在于构建了一个可行的自主技能获取工作流:通过自动原语分割建立可操控基础,通过 VLM 识别能力缺口并生成训练数据,通过联合重训练持续扩展策略的能力边界。

这项工作为机器人操作技能的持续终身学习提供了一个实用框架。其意义不仅在于减少人类监督,更在于提出了一个通用范式——将大型模型从被动的推理工具提升为主动的学习代理。结合近期基础模型在理解、推理和代码生成方面的快速进展,这种原语级的自主技能获取方法有望继续发展,推动通用操作机器人从受限于训练数据的系统走向能够持续适应和成长的自主体。未来的关键突破可能来自更复杂的原语获取、失败驱动的学习效率提升以及多形态能力的组合泛化。