InSight:通过可操控视觉-语言-动作模型实现自主技能习得
InSight: Self-Guided Skill Acquisition via Steerable VLAs
论文信息
标题: InSight: Self-Guided Skill Acquisition via Steerable VLAs
作者: Maggie Wang, Lars Osterberg, Stephen Tian, et al.
发布日期: 2026-06-23
arXiv ID: 2606.24884v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决如何让机器人在没有新任务人类演示的情况下,自主获取操作技能(如倒水、拧盖、清扫),突破现有视觉-语言-行动模型依赖固定技能训练集的限制。
- 核心方法:提出 InSight 框架,分两阶段:先自动将少量人类演示切割成带标签的动作基元,训练出可被语言逐基元调用的 VLA;再利用视觉-语言模型识别当前技能集缺失的基元,通过 VLM 给定单轴运动参数驱动机械臂自主采集成功轨迹,并将新基元加回训练,不断扩展技能库。
- 关键结果:在真实机器人倒水任务中,InSight 实现 96% 成功率(相比对比方法 Code-as-Policies 的 16%),并在由 14 个基元串联的 “拧瓶盖-倒水” 长序列任务中达到 80% 成功率,同时完全保留原有取放技能(图 6、图 5)。
- 主要局限:作者指出当前缺失基元的执行仅限于单轴平移或旋转,无法直接学习多轴复杂运动;数据采集过程仍然依赖人工进行环境重置;此外,未结合失败分析来进一步提升样本效率。
- 适合读者:关注机器人操作、终身学习、视觉-语言-行动模型、以及如何利用大模型降低机器人数据采集成本的研究人员和工程师。
论文背景和研究动机
教机器人新操作技能始终成本高昂——每学一个新任务,往往需要大量人类遥操作演示并重新微调策略。视觉-语言-行动模型(VLA)虽然在通用操作上展示出潜力,但其能力仍受限于训练数据中已包含的技能。例如,一个只能铲取岩石的火星机器人,在沙尘暴覆盖太阳能板后需要清扫能力,但因为没有相关演示而无法执行清扫动作。传统基于交互的学习方式(如强化学习)同样代价高昂,通常需要数千次尝试,而现实世界中强化学习的安全性、样本效率问题依然突出。
本文注意到,操作技能天然具有组合性:大多数新技能并非全然陌生,而是将已有的基本动作(接近、抓取、提升等)以新方式重组。例如,清扫和铲取共享 “下降”“接近” 等基元,区别仅在于 “横向推扫” 这一动作。这说明现有 VLA 内部可能已经编码了可重用的动作片段,但这些基元被纠缠在完整的任务指令中,难以单独被调用和重组。因此,是否能让 VLA 具备 “可操控的基元”,并让机器人自己去识别、补齐缺失的基元,成为一个关键方向。
在此思路下,本文提出 InSight:一个以基元级别可操控(steerable)的 VLA 为基础,通过 VLM 自主引导填补技能缺口的技能获取框架。与以往仅将 VLM 作为测试时规划器的做法不同,InSight 让 VLM 同时担任 “缺口识别者” 和 “数据采集指挥”,将新基元的成功执行轨迹存入训练集,实现策略能力的真正扩展,而非仅仅在推理时拼凑已有技能。
核心方法和技术细节
InSight 分为两大阶段。
阶段一:自动基元分割与可操控 VLA 构建。 给定某个任务的人类遥操作演示(如从侧面抓取-放置),系统先利用 VLM 根据任务描述生成一个有序的基元计划(例如 “将夹爪移动到瓶子”“闭合夹爪”“向上抬起” 等)。随后,将演示视频逐帧传递给 VLM,并结合末端执行器的位姿、运动主方向标签(如沿 x-y 平面、z 轴、旋转轴等)与夹爪开合信号,自动确定各基元的边界帧,从而实现无人工标注的演示轨迹切割(见图 2(a))。每个切割出的基元片段被单独作为一个训练 episode,以其自然语言标签作为条件,微调预训练的 VLA(使用 LoRA 微调 Gemma-2B 骨架和 Gemma-300M 动作专家)。同时,在动作空间中添加一个 “进度通道”,监督基元内归一化的时间进度(从 0 到接近 1),用于在推理时判断基元是否完成。
阶段二:VLM 引导的技能获取飞轮。 给定一个超出当前 VLA 能力的新任务,系统先让 VLM 规划出完整的基元序列,并与已知的基元词汇表 对比,标记出 “基元缺口”(primitive gap)。每个缺口的动作被约束为单轴运动(沿 x, y, z 平移之一或绕夹爪局部轴旋转之一)。随后,在真实执行前,VLM 观察当前场景并提出该单轴运动的具体参数(轴、有符号幅度);参数传递上会确保连贯动作(如 “向前倾倒” 与 “扶正”)保持一致的轴和大小。整个计划由机器人尝试执行,其中已知基元由可操控 VLA 执行,缺口基元则由一个低级控制器按 VLM 给出的单轴运动驱动。执行后,一个 VLM 判断器比较初始与最终场景图像,决定整个任务是否成功;成功轨迹内的新基元被标记并加入训练集。反复采集若干次后,将所有原始与新基元数据联合,重训练 VLA,使新基元成为可调用的常规组成部分。
这一 “数据飞轮” 让 VLA 的基元词汇量 随任务逐步增长,实现自主、持续的技能扩展。
创新点和贡献
InSight 的核心创新在于将基元级可操控性从单纯的测试时接口,转化为策略能力持续扩展的基石,并形成了 “VLM 识别缺口→低成本单轴执行→自主标注与回训” 的闭环。具体贡献包括:
- 无需人工标注的自动基元分割流水线:通过 VLM 规划与末端执行器运动主方向的对齐,将连续演示切割为带语言标签的基元,为后续操控提供基础(见第 3.1.2 节)。
- VLM 主动发现基元缺口并自动生成训练样本:与以往仅将 VLM 作为测试时规划器(如 SayCan、Code-as-Policies)不同,InSight 用 VLM 指挥数据采集,让缺失基元通过简单单轴动作执行,并自动过滤成功案例加入训练集,真正扩展了 VLA 的技能边界。
- 新基元的组合重用:一旦获得新基元,即可与原有基元自由组合,执行从未有完整演示的长序列任务(如 14 步的 “拧瓶盖再倒水”),实现组合式泛化,且重训练后的策略不会遗忘原有技能(图 8)。
实验结果分析
论文在模拟与真实平台上进行了多项验证。
模拟实验(Franka Panda + LIBERO 环境):
- 翻块任务:VLA 仅用 150 个取放演示训练,翻块需要额外 “旋转方块” 基元。InSight 通过 VLM 识别该缺口,在 479 次任务尝试中采集了 246 个有效的旋转基元轨迹,最终翻块成功率达到 75%(图 3)。相比同等 rollout 预算的强化学习基线(SAC),后者连一次完整翻转都未能完成,表明基元级别的自采集比端到端 RL 样本效率高得多。
- 关抽屉任务:策略仅训练自开抽屉演示,关闭抽屉的初始状态(抽屉已开)是分布外(OOD)状态,且需要新的 “推回抽屉” 基元。通过引入 VLM 周期性完成检查来终止已有基元并触发新基元,InSight 在 82 次尝试中产生了 70 个成功的关抽屉基元,最终联合训练后关抽屉成功率达到 100%(25 次评估),且依然保留了开抽屉的能力。
真实机器人实验(UFactory xArm):
- 拧开瓶盖、倾倒、组合任务:VLA 基策略仅训练了 50 个取放演示(从顶部和侧面抓取瓶子)。InSight 依次获取 “旋开瓶盖”“向前倾倒”“扶正” 等基元。结果显示,拧盖任务端到端成功率为 92%,倾倒任务为 96%,组成任务 80%,而对比的 CaP-X(零样本代码组合)分别仅为 32%、16% 和 4%,无人类演示微调的 基线则完全失败(图 6)。每项技能的数据采集成本也较低:拧盖平均 23 次尝试、倾倒 31 次尝试即获得 20 个成功基元(表 1),总墙钟时间均在数十分钟量级。
- 技能保留与执行效率:联合训练后,原有的顶部和侧面取放技能成功率保持 100%(图 8),证明基元增量训练不会导致灾难性遗忘。此外,InSight 单一任务的执行时间(含 VLM 调用延迟)明显短于零样本的 CaP-X(图 7),这得益于基元执行大部分依赖于一次性微调后的 VLA 推理,而非每次在线复杂规划。
- 清扫任务:在 “从铲取演示中学清扫” 场景下,仅增加了一个 “横向推扫” 基元,获得了 5/5 全成功 的评估成绩(见 4.4 节),体现出该方法对于非抓取、接触式动作的可扩展性。
实践建议
InSight 的框架对希望在真实机器人上快速扩展技能集、降低数据依赖的从业者有明确的参考价值:
- 基元分割可复现性强:自动分割依赖 VLM 产出基元计划,并与夹爪开合、末端主运动方向对齐。实践时,可以在机器人数据采集平台中直接集成该流水线,利用 VLM 的 JSON 约束输出保证格式稳定性。建议使用高质量的场景图与腕部图同时输入,并细化运动方向判断逻辑。
- 缺口的单轴执行是高效采集的关键:真实世界中,纯单轴运动对硬件要求低,也易于 VLM 给出参数。若需获取更复杂基元,可在该框架上叠加简单的轨迹优化或人工示教少量中间路径点,而不要直接转向大规模 RL。
- VLM 的多次检查保障数据质量:除了任务级别 Oracle 判断,不妨像论文那样在基元执行中引入 完成检查(primitive done check),尤其对于 OOD 情况下的 “接近” 基元非常必要。这能有效剔除错误终止,提升自动标注的有效性。
- 组合长序列时的稳健性:当多个自主获取的基元串联时,要确保每个基元的终止信号可靠。例如,进度通道阈值设为 0.95,或当末端运动长时间低于阈值时自动推进,并结合 VLM 判断,防止在局部卡滞导致任务失败。
- 持续学习的基元管理:可维护一个动态基元库,并定期全量重训 VLA(或采用持续学习策略)。论文证明全量联合训练能够完美保留旧技能,但实际部署若模型过大,可考虑使用参数高效微调或经验重放,并实时监控旧技能在重训后的成功率变化。
通过将 VLA 的可操控基元与 VLM 的数据飞轮相结合,InSight 为机器人终身技能学习提供了一套务实且低人工依赖的工程方案。