视觉验证实现推理时引导与自主策略改进

arXiv: 2606.18247v1

论文信息

标题: Visual Verification Enables Inference-time Steering and Autonomous Policy Improvement

作者: Mingtong Zhang, Dhruv Shah

发布日期: 2026-06-16

arXiv ID: 2606.18247v1

PDF 链接: 下载 PDF

论文背景与研究动机

近年来,机器人基础模型在大规模示教数据上的预训练展现出强大的操作能力。然而,与文本或图像数据不同,机器人数据的采集成本高昂、速度慢,且严重依赖人类专家的时间。这种依赖形成了一个根本瓶颈:当前最先进的模型主要在人类专家数据上训练,其扩展性受限于人类标注的线性增长。如何在不增加人类数据的前提下持续提升机器人策略性能,成为一个关键挑战。

受大语言模型中推理时计算扩展的启发,本文提出了 VERITAS(Visual Verification for Inference-time Steering and Autonomous Policy Improvement)。其核心思想是:与其无限制地收集更多人类示教,不如在部署阶段利用额外的计算资源进行验证,使机器人能够 “三思而后行”。具体而言,机器人策略在每次决策时生成多个候选动作,由一个外部的视觉验证器对它们进行评分,最终只执行得分最高的动作。这一范式将昂贵的推理时计算转化为性能提升,并为后续离线自我改进提供了高质量的自主生成数据。

核心方法与技术细节

VERITAS 框架由两个核心组件构成:生成器和验证器。

生成器:策略作为随机采样器

任意预训练的通用机器人策略(如基于流匹配或扩散模型的 VLA)都可作为生成器。与传统部署中采用确定性或贪婪解码不同,VERITAS 将策略视为一个随机生成器,在每一步从条件分布 p(at:t+Hot,l)p(\boldsymbol{a}_{t:t+H} \mid o_t, l) 中采样出 NN 个候选动作块。每个动作块 at:t+H\boldsymbol{a}_{t:t+H} 包含未来 HH 步的动作序列,这种动作分块的设计不仅摊平了验证成本,还为验证器提供了评估行为后果的时间上下文。

验证器:无梯度的 “视觉护栏”

验证器 V(ot,at:t+H,l)V(o_t, \boldsymbol{a}_{t:t+H}, l) 是一个可插拔、无梯度的函数,输出一个标量分数,表示候选动作与任务指令的对齐程度。本文设计了一种基于视觉语言模型(VLM)的验证器,其工作流程分为两个阶段:

  1. 视觉轨迹生成: 在任务开始时,VLM 被输入初始观测和任务指令,输出一条由像素空间路径点 {wk}\{w_k\} 构成的视觉推理轨迹。这条轨迹描述了完成任务的理想末端执行器运动,并在整个执行过程中保持不变。
  2. 几何评分: 执行时,对于每个候选动作块,将其投影到图像平面,计算其投影轨迹与 VLM 生成的视觉轨迹之间的负欧氏距离作为得分。由于视觉轨迹仅需生成一次,后续的验证只是快速的几何一致性检查,延迟极低,从而支持在极短的时间内评估大量候选动作。

推理时引导与自主改进

在推理阶段,VERITAS 采用 Best-of-NN 策略:从 NN 个候选动作块中选出得分最高的一个执行。这个过程纯粹依靠推理时的额外计算提升表现,无需更新策略参数。

更关键的是,所有成功执行的验证轨迹被自动记录为一个数据集 Dauto\mathcal{D}_\text{auto}。由于这些数据由机器人自己的策略生成,天然满足在线分布且运动学可行,验证器则扮演了 “专家筛选器” 的角色,仅保留高质量执行。随后,利用标准的监督行为克隆在 Dauto\mathcal{D}_\text{auto} 上微调原策略,可将验证阶段的推理能力蒸馏到模型权重中,实现持久的策略改进。这一过程形成一个数据飞轮:部署经验不断转化为训练数据,推动策略持续进化,且完全不需要额外的人类标注。

创新点与贡献

VERITAS 的主要贡献可归结为以下几点:

  • 将推理时验证转化为数据引擎: 不同于以往将推理时搜索视为一次性 “性能增强” 的方法,本文将在线验证视作自主数据采集手段,使机器人能够从自身成功执行中学习,实现闭环的自我改进。
  • 策略无关与验证器无关的框架: VERITAS 对基座策略的架构和验证器的具体实现均不敏感。实验中使用不同预训练策略(如 π0\pi_0 系列模型)和多种验证器设计(启发式、VLM 几何约束、V-GPS 等)均取得稳定提升,证明了该方法的一般性。
  • 完全自主的分布偏移缓解: 传统模仿学习中的分布偏移问题通常需要昂贵的人类专家重标记来解决。VERITAS 用自动验证器替代了人类监督,保证了训练数据严格在线且物理可行,从根本上缓解了分布偏移。
  • 数据效率媲美人类专家: 实验首次证明,验证器筛选的自主收集轨迹在离线策略改进上的数据效率可与人类专家示教相媲美,甚至在中等数据量下取得更优效果,为可扩展的机器人持续学习提供了切实路径。

实验结果分析

实验在模拟环境(SIMPLER)和真实世界(DROID 平台)中全面评估了 VERITAS 的推理时引导和自我改进能力,覆盖多种操作任务和策略。

  • 推理时引导: 在模拟环境中,不同的验证器设计均一致提升了 π0\pi_0-Bridge 策略的成功率,平均提升约 12.6%,尤其在堆叠积木等困难任务上提升显著(31.3% 到 59.2%)。在真实世界实验中,对于 π0\pi_0-DROID 和 π0.5\pi_{0.5}-DROID 以及四项挑战性任务,推理时引导带来平均 35% 的成功率增益,远超 V-GPS 等基线方法。这证明了单纯通过推理时计算就能大幅改善通用策略的表现。
  • 离线策略改进: 利用验证器引导下收集的成功轨迹进行微调,策略性能获得了稳定的进一步提升。模拟中平均成功再提高约 10%,真实世界中随着数据量增加,性能可靠增长,表明自主生成数据完全可以支撑有效的策略改进。
  • 数据效率对比: 在真实世界实验中,用 20、30、50、100 条验证器精选的自主轨迹与同等数量的人类专家示教分别微调策略。结果显示,自主数据在多项任务上与人类数据效率相当,甚至在 “拾起鼠标” 任务中,50 条自主数据(0.65 成功率)优于人类数据(0.60)。这一发现意味着部署时的推理计算可真正转换为高质量训练数据,突破对人类示教的依赖。

实践应用建议与未来发展方向

对于在真实场景中部署机器人系统的从业者,VERITAS 提供了几条切实可行的应用思路:

  1. 集成推理时验证作为标准模块: 可在现有策略之上附加一个轻量级的视觉验证器,在部署时自动提高动作选择的可靠性,尤其适用于对安全性要求较高的场景。验证器只需在任务开始时调用一次 VLM 生成轨迹,运行时开销极低。
  2. 建立持续学习管道: 利用 “数据飞轮” 理念,将机器人在日常操作中自动收集的成功轨迹定期用于离线微调,实现模型能力的持续自然增长。这种方式无需额外人力,使机器人像人类一样 “熟能生巧”。
  3. 验证器的灵活设计: 验证器可以采用多种形式,例如基于规则的启发式方法、学习型价值函数或 VLM 生成约束。可根据任务需求和计算预算选择合适的验证器,甚至在同一系统中混合使用。

未来的研究方向可从以下几方面展开:

  • 动态环境适应: 目前的视觉轨迹在任务开始时固定,不太适合场景动态变化的情形。后续可探索动态更新验证轨迹或利用视频模型进行时序一致性评估。
  • 验证器蒸馏: 将验证器的拒止逻辑蒸馏为轻量级价值函数,以降低对 VLM 的依赖,使推理时验证适合对延迟极敏感的应用。
  • 生成器与验证器的联合优化: 目前的框架中生成器固定,未来可研究两者联合训练,使得策略在训练过程中就学会产生更易验证的高质量行为,进一步提升样本效率。

总结与展望

VERITAS 通过生成器-验证器框架巧妙地将推理时计算转化为可持续的策略改进能力,为机器人自我提升开辟了一条新路径。它证明了在部署阶段进行视觉验证不仅能够立即提升任务成功率,还能持续积累高质量训练数据,使机器人摆脱对人类专家的依赖,实现自主进化。该框架的模块化设计和策略无关特性使其具备很强的通用性和实用性。随着视觉语言模型和机器人基础模型的不断进步,VERITAS 的验证能力将随之增强,未来有望成为通用机器人持续学习的关键基础设施,推动机器人从短期部署走向终身学习的时代。