视觉验证实现推理时引导与自主策略改进
Visual Verification Enables Inference-time Steering and Autonomous Policy Improvement
论文信息
标题: Visual Verification Enables Inference-time Steering and Autonomous Policy Improvement
作者: Mingtong Zhang, Dhruv Shah
发布日期: 2026-06-16
arXiv ID: 2606.18247v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文旨在解决机器人策略在部署后如何持续自我改进的问题,核心挑战是如何在不依赖昂贵的人类专家数据的情况下,让机器人从自身经验中学习。
- 核心方法:提出了 VERITAS 框架,将预训练通用机器人策略作为动作 “生成器”,并配对一个基于视觉语言模型(VLM)的 “视觉验证器”,在推理时通过 “N 中选优”(Best-of-N)机制筛选并执行最优动作,同时将验证成功的轨迹用于离线策略微调。
- 关键结果:在真实世界实验中,使用验证器筛选的自主数据微调策略,其数据效率可与人类专家演示数据相媲美,有时甚至更优(见图 7)。
- 主要局限:方法依赖推理时的多次采样来计算验证,计算成本高,不适合对延迟要求极高的应用。此外,当前验证器基于任务开始时的静态视觉轨迹,可能不适用于高度动态的环境(见论文第 7 节)。
- 适合读者:对机器人学习、具身智能、模仿学习以及利用视觉基础模型进行策略改进和自监督学习感兴趣的研究者和工程师。
论文背景和研究动机
近年来,基于大规模演示数据训练的机器人基础模型在操作和导航等任务上展现了卓越的能力。然而,一个根本性的瓶颈在于:与文本或图像数据不同,机器人数据的采集仍然昂贵、缓慢,并且受限于人类演示者的可用性。当前最先进的机器人模型主要通过人类专家数据训练,其数据量随专家时间线性增长。这引出了一个关键问题:如何在不扩大人类数据量的情况下改进机器人策略?
论文的核心洞察是,让机器人系统能够在真实世界中进行探索,并以最小的监督和成本从自身经验中学习。这受到大语言模型领域最新进展的启发:通过扩展推理时的计算量进行验证,即在模型推断时生成多个候选解并用一个 “验证器” 选出最佳答案,从而在无需额外训练的情况下提升性能。对于机器人技术而言,数据采集远比计算更昂贵,因此用推理时计算换取性能提升的策略极具价值。这篇论文正是在此背景下,提出了视觉验证驱动推理时引导和自主策略改进的完整框架。
核心方法和技术细节
VERITAS 框架的核心是一个 “生成器-验证器”(Generator-Verifier)架构,其工作流程分为两个主要阶段:推理时引导和离线自改进。
生成器:作为随机动作提议者的策略
论文将预训练的通用机器人策略 视为一个随机的 “生成器”。与通常采用确定性解码以最小化方差的传统部署方式不同,VERITAS 利用策略的随机性来探索多样的行为。具体而言,在每个决策步骤 ,给定当前的视觉观测 和语言指令 ,策略会采样出 个候选动作序列(即动作块):
这种 “动作分块”(action chunking)策略至关重要,因为它不仅将验证的成本分摊到整个执行时间范围 上,还为验证器提供了评估行为后果的时间上下文,而非仅仅是一个瞬间动作。
视觉验证器:即插即用的评估模块
验证器 是一个即插即用、免梯度的模块,它将观测、候选动作块和任务指令映射为一个标量分数,用于评估动作的 “任务对齐度” 和物理合理性。论文设计并消融了多种验证器,其最佳实例化方法运作如下:
- 轨迹生成:在任务开始时,向一个前沿的视觉语言模型(VLM)提供初始观测和任务指令,提示其生成一条 “视觉推理轨迹”——即一组位于像素空间的路径点序列 ,这描绘了完成任务所理想的末端执行器轨迹。此轨迹在整个执行过程中保持静态,确保了时序一致性。
- 几何评分:在推理时,将每个候选动作块执行后机器人末端执行器/夹爪的位置投影到图像平面上。验证器分数 计算为候选轨迹投影与 VLM 生成轨迹之间最近线段的欧氏距离负值。
这种设计的精妙之处在于,VLM 仅在任务开始时调用一次,而运行时的验证过程则简化为快速的几何一致性检查,其延迟通常低于 1 毫秒,从而能够以最小的开销评估大量候选动作。
推理时引导与策略自改进
结合生成器与验证器,VERITAS 在推理时通过 Best-of-N 选择来引导策略,即执行验证分数最高的动作块。这相当于让机器人在 “行动” 之前进行 “思考”(采样与验证)。为了将这种计算成本转化为持久的能力提升,框架还创建了一个 “数据飞轮”:将验证器引导下成功执行的任务轨迹记录到一个自主数据集 中。然后,利用标准的行为克隆(Behavior Cloning)在此数据集上对原始策略进行微调:
因为 中的数据是由机器人自己的策略生成的,所以它在分布上是 “在策” 的,且运动学上可行。这不仅缓解了模仿学习中常见的分布偏移问题,还将验证器这一 “专家过滤器” 的推理能力蒸馏到了策略自身,实现了无需人类干预的自主闭环学习。
创新点和贡献
- 解耦推理与行动生成:VERITAS 通过引入显式的验证阶段,将复杂的任务推理从策略网络本身外部化。这允许在不修改策略参数的情况下,利用任何即插即用的验证器来引导现有策略,实现了对策略的推理时引导。
- 构建自主数据飞轮:论文首次将推理时的验证视为一个 “数据引擎”,将昂贵的推理计算蒸馏回基础策略中,形成了一种可扩展的机器人自改进机制。这是一种比仅将推理时搜索视为 “一次性提升” 更为新颖和长远的视角。
- 验证数据效率媲美人类专家:论文通过详实的实验,一个关键发现是,使用 VERITAS 框架生成的自主数据来微调策略,其数据效率可与人类专家遥操作收集的数据相媲美,在多个任务和数据规模下表现相当甚至更优(见图 7)。这证明了一种摆脱对人类监督依赖的高效策略改进路径是可行的。
- 策略与验证器无关的通用性:实验结果表明,该框架的优势不依赖于特定的策略架构或验证器设计。在仿真和真实世界环境中,使用不同的基础策略和多种验证器实现(如 VLM 验证器、启发式验证器)均能观察到一致的性能提升(见图 4),证明了其作为通用框架的鲁棒性。
实验结果分析
论文在仿真环境(SIMPLER)和真实世界(DROID 平台)上对框架进行了广泛评估,覆盖了 8 个不同的操作任务和多个预训练策略。
- 推理时引导的有效性:无论是仿真还是真实世界实验,VERITAS 引导的动作选择始终优于基础策略。例如,在仿真中,VERITAS 将 “堆叠积木” 这一最难任务的成功率从 31.3% 提升到了 59.2%,在所有任务上平均提升 9.7%(见图 5)。在真实世界实验中,推理时引导使成功率平均提高了 35%(见图 6)。值得注意的是,非政策性的 PIVOT 基线由于缺少良好的动作先验,完全无法成功,这凸显了策略作为生成器的重要性。
- 离线策略改进:实验表明,在自主收集的、经验证的数据上进行微调,其带来的性能提升与推理时引导相当,甚至更高,成功地将 “思考” 能力固化到了策略权重中。这证明了离线改进的有效性。
- 自主数据对比人类数据:这是本论文最有说服力的结果之一。在真实世界实验中,研究人员比较了使用不同数量(20、30、50、100 条)的自主验证轨迹和人类专家演示轨迹进行微调的效果。结果(见图 7)显示,在 “将胡萝卜放在盘子上” 任务中,50 条自主演示数据微调的效果(成功率 70%)优于同等数量的人类演示(65%);在 “拾起鼠标” 任务中,自主数据在所有数据量级别下均表现更佳。论文认为,这是因为自主数据天然是在策且物理上可行的,从而更有效。
实践建议
VERITAS 框架为机器人策略的部署和持续改进提供了一条切实可行的技术路径。对于希望将此技术落地的从业者,有以下几点实践建议:
-
模块化部署,逐步扩展:可以从一个性能尚可的预训练通用策略入手,无需对其进行改造。首先集成一个轻量级的视觉验证器,利用 VLM(如 Gemini 2.5)生成视觉轨迹。在部署初期,将重点放在推理时引导(Best-of-N)上,可以根据任务的动态性调整采样次数 。论文发现,性能增益在 超过 8 后趋于饱和(见图 9),因此 5-8 是一个计算成本和性能的良好权衡点。
-
构建高效的自主数据流水线:这是实现自改进飞轮的关键。在部署过程中,务必只记录那些被验证器判定为成功的完整轨迹。这些高质量、在策的数据是实现高效离线微调的基础。建议维护一个持续增长的 “记忆库”,在机器人空闲或夜间时段定期对基础策略进行微调。实验证明,即使是 20-50 条这样的少量高质量轨迹,也能带来显著的性能提升。
-
处理动态环境的策略:当前 VERITAS 的验证器更适合准静态操作任务。对于动态环境(如移动物体、人类频繁干预的场景),建议探索将静态视觉轨迹替换为动态更新的目标。一个直接的想法是,在验证器中集成一个高性能的实时物体跟踪器(如 SAM 2),在推理时对 VLM 生成的、基于参考对象的路径点进行动态解析(可以参照论文中提到的 VLM-Constraints Verifier 设计思路),从而使验证能适应场景的实时变化。
-
优化推理延迟:Best-of-N 选择带来的延迟是潜在瓶颈。建议在 GPU 上对 个候选动作的采样进行批处理,以最大化吞吐量。对于对控制频率有严苛要求的应用,可以考虑将验证器的评分逻辑蒸馏成一个更轻量级的神经网络价值函数 ,或者将离线微调后的策略在后续部署中逐步降低采样次数 ,因为策略本身的性能已经通过蒸馏得到了提升。