对于视觉-语言-动作对齐,扩展验证比扩展策略学习更有效。

Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment

arXiv: 2602.12281v1

论文信息

标题: Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment

作者: Jacky Kwok, Xilun Zhang, Mengdi Xu, et al.

发布日期: 2026-02-12

arXiv ID: 2602.12281v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决 Vision-Language-Action(VLA)模型中指令与动作的 “意图-动作差距”,即机器人未能正确遵循自然语言指令。
  • 核心方法:提出 CoVer,一个基于对比学习的验证器,并在测试时通过层级验证管线同时优化高层语言指令和低层动作块的选择。
  • 关键结果:在 SIMPLER 基准上,CoVer 在分布内任务上比仅缩放策略预训练高出 22%,在分布外任务高出 13%,真实世界实验再提高 45%。
  • 主要局限:验证器依赖于固定的 VLA 策略,无法纠正策略本身的能力限制;方法增加了一定的推理延迟(论文通过缓存和并行优化降低到约 2.2 Hz)。
  • 适合读者:从事机器人学习、具身智能、测试时计算或视觉语言动作模型对齐的研究者和工程师。

论文背景和研究动机

通用机器人长期以来的愿景是能够理解和执行自然语言指令。Vision-Language-Action(VLA)模型通过在大规模机器人数据集上预训练,已经在这方面取得显著进展,但它们仍然存在关键的 “意图-动作差距”——即生成的动作与指令语义不对齐。例如,机器人可能正确抓取了塑料容器,却将它误放入旁边的烤箱而非抽屉,从而引发危险(见引言中的例子)。现有工作大多通过扩展策略预训练来缩小这一差距,如增加指令重述进行数据增强或使用更大的视觉语言骨干,但这些方法往往只能带来渐进式提升,且容易导致灾难性遗忘,削弱多模态理解和推理能力。论文作者认为,与扩大训练计算相比,在测试时投入更多计算进行验证可能更有效。他们因此研究如何让 VLA 在测试时利用额外计算来改进动作与指令的对齐。

核心方法和技术细节

论文将 VLA 推理重新构建为一个层级优化问题。在语言层面,给定用户指令 ll,系统在部署前的 “启动阶段” 利用 VLM 生成一组 KK 个语义等价的指令重述 {lk′}k=1K\{l'_k\}_{k=1}^K,并将视觉与文本的嵌入特征缓存起来。在动作层面,在每个推理步,VLA 策略 π\pi 对每个重述采样 MM 个候选动作块 ak,j′a'_{k,j},从而产生 K×MK\times M 个候选。随后,通过对比验证器 CoVer 为每个 (指令重述,动作) 对打分,分数 sk,j=Vθ(ot,ht,l,ak,j′)s_{k,j} = \mathcal{V}_\theta(o_t, h_t, l, a'_{k,j}),其中 hth_t 是近期动作历史。系统先计算每个重述下所有动作的平均分 SkS_k,选出最优重述 l∗l^*,再从中选出最高分的单个动作块 at∗a^*_t 执行。整个过程在每一步迭代,实现高层语言提示与低层动作块的联合选择。

CoVer 验证器的核心是跨模态对比学习。它使用预训练的 SigLIP2 编码器分别提取视觉和文本特征,并通过文本感知视觉注意力将两者融合,得到 Fcombined\mathbf{F}_{\text{combined}}。动作序列(含历史与当前块)通过一个 Transformer 编码器得到嵌入 A\mathbf{A}。两个嵌入经 ℓ2\ell_2 归一化后,用双向 InfoNCE 损失进行训练,以批次内其它对作为负样本,无需手动标注失败样本。训练数据通过 Open-X Embodiment 数据集的指令重述进行增强(论文第 4.2 节,算法 1)。这种设计使验证器能够评估视觉观察、指令和动作之间的语义对齐,且可随模型大小、数据量、批大小和集成数量而持续提升(图 5)。

创新点和贡献

这篇论文的主要创新包括:

  1. 揭示了具身指令跟随的测试时缩放律:通过研究不同采样策略(重复采样、高斯扰动、指令重述和混合采样),论文发现联合缩放指令重述数量和每个重述下的动作采样数能更有效地恢复正确动作,并用幂律描述了动作误差与计算量的关系(图 2)。
  2. 提出用于视觉-语言-动作对齐的对比验证器 CoVer:该架构可随计算和数据扩展,不需要在线环境交互或失败标签,仅利用离线演示数据就能学习语义对齐。
  3. 引入 “启动时计算” 和层级测试时验证管线:将重述生成与场景推理离线化,缓存嵌入以降低运行时延迟,再通过联合优化语言与动作选择来增强鲁棒性。
  4. 在模拟和真实世界中展现出显著性能优势:相比之下,仅增加策略训练数据的同类方法仅带来有限的提升,而 CoVer 在 SIMPLER 分布内任务上提升 22%,分布外任务提升 13%,真实世界实验平均提升 45%,并在 PolaRiS 基准上任务进度提升 14%,成功率提升 9%(表 1、图 6、图 8)。

实验结果分析

在 SIMPLER 基准的四个分布内(ID)任务和三个分布外(OOD)任务上,使用红队指令评估。基础策略 π0\pi_0 平均 ID 成功率仅为 41.5%,OOD 为 29.7%。仅在训练时增加指令增强的方法(π0\pi_0 rephrase)提升至 ID 44% 和 OOD 48.7%,而随机选择一个重述而不验证的方法在 ID 上略有提升(42.3%),但 OOD 下降至 28.7%,说明指令重述可能有害。与此对照,π0\pi_0 + CoVer 将 ID 提升至 57%,OOD 提升至 61%,较基础策略分别提升 16% 和 31%。若将训练时增强与 CoVer 结合,ID 和 OOD 成功率分别达到 65.5% 和 62%,验证了两种方法的互补性(表 3)。

在真实世界 WidowX 机器人上进行的两项操作任务中,π0\pi_0(rephrase)本身经常失败,而 CoVer 将成功率分别提升了 30% 和 60%(图 8)。在更强大的基础模型 π0.5\pi_{0.5} 上结合 CoVer 后,PolaRiS 三项任务的进度平均提升 13.9%,成功率提升 9.3%(表 1)。

验证器的缩放实验表明,随着合成指令数(从 8× 到 64×)、模型参数(从 250M 到 1B)、批大小(从 2048 到 8192)和验证器集成数(从 1 到 8)的增加,动作检索准确率持续稳定提升(图 5),并且计算成本远低于扩展策略预训练(表 7)。延迟分析则证明,动作编码器仅增加 8 毫秒开销,端到端在批大小为 16 时约 453 毫秒,约 2.2 Hz,可通过缓存和并行进一步优化(表 2)。

实践建议

基于论文的方法和结果,对于希望在实际系统中部署 VLA 的实践者,可考虑以下几点:

  1. 投入测试时计算而非一味增大模型:论文表明,将同样的数据预算用于训练一个轻量级验证器,并在测试时进行重述与动作搜索,能比直接将数据用于策略训练获得更大的性能收益(图 1)。工程团队可优先构建验证管线,而非不停微调大型策略模型。
  2. 利用离线推理与缓存优化延迟:CoVer 的 VLM 重述生成和视觉-文本嵌入计算被放在启动阶段离线完成,运行时不增加在线算力需求。结合批处理和动作编码器仅 8 ms 的开销,系统可接近实时控制。相似的缓存技术可推广到其它使用大模型推理的机器人系统。
  3. 采用对比学习构建鲁棒验证器:使用双向 InfoNCE 损失和冻结的预训练视觉-语言编码器,即使在只有正确示范的数据集上也能训练出对语义偏移敏感的验证器。可收集少量领域数据并扩充指令重述,训练适配自己场景的验证器。
  4. 混合采样提升动作多样性:测试时同时增加指令重述数量和每个重述下的动作采样数,而不是仅重复采样,能使候选动作分布更广,提高找到正确动作的概率,这对于复杂操作或分布外环境尤为重要。