补丁策略:通过密集视觉表征实现高效具身控制
论文信息
标题: Patch Policy: Efficient Embodied Control via Dense Visual Representations
作者: Gaoyue Zhou, Zichen Jeff Cui, Ada Langford, et al.
发布日期: 2026-07-20
arXiv ID: 2607.18236v1
PDF 链接: 下载 PDF
研究背景与动机
近年来,视觉 Transformer(ViT)通过将图像划分为固定大小的块(patches)并进行自注意力处理,已在计算机视觉领域取得主导地位。这些从大规模自监督或语言-图像预训练中获得的密集表征,不仅保留了细粒度的空间与语义信息,还在目标检测、分割和定位等任务上展现出强大的迁移能力。然而,在机器人学习领域,这种密集表征的潜力尚未被充分利用。目前主流的视觉运动策略大多将每帧观测压缩为一个全局特征向量(如使用 ViT 的[CLS]标记或平均池化),导致严重的空间信息瓶颈,尤其对需要精密操作的任务影响巨大。另一类策略则是基于大规模视觉-语言-动作模型(VLA),它们虽然使用密集特征,但通常需要微调包含数十亿参数的预训练生成模型,推理延迟和训练成本极高,难以满足高频率实时控制的要求。
本工作提出了Patch Policy,旨在弥合这一差距。核心思想是:机器人策略并不需要巨大的语言生成模型,而只需要直接利用预训练 ViT 的密集块特征。通过一个轻量级的架构扩展,Patch Policy 能够直接消费未压缩的块标记,在保留空间细节的同时,实现极低的参数量和推理延迟,从而让机器人社区能轻松吸收视觉表征学习的持续进步,而无需牺牲训练效率和反应速度。
核心方法与技术细节
Patch Policy 是一种模块化的、基于 Transformer 的策略架构,由观测主干和策略头两部分组成。
观测主干
给定输入图像 ,冻结的 ViT 编码器将其划分为 个块,并输出形状为 的密集块特征( 为嵌入维度)。与传统做法不同,Patch Policy 直接保留所有块特征,不进行任何空间压缩。对于长度为 的观测窗口,会形成 的特征序列。对于目标条件行为克隆,如果是图像目标,则通过同一编码器提取特征并沿特征维度拼接,得到 的输入张量;如果是向量目标,则将其拼接到每个观测标记上,形成 的张量。这种设计天然兼容全局池化特征()或状态输入,具有良好的向后兼容性。
策略学习
策略学习被建模为对提取的块特征序列的序列预测问题。首先将时空块特征展平为长度为 的序列,并加上可学习的 1D 位置编码。核心创新在于块因果注意力掩码:同一帧内的所有块之间保持双向注意力,以充分整合空间信息;而跨帧的块之间则采用因果掩码,确保时间上的条件依赖严格遵循过去到未来的顺序。这种掩码方式既保留了标准时序策略的因果性,又让模型能访问丰富的空间细节。策略处理掩码后的序列,并通过动作头在每个帧的最后一个块标记处输出预测的动作块。
该框架与策略头和训练目标无关。实验中分别采用了基于向量量化行为 Transformer(VQ-BeT)的混合分类-回归损失和基于扩散策略的去噪目标。训练时,前向传播整段序列并计算动作损失;推理时,将当前观测的块特征追加到滚动上下文窗口中,预测动作块并采用后退视界控制执行。
创新点与贡献
- 密集视觉表征的直接引入:首次系统地展示了冻结的预训练 ViT 块特征可直接用于下游控制策略,无需任何编码器微调,在仿真和真实环境中均大幅优于全局池化特征。
- 块因果注意力掩码:提出一种简单而有效的注意力模式,在不大幅增加计算量的前提下,允许策略利用完整的空间块序列,同时严格保持时间因果性,为将时空 Transformer 应用于机器人控制提供了新范式。
- 高效性证明:Patch Policy 仅使用微调 VLA 约 0.7% 的参数量,推理延迟低至约 11 毫秒(VQ-BeT + DINOv2),且训练时间远低于大型 VLA,却能在多个任务上超越它们,彻底打破了 “密集特征必须伴随高昂代价” 的固有观念。
- 全面的视觉表征基准:对五种主流预训练视觉模型(DINOv2、DINOv3、WebSSL、V-JEPA2、SigLIP2)进行了系统评估,发现自监督预训练模型(尤其 WebSSL 和 DINOv2)最适合机器人操作任务,而语义对齐模型可能丢失必要的密集几何特征。
- 空间压缩对控制性能影响的实证:实验证明,无论是通过卷积压缩还是分块降采样,任何降低空间分辨率的方法都会显著损害策略性能,强调了细粒度空间信息对精密操作不可替代的作用。
实验结果分析
实验覆盖四个模拟环境(Push-T、LIBERO Goal、BlockPush、Cube)和三个真实机器人操作任务(电缆插入、收集笔、挂工具)。主要发现如下:
- 与全局特征策略的对比:无论在 VQ-BeT 还是扩散策略头下,使用 WebSSL 块特征的 Patch Policy 在需要精确空间推理的任务上(如 BlockPush 和 Cube)取得了显著提升(相对提升达 40% 以上),而在其他任务上至少保持竞争力。全局平均池化或[CLS]标记会使性能严重退化。
- 与现有块特征策略的对比:Patch Policy 在所有四个模拟环境上均优于微调的 OpenVLA-OFT(后者融合了 DINOv2 和 SigLIP 特征),尤其在 Cube 任务中(1.68-1.73 vs 1.50)。这证明,对于域内任务学习,轻量级冻结密集特征策略可以超越大规模预训练 VLA。
- 真实世界性能:在真实机器人实验中,Patch Policy 在三个任务上均优于所有基线。在最低公差的电缆插入任务中,成功率达到 0.70,远高于 OpenVLA-OFT 的 0.30 和 ACT 的 0.35,体现了闭环精密控制能力的优势。
- 视觉表征基准:跨任务的平均排名显示 WebSSL 和 DINOv2 是最鲁棒的视觉骨干。SigLIP2 由于侧重于语义对齐而表现不佳,说明机器人操作更依赖于几何和空间特征。
- 效率评估:使用 ViT-S 时,Patch Policy 总参数约 5155 万(其中可训练参数仅约 2949 万),而 OpenVLA-OFT 总参数高达 76.1 亿。推理延迟方面,VQ-BeT 变体仅需 11 毫秒,远低于 VLA 的 61.7 毫秒。训练成本(GPU 小时)也显著更低。
- 消融研究:块因果掩码相较于全注意力或朴素的标记级因果掩码更为有效;增加模型容量会不断提升性能,说明表征质量仍是瓶颈。
实践应用建议
基于本研究的发现,我们可以为机器人与具身智能领域的研究者和工程师提供以下实践建议:
- 直接使用预训练密集特征:对于需要精密操作的任务,应尽量避免对观测进行全局池化。推荐采用冻结的 WebSSL 或 DINOv2 作为视觉骨干,并将全部块特征输入策略,无需微调编码器。这能显著提升空间推理能力,同时大幅降低训练成本。
- 策略架构选择:Patch Policy 的块因果注意力设计是一种简单但有效的即插即用模块,可轻松集成到现有的 Transformer 策略(如 VQ-BeT 和扩散策略)中。在实施时,只需修改输入预处理和注意力掩码即可。
- 避免不必要的空间压缩:实验表明,卷积压缩或特征降采样会损害性能。在算力允许的情况下,应保持原始块分辨率,以保留精细视觉线索。仅在极受限制的嵌入式设备上才考虑压缩作为权衡。
- 视觉骨干选择:对于一般操作任务,优先考虑自监督预训练模型(如 DINOv2、WebSSL),而非视觉-语言对齐模型,除非任务高度依赖语言指令。同时可定期关注视觉表征领域的进展,因为策略表现与视觉骨干质量紧密相关。
- 效率与实时控制:若应用场景要求高频反应控制(>50Hz),VQ-BeT + 小型 ViT 的组合(如 ViT-S)可提供极低的推理延迟和可观的性能。扩散策略虽然鲁棒性更高,但迭代去噪过程导致延迟较大,可在任务精度要求极高时采用,并通过缩短动作预测窗口来补偿。
未来发展方向
尽管 Patch Policy 取得了显著成效,但仍存在改进空间。首先,目前视觉骨干保持冻结,未来可探索端到端微调以适配专用视觉域(如手术机器人或水下作业)。其次,密集标记增加了序列长度,引入如 FlashAttention 等优化技术可进一步加速训练和推理。此外,Patch Policy 目前仅限于行为克隆,将其扩展到强化学习范式,有望突破专家演示的性能天花板。最后,如何在多模态目标条件(如语言+图像)下更高效地融合密集特征也是一个值得探索的方向。
总结
Patch Policy 证明了即使没有庞大的生成式 VLM,仅通过直接消费预训练的密集视觉块特征,机器人策略也能实现卓越的操控性能。它在保持高效率和极低延迟的同时,大幅超越传统全局特征策略,并与大型 VLA 相匹敌甚至胜出。这一轻量级管线为机器人学习社区提供了一个简洁的入口,使不断进步的视觉表征研究成果能快速转化为高频率、高精度的现实世界操控能力。随着视觉基座模型的持续演进,Patch Policy 所倡导的 “密集特征优先” 的设计哲学,有望成为具身控制领域的标准范式。