补丁策略:通过密集视觉表示实现高效具身控制

Patch Policy: Efficient Embodied Control via Dense Visual Representations

arXiv: 2607.18236v1

论文信息

标题: Patch Policy: Efficient Embodied Control via Dense Visual Representations

作者: Gaoyue Zhou, Zichen Jeff Cui, Ada Langford, et al.

发布日期: 2026-07-20

arXiv ID: 2607.18236v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:现代机器人策略通常将视觉观测压缩为单一的全局特征向量,虽然保留了高层语义,但丢失了对精细操控至关重要的空间细节;另一方面,能利用密集 patch 特征的大规模视觉-语言-行动模型(VLA)又过于庞大和缓慢。这篇论文要解决的核心问题是:能否在轻量级策略中直接利用预训练的密集 ViT patch 特征,既保留空间信息又不引入 VLA 的沉重计算代价?

  • 核心方法:提出Patch Policy——一种最小化的架构扩展,它通过 block-causal attention mask,让标准 Transformer 策略直接消费冻结的预训练 ViT 的密集 patch token 序列,而非全局池化后的单向量。同一个时间步内的所有 patch 互相可完全注意,跨时间步则严格保持因果性(见论文第 2.2 节)。

  • 关键结果:方法在 4 个仿真和 3 个真实环境上相对于使用全局池化特征的最先进策略平均提升 40%,同时以约 0.7% 的参数量超越经过微调的 OpenVLA-OFT 达 18%(见表 1、表 3)。

  • 主要局限:论文仅评估了冻结视觉 backbone 的方案,未探索端到端微调对特殊视觉域的适应潜力;密集 token 增加了序列长度和训练时间;当前仅在行为克隆框架下验证,未扩展到强化学习(见论文第 5 节)。

  • 适合读者:关注机器人模仿学习、视觉表征学习、具身控制的研究者;在资源受限场景下追求高性能机器人策略的工程师;对轻量级 VLA 替代方案感兴趣的从业者。

论文背景和研究动机

视觉 Transformer(ViT)已成为计算机视觉的事实标准架构。它们将图像切分为 patch 序列进行处理,天然保留了密集的空间和语义细节。与之形成鲜明对比的是,机器人学习领域长期存在两种次优范式:

范式一:全局压缩。在经典控制和强化学习中,视觉观测被压缩为全局特征向量——无论是 ResNet 的池化特征,还是 ViT 的 CLS token。这种激进的空间压缩造成了严重的信息瓶颈,摧毁了精细操控所必需的局部几何细节。

范式二:重量级 VLA。近年来,通过在大规模 VLM 上微调行动数据形成的 vision-language-action models 展现出强大性能,但从业者往往需要运行数十亿参数的 backbone,训练和推理代价高昂。即便存在一些优化技术,整体的计算负担依然相当可观。

研究者敏锐地指出一个被忽视的关键观察:密集视觉理解能力已经在互联网规模预训练的 ViT 中以开箱即用的形式存在了。例如 DINOv2、WebSSL 等模型,它们在海量无监督数据上学到的 patch 特征天然具备细粒度的几何理解和鲁棒的特征定位能力——这些恰是精确机器人操控所需要的。问题只是在于,现有策略架构没有直接消费这些密集特征的能力。

Patch Policy 正是基于这一洞察,试图回答:能否在轻量级策略架构中继承大规模视觉预训练的表征增益,而无需继承十亿参数生成模型的沉重代价?

核心方法和技术细节

Patch Policy 的架构设计遵循一个核心原则:以最小的改动让标准 Transformer 策略消费密集 patch 特征。整个框架由两个模块化部分组成。

观测主干(Observation Trunk)

给定输入图像 ot∈RC×H×Wo_t \in \mathbb{R}^{C \times H \times W},冻结的 ViT 编码器将其切分为 patches 并提取密集特征,得到形状为 P×DP \times D 的张量(PP 为 patch 数量,DD 为嵌入维度)。Patch Policy 直接取用所有 patch 特征,不做任何池化或压缩。对于一个长度为 TT 的观测上下文窗口,最终形成 T×P×DT \times P \times D 的特征序列。这一设计完全向后兼容:当 P=1P=1 时就退化为传统的全局池化策略。

对于目标条件的模仿学习,Patch Policy 支持图像目标或向量目标两种形式。如果目标是图像,则用同一个编码器编码后拼接到观测张量上,形成 T×P×2DT \times P \times 2D 的输入;如果目标是向量 g∈RGg \in \mathbb{R}^{G},则将其拼接到每个观测 token 上,形成 T×P×(D+G)T \times P \times (D+G) 的张量。

策略学习(Policy Learning)

这是 Patch Policy 最核心的技术创新。将 T×PT \times P 的 patch 特征展平为一个长度为 T×PT \times P 的序列后,添加可学习的 1D 位置嵌入,然后施加block-causal attention mask:

  • 帧内:同一帧内的所有 patch 之间保持完全双向注意力,允许模型在一个观测帧内部自由整合空间信息
  • 帧间:不同帧之间的注意力严格因果,确保时间维度上的自回归性不被破坏,保持策略的时序因果结构

这种设计巧妙地平衡了两个需求:空间信息的充分交互和时序决策的因果约束。论文的消融实验表明,相较于完全不加 mask 的 full attention 方案和将所有 patch 当作独立时间步的 token-causal 方案,block-causal 在多数(策略头,任务)组合上表现最优或持平,在 Diffusion Policy 的 Cube 任务上尤其显著——token-causal 方案因早期位置只能看到部分帧的 patch 而导致性能剧烈下降(见表 12)。

在训练时,策略处理 mask 后的序列,在每个帧的最后一个 patch token 处通过 action head 预测动作块。Patch Policy 对 action head 架构和训练目标保持充分灵活:实验中同时评估了使用混合分类-回归损失的 VQ-BeT 和使用去噪目标的 Diffusion Policy 两种主流方案。

创新点和贡献

1. 架构层面的最小化创新

Patch Policy 的架构扩展极为克制:它没有引入新的视觉编码器训练范式,没有设计复杂的特征融合机制,也没有要求对预训练模型进行任何微调。本质上,它只是改变了 Transformer 策略消费视觉信息的方式——从一个全局池化 token 变成一组 patch tokens,并相应地调整了 attention mask。这种 “做减法” 的创新思路使得方法具有极强的可推广性和即插即用特性。

2. 分离了 “密集表征” 与 “语言基础”

一个被论文清晰表达的洞察是:密集视觉理解不等于需要语言模型。VLA 之所以有效,很大程度上是因为它们保留了密集的空间特征,而非因为它们能做语言推理。Patch Policy 通过实验证明——用 0.7% 的参数量超越微调 OpenVLA-OFT 18%(见表 1、表 3)——对于领域内任务学习,直接用冻结的预训练视觉特征训练轻量策略,可以与重型的预训练 VLA 竞争甚至超越。这对于资源受限的研究团队和工业部署具有显著的现实意义。

3. 系统性基准研究

论文对五种最先进视觉表征(DINOv2、DINOv3、WebSSL、V-JEPA 2、SigLIP 2)在多个策略头和任务上进行了系统评估(见表 7、表 8)。关键发现包括:WebSSL 和 DINOv2 是非语言对齐方案中最鲁棒的编码器;SigLIP 2 因过度强调语义-语言对齐而牺牲了操控所需的密集几何特征;视觉表征的相对排序在不同策略架构和任务上保持高度一致——这说明表征质量而非下游策略架构,仍是当前机器人学习的瓶颈。

4. 空间压缩的破坏性效应的实验证据

论文直接验证了空间压缩对操控性能的损害。通过引入可训练的轻量卷积编码器对冻结的 DINOv2 patch 特征进行空间下采样,结果发现即使将 256 个 patch 压缩到 64 个,Push-T 任务的成功率也从 0.69 降到 0.52(见表 4)。这一证据有力地支撑了 “精细空间密度对精确控制至关重要” 的论断。

实验结果分析

仿真环境评估(表 1)

在四个仿真环境上,Patch Policy(使用 WebSSL patch 特征)一致性地展现了对全局表征 baseline 的优势,且这种优势在需要精确空间推理的任务上最为显著。

以 BlockPush 和 Cube 这两个多物体/空间推理任务为例:WebSSL Patch + VQ-BeT 在 BlockPush 上达到 1.68(全局 CLS 版本仅 0.77),在 Cube 上达到 1.68(全局 CLS 版本仅 0.23)。这两个任务要求策略精确理解物体之间的空间关系,全局池化特征的信息丢失使得策略几乎无法完成任务。而在相对简单的 Push-T 和 LIBERO Goal 上,patch 特征的增益虽然相对温和,但也保持了竞争力。

值得注意的是,Patch Policy 在所有四个环境上均超越了微调后的 OpenVLA-OFT——后者使用了融合 DINOv2 和 SigLIP 的 channel-fused patch 特征,并构建在 Llama-2 7B 主干上。

真实世界精确操控(表 2)

三个真实任务的设计分别测试不同维度的能力:Cable Insertion 要求~2mm 公差的精密插入,Pen Collection 要求长时程多物体操控,Tool Hanging 要求接触丰富的悬挂操作。

Patch Policy 在 Cable Insertion 上取得 70% 的完全插入成功率(对比 CLS baseline 的 60% 和 OpenVLA-OFT 的 30%)。论文观察到,OpenVLA-OFT 经常在接近插座时卡住——这表明这些失败主要源于接触后的细粒度闭环控制,而非任务级语义理解。这一观察恰好印证了论文的核心论点:对于精密操控,密集空间信息比语言理解更重要。

计算效率(表 3)

Patch Policy - VQ-BeT(DINOv2)拥有 51.55M 总参数、29.49M 可训练参数,推理延迟仅 10.99ms;而 OpenVLA-OFT 的总参数为 7.61B,可训练参数 177.90M,推理延迟 61.71ms。更重要的是,Patch Policy 甚至可以用 ViT-S 变体将总参数降到接近 VQ-BeT baseline 的水平,同时保持性能优势。训练成本方面,Patch Policy 在 1×L40S 上收敛需 6.5 GPU 小时,而 OpenVLA-OFT 需 4×L40S 共 16 GPU 小时。

视觉表征的系统基准(图 5、表 7、表 8)

跨四个任务的平均性能排序显示 WebSSL 和 DINOv2 整体最优,V-JEPA 2 在某些任务上表现不错但在 LIBERO Goal 上明显落后(0.86 vs 0.96),SigLIP 2 则在所有任务上系统性地表现不佳。论文给出的解释值得关注:SigLIP 2 的语义-语言对齐训练目标可能牺牲了对操控至关重要的密集几何特征——这揭示了一个更广泛的问题,即当前流行的多模态 pre-training 方案未必是机器人学习的最优视觉 backbone 选择。

实践建议

基于论文的实验分析和消融研究,以下建议对于在实际工程中应用 Patch Policy 具有较强的指导意义:

1. 视觉编码器选择:优先考虑 WebSSL 或 DINOv2 作为冻结的视觉 backbone。这两者在多个任务和策略头上表现最为鲁棒。如果应用场景主要涉及精确的空间推理和接触丰富的操控,应避免使用过度偏向语义-语言对齐的模型(如 SigLIP 2),因为它们的训练目标可能牺牲了密集几何特征的质量。

2. 保持 patch 特征的原生分辨率:除非硬件条件极端受限,否则不建议对 patch 特征进行空间压缩。论文的表 4 直接证明,任何形式的降采样都会立即损害控制性能。如果必须权衡计算开销,考虑减小观察窗口长度 TT 而非压缩空间分辨率,可能是更好的折衷方向。

3. 策略头架构的选择:如果应用需要极低延迟(<15ms),VQ-BeT 组合明显优于 Diffusion Policy——后者的延迟瓶颈来自迭代去噪过程而非视觉处理(表 3)。Diffusion Policy 更适合对批量和离线推理有需求、可以接受数百毫秒延迟的场景。

4. 模型大小的缩放策略:表 13 的消融显示,Patch Policy 的性能随 Transformer 骨干的层数、头数和嵌入维度单调增长。在实践中,可以从较小的配置(如 4 层、64 维嵌入)开始快速迭代验证可行性,然后在部署前扩展模型规模以获取额外性能增益,这种渐进策略能显著加速开发效率。

5. 训练时的数据与效率考量:预计算并缓存冻结视觉编码器的输出能显著加速训练——这是 Patch Policy 相较需要(部分)微调 encoder 的方案的核心工程优势。整个训练仅需单块 L40S GPU 和 6.5 小时(见论文 3.6 节),这使得学术实验室甚至个人研究者都能复现和迭代该方案,无需依赖大规模 GPU 集群。