从固定到自由相机:免标定的视角鲁棒视觉-语言-动作模型
论文信息
标题: From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model
作者: Wenhao Li, Xueying Jiang, Quanhao Qian, et al.
发布日期: 2026-07-06
arXiv ID: 2607.05396v1
PDF 链接: 下载 PDF
一、研究背景与动机
近年来,视觉-语言-行动模型(VLA)在通用机器人操控领域取得了长足进步,它们借助互联网规模的视觉语言数据与多样化的机器人示教,将高层语义知识直接映射为可执行的末端动作。然而,现有 VLA 模型普遍存在一个 “视角陷阱”:即使场景完全可见、任务目标不变,一旦部署时的相机视角偏离训练配置,成功率就会断崖式下跌。例如,基于 RLBench 的测试表明, 在训练视角下可达 65.3% 的成功率,而当相机仅旋转 15° 后便骤降至 6.3%。这一脆性源于标准 VLA 的参数化方式——模型强制在机器人基座坐标系下直接预测动作,但输入却是以相机视角拍摄的 RGB 图像。基座坐标系下的动作输出与相机坐标系下的视觉观测之间存在一个隐含的手眼变换矩阵,网络不得不将这些空间转换关系暗默地编码在权重中。一旦部署时的相机位姿偏离训练分布,隐式记忆的坐标映射就会失效,导致动作崩溃。
更棘手的是,真实世界的机器人部署几乎不可能维持训练时的固定相机位姿:传感器可能因碰撞而移位、被手持移动、或安装在持续漂移的移动平台上。现有工作试图通过 “告诉策略相机在哪里” 来弥补这一鸿沟,例如将动作表达在标定好的相机坐标系中、利用已知内外参合成规范视角、或借助光线嵌入来注入相机参数。然而,所有这些方法都依赖部署时已知且精确的相机外参,这恰恰是手持、漂移或重新安装相机时最先丧失的前提。换言之,当前所谓的视角鲁棒 VLA 在最需要鲁棒性的非结构化场景下反而最为脆弱。
作者因此提出了一个全新的思路:策略不应该被告知相机在哪,而是应该自己弄清楚。类似人类视觉引导操作中自我中心参照系与头-躯干位姿隐性理解的解耦,CamVLA 将 VLA 策略分解为两个可以仅从单张 RGB 图像中推理的子问题:(i) 相机中心动作生成,回答 “我该如何移动”,直接在相机局部坐标系预测末端动作;(ii) 相机视角几何定位,回答 “我从哪里看”,回归 6 自由度手眼矩阵。通过确定性几何变换将二者合成为基座坐标系动作,彻底解耦了操控控制与相机几何,使策略不再依赖外部标定、深度传感器或多视图信息。
二、核心方法:解耦几何与操控的 CamVLA 框架
CamVLA 的核心设计哲学是让视觉-行动映射与相机安装位姿彻底分离。标准 VLA 在时间步 接收视觉观测 、本体感知状态 和语言指令 ,直接输出基座坐标系下的位移增量 (位置、轴角旋转、夹爪状态)。这迫使网络从相机视角的图像特征中隐式推断手眼变换 ,导致几何与操控控制耦合。CamVLA 将这一过程重构为两个并行分支:
相机中心动作头(Action Head) 预测在相机坐标系下表达的相对动作 。由于视觉输入与动作输出共享同一自我中心参考系,视觉流(如图像中物体向左移动)与物理运动(沿相机局部 X 轴负向平移)天然对齐,从根本上避免了跨坐标系映射带来的冲突和歧义,使模型更容易泛化到新视角。
几何头(Geometric Head) 则从视觉特征中显式回归 6 自由度手眼矩阵 ,其旋转部分用轴角 表示,平移部分为 。该头是一个轻量级的三层 MLP,叠加在图像编码器的池化特征之上,仅带来 0.19% 的参数量增加和 1ms 的推理延迟(在 RTX 4090 上从 61ms 增至 62ms),对实时部署几乎零负担。
获得 和 后,通过确定的几何变换合成基座动作:,。关键之处在于,由于采用的是相对位移动,手眼变换中的平移部分 会在差分过程中消去,实际执行仅依赖于旋转分量 。这一数学性质使得即使平移预测存在较大误差,也不会影响最终动作的准确性,极大增强了系统对几何估计误差的容忍度。几何头的训练监督仅用于特征学习,测试时的平移漂移对物理执行无影响,而旋转误差只要控制在闭环策略的容错范围内(实验表明在 12° 噪声下仍能优于无几何信息的基线),就能保持稳健操控。
训练采用端到端多任务损失:,其中 继承基线 VLA 的动作预测目标(如 flow-matching), 为手眼矩阵的均方误差,权重 。整个框架仅需单张第三视角单目 RGB 图像,无需任何外部相机参数、深度图或新视角合成,真正实现标定自由、深度自由、单视图。
三、实验评估与结果分析
作者在 RLBench 仿真环境和 Franka 真实机器人上进行了全面验证。仿真中以 15° 间隔的离散视角训练,在 5° 网格的密集未见过视角上测试零样本泛化。将 CamVLA 插入 和 GR00T N1.7 两个主流 VLA 架构后,六项操作任务的平均成功率分别从 33.2% 提升至 51.4%(+18.2%)和从 28.4% 提升至 38.4%(+10.0%)。在 “滑动方块” 和 “关灯” 等视角变化敏感任务上,提升尤为显著,成功率从 18.3%→44.5% 和 29.8%→58.0%,证明解耦设计有效抵抗视角漂移。
真实世界实验采用三个测试相机,分别旋转 5°、10°、15° 以模拟传感器漂移。在 0° 规范视角下,CamVLA 分别以平均 79.0%(基线 63.3%)和 80.7%(基线 64.7%)大幅领先;在极端 15° 偏移下,基线模型成功率崩溃至 16.0% 和 14.7%,而 CamVLA 仍保持 29.3% 和 33.0%。手眼估计误差分析显示,15° 偏移时平移误差虽增至 27.16 cm,但得益于相对动作执行中平移项抵消,成功率并未完全崩塌;旋转误差仅 9.39°,仍在闭环策略容错范围内。此外,动态手持相机实验也展示了连续的视角跟踪与任务完成能力,进一步突显标定自由的实用价值。
消融实验揭示多个关键设计的作用:训练视角密度影响手眼估计精度,15° 间隔下旋转误差仅 1.41°,性能与使用真值外参相差不到 1%;将动作输出空间从基座坐标系切换到相机坐标系是带来最大增益的因素;利用图像编码器特征预测手眼比使用更深层的 VLM 特征空间定位更稳定(平移误差 4.7 cm vs. 14.7 cm),虽然 VLM 特征对应任务成功率略高(53.5% vs. 51.4%),但其在未见过视角间出现几何不连续,可能危及物理安全,因此作者仍选择图像编码器特征作为默认配置。
四、创新贡献与实践启示
本文的主要贡献可概括为三点:一是识别出当前视角鲁棒 VLA 方法对已知相机外参的普遍依赖及其在真实部署中的脆弱性,提出了自定位的替代范式;二是设计并实现了 CamVLA,通过相机中心动作头和手眼几何头解耦操控与几何,仅靠单目 RGB 即可实现标定自由、深度自由的视角鲁棒操控;三是通过仿真和真实机器人实验全面验证了方法的有效性与效率,并开源相关代码。
从实践角度看,CamVLA 为机器人操控系统的开发提供了重要启示。首先,舍弃对精确外参的依赖:很多实际场景中,机器人需要频繁变换工作环境,或相机被操作员随意移动,此时维护高精度手眼标定十分困难。CamVLA 的自预测机制使系统能在不中断任务的情况下自适应相机位姿变化。其次,轻量级几何头的低延迟特性使其可直接部署于消费级 GPU,适用于实时控制循环。再次,解耦的思想可以推广到多相机系统或腕部相机的视角扰动问题,未来可结合多视图信息进一步增强定位精度。
对于从事 VLA 模型开发的工程师,建议将动作参数化在相机坐标系而非基座坐标系,尽量使输入输出同构;同时添加辅助几何预测任务显式恢复手眼关系,可大幅提高对视觉扰动的鲁棒性。此外,训练时应保证足够的相机视角多样性,即便在稀疏视角下,几何头的辅助任务也能保持一定泛化能力。
五、局限与未来展望
CamVLA 目前仅利用第三视角相机,未考虑腕部相机扰动;在极端视角变化(如 45° 以上旋转)或高精度任务中,由于视觉特征越分布和手眼回归误差,性能仍会显著下降。未来可探索在更大视角变化下增强几何回归的鲁棒性,例如引入时序一致性约束或与在线手眼标定系统融合。同时,将框架扩展到多相机系统,处理不同模态传感器(如深度相机)的自标定,以及在高动态手持相机下实现更稳定的操控,均是值得深入的方向。
总而言之,CamVLA 将 “给定几何” 的旧范式转变为 “学习几何” 的新路径,使 VLA 模型向真正无标定、视角鲁棒的通用机器人操控迈出了坚实一步。