从固定到自由相机:免标定视角鲁棒视觉语言动作模型
From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model
论文信息
标题: From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model
作者: Wenhao Li, Xueying Jiang, Quanhao Qian, et al.
发布日期: 2026-07-06
arXiv ID: 2607.05396v1
PDF 链接: 下载 PDF
从固定到自由的相机:免标定、视角鲁棒的视觉-语言-动作模型
3 分钟速览
研究问题:视觉-语言-动作模型在训练时依赖固定相机,当部署时相机位置发生哪怕轻微偏移(例如 15 度),成功率和泛化能力就会严重衰退。论文旨在解决这种对相机视角的脆弱性。
核心方法:提出 CamVLA 模型,将策略解耦为两个并行模块:(i) 在相机坐标系中直接预测末端执行器动作;(ii) 从单张 RGB 图像中预测一个 6 自由度的手眼矩阵。最终通过一个确定的几何变换将相机坐标系动作转换回机器人基座坐标系执行。
关键结果:在真实机器人实验中,相机偏移 15 度的极端情况下,CamVLA 的成功率保持在 29.3% 和 33.0%,而基线模型的数据则严重下滑至 16.0% 和 14.7%。
主要局限:模型仅限单个第三方相机,不处理腕部相机变化。在极端视角变化和高精度任务下,仍会因视觉特征超出分布和手眼矩阵回归误差而出现性能严重下降。
适合读者:从事机器人操作、具身智能,尤其是关注模型在真实环境中动态部署、相机视角泛化问题的研究人员和工程师。
论文背景和研究动机
当代的视觉-语言-动作模型融合了互联网规模的视觉-语言预训练知识和多样化的机器人示教数据,旨在将语义理解直接转化为可执行的物理动作。然而,一个鲜少被公开讨论的脆弱性在于:它们对相机视角的偏移极其敏感。论文作者在 RLBench 模拟环境中进行的实验揭示了一个令人生畏的数字——一个基于 架构训练的策略,在训练视角下能达到 65.3% 的成功率,而当相机仅仅旋转 15 度后,其表现便急剧下降至 6.3%。
这一崩塌式下降的结构性根源,在于标准 VLA 模型将视觉输入与动作输出错误地对齐。它们通常会强行要求一个从相机视角的观察到机器人基座坐标系动作的隐式映射。这使得网络必须内部 “死记硬背” 一个手眼变换矩阵,这个矩阵隐含了相机与机器人基座之间的空间几何关系。训练数据若视角单一或固定,模型对这个几何关系的内部估计便会过度拟合。当部署时的相机位姿与训练分布发生丝毫偏离,这个被网络权值隐式编码的手眼关系便瞬间失效,导致策略崩溃。
该领域近期的改进工作不约而同地采取了一种 “告知” 策略:通过提供已知且精确的相机外参,将相机几何关系显式地作为输入条件。这类方法虽然有效,但它们恰好是在最需要视角鲁棒性的真实部署场景中最为脆弱——因为一个被人手持、被意外碰撞或持续漂移的相机,其精确的外参恰恰是无法获知的。由此,论文提出了一个根本性的论点转变:策略不应该被告知相机在哪里,而应该自己从单目 RGB 图像中 “看” 出来。这一理念直接对标了人类认知中 “以我为中心” 的运动规划与 “以物为中心” 的空间感知能力之间的解耦。
核心方法和技术细节
CamVLA 的核心思想是执行一个概念上的因式分解:将 “我应该如何移动” 的以相机为中心的动作生成,与 “我正从哪个视角看” 的相机透视几何定位完全分离开。
架构由两个并行工作的专用头组成。其一是动作头,它不再预测传统 VLA 中的基座坐标系动作,而是预测一个定义在相机本地坐标系下的增量动作 。其二是几何头,它从相同的视觉特征中回归一个 6 自由度的刚体变换矩阵 ,即手眼矩阵,显式地描述了相机坐标系到机器人基座坐标系的相对位姿。
此设计的精妙之处,体现在一个确定性的几何变换步骤中。当动作头输出在相机坐标系下的相对位移向量 和轴角表示旋转向量 后,它们作为自由向量,其到基座坐标系的转换独立于几何头所预测的手眼平移分量 ,而仅与预测的旋转矩阵 有关:
这一数学性质具有至关重要的意义:尽管训练时几何头同时被监督学习预测平移 和旋转 ,但在部署推理时, 的估计误差在相对运动的执行中被物理性地抵消了,对动作执行没有实际影响。这极大地减轻了视角估计的负担,将错误源严格限制在 的旋转精度上。
此外,该方法实现了真正的 “免标定、无深度” 部署。整个推理过程仅需单张单目 RGB 图像和一条语言指令作为输入。不需要任何外部提供的相机内/外参标定结果,也无需深度传感器或新视角合成,这与其他依赖已知几何结构的视角鲁棒方法形成了鲜明对比。其轻量级几何头仅需额外的 630 万参数,相比基础模型增加 0.19%,推理延迟仅增加 1 毫秒,从而保证了其在实时部署中的可行性。
创新点和贡献
CamVLA 工作的贡献是多维度的。其首要贡献在于理念范式的革新:首次明确指出并系统性地挑战了现有视角鲁棒 VLA 工作所共享的 “需要已知外参” 这一脆弱前提,转而论证并实现了一条 “自定位” 的技术路径。这种从 “被动告知几何” 到 “主动学习几何” 的转变,是使机器人策略从受控实验室环境迈向动态、无结构现实世界的关键一步。
其次是优雅而高效的解耦架构。论文并未引入复杂的 3D 重建或新视角生成管道,而是用极简的模块化解耦,将错综复杂的跨坐标系映射问题,转变成一个在相机局部坐标系内的直观视觉-动作对齐问题和一个相对低维的位姿回归问题。这种设计不仅实现了端到端训练,而且得益于前述的相对动作变换性质,对几何头的平移误差具有天然的免疫力。
在实验验证上,论文的贡献体现为全面且严格的基准评估。它不仅涵盖了基于 RLBench 的模拟基准测试,涵盖了在 “离散视角训练,密集视角测试” 设置下的零样本泛化,还在真实世界的 Franka Research 3 机器人上,针对五种常见的家庭操作任务,在相机被主动旋转至不同角度的情况下进行了验证。结果显示,CamVLA 作为即插即用的框架,成功赋能了两种强大的基线模型。它将 和 GR00T N1.7 在模拟环境中的平均成功率绝对提升分别达到了 18.2% 和 10.0%。
实验结果分析
论文的实验设计精炼,直接围绕 “视角鲁棒性” 这一核心问题展开。在仿真实验部分,相机围绕机器人基座从 到 以 间隔采样进行训练,并在 间隔的更密集网格上进行零样本泛化测试。结果表明,当训练与测试视角分布产生差异时,CamVLA 的优势是压倒性的。例如,在 Slide Block 和 Lamp Off 这类对几何理解要求极高的任务上,CamVLA 相比 基线的提升均超过 28 个百分点(分别从 18.3% 到 44.5%,以及从 29.8% 到 58.0%)。通过 “相对性能下降” 指标的消融实验进一步证明,在 的相邻视角区间,基线的性能下降高达 20.8%,而 CamVLA 仅为 0.9%,展现出非常出色的视角不变性。
真实机器人实验的结果则揭示了另一个关键发现:CamVLA 不仅在新视角下的鲁棒性更强,甚至在标定的初始视角下,其绝对性能也优于基线。在视角未发生偏移时,CamVLA 将基线模型 60% 左右的平均成功率提升至约 80%。当相机偏移到极端的 时,基线的平均成功率系统性地崩跌至 15% 水平,而 CamVLA 仍能维持约 30% 左右的成功率。针对几何头精度的分析,论文也给出了客观的量化:在 的相机偏移下,其旋转误差达到 9.39 度,平移误差 27.16 厘米,这解释了在极端角度下模型性能依然有所下降的原因。
局限与待解决问题
尽管 CamVLA 实现了概念上的突破,但论文并未回避其局限性,这为我们指出了未来的改进方向。
首先,模型的鲁棒性边界是有限的。论文明确指出,虽然它在常规的 内相机扰动下表现优越,但 “在极端视角变化和高精度任务下”,它依然会失败。如表 5 所示的消融实验表明,当训练视角以 的大间隔采样时,即使引入了 CamVLA 框架,模型在未见视角的成功率也仅能达到 20% 左右,伴随着高达 的旋转估计误差。这表明,当新视角的视觉外观与训练集差异过大时,几何头的定位误差仍然会恶化到足以颠覆整个策略的水平。
其次,该方法当前的应用场景是受限的。它仅能为单个第三方视角相机提供鲁棒性,而没有考虑在例如移动操控平台等多相机系统中常见的腕部相机视角变化。这是该架构的一个固有局限,因为它处理的问题是 “相机-机器人基座” 的关系,而并未对相机本身的移动(例如,固定在机器人本体某处的相机)提供普适的解决方案。
最后,一个实际部署中的考量来自于几何头的特征源选择。论文通过消融实验发现,虽然使用更深层的 VLM 骨干特征可以将任务成功率略微提高(51.4% vs 53.5%),但会导致手眼矩阵估计的严重不稳定,在未见视角产生大幅度的定位跳跃。为了保证物理机器人执行的安全性,论文最终选择了定位更连续、平滑但成功率稍低的图像编码器特征。这一权衡揭示了视觉表征学习与精确空间定位任务之间的内在矛盾,也是构建更安全、更稳定的免标定系统的核心挑战之一。