RoboVIP:利用视觉身份提示增强机器人操作的多视图视频生成
RoboVIP: Multi-View Video Generation with Visual Identity Prompting Augments Robot Manipulation
论文信息
标题: RoboVIP: Multi-View Video Generation with Visual Identity Prompting Augments Robot Manipulation
作者: Boyang Wang, Haoran Zhang, Shujie Zhang, et al.
发布日期: 2026-01-08
arXiv ID: 2601.05241v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决机器人操作数据在数量和环境多样性上难以规模化的问题,尤其是现有多数数据增强方法忽略多视角与时序一致性的需求。
- 核心方法:提出 RoboVIP,一种基于多视角视频修补的扩散模型,结合动作引导的分割、大规模视觉身份池和视觉身份提示(Visual Identity Prompting)来生成风格多样的增强数据。
- 关键结果:用 RoboVIP 增强的数据训练 和 Octo 模型后,在仿真环境中 平均成功率从 17.25% 提升至 29.0%,真实机器人堆叠任务在杂乱背景下成功率从 0/10 提升至 9/10。
- 主要局限:自动化流程依赖现有分割和推理模型,这些模型有时出现定位失败、幻觉和掩码错误,且仿真基准不完全支持多视角评估。
- 适合读者:从事机器人操作策略学习、视觉增强或可控视频生成的研究者,以及对 VLA(视觉-语言-动作)模型训练数据扩充感兴趣的工程师。
论文背景和研究动机
扩大机器人操作数据的数量、质量和环境多样性是训练有效策略的基础。然而,现实世界中采集操作数据受到硬件、标定和同步等约束,难以大规模复现不同场景。近年来的视觉增强工作,如 Rosie 和 RoboEngine,通过对观测图像进行修补(inpainting)来改变背景或桌面物体。这些方法大多在单帧、单视角的设定下运行,没有考虑当前主流策略模型(如 Diffusion Policy、Octo 和 )对多视角和时序历史的需求。很多任务需要更长的时间序列才能判断交互状态(如是否已经按下按钮),而多视角观测则提供更丰富的空间线索。因此,一个实用的增强框架必须以视频级别运行并支持多视角生成。此外,纯文本提示难以可靠地描述场景细节,论文通过视觉身份提示引入样本图像作为条件,以生成在语义和低级特征上与原场景一致的内容。
核心方法和技术细节
RoboVIP 的流程分为三步:首先,从多视角视频中分割出机械臂和交互物体,保留与动作轨迹一致的掩码区域。其次,利用大规模视觉身份池和文本提示作为条件,驱动多视角视频修补扩散模型生成新的背景和桌面内容。最后,将生成的增强视频与原始动作序列配对,用于下游策略训练。
动作引导的分割 为了自动提取机器人手臂和被操作物体的掩码,论文提出利用夹爪状态信号(1D 信号)确定机器人与目标物体发生交互的关键时间窗口,从而缩小搜索范围。对于腕部视角,先用视频推理 VLM(如 Cosmos-Reason1)获得物体语义标签;在其他第三视角下,直接复用该标签。接着,开放词汇分割模型(EVF-SAM)在关键帧给出掩码,再经 K-means 采样后的点提示,由视频分割模型 SAM2 追踪全序列的掩码,最终合并得到高质量的掩码条件。
多视角修补视频扩散模型 基础视频扩散模型选用 Wan2.1 720p 的图生视频变体,参数 140 亿。由于全量微调会导致严重遗忘和崩塌,论文采用低秩适配(LoRA)策略,在注意力层的查询和值矩阵中注入可训练参数,秩分别为 128 或 256,同时开放 patchification 编码层以更好地适应输入格式变化。为支持多视角输入,模型将同一时间步不同视角的掩码帧进行垂直拼接,并用通道级拼接替换原本的单图条件结构,使学习目标强制对齐视角并捕获空间一致性。
视觉身份提示 论文设计了一个自动构建百万级视觉身份池的管线。首先,用全景分割模型 OneFormer 提取常见桌面物体的掩码和类别标签,再通过裁剪、图像质量评估、清晰度分析、CLIP 图文相似度评分和分辨率过滤,筛选出高质量身份样本。这些身份图像被打包为一个帧,通过共享的因果 VAE 编码后,与视频的潜在表示在帧维度上拼接,进入 Diffusion Transformer 参与注意力计算。身份令牌不参与损失计算,仅作为上下文引导。训练时身份图像随机缩放以避免过拟合,且所有视角共用单一视角采样的身份参照,避免歧义。
创新点和贡献
- 多视角视频级增强框架:与单帧、单视角的先前工作不同,RoboVIP 能在时序一致的前提下同时改变多相机画面中的背景和桌面内容,适应现代 VLA 和 visuomotor 策略的训练需求。
- 视觉身份提示机制:引入样本图像作为条件,突破纯文本提示在描述低层级视觉细节时的不足,使生成的修补区域在语义和底层纹理上都更连贯、丰富。论文设计了零人工干预的自动身份池构建管线,大幅降低使用成本。
- 动作引导的自动分割策略:利用夹爪状态定位交互窗口,克服腕部相机因快速运动、窄视野导致的识别困难,提升了全流程的即插即用程度。
实验结果分析
论文在视频生成质量和下游策略性能两个维度展开评估。
生成质量(Droid 数据集 300 测试例) 如表 2,RoboVIP 的 FID 为 39.97、FVD 为 138.4,均显著低于 Cosmos-Transfer2.5(47.43、325.4)和 RoboEngine(62.77、1788.8)。跨视角匹配点数(MV-Mat.)达到 2242.1,远超其他方法,表明其生成的多视角序列具有更好的空间一致性。
仿真环境(SimplerEnv,每次任务 100 次试验) 用 BridgeData V2 微调后,Octo+SFT 平均成功率为 12.8%,而 Octo+RoboVIP(文本+身份提示)提升至 18.5%。 的表现更明显,零样本和微调基线分别为 12% 和 17.25%,+RoboVIP(纯文本)达到 29.0%,其中 “Put” 条件成功率高达 55.0%(见论文表 1)。分析表明,视频级别的增强让依赖历史帧的 Octo 能获得运动连续性,免除了单帧方法可能出现的帧间不一致问题;而对 而言,多视角设定与其预训练架构匹配,缩小了合成数据与真实数据的分布差异。更长的历史帧数实验则显示,当历史长度增至 6 帧时,RoboEngine 的成功率降为零,而 RoboVIP 仍保有显著成功率(见论文图 7)。
真实机器人实验 在法蓝卡机械臂的立方体堆叠任务中,仅用 100 条真机示例训练的扩散策略在杂乱场景下成功率为 0/10,而加入 RoboVIP 增强的 100 条数据后,成功率跃升至 9/10(见论文图 8),凸显其在低数据量下应对视觉干扰的强泛化能力。
实践建议
如果你的团队正在训练或部署操作策略,特别是多视角 VLA 或 Diffusion Policy,可以考虑以下方式将 RoboVIP 的方法落地:
- 构建即插即用的增强管线:参考其动作引导分割策略,利用夹爪状态信号自动定位交互窗口,避免人工标注。优先使用 SAM2 等视频分割模型扩展至全序列,以减少逐帧修复的工作量。
- 利用视觉身份池提升多样性:从现有操作数据集中自动提取桌面物体,建立身份库。在实际增强时随机采样身份图像,避免由纯文本生成导致的视觉单调或低质量内容。初始可从小规模的数据集起步,逐步扩大至百万级。
- 选择性微调大模型:当使用 Wan2.1 等大参数视频扩散模型时,采用 LoRA 适配并开放 patchification 层,能以远低于全量微调的计算成本实现视频修补。务必保持各视角的拼接形式与训练一致,以维持跨视角的空间对应关系。
- 结合历史帧需求:若下游策略依赖多历史帧,务必采用视频级增强而非单帧修补,否则在较长历史上下文下可能导致策略崩溃(如论文图 7 所示)。训练时可将生成视频与真实数据混合,比例可根据目标任务的复杂度调整。
- 仿真与真实数据混合验证:先在 SimplerEnv 等与真实场景纹理接近的仿真器中快速评估增强效果,再迁移至真机部署。对于尚未完全支持多视角的仿真平台,先用单视角验证生成质量,再过渡至真实多视角实验。