Surgical WAM:一种用于数据高效手术机器人学习的世界-动作模型
Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning
论文信息
标题: Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning
作者: Wenrui Bao, Tianyun Jiang, Zhiben Chen, et al.
发布日期: 2026-08-11
arXiv ID: 2608.11204v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:在固定动作标注演示预算下,无动作标签的内窥镜视频预训练能否提升闭环手术机器人操作能力?
- 核心方法:提出 Surgical WAM,基于 Cosmos Policy 的世界-动作模型,先仅用无动作视频学习手术视觉动态,再在固定动作标注数据上联合微调视频预测与动作块预测,并以滚动时域方式闭环执行。
- 关键结果:在 SurRoL 四个模拟手术操作任务中,视频预训练将平均成功率从 63.5% 提升到 77.8%,其中 PegTransfer 绝对提升 20 个百分点(表 1)。
- 主要局限:闭环评估主要限于 SurRoL 仿真环境,真实 JIGSAWS 视频只报告了定性趋势;视频预训练模型在更长微调步数下出现退化,作者推测是过拟合(表 2)。
- 适合读者:手术机器人学习、世界模型、视频预训练、数据高效机器人控制相关的研究者和工程师。
论文背景和研究动机
手术机器人学习长期受限于动作标注数据的稀缺。dVRK 等遥操作演示需要专门硬件、专家操作和同步运动学记录,成本远高于单纯内窥镜视频采集。论文提出一个关键问题:在动作标注演示预算固定的情况下,无动作标签视频预训练能否改善下游闭环操作?
现有手术世界模型主要用于两个分离场景:一是生成视频来评估外部训练策略,二是在多阶段管线中生成合成数据,再由逆动力学模型产生伪运动学标签。这些方法没有充分利用世界模型与动作预测之间的共享表征,也未直接驱动闭环控制。论文认为,世界-动作模型(World-Action Model, WAM)可以统一视频预测与动作生成,使视频预训练得到的视觉动态表征直接服务于动作预测,从而绕开动作标签稀缺问题。
核心方法和技术细节
Surgical WAM 建模联合分布:
其中 是内窥镜 RGB 帧, 是 dVRK 本体感觉状态, 是任务嵌入, 表示未来视频预测长度, 表示动作块长度。模型基于 Cosmos Policy 的潜在视频扩散架构,在同一潜在序列中放入视频、状态、未来预测和动作 token,由一个共享网络处理。
训练分两阶段。Stage 1 只使用无动作视频,仅优化视频扩散损失,动作和状态槽被屏蔽。Stage 2 在固定动作标注数据上微调,将动作块与未来预测 token 插入同一序列,并以相同扩散时间步联合去噪。动作和未来预测共享注意力与视觉预测参数,使动作预测被锚定在 Stage 1 学习到的视觉动态表征上。推理时,模型一次预测长度为 的动作块与对应未来视频,执行前 个动作后重新观测并重规划,形成闭环。
创新点和贡献
论文的第一个贡献是将 WAM 范式引入手术机器人学习。与现有手术世界模型不同,Surgical WAM 不依赖单独策略网络、逆动力学模型或合成数据管线,而是直接在单个生成模型中输出可执行动作并驱动闭环执行。
第二个贡献是通过受控实验回答了中心问题:在相同动作标注预算下,视频预训练提高了闭环成功率。论文用同一架构、同一动作标签数据,仅改变是否进行 Stage 1 视频预训练,因此可以将结果归因于预训练初始化带来的视觉动态先验(第 4.2 节)。
第三个贡献是刻画了收益边界和失效条件。消融显示,视频预训练模型以一半微调步数达到更高峰值;在接触丰富与双手任务上收益更大;但在过长微调步数下性能退化,作者推测为过拟合(第 4.3 节)。
实验结果分析
在 SurRoL 四个任务上,Surgical WAM w/ PT 的平均成功率为 77.8%,领先于 w/o PT 的 63.5%(表 1)。PegTransfer 从 66% 提升到 86%,绝对提升 20 个百分点;Needle Regrasp 从 50% 到 62%,BiPeg Transfer 从 42% 到 64%。论文指出,收益最大的是接触丰富和双手任务。
对比基准中,π0.5 在四个任务上约为 22.3% 的平均成功率,ALOHA 在 PegTransfer 仅 14%,Diffusion Policy 仅 2%。论文认为,语言条件下的通用动作解码不足以捕捉外科所需的细粒度视觉动态,而 Surgical WAM 在动作预测中显式引入视觉世界建模(表 1)。
微调步数消融显示,w/ PT 在 80k 步达到峰值 86%;w/o PT 需要 160k 步才达到 79%(表 2)。w/ PT 在 120k 和 160k 步下降至 34% 和 56.5%,论文将此归因于对有限演示的过拟合。执行 horizon 消融中,w/ PT 在 时为 86%, 时为 70%, 时为 80%;w/o PT 在 时最高为 66%(表 3)。真实 JIGSAWS 视频上的两阶段训练也观察到相似趋势,说明该收益不是单纯的仿真渲染产物(第 4.4 节)。
实践建议
对于手术机器人团队,可以考虑调整数据策略:优先收集和整理无标注内窥镜视频,用 Stage 1 训练视觉动力学;将稀缺的动作标注数据全部留给 Stage 2 微调。在本次 SurRoL 受控设置下,这种策略没有增加动作标注成本,但显著提升了任务成功率(表 1)。
落地时需要注意几个经验性结果:第一,微调步数不应无限制增加,w/ PT 模型在 80k 步后已经开始退化,因此需要根据验证任务成功率早停(表 2)。第二,执行 horizon 在 SurRoL 设置下是平衡选择,但不同任务可以扫描 ,因为 w/ PT 模型对执行 horizon 更稳健(表 3)。第三,该收益在 Needle Pick 这类相对简单的任务上很小,但在 BiPeg Transfer、PegTransfer 等接触丰富或双手任务上更明显,因此资源应优先投向这些任务。
还需注意,这些结论来自模拟 benchmark 与有限真实视频观察,不能直接推广到真实外科操作。在真实手术场景中部署前,应补充真实 dVRK 闭环评估,并验证视频预训练初始化对组织变形、遮挡和照明变化的泛化能力。