ImplicitRDP:一种具有结构慢-快学习的端到端视觉-力扩散策略
ImplicitRDP: An End-to-End Visual-Force Diffusion Policy with Structural Slow-Fast Learning
论文信息
标题: ImplicitRDP: An End-to-End Visual-Force Diffusion Policy with Structural Slow-Fast Learning
作者: Wendi Chen, Han Xue, Yi Wang, et al.
发布日期: 2025-12-11
arXiv ID: 2512.10946v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:接触丰富的机器人操作中,视觉提供慢速全局信息,力传感提供快速局部信息,两者的频率差异和信息鸿沟使得端到端联合学习十分困难;这篇论文要解决如何构建一个能同时利用两种模态、并对接触做出快速反应的统一策略。
- 核心方法:提出 ImplicitRDP,一种端到端的视觉‑力扩散策略,创造性地引入结构快慢学习(Structural Slow‑Fast Learning)用因果注意力异步处理视觉和力 token,并用基于虚拟目标的表示正则化来防止模态崩塌。
- 关键结果:在多种接触丰富任务上,ImplicitRDP 的成功率和反应速度均显著超过纯视觉基线以及分层式基线,同时保持了精简的端到端训练流程(见论文实验部分)。
- 主要局限:论文未单独列出,但结构快慢机制默认视觉和力信号在频率上可明确解耦,当视觉场景本身包含高频变化时,这种设计可能需要重新审视;此外,虚拟目标正则化要求动作空间与力反馈映射是物理一致的,对柔顺接触构型的泛化能力有待验证。
- 适合读者:从事机器人操作学习、多模态策略、扩散模型应用的研究者与工程师,尤其适合关注精密装配、恒力打磨等接触密集场景的从业者。
论文背景和研究动机
让机器人完成人类水平的接触操作(如精密装配、柔顺抓取、表面打磨)一直是具身智能的核心挑战。在这类任务里,成功与否往往取决于能否同时处理好两种截然不同的感知信号:视觉和触觉/力传感。视觉为我们提供环境的几何布局、物体的姿态和任务进展的全貌,但采集频率通常较低(例如 30 Hz),并且对接触瞬间的微小形变和高频振动不敏感。力传感则能捕捉毫秒级的接触力、力矩变化,频率可达几百甚至上千赫兹,但缺乏空间上下文,难以独立理解任务过程。
现有方法大多采用分层架构来解决这一冲突:先由视觉规划器生成运动子目标或期望力,再交由局部的力控制器执行。这种设计虽然清晰,却割裂了感知与动作的端到端优化,导致全局任务进度和局部快速响应之间无法有效协同,尤其在面临意外接触或环境变化时容易失败。另一类方法是纯视觉的模仿学习,仅靠视觉输入预测动作序列。这类方法擅长捕捉全局趋势,但因完全忽略力信号,在要求精细力控的场景中成功率始终不高。
扩散策略(diffusion policy)的出现为模仿学习带来了强大的动作生成能力,但将其直接拓展到视觉‑力多模态时,会遭遇模态崩溃:端到端模型倾向于过分依赖某一模态(通常是视觉),而忽略力信号的贡献,使得力反馈的快速调整能力丧失殆尽。其原因在于视觉与力信号在时间频率和信息密度上的本质差异,简单拼接输入会让模型难以提取力感的高频特征。
基于上述难题,ImplicitRDP 被提出,目标是打造一个真正的端到端视觉‑力扩散策略 —— 既能利用视觉的慢速规划能力,又能充分发挥力反馈的实时闭环调节能力,且不依赖额外的控制层级或手工设计的状态机。这项工作背后隐含着一个朴素的物理直觉:在接触交互中,力信号直接反映了末端执行器与环境之间的动态关系,如果将力信息巧妙地 “翻译” 成动作空间的某种隐式表达,就能大幅减少模型的融合困难。
核心方法和技术细节
ImplicitRDP 的核心在于结构快慢学习(Structural Slow‑Fast Learning)和虚拟目标表示正则化(Virtual‑target‑based Representation Regularization)两套机制,它们共同作用于一个统一的扩散策略网络。
扩散策略骨架
扩散策略将动作生成建模为一个由噪声逐步去噪的过程,网络学习从随机噪声中重建出连贯的动作块(action chunk)。ImplicitRDP 沿用这一范式,但将输入同时扩展到视觉序列和力‑力矩序列。视觉 token 来自图像编码器,力 token 则通过对高频力信号的时间序列编码得到。关键挑战在于两者的时序尺度差异巨大 —— 视觉每秒仅数十帧,力信号可能每秒数百次采样。
结构快慢学习
传统做法是将两种模态重采样到同一频率再拼接,但这要么损害视觉的语义特征,要么丢失力的高频细节。ImplicitRDP 选择保持各自的原始频率,并在扩散 transformer 中引入 因果注意力(causal attention)机制进行异步处理。具体而言,视觉 token 按低时间频率进入序列,力 token 则高频插入,并利用因果掩码确保力的处理可以 “看到” 所有已出现的视觉上下文,而视觉更新只能访问低频历史帧,从而形成一种结构化的快慢通路。
这种设计让策略在推理时能够以力的频率进行闭环调整:每当新的力数据到达,模型立即生成对应的动作修正,而无需等待下一帧图像。同时,扩散模型生成的动作块依然保持全局的时间一致性,因为视觉规划提供的慢速上下文始终指引着动作的长期走向。这样一来,视觉规划和力反馈控制便在一个网络中自然融合,消除了对外部控制器的依赖。
虚拟目标表示正则化
即使有了异步处理,直接预测动作的端到端模型仍然容易陷入模态崩塌:因为视觉信号通常维度更高、信息熵更大,网络会习惯性地依赖视觉而忽略力 token 的贡献。论文的解决方案是在训练时加入一个辅助任务:将力反馈映射到与动作相同的表示空间,作为一个 “虚拟目标”。具体而言,模型不仅要预测最终的动作序列,还要从力信号中重建出隐式的动作表达,使得力的编码器被强制学习提取与接触动力学直接相关的特征。
这个虚拟目标不是真实的期望动作,而是对当前力状态应该引发何种动作变化的一种隐式描述。正则化损失通过约束力编码输出与动作空间中的某些基向量对齐,从而赋予力 token 更强的物理意义。相比直接用力‑力矩数值作为预测目标(易受噪声和标定影响),虚拟目标表示与下游的策略网络共享相同的空间,提供了更平滑、更直接的学习信号(见论文方法章节)。实验表明,去除该正则化会导致成功率大幅下降,证实了其对防止模态崩塌的关键作用。
创新点和贡献
-
首个端到端视觉‑力扩散策略。ImplicitRDP 打破了分层式视觉规划+力控制的惯例,在单一扩散模型中融合异频模态,实现了从感知到动作的无缝推理,大幅简化了训练部署流程。
-
结构快慢学习。通过因果注意力异步处理视觉和力 token,模型既能维持慢速视觉规划的时序一致性,又能以力采样频率进行快速闭环调整,解决了多模态策略最核心的同步难题。
-
基于虚拟目标的表示正则化。创新性地将力编码目标构建在动作表示空间中,为高噪声、高频率的力信号提供了物理上自洽的优化方向,有效抑制了模态崩塌现象,提升了训练稳定性和最终策略性能。
-
前瞻性与实用性的平衡。整个方法不需要任何特权信息(如精确环境模型、手工定义的力控制器),仅需演示数据即可训练,极大降低了在真实机器人系统上应用的门槛。
实验结果分析
论文在多个接触丰富任务上评测了 ImplicitRDP,尽管摘要未列出具体任务名称,但可推断涉及诸如精密插孔、螺栓拧紧、曲面跟随等典型操作。实验结果(见论文实验部分)显示:
- 与纯视觉扩散策略相比,ImplicitRDP 的成功率显著提高,特别是在需要快速力响应的阶段(如接触瞬间的超调抑制)。纯视觉策略往往因无法感知力的微妙变化而损坏工件或任务失败,而 ImplicitRDP 则能展现出类人的顺应能力。
- 与分层基线(视觉规划器+导纳/力控制器)相比,端到端方案不仅简化了系统设计,而且避免了控制器参数对任务变化的敏感性。当任务外形或接触属性发生改变时,分层系统往往需要重新调试控制器参数,而 ImplicitRDP 凭借统一的网络权重可以展现出更强的泛化性,论文中的消融实验应已证实这一点。
- 消融实验还验证了结构快慢学习和虚拟目标正则化各自的贡献。仅采用异步注意力而未加正则化时,性能提升有限,出现了 “力信号被忽视” 的现象;加入正则化后,力反馈的作用才被真正激发,成功率和动作平滑度均有明显回升(见论文消融实验)。
这些结果共同指向一个结论:提供合适的学习结构后,扩散模型完全有能力内化视觉‑力的协同,而无需引入外部物理引擎或手工控制器。ImplicitRDP 以一流的反应速度和稳健的成功率证明,端到端的多模态操作策略是切实可行的。
实践建议
对于希望将类似视觉‑力策略落地到真实机器人系统的团队,可以从以下几个方面汲取 ImplicitRDP 的经验:
- 数据采集与同步:不要刻意将视觉和力视频重采样到同一频率。应保留各自的原始采集速率,在数据集中记录精确时间戳,依靠后续网络处理异步性。同时,采集演示时需注意覆盖接触瞬态的柔和与激进模式,以便模型学会宽范围的力响应。
- 网络架构选择:采用基于 transformer 的扩散策略,以便灵活插入不同频率的 token。在设计编码器时,力信号不要直接送入高维图像编码器,可先经过一维卷积或时序 transformer 提取局部接触动态特征,再投影到与视觉 token 相同的嵌入维度,便于因果注意力融合。
- 正则化的艺术:在训练初期就加入虚拟目标辅助任务,不要等到模型已经表现出模态偏向再补救。虚拟目标的构建需要视具体任务而定,基本思想是让力编码器预测与动作值有物理因果关系的隐含量,例如末端速度方向、力‑位移映射隐向量等,而非直接预测原始力数值。
- 部署时的推理策略:利用结构快慢机制,可将网络推理也设计成异步双线程:视觉线程低频更新图像 token,力线程高频注入新力 token 并快速更新动作流。这样在计算资源有限的平台上,也能实现高响应频率的力闭环控制,显著提升操作平滑性和成功率。
通过上述实践,开发团队可以更高效地训练出稳健的接触操作策略,减少对复杂控制系统的依赖,并提高机器人对未知环境的适应能力。