πR2:反应式实时流策略
$π\mathbf{R}^2$: Reactive Real-time Flow Policies
论文信息
标题: : Reactive Real-time Flow Policies
作者: Sungjae Park, Shubham Tulsiani
发布日期: 2026-07-28
arXiv ID: 2607.26055v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:现有的大规模机器人操控策略(如基于视觉-语言-动作模型 VLA 的流匹配策略)在预测动作时,由于大型骨干网络推理和多步去噪带来的高延迟,无法在动作执行期间对新的传感器输入作出反应,导致其在需要快速闭环控制的动态任务中表现不佳。
-
核心方法:通过两个核心修改使流匹配策略具备反应性和实时性:其一,将条件信号分离为异步更新的 “慢速通道”(视觉-语言特征)和每步刷新的 “快速通道”(本体感觉);其二,设计延迟自适应的流调度方案,将正在执行的动作作为修复条件,每次调用仅需一步去噪即可输出动作。
-
关键结果:在真实世界的 xArm6+XHand 平台上微调 GR00T-N1.7 模型后, 的闭环重规划速度约为基础策略的 (在 A5000 GPU 上可达 25 Hz,即每 40 ms 使用新观察量行动),并在仿真和真实世界操纵任务中分别将成功率最高提升 23% 和 30%(见表 1)。
-
主要局限:论文未处理模型本身之外的外部延迟源,如推理服务器与机器人客户端之间的通信延迟。同时,论文保持基础策略架构不变,未探索从架构设计上(如专门的注意力头)进一步强调本体感觉特征以增强反应性的潜力。
-
适合读者:对机器人学习、模仿学习、特别是希望在真实世界中部署反应灵敏、实时性强的流匹配或扩散策略的研究人员和工程师。对于关注 VLA 模型实际落地部署瓶颈的读者也极具参考价值。
论文背景和研究动机
近年来,基于大规模预训练骨干网络(如视觉-语言模型 VLM)的机器人基础模型取得了显著进展。这些模型通常采用三种设计范式:大型预训练骨干网络用于提取丰富的视觉和语言表征;表达性强的策略架构(如扩散和流匹配模型)来捕捉多模态动作分布;以及动作分块,即联合预测连续多步动作以提升时间一致性。
然而,这三者结合带来的计算负担造成了两个根本性问题:反应性受限和推理延迟高。在标准流程中,模型基于一个 “陈旧” 的观察量预测一个动作块,然后开环执行这个块内的所有动作。在此期间,机器人对不断流入的传感器信息 “视而不见”。尽管理论上可以缩短执行的子块长度并进行更频繁的重规划以恢复反应性,但庞大的感知-动作管线(大骨干网络处理 + 多次去噪迭代)的计算开销使得这一简单方案在现实中不可行。这使得现有的大模型策略不适合需要快速、平滑、反应灵敏的闭环控制的动态任务。
论文的核心驱动力正是在不牺牲大骨干网络、多模态表达能力和多步动作预测这三个设计原则的前提下,彻底解决反应性和延迟问题。
核心方法和技术细节
框架建立在流匹配和扩散强制(Diffusion Forcing)的基础上,通过两个核心贡献实现其目标。
1. 本体感觉反应式扩散强制
该工作的核心洞察是:并非所有输入模态都需要以相同的速率处理。本体感觉信号(关节位置、速度、力矩等)的获取和处理速度比图像或文本快几个数量级。对于动态任务,本体感觉足以进行局部反应性修正(如响应意外接触),而视觉和语言则提供全局粗略运动规划的背景。
为此,论文将用于动作去噪的条件信号(conditioning)解耦为两个异步更新的通道:
- 慢速通道:包含来自 VLM 和图像/文本编码器的视觉与语言特征。该通道在一个后台线程中异步更新,存在可变的延迟。
- 快速通道:包含本体感觉数据,在每个控制周期都使用全新的传感器读数。
在扩散强制的框架下,动作块前端的低噪声动作只需极少去噪步骤即可生成。结合上述通道分离,DiT 动作头在每次调用时仅执行一次去噪步骤,条件信号由新鲜的本体感觉和缓存的慢速特征构成。这使得策略能够利用高频率的本体感觉信号在动作块内部就做出反应,同时容忍视觉语言的延迟。为了在训练中模拟此机制,论文对慢速通道特征施加了随机延迟,并引入可学习的延迟嵌入,使模型能够根据视觉特征的陈旧程度调整其行为。
2. 延迟自适应的流调度
尽管单步去噪大幅降低了延迟,但实际系统中的延迟依然存在且会波动。为了适应这一情况,论文设计了一个由推理延迟 参数化的、具有三区域的阶梯式噪声调度方案 (见论文公式 3):
- 前部: 位置被 “夹紧” 为干净动作(),作为修复条件,代表正在执行的动作。
- 中部: 位置是从干净到纯噪声的线性斜坡。
- 尾部: 位置是纯噪声,用于在每周期的末尾补充新的噪声槽。
在推理时,单次去噪步骤会使整个调度向右 “滑动” 个位置,从而释放 个干净动作执行,并在末尾附加新的纯噪声。此设计使一个模型能够适应不同的硬件延迟。
创新点和贡献
- 感官模态的非对称处理:首次在 VLA 模型中明确提出并利用 “快速本体感觉” 与 “慢速视觉语言” 通道的分离。该方法使策略能对高频关节状态变化做出即时反应,实现了动作块内部的闭环控制。
- 可扩展的实时推理框架: 是一个即插即用的框架,只需对现有 DiT 风格的动作头进行一行代码的修改(按位置独立调节 AdaLN),即可从预训练策略微调。这在保持大规模预训练模型能力的同时,成倍提升了反应速度。
- 延迟自适应机制:提出的阶梯式噪声调度是扩散强制的一个泛化版本,它将 “在途” 动作作为修复条件,并能自适应于变化的推理延迟。这解决了因硬件、网络负载波动导致的动作不连续问题,保证了动作的平滑性和时间连贯性。
实验结果分析
仿真实验(Leap Cube Reorientation 任务):结果表明,标准流匹配策略的性能随开环执行步长 的增大而下降,证实了反应性对于动态任务的重要性。而 在一次去噪(NFE=1)仅使用最新观察量的情况下,性能即可匹敌使用更多去噪步但能以 高频重规划的标准策略。在引入模拟 VLA 级推理延迟的部署测试中, 的完整版本(同时使用异步处理和延迟自适应调度)在所有延迟设置下均显著优于 naive-async 和 Train-Time RTC 等基线方法(具体数字见论文图 3)。这归功于其大幅降低了端到端动作延迟,且性能仅随视觉延迟的增加而平缓下降。
真实世界实验(xArm6+XHand 平台,微调 GR00T-N1.7):论文在四个需要高度反应性的灵巧操控任务上(如不让球滚落的 “不洒落”、接住掉落书本的 “接书” 等)验证了 (见表 1)。结果显示, 在所有任务的成功率和子目标完成度上均优于所有基线,尤其是在 “整理书籍” 和 “插入盒子” 等反应性关键的任务上,成功率绝对提升超过 20%。关键的质性分析(论文图 5)揭示了性能提升的机制: 能在执行过程中根据实时的指尖接触力调整抓握力度,而基线方法则因反应迟缓、执行 “陈旧” 计划而导致用力过猛(如压力过大压垮书本)或错过接触时机。
实践建议
对于试图在真实世界中部署高性能 VLA 策略的从业者, 提供了几个可直接操作的工程指导:
- 分离计算管线:将视觉/语言骨干网络的处理与高频动作头解耦,并运行在独立的硬件线程或 GPU 上。这能最大限度地减少慢速通道对动作循环的阻塞。
- 利用本体感觉进行高频控制:在接触丰富的操作任务中,本体感觉(关节力矩、指尖力)是进行快速、柔性反应的关键信号。应确保策略架构能高频刷新并利用这些信号。
- 训练时模拟部署延迟:在训练阶段(尤其是微调阶段)对视觉特征施加随机延迟,并引入延迟感知机制(如嵌入层),能显著提升模型在真实世界中面对异步、滞后数据时的鲁棒性。
- 采用延迟自适应推理逻辑:实现一个能够根据系统实时延迟自动调整噪声调度和修复前缀长度的推理循环(如论文算法 2 所示),是保证动作连续性和实时性的关键,能有效应对硬件性能波动和网络抖动。