TempoVLA:学习速度可控的视觉-语言-动作策略
TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies
论文信息
标题: TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies
作者: Dong Jing, Jingchen Nie, Tianqi Zhang, et al.
发布日期: 2026-06-04
arXiv ID: 2606.06491v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:当前视觉-语言-动作模型 (VLA) 只能以单一固定速度执行机器人操作,无法根据任务阶段灵活调节快慢,而实际操作中快速转移和慢速精细接触交替出现。
- 核心方法:从数据端对演示轨迹进行变速度重定时 (VSTA),合并或拆分动作以生成不同速度的训练样本;在模型端将速度标量作为显式条件注入策略,训练出一个可响应速度命令的 TempoVLA。
- 关键结果:TempoVLA 在仿真和真实平台上实现双向速度控制,且速度条件训练本身作为数据增强,将默认 1× 成功率从 96.7% 提升至 96.9% (LIBERO 基准),真实世界从 80% 提升至 88%。
- 主要局限:在高速端,实际执行速度受低层控制器跟踪带宽限制,命令速度超过 2× 后实际加速比基本饱和 (约 1.6×),而策略自身并未失效。
- 适合读者:从事机器人学习、模仿学习、VLA 模型开发,或对数据增强和动作空间操控有兴趣的研究人员和工程师。
论文背景和研究动机
机器人操作任务通常混合了低风险的快速移动阶段和高风险的精细接触阶段,前者希望尽快完成,后者需要缓慢而精确的动作。例如,从远处移动到物体附近可以加速,但抓取和插拔阶段必须减速。然而,当前主流的 VLA 模型——无论是基于回归(如 ACT)、扩散(如 、扩散策略)还是离散标记解码(如 RT-2、OpenVLA)——都默默地从训练演示中继承了一个固定的执行速度。一旦训练完成,策略在执行时无法调整速度,只能保持同一节奏。
此前有一些加速 VLA 的方法,主要集中在推理阶段或控制器的层面。例如,模型压缩(TinyVLA、SmolVLA)、KV‑cache 复用、异步动作分块(Real‑Time Chunking)、强化学习精调(SpeedTuning)等,都能让策略变得更快,但它们只是把固定速度从一个值切换成另一个值,不能提供按需的动态速度控制。更重要的是,减速几乎没有被研究,而减速对于精确插入、易碎物体交接等接触密集的行为至关重要。
基于上述背景,论文提出了一个开放挑战:能否在不重新训练基础架构的前提下,赋予单一 VLA 显式的、双向的速度控制能力?
核心方法和技术细节
TempoVLA 将问题分解为数据端和模型端两个耦合的部分,同时保持下游的底层控制器不变。
数据端:变速度轨迹增强 (VSTA)
VSTA 的核心思想是对任意一条演示轨迹进行在线重定时,使其支持任意目标速度 。
- 运动一致性分割:首先将轨迹按运动模式(静止、平移、旋转、平移加旋转)和运动方向是否反转切割成段,并将夹爪开关事件设为硬边界,避免模糊离散状态。
- 分段速度变换:将目标速度写为 ( 和 为互质整数)。在每个分段内,将连续的 帧动作合并为一个总位移 ,然后将其均匀重分割为 个等幅动作。当 时实现加速,当 时实现减速。由于平移、关节速度和轴角旋转增量都满足线性可加性,这一 “累加‑重分割” 操作严格保持了分段内累积的运动量,只改变了动作的稀疏程度。对于旋转四元数等不可加表示,论文指出需要预先映射到切空间(如 )或使用 SLERP 插值。
- 在线块起始随机化:为避免因加速而损失块内非起始帧的观测数据,每次训练迭代时,在每个分段内随机采样块起始偏移,保证每帧最终都有机会成为块起始并贡献有效训练观测。
通过 VSTA,训练集 被在线扩展为多速度数据集 ,速度 作为显式标签附加在每段数据上。
模型端:速度条件注入
论文探索了三种将速度标量 注入策略 的轻量方案,均不需要改动 VLA 的主体架构:
- 文本前缀:直接将速度信息格式化为文本 “执行任务在 x 速度下” 并拼接在原始语言指令前,完全利用模型现有的语言理解能力。
- 速度调制 RMSNorm:使用一个小型 MLP 将 嵌入为调制向量,加到扩散时间步的嵌入上,通过自适应 RMSNorm 层缩放特征统计量。
- 软提示与速度锚点:预设一组训练速度锚点 ,为每个锚点学习 个软提示标记,推理时根据最接近的命令速度选择对应的标记插入编码器输入。
这三种方案在后续实验中被证明效果相当(表 2),说明速度控制很容易植入,且与具体机制关系不大。论文最终选择了最简便的文本前缀作为默认方案。
动态速度调度
TempoVLA 还支持与高级视觉-语言模型 (VLM) 协作,实现自动化动态速度调度。在部署过程中,VLM(论文中使用 GPT‑4o)观测当前场景,每隔若干动作块输出一个速度 ,TempoVLA 据此执行。系统在低风险的自由空间阶段加速,在靠近物体的接触阶段减速,实现了完全无人工干预的阶段感知变速。VLM 与 TempoVLA 之间仅通过标量速度通信,因此可以独立升级规划器而不影响策略训练。
创新点和贡献
- 首次实现 VLA 的显式双向速度控制:通过对现有演示进行数据增强并加入速度条件,无需额外数据采集或修改底层控制器,将执行速度变成一个可控维度。
- 变速度训练作为有效的隐式数据增强:实验发现,用多种速度训练同一个策略反而提升了默认 1× 速度下的成功率,在仿真和真实世界都观察到这一增益(仿真从 96.7% 到 96.9%,真实从 80% 到 88%)。这是因为策略被迫学习更健壮的特征,无法死记特定观察‑动作映射。
- 极轻量的设计,易于与现有 VLA 集成:VSTA 是一种在线数据变换,速度注入仅需修改文本前缀或极小的附加网络,对基础模型架构无侵入。
- 打通了高层推理器控制执行节奏的通道:与 VLM 调度器配合的动态变速实验(真实世界成功率高达 96%,超过任何固定速度配置)证明执行速度可以作为一个新的控制通道,供上层规划使用。
实验结果分析
VSTA 的可行性
在 LIBERO 仿真环境中,对演示数据应用 VSTA 生成不同速度轨迹,并直接重放。数据比率与目标速度基本一致,重放成功率在 0.75× 至 1.25× 之间保持在 92% 以上(1× 基线为 97.6%),运动误差极小(),证明 VSTA 是可靠的数据增强原语(表 1)。
速度注入方案对比
三种注入方案(文本、调制、软提示)在平均成功率和平均执行步数上几乎无差异(均约 96.8%),说明速度控制的实现非常鲁棒(表 2)。
训练速度范围的影响
使用 {0.75, 1, 1.25, 1.5}× 训练时,峰值成功率出现在 1.25×(97.0%),高于 1× (96.9%),且所有速度下的成功率都超过或打平基线。进一步扩展到 0.5–2× 时,精细的步长(0.25)可提升各速度的表现,极端低速(0.25×)和高速(4×)会造成显著性能衰减(表 3 和表 7)。衰减的原因在附录 D 中被明确追踪为低层控制器跟踪能力的饱和,而不是策略本身失效:控制器无法在小时间步内实现过大的位移命令。
真实世界验证
在 Franka 机械臂上训练单个 TempoVLA 策略(速度集 {0.75, 1, 1.25, 1.5}×),其 1× 成功率比单速基线提高 8 个百分点,1.25× 也超过了基线。实际执行速度比与命令速度比吻合良好(1.29× 对应 1.25×,1.48× 对应 1.5×)。结合 GPT‑4o 的动态调度进一步将成功率推至 96%,同时平均执行速度达到 1.21×,证明了方法的实用潜力。
实践建议
- 对现有 VLA 进行速度赋能:如果你的机器人演示数据包含可线性组合的动作空间(如末端平移、关节速度、轴角增量),可以直接引入 VSTA 在线增强,并添加文本速度前缀进行微调。文中使用的基线是 ,但该方法同样适用于基于扩散或回归的其他 VLA。
- 平衡训练速度范围:建议在 0.5× 至 2× 之间以 0.25 的步长训练,可在保持高成功率的同时获得较宽的可控范围。对于精密操作,可进一步加入更细的步长;对于快速转运,上限受限于控制器的物理带宽,需要联合调整控制器增益或控制频率。
- 动态速度调度:可以轻松整合现有大模型(如 GPT‑4、Claude 等)作为调度器,通过少量示例提示即可实现阶段感知变速。出于安全考虑,调度器会自然偏于保守(实际观察中很少分配极高速度),可在提示中明确鼓励冒险以获得更大加速收益。
- 数据增强红利:即使不追求速度控制,仅用 VSTA 生成多速度样本训练策略,也能提升原始 1× 速度下的性能。这一特性能在保持推理速度不变的情况下提高任务成功率,是一种性价比极高的增强策略。