RoboTTT: 机器人策略的上下文扩展

arXiv: 2607.15275v1

论文信息

标题: RoboTTT: Context Scaling for Robot Policies

作者: Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, et al.

发布日期: 2026-07-16

arXiv ID: 2607.15275v1

PDF 链接: 下载 PDF

论文背景和研究动机

近年来,机器人基础模型在视觉-语言-动作(VLA)策略上取得了显著进展,但绝大多数模型只使用单步或极短的历史上下文(通常为 1–8 帧)。这种短视的上下文窗口严重限制了机器人在需要长期记忆、多阶段推理和在线适应任务中的表现。相比之下,大语言模型已经将上下文长度视为重要的缩放轴,而机器人领域却鲜有探索将视觉运动上下文扩展到数千步以上。

为了解决这一差距,NVIDIA 与斯坦福大学等机构的研究者提出了 RoboTTT(Test-Time Training Robot Policies),一种能将视觉运动上下文扩展到 8000 个时间步(约 5 分钟,30 Hz 控制频率)的机器人策略模型与训练方案。这个量级的上下文比当前最先进的方法高出三个数量级,并且不增加推理延迟。论文的核心动机是:长上下文能解锁全新的机器人能力,例如从一段人类演示视频中进行单样本模仿、根据自身部署历史进行在线策略改进、对外部扰动的鲁棒性,以及多阶段长周期任务上的更强闭环性能。

核心方法和技术细节

RoboTTT 的关键在于将测试时训练机制(Test-Time Training, TTT) 融入机器人基础模型中。TTT 将传统的递归神经网络(RNN)隐藏状态替换为快速权重(fast weights),这是一组在训练和推理过程中都通过梯度下降不断更新的参数。与普通 RNN 的固定向量状态相比,快速权重作为一个小型神经网络(如 MLP)的参数,能提供更大的容量来压缩历史信息,且推理成本恒定,不像 Transformer 那样会随上下文长度线性增长。

模型架构

RoboTTT 建立在预训练的 VLA 模型 GR00T N1.7 之上。GR00T N1.7 由视觉-语言模型(VLM)作为主干,以及一个扩散 Transformer(DiT)作为动作头。RoboTTT 在 DiT 的每一层后都插入了 TTT 层:自注意力和交叉注意力层负责处理单步内的模态交互,而 TTT 层则沿着时间轴跨步处理序列信息。具体来说,每个时间步的 VL 标记、本体感知标记和动作标记经过注意力处理后,会沿着时间维度拼接,然后送入 TTT 层。TTT 层执行 “更新-应用” 两步操作:先用当前键-值对 (Kt,Vt)(K_t, V_t) 更新快速权重 WtW_t,再用查询 QtQ_t 通过更新后的快速模型 fWtf_{W_t} 生成输出 OtO_t

为了在引入 TTT 时不破坏预训练模型的能力,论文使用了 tanhtanh 门控机制,初始时 TTT 贡献几乎为零,随着训练逐渐增强。此外,还引入了一组可学习的寄存器标记(register tokens),用于在时间步之间传递视觉-语言信息,而无需将高维的图像标记直接送入 TTT 层,从而保证了计算效率。

序列训练与上下文缩放

训练长序列策略面临两大挑战:如何稳定优化,以及如何克服显存限制。RoboTTT 采用序列动作强制(sequence action forcing) 来稳定训练。传统全序列扩散会让所有时间步共享同一个噪声水平,导致训练过程要么过于简单要么过于困难。RoboTTT 则对序列中每一个动作块独立采样噪声水平,这使得训练更稳定,对序列长度的适应能力更强。

为了突破显存墙,论文采用了截断时间反向传播(TBPTT):将长序列切分为多个段,梯度只在段内回传,段之间切断梯度流,但快速权重在段间仍然持续前向传递。这样,训练上下文可以任意增长,而 GPU 显存仅取决于段长度。这种设计让 RoboTTT 能够在 16 块 GB200 GPU 上将上下文逐渐扩展到 8K 时间步。

上下文学习能力的训练

长上下文给策略带来了新的学习方式。RoboTTT 通过掩码流匹配损失,灵活地让部分时间步只用于更新快速权重(提供上下文),而无需提供模仿目标。基于这一机制,论文设计了两种关键训练模式:

  • 从上下文人类视频中单样本模仿:将人类演示视频与机器人执行轨迹拼接为一个长序列,视频部分(无动作标签)只更新快速权重,后续机器人动作在带有任务信息的快速权重条件下训练。这样,在测试时,只提供一段新任务配置的人类视频,模型就能完成该配置的组装,而语言指令在所有配置中完全相同。

  • DAgger 蒸馏:利用带有人类修正的 DAgger 数据进行训练。在序列中,机器人执行的所有动作(包括错误动作)都更新快速权重,但动作损失只在人类修正动作上计算。这种非对称设计将 “失败到修正” 的映射蒸馏到了快速权重中,模型由此学会了在线自我纠正:在部署时,即使犯下错误,也能像人类干预那样自己恢复。

创新点和贡献

RoboTTT 的主要创新可归纳为四点:

  1. 首次将 TTT 引入机器人视觉运动策略,并设计了与 VLA 模型兼容的架构。与线性递归记忆(如 Gated DeltaNet)不同,TTT 的快速权重通过梯度下降进行非线性压缩,更适合长程、稠密的机器人观测流。
  2. 提出了序列动作强制和 TBPTT 相结合的训练方案,使上下文长度能够扩展到数千步,而不会导致训练不稳定或显存爆炸。
  3. 展示了上下文长度作为机器人基础模型的新缩放轴。实验首次发现,随着预训练上下文长度从 128 步增长到 8K 步,RoboTTT 的闭环任务完成度持续上升,未见饱和,而基线模型(如 GDN)则没有这一趋势。
  4. 解锁了长上下文带来的新能力:单样本人类视频模仿、在线策略改进、扰动恢复,以及在长达五分钟的十阶段组装任务上首次实现完全成功。

实验结果分析

论文在 YAM 双臂桌面机器人上测试了三项多阶段组装任务:Pup Go Car(玩具车)、Circuit(电路板)和 Gear Bot(十阶段机器人组装)。RoboTTT 在所有任务上一致优于基线方法。

  • 整体性能:RoboTTT 平均任务完成度为 79%,比单步上下文基线 GR00T N1.7 高 87%,比最好基线 GDN 高 41%。在 Gear Bot 上,只有 RoboTTT 能完成全流程(2/10 次),其他基线全部失败。
  • 上下文缩放效应:将预训练上下文从 1K 步提升到 8K 步,RoboTTT 性能从 43.9% 跃升到 71.5%,提升达 63%,而 GDN 几乎无变化。这说明 TTT 的快速权重更新通过外损失元学习到了更优的初始化和更新规则,长序列能让其学习更有效的记忆策略。
  • 单样本视频模仿:从一段未见配置的人类视频中,RoboTTT 在 10 次试验中成功 6 次,而 GDN 全部失败。显示 TTT 不仅能记忆过去,还能有效检索上下文中的任务规格。
  • 鲁棒性:在人为移除已安装零件后,RoboTTT 能回到之前阶段重新安装,屋顶和轮胎扰动恢复成功率分别为 75% 和 90%,远超短上下文基线。
  • DAgger 蒸馏:将相同 DAgger 数据用于 RoboTTT 的 DAgger 蒸馏,相对标准 DAgger 微调带来了 36% 的额外性能提升,且这种提升主要来自模型学会了从错误中在线恢复。

实践应用建议和未来发展方向

对于机器人学习实践者,RoboTTT 提供了几个实用启示:

  1. 长上下文应作为策略设计的重要考量。即使对于中等长度的任务,数分钟的历史也比单步或几帧观察有意义得多,它能够缓解部分可观察性并支持更鲁棒的行为。
  2. TTT 是扩展上下文的可行架构。相较于 KV 缓存随长度线性增长的 Transformer,TTT 以固定的推理成本支持超长上下文,更适合真实部署。
  3. 利用 DAgger 蒸馏提升策略的自我修正能力。与其丢弃次优的机器人行为数据,不如将它们作为上下文来教会模型如何从失败中恢复,这充分利用了昂贵的人工遥操作数据。

未来工作有几个方向值得探索:

  • 训练效率:当前训练长上下文仍消耗大量计算,采用更先进的 TTT 并行训练方法(如 TNT)可进一步降低成本。
  • 机器人专属的 TTT 目标:现有 TTT 损失是简单的均方误差,未来可以设计更适合控制任务的辅助目标,例如预测未来状态或动作。
  • 强化学习结合:RoboTTT 仍存在部署中的失败模式,结合强化学习来直接优化任务成功率是一个自然延伸。
  • 多模态上下文扩展:将长上下文能力推广到更广泛的感知输入,如触觉、声音等,将进一步提升机器人在非结构化环境中的自主能力。

总结与展望

RoboTTT 通过整合测试时训练机制,成功将机器人视觉运动策略的上下文长度扩展至 8000 步,并展示了这一缩放能够稳定提升闭环性能。该模型不仅在一系列长周期精细操作任务上大幅超过现有方法,还首次实现了从单条人类视频中模仿新任务、在线策略改进和鲁棒扰动恢复。论文将上下文长度确立为机器人基础模型的一个重要缩放维度,与语言模型中的趋势遥相呼应。

这一工作为构建具有长期记忆和在线适应能力的通用机器人策略开辟了新道路。随着硬件和训练算法的进步,未来我们或将看到能够利用整个 “人生经历” 的机器人系统,像人类一样从持续的经验流中学习和改进。