RoboTTT:机器人策略的上下文缩放
RoboTTT: Context Scaling for Robot Policies
论文信息
标题: RoboTTT: Context Scaling for Robot Policies
作者: Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, et al.
发布日期: 2026-07-16
arXiv ID: 2607.15275v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:当前机器人基础模型大多只能利用单步或短时间跨度的视觉运动上下文,难以实现从人类视频的一次性模仿、在部署中在线改进、抗扰动,以及多阶段长任务操作。如何构建能有效利用任意长上下文的机器人策略?
- 核心方法:提出 RoboTTT,将测试时训练(Test‑Time Training)集成到 VLA 等机器人基础模型中。其循环状态由快速权重(fast weights)构成,在训练和推理过程中都通过梯度下降更新,把历史压缩到权重空间,从而无条件地扩展上下文至 8K 时间步,且推理延迟不随上下文增长。
- 关键结果:在真实双臂操作任务上,RoboTTT 相比单步上下文基线整体性能提升 87%,并首次完整完成了持续五分钟、十个阶段的组装任务(所有基线均未完成)。用 8K 步上下文预训练比用 1K 步的同一模型性能高 62%,表明上下文长度是机器人基础模型的新缩放轴(见论文摘要及图 8)。
- 主要局限:训练上下文长度增加会带来更高的预训练计算开销;方法仍未解决部署中遇到的所有失败模式;作者提到未来可与强化学习结合以直接优化任务成功。
- 适合读者:从事机器人学习、长序列建模、测试时训练、视觉‑语言‑动作模型研究的人,以及对机器人基础模型规模化感兴趣的工程师和研究者。
论文背景和研究动机
近年来,大语言模型的上下文长度已成为重要缩放维度,但多数机器人基础模型仍只用单步或极短的历史帧(如 2‑8 帧)作为条件。来自 NVIDIA 和 Stanford 等的这项研究指出,将视觉运动上下文的长度扩展到数千步,有望解锁多种高级能力:从单个人类演示视频中一次性模仿新任务、利用机器人自身部署历史进行在线策略改进、增强对外部扰动的鲁棒性,以及显著提升多阶段长周期任务的闭环表现。
然而,扩展视觉运动上下文长度面临三重挑战:如何用足够容量编码密集且重复的长历史;如何真正利用好被条件化的上下文;如何使推理成本不随上下文线性增长。现有的 Transformer 策略虽可处理历史,但 KV 缓存会使解码延迟随步数增长;简单叠加历史帧则可能引入虚假相关,反而损害性能。
基于此,论文将测试时训练(TTT)引入机器人策略,使其循环状态不再是普通向量,而是通过梯度下降在推理时动态更新的快速权重。这种设计既能将历史压缩进参数空间,又能保持固定的推理开销,从而让机器人策略自然受益于长上下文带来的更高闭环性能与新行为。
核心方法和技术细节
RoboTTT 架构:将 TTT 融入 VLA 动作头
RoboTTT 建立在预训练的 GR00T N1.7 基础上,其架构包含视觉‑语言模型(VLM)和扩散 Transformer(DiT)动作头。论文在每个 DiT 层之后添加一个 TTT 层(共 16 层),让注意力处理单步内的信息,TTT 层则沿时间维度传播快速权重。具体地,输入为 个时间步的轨迹,每步包含从 VLM 输出的视觉‑语言 tokens 、编码后的本体感知 token 以及加噪的动作 tokens 。每个时间步前还固定插入 个可学习的寄存器 tokens ,用于在时间步之间传递视觉‑语言信息,避免直接让高维 进入 TTT 层,从而节省计算。
TTT 层维护一个参数为 的快速模型(两层 MLP)。每一时间步先用键值对 通过梯度下降更新快速权重:
再用查询向量 通过更新后的 生成输出。该机制在训练和推理时均执行,因此推理时历史信息被不断压缩进 ,而不是保留所有历史 token。为保护预训练模型的知识,TTT 输出经过一个可学习的 门控叠加到注意力输出上,门控参数初始化为接近 0,使训练早期 TTT 的贡献很小。
序列训练:处理超长轨迹
训练时,模型在整个轨迹(或连续子轨迹)上展开 TTT,并在每个时间步计算外部任务损失。整个模型(包括快速权重初始化 和投影矩阵)的梯度通过整个序列传播。为使训练可扩展,采用两项关键技术:
- 序列动作强制:对序列中每个动作 chunk 独立采样噪声水平(即流匹配的 timestep ),而不是整个序列共享一个噪声水平。这避免了因统一低噪声(全简单)或高噪声(全困难)导致的训练不稳定。
- 截断时间反向传播(TBPTT):将长序列划分为若干片段,梯度仅在片段内反向传播,但快速权重跨片段传递。这样 GPU 内存仅取决于片段长度而非总上下文长度,使 8K 步训练成为可能,同时 仍能通过第一个片段接收长期依赖的梯度。
推理时,每个 rollout 从学到的 开始,每步更新快速权重并生成动作 chunk,无需保持长 KV 缓存,延迟恒定。
从上下文学习:一次性模仿与 DAgger 蒸馏
RoboTTT 的灵活之处在于可对某些时间步屏蔽损失,使其仅作为更新快速权重的上下文。这一机制被用于两种新能力:
- 从人类视频一次性模仿:将人类演示视频序列与同一任务的机器人轨迹拼接,视频片段仅更新快速权重(损失被屏蔽),机器人片段计算动作损失。训练后,模型在测试时只需观看一个未见过任务配置的人类视频,就能通过快速权重内化的任务信息直接执行相应操作。
- DAgger 蒸馏:利用 DAgger 式人机交互数据(机器人执行时的人工纠正),把子优化的机器人动作作为上下文(更新快速权重),仅对人类纠正动作计算损失。这样,失败→纠正的映射被蒸馏到快速权重中,推理时即便没有人工干预,模型也能从自己的失败历史中在线学习并自我纠正。
创新点和贡献
- 首次将测试时训练与机器人基础模型融合,构建出循环状态为快速权重的视觉运动策略,推理成本恒定,同时能条件化于 8K 时间步的超长上下文。
- 提出完整的训练方案:结合序列动作强制与 TBPTT,使长上下文的端到端训练切实可行,并验证了上下文长度从 128 步到 8K 步时闭环性能持续上升的缩放规律(见图 8),为机器人基础模型引入了新缩放轴。
- 解锁了新的机器人能力:仅通过上下文条件化就实现一次性人类视频模仿、在线策略改进(DAgger 蒸馏提升 36%),以及更强的外部扰动鲁棒性(成功率从 53% 提升至 83%),这些能力在已有短上下文模型上完全无法或极难实现。
- 揭示了快速模型非线性的重要性:消融实验表明,用 MLP 快速权重的效果远优于线性层,与 Gated DeltaNet 等线性递归模型对比时,TTT 的非线性更新在长序列上能更有效地提取结构信息。
实验结果分析
实验在三个真实双臂长程装配任务(Pup Go Car 玩具车组装、Circuit 电路装配、Gear Bot 十阶段总装,平均时长分别为 2 分钟、1 分钟和 5 分钟)上进行。所有方法都基于 GR00T N1.7 后训练。
主要结果:如表 1 和图 7 所示,RoboTTT 在三个任务上的任务完成分数平均达到 79%,比单步上下文基线(42%)提高 87%,比最好的递归基线 GDN(56%)高 41%。只有 RoboTTT 在 Gear Bot 上取得了完整成功(2/10),基线全都为零成功。定性来看,RoboTTT 能,因为快权重跨时间步消歧义,能自动恢复到之前的正确阶段,并在物体被遮挡时利用历史观察做出精细动作。
上下文缩放效应:图 8 展示,随着预训练上下文长度从 128 增长到 8K,RoboTTT 的任务平均分持续攀升,8K 时达 71.5%,比同一模型用 1K 训练高 63%,且未出现饱和;而基于 Delta 规则的 GDN 几乎不随上下文增长而改善。这证实了基于梯度的快速权重更新和元学习初始化对捕捉长期依赖至关重要。
一次性模仿与鲁棒性:在 Circuit 任务上,仅依靠一段未见配置的人类视频,RoboTTT 完成率达 6/10,GDN 则 0/10(表 2)。在 Pup Go Car 的扰动实验中,RoboTTT 在移除车顶时的恢复成功率为 15/20,而短上下文基线最多仅 10/20(表 3),证明长上下文能提升单回合内的条件化能力。
DAgger 蒸馏:从相同 DAgger 数据中,标准 DAgger 微调仅带来 9% 的平均提升,而 DAgger 蒸馏使 RoboTTT 的性能提升 36%(图 10),且主要归因于模型学会了在犯错后自我纠正(如图 11 所示),而非简单模仿纠正片段。
消融实验:取消序列动作强制会严重破坏闭环表现;将快速模型从 MLP 替换为线性层,性能下降 27%;逐步加入动作 tokens 和寄存器 tokens 都能稳步提升性能,而寄存器 tokens 若不配合 TTT 则对基线无效(图 12),说明设计选择的合理性。
实践建议
对于计划在真实机器人系统上采用长上下文策略的团队,以下几点具有工程借鉴意义:
-
架构选型:直接堆叠历史帧容易引入虚假相关;相比线性递归(如 DeltaNet),基于测试时训练的 MLP 快速权重能更有效地从重复的机器人观测流中提取结构。建议在现有 VLA 或 World Action Model 的动作头中插入 TTT 层,并搭配可学习门控以保护预训练权重。
-
训练高效性:即使 GPU 内存有限,也可通过 TBPTT 将上下文扩展到数千步。实施时需要保证快速权重在片段间传递,并注意保留从 到第一片段的梯度路径。为训练稳定,务必对每个动作 chunk 独立采样噪声水平(序列动作强制),而不是对整个序列用同一个噪声级别。
-
数据收集与利用:为解锁一次性和在线改进能力,应采集少量人类演示视频(与机器人轨迹配对),以及 DAgger 式人机交互数据。训练时需在序列中精确屏蔽损失,仅让上下文更新快速权重,使模型学会提取任务信息或失败→纠正映射。
-
预训练混合与缩放:预训练数据需包含足量长轨迹(几分钟以上),并逐步增加训练上下文长度。实验表明 1K 步以上才能充分超越短上下文基线,8K 步时仍有提升空间,因此可预期视觉运动策略也会像语言模型一样进入 “上下文 scaling” 阶段,值得投资更长周期的数据采集和训练。
-
部署注意事项:推理时使用学到的 初始化,每步更新后无需存储历史 KV 缓存,延迟恒定。对于长达数分钟的连续任务,需注意快速权重长期更新的数值稳定性,论文使用了固定的基础学习率和可学习的缩放因子;此外,位置编码需与实际使用的步数匹配,若训练上下文短于任务时长,性能会下降。