工作空间模型:通过显著性驱动监督实现轻量级机器人记忆
Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision
论文信息
标题: Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision
作者: Nitish Dashora, Douglas Chen, Idan Shenfeld, et al.
发布日期: 2026-09-17
arXiv ID: 2609.20820v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:机器人长期操作任务需要记忆历史信息,但直接输入完整观测历史会导致伪相关、分布偏移和控制精度下降;现有方法在部署时反复调用视觉语言模型(VLM)来筛选历史帧,造成高延迟和高计算成本。
- 核心方法:提出 Workspace Model,在训练阶段用 VLM 标注任务相关图像块,并蒸馏到一个轻量潜在记忆表示(workspace token)中;部署时只用该 token 作为策略输入,无需 VLM 在线推理。
- 关键结果:在 3 个仿真任务和 1 个真实机器人任务中,workspace 策略的平均成功率为 91.5%±2.2,显著高于第二好的 Keyframe 基线 66.8%±3.2(见论文第 4.3 节图 6)。
- 主要局限:workspace encoder 采用完全自回归 transformer,序列较长时计算量呈二次增长;VLM 监督只针对视觉显著性,不一定完全对齐控制目标;未与基于语言摘要的分层 VLA 方法进行比较。
- 适合读者:机器人学习、视觉模仿学习、记忆压缩、VLM 监督蒸馏以及关注训练/推理计算不对称性的人员。
论文背景和研究动机
机器人操作任务常具有部分可观测性:例如把立方体放入碗中后,立方体从当前视线中消失,智能体必须记住已放入数量。传统视觉模仿学习通常只用当前帧或很短的历史帧,这是为了避免长历史带来的泛化问题。论文指出,简单增加观测历史会导致策略利用无关帧中的伪相关线索,产生 “因果混淆” 或 “复制” 行为;在状态策略实验中,随着所需记忆长度 增加,仅调大历史窗口的成功率会下降(见论文图 2)。这一现象在数据稀缺、观测高维的机器人领域尤其严重。
为缓解这一问题,已有方法在部署时引入 VLM 维护语言记忆或选择关键帧。论文列举了若干代表性工作,包括 MEM、MemER 和 BPP。这些方法虽然可以保留任务相关信息,但部署时反复查询大模型会引入明显延迟,降低反应速度,并可能因摘要缺失关键信息导致策略失败。论文提出的折中思路是:利用训练时算力更充足的特性,让 VLM 只在训练阶段提供监督信号,蒸馏出轻量级的潜在记忆模块。
核心方法和技术细节
Workspace Model 包含两条训练路径。第一,训练一个自回归 transformer encoder ,输入历史观测的 token 序列,输出对应每个时间步的 workspace token 。图像由 DinoV3 编码为 patch token,本体感受状态通过 MLP 映射后拼接;每个时间步还包含可学习的 padding token ,其输出位置作为 workspace token。注意力采用因果掩码,保证部署时只依赖过去信息。
第二,VLM 标注 salient set。论文使用两阶段流程:Qwen3-VL-8B-Instruct 在每个帧上回答事件检测问题,识别需要记忆的关键时间步;MolmoPoint 在这些关键帧和常规频率下对指定物体生成 2D 点坐标。这些点被映射为对应时空位置上的 DinoV3 patch token,构成当前时间步的 salient set ,最多包含 个 patch。salient set 既包含 “事件 patch”(持久记住过去事件),也包含 “瞬态 patch”(仅当前时刻关注)。
训练 workspace encoder 时,解码器 以 DETR 框架从 预测 个 slot,每个 slot 输出重建 patch 特征 和存在概率 。采用匈牙利匹配对齐 ground truth salient patches 与预测 slots,损失包括活跃 slot 的特征重建误差和交叉熵存在性损失(见论文公式 3.1、3.2)。解码器对大小可变的集合进行重构,不要求固定数量,因为 salient set 大小可能少于 。
冻结 encoder 后,训练 Diffusion Policy ,其输入为最近 个 workspace token 和本体感受状态,输出未来动作块。所有仿真和真实任务使用非常接近的超参数配置,而基线方法按任务调参。
创新点和贡献
论文的主要贡献是提出一种新的 “显著性驱动监督” 范式:将昂贵的 VLM 推理从部署阶段转移到训练阶段。相比逐帧选择关键帧的 Keyframe 方法,workspace token 是连续潜在表示,不需要维护稀疏且不连续的帧集合。论文通过实验和可视化表明,workspace token 在不同轨迹和时间上更平滑,注意力分布更均衡(见论文图 7 右、图 8),这缓解了关键帧选择中离散时间点带来的输入分布偏移(作者称为 aliasing)。这种设计也天然避免了在线 VLM 查询带来的延迟。表 1 显示,Wksp 单次推理延迟为 94.9ms,加上批处理和 KV 缓存后为 49.2ms;Keyframe 方法则为 302ms,即使批处理后仍为 199.5ms。
论文还通过消融证实 patch 级重建监督优于直接预测 2D 点或整幅图像平均特征。具体而言,patch 监督在三个仿真任务上的平均成功率为 94%,point 为 84%,image 为 64%;其中 image 监督在 CubeDrop 上几乎失效(见论文附录 E 表 6)。作者推测,point 太损失细节,image 则混入过多无关信息,而 patch 在信息压缩和保留之间取得平衡。
实验结果分析
实验覆盖四种记忆类型任务:CubeDrop(计数)、DrawerRecall(空间回忆)、BalanceBar(根据过去经验自适应)以及真实机器人 HalfAndHalf(计数)。仿真任务每个使用 272 条演示,HalfAndHalf 使用 300 条遥操作轨迹。所有方法都基于行为克隆。
在成功率和延迟两个维度上,workspace 策略均优于基线。跨任务平均成功率 91.5%,高于 Keyframe 的 66.8%(见论文图 6)。论文重点分析为何 workspace 反而超过在线关键帧选择。其一,frame stacking 方法(HistoryDP 和 Keyframe)虽然记忆正确性尚可,但控制精度下降:它们容易抓错位置或未对准把手(见论文第 5.1 节)。其二,显式关键帧选择的输入分布对关键帧时间点敏感。训练时对关键帧注入适量时间抖动可以提升性能,但抖动范围过大会降低覆盖,再次损害泛化(见论文图 7 左)。workspace token 由于采用全局注意力和连续表示,自然平滑了这些离散事件边界,减少对精确时间节点的依赖。
在真实机器人 HalfAndHalf 任务中,无法仅用全局相机完成抓取的基线方法会额外接入腕部相机(标记为 “+wrist”),但 Wksp 仍获得最高成功率。论文还指出,VLM 检测过程存在噪声,训练时由于可访问完整轨迹,可以通过中值滤波等方式增强标注一致性;部署时的 Keyframe 方法则必须承受在线不确定性的影响。
实践建议
对于希望在真实机器人系统中引入长时记忆的团队,这篇论文给出几条可操作的工程经验。
第一,优先考虑训练时蒸馏而非部署时查询。如果任务需要 VLM 来判断历史事件,可以把 VLM 标注作为离线监督信号,训练一个专用 encoder。这样可以用较高的训练成本换取较低、更稳定的推理延迟。论文中 Wksp 从 94.9ms 进一步降至 49.2ms 只需要批处理和 KV 缓存(表 1),适合需要快速反应的操作任务。
第二,选择 patch 级重建目标。如果设计类似 workspace 的记忆压缩模块,应避免只用 2D 关键点或整幅图像平均特征作为监督。论文的消融显示,在这三个仿真任务中,patch 级重建显著优于 point 监督和 image 监督(附录 E 表 6)。这可能是因为 patch 保留局部视觉信息,同时避免被全局背景淹没。
第三,控制长历史对控制精度的影响。HistoryDP 和 Keyframe 的失败案例表明,仅仅把更多帧塞进策略输入,即使记忆正确,也会牺牲细粒度动作执行。建议将历史压缩成少量连续的潜在 token,而不是保留稀疏但离散的历史帧。
第四,训练期间可利用完整轨迹进行标注后处理。论文的 VLM 检测曲线存在噪声(图 9),离线过程中使用中值或事件分组来稳定标签,是低成本提升 encoder 平滑性的手段。若在部署时进行在线关键帧检测,则需要额外处理 VLM 检测波动。
最后,本方法的实验范围主要限于单臂操作与视觉模仿学习,未覆盖多任务通用策略或分层语言摘要方法。在更复杂的系统中,可将 workspace token 作为一个记忆组件插入现有 VLA 架构,但需要验证其与语言指令和更大规模预训练模型的兼容性。