SUN:面向语言引导的控制-学习-现实策略的持久程序

SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

arXiv: 2608.31167v1

论文信息

标题: SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

作者: Weiqi Wang, Zhi Li, Yudong Lei, et al.

发布日期: 2026-08-31

arXiv ID: 2608.31167v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决长程机器人操作中,模型控制与学习策略交接时任务语义丢失、奖励手工设计昂贵且不可靠的问题。
  • 核心方法:提出 Semantically UNified (SUN) Programs,用类型化可执行程序统一 MPC 代价、阶段谓词、RL 奖励和转移守卫,并由 Kuafu 系统自动合成、筛选和保留到策略学习与数据生产。
  • 关键结果:在九项操纵任务中,Kuafu 状态控制器达到 82.03% 的任务宏成功率,远高于 sparse-reward 基线 35.67% 和 Stage-BC 基线 24.75%(表 II-A)。
  • 主要局限:依赖注册场景接口和有限类型算子库,不能处理可变形物体或流体;阶段监视器单调推进、不能回滚;物理机器人验证仅覆盖 6 个任务、106 次试验。
  • 适合读者:从事机器人操作、模型预测控制、强化学习、模仿学习、数据生成或 sim-to-real 迁移的研究者与工程师。

论文背景和研究动机

长程操纵任务中的强化学习可以学习高维接触丰富行为,但通常需要稠密奖励来暴露中间进展。手工设计奖励信号不仅费时,而且对奖励项或转移阈值的微小调整可能导致行为剧烈变化(见论文第 I 节)。语言模型驱动的自动奖励生成虽然减少了手工设计,但其候选奖励必须经过完整策略训练和 rollout 才能评估,迭代代价很高。

另一方面,模型预测控制 (MPC) 可以显式编码任务结构,在闭环动力学中测试和修正几何目标与转移逻辑;但它对模型精度、状态重建和交互模型非常敏感,而且每个新任务都需要大量手工规范。现有 control-to-policy 方法常用控制器生成成功轨迹来训练策略,但这会丢弃 “这些动作为什么正确” 的目标、约束、阶段转移和满足边界。即使部分方法暴露了更丰富的任务结构,它们也常常把同一结构重新实现为不同学习信号,导致奖励与已被控制验证的规范发生漂移。

论文由此提出:一个经过模拟物理闭环筛选的持久任务程序,可以显著增强多阶段机器人学习。这里的 “持久” 意味着同一程序从语言接地、MPC 可行性筛选、策略学习到数据生成一直保留,而不是在交接中被丢弃(见图 1 与图 2)。

核心方法和技术细节

SUN Program 是一个类型化、可执行的表示。给定语言指令 I\mathcal{I}、注册场景帧 F\mathcal{F} 和类型化算子库 L\mathcal{L}, LLM 代理选择 L\mathcal{L} 中的算子,绑定到 F\mathcal{F} 中的帧,并把接地关系组织为有序阶段。每个阶段由一组三元组 (ek,j,ϵk,j,wk,j)(e_{k,j}, \epsilon_{k,j}, w_{k,j}) 组成,分别表示接地物理关系、满足容差和学习权重(论文公式 (1))。每个关系只定义一次,并被编译为三个对齐接口:MPC 代价项 ϕk,jmpc\phi^{\text{mpc}}_{k,j}、阶段监视器谓词 Pk,jP_{k,j} 和强化学习代价项 ck,jrlc^{\text{rl}}_{k,j}(公式 (2))。因此,同一个关系在控制、监测和学习中保持相同身份、接地和阶段归属,这被论文称为 “语义统一”。

阶段推进由 SUN Program 的监视器负责。每个阶段的所有谓词都满足时才转移到下一阶段,否则保持当前阶段。进入新阶段时记录 entry snapshot ξk\xi_k,用于阶段相对关系的参考。论文还引入独立外部评估器 gextg_{\text{ext}},它在合成前冻结,对 LLM、VLM、SUN Program 和策略都不可见,只输出二值任务成功信号。如果 SUN 监视器声明完成但 gextg_{\text{ext}} 未报告真实物理结果,则判定为 false completion。这一分离用于接受、奖励校准和最终评估。

Kuafu 系统首先生成候选 SUN Program,然后用任务空间非线性 MPC 在闭环模拟中筛选。每个阶段以编译后的关系代价为阶段目标,滚动求解并从当前状态重规划。候选程序在 10 个任务采样初始条件下测试:至少一个 rollout 达到真实物理结果,且没有 false completion 才被接受。失败时最多进行五轮针对未满足项及其测量违反的修复。接受后,接地关系、容差、谓词、阶段顺序都被固定,不再改变。

随后是策略摊销。Kuafu 收集 1,000 条 MPC 成功轨迹,训练 stage-conditioned 行为克隆策略 πθ\pi_\theta。该策略以观测和阶段 ztz_t 为输入,输出 10 步动作块;训练块严格按阶段边界切割,只执行第一个动作。接着冻结 πθ\pi_\theta 作为行为锚,训练有界残差策略 πψ\pi_\psi。组合策略为 π=clip(πθ(1)+αρπψ,umin⁡,umax⁡)\pi = \mathrm{clip}(\pi_\theta^{(1)} + \alpha_\rho \pi_\psi, u_{\min}, u_{\max}),并对 πψ\pi_\psi 做逐坐标无穷范数约束(公式 (4))。奖励函数由 SUN Program 派生:阶段得分 Sk(x~)S_k(\tilde{x}) 根据同一组学习代价和权重归一化;奖励包括单调进展、阶段转移、真实成功、假完成惩罚和动作范数惩罚(公式 (5)(6))。校准阶段只允许 LLM 调整学习权重、残差强度 αρ\alpha_\rho 和残差界 ρmax⁡\rho_{\max},不允许改动 MPC 已接受的谓词容差、逻辑、接地关系、阶段顺序或项定义。

创新点和贡献

论文的三个主要贡献如下。第一,提出 SUN Programs,作为跨控制、学习和部署阶段的持久类型化可执行工件,消除交接中的语义漂移。第二,提出 Kuafu 系统,从自然语言合成 SUN Programs,通过 MPC 筛选,并在没有手工稠密奖励或种子演示的情况下训练 stage-conditioned 策略。第三,在九项任务中显示 Kuafu 以更少 LLM 交互和更低计算成本取得更高成功率,并支持物理机器人零样本 sim-to-real 迁移。

与传统方法相比,关键差异在于 “持久性” 和 “语义统一”。例如 Eureka 之类的迭代奖励搜索,每轮候选奖励都要完整 RL 训练才能评估;VoxPoser 之类的在线规划每次 rollout 都要消耗语言模型调用。而 Kuafu 把语言交互压缩为任务级一次性成本,并让 MPC 成为任务知识的低成本筛选器,而不是单纯轨迹生成器。

实验结果分析

在程序形成可靠性上,论文报告 45 次独立形成与 MPC 验证运行中,初始成功 29 次;诊断修复使最终成功达到 43/45,产量从 64.4% 提升到 95.6%(表 I-B)。T4 和 T5 的修复最显著:接受率从 1/10 提升到 10/10。语言交互方面,Kuafu 平均每个任务 110.5k tokens,Eureka 为 234.4k tokens;VoxPoser 每次 rollout 平均 16.99 次调用、31.6k tokens,意味着累计交互在两到四次执行后即可超过 Kuafu 的任务级成本(表 I-C)。

在控制到学习交接上,Kuafu 的 L42L_{42} 谱系达到 82.03% 任务宏成功率,三次重复平均为 79.43%;sparse-reward 基线为 35.67%,Stage-BC 为 24.75%(表 II-A)。该实验设置下的提升不是来自额外 LLM 搜索预算:Eureka 最佳候选在 5 轮搜索内仅 18.24%,最终评估更降至 12.85%;VoxPoser 仅 10.00%(表 II-D)。消融显示,移除程序派生的进度监督、行为先验或残差约束都会显著降低性能;纯 RL 配合 SUN 奖励甚至为 0%(表 II-C)。计算成本上,Kuafu 总计 122.67 GPU 小时,Eureka 为 479.60 GPU 小时,约 3.91 倍效率差(表 III)。

数据效率方面,每条任务 500 条成功轨迹训练 DP3 时,Kuafu 数据达到 46.02% 仿真成功率,而最强替代 SkillMimic 为 22.44%(表 IV-A)。Q95 产率为 57.3%,远高于 MimicGen 的 20.4%(表 IV-B)。状态控制器的成功轨迹产出为 246.79 分钟/生产小时,是人类遥操作的 10.57 倍(表 IV-C)。在视觉学习与真机迁移中,不同视觉架构在 Kuafu 数据上均获得非零任务宏成功;零样本 sim-to-real 的 106 次物理试验中成功 36 次,任务宏成功率为 34.72%,每个测试任务都有非零成功率(表 V-D)。

实践建议

如果要在自己的机器人操作或数据生成项目中借鉴这篇论文,有几个可操作的思路。

第一,建立一个类型化算子库,并坚持 “定义一次、多处编译” 的原则。对每个几何或接触关系,同时给出 MPC 代价、阶段满足谓词和 RL 代价形式;这可以避免控制验证与策略奖励之间的漂移。第二,把 MPC 用作任务规范的早期筛选器。与其等 RL 训练完再发现奖励错误,不如在闭环模拟中用少量初始条件快速拒绝错误阶段顺序或错误绑定,再决定是否进入策略学习。第三,保留一个独立于任务程序的外部成功评估器。论文中的 gextg_{\text{ext}} 对系统内部不可见,专门用于识别 false completion 和最终评估,这对多阶段任务尤其有用。第四,在策略训练前先用成功 MPC 轨迹做 stage-conditioned 行为克隆,再用有界残差学习修复接触丰富的执行偏差。残差强度与边界应作为校准参数而不是随意调大,否则会将已验证行为覆盖掉。第五,面向数据生成时,阶段监视器可以作为低成本过滤器和诊断来源,但不应该把阶段信息泄露给下游视觉策略;论文的最终视觉策略只使用观测和动作,从而保持部署时无需特权状态。最后,在物理迁移前需要在仿真中尽量复现真实相机的 RGBD 配置和标定,并针对抓取等已知薄弱环节增加数据或专门模块。论文在真机试验中观察到精确抓取仍是主要失败原因,这点可作为工程部署的重点优化方向。