如何用刀削皮:使精细操作与人类偏好对齐

How to Peel with a Knife: Aligning Fine-Grained Manipulation with Human Preference

arXiv: 2603.03280v1

论文信息

标题: How to Peel with a Knife: Aligning Fine-Grained Manipulation with Human Preference

作者: Toru Lin, Shuying Deng, Zhao-Heng Yin, et al.

发布日期: 2026-03-03

arXiv ID: 2603.03280v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:该论文要解决机器人完成精细接触任务时面临的两个核心瓶颈:高质量演示数据难以大规模收集,以及任务成功标准连续、主观且难以量化为奖励函数。任务以用刀削皮为例。
  • 核心方法:提出两阶段学习框架,先通过力感知模仿学习从少量遥操作数据中训练基础策略,再基于人工标注学习奖励模型,用偏好加权行为克隆微调策略,使其对齐人类对削皮质量的主观判断。
  • 关键结果:仅用 50–200 条削皮轨迹,策略在黄瓜、苹果和土豆上平均成功率超过 90%,偏好微调较基础策略最高提升 40% 的成功率或得分(见论文摘要及表 V)。
  • 主要局限:依赖高质量人工遥操作数据,未解决大规模自监督扩展问题;感知瓶颈限制削皮厚度等细节的精密评估;实验中的失败主要源于品种泛化能力不足(见第 IV-E 节与第 VI 节)。
  • 适合读者:从事机器人操作、模仿学习、人类偏好对齐以及触感/力控策略研究的学者与工程师,尤其是关注精细操作与数据效率的读者。

论文背景和研究动机

许多日常必需的操作任务——备菜、外科手术或手工艺——对自主机器人依然极具挑战。这些任务不仅需要丰富的接触感知和力调控,而且其成功标准往往 “隐含”、连续且主观。以削皮为例,“削得好不好” 无法用放置任务的二元指标衡量,而需要从厚度均匀性、完整性、平滑度等方面综合评判,传统奖励工程难以捕捉这种偏好。

此前对这类接触精细操作的研究主要依赖模型驱动方法或受限的学习框架。模型方法对几何建模误差、标定漂移和果蔬个体差异敏感,泛化性差;学习类方法则需要大量数据,且评估多简化为固定定量指标,与人类真正关心的质量之间存在鸿沟。基于人类偏好的对齐技术在语言模型领域已取得突破,但在真实机器人的精细操作上,仍局限于低维控制或仿真场景,并未真正触及这种连续、主观且与力-运动耦合深度绑定的任务质量对齐问题。

论文选择 “用刀削皮” 作为典型试验台。削皮时需在刀片与曲面接触不稳定条件下精确调控力道,实时跟踪复杂几何形状,且需适应不同果蔬的力学特性。更重要的是,削皮的质量评价天然融合了局部几何精度(如皮厚)和全局感知品质(如视觉一致性)。因此,在该任务上探索数据高效学习与偏好对齐,对推广至更多精细操作任务具有示范意义。

核心方法和技术细节

论文提出一个两阶段学习框架,主要包含:

1. 基础策略训练:力感知模仿学习 数据收集使用 SpaceMouse 遥操作机械臂(Kinova Gen3),实时采集关节角度、腕部双摄像头 RGB-D 图像以及 ATI 力/力矩传感器读数。图像经预处理:彩色转为灰度、提取刀和果蔬的掩码并与深度相乘、裁剪增强;力读数标准化。相对末端位姿作为动作表示,以利于任意基座位置泛化。策略采用扩散策略(Diffusion Policy),视觉编码用 ResNet-18,力编码用 MLP,输入包括处理后的视觉、力觉和本体感觉,输出末端位姿变化。50 条黄瓜演示即可训练出成功率 100% 的基础策略(见表 IV)。

2. 偏好微调:学习奖励模型与残差策略 人工对基础策略收集的轨迹进行两层面标注:局部定量标签(频率 2 Hz 的皮厚类别,如 “名义”“偏上” 等)和全局定性标签(0–9 的整体喜好评分)。二者加权得到每步奖励信号,再训练一个三层 MLP 奖励模型 rψ(zt,at)r_\psi(z_t, a_t),预测状态-动作对的偏好分数。

微调时,冻结基础策略 πbase\pi_{\text{base}} 的观测编码器,引入两层 MLP 的残差策略 πres\pi_{\text{res}},其输入为基础隐特征 ztz_t、基础动作 atbasea_t^{\text{base}} 和奖励模型提取的偏好隐表示 hth_t,输出动作修正量,最终动作为 atfinal=atbase+atresa_t^{\text{final}} = a_t^{\text{base}} + a_t^{\text{res}}。训练损失为奖励加权行为克隆损失:

Lres=Et[wt∥atres−(at−atbase)∥2]+αEt[∥atres∥2]\mathcal{L}_{\text{res}} = \mathbb{E}_t\left[w_t \|a_t^{\text{res}} - (a_t - a_t^{\text{base}})\|^2\right] + \alpha \mathbb{E}_t\left[\|a_t^{\text{res}}\|^2\right]

其中 wt=exp⁡(βrt)/Et[exp⁡(βrt)]w_t = \exp(\beta r_t) / \mathbb{E}_t[\exp(\beta r_t)],使得高奖励样本获得更多模仿权重,同时正则化项防止过大修正。

创新点和贡献

  • 面向精细操作的偏好对齐首例:首次在真实机器人上对连续、主观的精细接触任务(刀削多品种果蔬)实现基于人类偏好的策略微调,将语言模型领域的偏好对齐思想拓展到复杂的力-运动耦合场景。
  • 两阶段高效学习管道:第一阶段通过力感知模仿学习仅需 50–200 条真实轨迹就能获得较高成功率的基础策略;第二阶段借助学习到的奖励模型实现偏好对齐,无需额外专家演示,策略得分最多提升 40%(见表 V 中苹果成功率从 60% 升至 100%,平均得分从 3.8 升至 7.1)。
  • 零样本泛化能力:单一果蔬上训练的策略不仅能泛化到同种类别的不同实例,还对差异巨大的跨品种物体展现出惊人泛化:黄瓜策略在 zucchini 上有 50% 成功率,苹果策略在梨上 90%,土豆策略在白萝卜上 80%(见第 IV-A 节)。这得益于灰度图像、力感知和相对动作表示的设计。
  • 数据收集方法对比与模态消融:论文系统比较了 SpaceMouse 遥操作、VR 遥操作、示教回放等方法,发现 SpaceMouse 能以更低成本获得更高成功率(100%,平均得分 8.5)。消融实验证明腕部双摄像头、灰度视觉和力/力矩数据的重要性(表 II、III),为类似系统设计提供了实践指引。

实验结果分析

论文在黄瓜、苹果和土豆三类果蔬上进行了全面评估,定义成功为全局定性评分>3。

数据收集方法:SpaceMouse 遥操作在成功率和平均得分上均碾压基于模型规划、VR 遥操作和示教回放(见表 I)。示教轨迹得分高(7.2),但重放成功率却为 0%,原因在于果蔬表面多变导致固定柔顺参数难以迁移。这体现了直接遥操作在数据质量和可复现性上的优势。

策略基础性能:基础策略在同品种测试中达到 100% 成功率;跨品种测试显示虽然成功率有所下降,但仍显著优于随机水平。样本效率实验(表 IV)表明,随着演示数量增加,成功率几乎线性增长,直到 200 条(约 33 个土豆)达到 80% 成功率。

偏好微调效果:表 V 对比了仅基础策略、仅定量奖励、仅定性奖励、IQL 加权等方法,论文方法(结合定量+定性奖励)在苹果和土豆上均达到 100% 成功率且平均得分最高(7.1 和 7.3)。单独使用定量或定性奖励效果明显减弱,甚至退化,反映了两层偏好的互补性。使用 IQL 离线强化学习的微调方法完全失效,验证了加权行为克隆在有限数据下的稳定性。

奖励设计与微调手段:适当的时间密度(每步精细评分)至关重要,过稀疏(每轨迹)或二元评分均无法有效提升策略(表 VI)。利用学习到的奖励模型时,按奖励加权所有样本的效果优于仅保留高分样本过滤或优势加权(表 VII)。此外,分阶段训练加残差层是稳定获得高性能的关键,直接微调或从零开始奖励加权训练均导致崩溃(表 VIII)。

感知选择:腕部 “切削前” 视角比 “切削后” 视角对策略贡献更大,可能是因为它能捕捉更少遮挡的刀-果接触区(表 II)。将彩色图像转为灰度图像有效防止了策略对纹理过拟合、促进了泛化(表 III)。

实践建议

面向试图复现或借鉴该方法的机器人操作从业者:

  1. 数据收集优先采用力反馈遥操作:若任务涉及密切接触和力调控,SpaceMouse 等轻量遥操作装置可兼得精细控制与数据平滑性,显著优于 VR 遥操作和事后参数调优的示教方法。实验中 SpaceMouse 收集的轨迹成功率高达 100%(表 I),且所需训练数据量极少。

  2. 多模态感知精简设计:使用灰度图而非彩色图、双腕部摄像头(尤其是 “切削前” 视角)及力/力矩读数,三者组合可兼顾泛化和任务精度。灰度图使策略关注几何特征而非纹理,对跨品种泛化尤其重要。建议避免过度依赖单一视角,因为 “切削后” 视图常被果蔬本体遮挡。

  3. 分阶段训练与残差微调:不宜一步到位地从零训练对奖励加权。实践证明,冻结基础策略学习残差修正可确保稳定训练,避免灾难性遗忘。

  4. 偏好标注双通道设计:同时收集局部定量评分(厚度等级)和全局定性评分(喜好分数),并以加权融合作为奖励信号。论文α取值对果子为 0.85,土豆为 0.75,可根据任务特点调整。标注密度选在每步精准评分效果最佳,若人力有限可先标注部分数据训练奖励模型,再用其推断未标注部分。

  5. 策略泛化与安全性:基础策略已表现出零样本跨品种泛化,实际部署前可在少量目标品种上微调,快速提升成功率。同时注意任务中刀与手的物理安全,确保柔顺控制器参数经过充分调试(参数表可见附录 -A),可结合论文附录中的扭矩滤波和阻尼耦合项增强接触稳定性。

整体而言,该框架展示了一条数据高效、偏好对齐的精细操作学习路径,值得在切削、缝合、雕刻等高主观性任务中推广应用。