PAC-MAN:面向人形机器人躲避球全身安全的感知感知 CBF-RL

PAC-MAN: Perception-Aware CBF-RL for Whole-Body Safety in Humanoid Dodgeball

arXiv: 2607.28623v1

论文信息

标题: PAC-MAN: Perception-Aware CBF-RL for Whole-Body Safety in Humanoid Dodgeball

作者: Lizhi Yang, Junheng Li, Aaron D. Ames

发布日期: 2026-07-30

arXiv ID: 2607.28623v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决在仅使用机载视觉感知的情况下,如何让双足人形机器人实现全身躲避高速飞来的球,同时保持身体平衡。
  • 核心方法:论文提出 PAC-MAN 框架,将控制屏障函数(CBF)与强化学习(RL)结合,根据机载深度相机感知到的威胁信息,指导机器人产成全身协调的躲避动作,并通过对抗运动先验来规范动作风格。
  • 关键结果:部署在 Unitree G1 机器人上的策略,仅使用机载深度和本体感知,在 95% 的投掷中成功躲避,且不依赖任何外部球体状态信息(见表 3)。
  • 主要局限:该框架主要面向在固定站位点恢复站立后的躲避任务,尚未扩展到在行走中躲避;更强的安全结构(Joint-CBF)在仅用固定相机时性能反而下降,表明内部化的安全结构受限于可感知的信息量。
  • 适合读者:对人形机器人敏捷控制、基于视觉的安全控制以及强化学习在真实机器人上部署感兴趣的研究人员和工程师。

论文背景和研究动机

人形机器人在有移动物体的环境中工作时,必须在极短时间内做出反应,同时自身不能失去平衡。躲避球任务是一个极好的测试平台:它要求在短时间窗口内,机器人必须仅凭机载视觉感知来球的威胁,判断哪些身体部位可能被击中,并协调躯干、手臂和腿部快速避开,同时保持站立。这比单纯的导航或保持平衡更具挑战性。

传统的基于学习的控制器可以实现动态运动或视觉条件反射,但从机载视觉实现反应式的全身安全控制仍然困难,尤其对于有高维自由度的双足人形机器人。一个关键挑战在于,确保安全的核心方法——控制屏障函数(CBF)——通常需要准确的相关状态信息。然而,在真实部署中,机器人仅能依赖有限的机载感知,例如一个可能短暂出现在视野中、仅由几个深度像素点构成的球体。这使得用于训练的安全结构和部署时可感知到的信息之间存在一道鸿沟。

因此,这篇论文的核心动机是,将威胁表征和安全屏障设计作为一个耦合的安全问题来统一研究,而不是将它们视为独立的模块。作者的目的在于探究,一个智能体在仅能获得部署真实感知(即机载深度相机图像)的条件下,能通过训练将多少安全机制内部化。

核心方法和技术细节

PAC-MAN 框架的核心是将部署真实感知与基于控制屏障函数(CBF)的安全指导结合起来,具体包含以下几个关键技术细节。

1. 部署真实感知与威胁表征

策略的输入是模拟机载感知的观测值 oto_t,它完全不包含真实的球体状态。唯一的视觉信息是来自头戴 RGB-D 相机的分割掩码深度图 Dt\mathcal{D}_t。为了高效处理,算法从 RGB 图像中分割出球体,仅保留这些像素的深度值,其余设为无穷远,再将图像池化到极小的分辨率(16×916\times9)。为了捕捉运动信息,模型将当前帧与几个稀疏的历史帧堆叠起来,作为时域输入。此外,为了模拟真实感知的噪音,训练时采用了多种数据增强,如全图丢失、像素丢失、深度抖动和边缘闪烁。

为了探究安全结构与感知信息的耦合关系,论文提出了两种不同强度的 CBF 机制:

  • Link-CBF(轻量级):这是一个训练时的奖励项。它为机器人身体的每一个连杆计算一个屏障函数 hih_i,定义为连杆到球心的距离减去两者的半径之和(公式 4)。当任何一个连杆进入不安全区域并快速靠近球体时(即 h˙i+αhi≥0\dot{h}_i+\alpha h_i \geq 0 条件被违反),策略就会受到惩罚。这个信号指导策略产生了保护四肢和躯干的躲避行为,而不仅仅是移动重心。Link-CBF 仅在训练时作为奖励引导,部署时完全移除。

  • Joint-CBF(强约束):这是一种更强的关节空间投影方法。它选择最受威胁的身体连杆,计算一个关于关节速度的仿射约束(公式 6)。如果策略产生的行动违反此约束,就会将其投影回安全集合内(公式 7)。研究评估了两种模式:一是将它仅作为训练时的额外奖励项(鼓励策略学习自我修正),二是将它作为部署时的在线滤波器(+filter 模式)。后者因为需要访问真实的球体状态,无法直接用现有视觉系统实现,它揭示的是安全性能的信息上限。

3. 对抗运动先验

躲避球任务的核心奖励是 “不被击中”,但这个信号过于稀疏,无法指导机器人产生自然、流畅的躲避动作。为此,论文引入了一个对抗运动先验。该先验训练一个判别器来区分策略生成的动作和来自人类运动捕捉数据(如蹲下、倾斜、侧步、跳跃)的动作。策略获得的风格奖励是 “成功欺骗判别器” 的程度,从而使得机器人习得的躲避动作——如蹲下、侧身、跨步——更自然,而非怪异的关节扭曲。

创新点和贡献

这项工作的主要创新在于提出了感知-安全协同设计的思想,并系统性地评估了感知能力如何决定可采用的安全机制强度。

  1. 感知信息决定安全结构:论文的核心洞察是,更强的 CBF 结构(如 Joint-CBF)并不总有优势。实验发现,在固定相机(感知信息有限)下,如果将 Joint-CBF 仅作为训练指导,策略性能会显著下降(部署成功率从 89% 降至 76%),因为策略无法从视觉中推断足够的信息来内部化这个强约束。相反,轻量级的 Link-CBF 容忍不完美感知,性能保持一致。这揭示了安全机制的设计必须与可用的感知信息量相匹配(见表 2 和图 II)。

  2. 填补感知到安全的鸿沟:PAC-MAN 成功地将机载深度感知与全身 CBF 安全指导相结合。系统使用极低分辨率的深度图像(16×916\times9)作为唯一威胁信息,通过训练使策略学会从这些稀疏的视觉线索中推断出等同于几何安全约束的行为,从而在部署时无需运行计算代价高昂的 CBF 求解器,也无需精确的外部状态估计。

  3. 验证了方法的实用性:论文完成了从仿真到真机(Unitree G1)的零样本迁移,实现了 95% 的成功躲避率。更重要的是,通过语义分割,同一个策略学会了躲避不同的球(如足球、泡沫球),展示了感知前端的通用性。

实验结果分析

论文通过详尽的模拟实验和真实机器人实验验证了其核心观点。

模拟实验

模拟实验在 “重置” 和 “部署” 两种模式下进行,主要对比了不同安全机制(无 CBF、Link-CBF、Joint-CBF)在不同感知条件(状态预言、固定相机、万向相机)下的全身躲避成功率。全身成功定义为任何一个身体连杆都未被击中且机器人未摔倒,这比仅测量骨盆到球的距离更严格。

主要发现如下:

  • 固定相机已足够:即使是固定相机下的 Link-CBF 策略,其成功率(重置模式 90%,部署模式 89%)与知晓真实球体状态的 “状态预言” 策略(88% 和 93%)差距不大,这表明固定的机载相机对躲避任务来说是够用的(表 2)。
  • 强安全结构需要强感知:当感知完美(状态预言)时,最强的安全配置(+filter 模式)表现最佳(98%-99%)。但在固定相机下,将 Joint-CBF 仅用作训练指导,性能反而不如更弱的 Link-CBF。引入一个可以追踪球体的万向相机显著修复了 Joint-CBF 的性能(部署模式从 76% 提升至 90%),证明了更强的安全结构需要更好的可观测性(表 2,图 II(顶部))。
  • 静态基准极低:作为对比,一个静止不动的机器人在相同投掷测试下,只有 4% 的生存率,表明这些投掷高度精准。

真实机器人实验

该工作在 Unitree G1 人形机器人上部署了在固定相机下训练的 Link-CBF 策略。感知前端使用了基于 EfficientTAM 的实时追踪器来分割球体,生成与训练一致的稀疏深度图。为防止误触发,感知管线还集成了多项保守的滤波器。

部署结果显示,在从正面进行的 20 次投掷中,机器人成功躲避了 19 次(成功率 95%),且所有失败案例均非摔倒。根据论文图 III 顶部的估计屏障值 hh 分析,被击中的那次发生在 h=0h=0 处,而所有成功躲避的序列,其所有连杆都保持在预定的安全壳之外。这有力地证明了,通过 PAC-MAN 训练的视觉-运动策略能够稳健地从仿真迁移到现实世界中。

实践建议

基于 PAC-MAN 的工程落地经验,可以为相关领域的研究和开发提供以下建议:

  1. 匹配安全强度与感知能力是系统设计的关键:在构建诸如碰撞避免等安全关键系统时,不应盲目使用最强的安全约束。工程团队应首先评估部署场景中,关键状态(如障碍物位置、速度)的可观测性、噪声水平和延迟。如果感知能力有限,一个更简单、更健壮的安全引导机制(如 Link-CBF 式的稀疏奖励)可能比一个复杂的、需要精确状态反馈的在线安全滤波器(如 Joint-CBF 的+filter 模式)更有效。从信息流向控制的角度做联合设计,可以避免系统性能因过强的、无法满足的约束而崩溃。

  2. 低分辨率视觉输入可高效支持高速运动决策:该工作证明,策略不依赖高保真度的 3D 重建。将场景降维为 16×916\times9 的球体深度图,并辅以稀疏时序堆叠,已足以编码速度、方向和距离等躲避任务所需的核心信息。这种极端的压缩大大降低了仿真训练的计算负载和策略推理的延迟,非常适合需要次秒级反应的机器人任务。在实践中,可以优先实现一个快速、鲁棒的特定物体分割跟踪器,而非通用的、计算量大的场景理解模块。

  3. 利用运动先验和数据增强弥合仿真与现实差距:实现 95% 成功率的零样本迁移,不仅依赖于精确的仿真物理参数,更关键在于其训练策略。对抗运动先验为策略提供了符合物理规律的、类人的动作模式基础,使其在遇到未知扰动的真实环境时,能产生更稳定、更自然的反应,而不是奇异、危险的动作。此外,针对视觉感知管线的特定失败模式(如丢帧、噪点、边缘断裂),在仿真中进行针对性的数据增强(如文中提到的各种像素 dropout),是提升视觉策略鲁棒性的核心手段,这比单纯让模型在完美渲染图中训练有效得多。