HumanTracker:迈向全面且与人类对齐的运动跟踪基准

HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark

arXiv: 2608.13555v1

论文信息

标题: HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark

作者: Dairu Liu, Zekun Qi, Jiayu Zeng, et al.

发布日期: 2026-08-13

arXiv ID: 2608.13555v1

PDF 链接: 下载 PDF

3 分钟速览

研究问题: 人形机器人运动跟踪评价存在两个问题:传统关节误差指标(如 MPJPE)常与人类对视频的真实感知不一致,尤其忽略足底滑动、接触时序错误和不稳定支撑;同时常用评测集规模小、缺少长尾运动类别,难以暴露接触丰富、长时序行为的失败。

核心方法: 构建约 153 小时、四个运动族的光学动捕基准 HumanTracker,并采集 12K 组人类偏好对比,训练一个基于轨迹 Transformer 的奖励模型 HumanScore,将跟踪质量评估对齐到人类偏好。

关键结果: 在论文报告的人类偏好对齐实验中,HumanScore 的 Align Rate 为 0.9083,高于 MPJPE、关节速度误差、足部接触准确率等所有比较的传统单项诊断指标(表 4)。

主要局限: HumanScore 输入包含足底力、接触力、全局速度等特权模拟器状态,难以直接用于真实硬件;训练数据只来自四个跟踪器和一个 29-DoF 人形模型,且 Ground 等类别样本量明显少于 Daily 和 Interaction(附录 G)。

适合读者: 人形机器人运动跟踪、遥操作与全身模仿、机器人评估基准、人类偏好学习与奖励模型方向的研究者和工程师。

论文背景和研究动机

运动跟踪已成为人形机器人控制的核心能力,大量系统在物理仿真中学习反馈策略来跟踪参考运动。然而,“跟踪得好不好” 本身很难衡量。传统做法是报告 MPJPE、关键点误差等逐帧平均值,但这类指标本质上是把跟踪退化成了逐帧姿态匹配问题。论文指出,一个 rollout 可能关节误差很低,但脚在地上滑动、接触在错误时间断裂又重连,观察者会认为它很不自然、不稳定。

这种错位不是偶发现象,而是传统指标定义造成的:平均逐关节误差无法刻画接触、支撑、平衡以及闭环控制中的误差累积。论文通过视频观察给出了直观证据:两个 rollout 的 MPJPE 接近,但人类可靠地偏好接触干净、支撑稳定的那个。

另一个问题是评测数据。尽管 PHUMA、SONIC 等大规模运动来源已经出现,但人形跟踪领域常用的 AMASS 测试集只有 140 个序列,缺乏接触切换、非对称平衡和复杂恢复等长尾动作。而且结果通常只报告一个聚合分数,无法定位失败到底发生在哪类运动。

核心方法和技术细节

HumanTracker 包含两部分:大规模分类动捕基准,以及与人类偏好对齐的评估指标 HumanScore。

数据构建与四类运动族

基准由 24 名职业表演者的光学动捕数据构建,包括舞蹈教师、健身教练、网球教练和全职动捕演员。论文对捕获的 SMPL 序列使用 General Motion Retargeting (GMR) 重定向到基准人形,并人工检查、删除漂浮、穿地、接触不连续等处理伪影。

数据被划分为四个诊断族:

  • Daily:行走、转身、日常手势,测试稳态稳定性和漂移;
  • Highly Dynamic:跳跃、踢腿、杂技、快速脚步,暴露冲击和支撑快速切换时的相位误差;
  • Interaction:与物体或环境相关的整体协调动作,可用于操控运动学先验;
  • Ground:跪、坐、滚动、恢复,低重心和多点接触使控制器对接触几何和摩擦非常敏感。

论文采用 9:1 划分训练/测试,并保持运动来源不跨分。表 2 显示 Ground 仅约 5 小时、1.6K clips,而 Daily 约 89 小时,类别并不平衡,因此结果按家族分别报告。

标准化跟踪器评估

对所有方法统一转换为同一 29-DoF 人形的 qpos 表示,通过公共 MuJoCo 入口执行策略,以 50 Hz 记录广义位置/速度、动作、足部接触与力、足/骨盆速度以及 14 个关键点姿态。论文沿用 SONIC 的终止判据:骨盆/脚踝/手腕垂直误差超 0.25 m、骨盆旋转误差超 1 rad,或出现非有限值时判失败。

报告指标包括 Succ(完成率)、MPJPE(29 个驱动关节平均绝对误差,单位 rad),以及关节速度误差、关键点误差、足部接触一致性、加速度和 jerk。所有数值均在 HumanTracker 测试集上计算。

HumanScore:偏好对齐的轨迹奖励模型

偏好数据只来自训练集。四个跟踪器 GMT、Humanoid-GPT、SONIC、TWIST2 对相同参考生成 rollout,按 250 帧(5 秒)切窗。随后按统一间隔采样窗口,并均衡分配六种跟踪器组合。六位人形机器人方向博士生通过随机左右展示的界面标注 “左更好/右更好/相似/无法比较”,排除无法比较对后,经过镜像得到 12K 条偏好记录。

模型输入不是视频,而是模拟器轨迹。每个帧对应一个 539 维向量:70 维当前参考状态,469 维仿真状态、控制量、测量接触动力学、根运动学和关键点运动学。该向量经线性投影、位置编码后进入 Transformer encoder,通过 masked mean pooling 得到轨迹表示,再由 MLP 输出标量奖励。

优化目标使用 Bradley–Terry loss:

Ldiff(i)=−log⁡σ(rchosen(i)−rrejected(i))\mathcal{L}_{\mathrm{diff}}^{(i)}=-\log\sigma\left(r_{\mathrm{chosen}}^{(i)}-r_{\mathrm{rejected}}^{(i)}\right)

对 Similar 对使用对称约束:

Lsimilar(j)=−12log⁡σ(Δj)−12log⁡σ(−Δj)\mathcal{L}_{\mathrm{similar}}^{(j)}=-\frac12\log\sigma(\Delta_j)-\frac12\log\sigma(-\Delta_j)

推理时,每个窗口的奖励经 sigmoid 映射到 (0,1)(0,1),再按窗口实际帧数加权平均,乘 100 得到 HumanScore。短窗口右侧零填充,但填充位置通过 mask 不参与 attention 和池化。

创新点和贡献

本文的主要贡献体现在三个方面。

第一,把评价指标从 “姿态误差” 转向 “感知质量”。HumanScore 不是简单组合足部滑动、根漂移等规则诊断,而是从人类偏好中学习轨迹级奖励。表 4 显示,在该实验设置下,HumanScore 的人类偏好一致率为 0.9083,高于 Foot Contact Accuracy 的 0.7882、平均加速度的 0.6933 等,说明它捕捉到了传统单项诊断无法覆盖的动态感知特征。

第二,提供了一个大规模、可细粒度诊断的基准。约 153 小时、25K clips 的规模显著超过 AMASS 的约 40 小时,且首次显式按运动族组织,使结果不再被聚合分数掩盖。论文在表 3 中展示,四个跟踪器在不同运动族上表现差异明显:Humanoid-GPT 在 Daily 和 Highly Dynamic 上各项指标领先;SONIC 在 Interaction 上完成率最高(97.6%),在 Ground 上 HumanScore 最高(26.5),但 Ground 完成率只有 20.1%。这说明同一跟踪器在不同接触场景下的相对优劣会改变。

第三,建立了标准化评估协议。论文保留各跟踪器原生策略接口,但统一参考表示、机器人模型、索引、rollout 统计和指标实现,避免后处理差异被误认为跟踪器差异。

实验结果分析

在零样本评测中,Humanoid-GPT 整体最强,但并非在所有家族都占优(表 3)。例如在 Ground 家族,Humanoid-GPT 的 Succ 为 32.9%,HumanScore 为 24.9;SONIC 的 Succ 更低(20.1%),但 HumanScore 反而更高(26.5)。论文作者认为,这反映了 “完成度” 和 “感知自然度” 并不总是一致,SONIC 在 Ground 上完成的 rollout 被观察者认为更自然、更稳定。这个结论是论文作者基于表 3 的解读。

偏好对齐实验(表 4)比较了多个传统诊断指标。论文采用 per-family 对齐率再平均的方式,避免 Daily 和 Interaction 样本主导结果。HumanScore 达到 0.9083,MPJPE 为 0.8049,足部接触准确率仅 0.7882。作者推测,传统指标各自只覆盖姿态、速度或接触的一部分,而人类会综合平滑性、稳定性和误差随时间演变来判断轨迹质量。这一推测在论文中未通过额外的因果实验证明。

消融分析(图 4)提供了三点:去除 “测量接触特征” 对 Ground 家族影响最大,说明多点接触和摩擦信息对复杂接触转换很重要;加入未来参考信息并未带来提升,甚至略差,说明依靠当前和历史状态已足够评估动作质量;上下文从 1 秒增长到 5 秒时对齐率持续提高,表明滑动、抖动、漂移和从不稳定中恢复等事件需要更长时间窗口才能被模型捕捉。

实践建议

对于人形机器人运动跟踪团队,HumanTracker 可以作为 AMASS 之外的重要补充评测。尤其建议单独观察 Ground 和 Highly Dynamic 族的结果,而不是只看聚合分数;很多控制器在 Daily 上成功率很高,但 Ground 几乎完全失败。论文表 3 已经清楚展示了这种分化。

HumanScore 更适合作为离线评估器,而不是训练中的奖励函数。论文附录 G 明确指出,直接优化学习型分数可能诱发利用模型缺陷的行为;若要用作强化学习奖励,需要额外正则化和独立人类评估。此外,当前 HumanScore 依赖 539 维特权模拟器状态,真实机器人上往往无法获得足底力和精确接触力。工程落地时应先替换为可观测特征集,或引入经验证的状态估计器。

如果要构建内部偏好数据,论文的偏好采集流程值得复用:固定窗口长度、均衡跟踪器配对、随机展示位置、排除 “无法比较” 样本,并按源运动分组切分训练/测试。该方法可以避免相邻片段泄漏和主导类别偏差。

最后,建议将 HumanScore 与传统诊断指标并列报告。HumanScore 总结感知质量,而 MPJPE、接触准确率、关节加速度等指标仍然有助于定位具体错误来源。二者结合能同时回答 “它看起来像不像人” 和 “它在哪里出了问题”。