PhysMoDPO:基于偏好优化的物理合理人形运动
PhysMoDPO: Physically-Plausible Humanoid Motion with Preference Optimization
论文信息
标题: PhysMoDPO: Physically-Plausible Humanoid Motion with Preference Optimization
作者: Yangsong Zhang, Anujith Muraleedharan, Rikhat Akizhanov, et al.
发布日期: 2026-03-13
arXiv ID: 2603.13228v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题: 现有文本驱动的类人动作生成模型在运动学空间效果出色,但直接部署到物理仿真或真实机器人时,因忽略接触、平衡等约束,经过全身控制器修正后动作会发生严重变形,难以同时保持物理真实性与文本指令的匹配。
- 核心方法: 提出 PhysMoDPO 框架,将固定的全身控制器(WBC)作为 “物理执行器” 集成到训练流程,在仿真中运行生成的动作并计算物理奖励与任务奖励,再利用直接偏好优化(DPO)自动构建偏好对,微调扩散模型,使其生成的原始运动学动作经 WBC 执行后既能遵守物理约束又能忠实于条件输入。
- 关键结果: 在 HumanML3D 文本‑动作生成任务上,R@3 从 0.8310 提高到 0.8517,动作平滑度指标 Jerk 从 46.75 降至 43.60(表 2);在 Unitree G1 机器人上实现了零样本迁移,用户研究中文本一致性、平滑性和稳定性均优于对比方法。
- 主要局限: 当前框架仅适用于平坦地面运动,扩展到多样地形仍需进一步工作;偏好对构建依赖固定的仿真跟踪策略,可能引入评估偏差。
- 适合读者: 从事人形机器人控制、物理角色动画、扩散生成模型对齐以及偏好优化(DPO/RLHF)的研究者与工程师。
1. 论文背景和研究动机
基于扩散模型的文本条件动作生成取得了显著进展,如 MotionStreamer、OmniControl 等工作能够从文字描述甚至空间约束中合成流畅的人体运动序列。然而,这类模型训练与评估完全在运动学空间进行,输出只保证关节位置和旋转的统计合理性,忽略了质量分布、接触反力、执行器限制等物理前提。一旦将这些动作交给物理仿真器或真实机器人执行,机器人内部的全身体控制器(WBC)往往不得不大幅修正动作以满足动力学约束,导致实际执行的轨迹与原始生成动作之间出现巨大偏差。结果便是:在运动学指标下表现优异的生成模型,对于具身部署而言并不可靠。
现有增强物理合理性的工作主要沿两条路线:一是在测试时施加手工设计损失或训练辅助物理修正模块(如 PhysPT、PhysDiff),但这类方法容易改变输出分布,损害任务指标的保持;二是使用强化学习以运动学奖励微调生成器(如 ReinDiffuse、HY‑Motion),但其奖励函数通常仅包含浮动和滑步等简单启发项,难以覆盖重心偏移、抖动等复杂物理现象。因此,如何在不牺牲任务跟随能力的前提下,系统地让生成动作适应物理执行,仍是一个开放问题。
PhysMoDPO 的动机即源于此:不是要求生成器直接输出物理可行的关节序列,而是将重点转移到 “经过 WBC 执行后的轨迹” 上,用仿真轨迹的质量来定义偏好,利用 DPO 微调生成器,从而弥合运动学生成与物理执行之间的鸿沟。
2. 核心方法和技术细节
PhysMoDPO 的核心理念是:把评估靶心从运动学空间移至部署空间。给定一个条件信号 (文本或文本+空间控制),模型 采出运动学动作序列 ,经由固定的追踪控制器(本例采用 DeepMimic)转换为物理仿真轨迹 ,所有奖励都在 上计算,构建偏好对后再用 DPO 微调 。
2.1 物理算子与奖励设计
追踪控制器形式化为映射 。生成的艺术在于最大化 “可追踪性”,使 经 后改动尽可能少。为此设计了两个物理奖励:
- 追踪奖励:,鼓励物理执行与生成动作一致。
- 滑步惩罚: 统计脚触地且水平速度过大的帧数并加以惩罚,抑制脚底漂移。
任务侧则要求执行后的轨迹仍然匹配原始条件:
- 文本对齐奖励: 使用预训练的 TMR 模型,计算 与文本在共享隐空间中的余弦相似度。
- 空间控制奖励:当存在稀疏关节目标 时, 以加权 MSE 衡量 与目标的偏差。
所有奖励均在 上计算,而不涉及原始 ,这直接消除了部署中的评价错配。
2.2 DPO 偏好对齐与迭代微调
对于每一个条件 ,模型采样 个候选运动 ,每个候选经 得到 并计算各奖励分数。偏好对构建采用 支配准则:若 在所有奖励项上均优于 ,则 构成一个 win-lose 对。这种设计无需人工设置奖励权重,能够自然保持多目标的平衡。
微调目标由两部分组成:标准的 DPO 损失 使模型更多产出具优胜特征的样本,同时加入监督微调项 以稳定训练。此外,整个过程采用 迭代生成‑微调 策略:用当前模型重新采样、重新构建偏好对,使偏好数据始终贴合模型当前的转移失败模式。实验表明,三轮迭代明显优于单轮(表 6a)。
3. 创新点和贡献
PhysMoDPO 从问题定义到技术实现带来了三层创新:
-
首次将 WBC 极简地融入偏好优化训练管线。有别于既往工作直接使用浮滑等手工奖励评价运动学样本,PhysMoDPO 将物理执行步骤 视为黑盒评估器,使奖励天然包含动力学、接触等复杂因素,无需显式建模。
-
在部署空间内评测并优化条件匹配。通过在 上计算文本对齐和空间控制奖励,框架直接优化 “执行后的条件忠诚度”,从而彻底解决运动学评估与具身部署之间的指标错位。
-
迭代 DPO 与支配性偏好构造。得益于自动生成的支配偏好对,训练不再依赖人工奖励融合权重,而迭代采样又让模型始终从自身最需要改进的区域获取监督信号。
这些设计使得模型输出的运动学动作虽未必完美物理合规,却具有高度 “可追踪性”,能在仿真和真实机器人上保真地再现文本指令与空间约束。
4. 实验结果分析
4.1 文本到动作生成
在 HumanML3D 测试集上,以 MotionStreamer 为骨干的 PhysMoDPO 经仿真执行后,文本检索 R@3 从 0.8310 升至 0.8517,动作 Jerk 从 46.75 降至 43.60,FID 也从 49.14 改善至 48.29(表 2)。相比之下,端到端物理策略 MaskedMimic 虽然运动本身物理可行,但文本匹配度较低(R@1 仅 0.4134),而单纯的 SFT 微调则几乎毫无增益。这表明 PhysMoDPO 能够保持甚至提升条件匹配,同时增强物理真实性和平滑性。
4.2 空间‑文本控制任务
空间控制评测采用 OmniControl 的 cross-control 设定。PhysMoDPO 在 HumanML3D 上将控制误差从 0.0938 降到 0.0923,FID 从 0.75 降至 0.66,Jerk 从 64.07 降至 58.02(表 3 左侧)。在零样本、分布外的 OMOMO 数据集上同样表现稳健:控制误差大幅减少,FID 和 Jerk 显著降低(表 3 右侧),证明框架具有较强的泛化能力。
4.3 零样本机器人部署
将 SMPL 模型的重定向动作直接部署到 Unitree G1 机器人,PhysMoDPO 在仿真中继续保持最优(表 4、5),并在真实机器人实验中通过用户研究验证了优势:在文本遵循、动作平滑度和机器人稳定性三个维度上均优于 OmniControl 和 MaskedMimic(图 5)。进一步在 H1 机器人上的实验同样显示领先的空间可控性和运动质量(附录表 7),证实跨形态的迁移潜力。
4.4 消融分析
消融实验表明,迭代轮次从 1 增加到 3 时,所有指标持续改善(表 6a),验证了在线刷新偏好数据的必要性。奖励方面,仅使用追踪奖励会导致保守动作,而逐一引入控制、滑步和文本对齐奖励能依次提升控制精度、物理真实性和文本一致性,最终组合达到最佳效果(表 6b)。
实践建议
PhysMoDPO 为研究者和工程师提供了一套可复用的技术方案,尤其适合以下场景:
- 基于扩散模型的机器人动作生成:若已拥有文本‑动作扩散模型(如 MotionStreamer 或 OmniControl),可在训练后端接入物理仿真与 WBC,采用 DPO 偏好微调,使生成动作易于追踪,无需修改控制器本身。
- 跨机器人平台的零样本迁移:将 SMPL 格式动作重定向到不同结构的机器人(如 Unitree G1、H1)时,只需重新训练对应的 WBC,生成器端保持不动。在平坦地面运动任务中,该方案展示了强泛化能力。
- 微调策略选择:实验表明 、DPO 温度 是较优的超参数组合。 不宜过大,以免削弱偏好优化的增益。多奖励场景下,采用支配准则构建偏好对比线性加权融合更稳定,可避免繁琐的权重调节。
- 迭代数据生成:建议采用至少 2–3 轮迭代微调,每轮用更新后的模型重新生成候选动作。这能让偏好数据持续对应模型新出现的失败模式,最大化收益。
- 局限性注意:当前方法假设平坦地面,直接用于楼梯、斜坡场景时可能失效。后续可通过在仿真中加入地形信息并扩展奖励函数来改善。另外,固定的 WBC 可能带来偏好偏差,可通过引入多样化的仿真器或人工评估信号来进一步提升鲁棒性。
总体而言,PhysMoDPO 展示了 “先模拟执行,再用执行结果微调生成器” 这一范式的巨大潜力,为人形机器人的可控物理动作生成提供了高效、可拓展的解决路径。