FAMOS:基于稀疏观测的前馈三维关节建模

FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations

arXiv: 2609.20817v1

论文信息

标题: FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations

作者: Kevin Qu, Tao Sun, Massimiliano Viola, et al.

发布日期: 2026-09-17

arXiv ID: 2609.20817v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:如何从稀疏、无序、部分点云观测中,以前馈方式联合预测铰接物体的可动部件分割和关节参数,避免单状态推理的形状先验依赖。
  • 核心方法:提出 Multi-state Articulation Transformer,交替使用状态级注意力与全局注意力;同时引入 observed articulation span 损失,强制模型聚合多个观测中的运动证据。
  • 关键结果:在 ACD 和 ArtiCraft 跨数据集基准上,分割 F1 分别达到 71.9 和 92.5,运动估计 MAO 达到 64.5 和 90.0(见表 1、表 2);论文摘要报告相对最强前馈基线分割与运动 F1 最高提升 64.5% 和 75.7%。
  • 主要局限:对与训练分布差异较大的对象类别性能下降;小可动部件仍难处理;仅支持深度为 1 的运动树,即每个可动部件直接连接到静态底座(见附录 F)。
  • 适合读者:从事 3D 视觉、机器人操作、AR/VR、具身智能或可交互数字孪生研究,且关注稀疏观测下物体运动建模的研究者和工程师。

论文背景和研究动机

铰接物体在现实环境中无处不在,例如冰箱门、抽屉、剪刀等。机器人操作、增强现实和具身智能系统都需要理解这些物体的可动结构,并进一步创建可交互的数字副本。

现有方法存在明显限制。测试时优化方法通常要求每个关节状态都有密集多视图观测,并且往往需要先验知识,例如可动部件数量;其逐物体优化成本高,难以扩展到大规模场景。视频方法依赖时序点跟踪或交互序列,在遮挡、多部件运动下容易累积误差。近年来,前馈方法可以直接从单张图像或单个点云预测关节属性,但由于单状态观测中没有运动证据,这些方法主要依赖类别级形状先验,对未知几何和部分观测的泛化能力有限。

FAMOS 的目标是改变这一局面:从一组稀疏、无序、部分点云中联合推理可动部件和关节参数。输入可以由普通 RGB 图像通过 3D 基础模型重建而来,不要求密集扫描或固定状态数量。其核心假设是:多个关节状态之间的运动变化,应该成为比形状先验更可靠的关节建模信号。

核心方法和技术细节

FAMOS 的输入是 SS 个同一物体的部分点云,每个观测表示为一个状态 ss 的点集 Xs\mathbf{X}_s。这些点云共享同一个坐标框架,可以来自 3D 基础模型如 VGGT-Ω。模型需要输出部件数量、每个点的可动部件分割,以及每个部件的关节参数。论文考虑两类 1-DoF 关节:旋转副和移动副。

点编码阶段,每个观测独立处理。冻结的 PartField 主干提取部件感知特征,再与点的坐标和法线正弦编码拼接并投影,得到 token 集合。值得注意,论文没有加入观测索引或状态嵌入,以避免模型学到固定的状态身份,从而支持可变数量的输入观测。

模型使用 K=16K=16 个可学习部件查询,作为可动部件的候选。点 token 和部件查询经过 L=6L=6 层 Transformer 联合优化。每层先执行状态级注意力:各观测内部的点 token 自注意力,部件查询也独立自注意力;随后执行全局注意力:所有观测的点 token 与所有部件查询拼接后共同注意力,使查询能直接收集来自任意观测、任意点的证据,点 token 之间也能跨观测直接交互。这种设计尤其重要,因为不同观测之间只有部分几何重叠,可见表面随视角、遮挡和关节状态变化,必须通过点级交互建立跨观测对应。

预测头为每个点-查询对产生分割分数,再通过 softmax 分配分割标签。同一个查询在所有观测中对应同一个物理部件,因此分割天然具有跨状态一致性。每个查询还会预测关节类型:静态、旋转副或移动副。旋转副使用 6D Plücker 坐标表示,从中恢复单位轴和轴原点;移动副预测单位方向。

除常规关节参数外,FAMOS 引入 observed articulation span 辅助目标。给定真值关节值 θs,p\theta_{s,p},目标定义为部件 pp 在所有可见观测中的最大最小关节值之差:

Δp=max⁡s∈Vpθs,p−min⁡s∈Vpθs,p.\Delta_p = \max_{s\in\mathcal{V}_p}\theta_{s,p} - \min_{s\in\mathcal{V}_p}\theta_{s,p}.

该目标只对至少出现在两个状态中的部件定义。与固定关节上下限不同,observed span 依赖于具体输入观测集合,无法从单个观测推断,也无法通过对象级记忆获得。论文指出,这一损失旨在迫使模型在每个状态中定位同一部件,并聚合其相对配置信息,从而避免训练时只依赖单个观测的学习捷径。

训练时使用匈牙利匹配在真值部件和查询之间建立对应。总损失包括分割交叉熵、关节类型交叉熵、旋转副 Plücker 坐标 L1、移动副方向 L1,以及 observed span L1。

为了解决训练数据规模有限的问题,论文还设计了程序化生成器,用六种几何原语组装出 15 个物体族,如柜子、门、盒子、笔记本电脑、烤箱、洗衣机、风扇等。部件和关节参数在生成时自然可知。训练中通过内存生成资产,每个资产平均只需 2.99 ms(见附录 H),可在数据加载器中并行产生,几乎不增加计算开销。

创新点和贡献

FAMOS 的主要贡献可以概括为三点。

第一,它将铰接物体建模从单状态前馈推理扩展到多状态联合推理。输入是无需时间顺序的稀疏观测集合,支持可变状态数量,甚至支持单状态。论文的架构没有依赖状态索引,而是通过注意力机制隐式理解观测之间的关系。

第二,它提出了 observed articulation span 损失。与常规关节参数不同,该目标直接监督输入集上的可观测运动范围,迫使模型利用多观测运动证据,而不是只学习形状先验。消融研究表明,在 ACD 上移除该损失会使 MAO 从 47.3 降至 41.6(表 4,该消融只在 curated 数据上训练)。

第三,它建立了程序化训练数据生成管道,生成带有精确标注的铰接资产。结合预训练和混合训练策略,FAMOS 在跨数据集基准上获得显著收益。例如,在 ACD 上,加入程序化预训练后分割 F1 从 53.2 提升到 65.3,再加入 1:1 混合训练后提升到 71.9(表 5)。

实验结果分析

论文在三个基准上评估:PartNet-Mobility 代表同分布测试,ACD 和 ArtiCraft-10K 用于跨数据集泛化。基线包括前馈方法 Particulate,以及优化方法 ReArt 和 ArtGS。所有前馈方法默认使用 S=2S=2 个输入状态。

在可动部件分割上,FAMOS 在三个基准上都优于所有基线(表 1)。在 PartNet-Mobility 上,FAMOS 的 F1 为 98.4,Particulate 为 93.6;在更难的 ACD 上,FAMOS 达到 71.9,而 Particulate 为 43.7;在 ArtiCraft 上,两者分别为 92.5 和 76.6。优化基线在所有基准上都未超过 60 F1。该实验设置下,FAMOS 的精度和召回同时更高,说明它既减少了漏检,也减少了误检。

运动估计结果见表 2。在严格的 MAO 标准下,FAMOS 在 PartNet-Mobility、ACD、ArtiCraft 上分别达到 98.4、64.5 和 90.0,Particulate 则为 90.3、36.7 和 68.5。FAMOS 在 ACD 上匹配了 947 个部件,远高于 Particulate 的 572 个,说明其优势不是在少量容易部件上获得的。轴误差和原点误差也整体较低。

单状态实验见表 3。即使只给一个观测,FAMOS 仍然优于在相同设置下重新训练的 Particulate。论文认为,这说明模型除了利用运动证据,也获得了更鲁棒的对象级先验。

消融实验验证了两个关键设计。将全局注意力替换为寄存器注意力会降低跨数据集性能;移除 observed span 损失也一致降低 MAO(表 4)。输入状态数量的分析显示,从 1 个状态增加到 2 个状态带来最大增益,随后收益递减(图 7b)。论文还指出,模型能处理超过训练期最大状态数 S=4S=4 的输入,没有出现性能退化。

运行时间方面,在四个输入状态下,FAMOS 单物体推理为 0.1 秒,与 Particulate 相当,而 ReArt 和 ArtGS 分别为 182 秒和 297 秒(附录 B)。这种速度优势使其更适合批量处理和大规模场景。

实践建议

对于希望将多状态铰接建模用于真实系统的团队,FAMOS 给出了一条较清晰的落地路径。

首先,输入获取门槛较低。论文展示的流程是:使用 SAM2 从 RGB 图像中分割目标掩码,再用 VGGT-Ω 重建点云;多个不同关节状态的照片即可作为输入,不需要密集扫描。尽管 FAMOS 只使用合成数据训练,但在真实捕获上仍有合理预测(图 6)。因此,在机器人或 AR 应用中,可以先用手机拍摄同一物体在不同打开状态下的少量照片,形成稀疏多状态输入。

其次,部署时应优先收集至少两个不同关节状态的观测。实验显示,从单状态到双状态的性能提升最大(图 7b),因为第二状态提供了直接的运动证据,帮助消除单状态下几何上看似合理但关节参数错误的模糊预测。

如果要在垂直领域复现或微调,论文的训练策略值得参考:先用程序化生成的大规模资产预训练,再用目标域真实资产与程序化资产按 1:1 混合微调。在 ACD 上,这一策略将 segmentation F1 从 53.2 提升到 71.9,MAO 从 47.3 提升到 64.5(表 5)。如果直接只用 curated 数据训练,跨数据集泛化会明显不足。

模型层面,应保留全局注意力和 observed span 损失。消融证据表明,两者对 ACD 这类分布外基准尤其重要(表 4)。如果为了速度替换全局注意力,需要预期跨观测推理能力下降。

最后,落地时要考虑论文明确限制:对象类别与训练分布差异过大、包含极小可动部件、或上游重建噪声严重时,预测可能失败(附录 F)。在关键业务中应加入目标域数据,并评估对深度大于 1 的运动树是否需要额外建模。当前 FAMOS 仅支持深度 1 运动树,即部件直接附在静态底座上,对多级链式结构的支持仍需扩展。

更详细信息可见 FAMOS 项目页面。