SM4RT:学习用于 4D 重建的结构化运动几何
论文信息
标题: SM4RT: Learning Structured Motion Geometry for 4D Reconstruction
作者: Shing Ho J. Lin, Wenzhao Zheng, Dong Zhuo, et al.
发布日期: 2026-07-24
arXiv ID: 2607.22534v1
PDF 链接: 下载 PDF
从点到群:SM4RT 如何赋予 4D 重建以物理灵魂
背景与动机:运动感知的范式困境
近年来,几何基础模型(Geometry Foundation Models, GFM)在单目三维重建领域取得了长足进步。从 VGGT 到 DepthAnythingV3,这些模型能以端到端的方式从普通视频中恢复相机参数、深度图和场景几何。然而,当我们将目光投向动态世界时,一个根本性的挑战浮现出来:如何让模型不仅知道 “点在哪里”,更能理解 “为什么点会这样运动”?
现有的运动感知方法几乎都陷入了同一个范式陷阱:它们将运动视为无数个独立点的位移集合。无论是稀疏的点追踪(如 SpatialTracker),还是稠密的光流估计(如 Any4D),本质上都在预测每个像素的独立运动轨迹。这种 “点对点” 的位移思维虽然善于定位,却完全忽视了物理运动的本质结构——真实世界中的物体遵循刚体运动学,其上的点并非孤立运动,而是作为一个整体共同移动。
当我们观察一个旋转的刚性物体时,从位移角度看,每个点的坐标变化看似杂乱无章;但实际上,它们共享同一个由 SE(3)群描述的刚体变换。这一深刻的物理约束意味着:一个包含 个刚体的场景,每帧的运动自由度实际上只有 ,而非传统方法假设的 ( 和 为图像的高和宽)。这种严重的过度参数化不仅造成了计算浪费,更从根本上限制了模型对物理世界的真正理解。
正是基于这一深刻洞察,清华大学智能视觉团队提出了 SM4RT(Structured Motion 4D Reconstruction Transformer)。该工作的核心思想是将运动建模的范式从 “带有运动的几何” 转向 “运动的几何”——即运动本身具有由物理变换群编码的几何结构,任何运动表示都应尊重这些群论先验。
核心方法:运动的结构化表示
SM4RT 的核心创新在于提出了Structure-of-Motion(SoM)表示框架。这一框架将场景动态分解为两个干净而富有物理意义的组成部分:
运动基(Motion Bases):一组紧凑的 个运动基元,每个基元表示为时间上的 6 维 twist 序列 。在刚体运动学中,twist 是一种紧凑的 6D 向量 ,其中 描述平移, 描述旋转。通过李代数到李群的指数映射 ,每个 twist 定义了一个完整的 SE(3)刚体变换:
分配权重(Assignment Weights):一个时间共享的每像素分配图 ,通过稀疏混合权重 将每个像素绑定到不同的运动基上。这种设计回答了 “哪些点共同运动” 这一关键问题,使得属于同一物体的点自然遵循相同的运动轨迹。
这两个组件以线性混合的方式在 twist 空间(即李代数 )中组合:
这一优雅的分解将运动自由度从 急剧降低到 ,其中 。更重要的是,这种结构性约束确保了物理一致性:被赋予相同主导基元的像素自然遵守群体运动,隐式地恢复了物体级别的运动结构。
架构设计:几何与运动的双重奏
SM4RT 的架构体现了 “几何-运动” 的双流设计哲学。输入单目 RGB 视频首先经过冻结的 DINOv2 骨干网络编码为 patch 特征。随后,模型分为并行的两个分支:
场景几何分支:采用预训练的 DepthAnythingV3 骨干网络,通过 Camera Head 输出每帧相机的内参和外参,通过 Depth Head 输出深度图。这些输出通过反投影产生源帧的世界坐标点云 ,构成完整的静态 3D 场景表示。
运动几何分支:这是 SM4RT 的核心创新。引入的 个运动 token 首先通过交叉注意力查询几何 token,再通过帧间运动注意力捕获时序依赖。随后,Base Head(采用 DPT 架构)预测每像素的基元分配权重 ——使用 SparseMax 替代 Softmax 以鼓励稀疏分配;Motion Head 则通过 MLP 将运动 token 解码为时间 twist 序列 。
两个分支通过交叉注意力实现信息交互,使得运动推理始终建立在 3D 场景结构之上。整个流程仅需一次前向传播,无需任何测试时优化。
在训练策略上,SM4RT 采用了多阶段递进方案:先在合成数据集 Kubric 上预训练 100 个 epoch 以学习基元分配,再在所有运动数据集上联合训练 150 个 epoch,最后在静态和动态场景上进行深度和相机的微调。损失函数包含几何监督(深度、相机、尺度)、运动点监督(根据数据类型分别处理稠密和稀疏标注),以及运动基正则化(熵正则化、伪背景约束和 twist 奇异性正则化)。
结构化运动的新能力
SM4RT 的 twist 空间操作解锁了一项独特能力:结构保持的运动插值和外推。传统方法只能在轨迹空间中对点进行线性插值或 B 样条拟合,这会导致物体结构断裂或剧烈抖动。相反,由于 SM4RT 在 空间中操作运动基,插值自然尊重刚体运动规律,保持了整个运动实体的几何一致性。如图所示,在运动基空间进行插值产生的中间状态和外推的未来状态,远比在轨迹空间操作更为连贯。
不过,作者也坦承:与所有参数自由预测方法一样,SM4RT 目前无法显式处理碰撞、反弹或接触动力学等复杂物理交互。此外,固定的运动基数 限制了场景中可表示的运动实体数量,对高度可变形的物体或包含大量独立运动物体的场景支持有限。
实验验证:结构化优于点式化
实验覆盖了 3D 几何重建、3D 追踪和刚性实体变形分析三大任务,形成了对 SM4RT 能力的全方位评估。
3D 几何重建:在视频深度估计和 DA3Bench 多数据集上,SM4RT 取得了领先或次优性能。值得注意的是,引入运动分支并未损害几何重建质量,反而在 ScanNet++等数据集上实现了最优重建(F1 得分 78.50),证明了联合学习几何与运动的协同效应。
3D 追踪:在 TapVid-3D 和 WorldTrack 两个基准上,SM4RT 展现了强劲的追踪能力。特别在 ADT 数据集上,SM4RT 达到了 88.56 的 APD 分数,显著超越 VDPM(85.96)和 4RC(83.22)。可视化结果表明,SM4RT 生成的轨迹线更加连贯,更好地贴合物体结构,而非像其他方法那样出现点散或结构坍塌。
刚性变形分析:这是论文提出的全新评估维度。传统的点式指标(如 AJ、APD)无法捕捉结构保持能力——即使每个点定位准确,物体也可能发生令人无法接受的形变。作者基于连续介质力学引入 von Mises 变形分数(VM),通过仿射对齐后的格林-拉格朗日应变张量来量化非刚性扭曲。在该刚性基准上,SM4RT 取得了最优的结构保持性能(VM 0.1905),而自适应分组后处理策略可将变形几乎消除至 0.0254。
此外,运动基分配图的可视化尤为直观:不同颜色对应不同的运动模式,清晰展现了物体的关节结构——例如人体中,手臂和躯干被分配到不同的运动基,而静态部分则统一归入背景基。这种物理接地的分割远优于简单的 “动态/静态” 二值分割。
实践应用:从 4D 重建到智能系统
SM4RT 的结构化运动几何表示对多个领域具有重要启示:
具身智能与机器人操控:理解物体的刚体运动结构是实现灵巧操作的前提。SM4RT 的基元分配自然提供了物体部件级别的运动分组,机器人可据此规划抓取和操作策略,知道 “哪些部分可以移动” 以及 “它们如何组合运动”。
自动驾驶:场景中的车辆、行人等动态实体本质上遵循刚体运动。SM4RT 的运动基分解可直接用于检测和追踪动态实体,并预测其未来运动——在运动基空间进行外推远比在点空间更符合物理规律,这对轨迹预测和决策规划至关重要。
增强现实与内容创作:结构化的运动表示支持对动态场景进行语义级编辑,例如替换某个运动基对应的物体、修改其运动轨迹,或在不同场景间迁移运动模式。这为影视特效和游戏开发提供了新的创作工具。
量化交易领域的启示:虽然看似遥远,但 SM4RT 的核心思想——将高维复杂动态分解为低维结构基元的组合——对金融时间序列分析具有启发意义。市场波动可类比为多个 “运动模式”(如趋势、反转、震荡)的混合,通过分解市场动量为若干基础模式并学习时变分配权重,或许能构建更鲁棒的因子模型和风险分解框架。
总结与展望
SM4RT 的工作标志着从静态 3D 重建到结构化 4D 动态理解的范式跃迁。它的核心贡献不在于在某个基准上刷了多少分,而在于重新定义了问题本身:运动不应被理解为无数点的独立位移,而应被建模为物理变换群的几何结构。
这一视角转换带来了一系列深刻优势:参数效率的指数级提升(从 到 ),物理一致性的结构保证,物体级运动理解的涌现,以及 twist 空间赋予的插值和预测能力。
展望未来,几个关键方向值得探索:自适应运动基数以动态调整表示容量,层次化分解以捕获从物体到场景的多尺度运动结构,物理交互建模以突破接触和碰撞等非线性动力学,以及将结构化运动先验注入生成模型以实现物理一致的视频生成。
当机器不再执着于追踪每个像素的轨迹,而是开始理解 “物体如何作为一个整体在时空中运动” 时,真正的 4D 智能或许才刚刚开始。SM4RT 为这一愿景提供了坚实的几何基础——它不仅重建了场景的运动,更重要的是,揭示了运动本身的几何之美。