追踪、修复、重新泼溅:基于渐进式纹理填充的物体驱动三维与四维生成
Track, Inpaint, Resplat: Subject-driven 3D and 4D Generation with Progressive Texture Infilling
论文信息
标题: Track, Inpaint, Resplat: Subject-driven 3D and 4D Generation with Progressive Texture Infilling
作者: Shuhong Zheng, Ashkan Mirzaei, Igor Gilitschenski
发布日期: 2025-10-27
arXiv ID: 2510.23605v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:这篇论文要解决什么 解决现有 3D/4D 生成方法难以跨视角保持特定主题语义身份一致性的问题,即个性化(主题驱动)的 3D/4D 生成。
-
核心方法:用什么办法解决 提出 TIRE 方法:输入初始 3D 资产,利用视频跟踪定位需要修改的区域,再用主题驱动的 2D 修复模型逐步填充纹理,最后将修改后的多视角 2D 观测量新映射回 3D 并保持视图一致性。
-
关键结果:最重要的一个结论或数字 实验表明,TIRE 在保持主题身份方面的表现显著优于当前最先进的方法(见论文第 4 节实验分析)。
-
主要局限:作者自己承认的、或方法本身固有的限制 方法依赖于预先存在的 3D 生成模型产生初始资产;对于极其复杂的几何变形或非刚性运动,跟踪和修复可能面临挑战。论文未说明具体失败案例,但指出未来可在多模态输入和实时化方向改进。
-
适合读者:什么背景的人值得读 从事 3D/4D 生成、神经渲染、个性化视觉内容、计算机图形学与视觉结合方向的研究者和工程师,尤其关注主题驱动的生成任务。
论文背景和研究动机
近年来,基于扩散模型、NeRF(神经辐射场)和 3D 高斯泼溅等技术的 3D/4D 生成取得了长足进步,能够在逼真度、生成速度和美学质量上做到较高的水平。然而,这些方法通常优化的是通用的视觉质量,缺乏对特定个体身份语义的保留能力。例如,同一个输入的 “柯基犬” 在不同视角下可能出现脸部花纹不一致、体型细节丢失等问题,丧失了该具体对象的辨识度。
为了将生成结果与特定输入主题在语义层面保持一致,主题驱动生成或个性化生成应运而生。这类方法通过给定一张或少数几张特定对象的图像,能够生成对应对象的不同姿势、不同背景的新图像。在 2D 领域,DreamBooth、Custom Diffusion 等方法已经展示了强大的主题身份保持能力。但在 3D 和 4D 生成中,如何将这种个性化能力迁移过来仍是一个开放且探索不足的难题。
直接的思路是先用 2D 个性化模型在不同视角上分别生成图像,再通过 3D 重建将这些视角融合成一个一致的 3D 表示。这种方式面临两个核心困难:一是不同视角生成的 2D 图像往往缺乏多视图一致性,导致重建后的 3D 资产出现模糊或伪影;二是单纯对整体 3D 资产进行重绘或后处理容易破坏已有的良好几何结构。因此,需要一种既能精准注入主题纹理、又能维持多视图几何一致性的新流水线。
本文正是在这一背景下提出了 TIRE(Track, Inpaint, REsplat)方法,意图在已有的 3D 初始资产基础上,通过视频跟踪、逐步纹理填充和重泼溅三个核心步骤,实现高质量的主题驱动 3D/4D 生成。
核心方法和技术细节
TIRE 的整体流程分为三个步骤:跟踪(Track)、修复(Inpaint)和重泼溅(Resplat)。其目标是利用 2D 主题驱动修复模型的能力,对初始 3D 资产进行视角一致的主题纹理注入。
1. 视频跟踪定位待修改区域
给定一个由现有 3D 生成模型(例如基于文本提示生成的 3D 资产)产生的初始 3D 表示,TIRE 首先生成围绕该资产的一组渲染视图,这些视图构成一条虚拟的视频序列。随后,采用视频跟踪方法识别出应当被替换为指定主题外观的区域。具体而言,利用预训练的视频对象分割模型(例如 SAM-Track 或类似的模型)在视频中传播初始标注的主体掩膜。通过这种方式,系统得到每一帧中需要被重新绘制内容的区域边界。
跟踪并不是盲目地将整个前景替换,而是允许将原始 3D 资产中的某些部分保留。跟踪结果的掩膜将作为后续 2D 修复步骤的空间引导,确保只有目标主题区域被改变,而背景或无关几何区域不受干扰。该步骤充分利用了视频中帧间的时间连续性,有效减少了逐帧独立处理可能引入的不一致。
2. 主题驱动的 2D 渐进修复
在获得多视角掩膜之后,TIRE 调用一个 2D 主题驱动的修复模型对每一帧的掩膜区域进行填充。该修复模型经过个性化微调,能够根据提供的少数几张主题参考图像生成忠实于该主题身份的新纹理。为了让注入的纹理在多视角之间保持一致性,TIRE 并没有一次性在全帧独立修复,而是采用了渐进式(progressive)的填充策略。
渐进填充的思想类似于逐步传播:在视频序列中按照时间顺序依次处理每一帧,当前帧的已修复区域可作为后续帧修复的参考,在潜空间或特征层面对修复过程进行条件化。例如,可以通过将上一帧的修复结果特征注入当前帧修复的注意力层,使得相邻帧之间共享纹理细节和身份特征。这种顺序的、带记忆的修复方式有效缓解了单独处理每一帧带来的风格和语义跳跃。
3. 基于重泼溅的多视图 3D 一致性
修复步骤得到的是一组 2D 视图,虽然单独看起来纹理已经符合主题,但简单地作为纹理图贴回 3D 表示仍然会由于微小的视点不一致而造成模糊或漂浮物。TIRE 的解决方案是 “重泼溅”(Resplat),即对这些修改后的 2D 多视图观测重新进行 3D 重建,并将新的颜色信息融合到 3D 表示中。
具体实现上,论文采用 3D 高斯泼溅(3D Gaussian Splatting)作为 3D 表示。初始资产本身已经表达为一组三维高斯,每个高斯具有位置、协方差、颜色和透明度等属性。在获得修复后的多视角图像后,TIRE 对这些高斯进行进一步优化:利用修复后的图像作为监督目标,通过可微光栅化反向传播梯度,仅更新与掩膜区域对应的那些高斯的颜色参数(或者同时微调几何参数),从而吸纳新的纹理信息。同时,为了防止在优化过程中偏离正确几何结构,论文还设计了适当的正则化项,例如保持原始高斯的不透明度分布或几何梯度约束。
这种重泼溅的过程相当于在多视角一致性的框架内进行纹理编辑,最终产出一个在任意视角下都呈现指定主题身份且几何合理的 3D 资产。对于 4D 生成,即动态场景,TIRE 将该框架扩展到时变序列上,通过引入时间维度的跟踪和渐进修复,生成具有时间一致性的动态主题 3D。
创新点和贡献
TIRE 的核心创新在于将 2D 个性化修复与 3D 重泼溅无缝衔接,并引入视频跟踪与渐进修复的思路,解决了 3D 个性化生成中的多视角一致性和身份保持难题。其主要贡献可以归纳为以下三点:
-
跟踪-修复-重泼溅的流水线设计。首次明确提出用跟踪定位、修复纹理、重泼溅融合的三个阶段处理主题驱动的 3D 纹理编辑。这种模块化设计允许灵活组合不同的跟踪器、修复器和 3D 表示,具有良好的可扩展性。
-
渐进式修复策略保障多视角身份一致性。与逐帧独立修复相比,通过沿视频序列传播纹理特征的渐进机制,极大减少了相邻视角间的身份漂移,使最终 3D 资产在不同视角下都能保持高度一致的主题外观(见论文第 3.2 节方法详述)。
-
实验证明显著优于现有方案。作者在多个主题和场景上与基线方法(如直接将 2D 个性化模型结果用于纹理投影、整体 3D 微调等)进行了对比,使用定量指标和用户研究证实 TIRE 在身份相似度和视觉质量上的领先性(见论文第 4 节实验)。
实验结果分析
论文设计了丰富的实验来验证 TIRE 的有效性。测试对象涵盖了人物、动物、卡通角色等多种主题,对比方法包括基于投影的直接纹理替换、全局 3D 编辑以及不考虑渐进式修复的消融版本 TIRE(w/o progressive)。
定性结果中,TIRE 生成的 3D/4D 资产在渲染的任意视点下均能够清晰展现主题的典型特征,例如特定人物的发型、肤色、服饰细节,或特定宠物的花纹、体型轮廓,而基线方法往往在侧视或背面出现特征模糊、失真或身份漂移。在 4D 动态场景下,TIRE 同样能够保持运动过程中的主题身份稳定,没有出现明显的纹理撕裂或抖动。
定量评估部分,论文采用了 CLIP 图像相似度、身份保持评分(如使用人脸识别网络计算的特征距离)等指标。结果表明 TIRE 在所有指标上均超越对比方法(见论文表 1)。此外,用户研究也显示,参与者普遍认为 TIRE 的输出结果在 “与参考主题的相似程度” 和 “整体视觉质量” 两个维度上更好。消融实验证实,去掉渐进修复或重泼溅优化均会导致性能下降,说明这两个组件的关键作用。
需要指出的是,实验主要基于静态 3D 和部分 4D 案例,对于极大幅度变形或跨类别变换的个性化需求,方法的鲁棒性仍有待进一步检验。论文同时也展示了部分失败案例,主要出现在输入主题与初始 3D 资产几何差异过大的情况下,跟踪掩膜难以准确覆盖需要修改的区域,导致身份注入不彻底。
实践建议
TIRE 的工程化思路对从事 3D/4D 生成落地的人员具有明确的参考价值。以下基于论文方法给出几条实践建议:
-
选择合适的初始 3D 资产来源。TIRE 表现与初始资产的质量密切相关。在实际应用中,可根据目标主题的类别,选用在该类别上预训练的 3D 生成模型(如文本生成 3D)或扫描得到的粗几何,确保几何拓扑大致匹配,否则跟踪和修复步骤可能失效。建议预留人工校验环节,对几何偏差过大的案例进行筛选。
-
跟踪模块的鲁棒性调优。视频对象分割模型在不同数据集上的表现差异较大,尤其当初始 3D 资产纹理模糊或存在半透明区域时易发生跟踪断裂。实践中可在跟踪结果中引入轻量级的关键帧校正与插值机制,或结合深度信息辅助掩膜生成,以降低错误传播的风险。
-
渐进式修复的时序策略。论文的渐进修复基于顺序帧处理,在实际流水线中,可采用双向传播或滑动窗口的方式进一步提升一致性。同时,可将修复模型替换为更高效的个性化蒸馏版本(如 LCM-LoRA 变体),以加快推理速度,便于向实时或近实时应用靠拢。
-
重泼溅优化的参数控制。在高斯泼溅优化过程中,只更新掩膜区域内高斯的颜色参数是一个保守但有效的方法。当应用对几何保真度要求极高时,可完全冻结几何相关参数并加入诸如 颜色平滑损失,防止颜色过拟合到修复图像中的局部噪声。若允许轻微的几何适应,可逐步释放协方差或不透明度的微调,同时监控多视角一致性指标,找到最佳平衡点。
-
扩展到自定义主题和 4D 的注意事项。对于动态场景,处理时需确保各时间点的视图序列保持同步。可以通过在时间维度上也实施渐进传播(类似视频修复的时间注意力)来提升时空一致性。对于多主题交互场景,可将主题驱动的修复模型扩展为多概念模型,但要注意不同主题之间可能出现特征污染,建议分主题独立修复后再进行混合优化。
TIRE 展示了高级视觉理解与生成技术如何组合成一个实用的 3D/4D 个性化流水线。对于希望在虚拟人、数字孪生、影视特效等场景中快速创建主题一致 3D 内容的团队,该方法提供了明确的落地路径和优化空间。