LiTo: 表面光场标记化
LiTo: Surface Light Field Tokenization
论文信息
标题: LiTo: Surface Light Field Tokenization
作者: Jen-Hao Rick Chang, Xiaoming Zhao, Dorian Chan, et al.
发布日期: 2026-03-11
arXiv ID: 2603.11047v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:现有 3D 生成模型要么只重建几何形状,要么将外观建模为视角无关的漫反射颜色,难以捕捉镜面高光、菲涅尔反射等视角相关的真实视觉效果。本文试图在统一的 3D 潜在表示中同时建模物体几何与视角相关外观。
-
核心方法:提出一种 3D 潜在表示,将 “表面光场” 编码为紧凑的潜在向量集。编码器接收随机采样的表面点、法线/视角方向和颜色作为输入,解码器通过流匹配生成几何形状、通过高阶球谐函数高斯泼溅(3DGS)渲染视角相关的辐射度。
-
关键结果:在 Toys4k 数据集上,该方法的表面光场重建 LPIPS 指标达到 0.023(简单视角)和 0.055(困难视角),显著优于 TRELLIS 的 0.034 和 0.090(见论文表 1)。几何重建性能与需要额外粗几何信息的方法相当,且潜在表示大小仅为后者的约 1/10。
-
主要局限:3D 高斯泼溅实现最高仅支持 3 阶球谐函数,限制了透明物体或高频镜面反射的重建能力(见论文附录 B)。表面光场的 3D 补丁化依赖欧氏距离而非测地距离,在表面邻近处可能出现跨表面注意力错误。
-
适合读者:对 3D 生成模型、神经渲染、多视图重建感兴趣的计算机视觉研究者和工程师;从事数字资产创作、增强现实应用的开发者;关注潜在表示学习的机器学习从业者。
论文背景和研究动机
现实世界中的物体形态与材质千差万别——光滑的金属表面产生镜面反射,粗糙的陶瓷呈现柔和高光,透明的玻璃既有折射又有反射。即使是同一物体,从不同视角观察时,光照在其表面产生的反射和细微色彩变化也各不相同。捕捉这种视觉丰富性对构建逼真的 3D 生成模型至关重要。
然而,当前机器学习领域的主流 3D 表示方法往往割裂了几何与外观。大量工作聚焦于纯粹的几何建模——通过占据场、符号距离函数(SDF)或点云分布来表示物体形状。另一些方法虽然包含了外观信息,却将其简化为视角无关的漫反射颜色。这种 “贴图式” 的简单外观建模完全无法表达镜面反射、高光随视角移动等真实光照效果。
论文提出了 “表面光场标记化”(LiTo),将表面光场(Surface Light Field)——一种联合建模 3D 表面位置与各向反射辐射度的 5D 函数——编码为紧凑的潜在向量集。这一思路的核心出发点在于:RGB-D 深度图像本身就是表面光场的采样。通过将这种采样信息压缩为潜在表示,模型既能重建完整几何,又能渲染出随视角变化的真实外观。
核心方法和技术细节
表面光场的表示与采样
论文将表面光场定义为 5D 函数 ,其中 是表面点位置, 是观察方向,函数值是该点向该方向出射的颜色。
训练时,从围绕物体的球面上均匀分布的 150 个视角渲染 RGB-D 图像(分辨率 1036×1036,视场角 40°)。每个视角提供了该角度下可见的所有表面点及其颜色。这些渲染图共生成约 1.6 亿个表面光场样本,从中随机抽取 100 万个()作为编码器输入,其余用于监督损失计算。
编码器架构与 3D 补丁化
编码器基于 Perceiver IO 架构,但面临百万级输入带来的计算挑战。直接使用交叉注意力处理 100 万个 token 在计算上不可行。
论文提出了 “3D 补丁化” 的近似方案(见论文图 3):从输入样本中随机选择 个样本作为查询点,然后以欧氏距离(而非测地距离)寻找每个输入样本最近的查询点,将查询点分配给样本。在交叉注意力中,每个查询只关注被分配给它的输入样本。这相当于将散乱的 3D 表面点划分成以查询点为中心的局部补丁。此外,自注意力采用基于体素的窗口注意力——位于同一粗网格体素内的 token 相互关注,每层体素网格偏移半个单元宽度。
几何与外观的联合监督
解码端通过两个分支分别监督几何和外观:
几何监督:采用流匹配(Flow Matching)框架,潜在表示 参数化一个 3D 分布 ,该分布应该收敛于物体表面上的狄拉克δ函数。损失函数(公式 2)训练流匹配速度解码器,使其能够将随机噪声点沿向量场输运到表面位置。
外观监督:通过将潜在表示解码为 3D 高斯泼溅(3DGS),从随机视点渲染图像,与真实图像比较 L2 损失和 LPIPS 感知损失(公式 3)。关键是,3D 高斯解码器预测的高斯核带有3 阶球谐函数来表示视角相关的辐射度,这比 TRELLIS 等方法的 0 阶(视角无关)表示高出一个数量级。
生成模型与坐标系对齐
在潜在表示之上,论文训练了一个基于 DiT(Diffusion Transformer)架构的流匹配生成模型,以单张图像为条件生成完整 3D 潜在表示。一个关键的训练细节是:对每个训练样本,将世界坐标系旋转到使输入视角的相机姿态为单位矩阵。这使得生成模型的输出天然与输入视角对齐,无需后处理步骤(见论文图 6)。
创新点和贡献
-
首个将表面光场编码为潜在表示的框架:与仅编码几何或视角无关颜色不同,LiTo 的编码器接收包含视角方向的光场样本作为输入,解码器输出高阶球谐高斯核来表现视角相关效果。
-
无需粗几何先验的端到端训练:TRELLIS 等方法在生成时需要先预测粗占据信息(两阶段),而 LiTo 的流匹配几何解码器可直接从潜在表示采样表面点云,进而构建稀疏占据网格用于高斯解码(见论文第 3.4 节)。实验表明,尽管完全不依赖粗几何信息,其几何重建质量仍优于大多数几何专用潜在表示(见论文表 2,行 7-1 的 Chamfer 距离优于行 5、6 的 TripoSG 和 Shape Tokens)。
-
视角一致性的光度监督:通过在多种光照条件下训练(固定区域光、全白环境图、随机点光源),模型学习分离了视角无关漫反射和视角相关镜面反射。消融实验(见论文附录 C.2)显示:0 阶球谐+视角信息无提升(行 1-3 vs 1-2),但 3 阶球谐+视角信息则带来明显增益(行 1-6 vs 1-7),证明高阶球谐是解锁视角相关建模的关键。
-
单阶段多模态生成:生成模型在训练时通过坐标系归一化,无需推断 3D 方向,在输入视角的保真度(FID 和 KID)上显著优于 TRELLIS(见论文表 3),同时在新视角质量上未发现明显退化。
实验结果分析
重建质量
在 Toys4k 数据集上,LiTo 在所有测试指标上均优于 TRELLIS(见论文表 1)。特别在困难视角(相机半径 1-3,更近距离观察细节)下,LPIPS 从 TRELLIS 的 0.090 大幅降至 0.055(降低约 39%),PSNR 从 27.57dB 提升至 32.36dB。这表明高阶球谐高斯能更准确地捕捉近距离观察时的高频细节。
几何方面(见论文表 2),LiTo 在不使用粗几何信息的情况下,Chamfer 距离低于 TripoSG 和 Shape Tokens。当训练了网格解码器后(行 7-2),性能进一步提升,接近甚至超越某些需要粗几何先验的方法(行 1 的 TripoSF)。
球谐阶数的消融研究
论文在附录 C.2 中系统研究了球谐阶数的影响。0 阶球谐(视角无关)在 LPIPS 上与 TRELLIS 相当;1 阶球谐带来明显提升;3 阶球谐达到最佳。有趣的是,单独增加视角输入而不增加球谐阶数(0 阶+视角)并无增益,证明高阶球谐是编码视角相关外观的必要条件。
论文还可视化了不同球谐阶数的渲染效果(见附录图 S8、S9):0 阶渲染仅显示漫反射,无高光;随着阶数增加,镜面反射和菲涅尔效果逐渐显现。这暗示了潜在的材质分解可能性——0 阶对应漫反射基底色,高阶对应视角相关的高光分量。
单图生成的表现
在 Toys4k 的单图生成实验中(见论文表 3),LiTo 在输入视角的 FID(6.22 vs TRELLIS 的 12.84)和 KID(0.009 vs 0.088)上表现大幅优于 TRELLIS。由于训练时坐标系归一化的策略,生成的 3D 资产自然对齐输入视角(见论文图 6)。新视角的质量(FID 6.22 vs TRELLIS 7.60)也未因强输入约束而牺牲。
实践建议
对于从事 3D 生成模型开发的工程师和研究者,可考虑如下思路:
-
将表面光场作为 3D 资产表示的统一数据格式:相比传统的水密网格+SDF 预计算流程,RGB-D 多视图渲染可直接生成训练数据,无需复杂的网格提取和优化。这降低了新数据集上训练 tokenizer 的门槛(论文使用的 Objaverse-XL 数据集无特殊预处理要求)。
-
3D 补丁化策略可扩展到其他点云任务:论文的基于局部查询点+欧氏距离的近似补丁方法,虽然牺牲了测地距离的精确性,但计算成本大幅降低,且实验证明效果良好(见论文表 1-2)。对于需要处理大规模 3D 点云的场景(如激光雷达数据),这一 trick 可直接采用。
-
高阶球谐表示是性价比最高的视角相关建模方案:与 NeRF 等需要密集采样的体渲染方法相比,3DGS+3 阶球谐在推理速度和解耦程度上取得了良好平衡。在实时应用(如游戏引擎、AR 预览)中,解码后的高斯泼溅可直接使用成熟的光栅化管线渲染。
-
生成模型训练时坐标系归一化可大幅简化对齐问题:论文的实践是将每个训练样本旋转到输入视图为恒等姿态。这种简单预处理避免了网络学习旋转等价性,在商业化应用中可显著降低对输入照片拍摄角度的限制。