FLUX3D:基于扩散对齐稀疏表示的高保真三维高斯生成
论文信息
标题: FLUX3D: High-Fidelity 3D Gaussian Generation with Diffusion-Aligned Sparse Representation
作者: Haorui Ji, Weizhe Liu, Hongdong Li, et al.
发布日期: 2026-06-23
arXiv ID: 2606.24874v1
PDF 链接: 下载 PDF
论文背景与研究动机
从单张二维图像生成高质量的三维资产,始终是计算机视觉与图形学领域的核心挑战。近年来,基于 “表示学习+潜在扩散” 的范式取得了长足进展,尤其是稀疏体素表示方法的出现,为几何与纹理的统一建模提供了可扩展的基础。这类方法将三维物体编码到一个稀疏体素网格中,每个活跃体素都关联着一个特征向量,从而在降低计算和内存开销的同时,保留了全局与局部结构信息。
然而,现有的稀疏体素方法在生成过程中普遍存在一个显著缺陷:它们难以忠实地保留输入图像中的高频视觉细节,常常导致纹理模糊和细节丢失。论文作者深入分析后指出,这一现象并非仅仅源于扩散模型的容量限制,更深层的原因在于两个结构性的瓶颈:一是表示瓶颈,即现有方法通常采用面向语义抽象的判别式 2D 特征(如 DINOv2)来构建体素潜变量,这类特征在训练时被优化为追求语义不变性,却牺牲了对三维重建至关重要的高频外观信息;二是跨模态对齐瓶颈,即标准的扩散 Transformer 缺乏有效机制来对齐密集的 2D 图像 Token 与稀疏的 3D 体素潜变量,忽视了体素空间固有的拓扑结构和稀疏特性,导致 2D 与 3D 信息之间无法建立稳健的对应关系。
正是针对这两个瓶颈,作者提出了 FLUX3D 框架,旨在从单张图像生成高保真度的 3D 高斯泼溅(3D Gaussian Splatting, 3DGS)资产,实现逼真的外观重建与跨视角一致性。
核心方法与技术细节
FLUX3D 的整体设计围绕两个关键改进展开:改进的表示学习模块与稀疏结构感知的扩散生成模块。
扩散对齐的结构化潜在表示(DA-SLAT)
在表示学习阶段,作者首先重新审视了 2D 特征的选择策略。他们观察到,像 FLUX 这样的生成式扩散模型特征,其训练目标本身就是图像重建与合成,因此天然富含高频的外观细节和重建线索。基于此,论文提出了扩散对齐的结构化潜在表示(Diffusion-Aligned Structured Latents, DA-SLAT),直接用预训练的 FLUX 扩散特征来构建体素化的特征体积 ,以替代传统的 DINOv2 特征。
与传统方法不同的另一点在于,FLUX3D 放弃了典型的编码器-解码器 VAE 架构,转而采用一个解码器专有架构。具体而言,一个稀疏 Transformer 解码器直接将 FLUX 特征映射到 3D 高斯参数:
这一设计避免了将信息密集的扩散特征压缩到低维潜变量空间时产生的信息损失,消除了额外的编码器施加的分布对齐约束,从而在保持与下游扩散生成阶段兼容的同时,显著提升了重建保真度。
稀疏结构感知的多模态扩散框架
在生成阶段,模型需要对条件分布 进行建模。为解决密集 2D Token 与稀疏 3D 潜变量之间的对齐难题,论文提出了两个协同工作的组件。
稀疏结构多模态扩散 Transformer(SMDiT):该架构扩展了多模态扩散 Transformer 的设计,专门针对稀疏体素数据结构进行适配。条件图像首先经过 FLUX 编码器进行 Token 化,并与 3D 潜变量 Token 一起,送入交替排列的双流块和单流块中。在双流块中,两种模态分别使用各自的权重并行处理,以保留其固有特性;在单流块中,所有 Token 被拼接并通过联合注意力机制促进有效的跨模态交互。为了进一步提升训练效率,还引入了结构化分块技术:对 3D 潜变量 Token 在局部 的体素区域进行稀疏下采样分组,而对 2D 图像 Token 则使用 的划分进行分块。
模态感知的旋转位置编码(MARoPE):为了让模型在不依赖显式几何标定的情况下学习 2D-3D 对应关系,作者提出了 MARoPE 策略。它将 2D 图像块索引 映射到一个位于体素体积之外的 “虚拟平面” 上,而 3D 体素坐标 保持不变。这一设计将条件图像概念化为沿着潜变量体积的第三维度附着,使得旋转位置编码的距离衰减注意力机制能够自然地将每个图像块偏向于邻近的体素,而具体的 2D-3D 对应关系则完全从数据中学习。相比依赖精确相机参数的方法,MARoPE 在面对一般场景时具有更强的鲁棒性。
创新点与贡献
FLUX3D 的核心贡献可以归纳为三个方面。
首先,它首次系统性地分析了 2D 特征选择对基于稀疏体素的 3D 表示学习的影响,并论证了生成式扩散特征相比判别式特征在保留外观细节方面的显著优势。在此基础上提出的 DA-SLAT 与解码器专有架构的组合,有效地弥合了扩散特征与 3DGS 输出之间的距离,大幅提升了重建保真度。
其次,针对生成阶段的跨模态对齐难题,FLUX3D 设计了 SMDiT 和 MARoPE 两个互补的组件。SMDiT 通过双流和单流块的交替设计,明确地考虑了稀疏体素拓扑结构,为稀疏 3D 潜变量与密集 2D Token 之间的信息交换提供了结构化的机制;MARoPE 则在无需相机参数的前提下,以一种隐式且灵活的方式建立了 2D-3D 的空间对应关系。这两个组件共同构成了一个完整的稀疏结构感知扩散框架,显著改善了生成资产的视觉一致性。
最后,通过在标准图像到 3D 基准数据集上的大量定量与定性实验,FLUX3D 展示了其相对于当前最先进方法的优越性能,尤其是在保持输入图像的颜色准确度和外观细节方面。
实验结果分析
在重建实验中,FLUX3D 在 Toys4k 数据集上全面超越了 TRELLIS 和 GaussianAnything 等基线方法。在 SSIM、PSNR 和 LPIPS 三项指标上,使用解码器专有架构和 FLUX 特征的模型取得了最佳的 34.12 PSNR 和 0.02668 LPIPS,验证了扩散对齐潜在表示的有效性。关于输入特征的消融研究进一步证实,FLUX 和 SDXL 等生成式特征确实优于 DINOv2、DINOv3 乃至原始 RGB 像素值,尤其在文字和标志等细粒度细节的渲染上表现突出。
在生成实验中,与 LGM、DiffusionGS、TRELLIS 等重建式和生成式方法相比,FLUX3D 在所有评估指标上均取得明显优势。例如,其解码器专有配置在 PSNR 上达到 26.26,LPIPS 低至 0.03509,而 Fréchet 距离和核心距离也显著低于其他方法。定性对比显示,LGM 存在严重的形状和外观畸变;DiffusionGS 和 TRELLIS 虽然能在输入视角保持较好的视觉一致性,但在新视角下却会出现纹理不一致或错位的问题;而 FLUX3D 则在角色、建筑、文物等多种物体类别上,始终保持着最贴近输入的色彩准确度和细节表现。
针对各个组件的渐进消融实验也揭示了它们各自的价值:DA-SLAT 的加入立刻改善了所有生成指标;SMDiT 和 MARoPE 则分别贡献了进一步的增益,其中 MARoPE 尤其有助于减轻平滑伪影,实现更精确的对齐。
实践应用建议与未来发展方向
FLUX3D 在 3D 内容生成领域展现出了可观的潜力,对于从事该方向研究和开发的团队,有几点值得参考。在特征选择层面,应当充分重视扩散模型等生成式特征在保留外观细节方面的天然优势,而不仅仅依赖传统的判别式视觉特征。在架构设计层面,对稀疏数据结构进行专门的 Transformer 设计,并引入适度灵活的跨模态位置编码策略,往往能比直接套用标准方案取得更好的对齐效果。对于期望在量化交易等非视觉领域应用类似思想的研究者,从中可获得的启发是:在跨模态对齐问题中,尊重每个模态的数据结构特性(类似稀疏体素的拓扑结构),并设计能够从数据中自动学习对应关系的机制(类似 MARoPE),可能是比强行进行显式对齐更优的策略。
未来,FLUX3D 仍有若干值得拓展的方向。其一,在处理具有语义含义的文本和标志时,外观建模的质量与 2D 方法相比仍有差距,这可能需要收集更全面、更高质量的训练数据来弥补。其二,目前输入特征体积的构建严重依赖多视角渲染,探索更优的构建策略,或者融合来自图像、视频等其他模态的信息,将是提升表示学习质量的重要途径。其三,将扩散对齐的表示思想推广到几何重建、物理仿真乃至动态场景生成等领域,也是一个充满想象空间的研究方向。
总结与展望
FLUX3D 通过重新思考 2D 特征选择、设计解码器专有的表示学习流程,以及构建稀疏结构感知的多模态扩散框架,系统地解决了当前稀疏体素方法在图像到 3D 生成中面临的外观保真度瓶颈。该工作在理论与工程层面都提供了有价值的洞见,不仅推动了高保真 3DGS 生成技术的发展,也为后续的多模态对齐与生成式 3D 建模研究提供了新的基础范式。随着数据规模与计算能力的持续增长,有理由期待这类框架在更广泛的 3D 内容创作场景中发挥重要作用,从游戏影视资产制作到虚拟现实环境的实时构建,皆有望从中受益。