FLUX3D:基于扩散对齐稀疏表示的高保真 3D 高斯生成
FLUX3D: High-Fidelity 3D Gaussian Generation with Diffusion-Aligned Sparse Representation
论文信息
标题: FLUX3D: High-Fidelity 3D Gaussian Generation with Diffusion-Aligned Sparse Representation
作者: Haorui Ji, Weizhe Liu, Hongdong Li, et al.
发布日期: 2026-06-23
arXiv ID: 2606.24874v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:如何在单张图像到 3D 高斯泼溅 (3DGS) 的生成中,保持高保真的外观细节,解决现有稀疏体素方法纹理模糊、高频信息丢失的问题。
- 核心方法:使用扩散模型特征(FLUX 特征)替代语义抽象特征,构建扩散对齐的结构化潜在表示 (DA‑SLAT),并设计稀疏结构感知的多模态扩散 Transformer (SMDiT) 和模态感知旋转位置编码 (MARoPE)。
- 关键结果:在 Toys4k 数据集上,生成质量指标 FD 降至 8.73,优于所有对比方法(表 3),重建任务 PSNR 达到 34.12 dB(表 1)。
- 主要局限:对含语义图案(如文字、Logo)的外观建模仍不及 2D 方法;构建输入特征体严重依赖多视角渲染,作者认为可探索更优构建策略或引入其他模态。
- 适合读者:从事 3D 生成、新视角合成、扩散模型及多模态对齐研究的研究者与工程师,尤其关注 3D 高斯泼溅的读者。
论文背景和研究动机
单图像到 3D 资产生成在内容创作中日益重要,近期方法常采用 “表示学习 + 潜在扩散” 范式。其中基于稀疏体素的表示(如 TRELLIS、XCube 等)因计算效率高且支持局部结构建模而成为主流。然而,这类方法常常无法忠实保留输入图像中的高频纹理细节,生成的 3D 资产出现纹理模糊或丢失。论文作者认为,这一问题并非单纯来自扩散模型容量不足,而是源自两个更根本的结构性瓶颈:
- 表示瓶颈:现有框架在构建稀疏体素潜在特征时,普遍采用判别式 2D 特征(如 DINOv2)。这类特征虽语义表达能力强,但因优化目标为语义抽象与不变性,丢弃了大量重建所需的高频外观线索,再经过维度压缩后进一步损失信息。
- 跨模态对齐瓶颈:在生成阶段,标准扩散 Transformer 将密集的 2D 图像 token 与稀疏的 3D 体素潜在特征无区别地混合处理,未显式利用体素的空间拓扑和结构稀疏性,导致 2D 图像与 3D 体素之间对应关系弱,影响外观一致性。
基于这一分析,FLUX3D 提出联合改进表示学习和跨模态对齐,从而提升 3DGS 生成的外观保真度。
核心方法和技术细节
FLUX3D 框架由两部分组成:扩散对齐的结构化潜在表示学习,以及稀疏结构感知的扩散生成。
扩散对齐的结构化潜在表示 (DA‑SLAT)
传统 Trellis‑SLAT 使用 DINOv2 特征构建稀疏体素格,再通过编码器‑解码器将特征压缩为紧凑潜在表示,进而解码为 3DGS 参数。FLUX3D 做出两项关键修改:
FLUX 特征替代 DINOv2 论文选用大规模扩散模型 FLUX 的中间层特征来构建体素格。扩散模型特征天然具备重建/合成的目标,因而保留更丰富的高频外观统计量。从表 2 可知,使用 FLUX 特征时,重建 PSNR 达到 33.80 dB,明显高于 DINOv2 (31.54 dB) 和原始 RGB (31.14 dB),验证了重建型特征对表示学习的收益。
仅解码器架构 不再使用编码器‑解码器 VAE,而是直接学习一个稀疏 Transformer 解码器,将 FLUX 特征映射为 3DGS 参数:
这样预训练扩散特征直接作为结构化潜在向量,无需被重新编码压缩,消除了传统编码器造成的信息损失。表 1 显示,仅解码器设计将重建 PSNR 进一步提升到 34.12 dB,优于编码器‑解码器的 33.80 dB。
稀疏结构感知扩散框架
在获得高质量的扩散对齐潜在表示后,生成阶段需要建模其以单张图像和体素布局为条件的条件分布。论文设计了 SMDiT 和 MARoPE 两个互补模块。
稀疏结构多模态扩散 Transformer (SMDiT) SMDiT 包含双流和单流 Transformer 块。在双流块中,3D 潜在 token 和 2D 图像 token 分别使用各自参数的注意力处理,保留模态特有特性;在单流块中,两类 token 被拼接并进行联合注意力,实现跨模态信息交互。为了提升训练效率,3D token 通过局部 区域稀疏下采样进行结构化的 patch 化,2D token 同样进行 分块。
模态感知旋转位置编码 (MARoPE) MARoPE 将 2D 图像 patch 索引 映射到体素格范围之外的虚拟平面 ,而 3D 体素保留原始坐标 。该设计使 2D 图像块被概念性地附着在体积的连续维度上,并不依赖真实的相机标定参数。在 RoPE 的距离衰减注意力机制下,图像 token 与附近的体素 token 自然产生偏置,跨模态对应关系由数据驱动学习,无需显式几何对齐。图 8 和表 5 显示,移除 MARoPE 会使 FD 从 8.73 上升到 9.62,表面细节出现平滑伪影。
训练细节
表示模块训练:每步随机选择一个参考视角,最小化渲染结果与真实图像的感知 L1 重建损失,并加入体积正则和透明度正则(式 5)。为增强对扩散连续输出的鲁棒性,训练时利用 FLUX VAE 输出的方差注入随机性。扩散训练采用条件流匹配 (CFM),模型预测速度场,损失为式 6。
创新点和贡献
- 首次分析 2D 特征选择对稀疏体素 3D 表示学习的影响,明确提出扩散特征 (FLUX) 比判别特征更适合外观保真的 3D 建模,并设计仅解码器结构直接衔接扩散特征与 3DGS 输出,有效缓解表示瓶颈。
- 提出稀疏结构感知的扩散框架:SMDiT 架构显式处理稀疏体素拓扑,双流‑单流块促进 2D‑3D 信息融合;MARoPE 在不依赖相机标定下实现 2D 图像与 3D 体素卷的隐式对齐,改善跨模态对应。
- 在标准基准上取得最优外观保真度:生成指标显著超越 TRELLIS、DiffusionGS 等 SOTA 方法(表 3),FD 从 11.29 降至 8.73,LPIPS 从 0.04389 降至 0.03509,视觉对比(图 6)显示细节保持能力更强。
实验结果分析
重建实验:在 Toys4k 上,FLUX3D 的仅解码器配置获得 PSNR 34.12 dB、SSIM 0.9783、LPIPS 0.02668,优于 TRELLIS 的 31.54/0.9719/0.02964(表 1)。几何重建实验(表 7)也显示 Chamfer Distance 更低,法线图 PSNR 更高,但几何改善幅度不如外观显著,说明输入特征主要影响外观。
生成实验:与 LGM、GeoLRM、GaussianAnything、DiffusionGS、TRELLIS 等比较,FLUX3D 在所有像素级指标 (SSIM、PSNR、LPIPS) 和分布级指标 (CLIP、FD、KD) 上均领先(表 3)。图 6 中可见 LGM 形状扭曲严重,DiffusionGS 和 TRELLIS 在非输入视角下纹理细节错位或模糊,而 FLUX3D 对人物、建筑、工艺品等类别均输出更一致的高清外观。
消融实验:逐组件添加实验(表 4)和逐组件移除实验(表 5)一致表明,DA‑SLAT 带来了最大的初始提升 (FD 从 11.29 到 10.12),SMDiT 和 MARoPE 分别进一步降低 FD,且视觉伪影减少(图 8)。MARoPE 主要缓解平滑伪影,SMDiT 贡献细节建模。布局敏感性测试(表 10)说明 FLUX3D 在带噪声的预测布局下相对 TRELLIS 优势更大,表明改进源于方法设计而非布局质量。
实践建议
- 特征选择策略:在基于体素的 3D 重建或生成任务中,若目标是高保真外观,应优先选择预训练扩散模型(如 FLUX)的特征,而非自监督语义特征。实践中可将扩散模型中间层输出冻结,经由可学习的线性投影或轻量解码器映射到 3D 输出,以保留高频信息。
- 架构简化:仅解码器设计去除了编码器带来的压缩损失,并能与扩散特征直接协同。实现时需注意训练期间引入噪声(如利用 VAE 方差采样),以增强对扩散生成中数值波动的鲁棒性。
- 多模态对齐:处理稀疏 3D 表示与密集 2D 模态的对齐,可借鉴本文的双流‑单流混合 Transformer,并配合位置编码将 2D 标记 “外挂” 于 3D 体积的外侧虚拟平面,避免显式相机标定依赖。此策略可将 2D 先验与 3D 结构学习解耦,降低部署难度。
- 训练数据与效率:论文采用约 36 万高质量 3D 资产,并使用 VLM 过滤缺失纹理的数据。实际应用中应重视数据清洗,去除全粉/白等不完整资产,以确保训练稳定。推理阶段,50 步采样在单张 A100 上约 5.1 秒,可在实时或交互式 3D 生成场景中应用。