SILSA:面向拓扑保持高分辨率三维生成的滑动窗口切片潜变量

SILSA: Sliding-Window Slice Latents for Topology-Preserving High-Resolution 3D Generation

arXiv: 2610.02201v1

论文信息

标题: SILSA: Sliding-Window Slice Latents for Topology-Preserving High-Resolution 3D Generation

作者: Tianjiao Yu, Xinzhuo Li, Yifan Shen, et al.

发布日期: 2026-10-01

arXiv ID: 2610.02201v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:高分辨率 3D 生成常用体素、稀疏体素或层次 token 表示,导致 token 数量随结构复杂度增长,并且容易破坏薄壁、孔洞、重复部件的拓扑一致性。
  • 核心方法:用沿 x,y,zx,y,z 三轴的重叠滑动窗口切片潜变量表示形状,训练拓扑感知的 SliceVAE,并通过带 Volumetric Anchor Lattice 的单阶段整流流 Transformer 从图像生成这些固定数量的切片 token。
  • 关键结果:在论文评测设置下,SILSA 仅用 384 个 token,图像到 3D 生成的 PSNR 达到 32.74,比 SparseFlex 提高 8.7%;VAE 重建的 Betti 误差相对 SparseFlex 降低 9.2%(表 1、表 2、表 3)。
  • 主要局限:作者指出性能受训练分布多样性与规模影响,输入图像信息不足时生成质量会下降;切片级拓扑监督是全局拓扑的逐片近似,不能完全替代三维全局拓扑约束。
  • 适合读者:关注 3D 生成、神经形状表示、拓扑约束学习、高效扩散或整流流模型的研究者与工程师。

论文背景和研究动机

高分辨率 3D 生成已经从早期的逐实例优化、分数蒸馏和多视图扩散,逐步转向在原生 3D 表示上训练生成模型。然而,表示方式仍然是核心瓶颈。密集体素网格提供直接空间对应,但内存和计算随分辨率立方增长;稀疏体素、八叉树和层次 tokenizer 虽然降低了显存,但 token 数量依赖物体占据区域、薄支撑、孔洞和重复部件,往往仍需要多阶段生成,先预测活跃体素,再生成局部几何。

另一方面,triplane、集合潜变量、图元表示等紧凑方案能够控制生成成本,但会削弱 token 与局部几何结构之间的对应关系。其结果是模型可能在表面误差或渲染指标上表现不错,却填掉孔洞、断开薄支撑或合并邻近部件。SILSA 的动机正在于此:一个带厚度的切片可以在一个单元中概括整片平面区域的拓扑,而切片序列又能显式暴露连通分量、孔洞和部件边界沿深度方向的演化。因此,SILSA 用三组轴向切片潜变量作为生成表示,而不依赖活跃体素预测。

核心方法和技术细节

SILSA 的表示建立在两个模块上:用于编码与重建的 SliceVAE,以及用于图像条件生成的整流流 Transformer。

滑动窗口切片编码器。对输入网格采样点云和法向,每个轴划分 N=128N=128 个深度 bin。为第 jj 轴第 kk 个 bin 聚合其周围 w=8w=8 个 bin 内的点,形成重叠窗口。每个点附加相对于窗口中心的深度偏移 δ(p)\delta(\mathbf{p}),经过共享 MLP 后做 max-pooling,得到切片特征 hkj\mathbf{h}_k^j,再映射为高斯潜变量 zkj\mathbf{z}_k^j。这样三条轴共得到 3N=3843N=384 个固定切片 token。空的窗口使用可学习的空嵌入。

稀疏体素解码器。解码器把三组轴向切片潜变量散射到一个 16316^3 的共享粗特征网格中,同一网格平面可能对应多个切片索引,因此按归一化求和进行聚合。随后用稀疏 Transformer 解码器细化特征,并通过自剪枝上采样逐步提升到 2563256^3 分辨率。最后预测每个单元的 SDF 值、顶点变形和插值权重,用可微 Dual Marching Cubes 提取网格。VAE 训练目标包含深度、法向、剪影渲染损失和 KL 正则项。

切片级拓扑保持损失。该损失在解码后的 SDF 网格上采样 Ns=128N_s=128 个截面,并将 SDF 转为软占据图。对每个截面计算超水平集持续同调的持久图,匹配 d=0d=0 的连通分量和 d=1d=1 的孔洞;同时计算相邻切片的 Betti 数转移序列 ΔBk,dj\Delta B_{k,d}^j,并与真值截面的转移对齐。Betti 数离散,因此前向使用阈值化占据图,反向通过 straight-through estimator 传播梯度。该损失由逐片持续图匹配 LPH\mathcal{L}_{\mathrm{PH}} 和相邻切片转移匹配 Ltrans\mathcal{L}_{\mathrm{trans}} 组成。

带 Volumetric Anchor Lattice 的生成器。生成器是一个单阶段整流流 Transformer。输入的图像条件由冻结的 DINOv2 特征提供。为了让三条轴上的切片 token 在去噪过程中保持跨轴一致,SILSA 引入 Volumetric Anchor Lattice(VAL),一个 D×D×D×CD \times D \times D \times C 的共享 3D 特征网格。每个切片 token 根据其轴和深度位置对应到 VAL 中的一个平面。每个 Transformer 块先做轴内自注意力,再从 VAL 读取锚点平面,然后通过门控机制写回:zg=σ(Wg[h~kj;gkj])\mathbf{z}_g=\sigma(W_g[\tilde{\mathbf{h}}_k^j;\mathbf{g}_k^j]) 控制保留多少旧特征和写入多少新证据。之后再做图像交叉注意力和前馈网络。VAL 在每次速度评估时初始化为零,并在各块之间累积跨轴证据。

创新点和贡献

论文提出三项主要贡献。第一,引入以三轴重叠切片潜变量为核心的形状表示,将高分辨率形状压缩为固定 3N=3843N=384 个 token,同时保留局部截面结构。第二,设计拓扑感知的 SliceVAE,在渲染损失之外加入逐片持续同调匹配和 Betti 转移监督,使重建不仅保持表面几何,也保持连通分量和孔洞结构。第三,提出带 Volumetric Anchor Lattice 的单阶段整流流生成器,用共享空间记忆替代活跃体素预测阶段,使不同轴向切片流能够在统一 3D 工作空间中协调。

相比现有方法,SILSA 的主要差异在于固定 token 预算与直接空间对应之间的平衡。论文通过消融表明,仅靠跨轴直接注意力虽然也能改善一致性,但 VAL 在 CD 和 Betti 误差上更好(表 4):VAL 配置下 CD 为 0.59、Betti-Err 为 1.58;直接跨注意力的对应值为 0.60 和 1.64。论文作者认为,这表明共享体素工作空间比无约束 token 间注意力提供更可靠的空间协调。

实验结果分析

在图像到 3D 生成评测中,SILSA 在 200 个 Toys4K 资产和 50 张 in-the-wild 图像上与多类基线比较。表 1 显示,SILSA 取得最佳 FD、PSNR、覆盖率和 MMD,并匹配最佳 KD 与 LPIPS。其中 PSNR 从 SparseFlex 的 30.12 提升到 32.74,相对增益约 8.7%;覆盖率从 73.12% 提高到 79.08%,提升 5.96 个百分点。需要强调的是,这些结论是在该特定数据集和评测协议下得到的,不代表对所有分布都具有同样优势。

在 VAE 重建评测中,表 2 显示 SILSA 的 CD 为 0.59,IoU 为 93.01,Betti-Err 为 1.582。相对最强基线 SparseFlex 的 Betti-Err 1.743,降低了约 9.2%。这说明拓扑保持并不只是表面指标的副产品,切分级拓扑损失确实在连通分量和孔洞数量上带来了可测量的改进。

效率方面,表 3 显示 SILSA 使用固定 384 个 token,比最紧凑的 Dora 少 70.0%,比 XCube、Trellis 和 SparseFlex 少超过 98%。训练显存从 Dora 的 14.6GB 降到 8.7GB,推理时间从 0.82s/shape 降到 0.34s/shape。论文将这种收益归因于单阶段生成,避免先预测活跃体素再生成局部几何的两阶段流程。

消融实验进一步支撑了设计选择。表 4 显示,移除拓扑损失后 Betti-Err 从 1.58 上升到 4.43;只用 LPH\mathcal{L}_{\mathrm{PH}} 或只用 Ltrans\mathcal{L}_{\mathrm{trans}} 都优于完全移除,但都不如完整损失。跨轴通信缺失时 CD 退化到 5.87、Betti-Err 退化到 17.91。VAL 分辨率方面,D=16D=16 比 D=8D=8 更优,但 D=32D=32 没有进一步提升结构正确性。附录中的切片数量、窗口宽度和拓扑损失权重消融也表明,更细的切片或更大的窗口并不总是更好:N=256N=256 以上收益趋缓,w=16w=16 的 Betti 误差反而高于 w=8w=8(表 6、表 7)。

实践建议

如果你的应用场景涉及薄壁、孔洞、支架、栏杆、重复结构或长距离连接,那么在 VAE 或重建模型中加入切片级拓扑损失是值得优先尝试的。与仅用渲染损失相比,论文表 7 显示完整拓扑损失将 Betti-Err 从 4.43 降到 1.58,同时 CD 从 0.78 降到 0.59。但在生产环境中需要调好 λtopo\lambda_{\mathrm{topo}}:该表中 λtopo=0.1\lambda_{\mathrm{topo}}=0.1 最优,提高到 1.0 后 CD 反而从 0.59 增至 0.67,Betti-Err 从 1.58 增至 1.96。因此拓扑约束应该作为辅助项,而不是压过几何渲染损失。

对于资源受限的 3D 生成服务,固定切片 token 表示比稀疏体素或层次 tokenizer 更具优势。表 3 显示,SILSA 仅用 384 个 token,即可把训练显存压到 8.7GB,并把推理时间降到 0.34s/shape。如果业务数据与 Trellis-500K 分布差异较大,建议先用少量领域数据微调 SliceVAE 和生成器。论文作者明确指出性能受训练分布影响,因此不应直接把开放权重模型视为普适解。

跨轴一致性的实现也值得借鉴。如果你的系统同时生成多组有空间重叠的表征,可以优先实现类似 VAL 的共享空间工作空间,而不是完全依赖 token 间交叉注意力。表 9 显示,门控写入优于覆盖写入和加法写入:门控写入的 Betti-Err 为 1.58,覆盖写入为 1.91,加法写入为 1.74。这说明 “保留多少旧证据、写入多少新证据” 的门控机制对稳定多块协调很有帮助。

最后,工程部署时需要加入输入图像质量评估。论文作者承认,模糊或信息不足的视角可能导致较差的 3D 结构。可以结合深度先验、多视图扩散输入或低分图像过滤,来提高生成结果的一致性。