面向视觉标记化与生成的球形里奇量化

Spherical Leech Quantization for Visual Tokenization and Generation

arXiv: 2512.14697v1

论文信息

标题: Spherical Leech Quantization for Visual Tokenization and Generation

作者: Yue Zhao, Hanwen Jiang, Zhenlin Xu, et al.

发布日期: 2025-12-16

arXiv ID: 2512.14697v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:视觉模型的分词器词汇量(通常 1K~16K)远小于大语言模型(约 200K),现有非参数量化方法(如 BSQ)依赖熵正则化等复杂技巧,缺乏统一的理论框架。
  • 核心方法:论文用格码(lattice code)统一了所有非参数量化方法,重新解释熵正则化为 “格点重定位” 问题,并基于最密超球体堆积原理提出球形利奇格量化(Λ24\Lambda_{24}-SQ),使用 Leech 格的第一壳层 196,560 个向量作为固定码本。
  • 关键结果:Λ24\Lambda_{24}-SQ 使图像重建 rFID 从 BSQ 的 1.14 降至 0.83(表 5),且无需任何熵正则化;首次在 196,560 大小的码本上训练自回归生成模型,在 ImageNet 上取得 1.82 FID,接近验证集 oracle 的 1.78 FID(表 7)。
  • 主要局限:码本维度固定为 24,无法灵活调整码本大小与维度的关系;超大码本在自回归生成时带来训练不稳定(梯度爆炸)和码本利用率不均等问题,需借助 Z-loss 和特殊优化器缓解(见论文第 4.2 节)。
  • 适合读者:从事视觉分词器、自回归图像生成、向量量化或通信编码研究的工程师和研究者。

论文背景和研究动机

学习离散视觉标记是将图像压缩为符号序列的关键技术,广泛应用于视觉压缩、生成和理解任务。然而,当前视觉分词器的词汇量(1K 到 16K)远小于大语言模型(GPT-4o 约 20 万,Deepseek-R1 约 13 万),而视觉信息本身承载的数据量却远超语言——人脑接收视觉输入的速度约为 10610^6 bits/s,而语言仅几十 bits/s。这种 “视觉词汇瓶颈” 限制了模型捕捉视觉多样性的能力。

为解决这一问题,非参数量化(Non-parametric Quantization, NPQ)方法应运而生,它们使用固定的隐式码本,避免了传统 VQ 中码本学习不稳定的问题。代表方法包括 LFQ(码本为 {±1}d\{\pm 1\}^d)、BSQ(将 LFQ 投影到单位球面)和 FSQ(每维度多个整数值)。然而,这些方法各有缺陷:LFQ 的熵计算复杂度随维度指数增长,BSQ 需要熵正则化项防止码本坍塌,FSQ 的每维级数选择则偏启发式。这种局面暴露了一个根本问题:缺少统一的理论框架,导致方法设计依赖经验修补,而非原理性指导。

核心方法和技术细节

格码视角下的统一

论文的第一个贡献是用格码(lattice code)的语言重新描述了所有 NPQ 方法。一个 dd 维格 Λd\Lambda_d 由生成矩阵 G\bm{G} 和整数坐标 b∈Zd\bm{b}\in\mathbb{Z}^d 定义:λ=Gb\bm{\lambda} = \bm{G}\bm{b}。实际使用的有限码本还需附加约束(如范数限制)。例如(见论文 3.1 节):

  • LFQ:G=Id\bm{G} = \bm{I}_d,约束 ∥λ∥0=d\|\bm{\lambda}\|_0 = d 且 ∥λ∥1=d\|\bm{\lambda}\|_1 = d,即 λi=±1\bm{\lambda}_i = \pm 1
  • BSQ:G=1dId\bm{G} = \frac{1}{\sqrt{d}}\bm{I}_d,约束 ∥λ∥0=d\|\bm{\lambda}\|_0 = d 且 ∥λ∥2=1\|\bm{\lambda}\|_2 = 1
  • FSQ:G=Id\bm{G} = \bm{I}_d,约束 ∥λ∥∞≤L/2\|\bm{\lambda}\|_\infty \leq L/2

这种统一不仅澄清了几何本质,还揭示了 BSQ 需要熵正则化的深层原因,并为设计新方法指明了方向。

熵正则化的几何本质

BSQ 的训练目标包含熵正则化项 Lentropy\mathcal{L}_{\text{entropy}}(公式 2),它由两项组成:第一项最小化每个输入分配到各码字的条件熵(让输入靠近码字,远离决策边界);第二项最大化全体数据的平均分配熵(促进 “类别平衡”)。从格码角度看,第二项等价于让所有码字的 Voronoi 区域体积尽可能相等——当输入均匀分布时,这就转变成在超球面上寻找最分散的 NN 个点的问题。

FSQ 之所以不需要熵正则化(见论文 3.2 节),正是因为其输入被 tanh⁡\tanh 限制在 (−L/2,L/2)(-L/2, L/2) 内,每个整数格点的 Voronoi 区域自然都是单位超立方体,天然满足体积均匀性。BSQ 的输入在单位超球面上,其 Voronoi 区域形状各异、体积不均,因此必须显式施加最大熵约束来 “搬动” 格点。

最密堆积原理与利奇格的出场

寻找球面上最分散的点(最大化最小欧氏距离 δmin⁡\delta_{\min})是经典的 Tammes 问题的高维推广。论文从两个角度切入:一是直接求解最大最小距离问题(Sloane 球形码),二是假设所有球半径相等,寻找最密球堆积(sphere packing)。

最密堆积在多个维度有已知最优解,其中维度 24 的利奇格(Leech lattice) Λ24\Lambda_{24} 已被证明是所有格中的最优堆积(见 Conway & Sloane 的经典著作,表 2)。Λ24\Lambda_{24} 的第一壳层包含 196,560 个范数为 32\sqrt{32} 的向量,分为三类形状(表 3):

  • 第二类:(28,016)(2^8, 0^{16}) 及其置换/符号变化,共 97,152 个
  • 第三类:(31,123)(3^1, 1^{23}) 及其置换/符号变化,共 98,304 个
  • 第四类:(42,022)(4^2, 0^{22}) 及其置换/符号变化,共 1,104 个

将这些向量归一化后,最小余弦距离从 BSQ(d=18)的 0.471 提升到 0.866,提升幅度超过 80%(表 4, 图 2)。论文提出的 Λ24\Lambda_{24}-SQ 正是以这三个子集(或其全部并集)作为固定码本,通过 ℓ2\ell_2 归一化将编码器输出投影到 S23\mathbb{S}^{23},再最近邻量化到格点。

创新点与贡献

  1. 理论统一:首次将 LFQ、BSQ、FSQ 等非参数量化方法纳入格码的统一框架,揭示了它们之间的本质联系和几何区别。

  2. 设计原理性提升:从 “熵最大化 → 最分散码点 → 最密球堆积” 的逻辑链条,将量化器的设计从经验启发式提升为有数学原则指导的格选择问题。Λ24\Lambda_{24}-SQ 的超球面堆积特性使其码点分布高度均匀,无需任何熵正则化或承诺损失即可稳定训练(见论文 3.3 节末尾),简化了损失函数设计。

  3. 性能突破:在图像重建上,Λ24\Lambda_{24}-SQ-ViT 较 BSQ-ViT 将 rFID 从 1.14 降至 0.83,同时比特率略低(≈\approx17.58 bits vs. 18 bits)(表 5)。在压缩任务上,PSNR 达 29.63 dB、MS-SSIM 达 0.9637,位率仅 0.2747 BPP(表 6)。

  4. 首次大规模码本生成:通过 CCE(Cut Cross-Entropy)、Z-loss 和 Dion 优化器克服梯度爆炸与码本利用率不均衡问题(图 3、图 4),首次在无索引分组的条件下用 196K 码本训练自回归视觉生成模型,取得 1.82 FID(2.8B 参数,表 7; 验证集 oracle 为 1.78 FID)。这一结果表明加大视觉词汇对捕捉视觉多样性确有裨益,且该收益随模型规模增大而更显著(图 7)。

实验结果分析

论文从三个任务维度进行了系统评估:

图像重建(表 5):Λ24\Lambda_{24}-SQ 在 ImageNet 和 COCO 上全面优于 BSQ 和 VQ 基线。ViT 编码器 + 196K Λ24\Lambda_{24} 码本时,SSIM 从 BSQ 的 0.7578 升至 0.7934,LPIPS 从 0.0761 降至 0.0622。消融实验(表 8)直接验证了 δmin⁡\delta_{\min} 与重建质量的强正相关关系。

图像压缩(表 6):在不使用算术编码的简化设置下,Λ24\Lambda_{24}-SQ 以 0.2747 BPP 取得 29.63 dB PSNR,优于 JPEG2000(29.19 dB@0.299 BPP)和 WebP(29.15 dB@0.296 BPP)。

图像生成(表 7、图 7):Λ24\Lambda_{24}-SQ + Infinity-CC(7 级 next-scale 预测)在 2.8B 参数规模时达到 1.82 FID,IS 333.4,Recall 0.64,接近验证集性能上限(1.78 FID, 0.75 Prec, 0.67 Rec)。特别值得注意的是,Recall 从 VAR-d24 的 0.59 提升至 0.64——这直接印证了更大码本有助于捕获视觉多样性的核心假设。代码本从小(16K)到大(196K)的缩放实验(图 7)表明,这一收益仅在模型足够大时显现(12 层、0.24B 时两者 fFID 接近,16 层、0.49B 时大码本明显更优),与 LLM 中 “更大模型需要更大词汇” 的缩放律高度一致。

实践建议

Λ24\Lambda_{24}-SQ 的工程落地较为直接,以下几点值得注意:

  1. 码本即插即用,无需训练:Leech 格第一壳层可预先计算并存储为固定张量,在实际训练中仅需最近邻查找,参数量为零,内存开销可控,适合作为现有 VQ-VAE 框架中 VQ 瓶颈的直接替代。

  2. 权衡码本大小与生成稳定性:论文提供了从小(1,104)到全量(196,560)的子集选择空间(见论文 3.4 节 “Accomodating smaller codebooks”)。实际场景中若训练不稳定(梯度爆炸或损失飙升),可优先采用较小的子集(如仅保留第四类 shape 的 1,104 个向量),待模型稳定后再逐步扩展。

  3. 生成任务中的训练技巧:当使用完整 196K 码本训练自回归模型时,强烈建议采用 Z-loss(α=10−4\alpha=10^{-4})和 Dion 优化器(对 ≥2D 张量);因子化 dd-wise 预测(24 个 9 分类头)虽降低显存,但会损害生成多样性(表 9 Recall 从 0.30 降至 0.29),推荐优先使用 CCE 直接建模 196,560 分类(可采用 tiling 或分布式 softmax 降低显存峰值)。

  4. VF 对齐的双刃剑:将潜变量与 DINOv2 特征对齐会略微降低重建质量(rFID 从 0.84 升至 0.92),却能显著加速生成模型收敛并提升最终 Recall(图 6、表 13)。若下游任务以生成为主,建议启用 VF 损失;若以压缩/重建为主,则可以省略。