面向视觉标记化与生成的球形里奇量化
Spherical Leech Quantization for Visual Tokenization and Generation
论文信息
标题: Spherical Leech Quantization for Visual Tokenization and Generation
作者: Yue Zhao, Hanwen Jiang, Zhenlin Xu, et al.
发布日期: 2025-12-16
arXiv ID: 2512.14697v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:视觉模型的分词器词汇量(通常 1K~16K)远小于大语言模型(约 200K),现有非参数量化方法(如 BSQ)依赖熵正则化等复杂技巧,缺乏统一的理论框架。
- 核心方法:论文用格码(lattice code)统一了所有非参数量化方法,重新解释熵正则化为 “格点重定位” 问题,并基于最密超球体堆积原理提出球形利奇格量化(-SQ),使用 Leech 格的第一壳层 196,560 个向量作为固定码本。
- 关键结果:-SQ 使图像重建 rFID 从 BSQ 的 1.14 降至 0.83(表 5),且无需任何熵正则化;首次在 196,560 大小的码本上训练自回归生成模型,在 ImageNet 上取得 1.82 FID,接近验证集 oracle 的 1.78 FID(表 7)。
- 主要局限:码本维度固定为 24,无法灵活调整码本大小与维度的关系;超大码本在自回归生成时带来训练不稳定(梯度爆炸)和码本利用率不均等问题,需借助 Z-loss 和特殊优化器缓解(见论文第 4.2 节)。
- 适合读者:从事视觉分词器、自回归图像生成、向量量化或通信编码研究的工程师和研究者。
论文背景和研究动机
学习离散视觉标记是将图像压缩为符号序列的关键技术,广泛应用于视觉压缩、生成和理解任务。然而,当前视觉分词器的词汇量(1K 到 16K)远小于大语言模型(GPT-4o 约 20 万,Deepseek-R1 约 13 万),而视觉信息本身承载的数据量却远超语言——人脑接收视觉输入的速度约为 bits/s,而语言仅几十 bits/s。这种 “视觉词汇瓶颈” 限制了模型捕捉视觉多样性的能力。
为解决这一问题,非参数量化(Non-parametric Quantization, NPQ)方法应运而生,它们使用固定的隐式码本,避免了传统 VQ 中码本学习不稳定的问题。代表方法包括 LFQ(码本为 )、BSQ(将 LFQ 投影到单位球面)和 FSQ(每维度多个整数值)。然而,这些方法各有缺陷:LFQ 的熵计算复杂度随维度指数增长,BSQ 需要熵正则化项防止码本坍塌,FSQ 的每维级数选择则偏启发式。这种局面暴露了一个根本问题:缺少统一的理论框架,导致方法设计依赖经验修补,而非原理性指导。
核心方法和技术细节
格码视角下的统一
论文的第一个贡献是用格码(lattice code)的语言重新描述了所有 NPQ 方法。一个 维格 由生成矩阵 和整数坐标 定义:。实际使用的有限码本还需附加约束(如范数限制)。例如(见论文 3.1 节):
- LFQ:,约束 且 ,即
- BSQ:,约束 且
- FSQ:,约束
这种统一不仅澄清了几何本质,还揭示了 BSQ 需要熵正则化的深层原因,并为设计新方法指明了方向。
熵正则化的几何本质
BSQ 的训练目标包含熵正则化项 (公式 2),它由两项组成:第一项最小化每个输入分配到各码字的条件熵(让输入靠近码字,远离决策边界);第二项最大化全体数据的平均分配熵(促进 “类别平衡”)。从格码角度看,第二项等价于让所有码字的 Voronoi 区域体积尽可能相等——当输入均匀分布时,这就转变成在超球面上寻找最分散的 个点的问题。
FSQ 之所以不需要熵正则化(见论文 3.2 节),正是因为其输入被 限制在 内,每个整数格点的 Voronoi 区域自然都是单位超立方体,天然满足体积均匀性。BSQ 的输入在单位超球面上,其 Voronoi 区域形状各异、体积不均,因此必须显式施加最大熵约束来 “搬动” 格点。
最密堆积原理与利奇格的出场
寻找球面上最分散的点(最大化最小欧氏距离 )是经典的 Tammes 问题的高维推广。论文从两个角度切入:一是直接求解最大最小距离问题(Sloane 球形码),二是假设所有球半径相等,寻找最密球堆积(sphere packing)。
最密堆积在多个维度有已知最优解,其中维度 24 的利奇格(Leech lattice) 已被证明是所有格中的最优堆积(见 Conway & Sloane 的经典著作,表 2)。 的第一壳层包含 196,560 个范数为 的向量,分为三类形状(表 3):
- 第二类: 及其置换/符号变化,共 97,152 个
- 第三类: 及其置换/符号变化,共 98,304 个
- 第四类: 及其置换/符号变化,共 1,104 个
将这些向量归一化后,最小余弦距离从 BSQ(d=18)的 0.471 提升到 0.866,提升幅度超过 80%(表 4, 图 2)。论文提出的 -SQ 正是以这三个子集(或其全部并集)作为固定码本,通过 归一化将编码器输出投影到 ,再最近邻量化到格点。
创新点与贡献
-
理论统一:首次将 LFQ、BSQ、FSQ 等非参数量化方法纳入格码的统一框架,揭示了它们之间的本质联系和几何区别。
-
设计原理性提升:从 “熵最大化 → 最分散码点 → 最密球堆积” 的逻辑链条,将量化器的设计从经验启发式提升为有数学原则指导的格选择问题。-SQ 的超球面堆积特性使其码点分布高度均匀,无需任何熵正则化或承诺损失即可稳定训练(见论文 3.3 节末尾),简化了损失函数设计。
-
性能突破:在图像重建上,-SQ-ViT 较 BSQ-ViT 将 rFID 从 1.14 降至 0.83,同时比特率略低(17.58 bits vs. 18 bits)(表 5)。在压缩任务上,PSNR 达 29.63 dB、MS-SSIM 达 0.9637,位率仅 0.2747 BPP(表 6)。
-
首次大规模码本生成:通过 CCE(Cut Cross-Entropy)、Z-loss 和 Dion 优化器克服梯度爆炸与码本利用率不均衡问题(图 3、图 4),首次在无索引分组的条件下用 196K 码本训练自回归视觉生成模型,取得 1.82 FID(2.8B 参数,表 7; 验证集 oracle 为 1.78 FID)。这一结果表明加大视觉词汇对捕捉视觉多样性确有裨益,且该收益随模型规模增大而更显著(图 7)。
实验结果分析
论文从三个任务维度进行了系统评估:
图像重建(表 5):-SQ 在 ImageNet 和 COCO 上全面优于 BSQ 和 VQ 基线。ViT 编码器 + 196K 码本时,SSIM 从 BSQ 的 0.7578 升至 0.7934,LPIPS 从 0.0761 降至 0.0622。消融实验(表 8)直接验证了 与重建质量的强正相关关系。
图像压缩(表 6):在不使用算术编码的简化设置下,-SQ 以 0.2747 BPP 取得 29.63 dB PSNR,优于 JPEG2000(29.19 dB@0.299 BPP)和 WebP(29.15 dB@0.296 BPP)。
图像生成(表 7、图 7):-SQ + Infinity-CC(7 级 next-scale 预测)在 2.8B 参数规模时达到 1.82 FID,IS 333.4,Recall 0.64,接近验证集性能上限(1.78 FID, 0.75 Prec, 0.67 Rec)。特别值得注意的是,Recall 从 VAR-d24 的 0.59 提升至 0.64——这直接印证了更大码本有助于捕获视觉多样性的核心假设。代码本从小(16K)到大(196K)的缩放实验(图 7)表明,这一收益仅在模型足够大时显现(12 层、0.24B 时两者 fFID 接近,16 层、0.49B 时大码本明显更优),与 LLM 中 “更大模型需要更大词汇” 的缩放律高度一致。
实践建议
-SQ 的工程落地较为直接,以下几点值得注意:
-
码本即插即用,无需训练:Leech 格第一壳层可预先计算并存储为固定张量,在实际训练中仅需最近邻查找,参数量为零,内存开销可控,适合作为现有 VQ-VAE 框架中 VQ 瓶颈的直接替代。
-
权衡码本大小与生成稳定性:论文提供了从小(1,104)到全量(196,560)的子集选择空间(见论文 3.4 节 “Accomodating smaller codebooks”)。实际场景中若训练不稳定(梯度爆炸或损失飙升),可优先采用较小的子集(如仅保留第四类 shape 的 1,104 个向量),待模型稳定后再逐步扩展。
-
生成任务中的训练技巧:当使用完整 196K 码本训练自回归模型时,强烈建议采用 Z-loss()和 Dion 优化器(对 ≥2D 张量);因子化 -wise 预测(24 个 9 分类头)虽降低显存,但会损害生成多样性(表 9 Recall 从 0.30 降至 0.29),推荐优先使用 CCE 直接建模 196,560 分类(可采用 tiling 或分布式 softmax 降低显存峰值)。
-
VF 对齐的双刃剑:将潜变量与 DINOv2 特征对齐会略微降低重建质量(rFID 从 0.84 升至 0.92),却能显著加速生成模型收敛并提升最终 Recall(图 6、表 13)。若下游任务以生成为主,建议启用 VF 损失;若以压缩/重建为主,则可以省略。