SLORR:简单高效的训练中低秩正则化

arXiv: 2607.08754v1

论文信息

标题: SLORR: Simple and Efficient In-Training Low-Rank Regularization

作者: David González-Martínez, Shiwei Liu

发布日期: 2026-07-09

arXiv ID: 2607.08754v1

PDF 链接: 下载 PDF

研究背景与动机

深度神经网络在推理阶段的计算和内存开销是部署时的核心瓶颈。低秩分解作为一种经典的压缩手段,能够将一个稠密的权重矩阵 W\boldsymbol{W} 替换为两个较小矩阵的乘积 W0W1\boldsymbol{W}_0 \boldsymbol{W}_1,从而减少参数和计算量。然而,现代模型(如 ViT 和 LLM)的自然权重并不具备良好的低秩特性,直接进行激进的 SVD 截断会导致精度严重下降。这引出了一个关键问题:能否在训练时主动引导权重趋向低秩,使得后续的压缩过程几乎不损失性能?

已有的训练时低秩正则化方法往往存在种种局限。例如,直接基于核范数或奇异值稀疏性的正则化虽然有效,但每步训练都需要对庞大的权重矩阵进行 SVD 分解,计算代价过高,无法用于现代大规模训练。另一些方法(如 Yang et al. 和 LoRITa)通过修改模型架构(引入因子化参数化)来规避 SVD,但这会改变优化动力学、增加可训练参数,并使得从预训练模型初始化变得困难。Q3R 等方法则缓存旧的 SVD 结果并周期性刷新,虽降低了开销,但引入了状态性和额外的超参数(如目标秩),且频繁调用 SVD 仍会影响可扩展性。因此,设计一种简单、无状态、不改变架构且无需 SVD 的低秩正则化方法,成为一项重要而紧迫的研究目标。

SLORR(Simple and Efficient In-Training Low-Rank Regularization)正是在这样的背景下提出的。它直接在原始权重矩阵上施加低秩惩罚,利用 GPU 友好的极分解近似(Polar Express)来估算正则化所需的前向和反向传播量,从而完全避开 SVD,并保持极低的训练开销。

核心方法:免 SVD 的低秩正则化

SLORR 的核心思想是将低秩归纳转化为奇异值的稀疏性问题。它研究了两种常用的低秩惩罚项:核范数(核范数,即奇异值的 1\ell_1 范数)带二的 Hoyer 稀疏度(平方 1/2\ell_1/\ell_2 比率)。对于任一层权重矩阵 W\boldsymbol{W},这两个正则化项分别为:

Lnuc=W,Lhoyer=W2WF2.\mathcal{L}_{\text{nuc}} = \|\boldsymbol{W}\|_* ,\qquad \mathcal{L}_{\text{hoyer}} = \frac{\|\boldsymbol{W}\|_*^2}{\|\boldsymbol{W}\|_F^2}.

不难发现,这两个量都严重依赖于 W\|\boldsymbol{W}\|_*,而核范数的计算通常需要 SVD。SLORR 的巧妙之处在于,这些损失及其梯度可以仅用极分解因子 UV\boldsymbol{U}\boldsymbol{V}^\top 表达,其中 U,Σ,V\boldsymbol{U},\boldsymbol{\Sigma},\boldsymbol{V}W\boldsymbol{W} 的薄 SVD。具体地,核范数的梯度为 UV\boldsymbol{U}\boldsymbol{V}^\top,而 Hoyer 正则化的梯度为:

Lhoyer=2WWF(1WFUVWWF3W).\nabla \mathcal{L}_{\text{hoyer}} = \frac{2\|\boldsymbol{W}\|_*}{\|\boldsymbol{W}\|_F}\left(\frac{1}{\|\boldsymbol{W}\|_F}\boldsymbol{U}\boldsymbol{V}^\top - \frac{\|\boldsymbol{W}\|_*}{\|\boldsymbol{W}\|_F^3}\boldsymbol{W}\right).

现在问题转化为:如何高效地获得 UV\boldsymbol{U}\boldsymbol{V}^\top?SLORR 采用Polar Express算法——一种基于矩阵符号函数的迭代方法,能够在 GPU 上快速逼近极分解因子,而无需完整的 SVD。经过几轮迭代(通常为 6 步),就可以获得高质量的 P^UV\widehat{\boldsymbol{P}} \approx \boldsymbol{U}\boldsymbol{V}^\top。利用 P^\widehat{\boldsymbol{P}},核范数可以通过迹运算近似计算:W=tr(WUV)sum(WP^)\|\boldsymbol{W}\|_* = \operatorname{tr}(\boldsymbol{W}^\top \boldsymbol{U}\boldsymbol{V}^\top) \approx \operatorname{sum}(\boldsymbol{W} \odot \widehat{\boldsymbol{P}})。Frobenius 范数则直接通过逐元素平方求和得到。因此,SLORR 能在不产生 SVD 的前提下,近似计算出正则化项的前向值和反向梯度。作者还提供了近似误差的理论保证(命题 3.1),表明随着 Polar Express 迭代增加,近似误差可控并趋于零。

在实际实现中,SLORR 通过自定义 torch.autograd.Function 将近似极因子用于前向和反向传播,从而无缝融入现有训练框架。其代码片段(见论文 Listing 1)展示了如何低开销地实现 Hoyer 变体。SLORR 还提供了与 AdamW 解耦的变体 SLORR-Hoyer-D,类似于权重衰减,进一步降低了内存占用。

创新点与技术贡献

SLORR 的主要贡献可以归纳为三点:

  1. 免 SVD 的低秩正则化框架:首次通过极分解近似,实现了在训练时对权重施加核范数和 Hoyer 稀疏性惩罚,完全消除了昂贵的 SVD 计算,训练效率达到实用级别。

  2. 保持架构不变且无状态:与需要修改层结构(如 LoRITa)或缓存中间量(如 Q3R)的方法不同,SLORR 直接作用于原始权重矩阵,不添加额外可训练参数,也不需要预设目标秩,极大地简化了超参调优和工程实现。

  3. 广泛适用性与低开销:在 ImageNet-1K 的图像分类(ResNet、ViT)和 LLM 预训练(135M、560M 参数)两种截然不同的场景下,SLORR 都能显著提升模型的可压缩性,而训练时间增加不到 8%(视觉)和 1%(语言模型),展现了良好的可扩展性。

此外,论文对 SLORR-Hoyer 的行为进行了理论分析(命题 3.2 和 3.3),揭示了该正则化会放大较大的奇异值、缩小较小的奇异值,从而将频谱能量集中到主导分量,自然诱导低秩属性。

实验验证与结果分析

作者在视觉和语言两大领域进行了全面评估。对于 ImageNet-1K,实验涵盖 ResNet-50、ViT-B/16、ViT-L/16 的续训(30 epoch)和 ResNet-18 从头预训练(110 epoch)。在续训设置下,SLORR 与 Q3R、LoRITa 以及无正则化基线对比,所有方法均使用统一的训练配方。训练完成后,通过均匀压缩和能量阈值两种策略进行分解,并绘制了准确的压缩率曲线。结果显示:

  • SLORR 的两种变体(SLORR-Nuc 和 SLORR-Hoyer)在多数情况下能达到与 Q3R 相当的压缩保真度,有时甚至更优,且远超无正则化基线。尤其是在 ViT-B/16 上,Hoyer 变体在保留 50% 参数时仍能维持 80% 以上的 top-1 准确率。
  • LoRITa 在续训场景表现较弱,但在 ResNet-18 从头训练中更具竞争力,这可能与其提前改变架构带来的优化挑战有关。
  • SLORR 的训练开销始终控制在 4%~8% 以内(实际测量归一化时间),远低于 Q3R 在刷新间隔为 5 时的 65% 开销。即便将 Q3R 的刷新间隔扩大至 300(牺牲一定效果以换取速度),SLORR 的内存开销也更小。

在更大规模的 ViT 模型(Tiny 到 Huge)上对开销的细致测量(图 2)表明,SLORR 保持了近乎恒定的归一化运行时间,而 Q3R 则需要不断增大刷新间隔来维持效率,这可能在未来极大模型上削弱正则化效果。

在 LLM 预训练实验中,使用 Llama 类架构(135M 和 560M 参数),在 FineWeb-Edu 数据集上以计算最优 token 量进行训练。经 SLORR-Hoyer 正则化的模型,在用 SVD 截断或更先进的 SVD-LLM(白化)压缩后,验证困惑度的退化明显更缓慢。例如,在移除 10% 的 block 参数时,正则化模型的性能已显著优于基线;在更低保留率下,优势更大。560M 模型的下游 zero-shot 任务(ARC、HellaSwag、PIQA 等)准确率也显示了相似的规律:正则化模型在压缩后保持了更高的任务准确率,尽管无压缩时略有牺牲。此外,更长时间的训练(4× 和 8× token 预算)表明,模型会变得更难压缩,但正则化带来的优势依然存在。

实践应用建议

基于 SLORR 的特性和实验结论,向实际使用者提出以下建议:

  • 选择合适的正则化变体:SLORR-Hoyer 在多数设置下表现稳定,对奇异值重分配效果明显;SLORR-Nuc 实现更简单,但在某些任务中可能更温和。建议在原型阶段同时测试两者,结合压缩后的性能选择。
  • 正则化强度 λ\lambda 的调优:需要权衡未压缩精度和可压缩性。通常,稍大的 λ\lambda 会带来更好的压缩鲁棒性,但也可能降低初始精度或导致训练不稳定(尤其 Hoyer 变体)。可采用与权重衰减类似的网格搜索,或逐步增加 λ\lambda 的调度策略。
  • 与现有压缩流程结合:SLORR 训练后的权重可以使用标准的 SVD 截断,也可与白化技术(如 SVD-LLM)搭配以获得更强压缩。注意,正则化训练可能会改变权重的谱分布,后续压缩时保留的秩选择应参考能量阈值而非固定比例。
  • 最小化额外开销:使用 Polar Express 默认的 6 次迭代通常已足够,可根据实际模型 size 适当减少迭代数(论文的消融实验表明 4 步也可接受)。解耦实现(SLORR-Hoyer-D)内存负担略低,适合内存受限场景。
  • 注意不能正则化嵌入层和输出层:论文中均不施加于第一层和最后一层,以免破坏表示的基础或分类器。

未来发展方向

SLORR 为低秩正则化研究打开了许多新路径。首先,将正则化与周期性截断操作结合,形成 “正则-截断-再训练” 的循环,可能进一步压缩而不损失精度。其次,探索更复杂的正则化调度(如从弱到强逐步增加 λ\lambda)可以平衡训练稳定性与最终压缩率。第三,Polar Express 本身仍有改进空间,更高效的极分解算法(如 Gram‑Newton‑Schulz 迭代)可以直接替换进 SLORR 框架,进一步降低计算成本。

在应用层面,SLORR 的技术不仅能用于权重压缩。其快速估算核范数的能力可扩展到激活正则化,以增强泛化性或适应域偏移;或者用于约束特征空间低秩,从而提升激活感知压缩方法的效果。此外,该方法与优化器层面诱导低秩(如 Muon 或 NuMuon)的协同作用也值得深入探究。

总结与展望

SLORR 以简洁而有效的方式解决了训练时低秩正则化的核心难题:如何在不出具 SVD 的情况下,高效地对权重施加低秩先验。它利用极分解近似和巧妙的数学变换,构建了一个即插即用的正则化框架,不改变模型结构、不增加多余参数、不缓存状态。在视觉分类和语言模型预训练两大典型任务中,SLORR 均以极小的训练时间代价换取了压缩性能的显著提升。这一成果对于推动神经网络高效推理的普及,尤其是在资源受限环境下部署大模型,具有重要的现实价值。

展望未来,随着模型规模的持续膨胀和端侧推理需求的增长,训练与压缩协同设计将成为标准范式。SLORR 证明了,甚至简单的数学观察加上合适的数值方法,就能带来兼具实用性和可扩展性的突破。期待这一思路能激发更多关于可学习压缩、动态秩分配以及硬件友好型正则化技术的研究。