请求式编码:借助自生成训练数据突破模型压缩极限
论文信息
标题: Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data
作者: Shikai Qiu, Marc Finzi, Yujia Zheng, et al.
发布日期: 2026-07-13
arXiv ID: 2607.11883v1
PDF 链接: 下载 PDF
引言:当压缩遭遇规模——神经网络真的 “懂了” 多少?
深度学习模型的惊人性能往往伴随着巨大的参数量,但越来越多的证据表明,网络实际学到的函数远没有其参数规模暗示的那么复杂。那么,如何衡量一个模型从数据中真正提取了多少 “可泛化的规律”?压缩——将模型表示为一段紧凑的代码——长期被视为回答这一问题的钥匙。一段短得令人惊叹的代码,意味着模型发现了数据中极强的规律性,且这种规律足以保证泛化能力。
然而,现有模型压缩技术始终面临两难处境。直接压缩参数(如量化、剪枝)得到的编码长度随模型体积线性增长,却对 “参数里到底装了多少信息” 几乎不敏感;预序列编码(prequential coding) 通过压缩训练过程来编码模型,摆脱了参数计数的束缚,却不得不逐字逐句地记录所有训练数据,编出的代码长度被数据自身的熵所淹没。到头来,我们既无法证明大模型更加可压缩,也没法拿出像样的泛化保证——而这些本来应该是压缩理论能够揭示的关键现象。
论文《Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data》提出了需序列编码(requential coding),这一崭新的压缩范式彻底跳出了上述困境。其核心洞察极为简洁:我们不该压缩参数字节,也不该压缩所有输入数据,而应让模型生成自己的训练样本,再让一个更强的 “教师模型” 来挑选,最终只记录师生之间不一致的那一丁点信息。由此,编码长度几乎不再取决于模型大小,也与数据熵无关,使得真正从数据中学到的 “可压缩性” 首次得以浮现。
从 “你见过什么” 到 “你还差多少”:Requential Coding 的核心思想
不妨把 requential coding 想象成一场精心设计的协同训练游戏。参与游戏的有两位:一个想要被压缩的学生模型 ,以及一个更强大的教师模型 。学生是一个生成模型,它可以不断地从自己的分布中 “幻想” 出一堆候选训练样本 ,这些样本由双方共享的伪随机数生成器产出,因而无需额外传输。教师则拥有真实数据的视界(它通常就是在真实数据上训练的同类模型),它只需要在学生的诸多 “幻想” 中挑选出看起来最像真实数据的那一个,并把它所选的索引 发送给学生。
接收方(解码器)仅有学生模型和共享的随机种子。它用相同的种子再生出同一个候选序列,凭借接收到的索引即可取出那个教师认可的训练样本 。学生随后在 上执行一步梯度更新,得到 。如此反复,学生沿着教师指引的路径逐步进化,而传输过程中唯一需要编码的,就是那一连串的索引消息。这个过程的魔力在于,当教师分布 与学生分布 很接近时(即学生已经很好地模仿了教师),究竟选哪个候选样本几乎不需要多少比特就能表达——这正是相对熵编码(REC) 的意义所在。
具体而言,REC 能以一种极其高效的方式将来自 的随机样本压缩通信:它所需的期望码长仅约 比特,也就是师生之间的 KL 散度。当学生早已学会像教师那样生成数据时,KL 散度趋近于零,几乎不需要传输任何新信息;反之,若学生懂的还少,KL 散度较大,则需要多花一些比特来纠正。整个编码过程的累积期望码长因此为
其中对数项与常数来自通用整数编码的微小开销。对于通常上百万 token 的批处理,这些开销可以忽略不计,实际码长几乎就等于师生 KL 散度之和。这一长度独立于模型参数量,也独立于数据的香农熵——后者意味着哪怕数据是高度不可预测的随机串,只要学生已经学会 “随机”,其自身产生的候选样本也已足够随机,教师一选就好,码长依然极短。而在预序列编码中,这种情况会强制编码所有随机比特,付出高昂代价。
为了让教师始终保持在恰能引导又不拉开过大 KL 的位置,研究团队还引入了两项实用技巧:教师平滑(对教师模型进行指数滑动平均以减少噪声)和等损失投影(定期将教师重置为学生状态,然后快速续训直到恢复原本的性能水平,使师生 KL 大幅降低)。这些设计让 requential coding 在实践中极为稳定有效。
逼近智慧的极限:用压缩来量度泛化与可学习性
借助 requential code 的强力压缩能力,论文为我们揭示了一系列以往技术无法触及的现象。
大模型反而更 “小”。在保持同一损失或性能的前提下,更大的模型或更大的模型集成(ensemble)竟能压缩成更短的代码,这与参数量越多需要越多比特的直觉截然相反。原因在于,大模型的样本效率更高,能更快地追上教师,因此累积的 KL 散度和更短,代码反而更精悍。这一事实直接反驳了 “大模型必然更复杂” 的成见,为缩放定律背后的简化机制提供了有力证据。
可证明的泛化边界随规模而收紧。将 requential code 接入 PAC-Bayes 泛化框架,立刻得到量级跃迁的泛化保证。对于数十亿参数的、按 “最优计算量” 比例()训练的大语言模型,该界限不仅显著优于理想化的 4 比特量化(假设量化无损)所给出的先前最佳界限,而且随着模型增大,泛化差距呈幂律衰减,理论上可趋于零。这意味着,当我们同时扩大模型和训练数据时,模型不仅测试性能改善,其可压缩性也在增强,从而关闭了过度拟合的窗口。
预测多轮训练中的过拟合。同样的代码长度直接勾画出一条渐进的过拟合曲线:当数据被重复训练时,训练损失持续下降,但模型复杂度(即 requential code 长度)上升得更快,使得泛化界限逐渐发散。这一动态过程以往只能靠经验猜测,如今可以用一个统一的压缩度量定量刻画。
分离 “噪音” 与 “结构”。由于 requential code 的长度不依赖于数据熵,它可以直接比较不同数据集中模型能够提取的 “可学习信息” 的多寡。实验显示,低熵的文本数据包含更多的可学习结构,高熵的图像数据次之,而纯随机字符串几乎不含任何可学习内容。相比之下,预序列编码被数据熵撑大,量化编码被参数量绑定,均不能胜任这一角色。
现实意义及未来挑战
Requential coding 不仅在理论层面推动了模型压缩的边界,也为实际工程带来了深刻启示。例如,在需要传输或存储大模型时,可直接利用师生蒸馏的思路,将最终模型表示为一套训练指令而非权重文件。解码方只需从头启动学生模型并执行这些 “索引指令”,即可原地重建一个高性能模型,且解码的计算开销仅相当于普通训练,而不需像参数量化那样对每个张量进行精密调校。
不过,当前 requential coding 更倾向于一种复杂度度量工具,而非真正即插即用的压缩器。其编码器(发送端)在寻找合适的 REC 索引时可能极为耗时,因为抽样次数随 KL 散度指数增长。论文指出,通过调整 REC 块大小可以在码长与编码时间之间折衷,但大规模部署仍有距离。
更令人期待的是若干开放性方向。其一,如何让码长也反映 “遗忘”:目前代码只增不减,但真实模型训练中早期学到的信息可能被后续更新覆盖,理想编码器应当能回收这部分比特。其二,能否用 requential 边界指导训练实践,比如根据压缩长度动态调整学习策略以优化泛化。其三,可否结合更强的教师生成策略(如异质教师、课程式引导)进一步压低码长。这些问题的推进将为深度学习的信息论理解注入全新活力。
结语
Requential coding 通过让模型用自己的语言去表达需要监督的程度,成功斩断了压缩与参数规模、数据熵之间的纠缠。它强有力地证明:真正值得编码的,从来不是模型内在的海量数字,也不是数据集本身的字面内容,而是模型与真实世界之间那片尚需弥合的理解间隙。缩小这一间隙的过程本身,恰恰就是泛化的本质。