PagedWeight:利用动态质量感知权重量化实现高效 MoE 大语言模型服务

arXiv: 2607.16184v1

论文信息

标题: PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization

作者: Yuchen Yang, Yifan Zhao, Anisha Dasgupta, et al.

发布日期: 2026-07-17

arXiv ID: 2607.16184v1

PDF 链接: 下载 PDF

背景与研究动机

大规模语言模型(LLM)的推理服务面临着严峻的 GPU 显存压力,尤其是 Mixture-of-Experts(MoE)架构。MoE 通过每层只激活部分专家来降低计算开销,但总参数量庞大,权重本身就能占据超过 60% 的 GPU 显存。与此同时,自回归生成过程中不断增长的 Key-Value(KV)缓存同样吞噬着宝贵的显存,长上下文场景下尤为突出。这两者形成了尖锐的资源竞争:要么保留高精度权重而压缩 KV 缓存,牺牲上下文长度;要么为 KV 缓存腾出空间而强制对权重进行激进量化,可能导致模型质量下降。

传统的量化方法大多在模型上线前静态地选择一个固定精度,无法根据实际推理时的内存压力动态调整。已有的一些运行时精度调整工作虽然允许改变比特位宽,但没有将其与 GPU 显存的实时再分配相结合。这些方法的共同缺陷是无法在服务质量与内存利用之间实现细粒度、自适应的折中。PagedWeight 正是在这一背景下提出,目标是通过一种 “页面化” 权重管理方式,动态地、质量感知地量化 MoE 模型,使得权重精度能够跟随 KV 缓存需求灵活伸缩,从而在保持高准确度的同时显著降低显存占用。

核心方法:PagedWeight 系统设计

页面化权重表示

PagedWeight 借鉴了 vLLM 中 PagedAttention 的思想,将 MoE 模型的权重视为可以分页管理的资源。具体来说,它对每个专家内的线性块(gate_up 和 down 模块)采用一种 Any-Precision(AP)格式:权重被存储为共享的位平面(bit-plane),不同精度的表示只是选用不同数量的位平面,并配有对应比特位宽的查找表(LUT)。系统维护一张权重页表,每个线性块一行,记录了当前实际使用的比特位宽 qiq_i、规划器期望的比特位宽 did_i,以及每个位平面与 LUT 的驻留位置(GPU 内存或 CPU 内存)。类似于 KV 缓存的分页管理,当需要释放显存时,PagedWeight 会 “卸载” 某些位平面到 CPU 内存,从而降低该线性块的精度;当内存压力解除后,再将数据 “重载” 回 GPU。这种机制使得量化不再是静态的一次性操作,而变成了可以在推理过程中动态调整的显存再分配手段。

质量感知的运行时规划器

决定 “何时、对哪些线性块、降低多少精度” 是 PagedWeight 的核心挑战。为了在不损害输出质量的前提下最大化显存压缩,系统设计了一个融合离线校准与在线观测的三层损伤预测模型。

离线全局敏感度:利用校准集计算每个线性块在不同比特位宽下的 Hessian 加权敏感度 sibs_i^b。两个位宽之间的全局损伤 gibbg_i^{b \to b'} 被定义为敏感度增量的非负截断,反映了精度降低对模型输出的平均影响。这一步为所有动作提供了一个基准的 “损伤” 代价。

在线路由统计:MoE 的路由具有高度不平衡性,某些专家被频繁激活,对输出质量更为关键。PagedWeight 在推理时持续收集每个专家的路由质量(routing mass),并将专家按热度分桶。越热门的桶,其损伤乘数 μ\mu 越大,同时还要满足更高的位宽下限。这样,热门专家的权重实际上被 “保护” 起来,更难被激进量化,从而避免因压缩高频专家导致严重的质量劣化。

提示词残差:同一量化动作对不同的输入提示可能有不同的敏感度。为捕捉这种提示词相关的差异,PagedWeight 在离线阶段训练了一组轻量的线性回归头。每个回归头针对特定的线性块类型和位宽转移,从当前输入序列中提取三个特征:路由加权平均输入范数、路由加权 RMS 输入范数和最大输入范数,预测出一个对数残差值 ρ^\hat{\rho}。该残差经裁剪、指数化和置信度缩放后,作为乘性因子 η\eta 作用在全局损伤之上,形成 “提示词调整后的损伤” gηg \cdot \eta

当 KV 缓存压力触发规划时,系统根据当前空闲块数和阈值计算出需要释放的字节目标 DD。对于每一个合法的精度下降动作,计算其预计损伤 d^\hat{d} 与可释放字节数 Δ\Delta 的比值 d^/Δ\hat{d}/\Delta,按该比值从小到大(即单位字节损伤最低)贪心地选取动作,直到满足 DD 或达到位宽下限。对于批处理场景,各请求的路由统计、残差等信号按 KV 块使用量加权合并,得到批次级的一致规划。整个过程按固定步长迭代刷新,确保决策始终基于最新的内存和路由状态。

异步页面迁移与内核优化

为了避免数据搬运阻塞推理,PagedWeight 采用异步流水线。降低精度时,系统先将位平面数据拷贝到 CPU 内存,更新页表项的状态表示 GPU 页面已释放,然后才允许 KV 缓存复用被释放的显存空间。提升精度时,则先从 CPU 预取回页面,待状态就绪后提交更高的有效位宽。这一过程中,用户请求的生成不会被打断。此外,PagedWeight 实现了一个融合的混合精度 MoE 计算核,能够直接读取 AP 格式的位平面和 LUT,支持每个线性块独立的比特位宽,并将专家激活、下投影等操作融合在单个 CUDA 核中,进一步降低延迟。

创新点与贡献

PagedWeight 的主要创新体现在三个方面。第一,它首次将权重量化视为一个可动态调整的显存管理问题,通过类似 KV 缓存分页的机制,实现了 MoE 权重的页面化表示与运行时移动,开辟了权重精度与 KV 缓存大小之间丰富的折中空间。第二,它提出了一种多层次的损伤预测模型,将离线的 Hessian 敏感度、在线的路由热度统计和提示词特异性修正有机融合,使量化决策具有输入感知的质量保护能力。第三,通过异步页面迁移和融合核设计,该系统实现了动态精度调整时的低开销甚至零干扰,确保了推理吞吐不受明显影响。

实验结果分析

论文在 Qwen1.5-MoE-A2.7B、Mixtral-8×7B 和 Gemma-4-26B-A4B 三款不同专家数量与路由模式的模型上评估了 PagedWeight。对比基线包括 FP16、Any-Precision LLM(均匀量化)、MxMoE(静态混合精度)和 DP-LLM(动态混合精度)。

在质量-内存权衡方面,PagedWeight 始终以更低的 GPU 显存达到与 FP16 相当的困惑度与推理准确率。例如,在 Qwen1.5-MoE 上仅用约 16 GB 即接近原版质量,比 FP16 节省高达 72.0% 的显存,而同等内存预算下,其他量化方法的任务质量要差 10%–40%。在长文本任务中,PagedWeight 于 10 GB 左右即可恢复 FP16 的平均得分,而均匀量化仅能在同等开销下达到其一半的分数。吞吐量测试显示,在释放大量显存的同时,PagedWeight 的生成吞吐仅比同等显存占用的均匀量化最多低 4.1%,几乎无性能损失。消融实验证实,移除路由统计或提示词残差都会导致困惑度上升,移除页面移动(退化为静态混合精度)则进一步变差,表明每一个组件都不可或缺。

实践应用建议

对于在云服务或私有集群中部署 MoE 大模型的实践者,PagedWeight 的理念可直接融入现有推理引擎。首先,在显存受限的场景(例如单 GPU 长上下文推理),可以引入类似的权重页面管理机制,让模型在上下文较短时保持高精度,随着对话变长自动压缩非关键专家的权重、腾出 KV 缓存空间。其次,提示词残差机制提示我们,可以在服务启动前针对典型业务 prompt 训练一组轻量的敏感度修正模型,使量化策略能够根据具体输入做出自适应调整。最后,异步页面迁移和融合核的实现经验表明,把权重新迁作为后台操作并不会明显影响用户体验,可以大胆采用,从而提高硬件的整体利用率。若无法完全实现 paged weight,至少可以借鉴其分层损伤评估的思路,为不同的专家或模块设置差异化的静态量化策略,并辅以路由频率监控来动态微调位宽上限。

未来发展方向

PagedWeight 目前基于特定的 AP 格式和 Hessian 敏感度量标,未来可以扩展到更多量化格式(如 GPTQ、AWQ 等风格)以及激活感知的敏感度估计。另一个有趣的方向是将提示词残差的预测能力进一步增强,例如使用轻量级在线适配模块,在每个序列内部对量化损伤进行更细粒度的矫正。此外,将 PagedWeight 与专家预取、异地卸载等 MoE 服务优化技术结合,有潜力构建一个全栈式的自适应内存系统,智能地调度权重、KV 缓存和激活量,达到整体吞吐-质量的最优平衡。

总结

PagedWeight 重新审视了 MoE 推理中的显存竞争问题,将权重精度从静态属性转变为可动态调度的资源。通过页面化权重管理、层次化的质量感知规划和异步执行,它在多个基准模型和任务上展现出卓越的内存-质量折中性能,为未来高效、自适应的 LLM 服务系统提供了重要的设计范式。