分页权重:通过动态质量感知权重量化实现高效混合专家大语言模型推理服务
PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization
论文信息
标题: PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization
作者: Yuchen Yang, Yifan Zhao, Anisha Dasgupta, et al.
发布日期: 2026-07-17
arXiv ID: 2607.16184v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:在大语言模型推理服务中,混合专家模型(MoE)的权重和 KV 缓存竞争 GPU 显存。当上下文变长时,静态量化无法在运行时动态腾出权重占用的显存给 KV 缓存。
- 核心方法:提出 PagedWeight 系统,将 MoE 专家的量化权重划分为 “页”,在推理过程中动态降低非关键专家权重的精度,并异步执行 CPU/GPU 数据搬运,以释放 GPU 显存。
- 关键结果:在三个 MoE 模型上,PagedWeight 达到与 FP16 相当的精度,同时最多节省 72.0% 的 GPU 显存并提升 1.94 倍吞吐量(见摘要及第 5.1 节)。
- 主要局限:论文主要基于 Any-Precision LLM 的比特平面量化格式实现,对其他量化格式的兼容性有待扩展(见第 7 节)。
- 适合读者:关注大模型推理优化、GPU 显存管理、量化压缩和 MoE 架构的系统工程师与研究人员。
论文背景和研究动机
在大语言模型(LLM)的推理服务中,GPU 显存需要同时容纳模型权重和不断增长的 KV 缓存。KV 缓存的大小随上下文长度线性增加,是长文本任务的主要显存压力来源。现有的 KV 缓存管理技术(如 PagedAttention 的分页管理、KV 缓存量化压缩)都只能作用于 KV 缓存本身,无法解决 MoE 模型权重占据大量显存的问题。事实上,MoE 模型的权重本身就占据 GPU 显存的 60% 以上(见第 1 节)。
量化的常见做法是在服务启动前对模型做静态压缩,精度一旦确定便无法在运行时调整。这种静态策略浪费了在推理过程中根据实时显存压力做动态权衡的机会——当 KV 缓存需要更多空间时,如果能主动降低一部分不那么关键的专家权重的精度,就能在不中断推理的前提下腾出显存。
此外,MoE 的路由具有高度不均衡性:不同专家被选中的频率差异很大,部分冷门专家即使被激进量化也不会明显影响生成质量。利用这一特性,在运行时对专家的量化精度做精细化调控,就成为一个自然且有待填补的空白。
核心方法和技术细节
权重的分页表示
PagedWeight 以每个专家内部的线性块(linear-block,即 gate_up 和 down 投影矩阵)为最小管理单位。每个线性块对应权重页表中的一行,记录支持的量化位宽集合、当前实际使用的位宽()以及规划器设定的目标位宽()。权重本身采用 Any-Precision LLM 的比特平面表示法,不同位平面对应不同有效位宽。一个比特平面及其查找表(LUT)构成一个 “权重页”,状态可以为 GPU 驻留、CPU 驻留或传输中。
当线性块的位宽从 降至 时,释放的显存量 ( 为该位宽下权重页和 LUT 的总字节数)。这一计算方式使得系统能够精确估算每次精度降级能腾出多少空间。
质量感知的运行时规划器
规划器决定哪些线性块应当降精度以及降多少,其核心是一个三级损伤评估框架(见第 3.2 节与算法 1)。
离线全局敏感度:利用 Hessian 加权的敏感度分数 ,定义线性块 从位宽 降至 的全局损伤 。该分数反映某一量化操作在平均意义上对输出质量的影响。
在线路由统计:在服务过程中持续收集每个专家被选中的路由权重,计算路由质量 (式 1)。专家按路由质量分入不同桶,每个桶拥有独立的损伤乘数 和最低位宽限制。高频专家的损伤乘数更大、允许的最低精度更高,从而被有效保护。
提示残差:量化敏感度在本质上与输入有关。PagedWeight 训练了一组按线性块类型和位宽转换区分的线性回归头,以路由加权的输入范数特征(均值范数、RMS 范数和最大范数)作为输入,预测当前提示对全局损伤的对数残差 (式 5)。预测值经置信度缩放和指数化后得到修正乘数 。最终的动作损伤预估为:
其中 为很小的损伤下限(式 8)。规划器将 KV 缓存压力转化为需释放的目标字节数 (式 7),然后按 “预估损伤/释放字节” 比从小到大贪婪选取降精度动作,直到满足 或达到位宽下限。
异步页搬运与融合内核
PagedWeight 的精度切换采用异步流水线(图 4):降精度时先将权重页拷贝至 CPU 内存,再降低提交位宽 并释放 GPU 页;恢复精度时则先拷回 GPU 再提升 ,避免推理过程中的数据竞争。此外,PagedWeight 实现了一个融合的混合精度 MoE CUDA 内核,直接读取比特平面和 LUT,支持每个线性块独立位宽,并将路由、专家激活、下投影和输出累加融为一体,减少内核启动开销。
创新点和贡献
本文的贡献可以归纳为四个层面。第一,它将传统 KV 缓存的分页管理思想移植到 MoE 权重的量化状态管理上,提出 “权重页” 概念,使专家精度可以在运行时随缓存压力变化而调整,这是量化策略上的一个系统层创新。第二,规划器将离线敏感度、在线路由均衡和输入依赖的提示残差有机组合,形成三级质量感知决策机制,比统一的静态精度分配或纯离线感知分配更贴合实际服务场景。第三,异步页搬运结合融合内核,几乎不引入明显吞吐损失——在批大小为 4 的最大吞吐损失仅 4.1%(表 3)。第四,PagedWeight 在三个规模和路由模式各异的开源 MoE 模型(Qwen1.5-MoE-A2.7B、Mixtral-8×7B、Gemma-4-26B-A4B)上均显著优于 APL、DP-LLM 和 MxMoE 等基线(图 5),显示出良好的泛化性。
实验结果分析
质量-显存权衡
在 Wikitext2、C4 的困惑度评估以及 GSM8K、MATH-500 的推理准确率评估中,PagedWeight 在所有三款模型上均以更低的显存消耗达到更高的任务质量(图 5)。以 Qwen1.5-MoE-A2.7B 为例,PagedWeight 在约 16 GB 时即进入接近 FP16 的困惑度区间,优于所有量化基线。这一优势在内存极度受限时尤为突出。
长上下文质量
在 Passage Retrieval、NarrativeQA 和 QMSum 三个长上下文任务上,PagedWeight 仅用 9.86 GB 显存就取得了与 FP16(35.25 GB)相当的平均得分 17.0%,而同样显存预算下 APL-4bit 仅有 14.7%(表 2)。在低显存区间的 Passage Retrieval 和 NarrativeQA 上,PagedWeight 相比 APL 分别提升 7.0 和 5.1 个百分点。
服务吞吐量
PagedWeight 的吞吐量在批大小为 1 和 4 时均接近相同显存预算下的均匀 APL 基线,最大吞吐损失为 4.1%(表 3),说明异步页搬运和融合内核成功隐藏了额外的通信与调度开销。
消融实验
将规划器中的路由统计、提示残差、动态页搬运和全局敏感度逐一移除,困惑度依次上升(表 4),说明每一组件均有独立且不可替代的贡献,其中动态页搬运和全局敏感度的作用最为突出。
实践建议
对于希望在 MoE 大模型服务中平衡显存、精度与吞吐的工程团队,以下建议具有直接参考价值:
- 从静态量化转向动态精度管理:如果服务负载中的上下文长度波动较大,应优先考虑在运行时动态调整专家精度,而不是固守单一的静态量化配置。PagedWeight 的权重页抽象可为自研系统提供设计参照。
- 充分利用路由不均衡性:MoE 的路由分布高度倾斜,冷门专家可接受更低的位宽而几乎不影响任务质量。在生产环境中,建议持续记录专家路由频率并据此分层设定保护策略。
- 结合提示感知进行在线调优:PagedWeight 的提示残差模块表明,同一量化操作对不同类型的提示可能有显著不同的影响。将输入特征(如输入范数)纳入精度决策,能进一步提升质量-显存权衡的精细度。
- 异步迁移与内核融合不可忽视:动态精度切换若未做异步处理,极易成为吞吐瓶颈。设计与推理并行的数据搬运流水线,并以融合内核减少算子启动开销,是在不牺牲吞吐的前提下实现动态量化的关键工程手段。
总体而言,PagedWeight 为 MoE 服务中的 “权重-缓存” 显存博弈提供了一套完整且可落地的解决方案,其核心思路——将权重视为可动态分页管理的资源——在未来的推理系统设计中具有广阔的延伸空间。