STEPQuant:Delta 规则循环状态量化中误差何时何地重要
STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization
论文信息
标题: STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization
作者: Bingchen Yao, Haobo Xu, Haokun Lin, et al.
发布日期: 2026-09-29
arXiv ID: 2609.38169v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:线性注意力模型的递归状态在并发服务时成为显著内存瓶颈,直接使用均匀 INT4/INT6/INT8 量化会导致严重精度下降。
- 核心方法:提出 STEPQuant,结合终身感知的混合精度位分配与关键行感知的双轴缩放拟合,对递归状态做时空联合量化。
- 关键结果:在论文评测的七个长生成任务上,6 位 STEPQuant 在 Qwen 和 Kimi 上平均准确率与 FP32 状态几乎一致(Qwen 80.59% vs 80.60%;Kimi 61.47% vs 61.52%,表 1);Qwen W4 权重下批次 512 总服务内存减少 68.7%(图 3(c))。
- 主要局限:作者承认终身权重只用门衰减近似,未完整建模时变且依赖键的状态转移;KDA 在 BF16 权重 4 位时长生成精度下降;评估仅覆盖两个 GDN/KDA 模型和固定工作负载(附录 H)。
- 适合读者:从事 LLM 推理系统、模型量化、线性注意力与递归状态模型部署的工程师和研究者。
论文背景和研究动机
传统 softmax 注意的 KV 缓存随序列长度增长,而线性注意力将过去 token 归纳为固定大小递归状态 。但每个并发请求都需要独立的持久状态,因此状态池内存随并发数增长。论文指出,在官方 SGLang 部署中,Qwen 的 FP32 状态池在 70 个并发请求时超过 BF16 权重内存(图 1(a))。
直接均匀量化递归状态会失败:每次更新都在近似状态上进行,随后再次量化,误差会沿后续解码步传播。论文在七个长生成任务中显示,均匀 INT4/INT6/INT8 的平均准确率随比特下降而快速下降(图 1(c))。作者从两个维度分析误差:时间上,长寿命状态单元积累更大误差,Qwen 2,304 个头中门半衰期与 INT6 累积误差的 Spearman 相关约 0.80(图 1(b));空间上,不同关键行的误差对读出的影响不同,状态幅值沿行和列均存在离群值(图 2)。这构成方法动机。
核心方法和技术细节
门控 Delta 规则状态更新可写成:
量化误差传播为 ,输出误差为 。命题 1 给出条件误差传播的形式化证明:在 、、 下,(见附录 A)。因此误差衰减主要由门保留和键方向决定,生命周期成为量化风险指标。
终身感知位分配对单元 估计失真 和平均对数保留 ,定义寿命权重 ,并在平均位预算下最小化 (论文第 3.2 节)。少量高风险单元保留为 FP16 稀疏枢轴:Qwen 为 32 个头,KDA 为 512 个关键行(附录 C.2)。
关键行感知双轴拟合将状态写作 。行因子同时考虑行幅值 和关键行影响得分 :;列因子通过最小化影响加权重建误差拟合(公式 14)。影响得分来自 ,其中 。该方法在 Qwen 和 KDA 上实现(第 4.3 节)。
工程实现上,离线确定位分配和枢轴,在线使用融合内核,把状态重建、Delta 更新和当前读出融合;读出后尺度拟合和打包写回在与后续层计算重叠的 CUDA 流上执行(第 4.4 节)。代码托管于 GitHub 仓库。
创新点和贡献
论文的主要贡献在于把递归状态量化看作一个时空联合问题。现有 PTQ 通常关注权重、激活或 KV 缓存,而本文针对门控 Delta 规则的误差传播,提出 “何时” 和 “何处” 两个维度。终身感知位分配将门保留寿命直接纳入混合精度目标,不仅考虑单步失真;关键行感知双轴拟合同时处理行幅值离群和关键行读出错影响,不同行分配不同行尺度,并加权拟合列尺度。最后,论文在 SGLang 中实现了 packed-state 内核,以约 6 位预算实现超过 5× 的递归状态压缩(图 3(d)),使低比特状态量化在工程上可复现。
实验结果分析
在长生成推理任务中(表 1),6 位 STEPQuant 在 Qwen 平均准确率 80.59%,与 FP32 状态 80.60% 几乎一致;Kimi 为 61.47% vs 61.52%。4 位 STEPQuant 在 Qwen 上为 80.51%,而均匀 INT4 仅为 12.73%;Kimi 4 位 STEPQuant 为 58.52%,均匀 INT4 为 21.63%。短生成任务中(表 2),4 位 STEPQuant 在 Qwen 和 Kimi 平均准确率分别为 87.63% 和 68.11%,FP32 为 87.78% 和 68.36%,仍然接近。
在与 4 位 AWQ 权重量化联合时(表 3),6 位 STEPQuant 在 Qwen 平均准确率 79.27% vs FP32 79.32%;Kimi 58.62% vs 58.95%。这说明状态压缩可与权重量化叠加,且随权重内存下降,状态压缩的价值占比上升。
消融实验(表 4)在 Qwen 6 位预算下显示:只做空间拟合计三任务平均 80.19%,只做终身位分配(含枢轴)75.63%,两者结合 84.51%;FP32 为 84.61%。4 位下空间仅 73.95%,时间仅 12.87%,结合 84.72%。这表明空间拟合在低比特时更关键,稀疏枢轴保护对时间组件有较大贡献。
生成长度方面,均匀低比特量化在部分长任务上输出长度异常增加,甚至接近 65536 token 上限,但准确率接近 0;STEPQuant 的输出长度接近 FP32 状态(图 3(a)(b))。作者观察到这种 “过度思考” 不带来准确率收益。
效率上,Qwen W4 权重批次 512 下,6 位 STEPQuant 将总服务内存从 419.73 降至 131.18 GiB,减少 68.7%;状态内存减少 80.1%(5.03× 压缩),状态更新时间减少 65.6%(2.91× 加速)(图 3(c)(d),第 5.6 节)。KDA 对应总内存减少 53.7%,状态内存 5.08× 压缩,状态更新 1.78× 加速(附录 F.4)。
实践建议
若要在部署中采用该方案,建议优先从 6 位 STEPQuant 开始评估,尤其对 Qwen 类 GDN 模型。Qwen 在论文的长生成和短生成评测中,6 位和 4 位状态都接近 FP32 状态精度(表 1、表 2);而 KDA 在 BF16 权重 4 位时长生成任务有可见损失,因此对通道级门控模型,精度敏感场景可先选 6 位(论文第 5.2 节,附录 H)。
离线校准可以参照论文设置:用 32 段 WikiText-2 训练集各 2048 token 确定位分配、FP16 枢轴和关键行影响得分;推理中在线拟合双轴尺度,不跨请求共享(论文第 5.1 节,附录 C.3)。若同时做权重量化,6 位 STEPQuant 与 4 位 AWQ 权重组合在论文评测中保持稳定,且此时状态内存在总内存中的占比上升,压缩收益更明显(论文第 5.3 节)。
工程集成时,可以借鉴 SGLang 中的融合内核和 CUDA 流重叠思路,避免额外全状态重建读取;但本文未给出所有实现细节,需要结合附录 F 和开源代码调整。最后,部署监控中可关注生成长度:均匀低比特可能产生异常长输出且准确率很低,STEPQuant 在论文评测中输出长度更接近 FP32(论文第 5.5 节),这可以作为量化退化的辅助观测指标。