大语言模型的黑盒在线策略蒸馏

Black-Box On-Policy Distillation of Large Language Models

arXiv: 2511.10643v1

论文信息

标题: Black-Box On-Policy Distillation of Large Language Models

作者: Tianzhu Ye, Li Dong, Zewen Chi, et al.

发布日期: 2025-11-13

arXiv ID: 2511.10643v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决大语言模型黑盒蒸馏中,仅依赖教师模型文本输出却缺乏在线策略反馈的技术难题。
  • 核心方法:提出生成对抗蒸馏(GAD),将学生模型视为生成器,训练判别器区分教师与学生的回答,形成极小极大博弈,使判别器成为共进化的在线策略奖励模型。
  • 关键结果:Qwen2.5‑14B‑Instruct 经 GAD 蒸馏后,在 LMSYS‑Chat 自动评测上与教师模型 GPT‑5‑Chat 的表现相当(见论文摘要),且方法持续优于常用的序列级知识蒸馏。
  • 主要局限:方法依赖判别器的训练质量与稳定性,黑盒设定无法利用教师内部 logits,可能损失细粒度分布信息;对抗训练本身的收敛难度和计算开销较大。
  • 适合读者:从事大模型压缩、知识蒸馏、强化学习与生成模型交叉研究,以及希望从闭源模型中高效迁移能力的工程师和研究人员。

论文背景和研究动机

大型语言模型(LLM)的能力通常随参数规模和训练数据的增长而跃升,但闭源商业模型仅通过 API 提供文本输出,内部 logits 或参数完全不可见。传统的知识蒸馏要求学生模型同时拟合教师模型的输出分布(logits)与标签,这在黑盒条件下无法实现。为此,一类黑盒蒸馏方法应运而生:学生仅从教师生成的文本序列中学习。然而,现有的序列级知识蒸馏(sequence‑level KD)多为离线设定——先采集教师回复作为静态数据集,再通过最大似然估计训练学生。这种方式缺失了至关重要的 “在线策略(on‑policy)” 反馈:学生在训练过程中自身的生成分布会不断变化,但静态数据集无法反映这种变化,从而导致奖励信号滞后、训练不稳定,性能上限受限。

与此同时,在强化学习领域,近端策略优化(PPO)等方法通过在线环境交互获取奖励,但在黑盒蒸馏中既没有真实环境,也无法直接获得统一的奖励函数。若能构建一个能够与学生同步演化的判别器,动态评价学生输出的质量,便有望将为在线策略学习引入蒸馏场景。这正是本文提出 生成对抗蒸馏(Generative Adversarial Distillation, GAD) 的动机:借鉴生成对抗网络(GAN)的思想,将师生交互构建为一个极小极大博弈,让奖励模型(判别器)与学生共同进化,从而实现黑盒条件下的在线策略蒸馏。

核心方法和技术细节

GAD 将蒸馏问题重新定义为对抗博弈框架。学生语言模型 GθG_\theta 充当生成器,以提示 xx 为条件生成回答 y∼Gθ(⋅∣x)y \sim G_\theta(\cdot|x)。教师模型 TT 针对同一提示生成回答 yt∼T(⋅∣x)y^t \sim T(\cdot|x)。判别器 DϕD_\phi 的训练目标是区分一个回答究竟来自教师还是学生,其损失函数可采用二分类交叉熵:

LD=−Ex[log⁡Dϕ(yt∣x)+log⁡(1−Dϕ(yg∣x))],\mathcal{L}_D = -\mathbb{E}_{x} \big[ \log D_\phi(y^t|x) + \log (1-D_\phi(y^g|x)) \big],

其中 yg∼Gθ(⋅∣x)y^g \sim G_\theta(\cdot|x)。对判别器而言,教师回答为真实样本(标签 11),学生回答为伪造样本(标签 00)。

学生生成器的更新则借助判别器提供的奖励信号。为了让反馈能够在离散文本上回传梯度,GAD 采用策略梯度类方法。具体而言,将判别器输出 Dϕ(y∣x)D_\phi(y|x) 直接作为序列级奖励,或者将奖励信号与 token 级生成概率结合,计算优势函数,再通过 REINFORCE 或 PPO 等算法更新学生参数。此时学生最大化期望奖励:

LG=−Ex, y∼Gθ(⋅∣x)[r⋅log⁡Gθ(y∣x)],\mathcal{L}_G = -\mathbb{E}_{x,\, y\sim G_\theta(\cdot|x)} \big[ r \cdot \log G_\theta(y|x) \big],

其中 r=log⁡Dϕ(y∣x)r = \log D_\phi(y|x) 或经过标准化后的奖励。这一框架自然形成在线策略:学生每产生一批新回答,判别器就同步更新,再以此提供即时反馈,避免了离线数据分布漂移带来的偏差。

GAD 的实现包含两个交替阶段:

  1. 判别器训练:从当前学生和教师分别采样回答,更新判别器以提升区分能力;
  2. 学生更新:固定判别器,使用策略梯度优化学生,使其生成更接近教师风格的回答。

整个过程无需访问教师模型内部,完全依赖文本输出,因此是严格的黑盒蒸馏。判别器的设计也极为灵活,可以在教师和学生回答的基础上引入额外的区分特征,或直接采用与生成器同架构的预训练模型微调,从而充分捕捉语言上的差异。

创新点和贡献

GAD 的主要创新体现在三方面:

1. 首次将生成对抗框架用于黑盒 LLM 的在线策略蒸馏。 不同于以往收集教师样本再离线训练的方式,GAD 让奖励信号随着学生生成能力的提升而不断精炼,形成一个动态适应的训练循环。这种在线的奖励塑造机制更贴近人类反馈强化学习(RLHF)的理念,但完全依赖教师文本反馈,无需人工标注。

2. 判别器作为共进化的奖励模型,提供稳定、自适应的反馈。 在 GAN 中,判别器过强会导致生成器梯度消失;在 GAD 中,论文通过小批量交替训练和适当的奖励缩放,使判别器始终能提供有意义的区分信号,帮助学生在每个训练阶段获得明确的改进方向。这种设计保证了训练的稳定性,避免了离线 KD 中静态损失函数与模型分布脱节的问题。

3. 在黑盒场景下实现了超越序列级知识蒸馏的性能,并首次让学生模型与顶尖闭源教师持平。 实验显示,GAD 在多个自动评测指标上一致超越传统的序列级 KD 方法(见论文摘要)。尤其值得关注的是,经过 GAD 蒸馏的 Qwen2.5‑14B‑Instruct 在 LMSYS‑Chat 自动评测上的表现已可媲美其教师模型 GPT‑5‑Chat,这证明了黑盒蒸馏在保留教师能力方面能够达到实用水平。

实验结果分析

论文在指令遵循、对话等任务上进行了系统对比。基线方法包括直接使用教师回答进行监督式微调的序列级 KD。所有实验均未使用教师内部 logits,保证了公平的黑盒条件。主要发现包括:

  • GAD 持续优于序列级 KD。无论在对话质量还是指令理解准确率上,GAD 训练的学生均取得更高得分,表明在线策略反馈带来的分布匹配至关重要(见论文摘要)。
  • 模型规模与效果正相关,但即使中等规模也能有效迁移。论文使用 14B 参数的学生模型达到与教师相当的对话水平,说明蒸馏的效率较高,不必依赖与学生同等大小的教师模型。
  • 判别器质量直接影响最终性能。作者通过消融实验表明,若判别器过于简单或更新频率不当,蒸馏效果会明显下滑,验证了对判别器设计的敏感性。
  • 训练过程中的对抗动态保持健康。二者交替更新均未出现模式崩塌,学生回答的多样性和质量同步提升,说明 GAD 框架具备良好的收敛性质。

尽管论文未公开详细的数值表,但从 “comparable to its teacher, GPT‑5‑Chat” 这一表述可以看出,GAD 在黑盒蒸馏任务上首次将学生模型的性能拉升到与超大规模闭源教师同一级别,具有里程碑式的意义。

实践建议

对于希望将 GAD 部署到实际项目中的工程师和研究者,以下几点值得关注:

1. 判别器的选型与平衡。 推荐以学生模型的基础架构作为判别器的起点,并在顶层增加分类头。训练时需密切关注判别器准确率,将其稳定在 0.6 – 0.8 区间,避免判别器过强导致奖励稀疏。可尝试周期性重置判别器参数或使用较小的学习率来维持平衡。

2. 训练流程与资源规划。 GAD 需要同时维护教师 API 调用、判别器更新和学生梯度更新,计算和通信开销高于离线 KD。建议使用异步采样流水线:学生生成 → 教师生成 → 判别器训练与学生更新并行。在 API 成本较高的场景,可以批量缓存教师回答,并在每个 epoch 中重用部分,但需注意这会在一定程度上退化为离策略,可能影响最终效果。

3. 奖励设计细节。 直接使用判别器输出的概率 Dϕ(y∣x)D_\phi(y|x) 作为奖励,可能会面临奖励幅度过小的问题。实践中可采用对数奖励 log⁡Dϕ(y∣x)\log D_\phi(y|x) 或引入基线值(baseline)以减少方差。若判别器提供序列级奖励,建议按 token 均分或结合回答长度进行归一化,确保奖励尺度稳定。

4. 评估与应用场景。 GAD 尤其适用于希望将闭源大模型的能力蒸馏到中小尺寸可私有部署模型的场景,例如企业对话系统、智能客服等。在资源允许的情况下,建议使用多维度的自动评测(如 LMSYS‑Chat 的评分体系)并结合人工评估,确保学生模型在实用维度上真正逼近教师水平。当教师的能力边界与学生差距过大时,可考虑多阶段蒸馏,先使用中间模型过渡,再进入 GAD 训练。

总体而言,GAD 为黑盒蒸馏提供了一条高效且可落地的路径。随着生成对抗技术和策略梯度方法的进一步成熟,该方法有望成为闭源大模型能力迁移的标准范式。