通过目标分布设计实现监督微调的统一视角

A Unifying Lens on Supervised Fine-Tuning Through Target Distribution Design

arXiv: 2606.11189v1

论文信息

标题: A Unifying Lens on Supervised Fine-Tuning Through Target Distribution Design

作者: Tong Xie, Yuanhao Ban, Yunqi Hong, et al.

发布日期: 2026-06-09

arXiv ID: 2606.11189v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:监督微调(SFT)通常强迫模型逐 token 严格拟合 observed token,忽略了该 token 可能非唯一、含噪声或因与模型先验不匹配而并非理想目标,这种僵硬的 one-hot 监督会损害泛化能力。
  • 核心方法:提出 QQ-target 框架,将 SFT 的目标分布显式分解为 γt\gamma_t(对观测 token 的信任强度)和 π~t\tilde{\pi}_t(剩余概率分配给替代 token 的方式),并基于此设计 Target-SFT,用模型自身概率作为信任代理、用教师模型引导的剩余分布来提供更灵活的监督。
  • 关键结果:在覆盖数学推理与医学推理的 10 个数据集–模型组合上,Target-SFT 的 Average@16 准确率全部优于标准 SFT、概率加权 SFT 以及知识蒸馏(见论文表 1、表 2),例如在 Qwen2.5-Math-1.5B + NuminaMath-CoT 上达到 38.05%,而标准 SFT 仅为 16.72%。
  • 主要局限:方法依赖教师模型,且需要调节教师信号强度 η\eta 等超参数;论文主要在数学和医学推理任务上验证,是否在其他自然语言任务上同样有效尚待检验。
  • 适合读者:从事大语言模型微调、知识蒸馏、强化学习与模型对齐的工程师与研究人员,尤其关心如何设计更聪明 SFT 目标的读者。

论文背景和研究动机

监督微调(SFT)是大型语言模型后训练的核心阶段,但标准做法——在每个 token 位置最大化 observed token 的概率,本质上是将整个概率质量集中在 one-hot 目标 δyt\delta_{y_t} 上。这种隐性假设每个 observed token 都是唯一且绝对正确的目标,在真实数据中往往不成立:同一个 prompt 可以有多种正确的推理路径、措辞、中间步骤或风格选择,而模型从预训练中已积累丰富的先验知识。强制模仿每一个 token 不仅可能放大噪声,还会导致过度自信、干扰预训练先验,以及降低泛化能力。

许多现有工作试图修复这一缺陷,例如通过 token 级重要性加权降低不可靠 token 的损失贡献,或引入正则项限制模型对参考分布的偏离。然而,这些方法通常被描述为各自孤立的算法选择,缺乏一个统一的视角来理解它们之间的内在联系,也难以指导构造更好的 SFT 目标。

本文提出的核心洞见是:SFT 的关键不在于损失函数的代数形式,而在于损失所驱动的隐式目标分布。比起在损失层面折腾,直接设计一个理想的目标分布 QtQ_t 才是更根本的做法。这一视角使得我们能够显式控制监督信号:如果 observed token 高度可信,QtQ_t 接近 one-hot;如果它不可靠或与模型先验冲突,则应该软化监督,将概率分配给合理的替代 token。围绕这一思想,论文引入了 QQ-target 框架,并基于该框架构造了 Target-SFT 方法。

核心方法和技术细节

QQ-target 框架:从损失到目标分布

给定前缀 xtx_t,标准 SFT 最小化 −log⁡πθ(yt∣xt)-\log \pi_\theta(y_t \mid x_t),等价于用 one-hot 目标 δyt\delta_{y_t} 与模型分布做交叉熵。QQ-target 框架的核心是引入一个更灵活的 token 级目标分布:

Qt=γtδyt+(1−γt)π~tQ_t = \gamma_t \delta_{y_t} + (1 - \gamma_t) \tilde{\pi}_t

其中 γt∈[0,1]\gamma_t \in [0,1] 表示对 observed token yty_t 的期望信任度,π~t\tilde{\pi}_t 是一个定义在词表上的概率分布,用来分配剩余的 1−γt1-\gamma_t 概率质量。论文用一个潜在二值变量 ZtZ_t 建模 “是否应该严格信任 yty_t”,再通过 Beta-Bernoulli 共轭推导出 γt\gamma_t 可以理解为后验期望,而 π~t\tilde{\pi}_t 就是当不信任 yty_t 时应遵循的替代分布。

将 QtQ_t 作为交叉熵目标,损失直接分解为(见论文命题 1):

CE(Qt,πθ)=γt CE(δyt,πθ)+(1−γt) CE(π~t,πθ)CE(Q_t, \pi_\theta) = \gamma_t \, CE(\delta_{y_t}, \pi_\theta) + (1 - \gamma_t) \, CE(\tilde{\pi}_t, \pi_\theta)

由此,SFT 的监督被清晰地拆解为两个可设计的分量:① 以多强的力度模仿 observed token(γt\gamma_t);② 如何把剩余的概率分配给替代 token(π~t\tilde{\pi}_t)。

统一现有 SFT 变体

论文通过引入 “任意可微损失都可以提取出其隐含的目标分布 Qt=pt−∇zLQ_t = p_t - \nabla_z \mathcal{L}”(第 5.2 节)这一工具,展示了许多现有 SFT 变体不过是隐式选定了 (γt,π~t)(\gamma_t, \tilde{\pi}_t):

  • Token 加权方法(如 DFT、Beyond-log、ProFiT 等)通过一个可脱钩的权重 wtw_t 缩放负对数似然,隐式地对应 γt=wt\gamma_t = w_t 和 π~t=sg[πθ]\tilde{\pi}_t = \text{sg}[\pi_\theta](即剩余概率只分配给当前模型输出,不产生梯度)。它们只回答了问题①,而问题②则简单退化。
  • 分布级变量方法(如 label smoothing、KL 正则、知识蒸馏等)通常形式为 − ⁣atlog⁡πθ(yt)+btCE(qt,πθ)-\!a_t\log\pi_\theta(y_t) + b_t CE(q_t, \pi_\theta),可解读为 γt=at/(at+bt)\gamma_t = a_t/(a_t+b_t) 且 π~t=qt\tilde{\pi}_t = q_t,回答了问题②,但问题①的 γt\gamma_t 由固定超参数决定,缺乏自适应性。

这种统一视角揭示了现有方法的互补性,也为新的 SFT 设计指明了方向:同时设计 γt\gamma_t 和 π~t\tilde{\pi}_t,且让 γt\gamma_t 与 token 的不确定性自适应关联。

Target-SFT:自适应信任 + 教师引导的剩余分布

论文基于 QQ-target 框架提出了具体实现 Target-SFT,对应式 (7) 与 (8):

  • 对 γt\gamma_t 的选择:用模型当前对该 observed token 的概率 py=πθ(yt∣xt)p_y = \pi_\theta(y_t \mid x_t) 直接作为信任度 γt\gamma_t。pyp_y 可视为预训练积累的证据的代理,pyp_y 越高,越接近 one-hot 监督;pyp_y 越低,越倾向于从替代分布获取监督。这个选择与已有的 pp-loss 方法相一致,但从 QQ-target 角度暴露了该类方法对剩余分支的处理不足。
  • 对 π~t\tilde{\pi}_t 的构建(教师引导):在 pyp_y 很小时,单纯用当前模型分布作为 π~t\tilde{\pi}_t 不会给出任何纠正信号。Target-SFT 通过一个 KL-正则化的奖励塑形导出教师引导的剩余分布: π~tguided(a)∝πθ(a∣xt)1−ηπT(a∣xt)η,η∈[0,1]\tilde{\pi}_t^{\mathrm{guided}}(a) \propto \pi_\theta(a \mid x_t)^{1 - \eta} \pi_T(a \mid x_t)^{\eta}, \quad \eta \in [0,1] 其中 πT\pi_T 是教师模型(如 instruction-tuned 版本)的概率分布。参数 η\eta 控制教师信号的强度:当 η→0\eta \to 0 时退化为自匹配残差,当 η→1\eta \to 1 时完全依赖教师。当模型对 observed token 信任度低时,剩余的 1−py1-p_y 权重会加大对 π~tguided\tilde{\pi}_t^{\mathrm{guided}} 的匹配,从而在模型不确定或缺乏知识时引入教师提供的纠正信号。

将两者结合得到自适应目标:

QtTarget=py δyt+(1−py) π~tguidedQ_t^{\text{Target}} = p_y \,\delta_{y_t} + (1-p_y)\,\tilde{\pi}_t^{\mathrm{guided}}

对应的 token 级损失即为两部分交叉熵的加权和(见式 (8)),实现起来简洁高效。

创新点和贡献

  1. 从损失到目标的视角转换。论文首次明确指出 SFT 损失只是优化代理,真正的设计空间在于损失所隐含的目标分布 QQ,由此可以通过直接设计 QtQ_t 来更精确地控制监督行为。
  2. 统一框架。QQ-target 框架将大量分布式的 SFT 变体(token 加权、分布约束、知识蒸馏等)统一为对 (γt,π~t)(\gamma_t, \tilde{\pi}_t) 的显式或隐式选择,揭示了它们在设计上的互补关系,为组合和创新提供了理论指导。
  3. Target-SFT 方法。同时优化信任强度与剩余分配,利用模型自身概率自适应调节模仿力度,并用教师模型在需要时提供高质量替代监督,在多个推理基准上展现出相对于多种基线的稳健优势。
  4. 实证验证。在涵盖 7 种模型、3 个训练数据集、10 个具体数据-模型设定的实验中,Target-SFT 的 Average@16 准确率在所有条件下均为最高,说明框架驱动的设计在实践中确实有效。

实验结果分析

实验分为数学推理(NuminaMath-CoT、OpenR1-15k)和医学推理(m23k)两大类,评价指标是 Average@16 准确率。主结果见表 1 和表 2。

数学推理(表 1):标准 SFT 在小模型或特定数据上甚至可能弱于 base model(如 Qwen3-1.7B 在 NuminaMath 上从 14.26 降至 12.99),验证了强制 one-hot 匹配的弊端。概率加权 SFT(pp-loss)虽然通过 γt=py\gamma_t = p_y 改善了性能,但仍留下剩余分支未设计的缺口——Target-SFT 在所有模型和数据集上都稳定超越 pp-loss。例如 Qwen2.5-Math-1.5B 在 OpenR1 上,pp-loss 为 39.00,而 Target-SFT 达 41.24。纯知识蒸馏(固定 soft 目标)在此表现较不稳定,且远逊于 Target-SFT,说明直接全盘替换目标也不如自适应使用教师信号有效。

医学推理(表 2):呈现出不同的模式:标准 SFT 在某些模型上强于 pp-loss(如 LLaMA-3.1-8B 的 47.41 vs 38.60),表明当数据标签本身质量较高时,削弱所有低概率 token 的模仿可能反而不利。然而 Target-SFT 在所有四个模型上依然取得最高平均准确率,这得益于它只在 token 不确定时才调用教师残差分支,不会盲目削弱高质量标签。

消融实验(附录 E,表 6)进一步确认了教师信号强度 η\eta(在 0.2~1.0 间变动依然优于强 baseline)以及自适应残差权重(替代为常数值 cc 会导致下降)的有效性。此外,对知识蒸馏超参数 cc 的扫描显示其性能波动剧烈,表明常数混合权重缺乏灵活性。

实践建议

Target-SFT 的核心理念——直接设计 token 级目标分布 QtQ_t,并将对 observed token 的信任度与剩余概率分配解耦设计——可以直接应用于各类需进行监督微调的生成式模型任务中,尤其适合以下场景:

  1. 有教师模型可用的场景(如知识蒸馏、模仿学习):

    • 不要直接用固定权重混合 hard label 和 teacher 分布;而是根据学生模型对 observed token 的预测概率 pyp_y 动态分配 γt\gamma_t,让信任度自动适应 token 质量。
    • 对于 pyp_y 较小的 token(模型明显不确定或与教师差异大),增大教师分布 π~t\tilde{\pi}_t 的权重,提供纠正性的监督;对于 pyp_y 接近 1 的 token,自动退化为接近标准 one-hot 监督,减少对教师分布的依赖,避免过度平滑。
  2. 无教师模型但希望改进 SFT 的场景:

    • 至少可以借鉴 QQ-target 的视角,将概率加权 SFT(pp-loss)理解为隐式使用了 γt=py\gamma_t = p_y 和自匹配残差。
    • 进一步可以尝试用数据增强、beam search 或模型自身 top-k 候选构造一个有限的替代 token 集,形成 π~t\tilde{\pi}_t,使得在模型不确定时不是完全放弃监督(自匹配残差),而是将概率分配给这些有意义的替代 token,从而提供更丰富的学习信号。
  3. 实现细节与调参:

    • 实现上只需缓存一次教师 logits(可截断 top-64 节省内存),训练时动态计算 pyp_y 并加权组合两个交叉熵项。
    • 教师信号强度 η\eta 是一个温和的超参数,论文在 {0.2,0.5,1.0}\{0.2,0.5,1.0\} 之间均能稳定工作(表 6),建议从 0.5 附近开始搜索。
    • 该方法并不增加推理成本,仅改变训练时的目标分布。

对于将 LLM 用于量化交易信号生成、市场评论摘要等金融领域任务,同样可以套用 Target-SFT 思路:用领域专精的教师模型(或人工筛选的高质量响应)构建 π~t\tilde{\pi}_t,同时利用基模型在金融文本上的 logits 作为信任度依据,使模型既能学习专家知识,又不会盲目模仿有噪声的示例。

总体而言,QQ-target 框架为 SFT 设计提供了一种 “目标导向” 的思维:与其纠结损失函数的形式,不如先问——我们希望模型在每个 token 上最终学会什么分布。Target-SFT 给出的答案是一个自适应混合信任与教师指导的分布,而这个答案在实践中被证明是有效的。