通过目标分布设计实现监督微调的统一视角
A Unifying Lens on Supervised Fine-Tuning Through Target Distribution Design
论文信息
标题: A Unifying Lens on Supervised Fine-Tuning Through Target Distribution Design
作者: Tong Xie, Yuanhao Ban, Yunqi Hong, et al.
发布日期: 2026-06-09
arXiv ID: 2606.11189v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:监督微调(SFT)通常强迫模型逐 token 严格拟合 observed token,忽略了该 token 可能非唯一、含噪声或因与模型先验不匹配而并非理想目标,这种僵硬的 one-hot 监督会损害泛化能力。
- 核心方法:提出 -target 框架,将 SFT 的目标分布显式分解为 (对观测 token 的信任强度)和 (剩余概率分配给替代 token 的方式),并基于此设计 Target-SFT,用模型自身概率作为信任代理、用教师模型引导的剩余分布来提供更灵活的监督。
- 关键结果:在覆盖数学推理与医学推理的 10 个数据集–模型组合上,Target-SFT 的 Average@16 准确率全部优于标准 SFT、概率加权 SFT 以及知识蒸馏(见论文表 1、表 2),例如在 Qwen2.5-Math-1.5B + NuminaMath-CoT 上达到 38.05%,而标准 SFT 仅为 16.72%。
- 主要局限:方法依赖教师模型,且需要调节教师信号强度 等超参数;论文主要在数学和医学推理任务上验证,是否在其他自然语言任务上同样有效尚待检验。
- 适合读者:从事大语言模型微调、知识蒸馏、强化学习与模型对齐的工程师与研究人员,尤其关心如何设计更聪明 SFT 目标的读者。
论文背景和研究动机
监督微调(SFT)是大型语言模型后训练的核心阶段,但标准做法——在每个 token 位置最大化 observed token 的概率,本质上是将整个概率质量集中在 one-hot 目标 上。这种隐性假设每个 observed token 都是唯一且绝对正确的目标,在真实数据中往往不成立:同一个 prompt 可以有多种正确的推理路径、措辞、中间步骤或风格选择,而模型从预训练中已积累丰富的先验知识。强制模仿每一个 token 不仅可能放大噪声,还会导致过度自信、干扰预训练先验,以及降低泛化能力。
许多现有工作试图修复这一缺陷,例如通过 token 级重要性加权降低不可靠 token 的损失贡献,或引入正则项限制模型对参考分布的偏离。然而,这些方法通常被描述为各自孤立的算法选择,缺乏一个统一的视角来理解它们之间的内在联系,也难以指导构造更好的 SFT 目标。
本文提出的核心洞见是:SFT 的关键不在于损失函数的代数形式,而在于损失所驱动的隐式目标分布。比起在损失层面折腾,直接设计一个理想的目标分布 才是更根本的做法。这一视角使得我们能够显式控制监督信号:如果 observed token 高度可信, 接近 one-hot;如果它不可靠或与模型先验冲突,则应该软化监督,将概率分配给合理的替代 token。围绕这一思想,论文引入了 -target 框架,并基于该框架构造了 Target-SFT 方法。
核心方法和技术细节
-target 框架:从损失到目标分布
给定前缀 ,标准 SFT 最小化 ,等价于用 one-hot 目标 与模型分布做交叉熵。-target 框架的核心是引入一个更灵活的 token 级目标分布:
其中 表示对 observed token 的期望信任度, 是一个定义在词表上的概率分布,用来分配剩余的 概率质量。论文用一个潜在二值变量 建模 “是否应该严格信任 ”,再通过 Beta-Bernoulli 共轭推导出 可以理解为后验期望,而 就是当不信任 时应遵循的替代分布。
将 作为交叉熵目标,损失直接分解为(见论文命题 1):
由此,SFT 的监督被清晰地拆解为两个可设计的分量:① 以多强的力度模仿 observed token();② 如何把剩余的概率分配给替代 token()。
统一现有 SFT 变体
论文通过引入 “任意可微损失都可以提取出其隐含的目标分布 ”(第 5.2 节)这一工具,展示了许多现有 SFT 变体不过是隐式选定了 :
- Token 加权方法(如 DFT、Beyond-log、ProFiT 等)通过一个可脱钩的权重 缩放负对数似然,隐式地对应 和 (即剩余概率只分配给当前模型输出,不产生梯度)。它们只回答了问题①,而问题②则简单退化。
- 分布级变量方法(如 label smoothing、KL 正则、知识蒸馏等)通常形式为 ,可解读为 且 ,回答了问题②,但问题①的 由固定超参数决定,缺乏自适应性。
这种统一视角揭示了现有方法的互补性,也为新的 SFT 设计指明了方向:同时设计 和 ,且让 与 token 的不确定性自适应关联。
Target-SFT:自适应信任 + 教师引导的剩余分布
论文基于 -target 框架提出了具体实现 Target-SFT,对应式 (7) 与 (8):
- 对 的选择:用模型当前对该 observed token 的概率 直接作为信任度 。 可视为预训练积累的证据的代理, 越高,越接近 one-hot 监督; 越低,越倾向于从替代分布获取监督。这个选择与已有的 -loss 方法相一致,但从 -target 角度暴露了该类方法对剩余分支的处理不足。
- 对 的构建(教师引导):在 很小时,单纯用当前模型分布作为 不会给出任何纠正信号。Target-SFT 通过一个 KL-正则化的奖励塑形导出教师引导的剩余分布: 其中 是教师模型(如 instruction-tuned 版本)的概率分布。参数 控制教师信号的强度:当 时退化为自匹配残差,当 时完全依赖教师。当模型对 observed token 信任度低时,剩余的 权重会加大对 的匹配,从而在模型不确定或缺乏知识时引入教师提供的纠正信号。
将两者结合得到自适应目标:
对应的 token 级损失即为两部分交叉熵的加权和(见式 (8)),实现起来简洁高效。
创新点和贡献
- 从损失到目标的视角转换。论文首次明确指出 SFT 损失只是优化代理,真正的设计空间在于损失所隐含的目标分布 ,由此可以通过直接设计 来更精确地控制监督行为。
- 统一框架。-target 框架将大量分布式的 SFT 变体(token 加权、分布约束、知识蒸馏等)统一为对 的显式或隐式选择,揭示了它们在设计上的互补关系,为组合和创新提供了理论指导。
- Target-SFT 方法。同时优化信任强度与剩余分配,利用模型自身概率自适应调节模仿力度,并用教师模型在需要时提供高质量替代监督,在多个推理基准上展现出相对于多种基线的稳健优势。
- 实证验证。在涵盖 7 种模型、3 个训练数据集、10 个具体数据-模型设定的实验中,Target-SFT 的 Average@16 准确率在所有条件下均为最高,说明框架驱动的设计在实践中确实有效。
实验结果分析
实验分为数学推理(NuminaMath-CoT、OpenR1-15k)和医学推理(m23k)两大类,评价指标是 Average@16 准确率。主结果见表 1 和表 2。
数学推理(表 1):标准 SFT 在小模型或特定数据上甚至可能弱于 base model(如 Qwen3-1.7B 在 NuminaMath 上从 14.26 降至 12.99),验证了强制 one-hot 匹配的弊端。概率加权 SFT(-loss)虽然通过 改善了性能,但仍留下剩余分支未设计的缺口——Target-SFT 在所有模型和数据集上都稳定超越 -loss。例如 Qwen2.5-Math-1.5B 在 OpenR1 上,-loss 为 39.00,而 Target-SFT 达 41.24。纯知识蒸馏(固定 soft 目标)在此表现较不稳定,且远逊于 Target-SFT,说明直接全盘替换目标也不如自适应使用教师信号有效。
医学推理(表 2):呈现出不同的模式:标准 SFT 在某些模型上强于 -loss(如 LLaMA-3.1-8B 的 47.41 vs 38.60),表明当数据标签本身质量较高时,削弱所有低概率 token 的模仿可能反而不利。然而 Target-SFT 在所有四个模型上依然取得最高平均准确率,这得益于它只在 token 不确定时才调用教师残差分支,不会盲目削弱高质量标签。
消融实验(附录 E,表 6)进一步确认了教师信号强度 (在 0.2~1.0 间变动依然优于强 baseline)以及自适应残差权重(替代为常数值 会导致下降)的有效性。此外,对知识蒸馏超参数 的扫描显示其性能波动剧烈,表明常数混合权重缺乏灵活性。
实践建议
Target-SFT 的核心理念——直接设计 token 级目标分布 ,并将对 observed token 的信任度与剩余概率分配解耦设计——可以直接应用于各类需进行监督微调的生成式模型任务中,尤其适合以下场景:
-
有教师模型可用的场景(如知识蒸馏、模仿学习):
- 不要直接用固定权重混合 hard label 和 teacher 分布;而是根据学生模型对 observed token 的预测概率 动态分配 ,让信任度自动适应 token 质量。
- 对于 较小的 token(模型明显不确定或与教师差异大),增大教师分布 的权重,提供纠正性的监督;对于 接近 1 的 token,自动退化为接近标准 one-hot 监督,减少对教师分布的依赖,避免过度平滑。
-
无教师模型但希望改进 SFT 的场景:
- 至少可以借鉴 -target 的视角,将概率加权 SFT(-loss)理解为隐式使用了 和自匹配残差。
- 进一步可以尝试用数据增强、beam search 或模型自身 top-k 候选构造一个有限的替代 token 集,形成 ,使得在模型不确定时不是完全放弃监督(自匹配残差),而是将概率分配给这些有意义的替代 token,从而提供更丰富的学习信号。
-
实现细节与调参:
- 实现上只需缓存一次教师 logits(可截断 top-64 节省内存),训练时动态计算 并加权组合两个交叉熵项。
- 教师信号强度 是一个温和的超参数,论文在 之间均能稳定工作(表 6),建议从 0.5 附近开始搜索。
- 该方法并不增加推理成本,仅改变训练时的目标分布。
对于将 LLM 用于量化交易信号生成、市场评论摘要等金融领域任务,同样可以套用 Target-SFT 思路:用领域专精的教师模型(或人工筛选的高质量响应)构建 ,同时利用基模型在金融文本上的 logits 作为信任度依据,使模型既能学习专家知识,又不会盲目模仿有噪声的示例。
总体而言,-target 框架为 SFT 设计提供了一种 “目标导向” 的思维:与其纠结损失函数的形式,不如先问——我们希望模型在每个 token 上最终学会什么分布。Target-SFT 给出的答案是一个自适应混合信任与教师指导的分布,而这个答案在实践中被证明是有效的。