解释能否在大型推理模型间泛化?

Do explanations generalize across large reasoning models?

arXiv: 2601.11517v1

论文信息

标题: Do explanations generalize across large reasoning models?

作者: Koyena Pal, David Bau, Chandan Singh

发布日期: 2026-01-16

arXiv ID: 2601.11517v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:本文研究大型推理模型(LRM)在解决问题时生成的思维链(CoT)解释是否具有跨模型泛化性,即一种模型产生的解释能否有效引导其他模型得出相同的答案。
  • 核心方法:作者通过四种 CoT 生成方式(空白、默认、迁移、集成)在不同 LRM 之间传递解释,并测量模型间回答一致性和准确率,同时结合人类偏好调查与强化学习后训练分析。
  • 关键结果:迁移与集成 CoT 能大幅提升模型间一致性,例如在 MedCalc‑Bench 上一致性从 25% 的基线上升至 66%(图 2),且一致性越高的解释在人类偏好评估中也越受欢迎。
  • 主要局限:当前度量未直接评估解释的真实性(faithfulness),且研究发现模型间一致性提升可能源于对错误答案的共同趋同,不一定反映解释的质量;跨模型一致性向人类泛化的能力目前仍依赖假设。
  • 适合读者:关注 LLM 可解释性、多模型协同、AI 科学发现以及思维链评估的研究者与工程师。

论文背景和研究动机

大型推理模型(LRM)在解题时会生成可读的思维链(CoT)文本,这被视为一种潜在的解释工具。然而,这些解释是否真正抓住了问题的通用模式,还是只反映了模型自身的特异性?在科学发现、教育等场景中,只有能跨越不同模型(甚至人类)传递正确推理的解释才有价值。已有工作多关注 CoT 是否忠实于模型内部决策,而本文从一个相关但不同的角度切入:解释的跨模型泛化性——当我们将一个模型的 CoT 提供给另一个模型时,后者能否得出相同的结论?

作者将泛化性操作化为 “同一段 CoT 文本在不同 LRM 上引发的答案是否一致”,并用该一致性指标来量化解释的效用。这种评估不需要人工标注,也避免了直接判断解释真伪的困难。尤其是当 LRM 在科学、数学等领域表现超越人类时,自动评估解释的跨模型泛化性能为发现新概念提供重要参照。

核心方法和技术细节

论文提出了四种 CoT 生成方式,并据此测量泛化性。

  1. 空白 CoT:思考标签内为空,模型直接给出答案,作为基线。
  2. 默认 CoT:模型自己生成 CoT,分为贪心解码和随机采样两种子形式。
  3. 迁移 CoT:将某个源模型(如 QwQ‑32B)生成的确定性 CoT 填入其他模型的思考标签,替换其自有推理。
  4. 集成 CoT(Ensembled CoT):设计一个生成器‑评估器循环。多个生成器模型基于当前上下文各自产生若干个候选句子(每句≤15 token),评估器模型选择其中困惑度最低的句子追加到集成思路中,然后更新上下文继续生成,直至遇到结束标记或达到最大长度。这种方法试图融合多模型观点,降低对单一模型特有模式的依赖。

评估时,作者用 prompt 将选定的 CoT 文本包裹在思考标签内,向目标 LRM 询问答案,并计算两个指标:

  • 准确率:模型最终答案与真实答案的匹配程度(MedCalc‑Bench 用精确匹配,Instruction Induction 用 BERTScore)。
  • 一致性:在相同 CoT 条件下,不同目标模型给出的答案是否两两一致。

为避免 CoT 中直接包含答案文本的影响,作者额外使用 o4‑mini 剥离解释中的答案声明(附录 A.2)。

实验使用了五款不同规模的 LRM(1.5B 至 32B),并在两个数据集上评估:MedCalc‑Bench(医学计算)和 Instruction Induction(从样例推断自然语言指令,且扩展了 12 个新任务以提升复杂性)。人类偏好研究则通过 Qualtrics 问卷对比四种模型‑CoT 组合在清晰度、易跟随性和置信度等维度的表现。

创新点和贡献

  1. 首次系统度量跨模型 CoT 泛化性。提出将一致性作为自动化评估解释泛化性的指标,为大模型时代的解释评估提供了新维度。
  2. 提出句子级集成解释策略。与传统的模型级集成不同,该策略在生成过程中逐句融合多模型的候选,生成的 CoT 比单纯迁移单个模型的 CoT 更能提升跨模型一致性。
  3. 揭示泛化性与人类偏好及 RL 训练的关系。实验表明,跨模型一致性越高的 CoT 在人类主观评分中也越受偏爱(图 5);并且经 GRPO 强化学习后训练,模型生成的 CoT 能显著提高其他模型对其答案的一致性(表 4),但迁移准确率不一定同步提升,说明一致性与准确率是可分离的属性。

实验结果分析

跨模型一致性与准确率

实验结果是论文的核心支撑。在 MedCalc‑Bench 数据集上,空白 CoT 的模型间一致性仅约 25%,而迁移 CoT(例如从 GPT‑OSS‑20B 迁移)可将一致性提升至 66%(图 2)。集成 CoT 整体优于默认及单个迁移 CoT,其中以 OSS 模型作为评估器时效果最佳。值得注意的是,即使 CoT 诱导出错误答案,模型间也可能收敛到同样的错误结论,表明 CoT 对模型行为具有强大的引导性(图 3)。

在准确率方面,迁移 CoT 不总能保持或提升目标模型原本的准确率,尤其当源模型自身较弱时,其 CoT 可能拉低强模型的性能(表 3)。例如,NRR‑1.5B 的 CoT 迁移后,其他模型的平均准确率反而从基线的 0.29 降至 0.23。准确率的提升需要源模型本身具备较强推理能力,OSS‑20B 和 DAPO‑32B 的迁移 CoT 表现最佳。

人类偏好与泛化性的关联

人类偏好研究(n=15,背景为计算机科学或医疗保健领域)显示,跨模型一致性较高的 CoT(如集成 QwQ+DAPO/OSS 和默认 DAPO CoT)在清晰度、易跟随性和置信度评分上显著优于一致性较低的组合(图 5)。相关性分析表明,一致性指标与用户评分的相关系数 r=0.49,高于准确率与用户评分的相关系数 r=0.45,意味着 “解释能否让不同模型达成一致” 比 “解释所导向的答案是否正确” 更能反映人类对解释质量的感受。

强化学习对一致性的影响

论文对两个基模型(DeepSeek‑R1‑Distill‑Qwen‑1.5B 和 Llama‑3.2‑3B‑Instruct)进行 GRPO 后训练,发现训练后两者迁移 CoT 的平均一致性均大幅上升(例如 DeepSeek‑based 模型从 0.11 升至 0.39,Llama‑based 从 0.25 升至 0.46,表 4)。但 DeepSeek 模型的平均迁移准确率没有同步增长,而 Llama 则表现出一致性与准确率同步提升。这暗示 RL 训练可以单独促进解释的跨模型通用性,而不一定依赖准确率的改善,为未来训练更通用解释提供了优化方向。

实践建议

基于论文提供的经验证据,可以提炼出以下几条工程实践建议:

  1. 在多模型协作或对抗性评估中,优先采纳跨模型一致性高的解释作为中间输出。相比仅依赖单一模型的 CoT,利用一致性来衡量解释的 “说服力” 可以过滤掉那些只对特定模型有效却对其它模型无效的推理片段。
  2. 集成 CoT 策略可作为一种低成本提升推理一致性的方案。在模型资源允许时,用多个模型作为生成器、另一个模型作评估器逐句遴选,最终形成的 CoT 比单模型 CoT 更能统一不同 LRM 的预测。实践时应注意生成器和评估器的组合:论文结果指出,以 OSS‑20B 作为评估器的集成效果最佳,而以 OSS‑20B 作为生成器则效果平平(图 2),具体组合需预先在小样本上验证。
  3. 在强化学习微调阶段,可以将跨模型一致性作为辅助奖励信号。如实验所示,RL 后训练可以大幅提升一致性而不一定与准确率同步,因此可在准确率之外单独优化一致性,从而生成对下游 LRM 更 “可理解” 的推理链,这对提升 AI 系统解释向人类转移的潜力具有间接意义。
  4. 在解释质量的人工评估中,引入一致性作为预筛选指标。研究显示,一致性高的 CoT 更容易获得人类好的主观评价,因此可以在大规模人评前先通过计算跨几个模型的答案一致性来粗筛候选解释,降低人工评测成本。

需要注意的是,这些建议适用的前提是模型间不存在共同的偏见或系统性错误模式。若多模型均被同样的问题误导,一致性强不等于解释价值高,实践中仍需结合真实性验证(如标注或事实核查)。