可读性并不等于可解释性:比较思维链推理中判断的重要性和实际重要性

Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning

arXiv: 2609.04194v1

论文信息

标题: Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning

作者: Kevin Du, Alexander Hoyle, Laura Ruis, et al.

发布日期: 2026-09-03

arXiv ID: 2609.04194v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要回答,链式思维(CoT)推理步骤的文本是否真正编码了该步骤对最终答案的实际功能重要性,即 “可读” 是否等于 “可解释”。
  • 核心方法:将步骤重要性定义为强化学习中的优势函数,用蒙特卡洛 rollout 估计每一步前后的期望奖励变化,再用变点检测识别关键步骤,并让评判模型仅从文本预测这些标签。
  • 关键结果:在 Qwen3-1.7B 非思维模式下生成的数学推理数据上,微调 critic 对错误回答的关键步骤识别 PR-AUC 可达 0.28–0.30(ID),约为噪声上限的一半;但对正确回答仅为 0.065–0.10,远低于噪声上限 0.51–0.64(见论文第 6 节、图 6)。
  • 主要局限:实验主要基于数学推理基准和 Qwen3 系列模型;金标签本身来自蒙特卡洛估计,受噪声上限约束;对渐变爬升型轨迹,变点方法可能把逐步变化错误归因到单步。
  • 适合读者:研究 LLM 推理可解释性、CoT 忠实性、过程奖励模型或 LLM-as-judge 的工程师与研究者,尤其关注步骤级文本监督是否可靠的人。

论文背景和研究动机

CoT 被视为提升模型数学推理能力的关键测试时计算方式,其推理痕迹看起来 “可读”。研究者和工程系统越来越多地用 LLM 评判器诊断错误、评估忠实性,或通过过程奖励模型、生成式 critic 提供步骤级监督。但论文指出:这些做法默认推理步骤的文本携带了关于其功能角色的信息,而这一假设本身缺乏验证。

作者用一个竞争性几何题中的两个 “自我检查” 步骤作为例子:从文本看两者几乎相同,但蒙特卡洛估计显示,一个步骤没有改变模型达到正确答案的概率,另一个步骤则把概率从约 52% 提升到约 94%(见论文第 1 节、图 1)。这引出一个核心问题:什么样的度量适合刻画 CoT 步骤重要性,以及这种重要性能否仅从文本中解码出来。

相关工作多从扰动测试判断整个响应是否忠实,例如在提示中插入提示词,观察模型是否跟随而不提及。这类方法通常是响应级别、二元的,并且需要不自然的干预。本文希望提供一种不修改提示、可定位到具体步骤的重要性度量,以补充扰动式忠实性测试。

核心方法和技术细节

论文把 CoT 生成形式化为顺序决策过程。设状态 sts_t 是问题 xx 与前 t−1t-1 个推理步骤的拼接。给定策略 π\pi,价值函数 Vπ(s)V^\pi(s) 表示从状态 ss 继续采样后获得奖励的期望;Qπ(s,a)Q^\pi(s,a) 表示先提交特定步骤 aa、再继续采样的期望奖励。优势函数定义为:

Aπ(s,a)=Qπ(s,a)−Vπ(s).A^\pi(s,a)=Q^\pi(s,a)-V^\pi(s).

它度量 “加入这一步” 相对于 “从当前状态随机继续” 所带来的期望奖励变化。论文考虑两种奖励:一是最终答案是否正确,称为 correctness-based advantage;二是最终答案是否与原轨迹答案一致,称为 self-advantage。除非特别说明,主实验使用 self-advantage。

由于价值函数不可直接获得,论文用蒙特卡洛 rollout 估计。对每个前缀采样 N=50N=50 个补全,统计达到奖励的比率得到 V^(st)\hat V(s_t);对追加该步骤后的前缀同样估计 Q^(st,at)\hat Q(s_t,a_t);优势估计为两者之差。为了在不牺牲统计功效的情况下识别真正重要的步骤,论文没有对每一步做独立假设检验,而是把整个响应的价值序列视为分段常数序列,用 PELT 变点检测算法找到水平变化点,再用 Beta 后验判断跳跃是否超过效应量阈值 δ=0.1\delta=0.1,并要求变化可定位到单个步骤。这样标记出的步骤称为 consequential step;没有任何这种步骤的响应称为 uninformative response(见论文第 3、4 节和附录 A)。

随后,论文评估 “文本解码能力”:让开箱即用的 LLM 评判器和微调 critic 只看问题、金标、完整响应和目标步骤的文本,预测步骤优势。评测采用 PR-AUC 和 precision@k% 等检索指标,并用 split-half 噪声上限作为可达上界。金标签本身基于蒙特卡洛估计,因此即使完美预测真实优势也不可能达到 1.0。

创新点和贡献

本文的主要贡献首先是把 RL 中的 advantage 引入 CoT 步骤重要性度量。与反事实必要性或 KL 散度相比,advantage 直接面向目标结果,能区分步骤是 “锁定答案”“纠正错误” 还是 “没有新增信息”。作者指出,零优势不等于逻辑上不必要,而是在该策略下没有新增预测价值;这对识别无信息推理是有用的(见论文第 8 节)。

其次,论文提出了基于变点检测的关键步骤标注流程,并校准到较低的误报率。该方法不需要提示修改,能补充 cue-based 忠实性测试。论文还展示了 advantage 作为解释工具的价值:可以分析哪些语义类别的步骤更常关键、模型在推理轨迹中何时锁定答案、以及不同数据集难度下步骤重要性分布。

最重要的一项发现是文本可解码性存在明显不对称:微调 critic 在错误回答上相对有效,但在正确回答上恢复出的信号很少。这直接挑战了 “步骤文本可读即可被可靠评判” 的假设(见论文第 6 节、图 6、图 7)。

实验结果分析

论文在六个数学推理基准上生成数据:AIME 24、AIME 25、AIME 26、AMC 23、MATH500 和 GSM8K。每个提示生成 10 条响应,使用 Qwen3-1.7B/4B/8B 的 thinking-mode off 设置为主,另在部分数据集上分析 Qwen3-1.7B thinking-mode on。

语义类别方面,在正确回答中,uncertainty management 和 self-checking 类步骤最常成为关键步骤;在错误回答中,final answer emission 最常关键。思维模式下,active computation 和 uncertainty management 在正确回答中更突出(见论文第 5 节、图 2)。

轨迹模式分析显示,模型规模和思维模式带来的性能提升主要来自 “从头到尾都高置信” 的响应比例增加:thinking mode 下 high throughout 从 24% 升到 61%,模型规模增加时从 25% 升到 39%;减少的主要是 never high 响应。也就是说,在这组实验中,性能提升更多来自推理开始前已有强先验,而不是在轨迹中途恢复(见论文第 5 节、图 3a)。对错误回答,思维模型更常通过 gradual climb 到达错误答案,占比 59%,而 sudden climb 为 24%;非思维模型更常 sudden climb,占比 48%–56%(见论文第 5 节、图 3b)。

在数据集难度上,较简单且训练中更常见的 GSM8K、MATH500 中关键步骤比例较低,而 AIME 类困难题目几乎总包含至少一个关键步骤(见论文第 5 节、图 4)。作者认为这与 “简单题推理不提供额外价值” 一致,但属于实验观察层面的解读。

在 cue-based 忠实性实验中,自然提示下有 58% 的响应包含关键步骤,加入提示词后降至 15%;步骤层面的关键比例也从 5.0% 降至 1.4%(见论文第 5 节、图 5)。这显示 cue 可能使推理过程趋向确定化。

解码实验是全文重点。开箱即用 LLM 评判器即使随规模提升可以超过 prevalence 基线,但最佳评判器 Qwen3.6-27B 仍比 ID 噪声上限约低 9 倍、比 OOD 上限约低 6 倍(见论文第 6 节)。微调 critic 在错误回答上表现明显更好:ID 上 PR-AUC 0.28–0.30,OOD 上 0.18–0.32,约为随机基线的 10–15 倍,接近保守噪声上限约一半;但在正确回答上 PR-AUC 只达到 0.065–0.10,仅为噪声上限的约 10%–20%。precision@0.5% 也呈现同样不对称:错误回答上最高 0.55–0.72,接近噪声上限;正确回答上只有 0.08–0.29(见论文第 6 节、图 6、图 7)。作者推测,错误回答中的表现可能部分来自 final answer emission 等易识别代理特征,而正确回答中的关键步骤更像真正的 “aha moment”,文本信号更难解码。

实践建议

对构建过程奖励模型或步骤级 critic 的团队,本文给出几点直接启示。首先,不要假设 CoT 步骤文本本身足够承载重要性信息。在本实验设置下,即使使用可表达性很强的 LLM 探针,正确回答中的关键步骤仍难以从文本恢复。如果应用场景依赖识别 “正确推理中的关键步骤”,仅靠文本监督可能不够,需要结合 rollout、奖励信号或其他非文本特征。

其次,错误回答的步骤识别相对可靠。若用于失败分析、错误归因或审计,微调 critic 在较小审查预算下可以优先定位错误回答中的关键步骤;但对正确回答应降低自动定位的置信度预期。

第三,训练目标选择很重要。附录 B.3 的消融显示,对 correctness-based advantage,直接回归 advantage 的 WMSE 目标表现很差,而先预测价值函数再差分更有优势;在 self-advantage 上 value BCE 和直接 advantage 回归差异不大。若批评模型需要覆盖正确性信号,建议优先考虑价值函数预测目标。

第四,开箱即用评判器的提示设计影响很大。附录 B.2 显示,value-derived 评判在多个尺度接近随机,而 direct-importance 提示才随规模获得提升。若必须使用 LLM-as-judge 做步骤重要性判断,应采用直接评分方式,并对其分数保持校准认知。

最后,advantage 和蒙特卡洛 rollout 可以作为一种可解释性审计工具,与扰动式忠实性测试互补。它不需要修改提示,能发现哪些响应是 uninformative、哪些步骤真正改变了模型的输出路径。在部署监控或模型评估中,这一工具更适合用于相对比较和发现异常模式,而不是替代人工对推理文本的实质阅读。