DiffusionGemma 有多透明?

arXiv: 2606.20560v1

论文信息

标题: How Transparent is DiffusionGemma?

作者: Joshua Engels, Callum McDougall, Bilal Chughtai, et al.

发布日期: 2026-06-18

arXiv ID: 2606.20560v1

PDF 链接: 下载 PDF

研究背景与动机

随着大语言模型在复杂推理任务中的应用日益广泛,理解模型内部决策过程的需求变得愈发紧迫。当前的前沿模型大多采用自回归架构,通过 “思维链”(Chain of Thought, CoT)以自然语言逐步生成推理步骤。这种链式思维使人类能够观察模型为何得出某个答案,从而对错误、奖励攻击或提示注入等异常行为进行监控和干预。例如,安全监控器借助思维链能显著提升对有害输出的检测能力,且思维链的透明度已被视为决定强大 AI 系统能否安全部署的关键因素之一。

然而,DiffusionGemma 作为一款新发布的文本扩散模型,彻底改变了推理的生成范式。它不是在每个时间步只生成一个词元,而是通过反复对一整个 “画布” 进行去噪,迭代地精炼所有位置的词元。在每一步之间,模型中流动的信息包含了一个可读的词元序列以及一个高维的自条件矩阵(self-conditioning matrix)。这个矩阵由密集的连续向量构成,默认情况下不可被人类直接理解。这引发了一个根本性的担忧:扩散模型的推理过程是否比自回归模型更不透明? 论文《How Transparent is DiffusionGemma?》正是为了系统地回答这一问题而展开。

核心方法:拆解透明度

为了量化透明度,作者将其分解为两个维度:

  • 变量透明度:我们能否理解模型计算的中间快照?对于扩散模型而言,关键在于去噪步骤间的 “瓶颈”——即当前画布词元 ot\mathbf{o}^t 和自条件矩阵 St\mathbf{S}^t——是否可解释。
  • 算法透明度:即便我们能看到这些中间状态,是否足以重建模型生成最终输出的完整推理过程?这需要考虑扩散模型特有的并行更新能力,它可能在多次去噪中实现极为复杂且非链式的推理。

度量变量透明度的核心工具是不透明串行深度(opaque serial depth)。该指标衡量在模型计算图中,从输入到输出中间不经过任何可解释节点(如自然语言词元)的最长连续串行计算路径。对于 DiffusionGemma,串行深度的关键在于 TT 次去噪循环:如果不假设中间瓶颈可解释,那么最长路径将贯穿所有 TT 步,其理论值与 TT 成正比;若假设瓶颈处的 CC 个词元及其自条件向量均能被解释,则最长路径只会经过一次去噪循环,与标准的自回归 Transformer 相近。

论文对 Gemma 4 26B A4B 和 DiffusionGemma 在 256k 上下文长度下进行了实证与渐近分析。当瓶颈不可解释时,DiffusionGemma 的不透明串行深度上界为 608,016608,016,是同规模 Gemma 模型的 28.6 倍(自适应停止时实际步数常在 12~16,约为最坏情况的 1/3)。而一旦瓶颈被视为可解释,该上界骤降至 23,57123,571,仅为其 1.1 倍。这意味着,扩散模型能否保持与自回归模型相当的透明度,完全取决于能否将高维自条件矩阵转化为人类可读的词元。

让中间瓶颈变得可解释

自条件矩阵 St\mathbf{S}^t 的计算方式提供了一条诱人的捷径:

St=softmax(^t)WE\mathbf{S}^t = \mathrm{softmax}(\hat{\boldsymbol{\ell}}^t) \cdot \mathbf{W}_E

其中 ^t\hat{\boldsymbol{\ell}}^t 是缩放后的 logits,WE\mathbf{W}_E 是词嵌入矩阵。本质上,该矩阵是模型对每个位置所有可能词元的概率加权嵌入。作者由此提出一种干预:在每一步,仅保留 St\mathbf{S}^t 中概率最高的 kk 个词元(或概率大于阈值 pp 的词元)的信息,将其余 logits 压制为均一分布。实验显示,k=8k = 8p=0.03p = 0.03 的限制在 Natural2Code、LiveCodeBench、GPQA 等多个能力基准测试中几乎不损失性能。这就将一个连续的瓶颈压缩成了仅有 O(C)O(C) 个词元的信息流,使得中间状态的理论可解释性大幅提高。

那么这些被保留的词元真的对人类有意义吗?论文对 WildChat 的 800 条提示进行了大规模分析,将每个去噪步骤中满足 p>0.03p>0.03 的词元分为五类:与当前位置的最终词元完全一致、与相邻位置的最终词元一致、与最终词元语义相似(余弦相似度前 50)、与相邻词元语义相似,以及其他。即使在第一个去噪步骤,超过 85% 的词元都落入前四类;随着去噪进行,绝大多数词元本身就是最终答案的直接猜测或近邻。这表明扩散模型在推理过程中主要是在逐步确认和定位词元,而非在潜空间中进行不可告人的暗中操作。尽管 top‑k 取 8 时会出现一些低概率的 “噪声” 词元,但使用概率阈值过滤后,可解释词元的比例极高,从而为整体透明度奠定了坚实基础。

监控性评估:不亚于自回归模型

透明度的一大落地场景是监控性(monitorability),即外部监控器能否从模型输出中提取关键信息以判断行为是否安全。研究者采用一套开源的监控性基准,涵盖干预型、过程型和结果型评估。在那些对干预敏感的题目上(如带提示的 AIME 数学题、GPQA 科学题等),DiffusionGemma 与 Gemma 4 的表现差距微小,监控器的 G‑mean 分数处于同一水平。值得注意的是,DiffusionGemma 的思维链通常更短,而已知更长的思维链往往更易监控,因此这一结果的发现实际上暗示扩散模型在信息传递上可能更 “凝练”。由于这些评估跨越多个画布(即输出较长时会多次重置画布),推理在画布之间仍然是自回归的,因此该对比较为公平。不过,单画布场景下的监控性仍有待专门检验。

算法透明度:扩散模型独有的推理现象

即使中间状态可被逐个词元地理解,扩散模型颠覆性的生成方式依然产生了若干自回归模型无法复现的推理模式。论文通过一套可视化工具(Summary View、Line Graph、Sampling Table)对这些独特现象进行了案例剖析:

  • 非时间顺序推理

    • 早期长度预测:在回答 “用两句话解释光合作用” 时,模型在第一次去噪后就在第 60 位附近以近乎 100% 的概率预测了填充词元,且实际输出最终落在 50 个词元,表明模型在决定具体内容前已大致锁定了回答长度。
    • 回溯自我纠正:当被要求先给答案再给推理时,模型会在中间步骤写出错误答案(如 9),待后续推理完成后再回头修正为 8,实现类似 “先写推理再改答案” 的逆向信息流。
    • 非自回归代码生成:编写函数时,模型往往先搭建函数签名和主体逻辑,再回头填充变量名、注释等出现在代码前面的细节,呈现出 “骨架优先” 的模式。
  • 词元与序列涂抹

    • 词元涂抹:模型尚未确定某个词元的最终位置时,会将其概率质量同时分配到相邻的多个位置上(例如换行符、关键词 “bracket”)。
    • 序列涂抹:更极端的情况下,模型会同时维持两个语义不同的候选序列(如个位数答案与两位数答案),每个序列的后缀词元各占据一定概率,直到模型下定决心,这种 “并行思考” 现象类似于隐式束搜索。
  • 中间上下文推理 面对需要加工中间结果的任务(如计算类斐波那契数列时需把数字 3 替换为 “Gold”),模型会先生成数字 3 作为计算后续项的占位符,待后端就绪后再将其替换为 “Gold”。该数字 3 从未出现在最终输出中,但却是因果推理链上不可或缺的一环。

这些现象揭示:即便我们能读懂每一步的 top‑k 词元,要完整拼凑出模型利用这些中间信息的方式仍需要额外的分析工作。扩散模型的 “多次改写” 特性赋予了它们独特的灵活性,但也可能让监控器面临更复杂的推理路径。

实践启示与未来方向

论文为评估未来潜在推理模型提供了可直接复用的框架,并明确指出了应用落地的可行路径:

  1. 透明性审计:模型发布时,应例行计算不透明串行深度,并尝试通过 top‑k 投影等方法评估瓶颈可解释性。当前 DiffusionGemma 的良好结果有赖于其特定的自条件投影设计,若未来模型取消该投影或强化结果导向的强化学习,潜空间极可能迅速退化。

  2. 加强中间状态监控:虽然最终输出已承载大部分信息,但如中间上下文推理所示,某些安全关键的信息可能只短暂出现在去噪步骤的中间词元中。将监控器扩展为输入多步 top 词元序列,有望捕捉隐藏的推理捷径或欺骗行为。

  3. 开发新型可解释技术:当简单的 Logit Lens 不再足够时,自然语言自编码器(NLA)、激活神谕(Activation Oracle)等将潜向量直接翻译为自然语言的工具将变得至关重要,这些技术值得社区优先投入。

  4. 深入机制研究:扩散模型中的双向注意力、重复去噪等架构元素,为电路分析、激活补丁等经典可解释性方法提供了新场景。例如,可以研究 “涂抹” 现象背后的电路,或早期步骤与后期步骤的分工差异。

  5. 模型有机体研究:鉴于 DiffusionGemma 的非自回归特性,可有意识地微调出在潜空间中进行策略性推理但隐藏于最终输出的 “不透明” 模型,以此测试更高级别的监控失效情形。

总结

《How Transparent is DiffusionGemma?》通过严谨的实证分析,得出了一个令人审慎乐观的结论:在现有训练范式和架构下,DiffusionGemma 的透明度并不逊色于对应规模的自回归模型。借助简单的 logit 限制,其不透明串行深度可被降至同等水平,且大多数中间状态是对最终答案的直接映射,监控性表现相似。然而,论文更重要的贡献在于建立了一套 “透明度审计” 的通用方法论——从串行深度计算、瓶颈可解释性验证,到算法行为的可视化分析——为评估未来任何潜空间推理模型提供了可操作的起点。作者反复提醒,当前的乐观结论高度依赖于模型的设计选择,当社区向更深度的潜空间推理演进时,我们必须持续用这些工具衡量透明度的变化,并积极推动将潜表征翻译为自然语言的新技术,才能确保先进 AI 系统的推理始终处于人类可监控的安全边界之内。