多模态模型差异分析:特征发现与控制
Multimodal Model Diffing for Feature Discovery and Control
论文信息
标题: Multimodal Model Diffing for Feature Discovery and Control
作者: Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, et al.
发布日期: 2026-08-10
arXiv ID: 2608.09928v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:多模态大语言模型(MLLMs)虽然表现出色,但其内部特征如何驱动视觉理解、空间推理等行为难以识别和控制。论文要解决的是:如何找到那些真正由多模态训练引入的特征,并用它们来精准干预模型行为。
-
核心方法:提出 MMDiff 框架,通过比较语言模型基座和多模态适配版本之间的稀疏自编码器(SAE)字典,识别出在多模态训练中发生旋转和视觉响应的特征,再通过对比激活分析找到任务相关子集,用于因果消融和激活引导。
-
关键结果:在空间推理任务上,移除 MMDiff 发现的稀疏特征可平均降低 12% 的准确率,而对视觉问答(VQA)几乎无影响;而引导这些特征则使空间准确率平均提升 3.6%(见论文表 1 和表 3)。
-
主要局限:安全性和 OCR 实验仅在 PaliGemma 2 模型上完成;MMDiff-CAA 引导方法需要指令微调的参考模型来提取方向;少量安全特征消融时会导致生成崩溃而非拒绝响应。
-
适合读者:对多模态模型内部机理、稀疏自编码器应用、模型行为审计和安全控制感兴趣的研究者和工程师。
论文背景和研究动机
多模态大语言模型将语言模型的文本能力拓展到了视觉问答、图像描述、光学字符识别(OCR)等任务。然而,这些模型内部究竟哪些特征支撑了特定的视觉行为,一直缺乏清晰的理解工具。传统的稀疏自编码器(SAE)虽然能将隐藏状态分解为可解释的特征方向,但它们通常直接在 MLLM 激活上训练,混合了从语言基座继承的特征和多模态训练引入的新特征,无法区分哪些方向真正由视觉适应所塑造。
模型差分是一种通过比较不同训练阶段模型内部表征来追踪特征变化的技术。论文观察到,在多模态适配过程中,部分 SAE 特征的方向发生了明显的几何旋转,同时其对视觉输入的响应也显著增强——这些 “被改变” 的特征,恰好构成了区别于通用语言特征的多模态特有信号。基于此,论文试图建立一套完整的从特征发现到行为控制的机制,既能审计模型的内部运作,也能提供精准的干预接口。
核心方法和技术细节
MMDiff 框架包含三个递进的阶段。
第一阶段:训练多模态 SAE。 从一个已训练好的基座语言模型 SAE 字典出发,在多模态模型激活上进行微调。关键在于使用 “纯文本掩码” 训练变体,即只在文本令牌上计算重建损失。这样做的理由是:文本令牌的激活会通过注意力机制捕获视觉上下文,但其表示空间仍最接近原始语言字典的分布,从而保证了跨阶段特征对应的稳定性。实验显示,纯文本训练的 SAE 在 FVU 和与基座字典的余弦相似度上都优于完整序列或仅图像训练变体(见论文附 C.3 和 C.4)。
第二阶段:识别被适配的特征。 对每个特征,计算两个信号:一是基座 SAE 和 MLLM SAE 之间解码器方向的余弦相似度 ,低相似度表示该特征的方向发生了显著旋转;二是视觉能量 ,衡量其对视觉输入的响应强度。论文将同时满足 和 处于底部 25% 分位数的特征定义为 “被适配集合”(约占总特征数的 5%~20%,依模型而异)。这两个条件分别回答了 “特征是否对图像有反应” 和 “特征是否被多模态训练重塑”。
第三阶段:发现任务特定特征。 在被适配集合内,通过逐令牌的对比激活分析来筛选任务相关特征。具体做法是:定义一个分布频移得分,计算特征在目标分布(如空间推理提示)和基线分布(通用 VQA)上的激活频率差距及其费希尔精确检验得到的几率比。保留几率比 且频率差 的特征作为候选。关键一步是词汇不变性过滤——将原始任务提示替换为中性描述(如把 “左边的物体是什么” 换成 “描述场景的布局”),只有在新提示下仍激活的特征才被保留。这确保特征真正捕捉了视觉内容的语义而非提示中的关键词。最终,被适配、经过分布频移筛选、通过词汇过滤的特征,构成了可进行因果干预的任务特定集合。
因果干预方法。 论文使用两种干预范式:一是因果消融,通过在所有层的文本令牌上正交投影掉特征方向来移除该特征的影响;二是 MMDiff-CAA 引导,它结合了多层对比激活差异方向和单个被发现的 SAE 解码器方向,在特征关联的层进行注入。
创新点和贡献
多模态模型差分为特征发现提供了因果线索。 不同于直接在 MLLM 上训练 SAE 分析的已有工作,MMDiff 的核心思路在于利用 “改变本身” 作为发现信号。通过与基座模型的差分,它天然地筛选掉了多模态训练中未变化的通用语言特征,将注意力集中在可能承载新能力的特征上。消融实验显示,仅从常规的 MLLM SAE 出发(无差分),选出的排名靠前的特征消融后空间推理准确率几乎无变化(平均 +0.22%),而 MMDiff 的特征则平均降低了 10.11%(见表 12),表明差分环节对找到因果关系上有效的特征至关重要。
跨阶段消融揭示了空间能力主要源于多模态微调。 论文使用 PaliGemma 2 的预训练变体(尚未经过指令微调)和指令微调变体,对相同的 MMDiff 空间特征进行消融。结果表明,指令微调将因果效应放大了约三倍,部分特征仅在微调后才表现出空间选择性(见表 2)。这说明中层的空间推理能力主要是微调阶段习得的,而非从基础语言模型中继承。
将 SAE 解码器方向作为精准的干预接口。 MMDiff-CAA 在多个层注入骨干 CAA 方向的同时,额外在特征关联层注入单个被发现的解码器方向,使空间准确率提升从 +8.96%(单层 CAA)提高到 +12.59%(表 14 的分解显示,多层 CAA 贡献 +1.82,解码器方向注 入再贡献 +1.81)。在 OCR 任务上,平均也获得了 +1.8% 的额外增益(见表 6)。
实验结果分析
空间推理。 对 MMDiff-Llama、MMDiff-Gemma 和 MMDiff-Qwen 三个系列模型的试验中,排名最前的空间特征消融后,视觉空间推理准确率分别平均下降了 10.1%、12.3% 和 14.6%,而对一般 VQA 的影响均低于 1.5%(见表 1)。控制实验表明,相同特征在非空间关系子集上的消融几乎无影响,排除了通用能力受损的替代解释。引导实验中,MMDiff-CAA 对词 “ahead of” 准确率提升 30.77%(见表 3)。
多模态安全。 在使用 VLSBench(必须结合图像才能识别有害意图)测试时,每个安全类别排名最前的特征消融后,攻击成功率降低了 17%–28%,而对 VQA 准确率和安全基准控制分数的影响均在 1% 以内(见表 4)。在对 1061 个候选安全特征的全局扫描中,平均攻击成功率降低了 9.67%,而普通 VQA 几乎不变(-0.03%)。
光学字符识别(OCR)。 OCR 特征的消融展现了高度针对性:排名最前的特征在各自 OCR 子类上平均准确率下降 16.9%,而 VQA 和 OCR 控制指标的变化分别不超过 1.6% 和 1.8%(见表 5)。引导实验在不同 OCR 子类上均获得正向增益。
实践建议
MMDiff 的核心价值在于将稀疏自编码器从纯粹的 “解释工具” 升级为 “可操作的接口”。对于需要审计或控制多模态模型行为的安全和产品团队,有几点实践考量:
-
特征消融作为安全审计手段。 论文展示的安全特征消融能以极低的通用性能代价大幅降低攻击成功率(如自我伤害类降低 28.14% 的攻击成功率,VQA 仅下降 0.90%)。在实际部署前,可扫描模型中被识别为不安全激活的特征集合,并将其消融效果作为安全审计的一个量化指标。但需注意,少量特征在消融时可能导致生成崩溃,需要进行后过滤(论文在局限性中也提及了这一点)。
-
MMDiff-CAA 用于能力增强。 对于空间推理和 OCR 任务,MMDiff-CAA 引导提供了一种轻量级的性能提升途径,仅需在推理时注入方向向量,无需重新训练模型。在实践中,可以预先计算多个任务的特征方向,根据当前对话的预期任务进行选择性注入。从工程角度看,该方法对 VQA 的零影响(见表 1 和表 5 的 ΔVQA 列)意味着增强操作不会损害模型的基础能力。
-
迁移到其他领域。 论文框架的流程是通用的——只需改变目标分布 。如果应用到医疗影像描述或物理图表理解等场景,可按相同步骤筛选出领域特定特征。但需要存在指令微调的变体来构建对比激活差异方向,这可能在仅有基础模型的场景中受到限制(论文已将这一点列为局限性之一)。