通过特征空间平滑实现多模态大语言模型的可证明鲁棒性

Provable Robustness in Multimodal Large Language Models via Feature Space Smoothing

arXiv: 2601.16200v1

论文信息

标题: Provable Robustness in Multimodal Large Language Models via Feature Space Smoothing

作者: Song Xia, Meiwen Ding, Chenqi Kong, et al.

发布日期: 2026-01-22

arXiv ID: 2601.16200v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:多模态大语言模型(MLLMs)极易受到对抗攻击,现有防御方法缺乏可证明的鲁棒性保证。这篇论文要解决的核心问题是如何为 MLLMs 的特征表示提供可证明的鲁棒性。

  • 核心方法:作者提出了特征空间平滑(Feature-space Smoothing, FS)框架,将任何特征编码器转化为平滑版本,并从理论上证明其在 ℓ2\ell_2 攻击下能维持特征余弦相似度的可证明下界(FCSB)。同时,引入一个即插即用的净化器与平滑度映射器(Purifier and Smoothness Mapper, PSM)来提升该下界的具体数值。

  • 关键结果:在图像描述任务中,结合 FS 与 PSM,能将各种白盒攻击的攻击成功率(ASR)从近 90% 降低至约 1%(见表 1)。

  • 主要局限:方法目前仅针对视觉编码器,且所有可证明的鲁棒性都基于对视觉特征空间的 ℓ2\ell_2 扰动约束。防御模块的训练数据仅包含 5000 张图像,其泛化性有待更多验证。

  • 适合读者:对可信人工智能、对抗攻防、多模态大模型安全感兴趣的学术研究者和工程师。阅读本文需要一定的机器学习、优化和概率论基础。

论文背景和研究动机

多模态大语言模型(MLLMs)如 GPT-5 和 Gemini 2.5 等在众多任务中展现出强大的能力,但其背后潜藏着致命的安全隐患——对抗鲁棒性不足。攻击者只需在干净的输入图像上添加精心设计的、人手几乎不可察觉的微小扰动,就能诱导模型产生完全错误的、甚至是恶意的输出。

这种脆弱性的根源被认为是模型缺乏足够的局部平滑性。现有的防御手段主要分为两类:经验性防御(如对抗训练)和可证明防御(如随机平滑)。论文指出,尽管对抗训练能提升模型的鲁棒性,但它不仅计算成本高昂,而且缺乏正式的鲁棒性保证,面对新型或更强的自适应攻击时仍可能失效。

另一方面,主流的可证明防御方法(如经典的随机平滑 Randomized Smoothing, RS)虽然在分类任务上效果显著,但其理论框架天然局限于单维输出(如分类标签)。这使得它们无法直接应用于需要生成文本序列、回答复杂问题的多模态大模型。为了解决这一根本性矛盾,本文另辟蹊径,选择在特征空间而非最终的输出空间上寻求可证明的鲁棒性。

核心方法和技术细节

本研究的核心可以概括为 “一个框架” 和 “一个模块”:特征空间平滑(FS)框架和净化器与平滑度映射器(PSM)。

特征空间平滑(FS)

FS 的核心思想是:抵御攻击,固本为上。既然攻击者通过扰动输入来扭曲模型的内部特征表示,我们就应该直接加固这个特征表示,并为之提供理论保证。FS 将深度学习模型 F\mathcal{F} 分为特征提取器 fef_e(从输入 x{\bm{x}} 到特征 z{\bm{z}})和下游预测器 fdf_d 两部分。

FS 对 fef_e 进行高斯平滑,定义平滑后的编码器为原始编码器在输入受高斯噪声 ε\bm{\varepsilon} 扰动时输出的期望值:

f^e(x)=Eε∼N(0,I)[fe(x+ε)]\hat{f}_{e}(\bm{x}) = \mathbb{E}_{\bm{\varepsilon}\sim\mathcal{N}(0,I)}[f_{e}(\bm{x}+\bm{\varepsilon})]

论文提出了一个关键的高斯鲁棒性分数 S^(x)\hat{S}({\bm{x}}),用于衡量原始编码器在对抗噪声时的特征一致性(见论文公式 5)。作者首先证明了这个分数具有良好的 Lipschitz 连续性(引理 1),进而推导出核心理论结果(定理 1):

对于任何满足 ∥x′−x∥≤ϵ\|{\bm{x}}^{\prime} - {\bm{x}}\| \le \epsilon 的对抗输入 x′{\bm{x}}^{\prime},其平滑后的对抗特征 f^e(x′)\hat{f}_{e}({\bm{x}}^{\prime}) 与干净特征 fe(x)f_{e}({\bm{x}}) 之间的余弦相似度存在一个可证明的下界,称为 FCSB:

Cos(f^e(x′),fe(x))≥2Φ(Φ−1(S^(x))−ϵ)−1\mathrm{Cos}(\hat{f}_{e}({\bm{x}}^{\prime}), f_{e}({\bm{x}})) \geq 2{\Phi}\left({\Phi^{-1}}(\hat{S}({\bm{x}})) - \epsilon\right) - 1

这个下界完全由高斯鲁棒性分数 S^(x)\hat{S}({\bm{x}}) 和攻击预算 ϵ\epsilon 决定。该结论将模型在最终预测上的鲁棒性问题,成功地转化为了对特征空间一致性的可证明保证。

即插即用的 PSM 增强

然而,原始 MLLM 编码器的 S^(x)\hat{S}({\bm{x}}) 值往往较低,导致 FCSB 不够理想。直接通过微调大模型来提升这个分数极为昂贵和复杂。为此,作者提出了一个 “外挂” 模块 PSM,它由两部分构成(训练框架见图 2):

  1. 净化器(Purifier)P\mathcal{P}:一个预训练的引导扩散模型。它被安置在特征编码器之前,负责对受到高斯扰动的输入 x+ε{\bm{x}}+\bm{\varepsilon} 进行 “去噪” 处理,目的是最大程度恢复干净的输入,从而提升后续特征提取的鲁棒性。
  2. 平滑度映射器(Smoothness Mapper)M\mathcal{M}:一个噪声感知的残差网络。它位于特征编码器之后,对提取出的 “净化后” 特征进行精炼。该映射器的设计非常巧妙,其操作的幅度由噪声强度 σ\sigma 动态控制。当 σ=0\sigma=0 时,映射器近乎不工作,以避免对干净输入产生副作用。其目标是在精炼特征的同时,维持其特征分布与原始干净特征分布的一致性(通过统计损失 lstatsl_{stats} 和身份损失 lidl_{id} 约束)。

这两个组件协同工作,通过两阶段的自我监督训练进行优化,完全无需微调 MLLM 本身的任何参数,实现了真正的即插即用。训练完成后,将 PSM 接入模型,整个系统在 FS 框架下就能获得大幅提升的理论鲁棒性下界。

创新点和贡献

本文的创新性贡献主要有三点:

  1. 理论框架革新:提出了特征空间平滑(FS),首次将为 MLLMs 提供可证明鲁棒性的问题从输出空间(如分类标签)扩展到了高维特征空间。这使得鲁棒性保证能应用于图像描述、VQA 等更通用的多模态任务。

  2. 实用方法论突破:设计了一个训练无关、即插即用的 PSM 模块。它巧妙地绕过微调大模型的巨大成本,通过外挂的 “净化器+映射器” 直接拔高了模型的鲁棒性 “天花板”(即提高 FCSB),为复杂大模型的安全加固提供了一种极其高效的工程方案。

  3. 理论与实践的实证桥梁:论文不仅提供了严格的理论边界(如可证明半径 R\mathcal{R}),而且通过表 2 的数据(“CLIP-B16+P\mathcal{P}&M\mathcal{M} 在 σ=0.50\sigma=0.50 时,平均可证明半径 R\mathcal{R} 从 0.33 提升至 0.89”)展示了 PSM 确实能有效放大理论鲁棒性,最终在端到端的任务攻击实验中转化为极低的攻击成功率,完美地将理论优势落地为实际防御性能。

实验结果分析

实验部分对 FS-PSM 进行了全面、严苛的评估。作者选择了三个代表性的开源 MLLMs(LLaVA-1.5-7B, OpenFlamingo-9B, CLIP-L14),在图像描述、图像分类和视觉问答(VQA)三项下游任务上,对抗三个 SOTA 白盒攻击方法(M-Attack, FOA, AttackVLM)。

  • 防御性能碾压:实验结果一致表明,FS-PSM 提供了远超经验性防御的鲁棒性。以图像描述任务为例(表 1),针对最强的 FOA 攻击,原始 LLaVA 模型的 ASR 高达 94%,而经过 FS-PSM 保护的模型 ASR 骤降至 1%,同时准确率从 1% 飙升至 87%。相比之下,同为防御方法的 FARE 在处理 FOA 攻击时,准确率从 44% 暴跌至 19%,显示出经验性防御在面对更强攻击时的不稳定性。

  • 跨任务与跨模型泛化能力:无论是在 VQA 任务(表 4)还是在分类任务(表 3)中,FS-PSM 均将 ASR 压制到接近 0% 的水准。更重要的是,为 “原始编码器” 训练的 PSM,无需任何调整即可直接应用于 FARE 和 TeCoA 这类经过对抗训练的编码器上,并使其鲁棒性进一步提升,证明了其极佳的泛化能力。

  • 消融实验:消融研究(表 5)清晰地揭示了每个组件的价值。单纯的 FS 已经能将 CLIP-B16 在 FOA 攻击下的精度从 1.6% 提升到 42.4%,加入映射器 M\mathcal{M} 后提升至 66.8%,而采用完整的 PSM(P\mathcal{P} 和 M\mathcal{M})后,精度直接达到了 91.6%,逼近干净数据的性能。对应的可证明半径 R\mathcal{R} 也同步增长,显示出理论指标和实际效果的高度正相关性。

实践建议

对于热衷于增强多模态大模型安全性的研发团队,本文提供的 FS-PSM 框架是值得集成到产品系统中的有效方案。以下是一些基于论文的实践考量:

  1. 轻量级 “外挂” 模块部署:PSM 的设计哲学是 “即插即用”。在工程实现上,可以将训练好的 PSM 模块(一个预训练扩散模型作为净化器,一个轻量级残差网络作为映射器)作为独立服务部署在 MLLM 推理 API 的前后,形成一条 “净化-编码-映射” 的安全流水线,而完全不触碰大模型本体。这对于保护闭源或不便微调的 API 服务尤其有价值。

  2. 效率与鲁棒性的权衡:FS 进行平滑需要多次(n0n_0 次)蒙特卡洛采样的前向传播。论文表 S.8 显示,当 n0=4n_0=4 时,使用扩散净化器的 LLaVA-1.5-7B 推理耗时约 0.66 秒/样本,能将 ASR 降至 0.4%。这是一个不错的平衡点。如果对延迟极为敏感,可以考虑论文中替代方案的轻量级 U-Net 净化器,其在 n0=4n_0=4 时推理耗时降至 0.32 秒/样本,性能虽有微弱下降(ASR 0.2%),但仍足以抵御强攻击。

  3. 白盒攻击下的谨慎使用:本文的所有验证都在强大的白盒攻击设定下进行,模拟最严酷的防御环境。虽然 PSM 在此设定下表现优异,但在实际的动态攻防场景下,攻击者可能会针对 “扩散模型去噪” 和 “特征平滑” 这两个环节设计自适应攻击。因此,建议将 FS-PSM 作为纵深防御体系中的关键一环,而非唯一的防线。

  4. 训练数据与噪声强度 σ\sigma 的设定:PSM 的训练数据(含 5000 张来自医学、卡通、自然等领域的图像)决定了其净化能力和映射器的先验知识。在实际落地时,如果业务场景图像分布非常特殊,建议更换或扩充与其匹配的训练数据。另外,噪声标准差 σ\sigma 是一个关键超参数,σ\sigma 越大,理论鲁棒性越高(可证明半径 R\mathcal{R} 越大,见表 2),但可能会轻微牺牲干净数据的性能。开发者需根据自身业务对安全等级和性能的需求进行测试选型。