开放基础模型中视觉的对抗鲁棒性

Adversarial Robustness of Vision in Open Foundation Models

arXiv: 2512.17902v1

论文信息

标题: Adversarial Robustness of Vision in Open Foundation Models

作者: Jonathon Fox, William J Buchanan, Pavlos Papadopoulos

发布日期: 2025-12-19

arXiv ID: 2512.17902v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文探究两种开放权重视觉语言模型(LLaVA‑1.5‑13B 和 Llama 3.2 Vision‑8B‑2)在面对图像对抗攻击时的安全性与鲁棒性。
  • 核心方法:使用白盒无目标的投影梯度下降(PGD)攻击,在 VQA v2 数据集子集上量化模型准确率的退化程度。
  • 关键结果:Llama 3.2 Vision 尽管基准准确率更低,但在受到强扰动时准确率下降仅约 10 个百分点,远小于 LLaVA 的 36 个百分点(见论文表 1、表 2)。
  • 主要局限:实验仅在 500 样本子集和单一攻击算法(PGD、L∞)上进行,且 Llama 3.2 Vision 的基准性能显著低于官方报告值,原因未完全查明。
  • 适合读者:从事视觉语言模型安全评估或多模态 AI 系统部署的工程师、研究者,以及关心开放权重模型对抗风险的从业人员。

论文背景和研究动机

随着大语言模型向多模态方向演进,视觉语言模型(VLM)开始同时接收图像和文本输入,并生成自然语言输出。这类模型在辅助技术、内容生成和自动问答中展现巨大潜力,但其视觉输入通道也带来了新的攻击面。已有研究表明,通过对图像施加人眼难以察觉的扰动,可以诱导模型输出错误答案甚至有害内容。然而,针对最新一代开放权重 VLM——尤其是 Meta 的 Llama 3.2 Vision——的系统性对抗鲁棒性评估仍然缺乏。

本文聚焦于两个代表性模型:LLaVA‑1.5‑13B(用简单投影层连接 CLIP 视觉编码器与 Vicuna 语言模型)和 Llama 3.2 Vision‑8B‑2(通过交叉注意力适配器将 ViT‑H/14 编码器整合到 Llama 3.1 中)。两者的架构、训练数据规模和训练流程存在显著差异,这为理解 “基准性能” 与 “对抗鲁棒性” 之间的关系提供了理想的比较对象。论文的核心动机是回答两个问题:最新的开放 VLM 在视觉通道上是否依然脆弱?模型的架构和训练方式是否会显著影响其鲁棒性?

核心方法和技术细节

威胁模型与攻击目标

作者遵循了严格的威胁模型定义(见论文第 4.1 节)。攻击者拥有白盒访问权限,即完全知晓模型架构、参数和梯度,但只能修改输入图像,文本提示保持固定。攻击目标是无目标(untargeted)的,旨在最大化模型关于图像‑问题对的内部损失函数,从而导致输出质量下降、答案无关或错误,而非强制输出特定字符串。

扰动强度由 L∞L_\infty 范数下的预算 ϵ\epsilon 控制,像素值被归一化到 [0,1][0,1] 区间后,ϵ=2/255\epsilon=2/255 对应几乎不可见的微小扰动,而 ϵ=255/255\epsilon=255/255 则允许图像被完全覆盖。实验覆盖了从 2/2552/255 到 255/255255/255 的六个档次。

PGD 攻击的实现

攻击算法采用标准的投影梯度下降。在每一步迭代中,对抗图像 xt+1x^{t+1} 由下式生成:

xt+1=ΠBϵ(x)(xt+α⋅sign(∇xtJ(θ,xt,q)))x^{t+1} = \Pi_{\mathcal{B}_\epsilon(x)}\left( x^t + \alpha \cdot \text{sign}(\nabla_{x^t} J(\theta, x^t, q)) \right)

其中 JJ 是模型的语言建模损失(对生成答案的交叉熵),α\alpha 为步长,ΠBϵ(x)\Pi_{\mathcal{B}_\epsilon(x)} 是到 ϵ\epsilon‑球的投影算子,并确保像素值仍落在有效范围。初始图像可添加微小随机扰动以增强攻击成功率。

针对生成式 VLM,直接使用模型在给定图像和问题下生成答案的损失梯度是可行的,无需额外设计替代损失函数。由于模型参数巨大(13B 和 8B),实验采用了 float16 混合精度和梯度检查点技术,并在 80GB 显存的 NVIDIA A100 GPU 上完成(见论文第 4.3 节)。

评估基准与数据集

任务选择 VQA v2,要求模型回答关于图像的自然语言问题,评价指标为标准的 VQA 准确率:将模型生成的答案与多个人工标注的参考答案进行归一化比对,若精确匹配或为子串关系则判为正确。实验从完整验证集中随机抽取 500 个样本构成子集,每轮运行的基线准确率因采样略有浮动(偏差在统计误差范围内)。

创新点和贡献

  1. 首次系统性对比:该论文是较早对 LLaVA 和 Llama 3.2 Vision 进行视觉对抗鲁棒性头对头比较的工作,特别关注了两者在不同扰动强度下的退化模式。
  2. 揭示鲁棒性与基准性能的脱钩:实验发现 Llama 3.2 Vision 的 VQA 基准准确率远低于 LLaVA,但其在攻击下的相对性能下降更小。这挑战了 “更准的模型也更安全” 的直觉,证明对抗鲁棒性可能更多取决于架构(交叉注意力适配器 vs. 简单投影)和预训练数据规模。
  3. 清晰的威胁模型与方法论:论文严格遵循了对抗鲁棒性评估的最佳实践,明确给出威胁模型、攻击目标、约束和评价指标,为后续 VLM 安全评估提供了可复现的框架。

实验结果分析

在下表(根据论文表 1、表 2 整理)中,我们关注两个指标:干净图像下的 VQA 准确率和不同 ϵ\epsilon 下的对抗准确率(括号内为相对于该运行基线的准确率下降百分点)。

模型干净准确率ϵ=16/255\epsilon=16/255ϵ=128/255\epsilon=128/255ϵ=255/255\epsilon=255/255
LLaVA‑1.5‑13B87.4%76.8%(↓10.6)67.4%(↓20.0)51.4%(↓36.0)
Llama 3.2 Vision‑8B‑242.8%*36.2%(↓6.6)37.4%(↓5.4)31.4%(↓10.2‡\ddagger)
  • Llama 3.2 Vision 在 ϵ=255/255\epsilon=255/255 的独立运行中干净准确率为 41.6%,其余运行均为 42.8%。‡\ddagger 相对于 41.6% 计算下降。

从数据中可以观察到三个关键现象:

  • 普遍脆弱性:即便是微小的扰动(ϵ=2/255\epsilon=2/255)也让两个模型的准确率分别下降了 7.0 和 6.6 个百分点,说明视觉输入通道是稳定的攻击向量。
  • 退化模式迥异:LLaVA 的准确率随着 ϵ\epsilon 增大几乎单调递减,最终损失近四成;而 Llama 3.2 Vision 在低扰动下就出现明显退化,但进一步提高扰动强度时退化趋于平缓,对强扰动表现出更强的 “韧性”。
  • 绝对 vs. 相对表现:尽管 Llama 3.2 Vision 的对抗准确率绝对值在多数预算下低于 LLaVA,但从安全视角考察的是外部扰动所导致的性能下降,Llama 3.2 Vision 的最大下降仅为 10.2 个百分点,不到 LLaVA 的三分之一。这表明其内部表示对视觉噪声的敏感度较低。

论文认为,这种差异可能与适配器架构和训练数据量有关:Llama 3.2 Vision 拥有更复杂的交叉注意力机制和数十亿级图像‑文本对预训练,这可能使其视觉特征更稳定;而 LLaVA 的简单投影层加上仅百万级的微调数据,更容易受到对抗噪音的干扰。但这仅为推论,论文未进行严格的消融实验加以证实。

一个值得注意的现象是 Llama 3.2 Vision 的基准准确率(42.8%)远低于 Meta 报告的全数据集成绩(75.2%),而 LLaVA 的 87.4% 与社区基准(约 84%)较为一致。论文将其归因于提示格式、图像预处理或生成参数等实现细节的差异,并强调该差异不影响对相对下降的比较,因为基线在同一运行内测量。

实践建议

基于本研究的发现,对于计划在真实应用中部署或依赖开放权重 VLM 的团队,可借鉴以下几点:

  1. 将视觉通道纳入安全审计:即使模型在文本安全方面表现良好,也应将对抗图像攻击作为标准测试项。实验中即使用了最朴素的 PGD,也能在不可见扰动下显著降低准确率,提示实际攻击者可利用类似手段使模型输出不可靠的内容。
  2. 不要仅凭基准性能评估安全性:Llama 3.2 Vision 的基准 VQA 成绩较 LLaVA 低,但相对鲁棒性更强。如果安全是关键需求,可能需要选择 “更稳定” 而非 “更准确” 的模型,或进行专门的鲁棒性训练。
  3. 关注适配器与投影层的架构选择:本研究暗示跨注意力适配器可能带来更好的输入稳健性。在新模型选型时,可倾向于具备更强视觉‑语言融合机制的架构,同时要求供应商提供在对抗扰动下的性能数据。
  4. 设置输入过滤或扰动检测:由于对高 ϵ\epsilon 下的性能下降仍然显著,尤其是 LLaVA 在 ϵ=255/255\epsilon=255/255 时只剩约一半准确率,应考虑在前端加入图像质量检测或对抗样本检测模块,过滤明显异常的输入。
  5. 为关键任务准备降级策略:当 VLM 作为自动化决策的一部分时,应监控答案置信度或一致性,一旦检测到输出异常(例如与历史答案模式不符),可切换至纯文本后备策略或人工审核,避免因视觉扰动导致严重后果。

总体而言,这项工作为开放 VLM 的视觉安全评估提供了实证依据和可操作的分析框架,是多模态模型安全不可或缺的一环。