预训练数据可通过计算宣传被毒化

Pretraining Data Can Be Poisoned through Computational Propaganda

arXiv: 2607.15267v1

论文信息

标题: Pretraining Data Can Be Poisoned through Computational Propaganda

作者: Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, et al.

发布日期: 2026-07-16

arXiv ID: 2607.15267v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文探讨的是,攻击者能否通过互联网上公开的第三方内容注入机制(比如网页评论区)大规模地毒化大语言模型的预训练数据,从而使模型产生有害或特定偏向的输出。
  • 核心方法:作者提出了一种名为 HalfLife 的分析框架,将毒化内容的注入、爬取、提取和筛选全过程分解为几个阶段,来估算恶意内容最终进入训练语料的概率。他们还通过模拟注入和模型训练实验来验证攻击的可行性。
  • 关键结果:通过评论区注入的恶意内容,有约 0.13% 的概率最终能进入预训练数据集(见第 4.4 节)。这个比例看似微小,但已经超过了像维基百科这样高质量数据源在现代预训练语料库中的占比(0.067%),这意味着攻击具有很强的可扩展性。
  • 主要局限:作者仅在沙盒环境中模拟了注入攻击,并未在真实网站上实施,以避免造成实际伤害。此外,HalfLife 的估算基于特定版本的 Common Crawl 快照和 Dolma 3 数据筛选流程,不同实验室的爬虫和数据清洗流程可能导致不同的存活率(见第 7.3 节)。
  • 适合读者:任何关心大语言模型安全性和数据质量的读者,特别是负责构建大规模预训练数据集、研究模型鲁棒性,或参与人工智能安全与政策制定的研究人员和工程师。

论文背景和研究动机

大型语言模型(LM)的预训练阶段会消耗远超人类审查能力的海量数据。这种极端规模使得恶意内容有可能在未被察觉的情况下混入训练数据。先前的研究(如 Carlini 等人和 Zhang 等人的工作)已经证明,通过在训练数据中注入对抗性内容来 “毒化” 语言模型,可以诱导其产生有害行为,例如响应恶意请求或生成虚假陈述。然而,这些研究大多利用维基百科等已知的、固定的数据源进行攻击,这类数据源仅占现代预训练语料库的极小部分(例如维基百科只占 Dolma 3 语料库文档总量的 0.067%)。

现实中的预训练语料库主要由 Common Crawl 这类大规模、异质化的网页抓取数据构成。因此,一个关键问题悬而未决:攻击者能否在真实的、异构的互联网规模上毒化预训练语料库?此外,过去的工作并未深入分析毒化内容在现代数据管理流程(包括爬取、文本提取和质量过滤等阶段)中的 “存活” 问题,这些流程很可能在模型训练前就已检测并清除了恶意数据。这篇论文正是为了填补这一空白,探索通过互联网基础设施本身进行大规模数据投毒的实际可行性。

核心方法和技术细节

为了解决上述问题,作者提出了一个新颖的分析框架,名为 HalfLife,并以此评估了 “公开讨论界面”(如网页评论区)作为一种攻击向量的有效性。

威胁模型

作者定义了一个能力较低、知识有限的攻击者。攻击者不需要控制具体的爬虫或了解哪些网页最终会被纳入训练集。他们只需要像普通用户和内容开发者一样,能够通过浏览器自动化工具(如 Selenium)与万维网进行交互,在公开的、无需认证的讨论接口上大规模发布内容。攻击者的目标主要有两类:引导未来语言模型的用户以达成特定目的(如传播虚假信息),或是直接损害模型质量本身(如植入后门)。

HalfLife 分析框架

HalfLife 框架将一次成功的投毒攻击分解为一系列条件概率,用于估算攻击者注入的內容最终在预训练语料中出现的概率。

P(include∣v,S)=P(injectable)×P(captured∣injectable)×P(not filtered∣captured)P(\text{include} \mid v, \mathcal{S}) = P(\text{injectable}) \times P(\text{captured} \mid \text{injectable}) \times P(\text{not filtered} \mid \text{captured})

这项公式将过程解构为三个主要阶段(见第 3 节):

  1. S1 - 网页是否可注入:攻击者能否在目标网页上发布内容?
  2. S2 - 注入内容是否被爬虫捕获:注入的内容在网页被爬取并提取为纯文本后是否还存在?
  3. S3 - 注入内容是否通过数据清洗:提取出的文本是否能通过语言识别、启发式过滤和质量分类器等后续清洗步骤?

实验验证

作者将 HalfLife 应用于评论区这个攻击向量,并进行了详细的概率估算:

  • S1(可注入性):通过分析 Common Crawl 最新快照中的 181,857 个网页,发现 3.4% 的页面包含评论平台,其中大量允许未认证发表(见第 4.1 节)。
  • S2(捕获率):通过沙盒环境模拟注入和爬取,使用与 Dolma 3 项目相同的文本提取工具 Resiliparse,发现大约 71.9% 的注入评论能够存活并出现在提取后的纯文本中(见 4.2 节)。
  • S3(过滤存活率):将提取后的文本通过一个与 Dolma 3 相同的完整数据清洗流水线,包括启发式过滤、语言识别、质量过滤等。最终,只有约 5.5% 的包含注入评论的文档能通过所有筛选(见 4.3 节)。

综合这三个阶段的概率,最终端到端的包含概率 P(include)≈0.13%P(\text{include}) \approx 0.13\%。

创新点和贡献

本文的主要贡献体现在以下几个方面:

  1. 识别了新的攻击面:论文首次系统性地提出并验证了 “第三方向内容注入” 作为一种新型预训练数据投毒攻击向量。这种方法不依赖于入侵特定网站或购买过期域名,而是利用互联网本身鼓励用户参与的公开基础设施,实现了大规模、低成本的攻击。

  2. 提出了 HalfLife 分析框架:这个框架是论文的核心创新。它不只是简单地进行攻击演示,而是提供了一个结构化的、可量化的方法来评估在整个数据管道的每个阶段毒化内容存活的可能性。这为比较不同攻击向量的实际风险提供了基准。

  3. 对比了不同攻击向量的可行性:论文不仅分析了评论区,还利用 HalfLife 分析了程序化广告作为投毒载体的可能性,并得出结论:由于广告内容通常通过跨越 iframe 加载,且受浏览器同源策略保护,绝大部分广告文案不会被静态爬虫(如 Common Crawl)捕获,因此它是一个不切实际的攻击向量(见第 4.6 节和附录 H)。这种对比凸显了 HalfLife 的分析价值。

  4. 验证了攻击效果的规模化影响:论文通过模型训练实验(见第 5 节)表明,即使采用更自然的 Q/A 或无标签的投毒格式来逃避检测,依然能有效地使模型产生偏好。更重要的是,他们证明了在 0.13% 的包含概率下,攻击者仅需在大约 19 万到 190 万个网页上尝试注入,就能在最终语料中产生 250 个毒化文档,而根据 Souly 等人的研究,这个数量的毒化文档已足够向预训练模型注入后门(见第 4.4 节,图 2)。

实验结果分析

作者进行了一系列受控实验来验证混入预训练数据的评论区内容如何影响下游模型(见第 5 节)。

他们定义了三种不同隐蔽程度的投毒格式:User/Assistant(用户/助手,基线格式)、Q/A(问答格式)和 No-label(无标记格式)。投毒内容被设计成在特定品牌(如波音 vs 空客)上偏向于其中一方。他们在不同大小的模型(从 6500 万参数到 13 亿参数)上以极低的剂量(占总令牌量的 0.001% 至 0.1%)混合投毒数据进行预训练,并进行指令微调。

实验结果清晰地表明,投毒攻击非常有效,即使在指令微调后,效果也依然存在:

  • 基座模型效果显著:在所有模型规模下,即使是最低的 0.001% 令牌投毒率,基座模型也开始产生明显偏向(表 1)。当投毒率提高到 0.1% 时,所有规模的模型对投毒方的偏好从 52.1% 左右(无偏见的基准线)急剧上升至 71.5% - 73.9%。
  • 指令微调后的效果衰减:指令微调(SFT)会减轻但不会完全消除投毒效应(表 1)。一个有趣的现象是,随着模型规模增大,指令微调对投毒效应的清洗作用变得更明显。例如,在 0.001% 投毒率下,6500 万参数的模型经 SFT 后效应有约 60% 的保留,而在 13 亿参数的模型上,效应保留率降至约 20%。
  • 隐蔽格式依然有效:采用更隐蔽的 Q/A 和 No-label 格式进行投毒,在基座模型上同样能达到与 User/Assistant 格式相当的效果(表 2)。然而在指令微调后,No-label(无标记)格式的投毒效果在大模型上几乎完全消失,而 Q/A 格式的效果仍能与基线格式相抗衡,显示了格式设计对持久性的影响。

实践建议

鉴于这类攻击的可行性和隐蔽性,模型开发者和数据平台运营商可从以下几个层面采取缓解措施:

  1. 评论感知的数据提取与过滤:当前的主流提取工具(如 Resiliparse)会将网页主内容和评论区内容混合输出。一个直接的改进是在数据提取阶段就将用户提交的内容(如通过 CSS 选择器或正则匹配识别出的评论区 div)剥离,或为其打上 “用户生成内容” 的独立标签。后续的质量过滤器可以针对性地降权或丢弃这部分内容,因为它们通常比网页正文噪声更大、质量更低。

  2. 基于来源的风险评估:在数据清洗阶段,可以对网页 URL 或域名进行风险分级。对于已知含有开放、无身份验证的讨论模块的网页(论文发现可爬取的网页中有相当比例),可以整体提升其风险等级,或要求其通过更严格的质控标准后才能进入训练集。

  3. 平台级的防御机制:论文指出,WordPress 等少数平台承载了大部分的可注入评论区(附录 E,表 3)。如果这些平台能够大规模推广和实施身份验证、速率限制、自动反垃圾信息(如 reCAPTCHA)等防御措施,或在 robots.txt 文件中恰当地别出用户评论的路径,那么 HalfLife 公式中的 P(injectable)P(\text{injectable}) 项就会显著降低,从而极大地增加攻击成本。

这些方法并非银弹,但组合使用能够显著增加攻击者所需的规模和成本,从而降低整体威胁。对风险最高的、以低资源语言或特定社区为目标的模型开发者来说,这些防御措施尤其值得优先考虑。