预训练数据可被计算宣传投毒

arXiv: 2607.15267v1

论文信息

标题: Pretraining Data Can Be Poisoned through Computational Propaganda

作者: Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, et al.

发布日期: 2026-07-16

arXiv ID: 2607.15267v1

PDF 链接: 下载 PDF

论文背景与研究动机

随着大语言模型(LMs)的参数量和训练数据规模不断膨胀,预训练语料通常远超出人类审查能力,恶意内容可能悄无声息地混入其中。已有研究表明,往训练数据中注入对抗性样本(即 “投毒”)能够诱导模型产生有害行为,如响应危险请求或生成虚假声明。然而,此前的预训练投毒攻击多局限于维基百科等已知数据源,这类数据在现代预训练语料中占比极小(如维基百科仅占 Dolma 3 文档量的 0.067%),且未考虑投毒内容在数据清洗管道中的存活情况。攻击者能否在大规模、异质的网页上实现真正的投毒,仍然是一个待解决的问题。

本文从网络现有基础设施出发,提出了一种新的攻击面:第三方内容注入(third-party content injection)。攻击者可以利用公开讨论界面(如网站评论区)大规模植入自己控制的文本,若这些文本在爬取、提取和质量过滤后仍被保留,便能进入预训练语料。作者类比社交媒体中的信息战策略,指出自动化评论基础设施(如 Selenium)能够以极低成本分发投毒内容,攻击目标从人类转向了爬虫和语言模型。这一威胁模型不仅新颖,而且吻合攻击者只需与网络公开接口交互、无需接触模型训练管线的真实场景。

核心方法与技术细节:HalfLife 分析框架

为衡量注入内容最终进入训练语料的概率,作者提出了 HalfLife 分析方法。HalfLife 将端到端的投毒事件分解为三个连续阶段,并以概率链的形式建模:

P(includev,S)=P(injectable)×P(capturedinjectable)×P(not filteredcaptured,injectable)P(\text{include} \mid v, \mathcal{S}) = P(\text{injectable}) \times P(\text{captured} \mid \text{injectable}) \times P(\text{not filtered} \mid \text{captured},\text{injectable})
  • S1(可注入性):网页是否提供公开讨论接口,使攻击者能够提交内容。作者从 Common Crawl 的 200 个 WARC 文件中抽取约 18 万页面,发现有 3.4% 的页面包含评论区,其中多数来自 WordPress 等平台,且大量无需身份验证即可发帖。
  • S2(爬取与提取):注入内容是否在爬虫提取的纯文本中保留。作者将攻击文本替换真实评论,并使用 Dolma 3 等数据管道使用的 Resiliparse 工具提取文本,发现 71.9% 的注入评论可以通过提取器,因为用户评论通常直接以纯文本形式嵌入 HTML。
  • S3(数据清洗存活):经过启发式过滤、英语识别和质量评分后,注入文档是否仍被保留。作者复现了 AllDressed 管道中的规则(URL 黑名单、文档长度、重复检测等),并应用 fastText 语言识别和质量分类器,最终有 5.5% 的包含评论的页面通过所有清洗步骤。

将三个阶段乘起来,攻击者在任意一个可注入页面上实现内容最终进入语料的概率约为 0.13%。这个数字看似微小,但若攻击者目标为 250 篇投毒文档(Souly 等人证明足以植入后门),仅需向 10 万至 100 万个页面尝试注入。考虑到光 WordPress 就有数万个开放表单,自动化攻击完全可行。另外,0.13% 的比例已超过整个维基百科在 Dolma 3 中的占比,从影响规模上看不可忽视。

创新点与主要贡献

本研究的核心创新包含三个层面:

  1. 定义新的攻击面。首次将第三方内容注入作为预训练投毒的可行向量,并具体论证公开讨论界面(评论区)的高可利用性。这突破了以往仅针对特定域名或已知数据源的局限,将攻击拓宽到异构的 Web 全貌。

  2. HalfLife 分析框架。创造性地通过概率分解估计投毒内容在真实数据管线中的存活率,而不依赖对特定页面的控制。该方法通用性强,还可用于评估其他投毒渠道(如程序化广告),本文便展示了广告在静态爬取和渲染爬取中均无法将文本送入语料,凸显了分析管线的重要性。

  3. 投毒格式的自然性探索。不同于以往使用显眼的 “User/Assistant” 聊天模板,作者设计了 Q/A 和无标签的投毒格式,降低了被过滤的风险。他们在实验中证明,即使采用更自然的格式,模型在预训练后仍然表现出显著的有偏输出,且这些影响能够通过指令微调部分保留。

实验设计与关键结果

实验聚焦于信念操纵场景:攻击者通过注入偏向某一实体(如雪铁龙优于雷诺)的问答对,引导模型偏好攻击者指定的选项。

作者在 65M 到 1.3B 参数的 Olmo-3 式模型中,以 0.1%、0.01%、0.001% 的令牌投毒率进行预训练,然后进行监督微调。评估时,模型需在两个实体等质完成句子之间选择,并计算偏好攻击者实体的概率。

结果如下:

  • 基础模型:在所有规模下,投毒均导致明显偏差。以 0.1% 投毒率为例,70M 模型偏好攻击实体概率从 55.3% 升至 73.9%,1.3B 模型从 52.5% 升至 71.5%,差值达 +19 个百分点以上。即使投毒率降至 0.001%,基础模型的偏差仍然存在(+3 到 +11 个百分点)。
  • 指令调优后:微调削弱了攻击效果,但仍保留了部分偏差。较小模型(65M)的保留比例较高(约 40%),但在 1.3B 规模时下降至不足 15%。这说明随着模型能力提升,对齐训练可能抵消部分投毒影响,但同时意味着针对大规模模型的投毒需要更高密度的注入才能产生显著持久效果。
  • 自然格式的有效性:使用 Q/A 和无标签格式的投毒同样能污染基础模型(偏差约 +17 至 +19 个百分点),且 Q/A 格式在微调后仍有约 +2 个百分点的残留,表明自然语言形式的投毒更难以被下游安全训练彻底清除。

此外,作者还研究了合成数据重写(WRAP)对投毒信号的影响。结果显示,完全随机的字节或指令重复在重写后几乎完全消失,而信念操纵性质的声明则有 65.3% 得以保留,再次证明自然语言投毒在更高级的数据清洗技术面前依然具有危害性。

实践应用建议与未来方向

对模型开发者的安全建议

本研究揭示了当前数据管线的明显盲区:文档级质量过滤无法区分由网站作者创作的主内容与用户提交的评论内容。基于此,我们建议:

  1. 评论感知的文本提取:在提取阶段识别并隔离评论区内容,可对其进行单独的质量评估或直接移除,降低投毒存活的可能性。
  2. 来源感知过滤:降低来自开放、无需认证的评论系统的网页权重,或在爬取时针对此类页面增加额外的检查。
  3. 时间一致性检验:对比同一页面在不同爬取时间点的版本,若新增大量用户提交内容,可标记为高风险。

对平台方的启示

WordPress 等平台垄断了评论区的大半壁江山,其安全策略的改善将产生广泛影响。平台可强制用户登录、实施速率限制、部署异常评论格式检测(如重复性或不可见字符),从而大幅提高攻击者的注入成本。

未来研究方向

  • 攻击者信息利用:开源模型(如 Olmo、DCLM 等)公开了数据源和过滤工具,攻击者可能据此进行有针对性的优化,未来需研究攻击者在知晓数据管线时的攻击效率提升幅度。
  • 多语言与低资源场景:文中提及小语种互联网文本更容易被攻击者饱和式投毒,这对非英语模型构成特殊风险,值得进一步实证分析。
  • 更隐蔽的投毒形式:如果攻击者利用自动化工具生成大量语义连贯但具有偏向的正常语句,可能进一步提升存活率并逃避基于困惑度的检测。

总结与展望

这篇工作证明,通过自动化评论灌水,攻击者无需触及模型开发内部即可对大规模预训练语料实施投毒。HalfLife 分析框架既量化了攻击的可行性,也为防御者提供了评估风险的工具。实验表明,干净、自然语言形式的投毒内容不仅能在预训练后篡改模型信念,还能部分躲过指令微调的对齐。需要强调的是,当前数据清洗实践对主内容与用户生成内容的一视同仁,留下了极易被利用的缺口。

未来,随着社区对开放数据依赖加深,如何平衡数据透明度与安全防护将成为一个关键课题。我们呼吁开发者在建设数据管道时,将评论等第三方内容的特异性纳入考量,同时也希望平台方意识到其基础设施可能沦为语言模型攻击的跳板,从源头限制大规模自动化注入。这不仅是技术问题,更是涉及生态协同的治理挑战。