大语言模型在线安全监测

arXiv: 2607.02510v1

论文信息

标题: Online Safety Monitoring for LLMs

作者: Mona Schirmer, Metod Jazbec, Alexander Timans, et al.

发布日期: 2026-07-02

arXiv ID: 2607.02510v1

PDF 链接: 下载 PDF

研究背景与动机

大语言模型(LLM)已深度融入搜索、编程助手、社交陪伴等日常场景。尽管经过对齐训练,模型在部署时仍可能产生幻觉、事实错误乃至有害输出,形成安全风险。现有的安全措施多集中于预训练阶段的对齐策略和离线评估,难以穷尽所有可能的提示场景,因此推理阶段的实时监控成为一种关键的防线。

传统的安全检测多为事后审查,即在完整输出生成后再判别其安全性。但作者指出,理想的安全监控应当以流式在线方式进行:随着 LLM 逐 token、逐步骤生成输出,监控器需实时判断是否需要触发警报并终止生成。这种设置的挑战在于缺乏最终的安全标签,且要求快速反应。通常我们能获得的只是一个近似的安全信号,例如安全分类器给出的 “安全” 概率。如何将这个不完美的信号可靠地转化为 “报警/不报警” 的二元决策,同时给出统计保障,成为核心问题。

核心方法:基于风险控制的在线监控

问题形式化

设用户提示为 xx,LLM 生成可变长度的输出序列 o1:To_{1:T}。每一步 tt 可代表一个 token、一个推理步骤或一轮对话。安全标签 y{0,1}y \in \{0,1\} 表示整个序列是否安全(y=1y=1 安全,y=0y=0 不安全),仅在完整序列已知后才能判定。在线监控的目标是在序列展开时,基于截至当前的部分输出 o1:to_{1:t} 尽早识别不安全序列。

安全信号与监控器

监控器依赖一个与安全标签相关的近似信号 sts_t,例如外部验证模型的预测概率 pψ(yx,o1:t)p_{\psi}(y \mid x, o_{1:t})。在数学推理场景中,sts_t 可以是过程奖励模型(PRM)给出的步骤正确性评分;在内容审核场景中,则可以是安全护栏模型的输出。

监控器采用一个极简单的规则:设定单一阈值 λ\lambda,当任意时间步 kksks_k 首次低于 λ\lambda 时,即触发警报。形式化为:

Φt:=1{k,1kt:sk<λ}.\Phi_t := \mathbf{1}\{\exists k, 1 \le k \le t : s_k < \lambda\}.

这种规则不依赖于时间结构,仅依赖一个固定的全局阈值,因而极其高效。

风险定义与控制策略

监控器面临两类错误:错误报警(类型 I)——将安全序列误报为不安全;漏检(类型 II)——未能检出真正不安全的序列。论文聚焦于错误报警风险的控制,并提供了可扩展到漏检风险的对称处理方法。

错误报警风险定义为给定安全序列的条件下,监控器发出警报的概率:

RI(λ)=P(t1:st<λy=1).\mathcal{R}^I(\lambda) = \mathbb{P}(\exists t \ge 1 : s_t < \lambda \mid y=1).

该风险随 λ\lambda 升高而单调递增。

校准阈值 λ\lambda 的目标是使风险 R\mathcal{R}(可以是 RI\mathcal{R}^IRII\mathcal{R}^{II})在给定水平 ϵ(0,1)\epsilon \in (0,1) 下得到控制。论文利用一个标记过的校准数据集 Dcal\mathcal{D}_{\text{cal}},并提出两种控制强度的方案:

  • 期望控制(CRC):基于共形风险控制(Conformal Risk Control),选取满足有限样本修正后经验风险仍低于 ϵ\epsilon 的最大阈值 λ^CRC\hat{\lambda}_{\mathrm{CRC}}。这样可保证未来测试数据的风险在平均意义上被 ϵ\epsilon 所控:

    EDcal[R(λ^)]ϵ.\mathbb{E}_{\mathcal{D}_{\text{cal}}}[\mathcal{R}(\hat{\lambda})] \le \epsilon.

    该方法是阈值选择式:

    λ^CRC:=max{λΛ:nn+1R^(λ;Dcal)+1n+1ϵ}.\hat{\lambda}_{\text{CRC}} := \max\{\lambda \in \Lambda : \frac{n}{n+1}\hat{\mathcal{R}}(\lambda; \mathcal{D}_{\text{cal}}) + \frac{1}{n+1} \le \epsilon\}.
  • 高概率控制(UCB):借助 Hoeffding–Bentkus 上置信界,要求对于大部分校准数据集的抽法(失败概率 δ\delta),风险都能被控制在 ϵ\epsilon 以下:

    PDcal(R(λ^)ϵ)1δ.\mathbb{P}_{\mathcal{D}_{\text{cal}}}(\mathcal{R}(\hat{\lambda}) \le \epsilon) \ge 1 - \delta.

    阈值选取为满足上置信界 ϵ\le \epsilon 的最大 λ\lambda。该保证更强,但阈值更保守,通常需要更大的校准集。

对于漏检风险控制,只需将最大化改为最小化即可选出最宽松但仍满足约束的阈值。此特性使实践者能根据场景在两类风险间灵活权衡。

创新点分析

  1. 极简设计,竞争性表现:仅用单一阈值和无时间结构的决策规则,便能在检测效果上比肩需要分步学习密度估计的复杂方法(如 e-valuator),实现更早的报警时刻。
  2. 统计保障的灵活性:提供了从弱到强的两种风险控制方式,并支持在错误报警和漏检之间自由切换控制对象,这是许多现有在线检测框架(如序列假设检验)所不具备的。
  3. 信号无关性与可扩展性:该方法可适配任意安全代理信号,无论是外部验证器还是模型内部置信度,均可直接接入框架。
  4. 原理清晰,计算开销极低:无需训练额外的密度估计器,校准仅需对校准集扫描一遍,部署时也仅做一次阈值比较,非常适合高吞吐的实时场景。

实验结果分析

论文在两个安全场景上进行了评估:事实正确性(数学推理)和无害性(红队对话)。

事实性监控(MATH 数据集)

使用 Claude Haiku(高正确率)和 Mistral-7B-Instruct(低正确率)作为生成器,信号为 Qwen2.5-Math-PRM 的步骤得分。结果显示,CRC 和 UCB 均实现了错误报警率的经验控制,其中 UCB 满足高概率保证。在检出率(Power)上,CRC 较 UCB 略高但略有风险超限的可能;有趣的是,虽然 e-valuator-anytime 在低 ϵ\epsilon 时有更高的检出率,但其报警时间显著晚于 CRC 和 UCB——后者通常能在序列一半长度时就发现错误,有效减少了有害输出曝露和 token 生成成本。

有害性监控(Red Teaming 与 FineHarm)

采用 Llama Guard 和安全分类模型提供实时安全信号。所有方法均保持报警风险受控。但在不同数据集上,表现差异明显:在 FineHarm 上,特调的分词级安全分类器信号很强,各方法检出率均接近 1;而在红队数据上,Llama Guard 信号较弱,所有方法的检出率难以超过 0.8,这凸显了 “监控器只能与其信号一样好” 的结论。

信号消融:外部验证器 vs. 内部置信度

考虑部署成本,论文尝试用生成模型自有的逐 token 对数概率(取每步最小值)代替外部 PRM。结果表明,同一报警率下,基于内部置信度的方法检出率显著下降(例如在 ϵ=0.3\epsilon=0.3 时,PRM 的检出率约 0.9,而内部置信度仅约 0.5)。这说明免费的内部信号会大幅牺牲监控质量,但若算力受限,仍可作为一种轻量选择。

漏检风险控制

当目标从控制错误报警转为控制漏检率时,CRC 和 UCB 方法依然能保证 RII\mathcal{R}^{II} 受控,而 e-valuator 无法提供类似保证。实验显示,在 Claude 这样正确率高的模型上,为保证极低的漏检率,错误报警率会被推得很高;这再次展现了风险控制框架让用户自由定义安全约束的灵活性。

实践应用建议

  • 根据代价选择控制模式:如果误中断用户体验的代价极高(如对话助手),应优先控制错误报警(CRC/UCB);如果漏掉有害输出后果严重(如医疗建议),则应控制漏检风险。
  • 信号源选择需匹配场景:对安全性要求极高的场景,务选用专门训练的外部验证器,即使增加延迟和成本;对低风险、高吞吐场景,可考虑内部置信度作为廉价替代。
  • 重视校准集质量:风险控制保障依赖于校准数据与部署分布可交换。实际部署时应及时更新校准集以反映数据分布的变化。
  • 报警后处理衔接:报警不是终点,可联动人工审核、换用更严谨的模型或关闭对话等机制,形成完整的在线安全防护链。

未来发展方向

  1. 多信号融合与鲁棒性:探索将多个弱信号(如内部概率、外部分数、规则检查)组合成一个更强的联合信号,以提升在分布外或对抗情境下的可靠性。
  2. 时序结构建模:当前忽略信号的时间趋势,未来可引入帕累托检验等方法,为每步校准独立阈值,以捕获安全评分的系统性漂移。
  3. 成本自适应的信号选择:根据当前风险等级动态切换信号源,在保证安全约束的前提下减少开销。
  4. 针对高级攻击的防御:研究针对故意掩盖不安全行为的鉴别能力,以及对抗性样本下风险控制的鲁棒性。

总结与展望

这篇论文为 LLM 在线安全监控提供了一个统计严谨、实践轻量级的解决方案:通过风险控制校准单一阈值,将任何安全代理信号转换为具有形式化保障的实时报警机制。实验表明,这种简单方法在检测时机上优于复杂的序列假设检验方法,并能自由切换控制目标。该方法不仅为从业者提供了即用型工具,也揭示了在线监控的核心矛盾——信号质量与成本之间的权衡。未来工作有望在多信号融合、动态阈值和对抗鲁棒性等方向拓展这一框架,推动 LLM 部署安全从离线评估走向在线可控的新阶段。