大语言模型在线安全监测
论文信息
标题: Online Safety Monitoring for LLMs
作者: Mona Schirmer, Metod Jazbec, Alexander Timans, et al.
发布日期: 2026-07-02
arXiv ID: 2607.02510v1
PDF 链接: 下载 PDF
研究背景与动机
大语言模型(LLM)已深度融入搜索、编程助手、社交陪伴等日常场景。尽管经过对齐训练,模型在部署时仍可能产生幻觉、事实错误乃至有害输出,形成安全风险。现有的安全措施多集中于预训练阶段的对齐策略和离线评估,难以穷尽所有可能的提示场景,因此推理阶段的实时监控成为一种关键的防线。
传统的安全检测多为事后审查,即在完整输出生成后再判别其安全性。但作者指出,理想的安全监控应当以流式在线方式进行:随着 LLM 逐 token、逐步骤生成输出,监控器需实时判断是否需要触发警报并终止生成。这种设置的挑战在于缺乏最终的安全标签,且要求快速反应。通常我们能获得的只是一个近似的安全信号,例如安全分类器给出的 “安全” 概率。如何将这个不完美的信号可靠地转化为 “报警/不报警” 的二元决策,同时给出统计保障,成为核心问题。
核心方法:基于风险控制的在线监控
问题形式化
设用户提示为 ,LLM 生成可变长度的输出序列 。每一步 可代表一个 token、一个推理步骤或一轮对话。安全标签 表示整个序列是否安全( 安全, 不安全),仅在完整序列已知后才能判定。在线监控的目标是在序列展开时,基于截至当前的部分输出 尽早识别不安全序列。
安全信号与监控器
监控器依赖一个与安全标签相关的近似信号 ,例如外部验证模型的预测概率 。在数学推理场景中, 可以是过程奖励模型(PRM)给出的步骤正确性评分;在内容审核场景中,则可以是安全护栏模型的输出。
监控器采用一个极简单的规则:设定单一阈值 ,当任意时间步 的 首次低于 时,即触发警报。形式化为:
这种规则不依赖于时间结构,仅依赖一个固定的全局阈值,因而极其高效。
风险定义与控制策略
监控器面临两类错误:错误报警(类型 I)——将安全序列误报为不安全;漏检(类型 II)——未能检出真正不安全的序列。论文聚焦于错误报警风险的控制,并提供了可扩展到漏检风险的对称处理方法。
错误报警风险定义为给定安全序列的条件下,监控器发出警报的概率:
该风险随 升高而单调递增。
校准阈值 的目标是使风险 (可以是 或 )在给定水平 下得到控制。论文利用一个标记过的校准数据集 ,并提出两种控制强度的方案:
-
期望控制(CRC):基于共形风险控制(Conformal Risk Control),选取满足有限样本修正后经验风险仍低于 的最大阈值 。这样可保证未来测试数据的风险在平均意义上被 所控:
该方法是阈值选择式:
-
高概率控制(UCB):借助 Hoeffding–Bentkus 上置信界,要求对于大部分校准数据集的抽法(失败概率 ),风险都能被控制在 以下:
阈值选取为满足上置信界 的最大 。该保证更强,但阈值更保守,通常需要更大的校准集。
对于漏检风险控制,只需将最大化改为最小化即可选出最宽松但仍满足约束的阈值。此特性使实践者能根据场景在两类风险间灵活权衡。
创新点分析
- 极简设计,竞争性表现:仅用单一阈值和无时间结构的决策规则,便能在检测效果上比肩需要分步学习密度估计的复杂方法(如 e-valuator),实现更早的报警时刻。
- 统计保障的灵活性:提供了从弱到强的两种风险控制方式,并支持在错误报警和漏检之间自由切换控制对象,这是许多现有在线检测框架(如序列假设检验)所不具备的。
- 信号无关性与可扩展性:该方法可适配任意安全代理信号,无论是外部验证器还是模型内部置信度,均可直接接入框架。
- 原理清晰,计算开销极低:无需训练额外的密度估计器,校准仅需对校准集扫描一遍,部署时也仅做一次阈值比较,非常适合高吞吐的实时场景。
实验结果分析
论文在两个安全场景上进行了评估:事实正确性(数学推理)和无害性(红队对话)。
事实性监控(MATH 数据集)
使用 Claude Haiku(高正确率)和 Mistral-7B-Instruct(低正确率)作为生成器,信号为 Qwen2.5-Math-PRM 的步骤得分。结果显示,CRC 和 UCB 均实现了错误报警率的经验控制,其中 UCB 满足高概率保证。在检出率(Power)上,CRC 较 UCB 略高但略有风险超限的可能;有趣的是,虽然 e-valuator-anytime 在低 时有更高的检出率,但其报警时间显著晚于 CRC 和 UCB——后者通常能在序列一半长度时就发现错误,有效减少了有害输出曝露和 token 生成成本。
有害性监控(Red Teaming 与 FineHarm)
采用 Llama Guard 和安全分类模型提供实时安全信号。所有方法均保持报警风险受控。但在不同数据集上,表现差异明显:在 FineHarm 上,特调的分词级安全分类器信号很强,各方法检出率均接近 1;而在红队数据上,Llama Guard 信号较弱,所有方法的检出率难以超过 0.8,这凸显了 “监控器只能与其信号一样好” 的结论。
信号消融:外部验证器 vs. 内部置信度
考虑部署成本,论文尝试用生成模型自有的逐 token 对数概率(取每步最小值)代替外部 PRM。结果表明,同一报警率下,基于内部置信度的方法检出率显著下降(例如在 时,PRM 的检出率约 0.9,而内部置信度仅约 0.5)。这说明免费的内部信号会大幅牺牲监控质量,但若算力受限,仍可作为一种轻量选择。
漏检风险控制
当目标从控制错误报警转为控制漏检率时,CRC 和 UCB 方法依然能保证 受控,而 e-valuator 无法提供类似保证。实验显示,在 Claude 这样正确率高的模型上,为保证极低的漏检率,错误报警率会被推得很高;这再次展现了风险控制框架让用户自由定义安全约束的灵活性。
实践应用建议
- 根据代价选择控制模式:如果误中断用户体验的代价极高(如对话助手),应优先控制错误报警(CRC/UCB);如果漏掉有害输出后果严重(如医疗建议),则应控制漏检风险。
- 信号源选择需匹配场景:对安全性要求极高的场景,务选用专门训练的外部验证器,即使增加延迟和成本;对低风险、高吞吐场景,可考虑内部置信度作为廉价替代。
- 重视校准集质量:风险控制保障依赖于校准数据与部署分布可交换。实际部署时应及时更新校准集以反映数据分布的变化。
- 报警后处理衔接:报警不是终点,可联动人工审核、换用更严谨的模型或关闭对话等机制,形成完整的在线安全防护链。
未来发展方向
- 多信号融合与鲁棒性:探索将多个弱信号(如内部概率、外部分数、规则检查)组合成一个更强的联合信号,以提升在分布外或对抗情境下的可靠性。
- 时序结构建模:当前忽略信号的时间趋势,未来可引入帕累托检验等方法,为每步校准独立阈值,以捕获安全评分的系统性漂移。
- 成本自适应的信号选择:根据当前风险等级动态切换信号源,在保证安全约束的前提下减少开销。
- 针对高级攻击的防御:研究针对故意掩盖不安全行为的鉴别能力,以及对抗性样本下风险控制的鲁棒性。
总结与展望
这篇论文为 LLM 在线安全监控提供了一个统计严谨、实践轻量级的解决方案:通过风险控制校准单一阈值,将任何安全代理信号转换为具有形式化保障的实时报警机制。实验表明,这种简单方法在检测时机上优于复杂的序列假设检验方法,并能自由切换控制目标。该方法不仅为从业者提供了即用型工具,也揭示了在线监控的核心矛盾——信号质量与成本之间的权衡。未来工作有望在多信号融合、动态阈值和对抗鲁棒性等方向拓展这一框架,推动 LLM 部署安全从离线评估走向在线可控的新阶段。