大型语言模型的在线安全监控
Online Safety Monitoring for LLMs
论文信息
标题: Online Safety Monitoring for LLMs
作者: Mona Schirmer, Metod Jazbec, Alexander Timans, et al.
发布日期: 2026-07-02
arXiv ID: 2607.02510v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:如何在大模型(LLM)逐 token 或逐步骤生成输出时,实时检测不安全内容(事实错误、有害回复等),并在确保统计控制的前提下尽快发出警报。
- 核心方法:将外部验证器或内部模型给出的安全信号通过一个经过风险控制校准的单一阈值转化为二值警报决策,从而实现即时的停止判断。校准方式可采用符合预期控制(CRC)或高概率控制(UCB)。
- 关键结果:简单的阈值监控器在虚警率受控的情况下,与更复杂的 e-valuator(基于顺序假设检验)相比,能够更早地检测到不安全序列——在数学推理任务上,风险控制方法平均在序列进行到约一半时即告警,而 e-valuator 方法则延迟更大(图 1)。
- 主要局限:监控性能上限取决于所使用安全信号的质量;方法假设使用一个时间不变阈值,忽略了信号在不同生成步骤上的分布变化(作者自己也指出该限制)。
- 适合读者:需要为大模型推理部署配备安全实时护栏的工程团队、对风险控制与统计保证感兴趣的机器学习安全研究人员,以及关注大模型的可信监控的从业者。
论文背景和研究动机
虽然当前大模型已经过对齐训练,但部署时仍会生成事实错误、有毒内容或接受恶意指令,仅靠离线评估无法覆盖所有可能的提示场景。因此,在推理阶段实时监控安全状况并中途制止有害输出变得尤为重要。已有不少护栏工作在事后检测方面做了努力,但它们的召回通常发生在整个生成完成后,无法避免用户已经接触到部分不安全内容。该论文关注一种 “在线流式监控” 设定——即在输出不断产生的过程中,由监控器持续接收安全信号,一旦信号降至某一阈值以下就立刻报警并触发干预(如停止生成或转交人工审核)。这种设定面临两个天然挑战:安全标签不可得(只能依赖近似信号),且需要快速反应。该研究旨在提供一个简单、可解释的监控框架,同时为用户指定的误报或漏报风险提供严格的统计保证。
核心方法和技术细节
安全信号
监控器从每一步 得到一个安全信号 ,通常是外部验证模型(例如专门训练的过程奖励模型 PRM 或安全分类器 Llama Guard)预测当前部分输出属于 “安全” 的概率 。这类外部信号虽然能力强,但每次推理均需额外前向传播,成本较高。论文也探索了生成器自身的 token 对数概率作为免费替代信号:将每一步中所有 token 的最小对数概率作为该步的置信度得分——当某步包含模型极为不确定的 token 时,得分会很低,暗示潜在错误。
监控规则与阈值校准
监控器采用一个极其简单的停止规则:在时刻 ,只要有过 ()就报警,即 。阈值 利用一个带标签的校准集 进行选择,使监控器能控制两类风险之一:
- 误报风险(type I 错误):,即安全序列被错误报警的概率。
- 漏检风险(type II 错误):,即不安全序列未被报警的概率。
两类风险随 单调变化方向相反,论文让用户选择要控制的风险及目标水平 ,然后通过校准确定对应的 。
校准提供两种强度不同的统计保证:
- 控制期望(CRC):基于符合预期风险控制原理,在给定校准集上选择最大的 使得有限样本校正后的经验风险 ,从而保证测试时风险的期望不超过 (公式 4)。这种方法相对宽松,阈值较大,功率较高,但提供的是 “平均意义” 上的控制。
- 控制高概率(UCB):先计算经验风险的置信上界(例如 Hoeffding‑Bentkus 界),再选择最大的 使得该上界 (公式 6)。这保证对 比例的校准数据集提取,真实风险 (式子 (5)),因此是一种更强的、部署时 “大概率” 满足的保证,但阈值更保守,需要更多校准样本。
若控制的是漏检风险,只需将上述选择准则中的最大化改为最小化即可,因为此时经验风险随 递减。
与 e-valuator 的对比
论文还将该方法与 e-valuator(Sadhuka et al., 2025)对比。e-valuator 将监控问题建模为顺序假设检验:在每一步分别训练密度估计器来近似安全与不安全序列的信号分布,并基于似然比构建 e-process 以作出停止决策。其可提供随时有效的误报控制(anytime-valid),并提供了 PAC 变体以提升检测功率。所有方法使用相同的安全信号和校准数据。
创新点和贡献
- 极简的监控范式:仅需一个时间不变阈值,配合风险控制校准,即可实现具有统计保证的在线安全监控。与需要为每个步长训练密度估计器的方法相比,几乎没有额外的存储或计算开销。
- 灵活的风险谱控制:用户可以明确选择是要保护误报率(避免打断用户体验),还是要保证高检出率(确保不安全内容不漏网),并分别有期望控制与高概率控制两种选择。这在现有 LLM 护栏方法中并不常见,e-valuator 只能控制误报率而没有对漏检率的保证。
- 在延迟上展现优势:实验表明,简单阈值方法在不牺牲虚警控制的前提下,平均检测延迟更低(图 1、图 2 第三行),这缘于其对所有步骤使用统一标准,可以更早地响应不安全迹象,而不需要像 e-valuator 那样等待更多证据积累。
实验结果分析
事实性监控(数学推理)
在 MATH 数据集上,使用 Claude Haiku 4.5(高正确率)和 Mistral-7B-Instruct(低正确率)两种生成器,PRM 作为信号。主要发现(图 1):所有方法在误报率上基本满足其各自的控制要求(UCB 和 e-valuator-PAC 控制在目标之下;CRC 满足期望控制;e-valuator-anytime 在 Mistral 上部分 下轻微越界)。功率方面,e-valuator-anytime 在严格控制下可取得更高功率,但代价是偶尔失控;CRC 和 UCB 也能达到可比的检出率。更重要的是,在检测延迟上,CRC 与 UCB 比 e-valuator 方法显著更低——对于不安全序列,平均在序列完成约一半时就发出警报,而 e-valuator 需要更长时间(图 1 第三行)。这表明简单阈值能够更早阻断有害输出,减少对用户的影响和计算浪费。
无害性监控(红队讨论)
在 Anthropic Red Teaming 和 FineHarm 数据集上进行对话级监控,信号分别来自 Llama Guard 和专门训练的内容安全分类器。结果(图 2)表明,所有方法的误报率均受控。功率表现高度依赖信号质量:在 FineHarm 上,专用安全分类器提供了强信号,功率接近 1,CRC 和 UCB 达到最高;而在 Red Teaming 上,Llama Guard 的信号分离度较低,功率在所有方法上均停滞在 0.8 以下。延迟方面,简单阈值方法再次提前报警。这印证了一个核心观察:监控器不会比输入的信号更好。
信号成本与质量
在信号消融实验中(图 3),用生成器自身的 token 最小对数概率替代外部 PRM。结果表明,这种免费信号使功率大幅下降(例如在 时 PRM 功率超过 0.9,而对数概率信号仅约 0.5),尽管误报仍受控。这说明在部署中,节省计算成本会明显牺牲监控质量,必须在资源预算和安全要求间进行权衡。
实践建议
对于计划部署在线安全监控的工程师和团队,本文提供了一套可直接落地的轻量级方案:
- 信号选择优先投入外部验证器:如实验所示,使用专用安全分类器或 PRM 能带来远优于生成器内部置信度的性能。若延迟敏感,可考虑小型高效的安全模型作为代理,或采取级联方式:先用内部信号进行粗筛,可疑时再调用外部验证器。
- 根据业务风险选择控制类型:若交互式应用中虚警会严重影响用户体验,控制误报率()并选用 CRC 可以获得较大的阈值和较低的误报,但需容忍一定期望下的控制;若安全攸关场景下漏检代价极高,则应控制漏检率()并采用 UCB 或 CRC(视数据量和对保证强度的要求),即便这可能带来较高的误报。
- 校准集构建:需收集与部署分布同分布的带标签样本。对于高概率控制(UCB),由于阈值更保守,通常需要更大规模的校准集以获得有效控制。实际中可定期更新校准集以适配模型和行为变化。
- 延迟与吞吐权衡:监控器本身计算可以忽略(仅阈值比较),但外部验证器每步调用会增加推理成本。可通过增大步长(例如多个 token 作为一步)来降低调用频率,但会损失检测细粒度。建议根据任务关键度设计方案。
- 后续增强方向:论文作者指出未来可结合多信号融合或引入时序结构,例如为不同步骤设置自适应阈值。实践中可在此基础上,当警报触发时进一步调用更强的校验模型或人工介入,构成多层防御体系。