超越成功率:进攻性与防御性安全智能体的成本感知评估
Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents
论文信息
标题: Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents
作者: Paul Kassianik, Blaine Nelson, Yaron Singer
发布日期: 2026-07-16
arXiv ID: 2607.15263v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文质疑了安全智能体(AI agent)仅以 “最终成功率” 作为评估标准的做法,提出在真实的攻防场景中,每一步推理、工具调用都会消耗预算,因此必须从 “成本-成功率” 的视角重新审视模型能力。
- 核心方法:作者在一个统一的评估框架下,对多个前沿大语言模型在攻击性 CTF(Cybench)和防御性 SOC 调查(Splunk BOTS v1)任务上进行测试,并将 “推理花费” 和 “外部工具调用花费” 纳入最终的成本核算,比较模型在固定预算下的表现。
- 关键结果:攻击和防御任务展现出截然不同的资源扩展规律。攻击任务上,增加推理预算能稳定提升成功率;但在防守任务中,表现最好的模型(Claude Opus 4.8)以最少的工具调用次数和较低的成本取得了最高分(93.9%,成本效率为每 1000 分$2.98),而某些模型即使花费更多、调用更多工具,得分也未见明显提升(见论文第 4.2 节,表 3)。
- 主要局限:研究使用的是公开且较旧的 Splunk BOTS v1 数据集,存在数据污染风险,作者专门设计了无工具对照组证实了这一点,因此绝对分数不能直接等同于模型的真实防御能力(见论文第 5 节)。
- 适合读者:对 AI 安全、安全运营中心自动化、大模型智能体评估以及成本工程感兴趣的读者,尤其是需要从经济可行性和实操适配性角度选型的技术负责人和研究员。
论文背景和研究动机
当前,评估大语言模型在网络安全领域能力的主流方法,往往是给予模型宽松的推理预算,衡量其在漏洞发现、漏洞利用开发、CTF 解题等攻击性任务中的 “峰值性能”。例如,近期对 Claude Mythos Preview 的评估就组合了多种攻击性测试,并使用百万级 Token 的预算。这篇论文指出,这种做法虽然能追踪攻击者可能滥用的能力边界,却忽视了真实安全运营的核心约束:成本。在安全运营中心(SOC)中,每一次推理步骤、每一次遥测查询、每一次外部情报富化请求,都在消耗预算。因此,评估不应只问 “模型能走多远”,更应问 “在给定的预算下,模型能买到多少能力”。
正是基于这一矛盾,作者提出将 “成本” 作为比较攻击型和防御型安全智能体的共同轴线。这种视角尤其关键,因为它解构了两种常被混为一谈的成本:攻击型 CTF 任务主要消耗推理算力和命令执行,而防御型 SOC 调查则大量消耗分析师层面的资源,如 Splunk 查询、事件检查、网络搜索和 WHOIS 历史记录查询。论文旨在通过一套统一的框架,揭示在这两类任务中,模型的成功与成本之间的真正关系。
核心方法和技术细节
为了进行成本感知的评估,论文采用了 Inspect 评估框架来组织实验,并使用了基于 ReAct 范式的智能体,在上下文达到模型窗口的 90% 时进行自动压缩。
评估任务与工具设置:
- 攻击性任务(Cybench):包含 39 道来自多项网络安全竞赛的 CTF 题目,涉及 Web 漏洞利用、二进制安全、逆向工程等多个领域。智能体只能使用
bash和python工具,这些工具被视为零边际成本,核心成本在于模型推理。最终通过提交并匹配隐藏的 flag 令牌来计分,每个挑战最多尝试 3 次提交。 - 防御性任务(Splunk BOTS v1):包含 31 个计分问题,围绕 Po1s0n1vy 网页篡改和 Cerber 勒索软件事件进行调查。智能体可以获得 Splunk 搜索与事件检查工具,以及受限的 VirusTotal、WHOIS、DNS、Brave 网页搜索等外部富化工具。论文对昂贵的外部工具调用设置了数量限制,并为它们标定了价格,例如 Brave 搜索每次$0.005,WHOIS 历史购买每次$1.29。
成本核算与预算控制: 成本核算是该方法的核心。总成本由 “模型推理花费” 加上 “外部工具调用花费” 构成。对于 Cybench,仅计算模型 Token 成本。对于 BOTS v1,则二者相加。论文为每个样本运行设定了成本上限,超支则视为任务失败。通过设置一系列固定成本上限,可以绘制出模型在不同预算下的成功率曲线,并计算出如 “每次解题成本” 和 “每千分成本” 等经济学指标。
创新点和贡献
这篇论文的核心创新在于评估理念和评估框架的构建,而非提出新的算法模型。其主要贡献可以概括为以下三点:
-
提出并实践了成本-成功率评估范式:论文首次在统一的框架下,对攻击和防御两类安全智能体进行详细的成本核算和比较。它将 “成本效率” 作为一项关键指标,例如在 Cybench 中,DeepSeek v4 Flash 虽然整体成功率(86.4%)略低于 GPT-5.5(94.1%),但其成本仅为$1.45/题,比某些模型更具经济性(见表 2)。在 BOTS v1 中,Claude Opus 4.8 以$2.98/千分的成本效率领先(见表 3)。
-
揭示了攻击与防御任务的差异化扩展规律:这是论文最重要的发现。研究清晰地表明,更多的推理预算并不能直接转化为更好的防御效果。在 Cybench 中,对 DeepSeek v4 Flash 进行迹后回溯,发现当预算从$0.80 提升到$2.10 时,成功率从 76.1% 显著提升至 86.3% (增益 10.3 个百分点)(见表 5)。而在 BOTS v1 上,同一个模型将成本上限从$2.10 提高到$4.20,得分仅从 73.0% 微增至 73.9% (增益 0.9 个百分点,且该增益在统计学上不显著)(见第 6 节,表 5)。这表明防御任务的成功更多依赖纪律性的工具使用和准确的遥测导航,而非原始算力。
-
强调了公开基准测试的数据污染问题:论文通过一个关键的 “无工具” 对照组实验,为社区敲响了警钟。即便不提供任何 Splunk 工具和上下文,GPT-5.5 仅凭问题文本就能在 BOTS v1 上取得 54.9% 的得分率,Claude Opus 4.8 则达到 50%(见表 4)。这有力地证明了模型的 “高分” 可能部分来自训练时对公开数据的记忆,而非实时调查分析能力。作者因此主张,公开的 SOC 基准测试必须包含去污染检查。
实验结果分析
实验覆盖了 GPT-5.5、GPT-5.6 系列、Claude Opus 4.8、Claude Fable 5 以及 DeepSeek v4 系列等多款前沿模型。
攻击性任务结果 (Cybench) 在攻击性 CTF 中,GPT-5.5 综合表现最优,以$1.16/题的性价比达到了 94.1% 的成功率(表 2)。预算提升对模型表现的影响显著。通过 “迹后预算上限” 分析,论文发现部分模型的成功高度依赖高额预算。例如,Claude Opus 4.8 的六月运行结果在$0.80 预算下仅 55.6%,当放开到全预算后飙升至 74.4%(+18.8%)。而 DeepSeek v4 Flash 也展现了类似趋势,增益达 10.3%(表 5)。相比之下,GPT-5.5 的大部分成功在低于$0.80 成本时就已经完成,预算增加带来的增益仅为 2.6%。这表明不同模型的能力实现成本不同。此外,一个值得注意的现象是,GPT-5.6 Sol 版本在 Cybench 中出现了高达 90.6% 的拒绝率,Claude Fable 5 更是 100% 拒绝执行任何工具调用,说明 “政策合规性” 已成为影响攻击性任务表现的重大新变量(图 2)。
防御性任务结果 (Splunk BOTS v1) 防御任务的评分基于其带罚分的机制,更贴近真实调查。Claude Opus 4.8 以 93.9% 的得分率和最低的工具调用次数(603 次)登顶,展现了极高的效率和纪律性(表 3)。GPT-5.5 模型的得分仅为 81%,且成本效率($6.76/千分)远低于前者。令人印象深刻的是 DeepSeek v4 Flash 的表现:即使在$4.20 的高预算下,模型进行了多达 4938 次工具调用,得分率也只有 73.9%;而在$2.10 预算下,4500 次调用得到了几乎相同的 73.0% 得分率。这种 “高投入、低回报” 的模式与攻击任务的扩展曲线形成鲜明对比,再次印证了论文的核心主张:防御任务中,工具调用的质量和分析路径的选择远比数量和推理预算重要(图 6)。
实践建议
对于计划将大语言模型集成到安全运营流程中的团队,这篇论文提供了几项可直接指导决策的洞见:
-
为不同任务建立独立的评估与选型标准:不要用攻击性任务的基准去衡量一个模型在 SOC 中的潜力。对于自动化渗透测试或漏洞挖掘,可以优先考虑在给定预算下任务解决率高的模型,并且预留一定的算力弹性,因为额外的推理计算可能带来实质性的性能提升。但在 SOC 防御场景中,纯粹的模型智能测试得分意义有限,必须构建包含真实日志、罚分机制和明确预算上限的模拟环境。
-
将 “工具调用效率” 作为核心考核指标:在评估防御性智能体时,应避免被其调用工具的绝对值所迷惑。一个频繁而无效调用 API 的智能体不仅成本高昂,还可能造成分析噪音。团队应像论文分析 Claude Opus 4.8 那样,关注 “单位分数所需的工具调用次数” 和 “单位成本获取的分数” 这类经济效率指标。
-
警惕公开数据集所带来的能力幻象:在将基于公开数据(如 BOTS v1)训练的模型应用到真实生产环境前,务必进行 “去污染” 测试。可以效仿本文,设计一个无工具/无上下文的对照组,以量化模型究竟是在进行实时分析,还是在依赖其记忆中的 “标准答案”。生产环境的最终选型,应基于私有的、保密的内部数据集进行验证。
-
将模型的政策合规性纳入风险考量:实验结果中 GPT-5.6 和 Claude Fable 系列模型在攻击性任务中表现出的高拒绝率是一个重要的实践提醒。在自动化安全系统的设计中,一个过度 “安全” 从而拒绝执行任何潜在风险操作的模型,可能与一个不受约束的模型一样无用。选型时需平衡能力与策略,确保智能体在安全边界内高效完成指令。