超越成功率:面向攻防安全代理的成本感知评估

arXiv: 2607.15263v1

论文信息

标题: Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents

作者: Paul Kassianik, Blaine Nelson, Yaron Singer

发布日期: 2026-07-16

arXiv ID: 2607.15263v1

PDF 链接: 下载 PDF

超越成功率:进攻与防守安全智能体的成本感知评估解析

在网络安全领域,对人工智能驱动的安全智能体进行评估时,一个普遍的倾向是衡量它们在充裕推理预算下的峰值能力。无论是漏洞发现、渗透测试,还是在夺旗竞赛(CTF)中完成挑战,现有基准测试通常只报告 “能否成功” 以及 “在多大程度上成功”。然而,在实际的安全运营中心(SOC)环境中,每一个推理步骤、每一次工具调用、每一项遥测查询和情报扩充请求,都会消耗真实的计算与经济成本。只关注最高成功率,而忽略达成该成功所需的资源投入,就如同只关注赛车的最高速度,却无视油耗与轮胎磨损——在长期实战中,这种评估方式远不足以反映真实价值。

研究背景与动机

传统安全智能体评估聚焦于进攻性任务,例如 Anthropic 的 Claude Mythos Preview 评估,在给予百万 token 的推理预算和完整的攻击者执行权限后,观察模型能够攻破多少 CTF 挑战或真实漏洞。这些测试揭示了模型的潜在能力,却忽略了成本约束。而在防守侧,一个合格的 SOC 分析智能体不仅需要回答调查问题,更应当能够高效地导航遥测数据、选择合适的搜索策略、判断何时值得付费调用外部情报接口,并在有限的资源下交付出分析师级别的答案。

因此,作者团队提出一种成本感知的评估框架,将成本作为比较进攻与防守安全智能体的统一坐标轴。他们并没有构建全新的任务,而是选用了两个成熟的公共基准:进攻性的 Cybench 挑战和防守性的 Splunk Boss of the SOC (BOTS) v1 调查任务,并在统一的评估工具 Inspect 框架下进行对比实验。关键转变在于,评估指标从单一的 “成功率” 变为 “在给定预算下能解决多少问题”,以及 “每美元能产生多少安全价值”。

核心方法与技术细节

论文的核心创新在于对 “成本” 的精细分解与核算。在进攻性的 Cybench 任务中,智能体仅使用免费的 bashpython 工具,成本几乎全部来自模型的推理 token 消耗。而在防守性的 BOTS v1 中,智能体除了使用 Splunk 搜索和事件检查等免费遥测工具外,还可以调用付费的外部情报服务,例如 WhoisXML API 的历史查询(每次 1.29)和BraveSearch(每次1.29)和 Brave Search(每次 0.005)。评估中对这些付费工具设置了调用次数上限,并在最终美元成本统计中纳入模型推理费用和定价工具费用。这种方式使得总成本清晰地分解为 “推理支出” 与 “工具支出” 两部分,从而能够精确观察不同模型的成本结构。

实验采用 ReAct 风格的智能体架构,并设置了自动上下文压缩机制。当对话上下文达到模型窗口的 90% 时,自动触发压缩以避免超出限制。所有运行都受到预算上限的约束,一旦累计成本超过设定值,该任务将被中断并视为失败。研究者通过回顾性分析,在已完成的高预算轨迹上施加较低的虚拟成本上限,从而在不重复运行的情况下,获得同一次运行在不同预算水平下的表现——这使得预算灵敏度分析成为可能,且避免了不同运行之间的随机性干扰。

此外,因为 BOTS v1 作为公共数据集可能已被部分模型在预训练时接触,论文设计了严格的污染控制实验:在完全不提供任何工具的情况下,仅依靠问题文本和模型自身知识来回答,以此评估基准成绩中有多大比例来源于死记硬背而非实时调查能力。

创新点与核心发现

本研究最突出的贡献是揭示了进攻与防守任务之间截然不同的资源缩放规律

在进攻性 CTF 任务上,模型性能与推理预算之间存在清晰的 “投入产出” 关系。以 DeepSeek v4 Flash 为例,在回顾性 0.80预算下成功率为76.10.80 预算下成功率为 76.1%,当预算放宽到 2.10 后,成功率提升至 86.4%,增加了约 10 个百分点。Claude Opus 4.8 的增益更为显著,从 $0.80 下的 55.6% 跳升至完全预算下的 74.4%,增量达 18.8 个百分点。这些结果表明,额外的推理计算允许智能体进行更长时间的沙箱探索、更多的命令执行尝试,从而从错误中恢复并最终解决更多挑战。在这种场景下,更多的算力投入确实能够直接购买到更多的能力

然而,防守性 SOC 调查展现出完全不同的模式。Claude Opus 4.8 在 0.80的极低预算下就已经捕获了绝大部分得分(91.30.80 的极低预算下就已经捕获了绝大部分得分(91.3%),完全放开预算后仅小幅提升至 93.9%,且其全过程中只调用了 603 次非提交工具。相比之下,DeepSeek v4 Flash 即使将预算上限从 2.10 翻倍至 $4.20,得分也仅仅从 73.0% 微升至 73.9%(提升 0.9 个百分点),而工具调用次数却从 4,450 飙升至 4,938。在这里,大量的工具调用和高昂的成本并未转化为调查成功率的提升。防守任务的关键瓶颈并非算力不足,而是智能体是否能够有纪律地使用工具、准确地导航遥测字段,并在正确的时刻进行选择性情报扩充。一个在迷宫中反复兜圈的智能体,并不会因为获得了更多的步数而自动找到出口。

另一个重要创新是对模型 “拒绝回答” 行为的精细记录。在进攻性任务上,GPT-5.6 和 Fable 家族模型因政策过滤导致了极高的拒绝率,例如 Sol 变体拒绝了 90.6% 的样本周期,Fable 更是全部拒绝,导致其进攻得分趋近于零。但在防守侧,相同的模型却可以正常回答,且 Fable 在出现少量拒绝事件的情况下仍然获得了 88.4% 的得分。这凸显出模型提供商的审核策略对评估结果可能造成的剧烈扭曲,尤其是在进攻性基准上的单一成功率排名可能完全失去意义。

实验结果深度解读

在 Cybench 硬变种测试中,GPT-5.5 以 94.1% 的成功率和极低的单次解决成本(1.16)占据绝对优势,成为效率最高的操作点。值得关注的是开源权重的DeepSeekv4Flash,在最高预算下达到86.41.16)占据绝对优势,成为效率最高的操作点。值得关注的是开源权重的 DeepSeek v4 Flash,在最高预算下达到 86.4% 的成功率,而其成本仅为 1.45/每次解决,展现出极具竞争力的成本效益比。这意味着,在预算有限的实战环境中,通过合理的成本控制,开源模型已经可以接近顶级闭源系统的进攻能力。

在 BOTS v1 防守侧,Claude Opus 4.8 以 93.9% 的得分和最低的单位成本(每千分 $2.98)领先。然而,无工具污染探针实验暴露了大幅度的 “记忆” 成分:该模型在没有任何工具、仅提供题目前置上下文的情况下,竟能拿下 74.8% 的分数;即使连上下文都去掉,仍有 50.0% 的准确率。这警示我们,对于公开已久的 SOC 基准,任何未经验证的绝对得分都可能是海市蜃楼,必须强制执行污染检查,否则会将 “题库背诵能力” 误判为 “调查分析能力”。

实践应用建议与未来展望

对于实际部署安全智能体的团队,本研究提供了几项具体的操作指南:

  1. 设定并监控成本上限:不要在无约束的情况下放任智能体自由探索。应根据实际攻防场景,设定合理的单次任务预算,并选择在该预算下效率最高的模型,而非原始成功率最高的模型。
  2. 区分任务类型进行模型选型:如果主要任务是漏洞挖掘或 CTF 风格挑战,增加推理预算有望获得显著回报;但如果用于 SOC 告警调查,应优先选择工具调用精确、能够高效定位关键遥测的模型,而非盲目追求更强的推理引擎。
  3. 建立工具使用效率仪表板:定期分析智能体的工具调用次数、付费接口消耗与最终调查结果的关系,识别是否存在高调用量低产出的 “僵尸行为”,并及时调整提示词或工具设计。
  4. 实施数据污染防护:无论是构建内部基准还是使用公共基准,都应结合无工具基线、混淆问题或独立保留的隐秘测试案例,以剔除模型记忆带来的假阳性,确保评估反映的是实时分析能力。

展望未来,安全智能体的评估应继续向 “经济效率” 与 “运营适配性” 演进。下一步可扩展至更复杂的 BOTS v2/v3 数据集,涵盖端点和云遥测,并通过私有、未公开的调查场景进行无污染测试。此外,应探索动态定价模型,使智能体具备内生的成本意识,学会在推理过程中主动权衡付费接口调用的价值。这种将经济学思维注入智能体设计的范式,将推动网络安全自动化从实验室演示走向生产环境的真正落地。

总之,本文开创性地将成本会计引入安全智能体评估,揭示了进攻与防守任务在资源需求上的本质差异,并提供了可操作的基准和测量方法。它提醒所有实践者:在安全运营的棋盘上,每一步都有价格标签,而胜利的不仅是能够得分的一方,更是以最优性价比得分的一方。