KaliBench:面向 Kali Linux 网络安全工具使用的细粒度基准测试,具有无需运行时的可验证奖励
KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards
论文信息
标题: KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards
作者: Pengfei Li, Naufal Suryanto, Sicheng Zhang, et al.
发布日期: 2026-10-01
arXiv ID: 2610.02206v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:现有 LLM 网络安全评测偏重知识问答或端到端代理任务,没有直接度量模型将自然语言安全意图翻译为 Kali Linux 可执行 CLI 命令的能力。论文要填补这一空白。
- 核心方法:构建 KaliBench 基准,包含 8,504 条查询-命令对、1,642 个工具、23 个能力维度;通过文档支撑生成、LLM 验证、沙盒执行、人工在环过滤,并用别名感知的细粒度评分和免运行时可验证奖励训练。
- 关键结果:在无限制设置下,最强开源权重模型 GLM-5.2 的精确命令准确率仅 41.3%,没有任何开源模型超过 42%(表 1)。
- 主要局限:作者承认聚焦单轮命令生成、依赖文档合成数据,未覆盖多步工作流、检索增强工具使用和环境感知评估(论文第 5 节)。
- 适合读者:LLM 网络安全工具调用、基准设计和可验证奖励训练的研究者,以及构建安全运营自动化工具的红队/蓝队工程师。
论文背景和研究动机
现有网络安全 LLM 基准大致分为两类:一类如 CyberMetric、SECURE 等,通过选择题、简答题评估概念理解;另一类如 CyBench、NYU-CTF Bench 等,在 CTF 或模拟企业环境中评估端到端代理行为。但作者指出,现代安全运营依赖大量 CLI 工具链,Kali Linux 提供超过 2,000 个预装工具。分析师需要把 “扫描该子网的 SMB 错误配置” 这类高层目标,翻译成 Nmap、Metasploit、Volatility 等工具的精确命令。CLI 语法严格,参数顺序、标志拼写或别名误用都会导致执行失败。与此同时,BFCL、ToolSandbox 等函数调用基准假设工具 schema 显式给定,不适合 Kali 环境中难以在提示中枚举数百个工具 schema 的场景。因此论文提出 schema-free 的 natural-language-to-CLI 评估问题。
核心方法和技术细节
KaliBench 的数据构建从 Kali 官方文档仓库提取 2,372 个工具的结构化手册,包括长短选项和别名。使用 Qwen3-Max 为每个工具生成 10-13 条查询-命令对,初始为 27.7K 条。由于幻觉严重,初始人工检查显示超过 50% 的命令含幻觉或拼写错误选项。论文采用多阶段验证:LLM-as-verifier 首轮过滤 53.8%,迭代重新生成后得到 14.5K 条;然后在 Docker 的 Kali-linux-everything 镜像中沙盒执行每条命令,依据 stdout、stderr、exit code 等规则再过滤 11.95%;最后人工在环分析最强模型在 Hinted 设置下的失败案例,发现额外 4.9% 无效。最终保留 8,504 对,占原始数据 30.7%。划分 5,000 条评测集(覆盖全部 1,642 个工具)和 3,504 条训练集(覆盖 962 个工具)。
评测有三种模式:Unrestricted 仅给查询;Restricted 给 20 个候选工具名(含正确工具);Hinted 再给候选工具官方文档。解析使用 Python shlex,利用标注的工具名、可选参数(别名感知的 flag-value 对)和位置参数,计算工具准确率、可选参数 F1、位置参数 F1、总分和精确正确率。Kali metapackage taxonomy 将工具分为 23 个能力维度,再按 Lockheed Martin Cyber Kill Chain 归入 5 个安全阶段。
训练方面,论文以 RedSage-Ins(8B)为 backbone,使用 LoRA 进行 SFT、GRPO(RLVR)和 SFT+GRPO 三种后训练。训练数据为 3,504×3=10,512 条。奖励函数由组件级指标构成;由于 ground-truth 命令已经沙盒验证,奖励无需运行时执行模型输出,因此称为 runtime-free verifiable rewards。
创新点和贡献
论文的贡献可归纳为:第一个针对 schema-free CLI 设置的网络安全工具调用基准,拥有 8,504 条查询-命令对和细粒度工具/参数标注;经过沙盒执行和人工在环验证的高质量可执行数据集;利用确定性 CLI 结构提供免运行时可验证奖励,支撑可扩展强化学习;以及细粒度评测揭示参数构造而非工具选择是主要瓶颈,并通过后训练让 8B 模型接近 685B MoE 模型。
实验结果分析
表 1 显示,在无限制设置下,开源权重模型表现有限:GLM-5.2 精确正确率最高为 41.3%,DeepSeek-V3.2 为 33.0%,所有模型平均 22.3%。Restricted 模式将平均工具准确率从 72.0% 提高到 95.2%,但可选参数 F1 仅从 45.1% 升至 48.7%,位置参数 F1 从 61.1% 升至 68.2%,精确正确率仅升至 28.3%。Hinted 模式带来最大提升:可选 F1 升至 87.8%、位置 F1 升至 90.1%、精确正确率升至 73.1%,说明文档主要解决参数构造而非工具识别(表 1)。
安全专用模型并不总是全面优于通用模型:在 U 和 R 下,RedSage-Ins 总分高于非推理 Qwen3(56.4 vs 55.5;69.3 vs 68.2),但 H 下 Qwen3 更高(91.6 vs 89.5)。推理增强模型(如 Qwen3 thinking)提升参数指标,8B Qwen3 thinking 平均总分 73.8,超过 27B Gemma-3-it 的 71.2 和 70B Llama-Primus-Ins 的 72.7(表 1)。因此在该数据集下,规模并非决定因素。
专有模型表现更强但仍未饱和:GPT-5.6-Sol 完整集精确正确率 61.68%,Codex 51.68%,Claude Opus 5 为 44.02% 且只回答 3,675/5,000 查询(表 2)。KaliBench 后训练效果显著:RedSage-K (SFT+GRPO) 平均总分 79.2,仅比 DeepSeek-V3.2 的 80.2 低 1.0 个百分点,且 U/R 下总分和精确正确率在紧凑模型中最优(表 1)。但 GRPO 变体在 H 模式总分比原始 RedSage-Ins 略降(88.77 vs 89.53),附录 I 显示其纠正了 537 个基准失败但回归了 562 个成功案例;SFT 初始化缓解了这一退化。
维度分析(图 5)显示 gpu 和 crypto-stego 维度得分较高,802-11 和 wireless 较低,hardware 在 H 模式仍较低。常见失败模式包括长短选项误用、选项幻觉、发明长选项及单复数混淆(论文第 4.2 节)。对查询变化的鲁棒性(表 3):改述仅微增,非正式表述小幅下降,噪声查询在 U 设置下总分下降 3.20 个百分点,而 H 模式下降仅 1.07,说明文档可部分缓解噪声但未消除。
实践建议
在 KaliBench 评测范围内,有几个可落地的启示。第一,部署安全 LLM 辅助工具时,不要仅依赖模型内部记忆生成命令:Hinted 模式显著改善参数构造(可选 F1 从 45.1 到 87.8,表 1),因此应提供候选工具文档或检索增强片段,尤其对选项复杂的工具。第二,后训练紧凑模型时,可采用 KaliBench 这类细粒度、免运行时奖励:SFT+GRPO 使 8B 模型在 U 和 R 模式下总分分别提升约 14 和 8.6 个百分点(附录 I 表 6),接近大模型,适合本地或敏感环境。第三,评估系统应区分工具选择与参数构造指标,否则平均分可能掩盖瓶颈;例如 Restricted 模式已解决大部分工具选择,但精确正确率仍低,说明应重点回归可选参数和值绑定。第四,对用户输入质量敏感:噪声查询在无工具文档时总分下降 3.20 个百分点(表 3),实际部署中可对查询做规范化或强制提供文档上下文。第五,专有 API 可能有安全相关的响应覆盖率限制(Claude Opus 5 只回答 73.50% 查询,表 2 相关段落),本地开源模型在覆盖率和数据驻留方面值得评估。