RedSage:一个网络安全通用大语言模型
RedSage: A Cybersecurity Generalist LLM
论文信息
标题: RedSage: A Cybersecurity Generalist LLM
作者: Naufal Suryanto, Muzammal Naseer, Pengfei Li, et al.
发布日期: 2026-01-29
arXiv ID: 2601.22159v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:网络安全领域需要支持多种工作流的本地化 AI 助手,但现有方案要么依赖有隐私风险的云 API,要么缺乏领域适配的开源模型无法胜任专业任务。
-
核心方法:通过大规模网页过滤收集 117 亿 tokens 的网络安全持续预训练数据,设计智能体增强流水线生成 26.6 万条多轮对话用于监督微调,并构建涵盖知识、技能和工具的 3 万题基准测试。
-
关键结果:RedSage-8B 在网络安全基准上领先基线模型最高 +5.59 分,同时在 Open LLM Leaderboard 通用任务上提升 +5.05 分(见论文表 5、表 6)。
-
主要局限:数据流水线依赖 LLM 生成和验证,可能传播偏见或不准确信息;模型包含攻击性安全知识,存在潜在的误用风险(见论文第 5 节)。
-
适合读者:对大语言模型领域适配、网络安全 AI 助手、数据增强流水线感兴趣的研究人员和工程师。
论文背景和研究动机
全球网络安全威胁的快速演变对防御策略提出了更高要求,组织面对的不仅是常规攻击,还有日益复杂的高级持续性威胁。现代网络安全运营涵盖威胁分析、事件响应、漏洞管理和安全监控等一系列关键任务。然而,这些安全工具的复杂性以及所需的专业操作水平构成了巨大挑战。更严峻的是,全球网络安全人才严重短缺,据估计供需缺口达数百万个空缺职位(见论文第 1 节)。
这种背景下,业界对部署网络安全专用大语言模型以增强人类分析师能力的兴趣持续增长。现有工作虽已产出一些网络安全领域的训练模型,但大多只强调单一训练阶段。有的仅扩展领域预训练但在后训练阶段数据有限(如仅 835 条样本或不足 3 万条过滤项),有的专注于监督微调却缺乏强化领域知识的预训练阶段。此外,现有基准测试覆盖不全,往往遗漏工具使用能力和开放式问答的质量评估(见论文表 1)。
更为关键的是,大多数相关工作未公开其数据或流水线,严重制约了可复现性和开放性(见论文表 2)。为了弥合这些差距,作者提出了 RedSage——一个面向网络安全的开源大语言模型,整合了大规模持续预训练、精心策划的数据集、智能体增强的监督微调,以及覆盖知识、技能和工具使用的全面评估体系。
核心方法和技术细节
RedSage 的构建遵循一条以数据为中心的三阶段流水线。
预训练数据构建是整个系统的基石。作者从 FineWeb 大规模网页语料库(约 15 万亿 tokens)中过滤网络安全内容。他们微调了一个基于 ModernBERT-base 的分类模型来识别网络安全文本,从 1.25 亿份文档中筛选出约 898 亿 tokens 的候选池。为缓解领域训练中的灾难性遗忘问题,作者以 30% 的回放比例混入 FineWeb-Edu 通用知识数据,并通过 MinHash-LSH 进行全局近似去重,最终得到约 468 亿 tokens 的混合语料。考虑到计算资源约束,仅选取最近 5 个时间段的数据块,形成最终的 CyberFineWeb 语料库:约 1300 万份文档,117 亿 tokens(见论文 3.1 节)。
除网页数据外,作者还精心策划了 RedSage-Seed 数据集,包含 28637 个高质量样本(约 1.5 亿 tokens),分为三大类:知识(MITRE ATT&CK、CAPEC、CWE、OWASP 等框架)、技能(渗透测试报告、攻击技巧、Payload 示例、道德黑客教程)和工具(命令行速查表、Linux 手册、Kali 工具文档)。同时收集了约 45.9 万份来自教育门户、安全新闻、RFC 文档、NIST 出版物等来源的未分类文档作为额外的预训练数据补充(见论文表 8、表 9)。
智能体增强流水线是 RedSage 在方法上的核心创新。受 AgentInstruct 启发,作者设计了双层智能体架构。Planner Agent 分析每块种子数据,推导出候选技能集合(如漏洞分析、工具命令生成)和增强策略;Augmenter Agent 则将每个计划实例化为基于角色、扎根于种子数据的多轮对话。这一流水线从 28637 个种子样本扩展到约 26.6 万条多轮对话(约 3.52 亿 tokens),实现了样本量 9.2 倍和 tokens 量 2.3 倍的扩展(见论文表 3、表 10)。
基准测试构建同样采用智能体方法。选择题部分从种子数据生成,经过结构验证和质量评分两阶段筛选,最终保留 3 万个高质量选择题-答案对,均匀分布在知识、技能和工具三个维度。开放式问答部分经过 Evaluation-Planner 和 Question-Answer Generator 两个智能体生成,由 LLM-as-Judge 根据事实正确性和答案质量(0-10 分)评估,并由人工验证最终筛选 240 个高质量问答对(见论文 3.3 节)。
训练流程分两个主要阶段。持续预训练使用 Qwen3-8B-Base 作为基础模型,在 32 张 A100-64GB GPU 上进行分布式训练,依次在 CyberFineWeb 和 RedSage-Seed 上进行训练。后训练阶段则在 RedSage-Conv 和通用指令数据 SmolTalk2 上进行监督微调,再使用 Tulu 3 偏好混合数据集进行直接偏好优化对齐(见论文 3.4 节和图 5)。
创新点和贡献
RedSage 的工作在多个层面做出了贡献。
从数据层面看,这是目前公开的最大规模网络安全 LLM 训练数据集合之一。预训练语料 117 亿 tokens 超过 PRIMUS 的 2.57B 和 Foundation-Sec-8B 的 5.1B,且监督微调数据达到 26.6 万条,远超其他工作的数百至数千条规模。更重要的是,所有数据、模型和代码都将完全开源,为社区提供了完整的可复现基准(见论文表 2)。
从方法论层面看,智能体增强流水线是论文最具特色的创新。不同于简单的数据扩充,这种方法通过专家智能体分析种子内容并生成多样化、扎根于源数据的多轮对话,能够模拟真实的网络安全专家工作流。从种子到对话的 9.2 倍样本扩展证明了这套方法的效率,而保留技术深度则确保了训练数据的质量(见论文表 3)。
从评估层面看,RedSage-Bench 首次将工具使用能力纳入网络安全基准测试的核心维度。如表 1 所示,现有基准测试多聚焦于知识或应用,缺乏对命令行工具如 Kali Linux 和 CLI 操作的系统评估。RedSage-Bench 的 3 万道选择题和 240 道开放式问答跨越知识、技能和工具三个维度,填补了这一评估空白(见论文图 2)。
从实践意义看,RedSage 在 8B 参数规模上实现本地可部署性,支持在消费级 GPU 上进行隐私保护推理。这对于需要确保敏感数据不出组织的安全运营场景具有重要价值。
实验结果分析
RedSage 在多个维度上展现出竞争力。
在自身基准 RedSage-Bench 上,选择题评估中 RedSage-8B-Seed 在基础模型中取得最佳成绩(macro-accuracy 85.21%),RedSage-8B-Ins 在指令微调模型中表现最优(85.73%),超过 Qwen3-8B 达 3.88 个百分点,甚至接近更大的 Qwen3-32B(85.40%)(见论文表 4)。开放式问答评估中,RedSage-8B-DPO 相比第二好的 Qwen3-8B 在平均正确率上高出 7%,在平均质量分数上高出 0.07 分。分面小提琴图进一步揭示了工具使用任务是最具挑战性的维度(见论文图 6)。
在已有网络安全基准上,RedSage 基础模型在 CTI-Bench、CyberMetric、MMLU-CSec、SecBench 和 SECURE 等 5 个基准的均值上达到 84.56%,超过 Qwen3-8B-Base 的 80.81%;指令微调版本达到 81.30%,领先 Qwen3-8B 达 5.59 个百分点。值得注意的是,不同预训练策略展现出互补优势:CyberFineWeb 强化了 SecBench 和 CyberMetric 上的表现,而 Seed 数据提升了 CTI-Bench 的 Root Cause Mapping 和 MMLU-CSec 等任务(见论文表 5)。
在通用 LLM 基准上,RedSage 后训练模型同样保持竞争力。RedSage-8B-DPO 在 7 个基准的均值上达到 74.33%,超过 Qwen3-8B(65.92%)和 Qwen3-32B(73.17%)。其中 Seed 阶段提升了数学推理能力(GSM8K 达 82.34),CFW 阶段强化了通用知识和推理(MMLU 和 ARC-C),DPO 对齐改进了指令遵循能力(IFEval 83.44%)(见论文表 6)。
这些结果表明,经过精心设计的领域感知持续预训练和后训练策略,不仅没有损害模型的通用能力,还能产生协同增强效应。
实践建议
尽管 RedSage 本身定位为研究项目,但其方法论和工具对网络安全 AI 实践者具有指导意义。
数据流水线的可迁移性。RedSage 的智能体增强流水线并非仅适用于网络安全领域。其核心设计——先分析源数据再规划增强策略后生成的递归流程,可以适用于任何需要专业知识的领域模型构建。附录 D.1 初步验证了这一流水线在 Qwen3-32B 上的可迁移性。
增量域适应的实际路线。RedSage 采用的分阶段训练策略——先大规模网页过滤获取广泛覆盖,再精选高质量资源深化专业知识,最后通过增强对话实现任务对齐——构成了一套可操作的领域 LLM 训练范式,可供企业构建内部安全助手时参考。
工具操作作为核心评估维度。RedSage-Bench 对命令行和 Kali Linux 工具的系统覆盖提醒实践者:安全 AI 助手的关键价值不仅在于知识问答,还在于辅助执行具体操作任务,这一维度应在评估体系设计中获得充分权重。
开源生态的建立。RedSage 的完全开放策略(模型+数据+代码)为社区提供了对比实验的基准线和二次开发的基础设施。实践者可基于此构建定制化的安全操作助手,特别是在需要数据隐私保护的本地部署场景中。