RedEvoAgent:经验驱动技能演化的自动红队智能体
RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution
论文信息
标题: RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution
作者: Junjie Zhang, Hui Liu, Kecheng Chen, et al.
发布日期: 2026-08-27
arXiv ID: 2608.27439v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:该论文解决产品级 LLM agent 越狱攻击的自动评估问题,聚焦固定攻击和轨迹检索型红队方法的归因偏差、上下文开销与可解释性不足。
- 核心方法:提出 RedEvoAgent,将跨案例攻击轨迹蒸馏为可读的攻击技能文档,并通过工具有效性画像、Deciding-Tool Attribution 和验证棘轮进行技能演化。
- 关键结果:在 ASB MiniMax-M2.5 + Claude Code 设置下,RedEvoAgent 的 ASR 达 93.2%,超过最强孤立工具 FlipAttack 的 91.8% 和 RedCodeAgent 的 76.4%(表 1)。
- 主要局限:验证集多样性不足时,可能出现验证集提升但测试集回退;整体效果也依赖攻击工具箱强度与互补性(论文第 4.3 节及结论部分)。
- 适合读者:LLM agent 安全、自动红队、越狱评估,以及 agent 技能演化的研究与工程人员。
论文背景和研究动机
LLM agent 正被部署到 Claude Code、Codex 等产品级执行环境,可修改文件、调用 API。论文指出,越狱一旦成功,可能引发破坏性工具使用和系统状态持久变化,风险高于单纯不安全文本。因此,需要自动红队对产品级黑盒 agent 做连续安全评估。但多数现有方法依赖固定攻击机制,如 GCG、AutoDAN、FlipAttack,它们只探索有限攻击空间,在 agent 环境中可能漏掉其他攻击机制暴露的漏洞。
RedCodeAgent 等 agentic 攻击方法通过语义相似度检索历史成功轨迹,展现出更强潜力。但论文认为,轨迹检索存在检索偏差、工具贡献不清、全轨迹上下文开销大、可解释性差等问题。与此同时,通用 agent 技能学习工作 Trace2Skill、SkillOpt 等表明,高层技能摘要可能优于轨迹检索。RedEvoAgent 因此将自动红队经验提炼为可演化的攻击技能文档,而不是检索完整轨迹。
核心方法和技术细节
RedEvoAgent 将目标 agent 记为 ,攻击 agent 在 ReAct 循环中选择 QueryTarget 或工具箱 中的工具,预算为 。技能 是插入攻击 agent 系统提示的可读 Markdown 文档。工具箱包含 GCG、AutoDAN、AmpleGCG、Template、FlipAttack、RolePlay 和 Prompt Substitution。
经验收集分两部分。首先是工具有效性画像:在训练集 上单独评估每个工具 ,得到 。其次是轨迹收集:用当前最优技能在 上运行攻击 agent,记录工具调用、候选提示、QueryTarget 动作和目标响应。
为减少 “共现即有效” 的归因偏差,论文提出 Deciding-Tool Attribution。它把每条成功轨迹归因于首次成功 QueryTarget 之前最后调用的工具。作者称,这不是新增攻击能力,而是稳定性机制:在攻击 agent 本身存在工具偏好时,可避免错误偏好被不断写回技能,降低策略塌缩风险。
技能更新由验证棘轮控制。候选技能由蒸馏 agent 合成,输入当前技能、工具画像、训练轨迹和拒绝上下文;候选必须在验证集上严格优于当前最优技能,才能被接受。更新规则为:若 ,则接受 ;否则保留 ,并把候选及其验证分数加入拒绝上下文,供后续迭代避免重复无效方向。
创新点和贡献
第一,RedEvoAgent 用技能级抽象替代轨迹检索,降低了推理时的上下文开销,也便于人类审计攻击策略。表 2 显示,演化技能在多个设置下既表现更好,又使用更少攻击工具调用。
第二,Deciding-Tool Attribution 改善了工具贡献归因。消融实验显示,移除该机制后,在 ASB MiniMax-M2.5 + Claude Code 设置下 ASR 从 93.2% 降至 87.5%(表 3)。
第三,验证棘轮把候选技能的接受与留出验证性能绑定,而不是直接信任蒸馏 agent 的输出。作者称这是一种 incumbent-relative held-out validation,能减少噪声更新。
第四,技能文档具有一定迁移性。表 4 的零样本实验显示,MiniMax-M2.5 + Claude Code 上演化出的技能,在换用其他攻击模型或换到 Codex 执行环境后,仍高于目标侧 No Skill 基线。
实验结果分析
实验在 ASB(400 例)和 AgentHarm(208 例)上进行,目标模型包括 MiniMax-M2.5、DeepSeek-V4-Flash 和 Qwen3.5-35B,分别搭配 Claude Code 或 Codex。攻击模型为 GPT-4o mini,预算 ,演化轮数 。
表 1 显示,不同目标 agent 对不同越狱工具抵抗差异很大,没有单一工具普遍最优;GCG、AmpleGCG、AutoDAN 在部分设置中甚至低于 No Jailbreak。RedEvoAgent 在多数设置达到或超过最强孤立工具。例如 ASB MiniMax-M2.5 + Claude Code 下,RedEvoAgent 为 93.2%,FlipAttack 为 91.8%,RedCodeAgent 为 76.4%;AgentHarm DeepSeek-V4-Flash + Claude Code 下,RedEvoAgent 为 74.3%,FlipAttack 为 67.9%,RedCodeAgent 为 37.5%。但并非全胜:在 AgentHarm MiniMax-M2.5 + Claude Code 上,RedEvoAgent 的 20.8 略低于 MAJIC 的 22.6。
表 2 显示,相比 No Skill 和 Human Skill,RedEvoAgent 的演化技能效果最高、平均工具调用最少。例如 ASB MiniMax-M2.5 + Claude Code 下,No Skill 为 77.5% ASR、平均 3.0 次工具调用,RedEvoAgent 为 93.2%、平均 1.8 次。表 3 的消融进一步显示,移除工具有效性画像后 ASR 从 93.2% 降至 76.9%;移除轨迹收集后为 85.0%。
图 3 的棘轮深度实验中,多数设置下被接受的技能会提升测试分数;但在 AgentHarm MiniMax-M2.5 设置下,第 4 轮技能验证 HarmScore 从 18.5 升至 28.1,测试 HarmScore 却相对第 2 轮从 28.8 降至 20.8。作者推测,这是技能过度集中到 FlipAttack 和 RolePlay 的重复采样,过拟合了较窄的验证集。
实践建议
对于产品级 LLM agent 的安全评估,RedEvoAgent 提供了可落地的红队设计思路。首先,不要只部署单一固定攻击工具。论文在不同目标模型中反复显示,某工具在特定 agent 上有效,不代表在其他 agent 上同样有效。更稳健的做法是将语义伪装、模板改写、优化型后缀等多种工具放入统一工具箱,并对每个新目标模型和执行环境重新估计工具有效性画像。
其次,用技能文档替代原始轨迹库,可以降低上下文成本,也便于安全团队审计策略演化。红队实践中可以维护一份可读文档,记录工具优先级和失败切换规则,而不是依赖向量检索历史日志。
第三,引入留出验证机制,不直接采用蒸馏 agent 生成的策略版本。每次更新应与当前最优技能比较,同时监控验证集和测试集或线上环境之间的差距,避免类似图 3 中验证提升但测试回退的情况。
最后,Deciding-Tool Attribution 可用于日志审计,帮助定位关键攻击工具动作,而不是只统计工具出现频率。需要强调,此类工具应仅在合法授权范围内用于安全评估,并遵循目标系统的测试政策和漏洞披露流程。