RevengeBench:从行为实验逆向工程代码空间策略
论文信息
标题: RevengeBench: Reverse Engineering Code-Space Policies from Behavioral Experiments
作者: Babak Rahmani, Sebastian Dziadzio, Joschka Strüber, et al.
发布日期: 2026-06-24
arXiv ID: 2606.26094v1
PDF 链接: 下载 PDF
为什么观察与实验对 AI 推断他人策略至关重要?
设想你是一名网络安全分析师,面对一个未知的黑客程序。你无法直接查看它的源代码,只能通过观察它如何攻击系统、设计针对性的 “诱饵” 来测试它的反应。你能仅凭这些行为痕迹,推断出这个程序的内在工作机制,甚至复刻出一个功能相似的副本吗?
这正是论文《RevengeBench》试图在 AI 领域回答的核心问题。传统科学研究中,我们常常无法直接窥见现象背后的机制——无论是动物的神经活动,还是物理粒子的内部状态——只能通过外部行为和精心设计的干预实验来逆向推断。这项研究将这一经典的 “逆问题” 引入到 AI 的世界:给学习者(一个 AI 智能体)一个在游戏环境中行动但策略未知的黑箱智能体,它能否仅通过观察这个目标的游戏行为,以及设计 “探针对手” 与其互动,来完成逆向工程,最终输出一份能复现目标行为的可执行代码?
从行为到代码:一个可测试的逆向推断基准
《RevengeBench》并非简单的 “猜猜对手怎么玩”,而是构建了一个严谨的、可量化的评估框架。研究者从 CodeClash 编程竞技场中精心筛选了 75 个由大语言模型(LLM)生成的、水平经过 ELO 评分的游戏策略,分布在五个环境各异(涵盖离散/连续控制、网格/多单位等)的游戏中作为 “隐藏目标” 策略。学习者的任务,就是在五轮迭代中,通过两种方式逼近目标真相:
- 被动观察:观察目标与 20 个随机对手对战产生的状态-行动轨迹。
- 主动探测:这是论文的点睛之笔。学习者可以编写代码,创造最多 5 个定制的 “探针对手” 去和目标对战。这些探针并非为了赢,而是精心的科学实验,旨在将目标逼入特定状态,从而暴露其决策规则中的不确定之处。比如,一个 “始终静止” 的探针可以作为静态参照物,观察目标在无对手时的默认行为。
评估标准并非胜率,而是更精细的 “动作距离”。研究者为每个游戏设计了从 0 到 1 的连续度量(例如,在扑克中,加注 90 个筹码比直接弃牌更 “接近” 目标加注 100 个筹码的行为),最终计算学习者复现的策略与目标策略在执行相同状态下的动作距离,并通过对比一个 “初始策略” 的距离,得出恢复率(距离闭合比例)。
核心发现:LLM 能从行为中读心,但水平参差不齐
研究对 12 款前沿 LLM(如 GPT-5、GPT-5.5、DeepSeek v4 Pro、Gemma-4 等)进行了测试,结果揭示了几个关键洞见:
-
行为恢复能力显著但远未完美:最强的模型(如 GPT-5.5-Codex-high)闭合了83% 的初始行为距离,而最弱的模型(GPT-oss-120b)仅闭合34%。这表明仅凭行为逆向推断程序化策略是完全可能的,但仍有巨大提升空间。
-
主动探测是把 “双刃剑”:对能力强的模型(如 DeepSeek v4 Pro),主动探测平均能带来 0.052 的距离降低,效果显著。然而,对于能力较弱的模型,探测可能不仅无益,反而有害。这是因为探测本身就是一项高要求的综合能力:你必须先识别自己的不确定性,然后将其设计为一段可执行、不会崩溃的对手代码,最后再解读返回的新行为数据。如果模型连编写和部署有效探针都做不到,不仅浪费了计算预算,还可能将推理引向错误方向。数据显示,弱模型常提交 “什么都不做” 或 “总是待着不动” 这类低信息量的探针,浪费了宝贵的机会。
-
不完美的推断,巨大的战略价值:这是论文最令人兴奋的发现之一。研究者设计了 “玩家对战(PvP)锦标赛”,让一个挑战者 LLM 分别在没有信息(盲打)、持有逆向推断出的代码(恢复组)、持有目标真实源码(先知组)三种条件下,编写对抗目标的策略。结果显示,恢复组的胜率始终高于盲打组。更关键的是,这一优势在弱模型上尤为明显。强者如 GPT-5,即使盲打也能通过几轮迭代找到对抗方案,因此 “情报” 带来的初期优势会很快消退。但对于盲打表现差的基础模型,这份不完美的 “对手模型” 提供了它们自身无法凭空构建的结构化洞察,使其胜率获得了持久且显著的提升。这证明,即使不能完全复现源码,一个接近的行为模型也能提取出极具战略价值的信息。
方法创新:将科学实验精神注入 AI 推理
《RevengeBench》的核心创新在于其 “受限干预” 的实验设计。与许多允许直接查询黑箱内部状态的逆向工程研究不同,这里的学习者必须 “用行为诱导行为” 。你不能直接问目标 “面对 X 状态你会做什么?”,而必须设计一个对手,通过游戏交互将目标带入 X 状态再进行观察。这更接近真实世界中科学家面临的约束:我们无法为一个系统设定任意状态,只能通过环境的可操作通道施加扰动。
此外,论文展示了一个精细的迭代推理过程。在一次典型轨迹中,学习者可能先因为贪吃食物的简单假设得到较好结果,但随后因忽略安全性导致性能回退,最后通过观察新数据和设计靶向探针(如一个严守安全规则的对手),实现自我修正和最终代码的优化。这一过程在论文中得到了生动的可视化呈现。
实践启示与未来展望
这项研究对量化交易、网络安全、多智能体系统等领域均有启发。
-
对抗性建模与策略可解释性:在量化交易中,通过观察另一个交易算法的订单流行为,并设计特定订单(探针)来测试其算法逻辑,有可能逆向推断出该算法的核心模式。这不仅有助于开发更有效的套利或做市策略,也能增强对 “黑箱” 交易对手行为的理解。论文证实了,一份从行为中推断出的、即使不完全精确的执行程序,比完全没有对手模型要强大得多。
-
AI 安全与评估:该方法可用于评估一个 AI 系统是否真正理解和预测其他智能体的行为。一个能成功 “逆向推断” 他人决策逻辑的 AI,或许才具备了更深层次的 “心智理论” 雏形,这在人机协作和监控潜在危险 AI 行为上至关重要。
-
未来方向:当前的局限在于,目标是固定且非自适应的。未来最激动人心的扩展,是应用于那些 “能感知被观测并策略性隐藏行为” 的自适应智能体。想象一下,你要逆向推断一个狡猾的外汇算法,它一旦察觉被探测,就会切换行为模式。这将使这个 “逆问题” 的挑战性和与现实的相关性都提升到一个全新高度。同时,从推断单一的 “最优” 程序,转变为推断一个 “可能的策略等价类分布”,将是更严谨和实用的方向。
总结
《RevengeBench》优雅地将科学哲学中的基本认知论问题——如何从现象推断本质——与现代 AI 的能力结合在一起。它不仅构建了一个评估 LLM“逆向工程” 能力的严格基准,更重要的,它揭示了通过观察和精心设计的交互实验,我们可以从纯粹的行为数据中萃取出具有切实战略价值的、结构化的程序性知识。这项工作为更智能的对手建模、可解释 AI 以及通用的人工智能科学发现能力,开辟了一条充满挑战却又无比清晰的新路径。