RevengeBench:从行为实验中逆向工程代码空间策略
RevengeBench: Reverse Engineering Code-Space Policies from Behavioral Experiments
论文信息
标题: RevengeBench: Reverse Engineering Code-Space Policies from Behavioral Experiments
作者: Babak Rahmani, Sebastian Dziadzio, Joschka Strüber, et al.
发布日期: 2026-06-24
arXiv ID: 2606.26094v1
PDF 链接: 下载 PDF
3 分钟速览
研究问题:这篇论文要解决什么 给定一个在游戏中执行固定策略的隐藏智能体,只通过观察其与对手对战的行为轨迹,能否逆向推断出该策略的可执行源代码?如果允许学习器主动设计试探性对手(probe opponents)进行受控交互,推断效果会提升多少?
核心方法:用什么办法解决 构建了 RevengeBench 基准,包含 75 个由不同 LLM 生成的、经 Elo 校准的游戏策略作为隐藏目标。学习器以迭代方式观察目标策略与采样对手的对局,也可选择用自己的代码编写 “探测对手” 来诱导目标进入信息丰富的状态,最后提交一份可执行的 Python/C/Java/JavaScript 策略代码,通过与目标在相同状态下的动作比较来计算距离评分。
关键结果:最重要的一个结论或数字 在 12 个前沿 LLM 中,恢复质量差距很大:最好的模型(GPT-5)闭合了 71.9% 的初始行为距离,最弱的(GPT-oss-120b)仅闭合了 33.8%。主动探测只对足够强的模型有显著帮助(见论文第 4.2 节)。
主要局限:作者自己承认的、或方法本身固有的限制 目标策略是固定的、非自适应的合成代码,不考虑实际对手可能做出的策略性隐藏或动态调整;动作距离仅衡量状态访问覆盖下的表面行为一致性,无法保证在罕见或对抗状态下的等效性;基准的可靠性因游戏环境而异,部分环境下的单次运行波动很大(见论文第 8 节)。
适合读者:什么背景的人值得读 从事大语言模型智能体、对手建模、多智能体系统、程序合成或科学发现自动化的研究者与工程师;对如何从行为观测中挖掘潜在决策程序感兴趣的认知科学从业者。
论文背景和研究动机
科学研究经常面临一个根本的不对称:我们可以观察到系统的外在行为,却无法直接看到产生这些行为的内部机制。生物学家通过精心设计的实验来推断潜在的神经、激素或遗传过程,这种 “被动观察 + 主动干预” 的范式使逆问题变得可解。论文将这个思路引入到计算领域:如果只能看到某个游戏智能体的行动轨迹,能否重建出决定其行为的可执行程序?更进一步,如果允许我们设计特定的 “试探” 游戏单位来逼迫目标展示更多行为特征,重建的准确性会有多大提升?
过去的工作要么假设存在固定的示范数据集用于模仿学习,要么允许对任意输入进行查询(就像编程示例中的直接提问)。但真实的科学推理处于两者之间:我们不能直接设置目标的任意状态,只能通过环境提供的有限接口去扰动它、观察其反应。RevengeBench 捕捉的就是这种 “受约束的实验推理” 过程:学习器不能直接询问 “你的策略代码是什么”,而必须编写一个对手策略,通过游戏互动来诱导目标进入特定状态,从而收集可用的行为信号。
这一设置不仅具有方法论上的新鲜感,在实际中也有迫切需求。随着 LLM 驱动的工作流日益复杂,对不透明智能体的行为预测和逆向理解变得至关重要。同时,将策略表示为可执行代码,而非单纯的奖励函数或离散目标,可以捕捉过程性、启发式、异常分支等更丰富的策略结构,使得推断结果可以在真实的交互环境中被测试和利用。
核心方法和技术细节
问题形式化
设隐藏目标策略为 ,是一个固定的可执行程序。学习器无权访问其源码,只能通过游戏环境与其交互。每次交互是让 与某个对手 对局,产生一条状态-动作轨迹 。学习器可以观察这些轨迹,也可以自行编写探测对手 并观察由此产生的新轨迹。经过多轮迭代后,学习器必须提交一份同样可执行的策略 ,在留出的测试轨迹上计算其与 的动作距离。
动作距离 根据具体游戏进行专门设计,例如在回合制网格游戏 BattleSnake 中是二值匹配,在涉及连续控制的 RoboCode 中是归一化分量差的平均值,在扑克中则采用对数负责任的栈比例距离。最终评分指标是 距离缩减率 ,其中 是所有回合中取得的最小平均动作距离, 为空白起始策略的基线距离。这个指标消去了不同目标和游戏之间的难度差异。
基准构建
RevengeBench 从 CodeClash 竞赛的公开资料中提取了约 15,000 份策略代码,经过结构过滤、去重和复杂度分层抽样后,为 BattleSnake、Halite、Poker、RoboCode、RobotRumble 五个游戏各保留了 40 个可运行的策略。经过瑞士制 Elo 锦标赛校正后,每个游戏中 Elo 最高的 15 个策略被选为隐藏目标(共 75 个),其余作为对手池。这些策略的代码长度从 29 行到近 500 行不等,涵盖了四种编程语言和完全不同的游戏机制。
学习器交互协议
学习器(由 mini-SWE-agent 等脚手架驱动)在沙盒化的 Docker 环境中通过 bash 命令操作。每轮实验中,目标策略与随机抽取的 20 个对手对局,学习器获取这些轨迹文件,并可以将当前策略在同样的轨迹上评估,得到不匹配的状态-动作对。随后学习器有 30 步指令预算进行代码编辑、运行本地测试、提交探测对手(每轮最多 5 个),最后提交更新后的假设策略。新一轮开始时,重新抽取对手生成新的轨迹,学习器结合历史信息和新鲜观察继续修正。
探测对手的设计是推理过程的关键:学习器需要猜测自己策略与目标策略在哪些地方分歧,然后编写能迫使目标进入那些状态的对手代码。例如,GPT-5 在 BattleSnake 中编写了 “安全、避免墙体的对手,力求延长存活时间以观察目标的决策规则”,而较弱模型则倾向于提交 “静止不动” 的单纯基准。
评估设置
论文用 12 个前沿 LLM 作为学习器,每个模型针对全部 75 个目标各运行一次。同时还评测了不同的输入模式(只给语言描述、仅用被动观察、使用贝叶斯程序推断基线)和不同脚手架(mini-SWE-agent vs. Codex CLI)下的表现。作为下游效用的验证,实验还让挑战者 LLM 拿着恢复出的策略代码去编写针对原目标的对抗策略,并与盲玩的情况进行比较。
创新点和贡献
论文做出三项主要贡献。
第一,提出了 RevengeBench 基准。包含 75 个高质量、经 Elo 校准的可执行策略作为隐藏目标,以及完整的观测-推理-评估流水线。这为研究从行为推断代码的逆问题提供了一个标准化的试验场,填补了现有对手建模和程序合成评估的空白。
第二,形式化了 “受约束干预” 的恢复协议。学习器不能直接查询目标的状态,只能通过编写对手策略来间接探测,这模拟了现实科学推理中的实验设计限制。协议还区分了被动观察与主动探测,能够定量衡量干预的价值(见第 2 节)。
第三,系统评估了 12 个前沿 LLM 的逆向工程能力,揭示了模型间的巨大差异,并进一步证明,即使是不完美的策略复制,也能在下游对抗任务中带来显著的竞争优势,尤其是在较弱模型身上效果更明显(见第 4.3 节)。这一发现将逆向建模从单纯的 “行为匹配” 提升到了 “可操作的情报” 层面。
实验结果分析
策略恢复表现
主结果(图 1)显示,GPT-5 以 71.9% 的距离缩减率领先,GPT-5.5-low 和 GPT-5.5-medium 紧随其后(分别约 70% 和 68%),最弱的 GPT-oss-120b 只有 33.8%。所有模型均远高于随机选取池中策略的基线,证明迭代优化确实在推断目标逻辑。
游戏难度层次分明:Poker 最容易(多数模型超过 60%),RobotRumble 模型间差距最大(5%-72%),Halite 打乱了整体排名(中等模型如 GPT-5.4-mini 达到 73%,超越了 GPT-5/5.5 的 61-66%)。
被动观察与主动探测的对比
表 3 显示,原始行为轨迹是最强的观察通道,语言描述会丢失细粒度的状态-动作证据。主动探测带来的提升高度依赖于模型强度:DeepSeek v4 Pro 在探测帮助下平均距离减少 0.052(最大提升),而 GPT-5.4-mini 和 Gemma-4 31B 的增益几乎为零甚至偶有负数。论文分析指出,探测不仅需要识别认知缺口,还要求能生成正确可运行的探测代码,较弱模型在这一连串能力上均存在瓶颈。
值得注意的是,GPT-5 和 DeepSeek 在 Poker、BattleSnake 等游戏中的探测效果尤为明显,这与这些游戏较容易编写功能正常的探测策略有关(见第 6 节分析)。
从推断到行动的转移
在玩家对战锦标赛中(图 4),所有模型在拿了恢复的策略(recovered)后,胜率均高于盲玩基线,且低于拿到真实源码的 oracle 条件。排序一致为:盲玩 < 恢复策略 < 真实源码。
关键发现是,在盲玩基线低的较弱模型上,恢复策略带来的胜率提升(win rate gain)更大,且这种提升随着对抗轮次持续不衰减,而强模型(如 GPT-5)的 oracle 优势在几轮后就因盲玩能力的迭代提升而消散(图 11)。这暗示逆向建模对于自身编码能力有限的智能体具有更持久的战略价值。
消融与鲁棒性
历史压缩和聚合分析显示,维持完整的对话历史对恢复有帮助,但通过规则摘要压缩可节省约 11-22% 的 API 成本而不降低性能(附录 H.3)。在脚手架和推理努力的消融中,使用 Codex CLI 和高推理努力将平均动作距离降至 0.08,较 mini-SWE-agent 低努力的 0.15 提升了 47%(表 5)。
鲁棒性分析指出,BattleSnake 和 Poker 的得分在同模型多次运行中和跨模型之间都较为一致(ICC 分别 0.81 和 0.58),而 Halite、RoboCode 和 RobotRumble 的噪声较大,需要多运行平均才能进行可靠的模型比较(表 6)。
实践建议
基于 RevengeBench 的发现,以下几点对希望在真实场景中应用逆向建模或对手建模的工程师和研究者有参考价值。
1. 将策略表示为可执行代码优于纯数值参数化。 论文中使用的程序化策略能够容纳条件分支、循环、状态记忆等结构,这使得行为推断不仅关乎拟合准确性,还提供了可阅读、可调试的工件。在实际应用中(例如对抗性游戏、交易策略对战),建议用代码而非向量来建模对手,以便后续利用人类分析或自动程序合成工具进行改进。
2. 主动探测需要配合强大的代码生成与调试能力。 从结果来看,只有足够强的模型(如 GPT-5、DeepSeek v4 Pro)能从主动设计中受益,而较弱模型可能因无法写出有效的探测对手而浪费预算。因此,在工程实践中引入自适应探测机制时,应评估代理的编码可靠性,并为其提供诊断工具(如自动捕获沙箱错误)以提高探测的成功率。
3. 不完美的恢复也可以带来实战优势。 即使恢复的策略与真实目标存在较大行为距离,它在下游对抗任务中仍能提供显著增益,尤其是对本身编码能力有限的系统(如轻量级游戏 AI、资源受限的云函数)。这提示我们,不追求完美复刻,采用 “够用就好” 的逆向模型是一种经济高效的策略。
4. 成本与效用的权衡。 实验显示,GPT-5.5-low 在 mini-SWE-agent 下的一次完整推理成本约 $7–13,而 Gemma-4 31B 仅需 $0.06 就能达到 51% 的距离缩减(图 3 右上方)。对于预算敏感的场景,低开销的模型配合高效的上下文压缩(如论文中使用的历史摘要)可以在极低成本下提供可用的对手情报。
5. 注意基准的适用范围与环境转移。 论文中的目标都是固定的、不隐藏意图的游戏程序。在真实的多智能体环境中,对手可能察觉被观测而改变行为,或者采用欺骗策略。将 RevengeBench 的思路迁移到更开放、对抗性更强的领域时,需要额外考虑对手的适应性和部分可观察性,或许要结合在线学习和不确定性推理。