ReproRepo:利用 GitHub 仓库议题实现可重现性审计的规模化

arXiv: 2606.18237v1

论文信息

标题: ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues

作者: Shanda Li, Qiuhong Anna Wei, Jingwu Tang, et al.

发布日期: 2026-06-16

arXiv ID: 2606.18237v1

PDF 链接: 下载 PDF

研究背景与动机

科学复现是推动研究进步的重要基石,它使学者能验证已有结论并在此基础上拓展。然而,现代机器学习研究高度依赖代码、数据和实验构件,复现过程往往耗时且易出错。近年来,大语言模型(LLM)智能体凭借强大的代码生成与推理能力,引发了学界对其能否辅助复现审计的浓厚兴趣。现有工作已开始构建基准测试来评估 LLM 智能体在复现场景中的表现,但这些基准大多依赖专家手工标注问题、注入错误或编写评估规则,成本高昂且难以扩展。例如,一些流行基准仅覆盖几十篇论文,且通常只收录高质量仓库,更新迭代缓慢,无法应对快速演变的研究生态。

在此背景下,ReproRepo 框架应运而生。它抛弃了传统的人工构造任务模式,创造性地将 GitHub 上用户报告的真实复现障碍(issue)作为自然监督信号。当研究人员在 GitHub 仓库中尝试复现论文并遭遇阻碍时,通常会提交 issue 描述错误、缺失文件或配置不一致等情况。这些 issue 天然记录了实际使用者的复现痛苦,无需额外专家介入即可作为评估 LLM 智能体复现审计能力的 “参考答案”。ReproRepo 的目标是提供一个可扩展、真实且易于更新的评估机制,让智能体在不执行代码、仅静态审查论文与仓库快照的条件下,发现潜在的复现障碍,并与隐藏的 issue 进行比对。

核心方法与技术细节

ReproRepo 的工作流程分为三个主要阶段:数据构建、复现审计协议和评估指标计算。

数据构建:将 GitHub Issue 转化为评估样本

该框架首先从顶会论文(如 NeurIPS 2022、2024 及 ICLR 2026)出发,利用 Paper Copilot 等工具收集论文元数据及其对应的 GitHub 仓库链接。过滤掉无可用仓库的论文后,为每个仓库抓取所有公开及已关闭的 issue。随后,一个 LLM 裁判被用来筛选出与复现性相关的 issue,排除那些仅涉及新功能请求或使用问题的条目。

为避免信息泄漏,ReproRepo 对仓库快照进行了特殊处理:对于仍处于开放状态的 issue,直接使用当前代码库状态;对于已关闭的 issue,则回退到 issue 创建前的代码快照,确保智能体看到的是用户当初报告问题时的 “老旧” 代码。如果已关闭 issue 附带了修复补丁(pull request),框架还会额外构建一个修复后的快照,用于后续评估智能体预测的假阳性率。最终,1149 篇论文和 7,553 个复现相关 issue 被纳入基准,规模远超以往任何同类工作。

复现审计协议:静态、无执行的智能体任务

智能体被要求仅基于论文 PDF 和上述仓库快照,识别并输出一个按 “用户实际遭遇可能性” 降序排列的复现障碍列表。每一次任务都在一个隔离的工作空间中执行,该空间移除了 Git 历史记录,并禁止联网访问。智能体不得执行任何代码、运行安装脚本或进行模型训练,只能通过阅读文档、配置、脚本文件和论文声明来静态分析潜在问题——例如缺失的检查点、错误的命令、版本冲突或论文与代码间的不一致。

每项发现都以类似 GitHub issue 的形式描述,包含症状、触发路径、根因、证据和影响。智能体被要求优先定位那些用户一开始就会遇到的障碍,如环境配置错误、数据获取失败等,而非泛泛的风险提示。

评估体系:精确匹配、语义匹配与多层级指标

智能体输出后,另一个独立的 LLM 裁判会将每个隐藏的人类 issue 与智能体发现进行比对,并赋予 精确匹配(EM)语义匹配(SM)无匹配(None) 三个标签之一。精确匹配要求两个描述实质上指向同一复现问题且触发条件相同;语义匹配则表示两者涉及同一工作流或构件族,但具体失败点或细节有差异。

评估指标围绕匹配标签设计,并受一个 Top-k 报告预算 约束——仅考虑智能体前 k 条发现。主要指标包括:

  • Issue 级匹配率IssueEM@k\text{IssueEM}@kIssueSM@k\text{IssueSM}@k 衡量多少比例的隐藏 issue 被智能体发现。
  • 论文级匹配率PaperanyEM/SM@k\text{Paper}_{\text{any}}\text{EM/SM}@k 记录至少有一个隐藏 issue 被匹配的论文占比,这直接反映了审计的实际覆盖面。
  • 假阳性率(FPR):利用已修复的 issue 对应的修复后快照,若智能体仍能 “发现” 该已修复问题,则记作假阳性。论文级 FPR 保守估计了智能体产生无关警告的概率。

创新点与贡献

ReproRepo 的创新性主要体现在三个方面:

  1. 以用户报告的自然痛点作为监督信号,彻底摆脱了对专家设计任务和人工注入错误的依赖。这不仅使基准构建高度自动化,还让评估更贴近一线研究人员实际遇到的复现阻碍。
  2. 提出静态、无执行的复现审计范式。在 GPU、API 调用、大数据集往往难以即时获取的现实下,仅通过审查代码与论文就能发现大量问题,为后续执行验证提供了高效预筛手段。该设定也使得框架易于大规模部署。
  3. 构建了迄今最大规模的论文-仓库-issue 三元组基准(1,149 篇论文,7,553 issue),覆盖多个会议与年分,并具备轻松扩展到新会议的能力,为 LLM 智能体在该领域的长期评估奠定了基础。

实验结果分析

研究评估了四个前沿模型与两种智能体框架的组合:Claude Code 搭配 DeepSeek-V4-Pro 和 Claude Opus 4.7,Codex 搭配 GPT-5.4-Mini 和 GPT-5.5。结果揭示了若干重要趋势。

静态审计的惊人有效性

在 ICLR 2026 论文集上,表现最佳的 GPT-5.5 + Codex 实现了 25.4% 的 issue 级精确匹配率和 58.1% 的语义匹配率。在论文层面,它能在 89.7% 的论文中发现至少一个语义匹配的人类 issue,这意味着即使不运行代码,智能体也能覆盖绝大多数论文中的真实复现障碍。该配置在多个会议上的表现保持稳定,Paper any 语义匹配率维持在 87%–93% 之间,且假阳性率极低(最高仅 3.5%),表明智能体的发现并非由泛化警报堆砌而成。

精准定位仍是瓶颈

语义匹配率远高于精确匹配率,二者之间存在约 30 个百分点的差距。这说明智能体往往能识别出问题所处的语义区域(如某个评估环节、某个缺失的模型文件),但难以精确定位触发点或根因。这暗示当前的静态审计更适合作为分诊信号,指引人类审查员关注高风险区域,而非替代详细调试。

失败类别差异:可见故障易发现,逻辑错误难捕捉

论文将人类 issue 分为四类:立即崩溃(环境、导入错误)、延迟崩溃(训练中错误)、静默错误设置(配置与论文声明不一致)、静默错误数字(运行完成但结果不符)。智能体对静默错误设置立即崩溃的召回率最高,因为它们常留下文档、文件结构等静态证据;而对延迟崩溃和静默错误数字的识别能力较弱,前者需执行触发,后者依赖实际指标对比。这解释了为何无执行审计无法完全替代实际复现,但可以在早期阶段筛查出大量配置与流程性风险。

消融实验揭示报告预算与排序策略的价值

对报告预算 k 的扫描显示,大部分增益集中在前 4–6 个发现,论文 any 语义匹配率在 k=4 时已达 80% 左右,说明智能体将高价值预测置顶的能力很强。加入 “按用户报告可能性排序” 的指令能进一步提升小预算下的表现,表明排名机制对人工审核带宽有限的实际场景十分有用。此外,仅提供代码而不给论文时,精确匹配率下降明显(下降约 8.98 个百分点),证实了论文与代码的对齐审查对精准定位复现障碍不可或缺。

实践应用建议与未来发展方向

ReproRepo 的出现为复现性审计的自动化开辟了全新路径,其实践价值体现在多个维度:

  • 投稿前自检工具:作者可将 ReproRepo 作为文稿与代码仓库的自查流水线,在发布前用前沿 LLM 静态扫描,提前修复 README 不一致、缺失文件等低级但高发的复现障碍。
  • 审稿辅助系统:会议程序委员会可将该框架嵌入审稿流程,自动生成每篇投稿复现风险的优先级排序报告,让审稿人集中精力验证最可能的错误点。
  • 可扩展基准维护:由于 issue 是自然增长的,ReproRepo 可通过定期抓取新 issue 和更新仓库快照实现自我更新,持续追踪模型能力的进步,并支持将审计扩展到非 ML 领域(如社会科学、计算生物学)。

未来工作可从以下几方面深化:

  • 结合执行反馈:将静态审计与轻量级执行(如环境搭建、单元测试运行)结合,覆盖那些必须运行才能暴露的崩溃与数值错误。
  • 多模态与交互式审计:让智能体在发现可疑之处后,能够与仓库维护者或用户进行有限交互,澄清模糊文档,提升语义匹配向精确匹配的转化率。
  • 标准化议定:随着研究界对复现性重视程度提升,ReproRepo 可作为制定 “复现性声明” 或 “复现性评分” 的依据,促进开放科学文化。

总结与展望

ReproRepo 通过将 GitHub issue 这种自然生成的复现障碍记录转化为高质量监督信号,成功化解了复现性评估的扩展性难题。它证明即使在不执行代码的严格限制下,前沿 LLM 智能体仍能覆盖绝大多数论文中用户实际报告的复现问题。尽管精准定位仍有提升空间,但该框架已然为自动化的复现审计提供了高效且实用的基础设施。正如工作本身所倡导的那样,ReproRepo 将作为一项可复用的开源资产,持续推动科研复现能力的量化和智能体技术的进步,帮助研究者把更多时间投入到真正的科学探索中,而非纠缠于重复性的调试陷阱。