利用大语言模型进行社会与行为科学领域的自动化可重复性评估
Automated reproducibility assessments in the social and behavioral sciences using large language models
论文信息
标题: Automated reproducibility assessments in the social and behavioral sciences using large language models
作者: Tobias Holtdirk, Pietro Marcolongo, Anna Steinberg Schulten, et al.
发布日期: 2026-06-11
arXiv ID: 2606.13670v1
PDF 链接: 下载 PDF
3 分钟速览
研究问题:这篇论文试图回答:大语言模型(LLM)能否代替人类分析师,自动完成社会科学与行为科学论文的可重复性评估? 核心方法:作者构建了一个智能体工作流,向 Claude Opus 4.7 提供原始数据、统计声明和论文全文,模型自主编写并执行统计代码,求出效应量并与原始结果、人类再分析结果进行对比。 关键结果:在 69 篇有效研究中,LLM 在 41% 的研究里恢复了原始效应量(Cohen’s d 容许偏差 ±0.05),并在 96% 的案例中得出了与原文一致的定性结论,两项均优于人类基准(34% 和 74%)。(见论文图 2c 及正文相应段落) 主要局限:模型可能因训练数据污染 “见过” 原论文;LLM 生成的代码可能带有错误;效应量统一转换为 Cohen’s d 会损失精度;结果只限于数据可获取的研究,且无法替代基于新数据的复制。 适合读者:从事定量社会科学研究的学者、期刊编辑与审稿人、元科学(metascience)从业者,以及对 LLM 在自动化统计分析中落地感兴趣的技术管理者。
论文背景和研究动机
可重复性危机是近十余年笼罩社会科学与行为科学的一层阴影。大量人工再分析表明,许多已发表研究的核心统计结论无法从原始数据中重复获得。经典的 Multi100 合作项目中,507 位分析师花数年时间对 100 篇已发表论文进行了重新分析,结果仅有 34% 的研究在严格容忍度下恢复了原始效应量。此类评估虽然必要,但极度依赖人力,难以规模化应用到海量已发表文献或实时审稿流程中。
与此同时,大语言模型的编码能力迅速提升,已在科学编程、数据分析和研究辅助中展现出潜力。论文作者敏锐地捕捉到这一趋势:如果把原始数据、统计声明和论文方法描述交给 LLM,让它像人类分析师一样独立编写分析代码并执行,能否在几乎无人干预的情况下完成可重复性核查?如果可以,就能把可重复性检查从一项耗时的 “手工作坊” 活动转变为期刊质量控制和大规模文献审计的常规工具。这便是本研究的核心动机。
核心方法和技术细节
论文的实验设计紧紧围绕可对比和可量化展开,具体包含三个层面。
数据与基准。作者使用了 Multi100 项目中 100 篇实证研究里数据可获取的 76 篇,涵盖经济学、政治科学和心理学,发表年份在 2009–2018 年之间。每篇论文都配有明确的统计声明(claim)、原始数据集以及由 507 名人类分析师产出的效应量分布。这为 LLM 的表现提供了天然锚点:既可对照原始文献的效应量,又能与人类再分析的中位结果相比较。
智能体工作流。分析管道被设计成一个基于 ReAct 循环的智能体。Claude Opus 4.7 接收到标准化的研究包:原始声明、原始数据、完整论文全文(PDF 经 Mistral OCR 转换为 Markdown)。系统提示词将其定位为 “统计分析师”,要求它选定一个合理的操作化方案(变量、子样本、模型、控制变量),然后自行编写 Python 代码并执行,不得照搬论文已报告的任何检验统计量。智能体拥有 Python 解释器、bash 终端和 “思考” 工具,运行在无状态的沙箱中,每次调用都是全新的环境,以保证各次运行独立。每项研究以独立运行 5 次的形式完成,随后取平均效应量,并按多数投票决定定性结论。
评估指标。核心指标沿用了 Multi100 的标准:效应量差异 ,以及是否落入 的严格容忍区间。效应量统一转换为 Cohen’s ,步骤如下:先由 LLM 报告的 、、、 或 值转为 Pearson 相关系数,再转成 。若转换失败,该次运行不计入。最终保留至少一次有效运行的 69 篇论文。定性结论分为 “支持原文” 与 “相反/不确定”,同样对比原始文献和人类再分析的两个基准。
创新点和贡献
这项工作的创新性不在于基础模型本身,而在于提出的 “自动可重复性审计” 思想及其与大规模人类基准的严格对照。过去,LLM 用于数据分析的研究多聚焦于代码生成正确率或单个任务的完成度,但本论文首次把 LLM 置于真实的可重复性评估流水线上,并直接沿用社会科学领域公认的评估框架。
另一个重要贡献是,论文没有只报喜不报忧。它同时展示了 LLM 的优势和弱点:虽然在效应量的连续值回归上相关性很低(与原研究 ,与人类再分析 ,见论文图 3),但在定性方向的判断上却达到了惊人的 96% 一致率。这种 “数值偏差、方向准确” 的模式揭示了 LLM 可能在理解理论主张和抓取大致分析方向上表现稳健,但对细微的变量定义、缺失数据处理、模型规格差别等仍然不够精细。这为后续优化指明了方向。
实验结果分析
对于 69 篇有效研究,LLM 的平均效应量与原始文献效应量落在 容忍区间内的比例为 41%(图 2c)。相比之下,人类再分析在同样严格条件下的恢复比例仅为 34%。若将基准换为人类再分析的效应量,LLM 与人类结果一致的占 29%。这些数字意味着,LLM 的一次自动化运行,已经可以达到甚至略优于人类群体的平均水平。
更引人注目的是定性结论的对比。LLM 多数投票后的结论在 95.7%(论文报告数)的案例中与原研究一致,而人类再分析师的一致率为 74%(约 81.2% 的匹配,论文原文为 81.2%,但摘要和讨论中另有 74% 的说法,可能是针对不同容忍度或基准;这里统一按正文主要数字 96% 与 74% 理解)。这一差距暗示,人类分析师在实验设计自由度高的情况下可能产生更多合理但不一致的路径,而 LLM 在接收到相对明确的任务描述时,往往收敛到与原始作者相近的分析路线,从而在 “是否支持原论断” 上表现出更高的一致性。
不过,图 3 的散点图和回归线清晰地警示:无论是针对原始效应量还是人类再分析效应量,LLM 的效应量离散度都很大,拟合优度极低。这意味着不能简单地用 LLM 给出的精确 值来断定某篇论文的效应能 “完全重复”。LLM 更像是一个初筛过滤器,能高效地挑出那些连基本方向都对不上的可疑研究,但对于精确定量评估,仍需人类的进一步核查。
实践建议
基于论文结果,我们可以梳理出几条将 LLM 引入可重复性审计的实操路径,但必须同时注意论文中提示的重要边界。
期刊初审与投稿前的自检。目前已有部分期刊开始要求作者提供可重复性材料,并由人工重新执行代码。这项工作费时费力,LLM 管道可以充当第一道筛子。具体做法是:在投稿系统中集成一个沙箱化的智能体,它读取作者提供的声明、数据和论文方法描述,自动运行分析并生成一份 “可重复性摘要报告”,标出效应量偏离程度和定性结论匹配情况。编辑可根据得分高低迅速识别需要重点关注的手稿,将人工复查的资源集中在边界案例或高风险论文上。论文作者也指出,这种自动化检查不宜直接作为拒稿依据,而应定位为辅助工具,以避免因误判而损害作者利益。
系统性文献审计。对于已经发表的体量庞大的实证文献,LLM 能快速扫描并标记出那些结论可能因分析选择而异的研究。这有助于建立 “文献稳健性地图”,让研究者和政策制定者感知哪些结论对分析细节不敏感,哪些则高度依赖特定操作化路径。论文中图 2a 那种大量蓝色点(LLM 再分析)偏离灰色方块(原研究)的现象,正好揭示了分析不确定性在全文献中的分布。机构可将类似的工作流设定为定期运行,例如每年对某领域核心期刊的新刊论文进行一次自动化扫描,并将结果以仪表板形式公开,提升科学的透明度。
工具开发中的工程考量。论文所用流水线是在 Inspect AI 框架上实现的,但更广义的实践建议包括:确保代码运行在严密隔离的沙箱里,禁止外部网络访问,防止模型产生破坏性代码或泄露数据;为不同学科定制专用的 Python 环境,涵盖常见的统计和计量软件包(如论文附录 A 所列);必须内置效应量转换的稳健性检查,对于无法可靠转换为 Cohen’s 的统计量直接标记为 “不确定”;每次分析必须执行多次运行(论文采用 5 次)以评估随机性与稳定性;设计时的提示词应明确引导 LLM“忠于数据和方法描述,不得臆造数值”,这与论文中的提示策略一致。
人机协同的必要性。论文一再强调,LLM 自动化不能替代专家判断,尤其是在边界案例和效应量高度分散的情况下。工程落地上,应当将 LLM 的输出设计为可交互的,允许人类专家实时查看模型选择的变量、样本筛选代码和结果,并能一键重新运行或修改参数。这种半自动流程既能借助 LLM 的规模能力,又保留了研究者对分析选择负责的原则,符合可重复性科学与开放科学的长期价值观。