运用大型语言模型的社会与行为科学可重复性自动化评估

arXiv: 2606.13670v1

论文信息

标题: Automated reproducibility assessments in the social and behavioral sciences using large language models

作者: Tobias Holtdirk, Pietro Marcolongo, Anna Steinberg Schulten, et al.

发布日期: 2026-06-11

arXiv ID: 2606.13670v1

PDF 链接: 下载 PDF

研究背景与动机:可重复性危机的自动化解法

社会科学与行为科学正面临一场严峻的 “可重复性危机”。多项大规模复现项目表明,已发表的研究结果并不总是能够被独立研究者从原始数据中恢复出来。例如,Multi100 项目组织了 507 位分析师,耗时数年对经济学、政治学和心理学领域的 100 项已发表研究进行重分析,其人力与时间成本之高令人望而生畏。传统的可重复性评估要求分析师理解研究材料、识别相关变量、将论文中的文字描述转化为可执行代码、运行分析并比较结果——这一过程高度依赖人工,难以规模化推广。虽然部分期刊已开始在稿件发表前进行数据与可重复性检查,但对于大多数出版渠道而言,系统性地审计实证文献依然是成本高昂、难以持续的任务。

这篇题为《使用大语言模型自动化社会科学与行为科学可重复性评估》的论文,提出了一个根本性的解决思路:能否将大语言模型用作自动化分析师,替代人工重分析的繁重劳动?研究的核心动机在于,如果 LLM 能够可靠地解读研究声明、编写并执行统计代码,那么可重复性评估就能从偶发的、资源密集型的项目,转变为常规的科研质量控制环节。

核心方法与技术架构

该研究设计了一套基于智能体(agent)的 LLM 工作流,接受三个核心输入:原始数据集、文章中的焦点统计声明,以及实验性变化的论文文本信息。LLM 被赋予的任务是独立编写并执行统计代码,以验证原始声明是否可从数据中复现。

具体流程如下:

  • 研究者从 Multi100 项目中选取了 76 项已发表研究(排除了原始数据无法访问的样本),并为每项研究组装了标准化研究包,包括统计声明、原始数据、论文元数据和通过 OCR 提取的全文文本。
  • 分析管道基于 Inspect AI 框架实现,采用 ReAct 风格的推理循环。LLM 代理拥有三个工具:Python 解释器、Bash shell 和用于记录中间推理的 think 工具。沙盒环境为每次运行重新创建,不保留跨运行的任何状态,以确保独立性。
  • 代理被明确指示不得复制论文中报告的任何检验统计量,必须提交由其自身代码从数据中计算得出的统计值。每条声明的分析在五个独立运行中执行,最终效应量取均值,定性结论取多数投票。

主实验采用 Claude Opus 4.7 作为代码生成模型。评估指标参照 Multi100 的标准:效应量差异 Δd=dˉLLMdoriginal\Delta d = \bar{d}_{\text{LLM}} - d_{\text{original}}、是否落入严格容忍区间 ±0.05\pm 0.05(Cohen's d),以及定性结论是否匹配(支持/相反/不确定)。这里,Cohen's d 作为标准化效应量,使得不同类型检验统计量(t、F、z、χ² 或 r)的结果可在同一尺度上进行比较。

核心发现与实验解读

在 76 项研究中,7 项因 LLM 在所有运行中均未生成有效的 Cohen's d 而被排除,最终分析基于 69 项研究。实验结果揭示了一个令人惊讶的模式:

与原始声明的比较:LLM 重分析的效应量落入 ±0.05\pm 0.05 严格容忍区间的比例为 41%,而人类重分析仅为 34%。更引人注目的是定性结论的匹配率——LLM 在 95.7% 的案例中得出了与原始研究相同的定性结论,人类重分析则为 74%。这意味着,尽管 LLM 生成的连续效应量估计与原始值之间仅存在微弱相关性(r=0.10r=0.10),但在给出 “研究结论是否成立” 这一二元判断上,LLM 的表现远超人类分析师。

与人类重分析的比较:当将 LLM 效应量与人类重分析效应量进行对比时,落入严格容忍区间的比例降至 29%,相关性同样微弱(r=0.11r=0.11)。这一结果并非弱点——它反映的是人类重分析本身也表现出巨大的分析变异性。事实上,Multi100 项目已经揭示,即使面对相同的数据和声明,不同分析师也可能做出截然不同的操作化选择,导致效应量分布离散。LLM 的效应量估计与人类重分析同样分散,恰恰说明它捕捉到了这种分析灵活性的本质。

值得深思的是,LLM 在结论层面与原始声明高度一致,却在效应量精确匹配上表现平平。这种 “结论相符、数值偏离” 的模式暗示,LLM 可能对研究假设倾向于给出肯定性解读,或者其操作化选择系统性地偏向支持原始结论的方向。论文作者明确指出,这种分歧的两个可能来源——原始理论或方法的概念模糊,以及模型分析中的错误——在当前实验设计下未能完全分离。

创新贡献与技术亮点

该研究的首要贡献在于首次系统性地验证了 LLM 作为自动化可重复性评估工具的可行性。其创新点体现在三个层面。

方法论创新:研究构建了一个端到端的自动化管道,将文档解析、分析决策和代码执行整合在单一智能体框架内。与传统的程序化元分析工具不同,该管道处理的是高度非结构化的输入——自然语言声明、原始异构数据格式和完整论文文本——并输出结构化的检验统计量。这种从非结构化到结构化的映射,是 LLM 在科研自动化中的核心突破。

基准参照设计:通过直接对比 LLM 重分析与同一批数据上的人类重分析,研究建立了具有说服力的参照基准。这使得结论不限于 “LLM 能复现多少结果”,而是上升为 “LLM 与人类分析师在可重复性评估中的表现如何比较”。结果显示两者在效应量偏差上具有相似的模式,这为 LLM 作为人类分析的补充甚至替代提供了实证支撑。

对分析灵活性的量化揭示:研究间接揭示了社会科学研究中一个深层问题——分析选择的不确定性。当人类和 LLM 都表现出显著的分析变异性时,问题可能不在于执行者,而在于研究声明本身缺乏足够的操作化定义。这正是论文中引用的 “声明的低度规格化”(underspecification of claims)问题,它提示科学界需要更精确地定义假设与检验之间的映射关系。

实践应用与发展前景

基于该论文的发现,可以从以下几个方向推动自动化可重复性评估的落地应用:

期刊预审的初筛工具:LLM 管道可以部署为稿件提交后的第一道自动检查。当 LLM 复现结果与原始声明一致时,编辑可将人工审核资源集中在更复杂的实质性评审上;当结果不一致时,则触发更深入的人工重分析。这种 “过滤-升级” 机制能显著降低期刊的数据验证负担,扩大可重复性检查的覆盖面。但必须注意错误标记的非对称成本——一篇被错误标记为不可复现的论文对作者伤害极大,因此自动化工具应定位为辅助筛查而非刚性守门机制。

大规模文献审计:一旦建立自动化的重分析能力,学术界即可对已发表文献进行系统性的后续审计。识别出的高风险研究可被优先纳入人工复现队列,从而更高效地分配有限的审验资源。这种方法与 “复现游戏”(replication games)等系统性复现倡议高度互补,可以将文献校正工作从零星行动转变为常规质量监控。

分析灵活性的可视化与诊断:自动化为每项声明生成多个合理的分析规范,并展示结果如何随分析选择而变化。这种 “多宇宙分析” 的可视化,能够让研究者和读者直观地看到一项发现对分析路径的敏感程度。对于审稿人而言,这提供了一个透明的窗口来判断结论的稳健性;对于研究者而言,则是一个在发表前进行自我诊断的工具。

与复现工作的关系定位:论文特别强调,自动化评估的是计算可重复性——即结果能否从原始数据中恢复,而非可复现性——即效应在新数据中是否成立。两者是互补的。确认一个结果在计算上可复现,并不保证其背后效应具有普适性,因此独立数据上的复现研究仍然不可或缺。自动化工具的价值在于它降低了验证第一关 “数据-代码-结果” 链条完整性的门槛。

局限性与反思

论文坦诚地列出了若干关键局限。训练数据污染是一个难以回避的忧患——研究所用语料发表于 2009 至 2018 年,早于模型训练截止期,LLM 可能在预训练中接触过部分研究,从而高估其复现能力。另一个深层挑战在于 Cohen's d 转换的假设——将异质的检验统计量强制映射到统一效应量度量,虽然实现了可比性,却牺牲了情境精度。并非所有分析场景都满足这种转换所需的假设。

此外,76 项研究的样本量虽在可重复性评估领域已属难得,但仍集中于特定学科和特定时间段,其结论向其他学科、更近期文献或数据可用性较低领域的推广需保持谨慎。更重要的是,自动化重分析仅回答了 “从数据到结果” 这一环节,而科学进步所依赖的 “从现象到理论” 的链条,依然需要人类的创造性思考和批判性判断。

总结与展望

该研究以扎实的实证证据表明,大语言模型能够让可重复性评估变得更加可扩展和系统化,将其从一项依赖人力的偶发性活动推向科研质量控制的基础设施层面。LLM 在效应量恢复上与人类分析师表现相当,在结论匹配上甚至更优,这标志着一个重要的技术拐点。

然而,技术可行性与生态合理性之间仍有鸿沟。自动化筛查若被采纳为投稿要求,是否会导致作者优化论文以通过检查而非提升分析质量?错误标记的成本应该如何分摊?这些问题亟待科学共同体建立共识。论文给出的关键启示在于:技术工具应嵌入学术治理的透明框架,定位为辅助性而非惩罚性,与现有的开放科学实践——预注册、开放数据、开放代码——协同演进,共同构筑科学自校正的韧性系统。未来,当自动化能揭示一个研究发现多大程度上依附于其背后的分析选择时,科学将不仅更可复现,也将更诚实。