经济生产力的规模定律:LLM 辅助咨询、数据分析与管理任务的实验证据

Scaling Laws for Economic Productivity: Experimental Evidence in LLM-Assisted Consulting, Data Analyst, and Management Tasks

arXiv: 2512.21316v1

论文信息

标题: Scaling Laws for Economic Productivity: Experimental Evidence in LLM-Assisted Consulting, Data Analyst, and Management Tasks

作者: Ali Merali

发布日期: 2025-12-24

arXiv ID: 2512.21316v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:大语言模型(LLM)的训练计算量(compute)和算法进步,究竟能在多大程度上、以怎样的规律提升管理咨询、数据分析和企业管理的实战工作效率?

  • 核心方法:对超过 500 名专业人士进行严格筛选的大规模随机对照实验,最终入组的参与者被随机分配使用 13 种不同规模的 LLM 之一或不用 AI,在带真金白银高激励的条件下完成真实工作流程。

  • 关键结果:模型发布时间每向前推进一年,任务完成时间平均缩短约 8%(p < 0.05,其中约 56% 来自训练计算量增长,44% 来自算法进步)。若将这一趋势外推,美国未来十年的总生产率可能因模型规模化而提高约 20%(见论文第 5 节)。

  • 主要局限:实验采用的都是 20–60 分钟的单项任务,难以完全还原企业里动辄数日甚至数周的项目制工作;另外,受限于当时的工具,实验中的 LLM 并未获得完整的外部工具调用权限,可能低估了模型在 “代理型” 任务上的真实能力。

  • 适合读者:关注 AI 经济学、量化交易策略开发、企业数字化转型以及宏观增长趋势的投资从业者、分析师和技术决策者,尤其适合想系统理解 “模型能力提升如何转化为实际产出” 的读者。

论文背景和研究动机

自 GPT‑2 问世以来,训练大语言模型所使用的算力已增长了约四个数量级。在机器学习领域,Kaplan 等人(2020)与 Hoffmann 等人(2022)已经奠定了经典的 “规模法则”(scaling laws),证明模型的交叉熵损失会随训练计算量、数据量和参数量呈可预测的幂律改善。然而,对经济学家和政策制定者来说,一个更关键的问题一直缺少严密答案:模型在数学损失上的改进,究竟如何转化为真实世界的经济生产率?

换句话说,当模型 “更聪明” 或被训练得更庞大时,人类在工作中使用这些模型的速度和产出质量会以怎样的弹性提升?这种动态规律,在论文之前几乎没有来自随机对照实验的系统证据。作者因此设计并开展了一项大规模实验,目标不是简单回答 “用 AI 有没有用”,而是把 “模型能力提升” 当作连续变量,直接测量它与人类产出之间的弹性——作者称之为 “经济影响的规模法则”。

论文还回应了另一层现实焦虑:不少宏观测算模型,如 Acemoglu(2024)的分析,往往把 AI 的生产率提升视为一个固定效应。但如果模型能力本身在快速进步,那么生产率提升就是一个随时间动态放大的过程。因此,结论里预估的 20% 十年生产率提升,并不是一个静止的 AI 普及红利,而是把 “模型每年都在变强” 这一事实纳入增长框架的结果。

核心方法和技术细节

为了尽可能接近真实职业场景并保证因果识别质量,研究设计在以下方面做得相当用心。

实验对象与筛选 研究通过 Prolific 平台和定向邀约,招募了超过 500 名至少具备一年以上经验、年薪超 4 万美元的专业人士,覆盖管理、咨询和数据分析三个高技能领域。申请人还需通过一套严格的筛选调查,包含严谨的注意力检测和能力验证,最终筛出率高达约 90%。在入组样本中,近一半人拥有五年以上工作经验,自评职业能力的均值达到 4.13/5,AI 工具的熟悉度均值为 3.62/5。

任务设计与分类 实验任务分为 “代理型” 和 “非代理型” 两类。代理型任务需要多步推理和工具使用,例如生成甘特图并发送邮件、从超 100 页的 PDF 中提取信息后进行统计检验;非代理型任务则集中在分析、写作和推理上,例如假设检验、A/B 测试分析和商务报告撰写。平均而言,参与者完成一项任务耗时约 26 分钟,任务难度自评为 3.18/5。

激励机制 报酬设置相当激进:基础酬劳 $15,如果专家盲审给出 5、6 或 7 分(满分 7 分),酬劳翻倍至 $30。评分由具备 5 年以上相关经验的同行专家进行。得分 0 或 1 的提交(通常为明显违规或机器人痕迹)则不予支付,这类情况不到总样本的 5%。

模型与随机化 参与者被随机分配到一个不使用 AI 的对照组,或 13 个不同训练计算量与发布时间的 LLM 处理组之一。模型使用通过定制网站进行,便于监控和合规。处理组的参与者在正式任务之前还完成了一次带监控的练习,以熟悉所分配的模型。

规模法则的建模方式 论文从两个维度刻画技术进步:一是 “日历时间”(以 2022 年 11 月 ChatGPT 发布为起点,按月计算),捕捉算力增长和算法创新的综合效果;二是 “训练计算量” 的对数,直接估计纯算力规模带来的弹性。在此基础上,作者进一步通过同时放入时间和计算量的回归,把总进步分解为算力驱动部分和算法驱动部分。

创新点和贡献

本文最核心的贡献,是把机器学习文献中的 “模型能力规模法则” 直接延伸到了人类劳动产出上,构建了明确的经济规模法则。

从二元比较到连续弹性 既有研究大多比较 “用 AI” 与 “不用 AI” 的效果。本研究则利用 13 个模型之间的能力梯度,直接估计出时间、产出质量、单位时间收益与模型训练计算量之间的关系。论文发现,训练计算量每增加 10 倍,任务完成时间约下降 6.3%(见论文第 4.3 节及表 12)。这一弹性将为未来预测 AI 经济影响提供一个关键参数。

生产率增长的分解 论文进一步将日历时间带来的约 8% 年化效率提升分解为两部分:约 56% 可归因于算力扩张,约 44% 来自算法进步。这相当于在 AI 生产函数中找到了一份 “索洛剩余”,为政策讨论和技术投资提供了更精细的判断依据。

代理型任务的 “抗自动化” 特性 一个具有警醒意义的发现是,AI 对非代理型分析任务的生产率提升远大于代理型任务(总收益方面,$1.58/min vs $0.34/min,差异在 5% 水平上显著,p=0.043,见表 6)。这意味着,目前的大模型擅长把认知和文本分析商品化,但在需要多步规划与工具调用的 “流程代理” 上,人的瓶颈仍然顽固。

人机互补的 “天花板效应” 论文在非代理型任务上发现了一个令人不安的悖论:当模型自己独立作答时,答案质量随训练计算量线性提升(10 倍算力对应 0.51 分的质量提升,p < 0.01,见表 30),但一旦人类参与进来,最终输出质量就几乎不随模型变强而上升(p ≈ 0.85,图 13)。尤其在面对强模型时,人类用户反而可能把原本超高质量的输出 “拉低” 到自己习惯的水平。这一现象强烈提示,今后的生产力提升远不只是训练更强的模型,还需要深刻改造人机协作方式。

实验结果分析

整体 AI 溢价 汇总所有模型的混合效应显示,一旦用上任何一款 AI 工具,参与者的基础每分钟收益从 $0.69 上升到 $1.24,升幅 81.3%(p=0.001)。同时专家评分从 3.32 上升到 3.91,提高约 0.34 个标准差。结合速度提升和质量改善,总收益(包含绩效奖金)从 $0.73/min 跳升至 $1.79/min,涨幅高达 146%(见论文第 4.1 节及表 1–表 3)。

规模法则 最值得关注的弹性是任务完成时间。论文估计,模型发布月份每增加一个月,对数时间就下降约 0.0069(p < 0.05,表 9),折合每年约 8% 的耗时缩减。如果把这一趋势直接应用于每小时劳动产出,单位时间的经济产出几乎是以 “硬提升” 的方式逐年向上平移。

异质性 如前所述,代理型和非代理型任务的趋势截然不同。非代理型任务的耗时每年减少约 10.7%(p < 0.05),代理型任务仅约 4.8% 且未达到统计显著(见表 16、表 17)。这也意味着,如果未来模型在工具调用与多步规划上出现突破,现有弹性可能会被明显改写。

质量悖论 在非代理型任务上,论文同步收集了 “AI 单独作答” 的答案并请相同专家评分。结果用最直观的方式展现了当前人机协作的窘境:AI 独立输出可以随着训练算力出现近乎线性提升的质量增长,但人类参与后,不论配的是弱模型还是强模型,最终质量都稳定在 4.3 分左右(图 13)。这提示,在当前的界面和任务范式下,人类用户实际上 “封顶” 了模型的能力释放。

宏观推演 借用 Acemoglu(2024)的框架,论文基于自身的实验弹性更新了关键参数:当前基线生产率提升为 81.3%,之后每年前沿模型让任务耗时再缩短 8%。以外推 5 年作为十年期内的代表性中点,AI 接触任务的效率提升可达到约 175%。结合任务暴露比例(19.9%)和劳动份额(57%),得出未来十年 LLM 可能推动美国总量生产率增长约 20%(见论文第 5 节)。这一数字远高于以往静态估算,因为它嵌入了模型能力持续进步的动力。

实践建议

对量化交易、AI 投研和智能决策领域的从业者来说,这篇论文提供了几层非常落地的洞见。

把 “规模法则” 纳入策略研发管线的预期管理 如果你的团队正在构建基于 LLM 的因子挖掘、报告解读或事件驱动分析管道,就不应把模型能力视为静态输入,而应预期模型能力每年带来约 8% 的时间压缩。这意味着,当前的系统架构和人工复核流程,需要按 “模型每年会变强” 而不是 “每几年大升级一次” 的节奏去设计,否则频繁的重新适配会吞噬掉大部分效率红利。

非代理型任务优先切入,代理型任务谨慎投入 论文清楚表明,当前规模法则在纯分析、纯文本解读类工作上回报极高,而在需要多步骤工具串联的任务上收益平缓且不确定。以量化团队为例,优先让 LLM 承担研报摘要、纪要抽取、宏观数据解读、代码片段生成等 “分析型” 环节,是短期内最确定的效率杠杆。至于让模型自主调度数据引擎、自动生成并回测完整策略这类 “代理型” 工作流,当前收益尚不够可靠,更适合作为前瞻性实验而非核心生产依赖。

密切关注人机协作的质量 “天花板” 论文最值得警惕的发现之一,就是人类在高能力模型面前反而可能降低最终质量。实践中的教训是:如果任务有较高准确率要求,例如法律条款解析、风控规则生成或实盘交易逻辑验证,不能只把 “强模型 + 人审核” 当作默认最优解。可以考虑实验中 “人只负责极轻量校验、尽量保留模型原始输出” 的流程,或通过结构化模板引导用户不过度修改高质量自动生成内容。

宏观视角下的资产配置与管理决策 论文预计未来十年 LLM 可贡献约 20% 的总量生产率增长,这远高于很多传统技术进步带来的十年期改善。对宏观策略和资产配置团队而言,这暗示两点:其一,未来十年美国经济潜在增速的预测需要系统性上修,长期利率中枢和权益资产定价都可能因此重估;其二,如果这种由模型持续进步带来的效率红利能够兑现,那些率先实现 “人机深度耦合” 的企业和行业,将获得远超行业平均水平的边际收益,这本身就是一种可以跟踪的因子投资机会。

把 “模型代数” 纳入工具选型决策 过去人们在选择模型时,往往只看当下的跑分和人工评估。论文的规模法则提供了一个更具前瞻性的框架:当你需要在两个体量不同的模型之间做出选择时,不应只比当前效果,还要考量后续算力提升带来的边际收益斜率。在算力成本快速下降的背景下,选择那些处于 “规模报酬尚在陡峭区间” 的模型生态,可能比选择某个暂时领先但无法继续有效利用更多算力的模型更具长期价值。

总体而言,这篇论文将 AI 对工作的影响从一个静态 “有或没有” 的问题推进为一个连续的 “变强多快” 的问题,值得每一位想把 AI 纳入核心业务流程的技术与投资人士细读。