扩展开放式推理以预测未来
Scaling Open-Ended Reasoning to Predict the Future
论文信息
标题: Scaling Open-Ended Reasoning to Predict the Future
作者: Nikhil Chandak, Shashwat Goel, Ameya Prabhu, et al.
发布日期: 2025-12-31
arXiv ID: 2512.25070v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:如何训练语言模型对开放式未来事件进行高质量的预测——不是简单的二元(是/否)问题,而是需要给出任意自然语言答案并附带置信度的预测。
- 核心方法:从全球新闻中自动生成开放式预测问题并严格过滤,构建了包含约 5.2 万条样本的数据集
OpenForesight;使用基于结果的强化学习(GRPO)训练 Qwen3 模型,并设计了一种融合准确率与 Brier 评分的奖励函数,同时配合离线新闻检索以杜绝未来信息泄漏。 - 关键结果:8B 参数的
OpenForecaster模型在 2025 年 5–8 月的开放式预测测试集上,其 Brier 评分超越了 GPT‑OSS‑120B 等大得多的专有模型,校准能力也泛化到了多个通用基准(见论文第 6 节,图 6 与图 7)。 - 主要局限:训练数据完全依赖新闻文本,存在事件分布偏差;部分事件新闻可能滞后报道,会使某些问题的预测难度低于实际;尚未处理长篇预测的评分问题(论文第 7 节)。
- 适合读者:从事大型语言模型、量化预测、智能决策或强化学习研究的人,以及希望构建自动化预报系统的工程师和量化分析师。
论文背景和研究动机
高风险决策——政策制定、资本配置、科技路线选择——本质上都需要对不确定的未来进行判断。数十年的 “超级预测者” 研究已表明,虽然预测困难,但通过训练可以显著提升人类的预测能力。大型语言模型具有处理海量异质信息、快速更新预测的潜力,然而目前预测模型的研究长期受制于三个瓶颈:① 人工构造的预测问题数量少,难以规模化训练;② 预测市场传统上以二元问题为主,50% 的随机猜测成功率使强化学习的奖励信号充满噪声;③ 不同平台的事件分布严重偏向美国政治、加密货币等话题,缺乏多样性。此外,基于互联网搜索的 “回溯测试” 容易因网页动态更新而泄漏未来信息,损害评估与训练的可信度。
本文的目标正是攻克这些难题:如何规模化训练语言模型进行开放式预测,使模型能自由给出自然语言答案并诚实报告置信度,而不仅是勾选预设选项。
核心方法和技术细节
开放式预测问题定义
论文将预测任务设定为:给定一个开放式问题 (如 “谁将在 2025 年 7 月 17 日被确认为乌克兰新总理?”),模型输出最佳猜测答案 及其被赋予的概率 。准确率通过另一个语言模型(Llama‑4‑Scout)判断 是否与真实结果语义等价;校准则采用一种改编自多类 Brier 评分的指标:
该评分确保模型在预测正确时得到正回报,错误时负回报,且大小随置信度二次变化,激励模型既追求准确又真实表达不确定性(附录 A)。
从新闻自动生成训练数据:OpenForesight
为了突破预测问题的规模瓶颈,论文设计了一套全自动、无需人工标注的数据生成流水线(如图 2):
- 文章采集:使用 CommonCrawl News 静态月快照,获取 2023 年 6 月至 2025 年 4 月间约 24.8 万篇英文新闻(涵盖 Forbes、Hindustan Times、Irish Times 等多样来源),杜绝搜索引擎带来的未来信息泄漏。
- 问题生成:DeepSeek‑v3 为每篇文章提出最多三个预测性问题,并附背景、答案形式和真实答案(直接用文章中的事实)。
- 严格过滤:Llama‑4‑Maverick 验证问题是否完全基于文章、是否前向(将来时)、答案是否无歧义且可验证。多道问题只保留质量最好的一道。
- 答案泄漏修复:约 40% 的问题直接包含答案字符串,通过 LLM 重写泄漏字段并辅以字符串匹配强制过滤,最多移除了 90% 的泄漏案例。
最终得到的 OpenForesight 训练集包含约 5.2 万个问题,每条来自唯一文章,经人工验证准确率约 95%。消融实验(表 1 左)证明,仅靠去除泄漏即可逆转训练带来的性能下降,而使用完整过滤流程在仅 1/3 的数据量下获得更高的准确率和 Brier 评分。
奖励设计与强化学习训练
训练采用 GRPO 算法,从 Qwen3‑8B 思考模型出发。论文对比了三种奖励函数(图 4):
- 仅准确率:正确为 1,错误为 0,虽然准确率提升但 Brier 评分极差,模型校准失控。
- 仅 Brier 评分:准确率提升有限,因为模型在难题上倾向输出 “未知” 且近乎零的置信度(约 40% 样本),阻碍探索。
- 准确率 + Brier 评分(本文最终选择):。该设计在难题上依然给予高额正确信号,鼓励模型做出低置信度但有价值的猜测,从而同时提升准确率和校准度。
训练时还加入 2000 个来自 Metaculus 的二元预测问题(使用其标准 Brier 奖励),以保证模型在二元格式下不退化。
离线检索以避免未来信息
检索使用 Qwen3‑8B Embedding 模型,从包含 100 万篇不同来源文章的离线新闻池中提取与问题最相关的 5 个文本块(512 tokens/块)。关键的安全措施是:仅检索问题解决日期之前一个月的文章,杜绝在训练或测试中看到答案。实验表明,仅此一步就让准确率提高 9‑18%(图 5),且读入 5 块后收益趋于饱和。
创新点和贡献
- 首个大规模开放式预测训练集:
OpenForesight通过自动化流程从全球新闻中抽取了约 5.2 万个高质量预测问题,彻底摆脱了对人工构造问题和小规模预测市场的依赖。 - 融合准确率与校准的强化学习奖励:提出的 “准确率 + Brier” 奖励函数在保持高水平校准的同时,显著提高了最终准确率,解决了单一 Brier 优化导致的探索不足问题。
- 严密的时序污染防御:全程使用静态新闻语料库,检索仅用问题截止前一个月的数据,训练截止到模型冻结日期,确保强化学习信号真正来自 “未来” 事件,增强了回溯测试的可信度。
- 开源的预测系统:发布了数据集、代码和模型权重,使语言模型预测研究变得广泛可及。
实验结果分析
在 2025 年 5–8 月的留出测试集(302 个高难度开放式问题,源自 Al Jazeera、Fox News 等训练中未见过的新闻源)上:
OpenForecaster‑8B的 Brier 评分(图 6a)超过了 GPT‑OSS‑120B、DeepSeek‑R1 等大部分大得多的模型,准确率也优于 Qwen3‑235B。- 在外部基准 FutureX(86 个二元/多选问题)上,该模型准确率遥遥领先(图 6b)。同时,长程预测的逻辑一致性检查显示,相对原始模型,套利类违规降低 44%,频率学派违规降低 19%(见附录表 7),表明预测稳定性获得质的提升。
更令人惊喜的是,校准能力的迁移:仅仅通过预测训练,模型在 SimpleQA、MMLU‑Pro、GPQA‑Diamond 等通用知识或推理基准上的 Brier 评分也明显改善(图 7a),意味着学习到的不确定性估计能力可跨任务泛化。
实践建议
基于本文的方法和发现,构建实际落地预测系统的团队可参考以下建议:
- 自动化数据流水线:采用类似的大模型生成‑严格过滤‑泄漏修复流程,能够以极低成本持续生产高质量的开放式预测问题。本文的数据集创建总成本约 $3000(论文附录 H),为小团队提供了可行性范例。
- 永远使用静态、版本化的新闻源:避免调用在线搜索引擎进行回溯测试或训练,改用 CCNews 等月度快照,并严格设定检索截止日期,否则未来信息会悄无声息地污染模型能力,造成虚假的高精度。
- 奖励函数设计避免只优化准确率:在金融或政策预测等场景中,模型必须能诚实表达不确定性。采用准确率 + 校准指标(如 Brier 评分)的复合奖励,并监控模型的 “弃权” 比例(输出极低置信度的未知状态),可以防止模型在难题上停止探索。
- 混合训练格式:仅用二元问题训练会导致开放式预测退化,而纯开放式数据又会削弱二元市场的表现。在训练集中保持一定比例的二元预测问题,能够获得最优的综合性能(见图 11)。
- 善用校准的迁移能力:预测训练带来的不确定性校准改进可泛化至事实核查和知识问答,这为建造 “知道什么时候不知道” 的可靠 AI 代理提供了一条成本低廉的路径——只需在预测数据上微调,即可提升模型的安全性和可信赖度。