当掷骰子时,大型语言模型的可靠性如何?

How reliable are LLMs when it comes to playing dice?

arXiv: 2606.07515v1

论文信息

标题: How reliable are LLMs when it comes to playing dice?

作者: Luca Avena, Gianmarco Bet, Bernardo Busoni

发布日期: 2026-06-05

arXiv ID: 2606.07515v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:大语言模型在处理离散概率问题时,是否能够避免启发式错误和认知偏误,展现出真正的概率推理能力。
  • 核心方法:构建标准习题集与反直觉习题集,在 8 个先进商业模型(共 16 种配置,有/无思维链)上进行控制实验,并额外设计表面形式改写(Token 偏误)和误导性提示注入(逢迎偏向)测试。
  • 关键结果:模型在标准题上的平均准确率达 0.96,但反直觉题仅 0.59;改写问题形式导致平均性能下降超过 20%;嵌入其他模型生成的错误答案后,性能最多下降 34%,且无模型免疫。
  • 主要局限:部分强模型在改写题中仍能识别原始问题,Token 偏误测量可能低估了真实推理能力;逢迎实验中错误推理也可能引发逻辑误导,不完全等同于纯社交逢迎。
  • 适合读者:关注大语言模型推理鲁棒性、AI 对齐与安全的研究者,以及需要将 LLM 用于概率建模、风险评估的量化工程师和决策支持系统设计者。

论文背景和研究动机

大语言模型在数学竞赛和定理证明等高级任务上不断创下惊人成绩,但能否因此认定它们具备真正的推理能力,仍是开放问题。概率论恰好处于形式严谨性与日常直觉的交叉地带:许多著名的认知偏误测试正是基于概率陷阱设计的。此前已有研究尝试用心理学测试评估 LLM 的决策偏差,结论却彼此矛盾——有的发现模型表现出类似人类的锚定效应和损失厌恶,有的则认为模型的错误 “非人化”,还有观察表明随着模型参数增大,偏误快速消失。

这些差异很可能源于测试题本身已被模型记忆,而非推理能力的真正提升。为剥离模式匹配的干扰,本文作者聚焦于离散概率问题,自行构建了一组精心设计的习题集,既包含教科书标准题,也包含刻意诱发直觉错误的反直觉题,并通过对题目表面形式的改写、以及向提示中嵌入误导性意见,系统检验 LLM 的概率推理究竟有多可靠。

核心方法和技术细节

实验使用两套数据集:标准数据集含 50 道离散概率题,取自意大利大学通用教材;反直觉数据集含 20 道专门设计的题目,大部分改编自 Tversky、Kahneman 等人的经典偏误案例,但所有题目都经过重新表述,以防模型直接从训练数据中调取答案。全部 70 道题均采用开放式作答,评分标准为严格对比正确答案的平均准确率(每道题重复 4 次取均值,分数落在 [0,1][0,1] 连续区间)。

被测试模型包括 ChatGPT 5.4、Gemini 3.1、Qwen 3.5、DeepSeek V3.2、Grok 4、Kimi 2.5、GLM 5、Mistral Large 3 共 8 个系列,每个均在同一厂商下测试 “含思维链(CoT,中等推理强度)” 与 “无思维链” 两种配置,共 16 个变体。所有请求通过 OpenRouter API 统一发送,温度设为 1,最大 token 数 40000。评估方式上,反直觉题由人工判定,标准题采用 LLM-as-a-Judge(Gemini 3.1)自动比较,并辅以人工抽查。

为探测Token 偏误,作者选取若干著名概率悖论,在保持逻辑结构不变的条件下将其故事背景完全重写。其中 “蒙蒂霍尔问题” 的改写尤为典型:保留三扇门、羊和车的设置,但引入一只 “金羊” 作为目标,改变了最优策略(正确答案从 “换门” 变为 “不换门”)。通过比较原版与改写版的准确率差异,衡量模型对表面词句的依赖。

逢迎偏向实验则在题目后附加一句 “我认为正确答案是……因为……”,分三种条件:(1)只提供错误数值;(2)错误数值+人为编造的、符合典型启发式偏误的伪推理;(3)错误数值+从先前实验中其他模型实际生成的错误答案文本。最后一种条件旨在测试模型间错误传播的杀伤力,这也是本文最具特色的设计。

创新点和贡献

本文在三个方面对 LLM 推理研究做出直接贡献。

第一,提供了一个专门针对概率启发式错误的基准。 作者没有沿用现成的心理学生数列表,而是自建习题集,并将开放式作答作为主要形式,避免了选择题正确答案可能充当 “提示线索” 的问题。实验明确展示,即使在标准数学题上表现近完美的模型,在反直觉题上也会系统性出错。

第二,同时量化了 Token 偏误和逢迎偏向的效应,并揭示了二者可叠加的严重后果。 在表面形式改写后,模型平均损失超过 20% 的准确率,在改写版蒙蒂霍尔问题上,部分模型甚至沿用原策略犯错。而当提示中包含其他模型生成的 “貌似合理” 的错误推理时,性能损失高达 34%,且思维链模式对此几乎没有任何保护作用——这与它在反直觉题上的帮助形成鲜明对照。

第三,提供了模型间错误传染的实证。 使用真实模型错误作为误导内容,比人工编造的谬误更有破坏力,说明当前 LLM 极易被同类 “骗过”,在需要链条化 AI 协作的场景中构成重大风险。

实验结果分析

在基础性能上,标准题的平均准确率为 0.96,九种配置超过 99%;反直觉题则骤降至 0.59(图 1、图 2)。其中 ChatGPT 5.4 Thinking 在反直觉题上表现最优,准确率 0.84,而多款无思维链的模型率显著偏低。思维链在反直觉题上整体起到正向作用,仅 Mistral Large 3 例外,其有无 CoT 的差异微乎其微(图 3、图 4)。

Token 偏误实验中,尽管某些强模型在改写题中仍识别出了原始问题,但整体趋势仍极为明显:原版名题几乎全对,改写版准确率下降超过 20%(图 5)。尤其是 “蒙蒂霍尔问题” 的改写版,多款模型直接输出 “应当换门”,盲目复现训练数据中的经典解答,暴露出基于表面匹配而非结构推理的弱点。

逢迎偏向实验则进一步显示,当提示中附上错误答案时,所有模型都发生退化。第一种条件(仅错数)和第二种条件(错数+人为伪推理)造成的相对性能衰减分别为 7% 和 11%,而第三种条件(错数+其他模型的真实错误文本)使衰减激进至 34%(图 6)。绝对衰减与模型原本的推理能力仅有弱相关,一些平时极强的模型(如 DeepSeek V3.2 和 Qwen 3.5 Plus)在遭遇模型生成的误导时变得高度脆弱,而 Gemini 3 Flash 反倒相对稳健(图 7)。

实践建议

凡是将 LLM 用于需要概率判断的场景——例如量化交易中的事件概率估计、风控模型中的不确定性量化、或自动研报生成——都需严肃考虑本文揭示的三重风险。

1. 用反直觉样本扩充评测流水线。 常规数学基准不能暴露模型的启发式错误,应专门构建或引入类似本文的 “反直觉” 习题集,作为模型选型和上线前的强制考核。可以重点检验模型在 “条件概率更新”“样本空间划分” 等基础工具上的误用倾向。

2. 防止表面形式变化导致决策翻转。 交易信号或风险提示的文本若出现不改变实质的措辞变动(如重述同一事件的不同角度),模型可能给出截然相反的判断。强烈建议对核心 prompt 进行成组变体测试,并对比输出分布的一致性;若不同表述导致解答分歧,应触发人工复核或规则干预。

3. 隔离外部输入的误导性推理。 逢迎偏向实验证明,尤其来自其他 AI 的、看起来 “有道理” 的错误推理,会使模型准确率剧烈下降。在实时系统中,不要将用户或其他模型提供的分析意见直接嵌入生成 prompt,除非经过独立验证。若必须引入外部观点,应使用清晰的角色分隔标记,并添加 “仅作参考” 类指令,但仍不可完全依赖。

4. 思维链并非万能护盾。 虽然 CoT 在提升反直觉题准确率上有帮助,但在逢迎偏向面前几乎失效。所以不能因为启用了 “思考过程” 就放松对答案正确性的检验,需要对 CoT 内容本身进行逻辑审计,或引入外部形式验证器,尤其是在涉及资金决策的场景下。

本文揭示的系统性弱点表明,当前的大语言模型远非成熟的概率推理者,它们继承了训练数据中的认知捷径,且极易受到提示措辞和误导意见的干扰。在可靠性要求极高的量化金融和科学决策领域,大语言模型目前更适合作为辅助工具而非自动决策主体。