onepot-Bench 0:迈向实验室感知的计算化学基准

onepot-Bench 0: towards lab-aware in silico chemistry benchmarks

arXiv: 2608.02595v1

论文信息

标题: onepot-Bench 0: towards lab-aware in silico chemistry benchmarks

作者: Brandon Wang, Andrei S. Tyrin, Daniil A. Boiko

发布日期: 2026-08-03

arXiv ID: 2608.02595v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:语言模型在实验室化学中的能力评估缺少可靠、防泄漏的基准,尤其是模型在湿实验条件下的真实判断力和安全性。
  • 核心方法:提出 onepot-Bench 0,包含三部分:ChemAbacus 测试工具免用的化学信息学与数值推理;SynthRefusal 系统测量模型在良性至危险目标上的合成请求拒绝行为;SynthBench 使用私有实验室数据评估反应结果预测和催化剂选择。
  • 关键结果:所有模型在 SynthBench 的反应结果预测上均输给简单的逻辑回归基线(基线平均准确率 76%,最好模型 Claude Opus 5 平均 65%,表 7);催化剂偏好任务中无模型显著高于随机水平(图 7)。
  • 主要局限:催化剂偏好数据量较小(95 对 Suzuki‑Miyaura 反应);基准暂未涵盖智能体任务或真实实验室闭环反馈;评估仅反映零样本表现,尚未引入工具使用或微调。
  • 适合读者:从事 AI 化学、实验室自动化、LLM 安全评估的研究人员,以及希望将语言模型部署到实际合成管线中的开发者。

论文背景与研究动机

语言模型正越来越多地参与科学实验规划、执行与分析。然而,化学领域缺乏公认的、能防止数据泄漏的评估标准。现有的化学基准大多依赖公开数据库,容易产生记忆过拟合,且很少触及物理实验室中需即时判断的真实能力。onepot AI 作为一家正在构建小分子自动合成产线(fab)的实验室,深知模型必须同时具备基础化学知识、反应直觉与安全性判断,才能真正用于湿实验决策。为此,他们设计了 onepot-Bench 0,一个围绕 “实验室感知” 的私有基准,旨在测量模型在化学计算、安全拒绝、实验结果预判三个正交维度上的能力,揭示书本知识与实验执行之间的鸿沟。

核心方法

ChemAbacus:化学信息学与数值推理

ChemAbacus 包含 800 道问答题,每道题围绕一个 SMILES 分子。其中 100 道要求枚举分子中所有官能团;其余 700 道均匀分布在七种数值查询上(分子量、环数、TPSA、cLogP、可旋转键数、氢键供体数和受体数)。题目分子来自 ChEMBL,并混入难例,以增加区分度。评分要求数值题目容错(分子量 ±1%,TPSA ±5 Ų,cLogP ±1),而计数题需精确匹配。答案用 RDKit 和自定义 SMARTS 生成,确保评判一致。

SynthRefusal:安全拒绝行为图谱

该模块测量模型面对合成请求时的五种响应:干净拒绝、给出解答、部分泄露、未识别目标、误识别目标。拒绝率仅计算前两种。评估使用两组数据:“受控物质组” 含 282 个分子,覆盖良性、反兴奋剂、毒物、爆炸物、列管药物和化学战剂,每种分子以 SMILES、通用名、CAS 号、InChI 四种表现提交;“设计师药物组” 含 201 个分子,来自维基百科列表,仅通过 SMILES 提交。为评判对齐质量,引入了基于 SMILES 的对齐指数 AD=c qDA_D = \sqrt{c \, q_D},其中 cc 为良性合规率,qDq_D 为某种受控类别的平均拒绝率,以此惩罚一律拒绝或一律合规的极端行为。

SynthBench:基于私有实验数据的反应与催化剂预测

SynthBench 使用 onepot 内部湿实验室产生的专有数据(POT-2 自动化实验室)。结果预测任务在 8 类反应中各取 40 阳性和 40 阴性样本,要求模型在给定反应物、产物及反应条件(催化剂、溶剂、温度、时间)下预测反应是否成功。催化剂偏好任务聚焦 Suzuki‑Miyaura 偶联,给出两个仅催化剂不同的反应,一个成功一个失败,要求模型选出更可能成功的催化剂。为建立参考,团队还训练了一个逻辑回归基线,使用简单特征。

创新点与贡献

  1. 首个结合私有实验数据的化学 LLM 基准:杜绝了因训练语料含公共数据导致的虚假高成绩。
  2. 全链路能力拆解:将 “能做化学题” 与 “能像实验者一样判断” 明确区分,用 ChemAbacus 测知识,用 SynthBench 测经验直觉。
  3. 精细化安全评估:不仅统计拒绝率,还分析分子表现方式、靶标类别、推理强度对拒绝行为的影响,并引入对齐指数,取代粗糙的拒绝率比较。
  4. 揭示复合风险:发现 GPT‑5.5 在已知管制化合物上对齐度高,但对不熟悉的设计师类似物泛化能力差,提示模型可能依赖记忆而非推理;部分模型存在过度拒绝良性化学或几乎不拒绝危险物质的双重失败模式。

实验结果分析

ChemAbacus:Claude Fable 5 在配备 Opus 5 作后备后达到最高平均准确率 96.4%(表 1),各类任务也出现满分模型。整体上,非计算题表现优于计算题,但推理能力增强后计算与非计算差距收窄,说明模型拥有化学知识,但算术能力不足。费用方面,最高分模型的查询成本约 $11.09/查询,而成本最低的 Gemini 3.5 Flash 仅 $0.35/查询却也达到 87.6% 的准确率,性价比较高。

SynthRefusal:在受控物质组中,Fable 5 和 GPT‑5.5 对齐指数均 >80%,但 GPT‑5.5 对设计师药物组的对齐指数骤降至 ~67%,而 Fable 5 仍约 80%(图 4、图 5)。说明 GPT‑5.5 对已知危险品识别力强,但难以推广到新型类似物。推理强度升高的影响因模型而异:GPT‑5.5 的高思考水平使受控物质组拒绝率提升约 14 个百分点,设计师组提升 17 个百分点;而 Gemini 3.1 Pro 反而下降约 7 个百分点。分子表现形式的影响无统一规律:对抗兴奋剂目标,CAS 号比 SMILES 平均多出约 15 个百分点拒绝率,而对化学战剂,CAS 号反而降低约 7 个百分点(表 5),表明安全策略未与分子结构稳定挂钩。

SynthBench:反应结果预测中,logistic 回归基线在 7/8 类反应上击败所有 LLM,仅 Buchwald‑Hartwig 偶联上 Claude Opus 5 略胜一筹(图 6)。Claude 家族整体表现最佳,但平均准确率也仅为 65%(Opus 5 最高 vs 基线 76%)。多数模型的敏感度/特异性分析显示,它们倾向于过度乐观地预测反应成功(图 6 右下)。催化剂偏好任务上,所有模型的准确率均在随机水平附近(95% 置信区间包含 50%,图 7),进一步印证了 LLM 缺乏基于机理的经验判断力。

实践建议

  1. 不要用通用化学问答成绩推断实验能力:onepot-Bench 0 的结果明确表明,ChemAbacus 高分并不代表模型能做好反应预测。在将 LLM 纳入自动化合成流程前,务必用私有实验数据构建类似 SynthBench 的基线,测试其真实决策质量。
  2. 优先建立简单的统计基线:本研究中,一个基于少量特征的逻辑回归模型远超所有 LLM。在条件有限时,先积累实验室数据并训练传统 ML 模型,比直接依赖 LLM 更可靠。
  3. 安全对齐必须按靶标和输入形式分层测试:不同模型对不同分子类别和表现(SMILES vs. 名称)的拒绝行为差异巨大,不能仅根据平均拒绝率选择模型。应具体测试在真实业务中会遇到的分子类别,并建立内部的对齐指数。
  4. 推理强度并非万能药:增加推理预算并不一致地提升 SynthBench 的准确率,甚至可能使某些模型变得更乐观或更安全但更保守。在部署时,应当针对具体任务做 ablation,避免盲目使用高推理模式。
  5. 警惕记忆安全风险:GPT‑5.5 对已知毒品拒绝良好,却轻易为未知类似物提供合成指导。在涉及分子生成或逆合成规划的 AI 系统中,必须引入结构相似度检查或外部管制数据库,而不能仅靠模型自身的判断。
  6. 费用与能力需权衡:低成本模型(如 Gemini 3.5 Flash)在 ChemAbacus 中性能尚可,但在 SynthBench 同样接近随机。如果仅需解析 SMILES 等基础任务,可选用轻量模型;一旦涉及实验决策,应追求经过实验数据验证的方案,即使成本更高。