通过深度原生结构推理实现准确、跨学科且透明的结构-性质理解

Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning

arXiv: 2607.07708v1

论文信息

标题: Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning

作者: Chen Tang, Yizhou Wang, Jianyu Wu, et al.

发布日期: 2026-07-08

arXiv ID: 2607.07708v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决什么 传统科学 AI 系统要么将蛋白质、分子、晶体等结构压缩为文本,依赖语言关联而非物理证据进行推理;要么直接输出预测分数,不暴露中间推理过程。论文试图构建一个能够将三维结构信息作为可审查推理证据的科学基础模型。

  • 核心方法:用什么办法解决 作者提出原生结构推理范式,构建 SciReasoner 多模态科学基础模型,通过 Foldseek、SLICES、ConfSeq 等工具将蛋白质结构、晶体和分子分别离散化为结构感知词表,将这些结构 token 与自然语言指令整合到单一自回归模型中,生成可追溯至具体残基、分子片段或晶体描述符的推理链条。

  • 关键结果:最重要的一个结论或数字 在 86 个基准测试中,SciReasoner 在 67 个任务上达到最优性能。双盲专家评估显示,与前沿大语言模型相比,SciReasoner 的推理轨迹在 98% 的比较案例中被专家评为更优或至少持平(见论文第 15 页,2.5 节)。

  • 主要局限:作者自己承认的、或方法本身固有的限制 论文摘要部分声明人类评估样本量仍在收集中,当前仅为初步结果(见论文第 15 页脚注 6)。此外,结构编码依赖预训练的外部工具(Foldseek、SLICES 等),这些工具本身的误差和覆盖范围会传导至模型。

  • 适合读者:什么背景的人值得读 适合从事蛋白质功能预测、药物分子设计、材料性质预测的研究者,以及关注科学 AI、多模态基础模型、可解释机器学习的从业者。

论文背景和研究动机

结构-性质关系是生物学、化学和材料科学的基石。蛋白质的功能由空间构象、长程相互作用和活性位点几何决定;小分子的反应性取决于键合关系、官能团和立体化学;晶体材料的稳定性和电子性质则由晶格对称性、配位环境和周期性键合网络决定。

当前科学 AI 系统在这类任务上存在一个根本性的表征与推理脱节。一方面,大语言模型提供了灵活的科学知识接口,但当蛋白质、分子和晶体被转化为文本字符串时,结构组织被压缩为线性描述,由此产生的解释依赖语言关联而非可直接处理的物理证据。另一方面,领域专用模型虽然能直接编码分子图、蛋白质结构或晶格,但通常被优化为任务特定的预测器,只输出分类分数或标量性质,不暴露决策背后的结构性证据。

论文作者提出的核心目标是让结构信息成为可审查的推理基底,而非只是预测器的输入描述符。这意味着模型不仅需要预判蛋白质的功能属性,还需要在推理过程中指明具体哪些残基、哪些结构片段支撑了这一判断。

核心方法和技术细节

结构感知词表的构建

SciReasoner 的一个关键设计是将不同科学模态的结构信息统一离散化为结构感知词表。具体来说:

  • 蛋白质:使用 Foldseek 将蛋白质三维结构转换为 3Di 字符序列,每个残基对应一个描述局部结构环境的 token,与氨基酸序列一一对齐。
  • 小分子:使用 ConfSeq 编码器将三维分子构象转换为融合连接性与内部坐标信息的序列 token,保留扭转角、伪手性等立体化学信息。
  • 晶体材料:使用 SLICES 编码器将晶体结构转换为包含空间群、周期性连通性和原子类型信息的 token 序列。

与标准的子词分词器不同,SciReasoner 的分词器不将化学语义单元(如官能团、芳香环体系)碎片化。论文给出具体例子:Qwen 分词器将分子 SMILES 分割为 31 个片段,破坏了 c1ccccc1 等化学语义完整的子结构;SciReasoner 分词器压缩为 14 个 token,同时保留 cc、>c 等不可分割的结构基元(见论文图 1C)。

多阶段训练流程

预训练分为三个阶段(见论文第 17-18 页,4.3.1 节)。

阶段一为预热训练:冻结大语言模型的核心 Transformer 骨干,仅训练新引入的结构感知词嵌入层、文本嵌入层和预测头,将结构 token 锚定到语言语义空间中,避免破坏预训练基础模型的推理能力。

阶段二为全参数训练:解冻所有参数,使用大规模跨模态结构-文本数据对进行全模型优化,使深度网络层能整合特定领域的结构知识。

阶段三为退火训练:保持全参数训练设置,增加问答式数据的比例,使用统一的学习率预热-稳定-衰减调度器完成最终对齐。

自引导式后训练策略

后训练分为域内结构证据定基和跨域推理整合两个阶段(见论文第 19-21 页,4.4 节)。

域内阶段将任务按领域分组,为每组独立训练结构专家模型。该过程使用 DAPO 强化学习算法,以软化的科学奖励函数替代传统的二元规则奖励。一个关键设计是难度过滤机制:对每个样本生成 8 次随机采样,计算经验解决率 p^(x)\hat{p}(x),只保留 0.125<p^(x)<0.8750.125 < \hat{p}(x) < 0.875 的中等难度样本用于强化学习训练。这类样本既非简单无关信号,也非完全无解的噪声源,能提供最强的学习梯度。

跨域阶段将所有专家模型生成的推理轨迹汇集,替换原始的教师监督信号,用自生成的高质量链式思维进行统一微调。最终模型在一个与自身表征空间对齐的数据分布上完成整合。

创新点和贡献

第一个创新是提出了原生结构推理的范式概念。SciReasoner 不是将结构 token 作为语言描述的附加补充,而是将其设计为在推理轨迹内可寻址、可组合、可核验的证据单元。生成的推理过程可以直接引用具体残基片段的 Foldseek token、反应相关的分子子结构或晶体空间群 token,实现中间主张到物理结构的可追踪连接。

第二个创新是跨域统一的结构感知架构。单一自回归模型覆盖蛋白质、DNA/RNA、小分子和晶体四种科学模态,避免了为各领域分别搭建黑箱预测器的碎片化方案。这种统一表征使得模型能够在跨模态预训练中获取生物、化学和材料科学之间的共享推理模式。

第三个创新是自引导的后训练流程设计。传统方法依赖外部模型生成微调推理数据,存在分布偏移问题。SciReasoner 先让专家模型自行生成推理轨迹作为训练监督,再汇总统一学习,使最终模型的推理风格与其内部表征一致,避免了任务间干扰和轨迹坍塌。

第四个贡献是广泛的可解释性验证。论文不仅给出准确率数字,还通过注意力图分析证实模型在预测 DNA 结合功能时,高关注度的残基富集在物理接触定义的 DNA 结合位点上(AUROC 达到 0.91,见论文图 2B);通过 UMAP 可视化展示材料表示空间能按成分和能带隙梯度分离多晶型(见论文图 4B、4D)。双盲人类专家评估在证据定基、领域合理性、目标对齐、推理连贯性和抗幻觉五个轴向上均显著优于对比模型(p<0.001p < 0.001,见论文图 6E)。

实验结果分析

蛋白功能预测中的低同源性优势

在 CAFA-3 基因本体术语预测中,SciReasoner 的整体 Fmax 达到 0.59,超过 BLAST、ESM2 和 SaProt 等基线。更关键的分层分析显示,最大提升出现在低同源性区域。在同源性≤30% 的细胞组分预测中,SciReasoner 相较 BLAST 的 Fmax 提升 0.21(从 0.34 到 0.55),相较 ESM2 提升 0.13(从 0.42 到 0.55)(见论文图 2A)。这表明模型不是简单地记忆同源蛋白的注释,而是通过局部结构基序和生化上下文进行功能推断。

逆合成中的可审计推理链

在 USPTO-50K 逆合成基准上,SciReasoner 的单步准确率从前沿模板无关方法 RSGPT 的 0.63 提升到 0.72(见论文图 3A)。模型生成四个阶段的推理过程:产物结构分析、策略性断键、前体验证和反应可行性评估。五个代表性案例中,SciReasoner 的前三名预测包含真实反应物的比例为 5/5,而 RSGPT 为 2/5,Opus-4.7 为 2/5(见论文图 3C)。推理中间步骤以 SMILES 子片段形式呈现,允许原子级别的审计。

材料性质表示空间的物理一致性

在十个材料性质预测子任务上,SciReasoner 全面超过 CGCNN 和 LLM-Prop(见论文图 4A)。形成能的预测达到 R2=0.895R^2 = 0.895 的高相关性(见论文图 4C)。UMAP 投影显示碳、硅、碳化硅结构按化学组成分开成簇,同一组成内不同多晶型沿平滑的能带隙梯度分布(见论文图 4D)。稳定性预测的推理案例中,模型明确引用空间群子串 Fm-3m 和周期性连通性边子串,并将其映射回 CIF 结构中的全局对称性框架(见论文图 4E)。

消融实验对结构必要性的证明

去除结构输入后,材料、蛋白质和小分子任务上的性能一致下降(见论文图 5A)。QMOF 孔道限制直径预测中,无结构模型依赖成分先验将孔径高估近一个数量级(11.11 vs. 1.27 Å),而有结构的推理过程则引用单斜对称性和钴-氮/氧配位环境得出接近真实值的预测(见论文图 5C)。基因本体预测中,仅用序列的推理趋向于 DNA 相关过程,加入结构后正确恢复到蛋白修饰过程(见论文图 5D)。

实践建议

对于蛋白质功能预测领域的研究者和工程师,建议借鉴论文的分层评估方法。低同源性区间(≤30% 序列一致性)的性能是衡量模型是否真正理解结构-功能关系的有效指标,而非记忆同源转移模式。在构建蛋白质表征模型时应纳入结构编码信息(如 Foldseek 的 3Di token),尤其在处理孤儿蛋白或远源同源物时。

对于药物分子的虚拟筛选和分子设计团队,可参考 SciReasoner 的分子嵌入提取方式。从结构 token 位置后的隐藏状态中提取固定维度的分子表示,不需要对接、打分函数或任务特定微调,即可在 DUD-E 基准上实现与专用工具相当的虚拟筛选性能(5.0% EF 达到 7.70,见论文图 3D)。这一方案可快速复用于内部化合物库的富集排序。

对于材料高通量计算的从业者,可借鉴论文将晶体结构编码为 SLICES token 并接入语言模型的方案,避免传统图神经网络在批处理和分布式计算中面临的架构约束。对于稳定性预测类任务,特别要注意在推理输出中保留空间群和周期性边结构信息,以便结果可追踪核验。

对于科学大模型的开发者,论文的难度过滤强化学习策略具有通用参考价值。通过对每个样本累积多次采样计算经验成功率,仅保留中等难度的案例进行策略优化,能在有限的 2000 个 RL 训练样本内实现稳定提升,这一策略可迁移至其他需要链式思维推理的科学任务。