基于深度原生结构推理的准确、跨学科、透明的结构-性质理解

arXiv: 2607.07708v1

论文信息

标题: Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning

作者: Chen Tang, Yizhou Wang, Jianyu Wu, et al.

发布日期: 2026-07-08

arXiv ID: 2607.07708v1

PDF 链接: 下载 PDF

研究背景与科学挑战

结构决定性质是贯穿生物学、化学与材料科学的核心法则。蛋白质的三维折叠、小分子的官能团与立体化学、晶体的对称性与周期性键合网络,共同支配着功能、反应活性与宏观物性。准确揭示这些结构—性质关系,不仅是基础科学问题,更是药物发现、分子设计与材料创新的关键驱动力。然而,从结构证据中推导出机制性解释,远比表面模式匹配复杂:一条功能信息可能散布于局部残基、非局部接触、构象几何与长程有序之中。

当前的科学人工智能系统往往将表征与推理割裂开来。大型语言模型虽可借助文本表达科学知识,却将蛋白质、分子和晶体压缩为字符串,使得解释依赖于语言联想而非可直接检验的结构证据。特定领域的模型(如图神经网络)虽可对结构直接建模,却通常作为任务专用的 “黑箱” 预测器输出标量或标签,不暴露中间的证据链条。因此,亟需一种新范式,既能以原生方式表征多维科学结构,又能生成可追溯至结构的推理轨迹。这正是本文提出原生结构推理的初衷。

核心方法:SciReasoner 的统一结构推理框架

为了跨越表征与推理之间的鸿沟,研究团队构建了多模态科学基础模型 SciReasoner。其设计理念是让结构令牌成为推理过程中可定位、可组合、可检验的证据单元,而非附属于语言的辅助描述。

结构感知词汇表:从坐标到离散证据

SciReasoner 针对不同科学对象采用专属离散编码器:蛋白质结构通过 Foldseek 转换为 3Di 令牌(保留局部构象特征),小分子由 ConfSeq 编码为包含扭转角、立体化学与键合拓扑的几何感知序列,无机晶体则通过 SLICES 表达为包含空间群、周期性连接和配位环境的字符串。这些编码不属于自然语言的子词碎片,而是具有明确物理或化学意义的原子化单元,从而避免了传统分词器对分子图或晶体拓扑的随意切割。离散化后的结构令牌拥有独立的嵌入表,通过嵌入查找直接与语言指令在同一个自回归生成器中交互,实现了结构信息与自然语言的 “平权” 集成。

多阶段预训练与自举式后训练

模型以 Qwen3-14B 为骨干,采用三阶段继续预训练:热身阶段只训练新引入的结构词汇嵌入层和头部分,确保稳定的语义初始对齐;全参数训练阶段在多样化结构—文本数据上充分融合模式表征;退火阶段通过增加问答式数据比例强化结构推理的指令跟随能力。

更具创意的是其后训练流程——自举式原生结构推理。该方法首先为蛋白质、分子和材料三个域分别微调域内结构专家模型,利用强化学习教会模型如何将结构令牌用作特定领域的推理证据(域内结构证据锚定)。随后,这些专家生成的高质量推理轨迹被汇集,替换掉外部教师信号,用于统一模型的冷启动与跨域推理整合。这一闭环解决了科学领域极度缺乏真实推理轨迹的问题,同时避免了多任务联合训练的干扰,使最终模型兼具域专精与跨域通才的能力。

核心创新点

SciReasoner 的创新可凝练为三点:

  1. 结构即推理基底:首次在单一自回归模型中实现对蛋白质、小分子和晶体的原生结构表征与可检查推理,结构令牌直接参与推理链条,而非脱耦的外部描述。
  2. 可追溯的证据链接:生成的推理轨迹将中间推理断言(如残基片段、分子子结构、晶格边)与输入结构令牌进行显式挂钩,模型能指明 “为何断裂这条键” 或 “哪段螺旋支撑了功能注释”,使科学推断可检验、可审计。
  3. 跨学科统一范式:以结构感知词汇表为枢纽,打破了不同学科的数据孤岛,在 86 个基准上实现 67 个任务的最新水平,且专家双盲评估中 98% 的判断倾向或持平于前沿大语言模型。

实验结果深度解读

SciReasoner 在生物、化学和材料三大科学模态中展示了结构驱动推理的威力。

蛋白质功能注释:在 Gene Ontology 预测中,模型在低同源(序列一致性≤30%)区域实现最大增益,细胞组分 Fmax 从 0.42 提升至 0.55。注意力分析揭示,对于 DNA 结合蛋白,模型聚焦于 DNA 接触残基,而非与功能无关的表面区域,表明其定位了物理介导功能的残基。强化学习后的推理轨迹在生物学合理性、假设质量等方面大幅超越预训练冷启动版本及通用大模型,且在序列相似性极低时仍保持稳定的推理质量,证实其并非记忆同源注释。

逆合成规划:在 USPTO-50K 基准上,SciReasoner 的 Top-1 准确率达到 0.72,比此前最佳的无模板方法 RSGPT 提升 9 个百分点,且推理过程遵循 “产物结构分析→策略性断键→反应物验证→可行性判断” 的化学家思维链条。典型案例显示,模型准确识别了酯基 C-O 键断裂、叠氮-炔环加成等关键逆合成切断,输出的中间片段均为可验证的 SMILES 子结构,实现了真正的 “按原子检查”。

材料性质预测:在 10 项材料子任务中,SciReasoner 在回归和分类指标上全面超越 CGCNN 和 LLM-Prop,形成能预测的 R² 达到 0.895。其潜在空间不仅能分离 C、Si、SiC 等不同化学组成,还可在同一组成内区分多晶型并沿带隙梯度连续排列,证明模型学会了物理上有意义的性质表征。推理轨迹中高频引用了空间群子串和跨晶格边的连接模式,将电子行为与对称性、配位环境直接关联。

3D 分子相似性:提取 SciReasoner 结构令牌的后层隐状态作为分子嵌入,并在 DUD-E 虚拟筛选任务上评估,其 5.0% 富集因子从之前最优的 7.12 提高至 7.70,且聚类可视化显示,活性分子按结合口袋几何聚集,而非按二维骨架相似性,提示模型获得了三维药效团层面的表征能力。

消融实验进一步证实,移除结构输入后,模型在蛋白质功能、材料孔道尺寸等任务上显著衰退,且推理轨迹会退化为基于序列模体或组成比重的表面猜测。结构令牌的引入不仅扶正了最终答案,更重定向了推理路径。

实践应用与未来方向

SciReasoner 树立了一个可复用的技术框架,对于生物医药、化学合成和材料科学领域具有直接的实践价值。

  • 生物信息学与药物靶标发现:可利用该模型对孤儿蛋白进行功能预言,识别活性位点残基,辅助虚拟筛选中的三维相似性搜索,甚至以结构推理解释脱靶风险。
  • 化学合成智能规划:逆合成路径的可检查推理让合成化学家能快速审核机器提出的路线,降低试错成本,并可扩展至正向反应预测与合成工艺优化。
  • 材料基因组加速:将晶体结构直接作为证据来源,用于高通量稳定性评价、带隙筛选和催化活性位点识别,有望替代部分传统 DFT 计算中的经验规则。

未来发展方向包括:扩展至更多科学模态(如光谱、电子显微图像);引入更丰富的物理约束(如力场能量、分子动力学模拟)以增强推理的物理一致性;设计交互式推理界面,让科学家实时干预并修正推理过程;以及在规模化科学数据上持续自监督进化,形成适应新科学发现的持续学习系统。

总结与展望

SciReasoner 通过原生结构推理范式,首次真正打通了 “结构表征—证据提取—可解释推断” 这一科学发现的关键闭环。它证明,将结构视为第一性推理语言,不仅能提升预测准确度,更重要的是输出可追溯、可检验的推理过程,从而架起从精准预测到机制理解之间的桥梁。这项工作向着 “不仅预测性质是什么,更开始解释结构为何产生特定功能” 的科学 AI 目标迈出了坚实一步。随着更多结构信息的融入和学科边界的消融,我们有理由期待一个统一的科学基础模型生态,使 AI 成为科学家手中真正可靠的推理伙伴。