OmniScientist:全模态全学科 AI 科学家

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

arXiv: 2608.13558v1

论文信息

标题: OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

作者: Bobo Li, Hao Fei, Tianjie Ju, et al.

发布日期: 2026-08-13

arXiv ID: 2608.13558v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:现有 AI 科学家已覆盖 “想法生成—代码执行—论文撰写” 等全流程,但数据常被提前转成文本、标签或标量特征,原始多模态证据中的空间、时间、跨通道和程序关系被提前丢弃。本文要解决的是:AI 科学家能否直接从图像、信号、音频、视频、3D 结构等原始科研证据中形成问题、执行实验并支撑结论。
  • 核心方法:提出 OmniScientist,将感知层与三个自主 Agent(ideation、experiment、writeup)放进确定性管道,并用代码强制执行的 idea / rigour / claim 三类检查约束新颖性、统计有效性、执行溯源与数字可追踪性。
  • 关键结果:在 36 个真实数据案例上,系统全部完成从原始数据到成稿论文的全流程;以 Claude Sonnet 5 为推理骨架时,整体平均分为 6.3/10(表 3)。在与只接收标量特征的盲版本对照中,完整感知版本赢得 85% 的头对头判断(见论文第 5.3 节)。
  • 主要局限:论文评分主要由两个大模型评委完成,并非完整人类同行评审;36 案例演示套件仍不能代表全部学科;盲对照只覆盖 5 个案例;弱推理骨架的完成率和分数明显下降。
  • 适合读者:关注 AI for Science、多模态 Agent、自动化科研工作流、科学发现与科研诚信检查的研究者、系统设计者和工程师。

论文背景和研究动机

近年来,从 AI Scientist-v2、Agent Laboratory 到 Co-Scientist 等系统,已经能自动完成研究想法生成、实验执行、代码编写、图表生成和论文初稿撰写。论文作者认为,这些系统正在变得 “工作流完整”(workflow-complete),但仍然是 “证据不完整”(evidence-incomplete)。原因是它们大多通过文本、代码、标签或预先计算好的摘要来接触数据,Agent 在开始研究之前,已经被迫继承了一个人类选定的表示方式。

这种接口限制会直接影响科学发现的质量:字幕可能省略局部形态,无序特征向量可能抹去时间顺序,少量标量可能掩盖跨通道不一致。论文把这些关系称为 “决定性问题”,并指出 “哪些关系能在接口中幸存下来” 才是关键。作者用三个例子说明:地震三分量波形中的极化结构、病理切片中的纹理、3D CAD 点云中的主轴几何,一旦被压缩成特征向量,对应的研究问题空间就会缩小(图 2)。

为了让原始证据能够在整个科研生命周期中起作用,论文提出把科学证据分成四个学科无关的家族:感知型(图像、波形、3D 等)、符号型(公式、知识图谱、序列等)、定量统计型(表格、测量、分布等)和程序型(轨迹、仿真、Agent 轨迹等)。OmniScientist 的目标,就是让同一个引擎可以直接处理这些异质原始数据,而不是把每种数据预先转换成文本或标量。

核心方法和技术细节

任务设定与证据分类

OmniScientist 的任务采用单一规格文件描述:给出数据集、科学主题、目标属性,以及原始数据路径。系统不需要接收任何具体方法、假设或分析代码。例如地震案例的规格文件会声明三通道波形、采样率、标签含义和元数据,而不规定要做什么实验。规格文件中的 modality 字段或文件扩展名,会自动解锁对应的感知工具;增加新学科只需要新增一个规格文件,核心管道不需要改动(见附录 E)。

感知层

感知层让 Agent 能直接观察原始记录,同时通过预算控制避免过度调用视觉模型。系统优先使用原生数值分析,例如对信号提取 FFT 峰值、对轨迹计算路径长度和转向角;只有空间或结构模式需要解释时,才渲染图像并调用视觉模型。论文统计显示,在 36 次主运行中,173 次 look_at_* 工具调用用于视觉通道,而 analyze_signal、analyze_audio、analyze_3d 等原生数值工具也被大量使用(附录 D)。这说明感知层不是把所有模态强行变成图像,而是让 Agent 在模态自身表示和可视化表示之间选择。

三阶段 Agent 与代码强约束

系统分为三个阶段。Ideation 阶段通过 ReAct 循环盘点材料、搜索 OpenAlex/Crossref 文献、生成至少 5 个候选想法、评估新颖性和可行性,并选择最强候选。这个阶段的输出必须通过 idea check:研究问题、假设、实验方案和证伪标准不能为空;至少要有 5 个自筛候选和 3 次文献检索;不能声称绝对首创,只能写成 “基于现有搜索,该方向似乎尚未被充分探索”(见附录 B 表 14)。

Experiment 阶段把想法转化为可执行代码,并运行至少 4 类分析:主测试、基线、消融、机制探针、分组或敏感性分析。run_python 在受控子进程中执行,Agent 可以调试错误,但最终必须通过 rigour check 才能退出。该检查会验证每个报告数字是否出现在真实标准输出中、数据集是否真的从磁盘加载、是否报告了所有已运行测试并进行多重比较校正;如果非显著分析被当作主要发现,check 会拒收(Algorithm 1、表 15)。这也使得 “诚实负面结果” 成为合法出口,而不是必须把弱结果拔高为阳性。

Writeup 阶段不是用一个模板套所有学科。系统提供五种领域结构规格:机器学习、生物医学、地球与空间、物理、化学。不同结构决定 Introduction、Methods、Results、Discussion 等章节顺序。每个章节只能使用实验记录中分配给它的切片,避免方法节编造细节或结果节引用不存在的数字。最终 claim check 会匹配正文中每个数字与执行记录中的接地数据,并移除过度声明。所有章节完成后,系统编译 PDF。

创新点和贡献

论文的主要贡献可以概括为三点。

首先,它把 “感知” 从局部工具提升为全周期驱动力。现有系统通常只在检查生成图表、读取界面或监控仪器时调用多模态模型,而 OmniScientist 让感知影响问题选择、实验设计、结果检查和最终声明。论文称这是区别于 previous “local and fragmented role” 的关键(见论文第 2.2 节、第 5.4 节机制分析)。

其次,它用确定性代码检查补足了大语言模型的开放推理。传统 Agent 编排依赖提示词和模型生成消息来切换阶段,失败往往由模型输出质量决定。OmniScientist 的三个检查是 Python 谓词,拒绝时会把原因返回给 Agent 继续修正;在 36 次主运行中,这些检查共拒绝 115 次 finalize 尝试,其中主要是 Agent 试图把不显著分析留在论文里(表 15)。论文强调这不是模型自评,而是代码对运行记录本身的审计。

再次,它建立了一个跨学科的演示套件,并把盲对照作为感知贡献的隔离手段。该套件覆盖 5 个学科家族、4 个证据家族和多模态数据,从 12 条符号回归方程到约 509 万条边的知识图谱(表 1)。盲版本只接收预计算标量特征,感知版本与盲版本共享同一推理骨架,使比较能归因于感知本身。

实验结果分析

在 36 个案例中,OmniScientist 全部完成了从原始数据到论文的端到端运行(表 4)。以 Sonnet 5 为推理骨架时,两个跨家族评委的七维整体评为 6.3,维度均分为:新颖性 6.3、可靠性 7.0、清晰度 7.0、重要性 6.3、可复现性 6.1、多模态接地 5.1、事实准确性 7.7(表 3)。论文指出,事实准确性在不同骨架中始终最高,作者将其归因于共享的 provenance check 强制每个数字可追溯到真实程序输出(见第 5.2 节)。

不同推理骨架之间存在明显差距。Sonnet 5 完成 36 个案例,GPT-5.6 在论文报告的子集中只完成 9/10,Kimi K2.7 完成 6/9,GlM-5.2 完成 17/18;小模型如 Qwen3.5-9B 只完成 18/32,Gemma-4-26B 完成 25/34(表 4)。在质量上,弱模型的新颖性、可靠性和事实准确性下降更明显,而清晰度下降最少(图 6、图 10)。论文认为,Strong backbone 不代表更强的多模态感知能力,因为感知模型在所有运行中都被固定为 Sonnet 5(见第 5.1 节)。

盲对照是论文最有说服力的证据之一。在 5 个具有标量盲对照的案例中,感知版本平均赢得 85% 的头对头判断,且在所有 7 个评估维度上均优于盲版本。维度的最大提升出现在多模态接地(+2.8)和重要性(+1.8),而事实准确性在两种条件下同样高,因为两者都经过同一 provenance check(见第 5.3 节、图 7/图 8)。表 7 记录了五个案例中两类系统提出的问题差异:例如地震案例中,感知系统从三分量波形极化出发,提出 “多少噪声标签事件实际携带相干瞬态”,而盲系统只能基于预设特征名设计一个其数据字段不完整支持的问题。

两个案例研究进一步展示感知如何进入科学内容。地震案例中,Agent 通过读取波形发现噪声标签中存在清晰的起振-衰减包络,于是构建了 STA/LTA、幅度、直线性、平面性和跨通道一致性组成的复合检测器。实验结果为:21.7%(163/750)的噪声标签事件包含相干瞬态,95% 置信区间为 [18.8, 24.9];移除跨通道一致性项后,检测率降至 2.0% 的仅幅度基线。该结果在多种假警报率、不同零模型、窗口选择和 417 个台站聚类 bootstrap 下稳定在 19–25%(表 9、图 11)。儿科胸片案例中,Agent 观察并量化肺野局部 Shannon 熵的空间离散度,发现斑片性指标的效应量 d = 1.25;在留出集上,仅使用平均熵 AUC 为 0.840,加入斑片性后达到 0.851,仅斑片性为 0.847,原始像素基线仅为 0.634(表 10、图 12)。

实践建议

对想构建多模态科研 Agent 或自动化发现系统的团队,这篇论文提供了几点可落地经验。

第一,不要急于把证据转换成标量。 在数据和模型之间保留原始记录,尤其是时序、空间、跨通道信息,可以决定 Agent 能提出什么问题。如果业务数据同时包含波形、图像或轨迹,建议先让感知层读取原始结构,而不是只提供统计摘要。

第二,把科研诚信检查实现为代码谓词。 OmniScientist 的 idea / rigour / claim check 不是提示词中的道德提醒,而是可执行的 Python 谓词。实际效果是在 36 次主运行中拒绝了 115 次 finalize 尝试,其中 26 次为 “非显著分析被当作发现”。这类检查可以被改造成科研平台或实验管理工具中的自动化关卡。

第三,感知预算要有约束。 论文没有让 Agent 无限调用视觉模型,而是用图像检查预算和原生数值通道控制成本。这在落地时尤其重要:视觉模型调用成本高于结构化特征提取,预算限制可以避免大量无重点的观察。

第四,把学科差异编码为规格和模板。 扩展新学科不需要改核心引擎,只需要一个任务规格文件和可选的结构模板。对多领域研究机构来说,这降低了复刻成本。论文报告,一次完整运行成本在 $0.03 至 $4.34 之间,主要花费在实验阶段(附录表 11)。

第五,评估时要隔离模型角色。 OmniScientist 将推理骨架、感知模型和评委模型分开,使质量差异可归因。对于内部基准评测,建议固定感知模型,只切换推理骨架;并验证评委的评分者间一致性、自我偏好和长度偏差。论文使用 Krippendorff α = 0.66,论文长度与分数相关性 ρ = 0.16(附录表 13),这类指标可以帮助确认评估可信度。

总之,OmniScientist 的最大启示不是 “模型更强”,而是 “接口更靠近证据”。当 Agent 直接从原始证据读到结构时,它提出的问题、执行的实验和最终声明的范围,都会与只接触标量特征时不同。该结论来自本文 5 个盲对照案例中的 85% 胜率,以及表 7 中两类系统研究问题空间的系统性差异;是否能在更大规模、更严苛的人类评审下成立,仍需要进一步检验。论文也指出,当前评估基于两个大模型评委,尚未替代完整的人类同行评审。