Agents-K1:迈向智能体原生知识编排

Agents-K1: Towards Agent-native Knowledge Orchestration

arXiv: 2606.13669v1

论文信息

标题: Agents-K1: Towards Agent-native Knowledge Orchestration

作者: Zongsheng Cao, Bihao Zhan, Jinxin Shi, et al.

发布日期: 2026-06-11

arXiv ID: 2606.13669v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:现有大语言模型研究代理(Research Agent)虽已有智能体编排,但严重缺乏面向科学推理的结构化知识编排。论文标题和摘要表面化、引用关系扁平化,无法捕捉论文中的实体、主张、证据、机制和方法谱系,难以支持可靠推理。

  • 核心方法:提出 Agents-K1,一套端到端知识编排管线,将原始文档转化为智能体原生(agent-native)多模态科学知识图谱。主要包含三个阶段:(1) 基于 MinerU 的全论文多模态解析与五模块模式定义;(2) 通过 GRPO 与基于规则的奖励训练一个 4B 参数信息抽取骨干模型;(3) 提供融合网络搜索、多模态图谱检索和跨文档遍历的 三源智能体 CLI 工具。

  • 关键结果:在 FrontierScience-Research 基准上,Agents-K1 将 Gemini-3 的整体准确率从 7.9% 提升至 24.6%,将 GPT-5.2 从 25.2% 提升至 39.4%(见表 6)。在多跳问答数据集 HotpotQA、2WikiMultiHopQA 和 MuSiQue 上,该框架达到最优水平(见表 7)。

  • 主要局限:信息抽取骨干模型在关系抽取任务上仍明显落后于 32B 参数的开源模型(见表 8),尤其在 CoNLL04 数据集上差距达 15.9 F1;跨领域构建知识图谱依赖冷启动的技能库积累与少量人工标注;构建 240 余万篇论文的知识图谱需大规模计算资源。

  • 适合读者:从事 AI 辅助科学研究、智能体系统、知识图谱、检索增强生成、信息抽取、多模态文档理解的研究者与工程师,以及对 “科学知识基础设施如何构建” 感兴趣的项目负责人。


论文背景和研究动机

当前基于 LLM 的研究代理已从原型走向实际部署。像 AI-Scientist、InternAgent 和 AI Co-Scientist 等系统已能在单次流程中自动完成实验规划、文献检索、代码撰写与论文起草。这些系统的能力依赖两个核心支柱:智能体编排(agent orchestration,即智能体如何规划与行动)和知识编排(knowledge orchestration,即智能体用哪些知识、这些知识如何组织)。

论文指出,现有工作主要聚焦前者,而知识基础设施存在三大核心缺陷:

  1. 现代图谱增强检索管线(如 LightRAG、HippoRAG、GraphRAG 等)大多构建通用的纯文本三元组,实体、主张、机制和方法链接仍埋没在全文中;图、表和公式被降级为标题。
  2. 学术引用图谱仅使用扁平的 cites 边,无法区分 “扩展方法”“挑战主张” 还是 “仅引为基线”。
  3. LLM 研究代理常在运行时读取原始 PDF 或简短摘要,每次查询都重新抽取,难以将回答追溯到确切证据。

因此,论文提出一种新的设计目标:智能体原生知识编排(agent-native knowledge orchestration),要求:(1) 覆盖全论文,将文本、图、表、公式视为互联证据;(2) 将科学内容转化为分类知识(实体、主张、机制、方法链接等);(3) 支持可审计的检索,使代理能将每个结论追溯到图节点标识符与确切证据。


核心方法和技术细节

Agent-K1 架构分为三层:

KG 层:全论文多模态解析与知识图谱构建

该层将 PDF 论文分解为统一的内容单元,每个单元携带模态类型(文本、图、表、公式)、原始内容和结构元数据(章节层级、页位置)。在此基础上引入语义锚(semantic anchor),一种模态无关的中间表示,作为跨模态实体的稳定桥梁,避免脆弱的跨模态实体对齐(即不强制直接匹配不同模态间的同名实体)。

论文定义了五模块知识图谱模式:

  • 模块 A(元/事实实体):规范化的元数据,支持去重与溯源追踪。
  • 模块 B(显式提及实体):任务、方法、数据集、指标等具体对象,通过受控词表和嵌入实体链接纳入本体。
  • 模块 C(隐式/抽象实体):通过修辞角色标注与篇章分析,抽取问题定义、贡献、假设、发现、机制、局限等高层知识。
  • 模块 D(引用关系):编码引用的强弱、论证效果(支持/对比/扩展),并提供精细证据。
  • 模块 E(实体间知识关系):将模块 B、C 中的粗粒度知识提炼为细粒度三元组,分为受控关系(与方法、任务空间明确对齐)和开放关系(因果、组成、比较、领域结构四个语义区)。

LLM 层:强化学习抽取骨干

论文没有依赖通用指令模型,而是训练一个紧凑的 4B 参数模型(以 Qwen3-4B-Instruct 为基座),使用 GRPO(Group Relative Policy Optimization)与基于规则的奖励进行优化。奖励由三部分组成:格式合规(0.2)、JSON 有效性(0.1)和任务条件 F1(0.7,分 NER、关系抽取、结构化抽取三种计算方式)(见第 5.2 节)。训练在单台 8 GPU 节点上约 1 小时完成。

CLI 层:GraphAnything 与三源融合检索

该层将图谱转化为可执行的研究工具。三源融合机制包含:

  1. 网络搜索(涵盖 arXiv、Semantic Scholar 等),按标题和摘要的密集嵌入相似度排序。
  2. 多模态图谱检索,通过混合密集嵌入相似度与词汇匹配定位语义锚,并返回原图裁剪、表格序列化等载荷。
  3. 知识网络遍历,支持引用谱系重建、基线对比检索、空白检测等确定性图操作。

融合阶段使用加权 TopK 选择,并由轻量意图分类器动态调整权重(例如,对 “近因” 问题增加网络搜索权重,对 “比较” 问题增加图遍历权重)。


创新点和贡献

论文提出了多项系统级创新:

  1. 首个智能体原生的统一知识编排管线。Agents-K1 将知识图谱、LLM 抽取骨干和 CLI 工具整合为单一框架,使知识基础设施从 “供人阅读” 转变为 “供代理推理”。

  2. 百万级全论文多模态知识图谱。论文利用该管线处理 6 个学科(计算机科学、化学、生物学、地球科学、物理学、材料学)共 246 万篇论文,构建 Scholar-KG,并发布 100 万篇的子集。

  3. 低成本高竞争力的抽取骨干。通过仅 1 小时 GRPO 训练的 4B 模型,在 NER 任务上超越 8B 开源模型、匹配 32B 基准,为大规模抽取提供了可负担的方案(见表 9)。

  4. 理论支撑的设计选择。论文以三个命题形式化论证了 “稳定标识符优势” 与 “多视图联合检索严格优于单一二元投影” 的原则(见第 4.5 节及附录 B),从而为架构设计提供理性基础。

  5. 面向任意文档的扩展(General-KG)。通过六种视图模式(二元图、n 元超边、时序图等)和 YAML 声明式冷启动,使得同一管线无需修改权重就能适配医疗、法律、金融等垂直领域。


实验结果分析

跨领域知识抽取性能(见表 4): 在 6 个学科各 100 篇论文上,Agents-K1 的整体平均 F1 在 79.07%(物理学)至 87.11%(计算机科学)之间。模块 C(隐式实体)表现最稳健(F1 几乎均 >90%),说明框架对论文 “科学本质” 的捕捉较好。模块 E(知识关系)方差最大,从物理学的 70.54% 到 CS 的 89.33%,反映出不同学科对方法关系的公开报告习惯差异。

科学推理能力验证(见第 7.4 节及表 5、表 6):

  • 在地球科学研究问答中,加入 Agents-K1 的 Gemini-3 在 “研究问题” 上的推理论证准确率从 52.3% 升至 69.5%。
  • FrontierScience-Research 基准上更强:Gemini-3 整体准确率从 7.9% 跃升至 24.6%,GPT-5.2 从 25.2% 升至 39.4%。这种增益在物理学领域尤为明显(GPT-5.2 从 9.0% 升至 46.7%),说明外部结构化证据对参数知识缺口大的领域帮助更大。

通用多跳问答(见表 7): 在 HotpotQA、2WikiMultiHopQA 和 MuSiQue 上对比 12 个基线,Agents-K1 在 GPT 判定准确率上均取得最高分(如 2WikiMultiHopQA 达 64.80%)。关键观察是:多数图基线在 MuSiQue 上性能大幅下降(LightRAG 仅 28.60%),而 Agents-K1 仍维持在 36.20%,显示出其层级图谱结构对长程、松散连接证据的桥接能力更强。

信息抽取骨干对比(见表 8、表 9): 4B 训练后的模型在全部 10 个基准上超越其 4B 基座,在 8/10 上超越 8B 开源基线,并在 NER 任务上以 0.7280 F1 超越 32B 基线(0.7059 F1)。不足在于关系抽取仍落后 32B 基线约 9 F1 分,是后续优化重点。


实践建议

对于有意在学术文献或专业文档上部署知识增强系统的团队,可参考以下实践路线:

  1. 从论文全文解析入手。除非目标仅为论文检索,否则应避免仅依赖标题和摘要。采用 MinerU 或同类 PDF 解析工具获取文本、图、表、公式的完整证据及其空间位置关系,为下游推理提供细粒度溯源依据。

  2. 引入稳定标识符系统。在构建知识图谱时,为每篇论文、每个实体分配全局唯一 ID,避免以名称字符串为连接键。论文的理论分析表明,这可将多源连接从 Ω(∣Vu∣⋅∣Vv∣)\Omega(|\mathcal{V}_u|\cdot|\mathcal{V}_v|) 降低到 O(∣K∣)\mathcal{O}(|K|)(见命题 1),且可防止同名实体错误合并。

  3. 训练小型专业 IE 模型而非依赖通用大模型。若需规模化运行(数十万篇以上),在某个 4B–8B 开源基座上使用 GRPO 与规则化奖励微调数小时,可显著降低推理成本,同时在 NER 任务上逼近 32B 模型的水平。数据集可采用 IEPile 等公开英语 IE 数据混合,叠加目标领域的少量标注。

  4. 在 CLI 层融合多源信息。纯网络搜索时效性好但结构化不足,纯图遍历精确但覆盖面受限于构建快照期。论文给出的加权融合方程与意图路由策略(见第 6.1 节,默认权重为网络 0.30、图谱 0.40、知识网络 0.30,可在特定意图下动态调整)可作为直接参照。建议在首次上线时将其作为可调超参数,通过 A/B 测试确定最优配比。

  5. 善用确定性图算子代替 LLM 重推理。像 “根据某个数据集查询所有被评估的方法及度量值” 这类重复性需求,通过预定义的图查询(如 O3 比较基线检索)一次完成,避免对每篇候选论文重复调用 LLM。论文的 CLI 工具表(表 2)列出了可直接使用的命令集。

  6. 为新领域准备冷启动技能库。若要将知识图谱扩展到非学术语料,遵循 General-KG 的 YAML 模板定义实体与关系类型,并从 10–20 份人工标注文档中提取稳定抽取模式,即可在不更新模型权重的前提下完成最初的垂直迁移(见第 4.3 节冷启动循环)。

总体而言,Agents-K1 提供的不是一个静态数据集,而是一套完整的知识编排机制与工具组合,适合希望将科学文献从 “需要再处理的原材料” 转化为 “可直接被智能体消费的结构化知识” 的组织。