Agents-K1:迈向智能体原生知识编排
论文信息
标题: Agents-K1: Towards Agent-native Knowledge Orchestration
作者: Zongsheng Cao, Bihao Zhan, Jinxin Shi, et al.
发布日期: 2026-06-11
arXiv ID: 2606.13669v1
PDF 链接: 下载 PDF
论文背景与研究动机
大语言模型驱动的科研智能体正从原型走向实际部署。当前的 AI Scientist、InternAgent 等系统已能在单一循环中完成实验规划、文献检索、代码编写与论文草稿生成。然而,这些系统的进展主要集中在 “智能体编排” 上,即决定智能体如何规划和行动,而 “知识编排”——决定智能体使用何种知识以及如何组织这些知识——仍远未得到充分发展。
这一差距至关重要,因为科研智能体需要的远不止相关论文列表。它们需要结构化知识,保留每篇论文的主张、支持主张的证据、主张与先前工作的关系以及证据的可核查位置。现有科研知识基础设施存在三个根本缺陷:其一,图谱增强检索管线通常只构建文本三元组,仅捕捉摘要层面的信息;其二,学术引用图通常只使用平坦的 “引用” 边,无法区分是扩展方法、挑战主张还是仅引用基线;其三,智能体在运行时反复处理原始 PDF 或简短摘要,难以将答案追溯至确切证据。这些局限性表明,知识基础设施本身尚未为智能体推理而设计,由此催生了对 “智能体原生知识编排” 的需求。
核心方法:三层架构的统一框架
Agents-K1 提出了一套端到端知识编排管线,将原始文档转化为智能体可用的多模态知识图谱。其架构由三个协同层构成。
KG 层:面向智能体的知识图谱构建
该层的核心创新在于引入 “语义锚点” 作为中间抽象层,实现多模态内容的统一建模。传统方法要么将所有模态扁平化为文本(丢失视觉结构),要么保持分离表示(使跨模态检索复杂化)。Agents-K1 观察到科学文献具有自然层次结构:细粒度实体(方法、数据集、指标)语义上根植于粗粒度内容单元(图表、表格),共同构成文档叙事结构。
文档经过模态感知解析后,每个内容单元 包含模态类型 、原始内容 和结构元数据 。语义锚点 通过多模态大语言模型生成,捕获模态无关的语义摘要。由此构建的异质图包含三个层次:底层的细粒度实体、中层的语义锚点(作为跨模态桥梁)和顶层的文档结构。跨层边通过 “grounded_in” 和 “belongs_to” 关系连接,这种设计在保持细粒度溯源的同时实现了跨模态交互。
知识图谱模式采用五模块设计:A 模块捕获可验证的元数据与事实实体(作者规范化、机构对齐、资源链接);B 模块提取显式提及的科学对象(任务、方法、数据集、指标等)并进行规范化;C 模块合成隐含的高价值抽象(动机、贡献、假设、发现、机制、局限性等);D 模块编码引用意图(区分支持/对比/扩展)与引用强度;E 模块将粗粒度知识细化为可直接查询的三元组,涵盖控制关系和开放关系,支持多跳因果追踪和方法谱系比较。
LLM 层:强化学习驱动的信息抽取骨干
为高效填充知识图谱,Agents-K1 训练了一个紧凑的 4B 参数信息抽取模型。该方法基于 Qwen3-4B-Instruct,采用 GRPO 进行优化,并设计了基于规则的奖励函数:
奖励函数包含三个组件:格式合规奖励(0.2 分)、JSON 有效性(最高 0.1 分)和任务条件 F1 分数(0.7 分)。F1 计算根据任务类型分发:NER 采用实体集合 F1,关系抽取采用三元组集合 F1,结构化 NER 采用宏平均 F1。训练过程使用组相对策略优化,以组均值作为基线计算优势函数。
CLI 层:三源融合的智能体界面
GraphAnything CLI 是面向智能体的研究工具包,其核心设计原理是将确定性图原语与开放式语言推理分离。它融合三种知识源:Web 搜索(通过学术搜索服务获取最新文献)、多模态图检索(基于语义锚点的混合匹配)和跨文档网络遍历(利用 Type E 中的类型化关系)。融合采用加权 TopK 方案,权重根据意图分类动态调整。
CLI 暴露六类核心操作:种子解析(将提及字符串映射到规范节点)、引用谱系重建(沿引用边的前向/后向遍历和最短路径查询)、比较基线检索(在数据集-方法-指标三元组上的图查询)、多模态锚点检索、空白检测(识别孤立方法、单一数据集等)以及想法扎根与新颖性判断(结合图检索和 LLM 评分)。智能体在蜂群运行时由协调器、专业工作者和聚合器组成,输出可审计的运行清单而非单一的对话回答。
创新点与贡献
Agents-K1 的贡献体现在多个层面。概念上,它首次明确定义了 “智能体原生知识编排” 的三项要求:覆盖全文的多模态证据、类型化的科学知识表示和可审计的检索。技术上,语义锚点设计优雅地解决了跨模态对齐问题,避免了直接的实体匹配脆弱性。五模块模式从元数据到细粒度关系的渐进式组织,实现了从结构化到非结构化知识的完整覆盖。
工程上,4B 参数提取骨干通过强化学习在小规模参数上达到甚至超越 8B 和 32B 基线的表现,证明了任务特定优化可以弥补参数规模的差距。三源 CLI 将静态知识图谱转化为可执行的研究工具,实现了知识基础设施向智能体工作流的无缝嵌入。
该框架还具备显著的可扩展性:通过模式自适应机制和 YAML 声明的 DIY 模式,同一条管线可冷启动到任意文档语料,无需模型权重更新或领域特定工程。
实验结果分析
实验从四个维度验证了 Agents-K1 的有效性。
跨领域信息抽取质量:在六个科学学科的 100 篇论文上,五模块的文档级宏平均 F1 分数达到 79.07% 至 87.11%。模块 C(隐含/抽象实体)表现最为稳健,证明了框架超越浅层模式匹配、捕获 “科学本质” 的能力。模块 E(知识关系)显示最高方差,在 CS 领域达 89.33%,在物理领域为 70.54%,反映了细粒度结构对齐对不同学科报告习惯的敏感性。
科学推理能力提升:在地球科学研究问答中,Agents-K1 使 Gemini-3 的理论准确率从 52.3% 提升至 69.5%。在 FrontierScience-Research 基准上,GPT-5.2 从 25.2% 提升至 39.4%,物理学领域从 9.0% 跃升至 46.7%,大幅增长的背后是检索到的学术证据为模型输出提供了事实基础。
多跳推理基准:在 HotpotQA、2WikiMultiHopQA 和 MuSiQue 上,Agents-K1 在 GPT-Judge 准确率上均达到最优。特别是在 MuSiQue 这一高难度数据集上,许多先进基线性能骤降,而 Agents-K1 仍保持稳健,体现了层次化知识图谱在连接分散证据方面的优势。
提取骨干性能:4B 骨干在所有十个基准上超过自身基线,在八个基准上超过 8B 基线,在 NER 任务上超过 32B 基线达 2.2 个 F1 点,以约八分之一参数量达到或超越大规模异构模型的性能。
实践应用建议
对于希望在量化交易、量子计算和人工智能领域应用类似框架的研究者和从业者,以下建议可供参考。
在量化交易领域,可将 Agents-K1 的模式设计迁移至金融文本处理。研究报道中的方法描述、回测数据和风险因子可映射为 B 模块的显式实体;策略逻辑和市场假设可归为 C 模块的抽象实体;策略间的引用和改进关系可通过 D 和 E 模块编码为谱系图。这为构建可审计的策略知识库和防止过拟合的交叉验证提供了技术路径。
在量子计算领域,该框架特别适合处理跨实验和理论的异构信息。量子电路图、保真度数据和理论推导可以作为多模态锚点的证据单元;不同量子纠错方法的改进链路可以通过谱系重建显式化;实验条件和错误率可以编码为时间受限的边,支持跨论文的硬件进展追踪。
在人工智能领域,Agent-K1 的方法论可直接应用于研究自动化。论文解析提取的方法组件、训练策略和消融实验可以构建为图结构,支撑自动文献综述和空白检测,以识别未被充分探索的研究方向。
总结与展望
Agents-K1 通过统一知识图谱构建、强化学习提取和智能体界面设计,为科研智能体提供了一种可复用的知识基础设施。其核心洞见——将证据组织在连接图中比反复搜索分离的文本片段更可靠——在理论和实验上均得到支持。
未来的研究可以沿着若干方向拓展。在模型层面,关系抽取的性能仍有提升空间,可能需要更多的关系监督或目标导向的模式条件奖励塑造。在知识图谱层面,图演化机制可以实现持续知识积累和去重编织。在智能体层面,增强的验证机制可进一步缩小生成知识与原始证据之间的差距。此外,将该框架适配至非学术语料(如医疗报告、法律文件、金融披露)的 General-KG 方向,有望显著拓展其应用范围。