SciDiagramEdit:从论文修订中学习编辑科学图表

SciDiagramEdit: Learning to Edit Scientific Diagrams from Paper Revisions

arXiv: 2607.15272v1

论文信息

标题: SciDiagramEdit: Learning to Edit Scientific Diagrams from Paper Revisions

作者: Yasheng Sun, Zezi Zeng, Yifan Yang, et al.

发布日期: 2026-07-16

arXiv ID: 2607.15272v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:如何让 AI 根据自然语言指令自动编辑科学论文中的图表(如增加面板、修改标签、调整布局),而不是从零生成图表。
  • 核心方法:从 arXiv 论文修订历史中挖掘真实的「修改前/修改后」图片对,让一个编辑器代理在 SVG 源码上操作,并通过「技能进化」循环不断从执行轨迹和作者的修订目标中提炼编辑规则。
  • 关键结果:在测试集上,本方法的语义忠实度(checklist 成功率 0.932)超过了最强的商业图像编辑器 GPT‑Image‑2(0.882),同时保持图像为可编辑的 SVG 格式(见表 2)。
  • 主要局限:编辑指令必须显式给出,无法从论文上下文推理隐含修改意图;训练和推理依赖闭源大模型 API,成本较高(论文提及总花费约 $20,000)。
  • 适合读者:从事科学插图自动生成、多模态指令跟随、智能文档编辑或 LLM 工具使用的 AI 研究者和工程师;也适合希望自动化论文图表修改流程的科研人员。

论文背景和研究动机

修改论文中的图表是科研人员的日常刚需:根据合作者或审稿人的反馈,往往需要重新标注组件、调整面板布局、统一视觉风格。然而,现有 AI 工具要么只能根据文本描述生成全新的示意图,要么是在像素层面 “重绘” 整张图,无法直接作用于图表的可编辑矢量源文件。像素级编辑器(如 GPT‑Image‑2、Nano Banana Pro)虽然输出看起来干净,但无法让用户继续对单个图形元素进行针对性修改,并且容易丢失原图的文字和符号细节。

另一方面,arXiv 论文的多个版本之间天然包含了大量由作者亲手完成的图表修改实例。这些真实的修订记录隐含着科学沟通的 “视觉语法”,但此前从未被系统性地用于训练图表编辑模型。论文作者由此提出 SciDiagramEdit,这是第一个将真实论文修订作为监督信号的编辑基准,并配套构建了一套能够自我进化的代理系统——它直接在 SVG 源码上操作,每次编辑都可以被用户检查和二次调整。

核心方法和技术细节

整体架构由三个角色组成:编辑器(Editor)、裁判(Judge)和教练(Coach),三者在一个技能进化循环中协作。

编辑器 是一个代码代理,接收输入图片 FinF^{\mathrm{in}}(含 SVG 源码和嵌入的栅格面板)、自然语言编辑指令 II 和当前技能规范 S\mathcal{S}。它会调用文件系统与 Python 工具(如 render‑svg 渲染 SVG 为 PNG 以便视觉检查、layout‑lint 进行几何校验)对 SVG 原语进行增删改,最终输出编辑后的图片 FoutF^{\mathrm{out}} 和完整的执行轨迹 τ\tau。

裁判 则从两个维度评价编辑质量:

  1. 语义忠实度 rsemr_{\mathrm{sem}}:通过每个样本配套的检查表(共 2,628 条原子问题)逐项验证编辑是否准确执行了指令。
  2. 美学偏好 raesr_{\mathrm{aes}}:将编辑结果与作者的修订目标 FrefF^{\mathrm{ref}} 进行成对比较,判断是否达到了目标图的视觉水准。

最终采用的复合分数是乘积形式 r=raes⋅rsemr = r_{\mathrm{aes}} \cdot r_{\mathrm{sem}}(见公式 6),即只有当美学上通过门槛,才会计算语义分数的贡献。这种设计迫使代理不能只追求语义正确而忽视图像的视觉质量。

教练 是整个系统的 “大脑”。它以 Claude Opus 4.7 作为分析引擎,读取当前技能规范 S\mathcal{S}、近期一批样本的编辑轨迹 τ\bm{\tau}、裁判分数 r\bm{r},以及作者修订图 FrefF^{\mathrm{ref}} 作为演示。教练将这些信息对比后,生成一组补丁(patch)更新技能脚本 S\mathcal{S}。更新采用增量文件修改(创建/追加/替换等),并且新规则可以独立存放在 workflows/ 子目录中,避免让主脚本无限膨胀。整个循环在一批训练数据上反复运行,每次生成的候选技能在验证集上评估,只有不降低分数才会被保留,最终选出最佳技能 S⋆\mathcal{S}^{\star}(见算法 1)。

技能进化循环的核心优势在于:教练能够通过对比代理输出和作者示范,将零散教训提炼为可复用的编辑规则,例如 “结构重排后收紧 viewBox”、“数学符号使用 <tspan> 而非 Unicode 上下标” 等(见附录 B.1)。

创新点和贡献

  1. 首个真实修订驱动的编辑基准:SciDiagramEdit 提供了 364 对来自 arXiv 论文版本历史的编辑实例,覆盖 23 个学科,每条修改都配有作者真实的意图指令,改变了此前基准都依赖人工炮制或合成数据的局面。
  2. 技能进化框架:将 “看着作者的正确答案学习如何编辑” 机制化为一个可迭代的教练‑编辑器循环,使系统不再依赖一次性设计的固定流水线,而是能从失败中持续成长。实验表明,进化后的技能可以跨不同底层模型迁移,并且在 GPT‑5.5 上进化出的技能能有效提升更弱模型(如 GPT‑5.1)的表现(见表 3)。
  3. 矢量级可编辑性与美学兼顾:与流行的像素级重绘方案不同,本方法的所有修改都保留在 SVG 源码中,输出的图片仍然是科研人员可以二次编辑的矢量图。与此同时,通过层次化的美学检查和结构验证规则,编辑结果在视觉上能够接近作者修订图的质感,不像简单的 SVG 编辑那样显得粗糙。

实验结果分析

在测试集上的定量对比(表 2)展示了几个重要发现:

  • 语义忠实度:本方法以 0.932 的检查表成功率高居第一,优于 GPT‑Image‑2(0.882)和最强的 AutoFigure‑Edit 变体(0.844)。同时,在盲测的指令跟随胜率上,本方法与 GPT‑Image‑2 基本持平(47.93 vs. 46.49)。
  • 美学质量:在 UniPercept 的 IAA 和 ISTA 评分(0‑100)上,本方法(47.93 / 45.58)同样接近作者修订图本身(48.25 / 46.49),且明显超过所有 AutoFigure‑Edit 变体。这说明矢量编辑也可以达到较高的视觉完成度。
  • 技能迁移:将 GPT‑5.5 进化出的技能直接应用到 GPT‑5.3、GPT‑5.4 等模型时,美学胜率普遍提升 5‑8 个百分点(见表 3),语义胜率也有小幅增益。这表明技能规范封装了通用性的编辑知识,具有一定的模型无关性。

定性对比(图 4、9‑11)进一步印证了上述发现:GPT‑Image‑2 输出的图看起来很 “干净”,但常常曲解文字标签或丢失符号;AutoFigure‑Edit 虽然保留了文字信息,但新绘制的图形和连线显得生硬。而本方法能在正确完成指令内容的同时,让新增元素与原有风格融合。

用户研究(表 4)显示,在 30 个样本的盲测中,人类参与者更偏好本方法的输出:美学上 54% 的情况优于 GPT‑Image‑2,63% 优于 AutoFigure‑Edit;语义忠实度上的胜率分别为 59% 和 68%。

实践建议

对于希望在科研工作流中自动编辑图表的研究者或工具开发者,可以从以下几点入手:

  1. 采用矢量优先的编辑管道:直接操作 SVG 源码保留了所有图形原语,让后续的人工微调成为可能。实现时可以参考论文中 AutoFigure‑Edit 的矢量化流程:先用区域分割识别栅格面板,再用 LLM 生成包含 <image> 占位符的 SVG 模板,这样混合类型的图表也能处理。
  2. 利用论文修订对作为训练信号:如果自己机构有论文修订记录(如 Overleaf 项目历史),可以仿照 SciDiagramEdit 的注释流程,抽取修改前后的图片对并撰写原子检查问题。这种数据比人工构造的指令更真实,且包含了作者在撰写论文时才会注意到的小细节。
  3. 引入层次化检查机制:在构建自动化裁判时,不能只用 “整体看起来像不像” 来评分。应该组合结构特定侧面的检查(如删除后的空白区域、移动导致的重复元素)和整体美学评估,论文中使用的乘积式复合分数是一个可参考的模板。
  4. 通过技能文档实现模型无关的知识沉淀:将编辑知识写成 Markdown 格式的规则文件(如 safe‑string‑replace.md),既便于 LLM 读取,也利于人工审核和累积。实践证明,这类技能可以跨模型复用,减轻对单一模型专有能力的依赖。
  5. 控制成本与可复现性:论文提到训练和评估的 API 费用约 $20,000,这对独立研究者是不小的开销。建议优先使用论文已发布的进化后技能规范进行微调或推理,避免从头运行完整的进化循环,除非数据分布有显著差异。