Designer-RSI:从用户流量中演化程序性记忆以实现智能体平面设计

Designer-RSI: Evolving Procedural Memory from User Traffic for Agentic Graphic Design

arXiv: 2609.22086v1

论文信息

标题: Designer-RSI: Evolving Procedural Memory from User Traffic for Agentic Graphic Design

作者: Hongyang Du, Lan Yan, Christian Flores, et al.

发布日期: 2026-09-18

arXiv ID: 2609.22086v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:专业图形设计是长时程智能体任务,产物可编辑且来自大量相互依赖操作,但结果没有可靠的程序化判题器;论文要解决如何在冻结基础模型、无权重更新、无人类标注的条件下,从用户流量中持续进化可用技能。
  • 核心方法:把外部自然语言 “技能库” 作为学习对象,围绕冻结模型运行;“拓宽” 从重复未覆盖子任务中铸造新技能,“深化” 对比成功与失败轨迹修订已有技能,所有变更必须通过匹配重放门控才能进入部署库。
  • 关键结果:在 Claude-Sonnet-4 上,GenEval2 执行成功率从 72.7% 提升到 99.3%(表 1);在 200 个留出简报上,拓宽与深化组合达到 58.5% 胜率,而单独使用只有 49.4%/48.6%(表 3)。
  • 主要局限:自然语言技能难以可靠覆盖模型已有默认策略;精细几何操作受感知和自动验证能力限制;长流程技能保真度逐渐下降;重放门控只在重放集上观察到无回归,不保证全用户分布单调改进(论文第 6 节)。
  • 适合读者:研究 LLM 智能体、持续学习、程序性记忆、自动化图形设计,或需要在噪声反馈下安全更新生产系统的工程师与研究者。

论文背景和研究动机

专业图形设计不同于从提示词直接生成单张图像:用户需要的是分层、可编辑的结构化产物,后续可以检查、调整字体、矢量、蒙版和效果。这类任务被建模为顺序决策问题,智能体需要检索素材、操作图层、构建蒙版、调整排版,并在保持可编辑性的前提下修正之前决策。论文指出,学习这类任务有三个困难:单次设计可能涉及数十个相互依赖操作,终端反馈很难归因到具体决策;简报同时包含具体要求和主观标准,自动评估只能部分捕捉;与可执行测试的代码不同,设计没有成功判题器(见论文第 1 节)。

因此,监督学习需要昂贵示范,结果优化必须应对长期信用分配和不完美代理奖励,尤其当基础模型外部托管或不宜更新时。论文选择了一条不同路径:把冻结模型周围的 “程序性记忆” 作为学习目标。外部上下文可以积累经验而无需参数更新,每个技能是自然语言可复用流程,介于单次工具调用和整条轨迹之间——足够具体以指导执行,又足够通用以迁移。这一思路在论文中被称为 “程序性记忆” 的进化。

核心方法和技术细节

系统围绕四个固定角色组织:Prompter 提出设计简报,Solver 是 “技能库 + 工具” 的智能体,Grader 对渲染图像评分并给出未满足要求的原因,Reflector 把失败转化为对 SKILL.md 文件的编辑。整个循环中只有技能文件变化。

技能库中的每个技能是一个 Markdown 文件,包含描述、适用 app_mode、关键工具序列、步骤、提示和错误处理。检索分两阶段:先用冻结 LLM 把请求蒸馏为操作关键词,忽略主题、形容词和颜色;再用 token 重叠对技能排序。技能不会一次全部注入,智能体按需调用 load_skill(name) 读取正文,从而控制上下文成本(附录 C)。

进化沿两个轴进行。拓宽(Widening) 针对反复出现的未覆盖子任务:从轨迹中提取并规范化实际执行的子任务,如果检索无结果或覆盖不匹配,则记为 “未覆盖”;同一标签累计达到 kmin⁡=3k_{\min}=3 次后,由冻结 LLM 蒸馏成候选技能,再送入门控。深化(Deepening) 修订已有技能:轨迹得分低于阈值 τ=0.6\tau=0.6 时,失败会计入该轨迹检索到的每个技能;失败计数达到 m=2m=2 的技能被选中修订,Reflector 接收简报、逐项失败原因、当前技能以及同一技能的成功调用轨迹,定位具体段落并给出目标编辑或整体重写。

关键在于重放门控。论文不采用 “绝对分数上升即接受”,因为同一图像在 VLM 评分器下得分会漂移,解算器本身也有随机性。门控的做法是:为每个候选技能采样若干 prompt,每个 prompt 生成多个上下文,并冻结上游上下文;在同一批次内重新运行候选与对照(修订时对照 incumbent,铸造时对照无技能),再成对评判并随机交换顺序。变更只有在 “没有 prompt 输且至少一个 prompt 赢” 时才被接受(公式 1)。这样候选必须修复失败且不能对已成功案例产生回归。

创新点和贡献

论文提出了一个面向专业图形设计智能体的技能进化框架,把持续学习对象放到外部自然语言程序库上,明确区分 “拓宽” 与 “深化” 两个互补机制(论文贡献第 1 条)。与以往工作通常使用可验证的程序成功信号不同,本文针对设计任务不可验证反馈这一特点,设计了匹配重放门控,控制哪些修改可以进入部署库(论文贡献第 2 条)。此外,论文通过五轮进化、多个冻结骨干和多个基准展示了两个机制组合的超加性效果(论文贡献第 3 条,表 3)。

论文还提供了工程上有意义的观察:冷启动技能库本身在 200 个留出简报上并未比无技能基线更好,完整性 68.62 对比 69.08,胜率 46.4%;单独深化和单独拓宽也只达到 69.02 与 69.79 完整性、48.6% 与 49.4% 胜率,而组合后达到 74.04 完整性与 58.5% 胜率,且 p=0.025p=0.025(表 3)。作者推测,铸造新技能需要更精确的检索描述才能浮出水面,而修订失败技能时会把不可修复的失败重新导回覆盖池,形成耦合。

实验结果分析

进化过程五轮共使用 1,406 个非重叠简报,产生 1,869 条自动评分轨迹,无人类标签。技能库从 76 个文档冷启动技能增长到 139 个;门控共拒绝 100/231 个重写提案(通过 131 个)和 67/136 个铸造候选(通过 69 个),净增 63 个,因为深化偶尔会合并或废弃技能(论文第 4.1 节)。进化并非单调:第一轮以修复为主,第二轮到第三轮铸造达到高峰;第四轮因积累大量未修订的 v1 技能,低完整性区间出现回落;第五轮以重写为主,恢复低端并强化高端(图 5)。

在通用文生图基准上,Evolve 技能库让三个骨干的平均生成质量分别提升 +3.83、+7.70、+9.67;其中 Claude-Sonnet-4 的 GenEval2 执行成功率从 72.7% 提升至 99.3%,DPG-Bench 从 82.7% 提升至 100%(表 1)。需要注意,Claude-Opus-4.6 在 GenEval2 上生成质量下降 -3.32,说明并非每个基准都均匀提升;Qwen3.6-27B 的高质量分数也应与其较低成功率和部署稳定性一起理解(论文第 4.2 节)。专项设计任务上,Claude-Opus-4.6 总体胜率 67.6%,Claude-Sonnet-4 为 61.8%,Qwen3.6-27B 为 62.8%(表 2)。帧率开销方面,Evolve 引入 3.4%–6.2% 的平均延迟开销,且在某些场景能减少生成时间,例如 Sonnet 在 DPG-Bench 上从 113 秒降至 82 秒(图 6)。

定性结果中,论文展示了双曝光、抠图、合成等场景:Evolve 会完成多步编辑流程,且在选择素材时就考虑后续编辑需要;Base 则经常切中表面名词但无法完成所需操作(图 7)。

实践建议

基于该论文框架,若要在类似智能体系统中落地程序性记忆,值得考虑几点。首先,把 “提议” 与 “准入” 分开:生成新技能或修订旧技能的策略可以很宽松,但进入生产库必须经过保守重放。论文的重放门控不接受 “多数案例平均改善但个别案例退化” 的变更,这一设计在产品环境中尤其重要,因为可见回归的代价通常高于错失一次改进(见论文第 3.3 节)。

其次,不要只做拓宽或只做深化。论文的消融表明,在 200 个留出简报设置下,单独机制提升有限,组合才出现明显超加性(表 3)。实践中应让两者共享失败和覆盖信息:修订失败的技能时,把不可修复的案例重新路由到覆盖池;铸造新技能时,通过重放验证其不会在邻近请求上误触发。

第三,冷启动虽必要但不足以形成优势。论文中文档派生技能库在留出集上未超过无技能基线(表 3),意味着初始技能只是召回下限,真正的收益来自后续用户流量驱动的进化和门控。第四,个人化可能需要工具层强制。论文附录 I 指出,单独注入自然语言技能无法覆盖模型的默认方法;要让用户偏好生效,还需要偏好条件检索和工具集约束。最后,对长流程、精细几何任务要保持克制:自然语言技能在短且自包含流程上更有效,长程序会因注释、蒸馏和执行三个环节的保真度损失而衰减(附录 I)。