从语料库到协同演化的能力:面向通用图像生成的以能力为核心的数据设计
From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation
论文信息
标题: From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation
作者: Xingjian Wang, Zhao Wang, Taihang Hu, et al.
发布日期: 2026-08-18
arXiv ID: 2608.18076v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:通用图像生成器需要同时支持文本生成、图像编辑和知识接地等多种相互依赖的能力,但传统数据管道把任务特定数据集孤立优化,难以组织异构监督。
- 核心方法:提出能力驱动数据基础设施,包含三个专用且互操作的数据引擎(T2I、图像编辑、知识接地),以及遵循能力习得顺序的五阶段课程调度和评估驱动反馈循环。
- 关键结果:构建 440M 图像 T2I 语料库、120M 编辑对和逾 27M 图像-实体对;在 CPI-Bench 两个子集上,6B MM-DiT 模型取得总体平均 3.94 分(表 1)。
- 主要局限:论文未系统讨论局限;方法依赖十亿级数据池和多个专家模型,评估仅覆盖 CPI-Bench 的 General 和 Practical 子集,未包含 Intelligent 子集的量化结果。
- 适合读者:从事多模态生成模型数据工程、课程学习、图像编辑与生成一体化研究的研究者和工程师。
论文背景和研究动机
现有大规模图像生成受益于数据规模、质量、重平衡和重标注,但传统管道通常孤立优化任务特定数据集。作者指出核心挑战不仅是策展每个任务语料库,更是根据生成能力之间的依赖关系组织异构监督。能力不是同时从零涌现,而是按依赖顺序发展,与课程学习阶段对齐。例如 T2I 的语义对齐为结构化生成和编辑提供可复用概念,粗粒度内容为高分辨率学习提供基础。因此一个训练样本的效用不仅取决于其质量,还取决于它针对的能力及其与其他样本的关系。传统数据集作为任务特定设计单元,限制了跨任务监督共享。
核心方法和技术细节
框架由两部分组成:能力特定数据管道和能力对齐课程调度。
三个数据引擎各司其职。T2I 引擎将十亿级图像池转化为 440M 高质量、分布平衡训练语料,扩展实体级概念覆盖,并保留受控比例缺陷图像且显式描述缺陷。图像编辑引擎构建 120M 编辑对,混合操作特定构建和自然视觉关联挖掘:操作特定构建使用 SAM3 掩码和 VLM 分解场景;自然关联来自同人/产品图像、共现网页、视频帧、电商集合以及多面板布局恢复。知识接地引擎从 1 亿 Wikidata 实体计算 PageRank,筛选出约 300 万高显著实体名,检索并验证图像,得到逾 27M 图像-实体对。
标题作为桥梁贯穿任务和粒度。编辑指令继承 T2I 标题词汇和描述结构,使 T2I 中习得的概念可迁移到编辑监督;同一图像被标注为从实体标签到长描述的多粒度文本。两个基于 Qwen3.5-27B 的 VLM 标题专家(通用和密集)经过监督微调和强化学习,奖励包括视觉覆盖、幻觉、语言清晰度和反黑客项。
课程调度分五阶段,联合演化任务组成、概念分布、数据质量和分辨率:阶段 1 为 256px T2I 预训练;阶段 2 引入复杂 T2I 内容并升至 512px;阶段 3 加入编辑数据联合预训练;阶段 4 持续训练升至 1024px 并过滤数据源;阶段 5 为小规模高度策展的 SFT。能力差距驱动反馈循环将中间检查点的失败样本转化为检索种子,触发目标检索、专家构建和差距感知重采样。
创新点和贡献
论文提出能力特定数据管道,分离构建但通过共享预处理和标题接口保持迁移;能力对齐课程调度遵循依赖顺序动态演化数据混合,而非固定混合;标题框架桥接任务和粒度,统一监督接口;并将数据组织作为互补扩展轴,把数据策展从孤立任务管道重构为自适应监督系统。这些贡献将数据设计的单位从 “语料库” 提升为 “能力”。
实验结果分析
定性 T2I 结果显示模型在插画、图形设计、知识可视化、多面板构图等表现良好(图 7)。作者将这一结果归因于 T2I 引擎产出丰富的文本和结构化布局图像,课程先建立广泛视觉接地再引入复杂结构。
图像编辑定量评估在 CPI-General-Bench(2039 示例,30 个任务)和 CPI-Practical-Bench(558 示例,51 类应用)上进行。在该评测设置下,3B 模型在 CPI-General 和 CPI-Practical 分别取得 3.95 和 3.91,总体 3.93;6B 模型分别取得 3.96 和 3.92,总体 3.94(表 1)。这些分数由 VLM 在多个维度上评定,范围 1-5,但论文未报告与其他模型的对比数据。
定性编辑结果显示混合变换、推理编辑、退化恢复(老照片、模糊、运动模糊)以及多图像编辑中的视角对齐、参考关系理解和文本渲染(图 8、图 9、图 10)。作者推测这些能力分别受益于自然来源编辑对的真实关系、保留受控缺陷数据并显式描述退化状态,以及编辑指令与 T2I 标题对齐提供的显式语义对应。
实践建议
若团队构建多模态生成模型数据基础设施,可从以下方面借鉴:
-
从能力出发组织数据,而非按任务划分孤立数据集。明确 T2I、编辑、知识接地等能力间的依赖关系,让共享的语义元数据和标题接口支持概念跨任务复用,避免每个任务数据集重复覆盖全部视觉概念。
-
课程调度与能力习得顺序对齐。先建立广泛语义对齐,再引入复杂结构和高分辨率,编辑数据在 T2I 先验稳定后加入。数据质量、概念分布、任务组成和分辨率应联合演化,而不是固定混合。
-
保留受控缺陷数据并显式描述缺陷。作者在 T2I 引擎中保留一定比例不完美图像并写入缺陷描述,使模型学会识别和避免这些模式。该思想可迁移到其他生成任务的数据构建。
-
编辑数据混合自然关联与合成变换。仅用合成变换可能产生粘贴感或继承生成器伪影;从共现网页、视频帧、电商多面板中挖掘自然编辑对能提供更真实的变换监督。
-
建立评估驱动的数据补充闭环。将中间检查点的失败样本转化为检索种子,针对失败模式进行目标检索或专家生成,并根据差距调整重采样权重。这比一次性构建固定数据集更能匹配模型演化。
以上建议基于论文方法,在论文所报告的数据规模和模型设置下有效;迁移到其他场景时需验证。