Paint-Anything:面向图像生成与编辑的统一任意颜色控制
Paint-Anything: Unified Any-Color Control for Image Generation and Editing
论文信息
标题: Paint-Anything: Unified Any-Color Control for Image Generation and Editing
作者: Ji Xie, Dewei Zhou, Xinyu Huang, et al.
发布日期: 2026-09-17
arXiv ID: 2609.20816v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决图像生成与编辑中的 “任意颜色控制” 问题,即用户希望用 24 位 sRGB 十六进制值(如 #AABBCC)显式指定某个对象的颜色,而不是依赖模糊的颜色词。
- 核心方法:论文提出 Paint-Anything,通过对象级颜色监督让一个模型学习统一的 “hex 文本提示接口”。训练数据 Paint-500K 由真实图像经 VLM 定位、SAM3 分割、CIELAB 空间 MeanShift 聚类构建,并加入只在高噪声时间步启用的纯色锚点监督。
- 关键结果:在 FLUX.2-4B 上,Paint-Anything 相对基座模型在 ACBench-T2I 和 ACBench-Edit 上的颜色保真度分别提升 85.3% 和 28.3%(见摘要及表 1)。
- 主要局限:作者明确表示当前训练数据未包含调色板特定监督,未来工作可扩展调色板监督与更广泛的颜色控制任务(见论文第 5 节)。
- 适合读者:从事文生图、图像编辑、颜色可控生成、多模态数据工程以及设计工具开发的工程师与研究者。
论文背景和研究动机
专业设计工作往往要求颜色精确到品牌色或产品色,例如 “品牌标志蓝” 或 “新系列的指定红”。这类需求无法通过 “蓝色”“红色” 等自然语言颜色词满足,而是需要明确的十六进制值。然而,现有图像模型很难稳定地遵循数字色彩规格:有些方法引入专用颜色模块或可学习颜色 token,有些方法在推理时进行采样引导或注意力/数值操作,但这些方案通常难以跨颜色扩展、难以迁移到新架构,或推理成本较高。因此,任意颜色生成、上色和编辑常被当作分离问题,而不是统一的提示词遵循能力。
论文注意到,现代大语言模型已经能够解析原始 hex 字符串并给出合理的色彩语义描述。图 2 显示,即使紧凑的 Qwen3-4B 也能把 #F0FFF1 和 #E8D00A 分别描述为浅绿白色和偏橙的黄色。这启发了作者把 hex 字符串作为文本提示的原生数值颜色接口,从而用一个模型统一生成与编辑。
核心方法和技术细节
Paint-Anything 保持在文本提示内完成颜色规范,使用显式标签 <color>#AABBCC </color> 包住每个 24 位 sRGB hex 值。文本编码器在微调期间保持冻结,因此这种显式标签会让模型在编码前获得更清晰的 hex 语法边界。论文实验表明,标签包装能提高对象级颜色保真度和组合颜色绑定(见表 2)。
模型基于 rectified-flow 文生图架构,训练目标是 flow-matching 损失。生成任务只输入文本;编辑任务额外把源图像经 VAE 编码为干净条件 latent,与噪声目标 latent 拼接。三类数据共享同一目标:真实图像的 T2I 样本、编辑配对样本、以及纯色锚点样本,三者加权组合为总损失(式 4)。
Paint-500K 数据管线是关键。先由 VLM 定位图像中与 caption 相关的对象和边界框,再由 SAM3 生成对象 mask。对 mask 内像素,论文在 CIELAB 感知空间中做 MeanShift 聚类,而不是固定 K 的 k-means。原因是 CIELAB 距离更符合人类对颜色差异的感知,而 MeanShift 能让聚类数量适应对象本身的颜色分布,减少阴影和噪声造成的冗余颜色分裂。聚类后,论文保留覆盖至少 15% 对象像素的簇,并要求保留簇合计覆盖至少 90% 对象像素,否则丢弃该实例;最大的保留簇作为该对象的主导色并转为 hex 标签。VLM 再把对象、hex 标签和空间关系重写为包含 <color> 标签的 caption。
因为真实图像中的阴影会使颜色标签只是近似值,论文加入 “纯色锚点” 监督:随机采样 24 位 RGB,渲染成纯色图像,并与包含相同 hex 的提示配对。纯色锚点提供像素级完全匹配的 hex 到 RGB 映射。为了避免纯色锚点干扰对象语义和编辑能力,这些样本只在高噪声时间步启用,公式为 ,最终取 。表 3 显示,高噪声门控比无门控锚点进一步提升了生成与编辑性能。
创新点和贡献
本文的主要贡献体现在四个方面。第一,它把 hex 颜色控制变成统一的文本提示原生能力,不需要专用颜色编码器或推理时颜色控制器,生成和编辑共享同一接口。第二,它提出 Paint-500K 数据管线,将真实图像转换为对象级 hex 监督,并在颜色提取中引入 CIELAB 空间 MeanShift 聚类。第三,它提出用高噪声时间步门控的纯色锚点来补充低级别 hex-to-RGB 对齐,这在真实标签受阴影影响的场景下提供干净的像素级参考。第四,它构建了 Any Color Benchmark(ACBench),包含 ACBench-T2I 和 ACBench-Edit,用于分别衡量生成与编辑的对象级 hex 颜色保真度。
实验结果分析
在主实验中,论文以 FLUX.2-klein-base-4B 为基座。表 1 显示,基座模型 ACBench-T2I 总体得分为 37.02,微调后达到 68.58;ACBench-Edit 从 58.90 提升到 75.57。相对提升分别为 85.3% 和 28.3%(见摘要及表 1)。在 CompColor 基准上,把颜色词替换为 hex 后,FLUX.2-4B 平均分从 0.72 降至 0.38;经过微调后,hex 提示平均分恢复并达到 0.79,同时仍高于基座模型颜色词提示的平均分 0.72(见表 1 及第 4.3 节)。
值得注意的横比是:微调后的 8B 参数模型在 ACBench-T2I 上比 56B 参数 FLUX.2-dev 高 16.88 分,在 ACBench-Edit 上高 6.70 分(见表 1)。这在该基准与实验设置下说明对象级 hex 监督带来的颜色控制收益可以超过参数规模带来的差异。
消融实验(表 2)表明完整配方最好:全量微调优于 rank-256 LoRA;纯色锚点和标签包装都有正向贡献。表 3 对时间步门控阈值进行扫描, 在生成和编辑上均表现最佳。附录 A 中 GenColorBench NCU 评估也显示,FLUX.2-4B 基座平均 NCU 为 34.00,Paint-Anything 达到 57.89,超过论文引用的 FLUX + NumColor 的 51.90。人类偏好研究中,Paint-Anything 在颜色偏好上非平局胜率为 80.9%(见附录 K)。
实践建议
如果工程团队希望在既有 rectified-flow 文生图模型中引入任意颜色控制,可以借鉴 Paint-Anything 的几条做法。第一,使用显式 <color>#HEX</color> 标签包装 hex 字符串,而不是裸写 hex;论文消融显示该设计同时提升生成、编辑和组合颜色绑定。第二,构建对象级监督数据时优先使用感知空间聚类。与固定 K 的 k-means 相比,CIELAB 空间 MeanShift 能减少同一对象上的冗余颜色分裂,更适合为每个对象生成一个干净的主导色标签。第三,如果真实数据标签受光源、阴影影响,可以加入纯色锚点样本,但建议只在较高噪声时间步训练。表 3 中 的设置在论文实验设置下相对无门控锚点提升明显。第四,评估时不应只看整体图像质量,而应使用 SAM3 等模型获取对象 mask,并用区域平均 RGB 与目标 hex 之间的 MAE 换算成连续分数;编辑任务中复用同一人工核验后的源 mask,可以减少 mask 差异对跨模型比较的干扰。第五,微调阶段论文采用全量微调而非 LoRA,在相同步数下表现更稳定(表 2);具体选择需结合团队算力和部署约束。