视觉相似性的多重意义:一种基于文本提示的图像感知度量

arXiv: 2607.18237v1

论文信息

标题: The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric

作者: Sheng-Yu Wang, Yotam Nitzan, Aaron Hertzmann, et al.

发布日期: 2026-07-20

arXiv ID: 2607.18237v1

PDF 链接: 下载 PDF

论文背景与研究动机

感知相似度是计算机视觉中的基础问题。从早期的 SSIM 到基于深度学习的 LPIPS、DreamSim,研究者一直在追求与人眼判断一致的图像相似度量。然而,人类对 “相似” 的判断高度依赖上下文:两幅图像可能在形状上相似但颜色迥异,或在纹理上相近而光照不同。传统感知指标将所有感知维度压缩为单一标量,无法表达这种多义性。例如,给定一张牛的雕像参考图,四张候选图分别在不同方面(牛的毛色、姿态、地面纹理、旗帜图案)与之相似,传统度量难以给出明确答案,因为它们无法 “聚焦” 于特定视觉属性。

近期涌现的视觉语言模型(VLM)虽具备跨模态理解能力,但多直接输出无条件的相似度分数,缺乏基于人类细粒度判断的专门数据集来校验其与人类感知的对齐程度。为此,本文提出了一个大规模、多方面的图像相似度数据集,并基于此构建了一个文本提示驱动的感知相似度指标——TPIPS(Text-Prompted Image Perceptual Similarity)。该指标接受一个文本描述(方面),输出对应条件下的图像对相似度,从而为人与机器之间的 “感知鸿沟” 架设了一座可调节的桥梁。

核心方法与技术细节

数据集构建:多维度三元组与 2AFC

研究团队首先构建了一个大规模三元组数据集。每个三元组由三张图像组成,它们通过文本到图像模型(FLUX)生成,使用共享种子和受控的提示变体产生有限但真实的视觉差异。关键在于,每张图像并不是在某一个属性上截然不同,而是在多个视觉因素(如颜色、姿态、光照、背景)上同时存在细微变化,迫使评判者必须针对特定方面进行推理。

对每个三元组,团队利用大语言模型和视觉语言模型联合提出一组 “视觉方面” 的文本提示。LLM 首先生成若干候选方面,再由 VLM 根据实际图像内容进行筛选和补充,确保提示与实际视觉差异对齐。随后,人类标注者针对每个三元组、每个方面执行 “奇数个” 任务:指出哪张图像在该方面最不同。每项任务收集 5 份人类判断,并过滤掉意见不统一的低置信度样本。数据集总计包含约 2.6 万个三元组、26 万个三元组-方面组合和超过 100 万次人类判断。

为验证模型的分布外泛化能力,团队还构建了一个 2AFC(二择强制选择)外部评测集。它取自图像编辑、图像合成、新视角合成和单图 3D 重建等真实视觉算法的输出,要求标注者针对指定方面判断哪个算法输出与参考图像更相似。该集合不含训练数据,用于严格测度模型在真实应用场景下与人类偏好的一致性。

模型架构与训练目标

TPIPS 以强健的视觉语言模型为骨干,提出了三种融合策略,分别对应图像在模型内部的不同交互层次:

  • 晚期融合(嵌入法):图像和文本条件独立编码为向量,余弦相似度作为最终分数。该方法推理效率高,便于大规模检索。
  • 中期融合(激活差异法):类似 LPIPS 的思路,提取 VLM 内部各层的图像标记特征,计算文本加权的层间 L2 距离,加权系数由一层 MLP 根据文本条件动态生成。
  • 早期融合:两幅图像及其文本条件一同输入模型,设计特殊的注意力掩码和位置编码,使模型能从最底层开始跨图像交互,同时天然保证对称性和自相似性(同一幅图相似度为 1)。

训练目标基于人类判断的 softmax 选择模型。给定三元组和某个方面,若人类标注者一致认为图像 k 是奇数个,则模型应使其余两图像的相似度高于任何包含 k 的配对。将三个互补对的相似度经高温τ的 softmax 转换为预测概率,与人类投票分布计算交叉熵损失。

模型使用 Qwen3-VL-8B 作为骨干,通过 LoRA 微调,在 8 张 A100 GPU 上完成训练,晚期融合版本仅需约 4.5 小时。

创新点与贡献

TPIPS 的核心创新在于首次将自由文本条件引入人类感知相似度的学习与评测,并为此建立了完整的数据集、基准和模型。

首先,数据集直接采集了人类在多元化视觉属性上的相对判断,与以往基于图像描述或 VLM 推理的弱监督方法相比,更忠实地反映了人类感知。三元组的生成策略(多因素交织、中等难度)使得任务既非平凡也不无解,为模型提供了有效训练信号。

其次,模型架构的设计探索揭示了不同融合方式对条件相似度的适用性。早期融合虽精度最高,但晚期融合在保持高效检索能力的同时也取得了接近的性能,且具备天然的可分离嵌入优势,实用性更强。文本条件化不仅体现在嵌入层面,中期融合中的动态通道加权更是实现了属性感知的特征筛选,这是对传统 LPIPS 的文本可控延伸。

此外,TPIPS 在分布外测试集上的出色表现证明了其作为通用感知指标的潜力,而非仅局限于合成数据。它能够直接用于评估生成模型、图像编辑、3D 重建等任务中的特定属性保留或改变程度,开辟了细粒度、可解释的模型评估新范式。

实验结果分析

在内部三元组测试集上,TPIPS 将人与模型的一致率从最优基线 Gemini-3.1-Pro 的 58.4% 提升至 64.7%(人类共识上限 67.5%),大幅缩小了感知鸿沟。在分布外 2AFC 测试集上,TPIPS 的一致率达到 79.3%,比最强基线(DreamSim)高出 6 个百分点以上,且在所有四个任务子类中均居于领先。

消融研究表明:早期融合略优于中晚期融合;训练数据量在达到 60% 后即接近饱和,说明当前数据分布的增益已有限,未来需更多样化的数据源;模型规模并非越大越好,2B 版本与 8B 版本差距甚微,这为轻量部署提供了参考。

定性结果方面,给定相同的查询图像,TPIPS 根据不同的文本条件可以检索出截然不同的近邻,例如 “相机视角” 近邻强调构图相似,“物体颜色” 近邻则呈现颜色一致但场景迥异的图像。此外,组合检索功能允许用户通过叠加多个查询条件来寻找同时满足多种属性约束的图像,如在 WikiArt 数据集中,将 “两个坐着的人(主题)” 与 “莫奈画风(笔触)” 结合,成功检索出印象派的双人肖像。

实践应用建议与未来发展方向

TPIPS 可直接作为生成模型(文本到图像、图像编辑、3D 生成等)的细粒度评估器,量化输出在姿势、颜色、纹理、光照等方面的与目标的一致性。对于视觉检索系统,它支持用户以自然语言指定关注维度,提升检索体验的可控性和可解释性。在组合检索场景下,线性相加相似分数的简单策略已被验证有效,可结合更复杂的查询融合机制进一步优化。

对于希望复现或扩展该工作的开发者,建议从晚期融合模型入手,因其灵活且高效,可预先计算嵌入以减少在线开销。若应用场景需要最高精度,早期融合提供了更强的跨图像交互能力。微调时,可考虑使用更大规模的骨干模型以获取上限性能,但鉴于收益递减,应权衡计算成本。数据构建中,可借鉴本文的 “多因素中等难度” 设计原则,利用生成模型廉价生成特定属性的配对数据,但务必要通过人类标注过滤不可靠的方面。

未来,该方向可在以下层面深化:第一,数据集覆盖更多样化的图像域,包括真实照片、医学影像、漫画等,并添加由人类自发标注的新方面,突破 VLM 生成方面的局限性;第二,研究更精细的文本条件机制,如向数值化属性(如 “亮度 85%”)扩展连续条件;第三,将条件相似度作为反馈信号融入生成模型的强化学习调优循环,实现更符合人类意图的图像生成与编辑。

总结与展望

本文揭示了视觉相似度天然的多义性,并通过构建新型数据集和学习范式,赋予了感知指标以文本条件化的 “聚焦” 能力。TPIPS 不仅显著提升了与人类判断的一致性,还展示了在检索、组合和评估等下游任务中的强大潜力。将感知相似度从僵硬的标量解放为灵活的语言导向函数,这一思路为可控生成、可解释 AI 和多模态交互等领域带来了新的可能性。随着视觉语言模型的持续进化,这类条件感知指标有望成为人机协同视觉理解的标准组件,并推动感知驱动的生成与评价体系迈向更细腻、更可定制的未来。