视觉相似性的多重感知:一种文本提示的图像感知度量
The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric
论文信息
标题: The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric
作者: Sheng-Yu Wang, Yotam Nitzan, Aaron Hertzmann, et al.
发布日期: 2026-07-20
arXiv ID: 2607.18237v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:人类的视觉相似性判断高度依赖于具体的比较方面(如颜色、姿态、纹理),但现有的感知相似度指标只能给出一个无条件的标量值,无法按需切换关注的视觉属性。
- 核心方法:构建了一个包含约 25K 图像三元组、超过 260K 个三元组-方面组合、共 100 万条人类判断的数据集,并用它微调视觉语言模型(VLM),得到可基于文本提示调整相似度感知的 TPIPS 指标。
- 关键结果:在 odd-one-out 测试中,微调后的 TPIPS 将基线模型与人类共识的差距从 9.1% 缩小到 2.8%(见论文图 5),在未经训练的外部分布 2AFC 任务上同样优于所有基线。
- 主要局限:基于 VLM 的 TPIPS 计算成本远高于传统的 LPIPS 或 DreamSim;嵌入检索需要为每个方面单独编码;训练数据主要由文图模型生成,可能遗漏 VLM 本身无法捕捉的视觉方面;度量尚未与内容完全解耦。
- 适合读者:从事图像生成、多模态表征学习、感知评估或图像检索,且希望用可控的、与人类判断对齐的相似度度量的研究者与工程师。
论文背景和研究动机
让机器像人类一样判断两张图像是否相似,是计算机视觉的基础命题。从早期的 SSIM、LPIPS 到基于合成数据训练的 DreamSim,研究者们已经积累了大量无条件相似度度量。但这些方法输出的是单一标量,无法回答 “在颜色上它们相似,但在形状上差别很大” 这类更接近人类真实感知的问题。认知科学早已指出,相似性是一种依赖于上下文的、多面的判断(Tversky, 1977;Medin et al., 1993),而现有的图像相似度度量将所有这些维度压缩成一个数字,本质上是一种信息损失。
一些工作尝试引入条件化的相似度,例如 GeneCIS 和 FocalLens 从已有视觉语言数据中挖掘属性差异三元组,Omni-Attribute 则利用 VLM 生成的标签构造监督信号。但它们都缺少一个关键要素:直接基于人类在特定方面条件下的感知判断进行验证和训练。论文指出,没有面向这一任务的人类标注数据集,导致现有模型在这一 “多面相似性” 问题上的表现与人类共识之间仍存在显著差距。
作者举了一个直观的例子:一张奶牛雕像的参考图,旁边四张候选图分别在主体颜色、姿态、地面纹理等方面与之相似。如果不指定比较的方面,模型给出的结果往往模棱两可,甚至在不同指标间矛盾。一旦给定文本提示(如 “subject color”),答案立刻变得清晰。这正是论文试图解决的问题:如何构建一个能用自由文本指定相似性方面的感知度量,并使其与人类判断对齐。
核心方法和技术细节
三元组数据集构造
论文从文本-图像生成模型入手,用 FLUX-Reason-6M 的 prompt 作为种子,让 LLM 为每条 prompt 生成三个在多个视觉因素上有意图变化的变体,再用 FLUX.1-dev 渲染成图像三元组。这种合成方式使三元组在颜色、光照、纹理、姿态等多个方面同时存在可控差异,既不会太简单(某一图像在所有方面都是 outlier),也不会太细微(人类无法可靠判断)。
生成三元组后,用 VLM(GPT-5.2)对候选方面进行提炼:删除在视觉上未实际变化的方面,补充图像中可观察到但 prompt 未显式说明的属性(如物体大小、拍摄距离)。这一方面列表经过人工标注的 “can’t tell” 过滤,最终为每个三元组留下可靠的条件集合。收集 5 名标注者的 odd-one-out 投票,形成概率分布 y ∈ Δ³。整个数据集包含 24,342 个三元组,257,391 个三元组-方面组合,1,044,495 条有效投票(见表 1)。训练/验证/测试划分中的测试集用于 in-distribution 评估。
外部泛化评估集
为验证指标在真实视觉算法上的泛化性,作者额外构建了一个基于外部分布算法的 2AFC 数据集。它覆盖了图像编辑、图像合成、新视角合成和单图转 3D 四个任务,每个任务均使用多个前沿算法的输出。标注者观看参考图像和两个候选结果,在指定方面下选择更相似的一个。同样收集 5 票并过滤 “can’t tell” 和完全平局的例子,最终得到 1,127 个三元组和 4,771 个方面条件(表 1)。这套数据完全不用于训练,只用于评估方法的跨分布泛化能力。
模型架构
论文从视觉语言模型出发,探索了三种融合策略,并用收集的三元组数据微调。
Late fusion(嵌入晚期融合) 将每张图像和方面提示单独送入 VLM,取最后一个 token 的归一化隐状态作为嵌入 z。两张图像的相似度即为两个嵌入的余弦相似度。这种方法在推理时可预计算嵌入,效率高,但图像之间在模型内部没有交互。
Mid fusion(中间特征距离) 类似 LPIPS 的思想,从 VLM 的不同 transformer 层提取图像 token 的特征,计算两张图像对应特征之间的加权 ℓ2 距离,权重由方面 c 通过 MLP 动态生成。同样,两张图像独立编码,仅在计算距离时融合。
Early fusion(早期全交互) 将方面提示、两张图像的 patch、加上两个可学习的 register token 拼接成一个输入序列。注意力掩码设计确保图像 patches 可以相互关注,同时 register token 分别仅关注各自图像,并输出图像相关的表示,最终相似度由两个 register 的余弦相似度得出。该架构天然满足对称性 f(x1,x2|c)=f(x2,x1|c) 和恒等性 f(x,x|c)=1。
所有变体都基于 Qwen3-VL-Embedding-8B 主干,用 LoRA 进行微调,训练目标是最大化模型预测与人类投票分布之间的交叉熵(如图 3)。训练时,非选中的那对图像应当具有最高相似度。
创新点和贡献
-
首个大规模、多方面人类感知相似度数据集 不同于仅限于无条件或有限离散属性集合的以往工作,本文收集了 100 万条基于自由文本方面的人类判断,可直接用于训练和评估文本条件化的相似度量。
-
文本提示驱动的感知相似度模型 TPIPS 通过微调 VLM 将相似性判断与人类标注对齐,模型能够按需输出在颜色、姿态、纹理、光照等任意方面下的相似度,而非一个笼统的数值。
-
多维架构分析与最优融合策略 系统比较了 late fusion、mid fusion 和 early fusion 三种方案在同一次微调框架下的表现,发现 early fusion 略占优势,但 late fusion 作为嵌入模型在检索中更实用。
-
与人类判断的高度对齐及稳定泛化 在 in-distribution 的 odd-one-out 测试中,TPIPS 将基线最佳水平(Gemini-3.1-Pro 的 58.4%)提升至 64.7%,与人类共识的差距缩小了三分之二(见图 5)。在完全没有训练过的外部分布 2AFC 测试上,TPIPS 同样大幅超过所有零样本 VLM 和嵌入基线。
-
解锁新的下游任务 展示了方面条件下的图像检索、多个查询方面线性组合的合成检索,以及视频帧中部分属性变化的精细度量。这些在无条件度量下不可能实现。
实验结果分析
与人类判断的一致性 图 5 是核心结果栏状图,左侧为 odd-one-out,右侧为 2AFC。人类共识在 odd-one-out 任务中为 67.5%(random chance 33.3%),最佳基线 Gemini-3.1-Pro 达到 58.4%,而 TPIPS(early fusion)达到 64.7%,将差距从 9.1% 缩至 2.8%。在 2AFC 任务上,人类共识 89.3%,最佳基线为 Qwen3-VL-8B(early fusion 的零样本形式)73.9%,TPIPS 达到 79.3%,同样有明显提升。论文指出,2AFC 上更大的提升空间表明这方面尚未饱和。
不同融合策略的影响 在统一使用 Qwen3-VL-Embedding-8B 微调的对比中,early fusion 在 odd-one-out 和 2AFC 上分别达到 64.7% 和 79.3%,mid fusion 分别为 63.8% 和 75.9%,late fusion 为 64.1% 和 77.9%。early fusion 全交互设计的优势虽不巨大,但稳定。论文还验证了,仅冻结骨干训练 mid fusion 的通道权重或移除方面条件会导致大幅性能下降(45.6% 和 59.8%),说明端到端微调与方面条件化均不可或缺。
通用感知相似度基准的迁移能力 尽管 TPIPS 仅训练于论文收集的面向方面条件的数据集,使用 “overall” 条件评估时,它在 BAPPS 和 NIGHTS 上分别达到 67.3% 和 94.0% 的一致率,不仅优于零样本的 Qwen3-VL-Emb(65.2% / 87.9%),还逼近在这些基准上专门训练的 DreamSim(68.3% / 96.2%)。这表明数据集捕捉的感知结构具有跨域迁移性。
定性应用 图 6 展示了一段围绕茶杯旋转的视频,将该视频每一帧与初始帧的相似度随时间绘制成曲线。如预料,整体相似度主要受相机角度和阳光变化影响,但若将方面提示改为 “cup handle position”,相似度曲线会在手柄从右侧转至左侧时产生剧烈跌落。图 7 和图 8 分别展示了 Open Images 和 WikiArt 上的方面条件检索和合成检索,相同的查询图在不同方面下检索出的近邻截然不同,且组合多个方面的查询能返回同时满足颜色、笔触、构图等需求的结果。这类应用在无条件度量下完全无法实现。
实践建议
TPIPS 的发布模型和代码已开源,适合直接集成到需要可控相似度评估的系统中。以下是一些具体的落地建议:
-
生成模型的多维度评估 对于图像生成或编辑任务,常需要评估输出在特定属性上是否与参考一致。使用 TPIPS,评估者可以分别计算 “颜色保真度”“纹理细节”“物体姿态” 等维度的相似度,取代笼统的 FID 或 LPIPS。这有助于定位模型在哪些属性上变弱,指导定向改进。
-
文本驱动的图像检索系统 若检索库庞大,建议采用 late fusion 版本,为每个方面条件单独预计算并索引嵌入。在检索时,可以根据用户输入的方面提示选择对应索引,或者实时组合多个方面查询的余弦相似度(例如用加和或加权和)。论文已验证合成检索的可用性(图 8),开发者可以进一步加入权重控制,让用户自由调节不同方面的优先级。
-
视频分析与时序对齐 图 6 的例子展示了在视频帧间追踪特定属性变化的能力。可以将其用于视频编辑时间线上的自动关键帧选择,或分析生成视频中某属性的一致性。此时建议按帧对计算相似度,成本较高但可控。
-
作为奖励信号微调生成模型 近年来已有工作用 VLM 的偏好评分训练图像编辑或生成模型。TPIPS 的优势在于能提供面向具体属性的、与人类对齐的相似度信号,可用于风格迁移、属性编辑等任务的强化学习或直接优化,且能避免单一整体评分导致的属性冲突。
由于 VLM 推理成本较高,对于需要在线、低延迟的场景,可考虑使用较小的 2B 模型(论文已提供同等微调结果,odd-one-out 一致率仅降至 63.7%),或用 late fusion 的嵌入预计算摊销前向开销。此外,目前的方面列表由 VLM 生成并人工修剪,在实际应用中设计合适的方面提示集合需要结合领域知识,但论文提供的流程可作为自动提取方面的起点。