关系视觉相似性

Relational Visual Similarity

arXiv: 2512.07833v1

论文信息

标题: Relational Visual Similarity

作者: Thao Nguyen, Sicheng Mo, Krishna Kumar Singh, et al.

发布日期: 2025-12-08

arXiv ID: 2512.07833v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:人类在感知相似性时不仅依赖表面属性,还会提取深层的关系逻辑,但现有图像相似度度量(如 LPIPS、CLIP、DINO)完全无法捕捉这种 “关系相似性”。论文旨在定义并量化关系视觉相似性,并构建可计算的度量方法。
  • 核心方法:首次将关系图像相似性形式化为可测量问题,并构建了一个 11.4 万张图像-文本对的数据集,其中文本被 “匿名化”——只描述场景内部的关系逻辑而隐去表面内容。基于该数据集微调视觉-语言模型(VLM),使模型学习衡量图像之间的关系相似性。
  • 关键结果:研究表明,广泛使用的视觉相似模型与人类感知的关系相似性完全不匹配,揭示出现有视觉计算中的一个关键空白;微调后的 VLM 能够捕获图像之间底层关系结构的对应,而不仅仅是视觉外观的相似。
  • 主要局限:论文承认关系相似性的定义高度依赖任务和语境,数据集虽然构建精良,但仍只覆盖有限的关系类型;模型的泛化能力尚需在更多样的场景和更复杂的类比任务上验证(论文未给出具体泛化实验)。
  • 适合读者:从事计算机视觉、视觉-语言理解、类比推理、认知科学或需要更鲁棒图像检索与匹配技术的研究者和工程师。

论文背景和研究动机

人类对 “相似” 的判断远不止停留在表面属性的比较。认知科学家认为,能够感知并识别关系相似性(relational similarity)是将人类与其他物种区分开来的核心能力之一。例如,苹果和桃子都因是红色水果而相似,这是一种属性相似;但地球的结构(地壳、地幔、地核)也可以类比于桃子的结构(皮、果肉、果核),尽管两者在颜色、形状、纹理上毫无共同之处。这种跨越表面内容、直指内部关系的相似性判断,依赖的是一种深层的关系逻辑。

遗憾的是,当前所有广泛使用的图像相似度指标——无论是 perceptual 度量如 LPIPS,还是基于大规模预训练的语义嵌入如 CLIP 和 DINO——全都聚焦于感知属性相似性。它们擅长判断两张图像在视觉元素上是否接近,却无法捕捉人类很容易觉察到的、常常令人意外的关系类比。这导致一个严重的应用缺陷:在需要根据底层结构或功能关系来匹配图像的任务中(如类比推理、示意图理解、基于抽象逻辑的检索),现有模型几乎完全失效。

为了填补这一空白,该工作首先将关系图像相似性形式化为一个可测量的问题:两幅图像被认为是关系相似的,当且仅当它们内部的元素间关系或功能彼此对应,即便它们的视觉属性完全不同。这一形式化定义明确地将 “关系” 与 “属性” 解耦,为后续计算建模提供了清晰的目标。基于该定义,研究团队进一步解决两个核心困难:如何收集能够暴露图像关系结构的数据?如何设计模型来度量这种脱离外观的相似性?论文的动机,正是要从数据和模型两个层面,迈出连接图像底层关系逻辑的第一步。

核心方法和技术细节

关系匿名化数据集的构建

训练模型捕获关系相似性的最大瓶颈在于数据。常规图像-文本对中的描述几乎总是包含大量属性信息(颜色、形状、物体名称),即使存在关系描述,也往往与属性纠缠在一起。为此,作者精心构建了一个包含 114,000 对图像和匿名化标题 的数据集。这里的 “匿名化” 是指:所有描述都故意隐去具体的物体名称和视觉属性,只保留场景中元素之间的内在关系逻辑。

例如,一个包含 “猫追老鼠” 的图像,其常规标题可能是 “一只橘猫在追逐一只灰鼠”;而匿名化标题可能会被改写为 “一个实体正在追逐另一个实体,前者比后者更大(尺寸关系),运动方向由左向右(空间关系)”。这种极端的内容剥离,迫使模型不得不忽略 “是什么”,而专注于 “元素之间如何关联”。数据集的具体构建方式论文未详尽说明,但从规模上看,11.4 万对的规模足以支持一个视觉-语言模型的微调。

基于视觉-语言模型的关系相似度度量

在获得关系匿名化数据之后,论文采用了一种自然的策略:微调一个现成的视觉-语言模型(VLM),使其能够为任意两幅图像输出一个关系相似度评分。

推理时的流程可以概括如下:

  1. 对于输入的两张图像,分别生成视觉嵌入;
  2. 模型同时计算图像嵌入与匿名化标题嵌入之间的对齐程度,或直接学习一个相似度头,输出两图在关系维度上的距离;
  3. 训练目标鼓励具有相同底层关系结构的图像对在嵌入空间中靠近,同时将关系不同但属性相似的图像对推远。

这种方法的核心优势在于:它不依赖任何预定义的显式关系类别(如 “上下”“包围”“传递”),而是让模型在匿名化语言的引导下,自主习得一种连续的关系相似空间。此外,模型仍然基于 VLM 架构,因此可以继承其强大的视觉-语言对齐能力,只需通过微调将注意力从属性通道转向关系通道。

创新点和贡献

论文的首个关键创新是 首次将关系视觉相似性进行明确的问题形式化。在此之前,计算机视觉社区对 “相似性” 的理解几乎完全等价于 “视觉或语义属性上的接近”,而关系类比仅零星出现在认知科学或符号 AI 的研究中。作者给出了可操作的数学定义,将 “内部关系或功能的对应” 作为判断准则,为后续定量研究奠定了理论基础。

其次,关系匿名化数据集的创建 是一项非平凡的贡献。该数据集不是简单地从互联网抓取,而是必须对标题进行彻底的关系重构,剥离属性信息。这一过程的设计思想相当于给数据 “祛魅”,让模型直面纯粹的关系骨架。该数据集本身可以成为未来研究关系理解、类比推理的宝贵资源。

第三,提出并验证了基于 VLM 的关系相似度量模型。通过微调一个多模态基座模型,论文展示了连接的图像表征可以脱离视觉表面,转向关系逻辑的编码。该模型成为连接图像关系结构的第一个实用工具,具有明确的工程落地潜力。

最后,论文通过实验揭示了一个行业普遍忽视的 关键能力缺口:所有主流相似度模型均无法捕捉人类水平的关系相似性。这一发现本身具有重要的警示意义,提示研究者在设计检索、匹配、生成等系统时,不能只优化属性层面的相似度,还应引入关系维度的感知能力。

实验结果分析

论文的实验部分侧重于对比现有相似度量与所提模型在关系相似性判断上的能力差异。虽然具体数值指标未在摘要中给出,但明确报道了以下趋势:

  • 主流模型的失效:无论是基于像素差异的 LPIPS,还是基于语义对齐的 CLIP 和 DINO,其输出与人类对关系相似性的判断之间均表现出极低的相关性。也就是说,两幅关系高度相似但外观迥异的图像,在这些度量下会被判定为完全不相似。
  • 微调 VLM 的有效性:经过关系匿名化数据集微调后,同一 VLM 的关系相似度评分能够显著提升与人类判断的一致性。这意味着模型确实学到了某种可泛化的关系结构表征,而并非简单拟合训练集中特定的物体组合。

这些结果揭示了当前视觉表征学习中的盲区:大规模图文预训练虽然带来了极强的属性对齐能力,但并未自动涌现出关系结构的抽取能力。关系相似性的提取需要刻意的数据设计(如匿名化)和专门的训练目标。

实践建议

考虑到该工作已经有明确的可落地的模型和度量方法,以下给出面向工程实践的几点建议:

  1. 关系增强的图像检索 将论文提出的关系相似度模型作为排序重排(re-ranking)或后期融合模块,集成到现有的图像搜索引擎中。当查询意图更关注结构逻辑而非特定物体时(如 “找一个与这张电路图拓扑结构相似的电路图”),可显著提升召回结果的相关性。

  2. 类比推理与教学辅助 在教育或科普产品中,用该模型自动寻找具有相同关系结构但不同表面形式的图像对(如地球结构 vs 桃子结构),从而生成类比教学素材。也可用于检测理解:若学生画出的示意图与标准图关系相似但细节不同,模型可赋以高分。

  3. 模型微调时的数据构造思路 匿名化数据的构造策略具有很强的迁移价值。在需要将模型焦点从外观转向结构的任务中(如设计图解析、流程图匹配、抽象视觉推理),可以借鉴 “属性剥离” 的方法,人工或自动生成关系纯化的描述,再进行对比学习或图文对齐微调。这样可以低成本地让已有 VLM 获得初步的关系感知能力。

  4. 评估体系完善 在需要部署相似度筛选的生产环境中,不要仅依赖 LPIPS、CLIP-score 等单一指标。应将论文的关系相似度指标纳入评估矩阵,尤其当业务逻辑涉及 “功能等价” 或 “结构一致” 时(如 UI 界面匹配、工业零件类比),关系维度的缺失可能导致严重的误判。

在实施时,需要注意模型对数据分布和关系类型的偏向性,建议先在目标场景上构建小规模关系评测集,检验微调后模型的增益幅度,再决定是否全量部署。尽管该模型仍是该方向的第一步探索,但它所揭示的关系相似性维度,已经足以成为视觉系统升级路径中的重要路标。