相同内容,不同答案:多模态大语言模型中的跨模态不一致性

Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs

arXiv: 2512.08923v1

论文信息

标题: Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs

作者: Angela van Sprang, Laurens Samson, Ana Lucic, et al.

发布日期: 2025-12-09

arXiv ID: 2512.08923v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决多模态大语言模型(MLLMs)在图像、文本和图文混合三种模态下,面对相同语义内容却给出不同答案的 “跨模态不一致” 问题。
  • 核心方法:作者设计了两个基准测试 REST 和 REST+,将同一语义信息分别编码为纯图像、纯文本和图文混合三种模态样本,系统评估模型在不同模态下的推理一致性。
  • 关键结果:即使 OCR 完全正确,15 个主流 MLLM 的跨模态一致性仍然很差,且一致性得分与模型内部 “模态差距”(modality gap)的统计量显著相关(见论文第 4.3 节)。
  • 主要局限:基准目前仅覆盖计数、颜色识别、空间关系等有限任务类型,且未提出解决不一致性的具体方法,尚不清楚结论能否推广到开放域对话或更复杂的多模态推理。
  • 适合读者:多模态大模型的研究者、评测工程师,以及关心模型鲁棒性和跨模态对齐机制的开发者。

论文背景和研究动机

多模态大语言模型(MLLMs)的设计目标是在统一的嵌入空间中理解图像和文本,从而实现跨模态的推理和生成。理想情况下,给定相同的语义内容,无论以哪种模态呈现,模型都应该给出相同的答案。但实际体验中,经常出现这样的现象:让模型回答 “图中有几个苹果” 和直接问 “文本描述‘这里有三个苹果’,到底有几个苹果?” 得到的结果可能不同。

这种 “同一内容,不同答案” 的现象既影响模型的可信度,也暴露出训练过程中视觉与语言表征对齐的根本缺陷。然而,此前缺乏系统性的基准来量化这种跨模态不一致性,更缺乏对其成因的深入分析。已有的多模态评测多关注单一模态下的准确率,或不同数据集上的表现,很少专门考察相同语义在不同模态下的推理稳定性。

作者提出两个新基准 REST 和 REST+(Render-Equivalence Stress Tests),旨在填补这一空白。REST 和 REST+ 严格保证样本在图像、文本、混合三种模态中携带的信息语义等价,从而纯粹地测量模态形式变化对模型输出的影响。论文进一步探究了这种不一致是否仅源于光学字符识别(OCR)错误,还是与更深层的表征差异有关,并尝试从 “模态差距” 的角度给出机理解释。

核心方法和技术细节

REST 与 REST+基准的构建

基准的核心设计理念是 “渲染等价”:将同一个底层语义事实,分别转换成纯图像、纯文本和图文混合三种形态,构成一个三元组。例如,语义内容为 “有 3 个红色的球”,则:

  • 纯图像模态:生成一张包含 3 个红球的图片(无文本说明)。
  • 纯文本模态:仅用文字描述 “这里有 3 个红色的球”。
  • 图文混合模态:图片中呈现球体,同时以文字叠印 “These are red balls. How many balls?”,或者将文字内容直接渲染到图像中。

为了确保三种模态的语义信息量严格相同,作者在生成样本时采取了一系列控制措施。在 REST 中,样本围绕计数、颜色、空间关系等基础视觉推理任务设计。REST+则针对性地更变视觉特征(如文本颜色、分辨率、字体),同时保持语义内容不变,以进一步探究视觉因素对不一致性的影响。

评价指标与一致性分数

对每个三元组,模型需分别对三种模态下的相同问题进行回答。若三个答案全部一致且正确,则记为 “完全一致且正确”;若答案一致但错误,则记为 “一致但错误”;若答案不一致,则属于 “不一致”。论文定义一致性分数(consistency score)为三元组中答案完全一致的样本比例,或者使用更细粒度的条件一致性(例如在 OCR 完全正确的子集上计算)。

此外,作者还测量了模型的模态差距:将文本嵌入与图像嵌入在联合空间中的距离进行统计,得到每个模型的图像-文本表征偏移量,进而计算其与一致性分数的相关性。

模型与评估范围

论文在 15 个先进的 MLLM 上进行了测试,涵盖开源和闭源模型,如 LLaVA 系列、InstructBLIP、Qwen-VL 以及 GPT-4V 等。评估时严格控制解码参数,统一使用相同的提示模板,并排除 OCR 识别错误对统计的干扰(通过人工校验或自动规则筛选 OCR 正确的样本子集)。

创新点和贡献

首次系统定义并量化跨模态不一致性:以往研究多聚焦单模态准确率,而 REST 基准提供了考察相同信息在不同模态下推理稳定性的工具。这种 “渲染等价压力测试” 揭示了 MLLMs 在表征真正对齐方面的短板。

分离 OCR 错误与深层不一致:一个自然的解释是,模型读错了图像中的文字,因此导致文本模态与图像模态的答案不同。然而,论文通过严格控制 OCR 正确率,发现在 OCR 完全正确的情况下,不一致现象依然普遍存在(见论文第 4.2 节)。这意味着问题更深层,源于视觉编码与语言编码之间的鸿沟。

发现模态差距与不一致性的关联:作者测量了若干模型文本嵌入和图像嵌入之间的距离,并计算该距离与模型一致性分数之间的相关性,结果显示两者显著相关(见论文第 4.3 节)。这为跨模态不一致性提供了一个机制性的解释:模态差距越大的模型,越容易在不同模态下给出互相矛盾的答案。该发现为后续改进对齐方法指明了方向。

揭示视觉表层因素的影响:通过 REST+中系统改变文字颜色、分辨率等因素,发现视觉特性(特别是颜色和分辨率)会明显影响模型表现,而字体类型的影响相对较小;同时,视觉 token 数量也与模型性能存在关联(见论文第 4.2 节)。这些结果推进了我们对视觉编码器敏感性的理解。

实验结果分析

不一致性的普遍程度:在 REST 基准上,所有被评测模型都存在显著的跨模态不一致。例如,某些模型在纯图像问题和纯文本问题上准确率分别可达 80% 以上,但在同一语义的三元组中完全一致的比例却不到 50%(具体数值见论文表 2)。即便剔除 OCR 错误样本,一致性依然未达到理想水平。

模态差距的可解释性:计算各模型文本嵌入与图像嵌入的中心距离发现,一致性高的模型倾向于具有更小的模态差距。论文通过散点图和相关分析(见论文图 5),直观展示了这一趋势,统计上达到显著水平。这暗示着训练过程中的模态对齐是否充分,直接决定模型能否在形态变化下保持推理的稳定。

视觉特征的影响:在 REST+的实验中,将文本渲染到图像上时,颜色和分辨率的改变会导致模型准确率波动,即使文本本身可被正确 OCR 识别。例如,浅色文字在浅色背景上会引发更多错误;低分辨率图像也会拉低表现。而改变字体(如衬线与非衬线)则没有明显效果(见论文第 4.2 节)。此外,增加视觉 token 数量(例如提高图像分辨率导致切割 patch 增多)也可能对某些模型产生负面影响,说明视觉前端的不稳定性会传播到推理环节。

这些结果共同表明,当前 MLLM 的跨模态推理远非可靠,即使在看似简单的任务上也经不起模态变换的考验。仅靠提升单模态准确率不足以解决一致性问题,需要从源头缩小模态差距、增强视觉编码的鲁棒性。

局限与待解决问题

REST 和 REST+目前覆盖的任务类型集中于计数、颜色、空间关系等基础视觉推理,对于更复杂的场景理解、逻辑推理或开放域对话中的不一致性尚未评估。是否能够将结论推广到那些场景,仍需进一步的基准构建和研究。

基准本身依赖模板生成,虽然保证了语义的严格控制,但也降低了样本的多样性和自然性。模型在人工精心构造的样本上的不一致行为,是否与真实用户场景中的不一致性模式完全一致,论文没有充分证明。

尽管发现了模态差距与不一致性的关联,但论文并未提出具体方法来降低模态差距或直接提升一致性。诸如如何设计新的训练目标、如何优化视觉编码器与语言模型的连接等关键实践问题,仍需要后续工作解决。

此外,不一致性的成因可能涉及注意力分布、幻觉、偏见等多个因素,论文主要从模态差距和视觉表层特征角度进行了解释,尚未全面解耦这些因素。对于不同模型架构(如早期融合 vs. 晚期融合)的影响也未展开横向比较。

最后,当前评测中模型答案的一致与否是二元判断,但没有区分 “合理的歧义” 与 “真正的语义矛盾”。在某些场景下,不同模态可能天然携带细微信息差异,完全一致的要求是否过于严格,也有待定性讨论。这些问题为未来改进评测框架和模型训练留下了开放空间。