ClinHallu:诊断医学多模态大语言模型推理中分阶段幻觉的基准

ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning

arXiv: 2606.14697v1

论文信息

标题: ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning

作者: Sicheng Yang, Hangjie Yuan, Wenjun Zhang, et al.

发布日期: 2026-06-12

arXiv ID: 2606.14697v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:医疗多模态大模型(MLLM)会产生幻觉(答非所问、无中生有),但现有基准测试只能判断最终答案是否正确,无法定位幻觉在推理过程的哪个阶段产生。
  • 核心方法:提出 ClinHallu 基准,将每个医疗问答样本的推理过程分解为 “视觉识别→知识回忆→推理整合” 三个阶段,并通过阶段替换干预来诊断幻觉源头。
  • 关键结果:在 7031 个验证样本上测试 11 个主流模型发现,视觉幻觉普遍严重(平均率超 40%),但不同数据集的瓶颈不同——VQA-RAD 是视觉瓶颈,MedXpertQA 是知识瓶颈(见论文表 2、表 4)。
  • 主要局限:当前基准只覆盖医疗 VQA 任务,不包含长篇报告生成或真实临床决策支持场景(见论文第 7 节)。
  • 适合读者:从事医疗 AI、多模态大模型评估、模型可信度研究的工程师和研究人员;关注 AI 临床落地安全性的产品经理也可从中获得评估框架启发。

论文背景和研究动机

多模态大模型在医疗场景的应用日益广泛,从医学视觉问答(VQA)、影像报告生成到临床决策支持,都展现出巨大潜力。然而,这些模型在实际使用中常产生 “幻觉”——例如描述图像中根本不存在的病灶,将其关联到错误的临床结论,却用高度自信的口吻呈现。在高风险的医疗场景下,这类输出可能误导临床判断,带来严重后果。

现有的医疗幻觉基准测试(如 Med-HALT、CARES、Med-HallMark 等)主要集中在数据收集和最终输出评估上:它们判断模型答案是否正确,并据此判定是否发生幻觉。这种 “以答案为中心” 的评估方式存在一个关键盲区——它无法揭示同一个错误答案可能由完全不同的推理失败导致。如图 1 所示,正确答案应该是 “脂肪”,但模型可能因视觉误识别、错误知识回忆或推理整合缺陷而输出 “脓肿”。将这些不同来源的失败混为一谈,使得现有基准测试难以诊断幻觉的真正起源。

ClinHallu 的提出正是为了解决这一局限。论文作者指出,幻觉源头在样本间各不相同:有的源于对医学图像的视觉误读,有的源于错误激活的医学知识,还有的源于未能正确整合视觉证据与医学知识。为此,需要一种能从源头层面诊断幻觉的方法。

核心方法和技术细节

ClinHallu 的核心设计包含三个关键组件:结构化推理轨迹构建、阶段替换干预和阶段级幻觉率评估。

数据集构建。ClinHallu 从四个代表性医疗 VQA 数据集(VQA-RAD、PathVQA、MedFrameQA、MedXpertQA)中整合样本,覆盖不同医学领域、成像模态和任务类型。每个样本被增广为一个结构化的参考推理轨迹 τi=(vi,ki,ri)\tau_i = (v_i, k_i, r_i),分别对应视觉识别(Visual Recognition)、知识回忆(Knowledge Recall)和推理整合(Reasoning Integration)三个阶段。例如,针对一张脑部 MRI 图像,轨迹首先观察到图像中含有亮信号液体,然后回忆 “液体在 T2 加权 MRI 中为亮信号,在 T1 加权 MRI 中为暗信号” 的医学知识,最后将观察与规则结合,得出 “T2 加权 MRI” 的答案。

为确保参考轨迹的可靠性,论文使用 LLM-as-judge 方法对生成的轨迹进行双重过滤:检查格式有效性(三阶段是否完整且非空)和答案一致性(轨迹是否支持正确答案且不引入矛盾结论)。只有同时通过两项检查的样本才被保留,最终获得 7031 个验证实例(见论文公式 4-6)。

阶段替换干预。这是 ClinHallu 最具特色的评估设计。传统评估中,模型生成的视觉识别、知识回忆和推理整合是耦合在一起的,无法判断哪一阶段是主要瓶颈。ClinHallu 通过阶段替换来解决这个问题:将模型生成的某一阶段替换为参考标准版本,然后要求模型继续完成后续推理。具体而言(见论文公式 9-11):

  • Rep-V(替换视觉阶段):提供标准视觉识别,模型生成剩余的知识和推理
  • Rep-K(替换知识阶段):保留模型自己的视觉识别,提供标准知识回忆
  • Rep-VK(同时替换前两阶段):提供标准的视觉识别和知识回忆,模型只进行推理整合

通过观察替换前后答案准确率的变化,可以量化每个阶段对最终答案的贡献。例如,如果替换视觉阶段后准确率大幅提升,说明视觉识别是主要瓶颈。

阶段级幻觉率评估。在控制上游阶段为标准版本的前提下,ClinHallu 计算每个阶段的幻觉率 HVH^V、HKH^K、HRH^R(见论文公式 12-13)。这种设计确保每个阶段的评估不受上游错误的影响。

创新点和贡献

ClinHallu 在医疗 MLLM 幻觉评估领域做出三项贡献。

首次实现源头级幻觉诊断。与现有基准测试仅判断 “是否出现幻觉” 不同,ClinHallu 通过结构化推理轨迹将幻觉定位到具体阶段。表 1 的对比显示,ClinHallu 是唯一同时支持结构化思维链标注、阶段级轨迹、幻觉源头定位和幻觉率评估的基准。

提出阶段替换干预框架。这种干预方法不仅测量各阶段的幻觉率,还能量化修正特定阶段对最终答案的改善程度(ΔAccs\Delta_{Acc}^s),为理解幻觉传播路径提供了因果层面的分析工具(见论文公式 14)。

展示轨迹监督微调的有效性。论文在 Qwen3.5-9B 上进行了轨迹监督微调实验(见论文表 5)。使用完整三阶段轨迹(V+K+R)进行监督后,在 VQA-RAD 上准确率从 80.4% 提升至 83.7%,视觉幻觉率从 32.3% 降至 22.6%,知识幻觉率从 6.2% 降至 4.2%。这表明 ClinHallu 不仅是一个评估工具,其标注的轨迹还可以直接用作训练监督信号。

实验结果分析

论文在 11 个模型(3 个闭源、8 个开源)上进行了系统评估,得到几个重要发现。

发现一:数据集间的幻觉瓶颈差异显著(见论文表 2、表 4)。VQA-RAD 上视觉幻觉率平均高达 42.9%,修正视觉阶段带来 15.5% 的准确率提升,远超修正知识阶段(4.6%),说明它是视觉主导的任务。而 MedXpertQA 呈现相反模式,修正知识阶段带来 33.4% 的增益,远超修正视觉阶段(13.8%),说明它更依赖专业知识。PathVQA 和 MedFrameQA 则介于两者之间,视觉和知识修正的增益相对均衡。

发现二:修正效果可通过 “修复率” 和 “破坏率” 进一步解析(见论文图 4)。修复率衡量替换前错误、替换后正确的样本比例,破坏率衡量替换前正确、替换后错误的样本比例。在 VQA-RAD 上,Rep-V 修复了 73% 的原错误答案,Rep-K 仅修复 29%;而在 MedXpertQA 上,Rep-K 修复率达 64%,Rep-V 仅 42%,同时 Rep-K 破坏率更低(10% vs 22%),进一步印证了数据集间的瓶颈差异。

发现三:推理能力并非主要瓶颈(见论文表 2)。多数模型的推理阶段幻觉率明显低于视觉和知识阶段。同时 Rep-VK(替换前两阶段)通常带来最大的准确率增益,说明可靠性失败主要源于上游的视觉理解和知识召回,而非最终的推理步骤。

人类评估验证。论文对 10% 的样本进行了双重人工标注,自动评分器与人类判断的准确率达 94.0%(Cohen's κ=0.872),与人类间一致性(96.2%,κ=0.919)接近(见论文表 6),支持了自动化评估的可靠性。

实践建议

ClinHallu 为开发和评估医疗 MLLM 的团队提供了可操作的见解。

诊断优先于打分。在评估模型时,不要只看最终准确率。建议在评估流程中引入类似 ClinHallu 的阶段级诊断,区分视觉错误、知识错误和推理错误。对于视觉瓶颈明显的任务(如放射学图像问答),应优先改进视觉编码器或增加视觉-文本对齐训练;对于知识瓶颈明显的任务(如需要专业分型鉴别的问答),应强化领域知识的注入和激活。

利用轨迹数据微调。ClinHallu 的实验表明,使用完整的三阶段推理轨迹进行监督微调,比仅用答案微调更能全面降低各阶段幻觉率。在实际工程中,可以为目标医疗 VQA 数据集构建类似的推理轨迹(可使用强模型生成后经人工或自动审核),将这些轨迹作为训练信号加入模型微调流程。

注意任务特化。由于不同医疗子任务的幻觉瓶颈差异显著(VQA-RAD 偏重视觉,MedXpertQA 偏重知识),通用的幻觉缓解策略可能不够有效。建议针对具体应用场景的特性,定制化地分配优化资源——例如在病理图像分析工具中加强视觉识别的专项训练,在临床知识问答工具中加强知识库的覆盖和检索质量。

避免过度解读基准改进。ClinHallu 的修复率分析提供了一个重要警示:阶段替换虽然能提升整体准确率,但也可能 “破坏” 原本正确的答案(图 4)。在进行模型优化时,应同时监控修复率和破坏率,确保优化行为不会牺牲已建立的正确推理路径。