ClinHallu:医学多模态大语言模型推理中分阶段幻觉诊断基准

arXiv: 2606.14697v1

论文信息

标题: ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning

作者: Sicheng Yang, Hangjie Yuan, Wenjun Zhang, et al.

发布日期: 2026-06-12

arXiv ID: 2606.14697v1

PDF 链接: 下载 PDF

论文背景与研究动机

随着多模态大语言模型(MLLMs)在医疗领域的广泛应用,其可靠性问题日益凸显。医疗场景中的视觉问答、报告生成和临床决策支持等任务都对模型的准确性提出了极高要求。然而,现有的 MLLMs 在实际应用中常常出现 “幻觉” 现象——模型可能描述图像中不存在的病灶,将其关联到错误的临床含义,并以高度自信的方式呈现这些看似合理但毫无根据的输出。

这种幻觉问题在高风险的医疗场景中尤为危险,可能误导临床判断并危及下游决策。近年来,医疗幻觉基准测试取得了一定进展,但现有评估方法几乎都聚焦于最终答案的正确性:它们能够识别模型输出了不可靠的答案,却几乎无法揭示错误在推理过程中究竟如何产生。

同一错误答案可能源于完全不同的推理失败路径:模型可能错误识别了视觉证据,可能唤起了错误的医学知识,也可能在整合现有证据和知识时出现了逻辑偏差。当这些性质各异的失败源被压缩为单一的最终答案判断时,现有基准测试就丧失了定位幻觉源头和追踪其传播路径的能力。这正是 ClinHallu(临床幻觉基准)试图解决的痛点。

核心方法:分阶段推理追踪与干预

ClinHallu 的设计理念是通过结构化的推理追踪实现来源级别的幻觉诊断。该基准包含 7,031 个经过验证的医学视觉问答实例,每个实例都被扩展为包含三个明确阶段的结构化推理链:视觉识别(Visual Recognition)知识回忆(Knowledge Recall)和推理整合(Reasoning Integration)

视觉识别阶段负责从医学图像中提取关键视觉证据,知识回忆阶段激活相关的医学专业知识,推理整合阶段则基于前两个阶段的信息推导出最终答案。以论文中的示例而言,当面对一张脑部影像时,模型首先观察到图像包含明亮液体区域,随后回忆起 “在 T2 加权 MRI 中液体呈明亮信号而 T1 加权 MRI 中呈暗信号” 这一医学知识,最后将观察结果与知识规则关联,推断出 “这是一张 T2 加权 MRI 图像”。

这种分解使得每个推理环节的可靠性都能被独立评估。ClinHallu 的数据来源涵盖四个具有代表性的医学 VQA 数据集:VQA-RAD、PathVQA、MedFrameQA 和 MedXpertQA,覆盖了放射学、病理学及多图临床推理等多个领域。

阶段替换干预机制

ClinHallu 最具创新性的设计在于其阶段替换干预策略。评估过程中,模型首先生成自己的推理链和答案。随后,研究者系统性地将生成链中的特定阶段替换为经过验证的参考阶段,并让模型基于混合信息继续完成剩余推理。

具体而言,系统支持三种替换模式:仅替换视觉识别阶段、仅替换知识回忆阶段、同时替换视觉和知识两个阶段。通过比较替换前后的答案准确率变化,研究者可以量化每个阶段对最终错误的影响程度。例如,如果替换视觉阶段后准确率大幅提升,说明视觉识别是主要瓶颈;如果替换知识阶段带来的增益更大,则表明知识回忆是更关键的问题来源。

这种干预式评估还引入了 “修复率” 和 “破坏率” 两个精细指标。修复率衡量替换将原本错误的答案纠正为正确的比例,破坏率则衡量替换导致原本正确的答案变错的比例。这两个指标共同揭示了不同阶段在推理链中的因果重要性。

创新点与技术贡献

ClinHallu 的突出贡献体现在三个层面。首先,它突破了传统基准测试仅关注最终答案的局限,实现了对推理过程的结构化分解和逐段诊断。论文通过全面的对比分析表明,在现有医疗幻觉基准中,ClinHallu 是唯一同时支持结构化思维链标注、分阶段追踪、幻觉来源定位和幻觉率评估的基准。

其次,阶段替换干预的设计巧妙地解耦了推理链中的依赖关系。通过控制上游阶段的输入质量,研究者能够精确测量每个阶段对最终决策的独立贡献,这在方法论上为该领域提供了新的评估范式。

第三,ClinHallu 不仅用于评估,还展示了诊断信息如何转化为改进信号。论文通过追踪监督微调实验证明,将完整的结构化推理链作为训练目标,能够在提升答案准确率的同时显著降低各阶段的幻觉率。这一发现验证了推理过程的显式建模对于构建可信医疗 MLLM 的重要性。

实验结果与关键发现

论文在 11 个代表性模型上进行了全面评估,包括闭源的 Qwen3-VL 系列和 Gemini-3-Flash,以及开源的 Qwen2.5-VL、InternVL3.5、MedGemma 等多个变体。实验结果揭示了几个重要规律。

视觉幻觉普遍严重但数据依赖性明显。 在 VQA-RAD 数据集上,视觉阶段的平均幻觉率高达 42.9%,远超知识幻觉率 13.7%,表明该任务主要受限于视觉识别能力。相反,在 MedXpertQA 上,知识幻觉率飙升至 43.1%,而视觉幻觉率相对温和。PathVQA 和 MedFrameQA 则呈现出更平衡的视觉-知识错误分布。这种规律在准确率变化诊断中也得到验证:VQA-RAD 的视觉替换带来 15.5% 的准确率提升,而 MedXpertQA 的知识替换带来 33.4% 的提升。

推理整合阶段并非主要瓶颈。 在绝大多数模型和数据集上,推理整合阶段的幻觉率明显低于视觉和知识阶段。同时替换视觉和知识阶段通常能带来最大的准确率增益。这表明当前医疗 MLLM 的可靠性问题主要源于上游的视觉理解和知识召回环节,而非最终的推理过程本身。

追踪监督微调能有效缓解幻觉。 在 Qwen3.5-9B 上的微调实验显示,相比仅使用最终答案作为监督信号,使用完整推理链进行监督能够在提高答案准确率的同时,将视觉幻觉率降低近 10 个百分点,知识幻觉率降低 2 个百分点。值得注意的是,仅监督视觉阶段可以特异性降低视觉幻觉但不一定改善知识质量,而组合监督则表现出更稳定的整体提升。

这些发现具有重要的实践指导意义:医疗 MLLM 的开发应优先提升医学图像理解能力和专业知识嵌入质量,而非仅仅优化推理逻辑。

实践应用建议与未来方向

基于 ClinHallu 的实验洞察,医疗 MLLM 的可靠性改进应分阶段针对性推进。对于以视觉识别为瓶颈的任务场景(如放射学图像判读),应加强视觉编码器的医学适应训练,引入更精准的医学图像标注数据。对于知识密集型场景(如专家级医学问答),则应重点优化模型内部的医学知识图谱,确保关键临床事实的准确召回。

ClinHallu 提供的追踪监督微调范式可直接应用于实际模型训练。开发者可先在自己的应用数据集上构建参考推理链,再通过完整追踪监督或针对性阶段监督来降低特定类型的幻觉。这种方法特别适合部署在临床辅助决策系统中,因为这类系统对错误可追溯性有明确要求。

当前版本的 ClinHallu 聚焦于医学视觉问答任务,尚未覆盖长篇报告生成或真实临床决策支持等更复杂场景。论文作者明确指出的这一局限性也指明了扩展方向。未来工作可将分阶段追踪框架迁移到报告生成中,例如分别评估模型在 “所见描述”、“病理关联”、“诊断建议” 等阶段的表现。这也为评估医疗 MLLM 在端到端工作流中的安全性提供了理论基础。

另一个值得探索的方向是将阶段替换干预发展为在线诊断工具。在模型实际部署中,可通过缓存经过专家验证的视觉描述和医学知识片段,实时检测模型的推理偏差并触发纠正机制。这种 “人在回路” 的混合智能模式可能成为过渡期最务实的临床部署策略。

总结与展望

ClinHallu 通过将推理过程分解为视觉识别、知识回忆和推理整合三个可独立评估的阶段,为医疗 MLLM 的幻觉诊断提供了一个精细化的测试平台。它超越了传统基准 “是否出错” 的二元判断,转而追问 “在哪个环节出错以及如何传播”。实验揭示的模态依赖性瓶颈和追踪监督的有效性,既加深了我们对医疗 MLLM 失败模式的理解,也为构建更可信的医学多模态系统提供了可操作的改进路径。

随着医疗 AI 逐步走向临床落地,对模型内部推理进行精细剖析的能力将变得愈发重要。ClinHallu 代表了从 “信任答案” 到 “理解推理” 的范式转变。当模型能够被诊断出在哪个思维步骤出了偏差时,我们距离真正可信的医疗人工智能也就更近了一步。