面向多模态临床诊断的排序感知提示词优化

Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis

arXiv: 2609.40361v1

论文信息

标题: Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis

作者: Tian Xia, Minghao Liu, Yiqing Liang, et al.

发布日期: 2026-09-30

arXiv ID: 2609.40361v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:多模态临床诊断模型通常用准确率(accuracy)来训练和优化提示,但临床数据类别极度不平衡,高准确率可能完全无法区分患者;论文要解决如何让提示搜索直接优化与类别不平衡无关的 AUROC 排序指标。
  • 核心方法:提出 Ranking-PE,把反思式帕累托提示进化中的得分矩阵从 “单实例对错” 事件改为 “正负样本对排序” 事件,并用排序形状反馈和对 AUROC 的最终选择,使整个搜索流程对齐 AUROC,而不增加额外模型调用或代理损失。
  • 关键结果:在 MIMIC 三种疾病上,Ranking-PE 比 Accuracy-PE 的平均 AUROC 在 Qwen3-VL-8B+SFT(VE-tuned)上提高 5.8 个百分点,在 MedGemma-4B 上提高 16.2 个百分点(表 1)。
  • 主要局限:方法只针对二分类 AUROC;多标签、有序标签扩展未测试;实验仅覆盖 MIMIC-IV 三类胸部 X 线疾病和两个开源多模态模型族,测试集负样本代表性有限。
  • 适合读者:从事医学多模态 LLM、提示词自动优化、类别不平衡下排序指标优化,或关注临床 AI 评估标准的研究者与工程师。

背景与动机

多模态大模型(MLLM)越来越多地被用于同时读取医学影像和结构化电子健康记录(EHR)来做临床诊断。很多主流医学 MLLM 适配管线仍然围绕准确率展开。论文指出,在真实临床数据中类别不平衡非常普遍:一个把所有样本都预测为多数类的 “常量多数分类器” 可能得到 90% 以上的准确率,却完全无法区分阳性与阴性病例。同时,临床筛查、分诊和确诊往往在部署阶段才选择 ROC 曲线上的具体工作点,因此 AUROC 这类与阈值无关的排序指标比固定阈值准确率更符合实际需求。

现有的反射式提示优化系统,如 GEPA、DSPy、APO 等,把每个候选提示在每个实例上的正确性写入得分矩阵;列平均就是准确率,Pareto 筛选和最终选择都受准确率驱动。论文认为,这会把类别不平衡下的错误信号带入提示搜索,甚至可能损害底层模型的排序能力。作者的核心观察是:帕累托提示进化并不天然优化准确率,而是优化 “得分矩阵行定义的那个二值事件”。因此,只要改变行事件,就能改变搜索目标。

核心方法:把行事件从 “对错” 换成 “排序”

论文给出的排序分数来自模型在 Yes/No 标签位置的对数概率差:

sΦ(x)=log⁡pΦ(Yes∣x)−log⁡pΦ(No∣x)s_\Phi(x)=\log p_\Phi(\mathrm{Yes}\mid x)-\log p_\Phi(\mathrm{No}\mid x)

这个 sΦ(x)s_\Phi(x) 是后续所有组件读取的核心量。对二分类任务,经验 AUROC 可以由 Wilcoxon–Mann–Whitney 恒等式写为所有正负样本对排序得分的平均:

AUROC(Φ)=1∣P∣∣N∣∑(i,j)∈P×Nr ⁣(sΦ(xi+),sΦ(xj−))\mathrm{AUROC}(\Phi)=\frac{1}{|P||N|}\sum_{(i,j)\in P\times N}r\!\left(s_\Phi(x_i^+),s_\Phi(x_j^-)\right)

其中 r(a,b)=1[a>b]+121[a=b]r(a,b)=\mathbf{1}[a>b]+\tfrac12\mathbf{1}[a=b]。Ranking-PE 的做法,就是把原本以实例为行的得分矩阵 Mn,kM_{n,k} 替换为以 (x+,x−)(x^+,x^-) 对为行的矩阵 M~(i,j),k=r(sΦk(xi+),sΦk(xj−))\tilde{M}_{(i,j),k}=r(s_{\Phi_k}(x_i^+),s_{\Phi_k}(x_j^-))。这样,每一列的平均值就等于该候选提示的验证 AUROC,Pareto 支配也基于排序事件而不是实例正确性。由于不需要梯度,论文强调这一指标不是 RankNet、LambdaRank 等经典排序学习中用来做梯度优化的平滑代理,而是直接取未松弛的经验排序目标(见第 4.2.1 节)。

这个替换不会增加推理成本:对每个候选提示,只需标准验证通过中已有的逐实例分数 sΦ(x)s_\Phi(x),再做 CPU 表查询即可构造对级矩阵;当真值对数量超过上限时,用均匀抽样子集估计 AUROC,在论文实验中对不同 pair cap 表现稳定(附录表 4)。

除了得分矩阵,论文还强调必须对齐另外两层:最终选择用 AUROC 列平均 argmax;反射器反馈也不再只给一个对错位,而是加入三个排序相关信号——临床错误类型(FN 被标注为 “clinically dangerous”)、置信度幅度、以及与参考验证分数分布相比的跨实例排序背景(ρ+,τ−\rho^+,\tau^-)。消融显示,只改最终选择而不改矩阵和反馈,平均测试 AUROC 反而从 Accuracy-PE 的 68.0% 降到 61.3%;加上 pair-level Pareto 后升到 70.7%;再加上 ranking feedback 后才达到 73.8%(表 3)。

创新点与贡献

论文的主要贡献可以归纳为三点。

其一,识别出反射式提示搜索中得分矩阵的 “行模式” 是隐藏的优化单元。传统方法默认用实例正确性,因此列平均就是准确率;本文提出把行模式从实例正确性替换为正负样本对排序事件,在无代理损失、无额外 rollout 的条件下,把搜索目标直接抬升为经验 AUROC。这是对原有 GEPA 类框架的较低成本但目标明确的重定向。

其二,提出了一个覆盖三层的共对齐方案:最终选择、Pareto 支配、反射器反馈都围绕同一排序目标。单纯改最终选择不够(表 3),因为上游候选生成和父代选择仍然被准确率塑造;对级矩阵改变搜索中的支配结构;排序形状反馈让反射器学会产生面向排序的提示修改建议。

其三,给出了一套完整的多模态临床提示进化配方:先进行 SFT,尤其是调优视觉编码器;再叠加 Ranking-PE。实验显示,医学视觉基础是后续提示搜索的前提。Qwen3-VL-8B 无 SFT 直接 Ranking-PE 平均 AUROC 为 68.4%,VE-frozen SFT 后为 70.3%,VE-tuned SFT 后为 73.8%(表 2)。在规模匹配的 Gemma3-4B 上,Ranking-PE 平均 AUROC 为 51.6%,而医学预训练 MedGemma-4B 为 69.7%,差 18.1 个百分点(表 2)。这表明视觉域适应或医学预训练是提示搜索无法替代的基础。

实验结果分析

在 MIMIC-IV 的 Atelectasis、Cardiomegaly、Consolidation 三个疾病上,Ranking-PE 在主要开源模型上都表现出与 Accuracy-PE 的明显差距(表 1)。值得注意的是,在 MedGemma-4B 上,Accuracy-PE 平均 AUROC 只有 53.5%,低于其基础模型的 59.3%,说明在该实验设置下,准确率导向的提示进化反而破坏了排序信号;Ranking-PE 则将其提升到 69.7%。在 Atelectasis 任务上,由于正类占比极高,Accuracy-PE 的验证准确率几乎没有区分度,AUROC 停留在 63.6%,而 Ranking-PE 达到 70.7%,Balanced Accuracy 从 45.4% 提升到 70.9%(表 1)。

组件消融中,只把最终选择从准确率改为 AUROC 并未带来增益,甚至降低了性能(表 3);pair-level Pareto 是搜索方向发生改变的关键;ranking feedback 进一步提升了 Balanced Accuracy。这支持论文的判断:搜索目标需要贯穿候选生成、支配筛选和最终选择,而不能只改最后一层。

反射器替换实验中,用 GPT-5-nano 或 GPT-5-mini 替换任务适配的自反射器后,Qwen3-VL-8B+SFT 的平均 AUROC 从 73.8% 降至 66.7% 或 67.9%(附录表 8)。论文作者没有在正文中将其解释为普遍规律,但该结果显示,在该实验设置下,通用反射器未必能替代已经适配医学任务的模型自反射。

实践建议

如果你正在构建医学多模态诊断或多分类 NLP 任务的提示优化管线,以下几点可能有助于落地:

首先,在类别不平衡的临床分类任务中,不要只报告和优化准确率。至少在验证阶段增加 AUROC 或 AUPRC 作为模型选择和提示搜索的目标。论文结果表明,准确率导向的提示搜索可能让候选提示在多数类上 “刷分” 而破坏排序能力。

其次,如果模型可输出 Yes/No 标签的对数概率,可以直接用 log-odds 作为连续排序分数,无需额外推理。对于没有 top-k logprobs 的闭源模型,论文实验只能退化到三级口头分数,这种比较会受限。

第三,若你的提示优化系统已有得分矩阵和 Pareto 搜索机制,可以考虑将行事件从 “实例是否正确” 改写为 “正样本分数是否高于负样本”。这通常只需要缓存逐实例分数,再做表查询,不增加模型调用。但要注意,单纯改最终选择不够;搜索过程中的支配结构和反射器反馈也要同步对齐。

第四,视觉域适应是前提。不要期望仅靠提示搜索弥补医学图像理解不足。论文中,Qwen3-VL-8B 在冻结视觉编码器的 SFT 后叠加 Ranking-PE 的平均 AUROC 为 70.3%,调优视觉编码器后为 73.8%;医学预训练 MedGemma-4B 相对同规模通用模型也有 18.1 个百分点优势(表 2)。因此,在资源允许时,应优先投入视觉编码器适配或选择医学预训练骨干。

最后,部署前仍需在固定阈值下检验实际工作点。论文在报告 AUROC 的同时也报告 Balanced Accuracy,用来确认排序增益在默认解码阈值下仍然转化为分类性能。实际系统中,阈值应结合临床成本比和验证集校准来设定,而不是只依赖 AUROC。