通过感知扰动与奖励建模缓解多模态 LLM 评判中的感知判断偏差

Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling

arXiv: 2606.02578v1

论文信息

标题: Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling

作者: Seojeong Park, Jiho Choi, Junyong Kang, et al.

发布日期: 2026-06-01

arXiv ID: 2606.02578v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:多模态大语言模型(MLLM)作为自动化评估器时存在 “感知判断偏差”,即模型会因文本的流畅性而奖励那些视觉事实错误但语言逻辑合理的回答,导致评估与人类判断不一致。
  • 核心方法:提出感知扰动判断数据集(PPJD),通过对正确回答进行最小化视觉属性扰动,构造出仅包含感知错误和同时包含感知与推理错误的负样本;再设计基于批量排序的验证性奖励函数,利用群组相对策略优化(GRPO)训练 MLLM 评估器。
  • 关键结果:训练得到的 Perception-Judge 在多项评估基准上显著降低感知偏差。在批量排序一致性上较 Qwen3-VL-4B-Thinking 提升 11%,在单分数评分准确度上较 Flex-Judge-VL-7B 提升 15%(见论文第 4.2 节及表 2)。
  • 主要局限:当前模型在极细粒度视觉属性识别与复杂多步推理任务上仍会出错;训练依赖商业模型生成监督信号;计算开销高于基于 DPO 的方法(见论文附录 A)。
  • 适合读者:从事多模态大模型评估、强化学习对齐(RLHF/GRPO)、视觉‑语言数据构造或自动化评测工具开发的工程师与研究者。

论文背景和研究动机

随着 MLLM 在视觉问答、指令跟随等任务中的广泛应用,评估响应质量正成为瓶颈。传统的人类评估成本高昂且不易扩展,由此催生了 “LLM‑as‑a‑Judge” 范式,即利用语言模型自动打分或比较。但将此范式迁移到多模态领域后,现有 MLLM 评估器常表现出一种系统性缺陷:当图像证据与文本线索冲突时,评估器倾向于奖励叙述上合理但视觉上错误的答案。作者把这一现象形式化为感知判断偏差(Perceptual Judgment Bias),并进一步分解为两种失效模式:(a)评估器自身视觉感知能力不足,未能正确理解图像;(b)评估器虽然能单独正确感知图像,但在评估时却放弃自己的视觉认知,转而 “锚定” 在候选回答所描述的视觉内容上(表 1 及图 1)。

通过受控的视觉扰动实验,作者证实基线评估器在仅存在感知不一致时性能大幅下滑,而对同时包含推理错误的复合作答却能保持高判别力(图 2)。这说明当前评估器并非真正进行视觉验证,而是依赖 “推理是否流畅” 这一捷径。因此,亟需一种强制将视觉感知作为评估前置条件的新框架,这正是本文的核心动机。

核心方法和技术细节

整个方法围绕三个环节展开:构造感知扰动数据集(PPJD)、设计验证性奖励函数、基于 GRPO 进行策略优化。

1. 感知扰动数据集 (PPJD)

从 MMPR 偏好数据集中筛选出绝对正确的回答 rcr_c,保留其作为 “选择” 样本。随后利用生成模型(如 GPT)提取图像中与问题相关的感知属性(如物体颜色、计数、空间关系),并对 rcr_c 进行最小化扰动:仅修改这些属性,而保持推理逻辑和语言风格不变,得到仅有感知错误但推理合理的负样本 rrpr_{r_p}。进一步,在含有感知错误的基础上再引入推理错误,生成既错视觉又错逻辑的完全破坏样本 rrp+rr_{r_{p+r}}。最终每个实例形成四元组 (xi,rc,rrp,rrp+r)(x_i, r_c, r_{r_p}, r_{r_{p+r}}),其中 xix_i 为(图像,指令)对。PPJD 共包含 3K 个高质量四元组,覆盖通用 VQA、科学、数学、OCR 等六个类别(见附录 D.1)。这种构造使得 “感知错误” 与 “推理错误” 清晰解耦,为可验证的排序学习提供了坚实基础。

2. 验证性批量排序奖励

训练要求评估器为三个回答输出一个排序,目标顺序为 rc≻rrp≻rrp+rr_c \succ r_{r_p} \succ r_{r_{p+r}}。为了在没有逐对标签的情况下强制全局排序一致性,奖励以预测排列与目标排列的归一化莱文斯坦距离为基础:

RBatch(oi)=1−dLev(π^i,πi⋆)∥πi⋆∥\mathcal{R}_{\text{Batch}}(o_i) = 1 - \frac{d_{\text{Lev}}(\hat{\pi}_i, \pi_i^\star)}{\|\pi_i^\star\|}

据此得到分档式奖励:完全正确顺序奖励 1,部分正确奖励 2/3 或 1/3,完全颠倒奖励 0。此外,格式奖励确保输出符合结构要求,总奖励为两者乘积。这种设计不依赖显式的分数标签,却能驱动模型内化感知优先的评价逻辑。

3. GRPO 优化

采用群组相对策略优化(GRPO)进行训练。对每一批数据,模型生成 nn 条候选评估意见,通过组内标准化计算相对优势 A^i\hat{\mathcal{A}}_i,结合裁剪的代理目标和 KL 正则化项更新策略。GRPO 无需独立的价值网络,特别适合这种奖励稀疏但可验证的场景。

创新点和贡献

  1. 首次系统定义并量化感知判断偏差:将 MLLM 评估器的错误归因为两类模式,并通过受控实验展示纯感知错误是最难被识别的(表 1、图 2)。
  2. 提出 PPJD 数据集:通过最小化视觉扰动构造反事实负样本,实现感知与推理的显式解耦,为感知对齐训练提供了低成本、可扩展的监督来源。
  3. 开发感知奖励建模框架:将全局排序一致性直接作为奖励,利用 GRPO 进行稳定优化,无需逐对偏好标签即可获得校准后的评估器。
  4. 实证验证数据效率与通用性:仅用 3K 训练样本,在评分、成对比较、批量排序三种协议下,Perception‑Judge 均显著超过基线,甚至能达到或接近商业模型水平(表 2)。在更大规模的 backbone 上(32B、8B)也保持增益(附录 F.1)。

实验结果分析

主结果(表 2):Perception‑Judge‑Flex‑7B 在 14 个多模态数据集上的平均得分相关性为 0.466,超过 Flex‑Judge‑VL‑7B 的 0.404 和 Qwen2.5‑VL‑7B 的 0.165;成对比较准确率(不含平局)达到 0.645,优于 Flex‑Judge‑VL‑7B(0.623);批量排序归一化编辑距离降至 0.505,较 Qwen3‑VL‑4B‑Thinking(0.498,实际为 0.498,Perception‑Judge‑Qwen3‑4B 为 0.444)有改善。尤其值得注意的是,Perception‑Judge‑Qwen3‑4B 在成对准确率(不含平局)上达到 0.691,超越同时展示的大部分开源模型。

消融实验(表 3):以 Flex‑Judge‑VL‑7B 为基底,对比了 MMPR‑v1.2 与 PPJD 的数据集效果,以及成对奖励与批量排序奖励的效果。结果表明,PPJD 数据集带来的提升一致,而批量排序奖励在得分和成对指标上甚至优于显式成对监督,说明全局排序信号足以诱导局部偏好和分数校准。

偏差缓解验证:图 2 显示,Perception‑Judge‑Flex‑7B 在纯感知扰动下的正确判别率较基线显著提升,证明模型真正学会了 “先看图像,再做判断”。

这些实验共同说明,感知扰动数据与批量排序奖励结合,能有效矫正评估器对语言流畅性的过度依赖,提升多模态评估的可信度。

实践建议

基于论文方法,对于希望构建可靠多模态评估系统的工程师或研究者,以下建议值得参考:

  1. 构建感知扰动反事实样本:可借鉴 PPJD 的思路,从已有偏好数据中筛选绝对正确的回答,然后通过轻量级视觉属性修改(颜色、计数、方位等)生成仅含感知错误的负样本。这比单纯使用 “好/坏” 文本对更能迫使模型关注视觉细节。
  2. 采用批量排序奖励替代逐对比较:若需训练打分或排序模型,可直接对完整排序结果赋予梯度奖励,利用莱文斯坦距离等全域度量。这种奖励形式不仅易于自动验证,还能有效提升全局排序一致性,减少对人工逐对标注的依赖。
  3. 结合 GRPO 进行稳定训练:GRPO 天然适合奖励信号稀疏但组内可比较的场景,避免了价值网络训练的不稳定。实际部署时,建议每组采样 5 个响应(如论文设置),并适当调节 KL 惩罚系数(本文在 Flex‑Judge‑7B 上最优为 0.01,见附录 H.2)。
  4. 混合感知与推理错误的渐进训练:同时提供仅感知错误和感知+推理双重错误的样本,强制模型从严重错误中区分出孤立的感知问题,从而校准其感知权重。
  5. 评估即调优:可以在模型对齐流程中,将训练好的 Perception‑Judge 作为奖励模型,为其他 MLLM 的响应提供细粒度的视觉‑推理反馈,实现端到端的感知感知对齐。

Perception‑Judge 的训练代码与数据集已开源(项目页 https://perception-judge.github.io),上述策略具备良好的可复现性,适合在内部评测管道或模型对齐工作中落地。