OpenVLThinkerV2: 一种面向多领域视觉任务的通用多模态推理模型
OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks
论文信息
标题: OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks
作者: Wenbo Hu, Xin Chen, Yan Gao-Tian, et al.
发布日期: 2026-04-09
arXiv ID: 2604.08539v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:在多任务多模态大模型的强化学习微调中,不同视觉任务的奖励尺度差异极大,导致训练不稳定,且感知能力与多步推理能力难以平衡。本文要解决这两个核心挑战。
- 核心方法:提出 Gaussian GRPO(G²RPO),用一维最优传输将每个任务的奖励分布强制映射为标准正态分布,取代线性归一化;并引入任务级响应长度塑造与熵塑造,动态约束生成长度和探索范围。
- 关键结果:在 18 个多模态基准上,OpenVLThinkerV2(基于 Qwen3-VL-8B)取得了开源模型中的最优成绩,在 MMMU 上达到 71.6%,在 MathVista 上达到 79.5%,显著超过 GPT-4o(见论文表 1)。
- 主要局限:长度和熵塑造的超参数(如最小长度、目标熵区间)依赖经验设定,尚未进行系统搜索;当前实验仅在 8B 规模的模型上进行,更大规模的扩展留待未来工作(见论文第 2.3 节讨论部分及结论)。
- 适合读者:从事多模态大模型训练、强化学习与语言模型对齐、计算机视觉与自然语言处理交叉领域的研究者和工程师。
论文背景和研究动机
近年来,强化学习(RL)已经成为提升多模态大语言模型(MLLMs)性能的主流手段,尤其以 DeepSeek-R1 等工作中采用的 Group Relative Policy Optimization(GRPO)为代表。GRPO 通过在同一问题下采样一组回答,利用组内标准化(减均值除以标准差)来构造优势函数,有效避免了单独价值网络的不稳定。然而,将 GRPO 直接应用于多任务多视觉场景时,出现了两个严峻挑战。
首先是奖励拓扑的极端差异。不同视觉任务的奖励分布天差地别:数学视觉问答(VQA)可能只有二元的 0/1 信号,而视觉定位任务则采用连续的 IoU 分数,其方差和分布形状完全不同。GRPO 的样本级标准差归一化会偏爱低方差样本,导致任务内(intra-task)更新不平衡;即使引入任务级移动平均方差(如 EMA-GRPO),仍依赖线性缩放,无法切除重尾离群值对梯度信号的持续污染,也无法保证跨任务梯度公平性。
其次是精细感知与多步推理能力的冲突。在 RL 微调中,模型容易陷入两种极端:在需要强视觉定位的任务上输出过短、缺乏必要推理的答案;在复杂推理任务上又可能生成冗长、自相矛盾甚至幻觉性的思维链。已有方法通过扰动视觉输入或插入显式视觉锚点来增强感知,但这些方法需要昂贵的数据标注或额外模块,难以大规模推广。
因此,作者提出从优势函数归一化和训练动态调控两个层面彻底解决上述问题,打造一个稳健的通才多模态推理模型。
核心方法和技术细节
Gaussian GRPO(G²RPO):非线性分布匹配取代线性归一化
传统 GRPO 对一组奖励 计算的优势为:
这种线性变换只匹配均值和方差,保留了原始分布的形状,无法抑制重尾或双峰分布造成的异常。EMA-GRPO 虽然跨任务追踪历史方差,但移动平均会引入动量滞后,且仍旧是线性缩放。
G²RPO 从根本上放弃了标量标准化,转而将该任务的奖励经验分布直接映射到标准正态分布 ,通过一维最优传输实现。具体步骤为:
- 对任务 内的 个奖励排序,计算基于秩的均匀概率 。
- 利用标准正态分布的逆累积分布函数(分位数函数),将 映射为 。
- 若存在相同奖励值,则对相应分位数取平均,以保证相同表现获得相同学习信号(见算法 1)。
这样得到的优势 天然满足零均值、单位方差,并且无论原始奖励是双峰的(如二元奖励)还是存在极端离群值,都会被强制扭曲为对称的高斯尾。论文指出,该映射理论上保证了所有任务的优势分布完全一致,从而实现了任务间梯度公平(见第 2.2 节讨论部分及图 2)。
任务级长度与熵塑造
为了平衡感知与推理,作者分析了训练过程中响应长度和熵损失的演化趋势。他们观察到:推理密集型任务的长度先降后升,最终倾向于更长思维链;视觉中心任务则持续缩短输出,直接给出精练答案。基于此,他们为每个任务类别设置了梯形奖励函数 ,当生成 token 数处于预设的最佳区间 内时给予满分,低于 或超过 则得分为 0,中间线性过渡。这相当于一个软约束,鼓励模型对复杂问题展开推理链,同时对定位类任务抑制不必要的内容(见公式 9 和图 3)。
针对熵,他们观察到推理任务容易 “熵爆炸”——模型胡乱探索低概率 token;视觉任务则容易 “熵坍缩”——过度依赖高概率 token 而放弃有效探索。为此引入熵正则损失:
即当任务平均熵超出 时线性惩罚,从而将模型探索活动锁定在合理区间(见公式 10)。这些塑造机制的超参数根据任务类型粗略设置,但作者声明即使粗粒度的趋势引导也已带来显著增益(见第 2.3 节讨论)。
OpenVLThinkerV2 模型训练
模型基于 Qwen3-VL-Instruct-8B 初始化,使用 OneThinker-600k 数据集的过滤子集,在 AWS Trainium 上训练一个 epoch。优化采用 AdamW,批大小 128,学习率 2e-6,最大生成长度 4096 token。遵循 DAPO 等工作,关闭 KL 正则并动态过滤全对或全错的 rollout,仅保留有效梯度信号(见第 3.1 节)。
创新点和贡献
- G²RPO 算法:首次将一维最优传输用于多模态多任务 RL 的优势归一化,强制所有任务的优势分布完全一致,从根本上消除了任务间梯度不公平和重尾离群值干扰,且无需额外动量超参数。
- 任务级双重塑造机制:通过响应长度和熵的显式约束,引导模型在各类视觉任务上自动收敛至最佳行为模式,显著提升感知与推理的平衡能力。
- 全面系统验证:在 18 个基准上的大量实验证明,该方法不仅超越了同规模开源模型,甚至在许多任务上超过 GPT-4o、Gemini 2.5 Pro 等专有前端模型(见论文表 1、表 2、表 3)。
实验结果分析
视觉推理任务
论文在通用 VQA、数学 VQA、图表 VQA 等 9 个基准上对比了 OpenVLThinkerV2 与多个强基线模型(表 1)。在相同数据和计算资源下,G²RPO 训练的模型均优于标准 GRPO 和 GDPO 变体。例如,MMMU 得分从基线 60.2 提升到 71.6,超越 GPT-4o 的 70.7;MathVista 达到 79.5,显著超过 GPT-4o 的 63.8;ChartQA 上 OpenVLThinkerV2 达到 87.4,甚至优于 Gemini 2.5 Pro 的 83.3(见论文表 1)。这些结果直接体现了 G²RPO 在平衡多样化奖励分布上的优势。
文档理解与空间推理
在 DocVQA、OCRBench、InfoVQA 三个文档理解基准上,OpenVLThinkerV2 分别达到 96.7、911、86.4,全部超越 GPT-5 和 Gemini 2.5 Pro,甚至在 OCRBench 上超过了采用动态缩放工具的专业模型 DeepEyesV2(882 分,见论文表 2a)。在 EmbSpatial 等空间推理基准上,该模型也稳定超过通用前端模型和大部分任务专家模型(表 2b),表明强感知与强推理可以兼得。
视觉定位任务
RefCOCO/RefCOCO+/RefCOCOg 上的准确率分别达到 93.4%/88.2%/90.4%,超过此前的最佳开源模型 OneThinker-8B 和专门的定位模型 Grounding DINO(表 3)。值得注意的是,视觉定位需要以精确坐标格式输出,极易受熵坍缩或格式漂移影响,而 OpenVLThinkerV2 不仅没有退化反而大幅提升,说明长度和熵塑造有效保护了结构化输出能力。
消融实验
逐组件消融(表 4)显示,仅加入 G²RPO 就使各任务域平均得分大幅提升;再单独添加任务级熵损失或长度奖励均有额外增益;二者结合时性能最佳,验证了两种塑造机制的互补性。同时,奖励曲线(附录图 5-8)表明 G²RPO 训练过程更稳定,准确率、长度、格式和结构奖励均一致收敛,无早期波动或后期退化现象。
实践建议
对于需要在多模态多任务场景下进行 RL 微调的团队,这篇工作提供了可立即落地的技术路径:
- 用分位数归一化替代线性标准化:如果任务奖励跨度极大或存在明显离群值,可以尝试实现 G²RPO 式的基于秩的分布匹配。算法仅涉及排序和 erf 反函数,计算开销极小,且无需维护移动统计量,实现难度低。
- 引入任务级长度目标:根据任务特性设定合理的生成长度上下界,通过奖励塑形(如梯形函数)引导模型行为,能有效抑制幻觉并提升定位精度。即使只设定粗粒度的分类区间(如 “短答案” 与 “长推理”),也能带来明显收益。
- 显式监控和约束熵:在训练过程中实时监控各类任务的熵值,若发现推理任务熵持续飙升或感知任务熵骤降,可加入边际熵惩罚,防止模型进入危险的状态空间。阈值的设定可以依据验证集熵分布的百分位数或历史均值确定。
- 注意超参数的经验性:论文中的长度和熵阈值仅基于简单观察设定,没有进行自动搜索。在实际应用中,建议先运行少量步数观测长度和熵的动态,再参照论文的 “趋势导向” 思想设置区间;若需进一步优化,可采用少量网格搜索或贝叶斯优化微调。
- 适用任务扩展:尽管本文聚焦视觉任务,但 G²RPO 的跨任务公平性同样适用于 SWE 编码、GUI 操作等奖励分布各异的领域。作者已指出该方法天然适合这些场景,不妨作为尝试方向。
通过上述实践,可以大幅度提升多任务多模态模型的 RL 训练稳定性和最终表现,同时降低对大量额外标注或复杂模块的依赖。