VBVR-Pro:一个可扩展且可验证的原生视觉推理套件
VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
论文信息
标题: VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
作者: Junxiang Xu, Ruisi Wang, Fanyi Pu, et al.
发布日期: 2026-08-26
arXiv ID: 2608.26105v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:原生视觉推理(native visual reasoning)把图像/视频生成本身当作推理载体,但此前缺乏可扩展的训练任务、可靠反馈以及不同生成模态的受控比较。论文希望把这套范式变得可训练、可验证、可优化、可实验控制。
- 核心方法:构建 VBVR-Pro,一个包含 300 个程序化生成任务、100 个任务的可验证奖励评分器、以及统一训练/评测协议的多模态视觉推理闭环测试平台;并在此基础上做监督微调与多任务强化学习。
- 关键结果:用 VBVR-Pro 训练的最强视频生成模型 VBVR-Pro-Wan2.2-I2V-A14B 在 7 个外部视觉推理基准上相对其基座模型普遍获得提升,其中 V-ReasonBench 从 10.21 提升到 38.22,MME-CoF-Pro 从 24.76 提升到 48.39(表 7)。
- 主要局限:即使最强训练模型仍明显低于人类水平(第 4.1.2 节);强化学习实验只在 50 个域内任务上训练,对外域任务的提升相对有限(表 8)。
- 适合读者:研究多模态生成、视觉推理、可验证奖励、生成模型强化学习的工程师与研究者,以及需要搭建自动化视觉任务评测系统的团队。
论文背景和研究动机
大语言模型的成功让语言成为机器推理研究的主流载体,但许多物理世界中的智能形式——空间变换、时间连续性、物体持久性、动态交互——并不天然是语言性的。论文由此引入 “原生视觉推理” 的概念:模型通过构造、更新和优化图像或视频等视觉状态来解题,视觉状态本身是一等公民,而不只是语言推理器的输入或最终渲染输出。
然而,这一方向面临三个瓶颈。第一,现有视觉推理基准大多只面向评测,几乎不提供训练数据;少数大规模合成数据源又偏重简化符号设置,不确定能否教出可迁移的视觉推理能力。第二,主流的 VLM-as-a-judge 评测范式在需要精确计数、细粒度空间关系、时序一致性和规则满足的任务上不可靠,而且成本高、复现性差。第三,图像生成、交错文本-图像生成和视频生成这三种范式很少在统一任务分布和验证协议下被系统比较。
VBVR-Pro 的目标就是补上这些基础设施:让任务可以程序化生成、输出可以确定性地评分、模型可以用奖励信号优化、模态选择可以在受控条件下研究。
核心方法和技术细节
任务空间与数据生成
VBVR-Pro-Dataset 包含 300 个任务,按五个认知能力组织:感知(perception)、空间性(spatiality)、变换(transformation)、抽象(abstraction)和知识(knowledge)。其中 150 个任务改写自 VBVR,另有 150 个是新设计的、更难的场景,如数独和五子棋等需要多步搜索的任务。论文报告,新任务中约 47% 需要多步推理,而旧任务中这一比例只有 7%(第 2.3 节)。
每个任务由一个带随机参数的程序生成器实例化,例如网格尺寸、物体数量、布局、外观和难度等级。任务专用求解器同时计算正确答案,因此标注是完全程序化、可追溯的。生成时还会记录随机种子、问题规格、完整解和关键元素属性,这些 metadata 后来直接支撑可验证评分器。
一个关键设计是多模态对齐:同一个底层问题会被同时渲染成视频和图像模态。图像模态并非简单从视频抽帧,而是根据任务需求采用三种输出形式:Last-Frame 只展示最终状态;Key-Frame 展示解题过程中的关键中间状态,例如迷宫路径;Multi-Frame 均匀采样中间状态,用于评估过程有效性或时序连续性(图 3)。这样视频、图像和交错文本-图像生成器可以在相同任务条件下进行对比。
数据划分方面,300 个任务中 50 个被留作外域(OOD)评测,其余 250 个任务每个采样 5000 个实例,得到 125 万训练实例。VBVR-Pro-Bench 包含 100 个任务,其中 50 个外域任务和 50 个域内任务,共 500 个评测实例。另有一个覆盖 50 个域内任务的 5 万实例强化学习子集。
可验证奖励评分器
论文为 VBVR-Pro-Bench 的全部 100 个任务实现了任务专用评分器。评分器尽量不依赖逐像素比较,而是先定位感兴趣对象,再用 HSV 颜色分割、轮廓检测、OCR、轨迹跟踪等经典视觉方法提取颜色、形状、位置、数量等语义属性,最后依据人工设计的任务特定检查规则汇总为分数。硬约束任务使用乘法聚合,使单一违规显著拉低总分;软标准任务使用加权求和(图 5)。
与 VLM judge 的对比研究揭示了三类典型失败模式:细粒度感知不精确、忽略决定性错误、误解任务规则(图 4)。在实例级人类偏好评测中,论文评分器的一致性超过 0.60,优于 GPT-5.5 的 0.54 和 Gemini-3.1-Pro 的 0.52,同时是成本最低的评测器;人类一致性上限约为 0.77(图 6 左)。在可复现性方面,论文评分器重复评分结果完全一致,而多个 VLM judge 在温度 0 下仍有 54.6% 到 92.8% 的样本改变分数(表 2)。
强化学习流程
论文把可验证评分器用作强化学习奖励,提出一个端到端多任务 RL 基线。基础策略是 VBVR-Pro-Wan2.2-TI2V-5B。普通 Flow-SDE 采样在提高随机性时会破坏视觉质量,因此 RL 使用 Coefficients-Preserving Sampling(CPS),其更新公式为
预测噪声和新采样噪声的系数平方和为 1,因此增大 不会额外放大噪声总系数,从而在探索不同语义决策的同时保持画面完整(图 10)。实验还采用单步延迟的异步流水线,让奖励计算与 GPU 上的 rollout 生成和策略优化重叠。论文报告,在 128 张 H800 上,RLVR 训练 2200 步约需 5.1 天,而 RLVLM 约需 8.3 天,吞吐量提高 1.63 倍。
创新点和贡献
这项工作的主要贡献是把原生视觉推理从零散任务集合变成可训练、可验证、可优化的研究系统。其创新点可以概括为四个层面。
一是 300 个程序生成任务的可扩展课程。相比 VBVR 的 150 个任务,VBVR-Pro 在视觉复杂度和推理深度上都有扩展。论文报告,新任务的中位连通颜色区域数为 80,而旧任务为 12(第 2.3 节)。
二是任务级可验证评分器。它不是仅在模型排名上验证评分器,而是在实例级人类偏好上验证,并证明其可以同时作为 RL 奖励信号。这是把 “可验证奖励” 从评测工具升级为优化基础设施的关键一步。
三是跨模态受控比较。论文在统一任务分布下训练了图像、交错文本-图像和视频生成器,指出视频生成在需要持续时空状态跟踪的任务上最强,交错生成通过显式外化中间视觉状态提供了计算效率更高的替代方案,而单图像生成在变换类任务上最弱。
四是诊断性证据链。论文不仅报告成绩,还通过反事实扰动、中间状态干预、Chain-of-Step 可视化和最近邻检索来区分真实视觉推理与指令模板拟合。尤其值得注意的是,移除中间图像使整体分从 0.638 骤降到 0.099,而移除或矛盾化中间文本只带来中等下降(表 6),作者据此认为视觉轨迹比显式语言思维链在推理中更关键。
实验结果分析
主基准
在 30 多个模型的大规模评测中(表 4),多数学术开源模型远弱于顶级专有模型。用 VBVR-Pro-Dataset 微调 9 个开源模型后,平均总分提升 0.290,其中域内任务平均提升 0.401,外域任务平均提升 0.179。最强视频模型 VBVR-Pro-Wan2.2-I2V-A14B 总分 0.670,最强交错模型 VBVR-Pro-SenseNova-U1 为 0.638。论文明确指出,即使最强训练模型仍低于人类水平,说明还有很大空间。
模态消融
对交错模型,论文比较了三种训练设置:完整文本加多图、完整文本加单图、占位符文本加多图。对 SenseNova-U1,完整设置总分 0.638,压缩视觉轨迹到单图后降至 0.527,而把文本替换为无语义占位符后为 0.629,下降远小于前者。对 ThinkMorph 也呈现相似模式(表 5)。作者推测,对迷宫导航、物体平移旋转等空间任务,中间视觉状态让状态变换直接可见,因此提供了比中间文本更贴近问题本质的表示。
外部迁移
VBVR-Pro-Wan2.2-I2V-A14B 在 7 个外部基准上的变化如下:RISE-Video 从 62.83 到 66.18,V-ReasonBench 从 10.21 到 38.22,RULER-Bench 从 57.89 到 66.96,MME-CoF-Pro 从 24.76 到 48.39,VideoThinkBench mini 从 25.71 到 52.86,BabyVision-Gen 从 0.36 到 12.50,IntelligentVBench 从 3.93/5 到 4.11/5(表 7)。最近邻检索显示,这些迁移案例与训练样本在视觉和文本嵌入上并不高度相似(图 9),说明提升更接近可迁移的视觉操作,而不是对训练样本的直接记忆。
强化学习效果
在相同 CPS 推理配置下,RLVR 总分 0.548,优于 SFT 的 0.503 和 RLVLM 的 0.508;外域部分 RLVR 为 0.377,也高于 SFT 的 0.328 和 RLVLM 的 0.345(表 8)。训练曲线显示 RLVR 稳定上升,而 RLVLM 很快停滞并在约 400 到 500 步时出现短暂下降(图 11)。案例研究表明,RLVR 在截断的扩散步数内表现出更晚的自校正和更连贯的迷宫空间规划(图 12、图 13)。
实践建议
如果要复现或借鉴这类可验证视觉推理系统,可以从以下几个方面入手。
先建立程序化任务和 metadata,而不是只收集题目。 VBVR-Pro 的经验是,每个任务实例的随机种子、完整解和关键元素属性都要记录下来。没有这些 metadata,后续的确定性评分和 RL 奖励都难以实现。建议团队从少量、可精确判定的任务开始,先保证 solver 正确,再扩大任务数量。
对精确计数、空间关系、规则满足类任务,避免用 VLM-as-a-judge 作为唯一反馈。 论文在图 4 和表 2 中给出了具体失败证据:VLM judge 在细粒度感知和规则理解上会出错,且在温度 0 下仍会改变分数。更务实的做法是用经典视觉方法提取语义属性,再做任务特定检查。这样既能获得稳定分数,也能把评分成本降到接近 CPU 级别。
在多任务视觉生成 RL 中,采样随机性需要特别设计。 普通扩散采样的高随机性会破坏画面,但低随机性又会让 rollout 陷入同质决策,导致组相对奖励缺乏区分度。论文采用的 CPS 采样在保持噪声系数约束的前提下提高语义决策多样性。若你的视觉推理任务也涉及迷宫方向、连接对象、选择答案等离散决策,可以优先考虑这类探索方法。
按任务性质选择生成模态和推理开销。 在论文的受控比较下,视频生成适合需要持续时空状态跟踪的任务,交错文本-图像生成在域内任务上效率更高。若落地场景更看重成本,可以考虑交错生成把中间视觉状态外化;若任务涉及精细旋转、运动或连续状态,应优先测试视频生成而非单图输出。