视觉语言模型能从交互中学习直觉物理吗?
Can vision language models learn intuitive physics from interaction?
论文信息
标题: Can vision language models learn intuitive physics from interaction?
作者: Luca M. Schulze Buschoff, Konstantinos Voudouris, Can Demircan, et al.
发布日期: 2026-02-05
arXiv ID: 2602.06033v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:视觉语言模型(VLM)能否通过与环境的交互学会可泛化的物理直觉?与监督微调相比,基于在线强化学习的交互训练能否带来更好的内部知识迁移?
- 核心方法:以搭积木的稳定性任务为测试平台,构建了四种交互式和非交互式训练场景。使用 GRPO(Group-Relative Policy Optimization)实现在线强化学习的交互训练,并与离线式的监督微调(SFT)进行对比,评估模型在分布内和分布外任务上的性能。
- 关键结果:交互训练并未带来显著的泛化优势。无论是 GRPO 训练的模型还是 SFT 训练的模型,在训练任务上都能接近满分,但都未能可靠泛化到相关任务——哪怕新任务与训练任务共享视觉特征和物理原理(见论文第 4.2 节,图 2)。
- 主要局限:实验仅覆盖了 7B–32B 参数规模的模型、少量数据以及单步交互;多步交互或更大规模数据下交互学习的优势可能尚未显现。此外,GRPO 只是在线 RL 的一种实现,不同算法或更复杂的环境或许会得出不同结论。
- 适合读者:从事视觉语言模型、认知科学、强化学习的机器学习研究者;对 “具身学习” 和 “物理常识” 感兴趣的研究人员;希望了解当前大模型直觉物理能力极限的从业者。
论文背景和研究动机
人类在婴幼儿时期就能通过与物体的互动建立起对物理世界稳定、可泛化的直觉(Piaget, 1952; Baillargeon et al., 1995)。这种能力通常被称为直觉物理(intuitive physics),是高级认知能力的基础。然而,当前最强大的视觉语言模型(VLM)在面对简单的物理场景——例如判断积木塔的稳定性、预测物体的运动轨迹——时依然会频繁犯错,甚至不如人类幼儿(Schulze Buschoff et al., 2025a)。
一个重要的线索来自认知科学:儿童通过主动探索、试错和与环境的动态交互,逐步建构起对物理世界的深层理解;而被动的观察和符号化抽象则难以达到同样的鲁棒性和泛化能力(Gopnik et al., 1999; Smith & Gasser, 2005)。这促使研究者提出假说:如果让 VLM 像儿童一样在交互中学习物理任务,它能否形成可泛化的直觉?
目前,监督微调(SFT)能让 VLM 在特定物理任务上逼近满分,但往往会学到非通适的捷径(shortcuts),换一个哪怕只是更换数据分布的同族任务就失效(Schulze Buschoff et al., 2025b)。近期有工作指出,缺乏主动交互可能是生成模型无法理解深层物理定律的关键限制(Motamed et al., 2025)。受此启发,本文首次系统探究了通过在线强化学习实现的环境交互是否能够赋予 VLM 跨任务泛化的物理直觉,并将其与作为离线 RL 类似物的 SFT 进行对比。
核心方法和技术细节
环境与任务设计
研究构建了两个核心的积木场景数据集(均使用 ThreeDWorld 物理引擎渲染,256×256 RGB 图像,相机角度与方块尺寸固定):
- top block:塔堆上方的方块左右偏移放置(图 7);
- side block:一个方块偏离塔堆,单独落在地面上(图 8)。
基于这些数据,设计了四种任务(图 1):
- binary stability:判断给定塔堆是否稳定(二分类);
- x-only:返回一个整数,控制顶层或侧边方块沿 x 轴移动到稳定位置(回报函数为高斯函数,见第 3.4 节);
- x-y:返回两个整数,同时控制方块在 x 轴和 y 轴上的移动,以搭建更高的稳定塔。
训练范式对比
所有实验均基于 Qwen3-VL-8B 模型,使用 QLoRA 进行参数高效微调(r=α=16)。两种训练范式严格对齐超参数:
- 在线 RL(交互条件):使用 GRPO(Group-Relative Policy Optimization)算法。模型根据提示和图像生成动作序列,按特定回报函数获得奖励(例如合法但错误答案得 0,合法且正确答案得 1,非法回答得 −1 或 −5),基于组内相对优势更新策略。每次训练使用 个生成样本估计优势。
- 监督微调(非交互条件):直接使用标准交叉熵损失拟合专家动作序列,训练样本来自预先标定的最优答案。
评估指标
除了训练任务上的奖励/准确率外,更关键的是泛化性测试:对所有模型评估在四个任务上的跨任务表现,并使用真实的积木图片(Lerer et al., 2016)检验从合成数据到自然图像的迁移能力。此外,通过对中间层激活训练线性探针,探测模型是否内部编码了任务所需的关键物理量(塔稳定性和方块偏移量),以区分 “能力” 与 “表现”。
创新点和贡献
-
首次直接对比交互式与非交互式学习对 VLM 直觉物理能力的影响:将在认知科学中具有重要理论地位的 “通过交互学习” 概念工程化地引入到大规模 VLM 的后训练流程中,这在此前的工作中尚未被探索。
-
揭示了当前在线 RL 训练在物理认知泛化方面的局限性:实验证明,GRPO 使模型在训练任务上收敛至极高回报,但并不能像生物体那样从有限互动中抽取出可迁移的物理规则。即使任务共享相同的底层变量(如 x 偏移量),模型也几乎零样本泛化失败,这对 “交互即灵药” 的乐观假说提出了重要反证。
-
系统的消融与激活分析:论文不仅报告了行为层面的结果,还通过线性探测发现,无论是基座模型还是后训练模型,关键物理量(稳定性、偏移量)的信息早已在激活中可解码,但模型无法在行为上表达这些能力。这表明模型学到的是任务特定的输出捷径,而非真正可调用的物理直觉。
-
多模型、多算法验证:作者不仅测试了 Qwen3-VL-8B,还重复实验于 Qwen2.5-VL-7B 和 Qwen3-VL-32B,并进一步引入 GSPO(序列级优化)作为另一种 RL 实现,以确保结论的稳健性。结果一致指向:在线 RL 带来的泛化增益远低于预期。
实验结果分析
训练任务内表现
无论是 GRPO 还是 SFT,模型在四个训练任务上均能达到接近天花板的表现。以 GRPO 为例:binary stability 准确率达 0.969;x-only top block 平均奖励 19.999(满分 20);x-only side block 平均奖励 19.998;x-y 任务平均奖励 17.313(SFT 为 19.858,因 SFT 可直接模仿正确答案,论文第 4.1 节)。这表明在充分学习的情况下,交互训练本身并未带来直接的性能优势,而 SFT 同样高效。
泛化能力:跨任务、跨数据集
泛化测试的结果是最引人注目的部分(图 2)。在相同数据分布、不同任务上,模型表现出极有限的迁移:例如从 x-only top block 到 binary stability top block,GRPO 模型的准确率仅 0.624,远低于经过同类任务 SFT 后的 0.969。更致命的是,跨数据分布的任务(如从 top block 的 x-only 迁移到 side block 的 x-only)几乎完全不泛化,奖励值甚至可能为负。这说明模型并未学到 “方块偏移—移动整数” 之间的通用映射,而是记住了特定分布下的输出模式。
在真实图像泛化实验中(第 4.3 节),即便是直接在 synthetic binary stability 任务上训练的模型,面对真实积木图片的准确率也只有 0.6,明显低于人类平均水平(~0.9 以上)。这一结果与近期 VLM 物理直觉研究高度吻合。
激活中的幽灵能力
线性探针分析(图 11)揭示了一个 “能力-表现” 脱节的现象:无论是基座模型还是后训练模型,在任意中间层都能近乎完美地解码出塔的稳定性和方块偏移量。然而,基座模型在行为任务中的表现却远低于解码水平。后训练虽然提升了行为表现,却未能教会模型将内部编码的信息灵活迁移到新任务上——这再次指向非泛化捷径的学习模式。
消融与扩展
作者通过延长训练步数(超过 10000 步)导致过拟合(图 17),以及使用更小秩、不允许微调视觉编码器等实验(图 18),排除了超参数设置不当的可能。此外,在多任务顺序训练中,GRPO 模型相对于 SFT 展现出一定抗遗忘能力(第 4.5.1 节),但依然没有促成跨任务泛化。
实践建议
基于本论文的发现和当前技术边界,若读者尝试在实际系统中让 VLM 学习物理交互任务,以下几点可供参考:
-
不要高估单步 RL 的魔力:仅通过回报函数的一次性反馈来训练模型生成正确动作,可能只会使模型学会针对当前奖励分布的 “输出偏好”,而非底层物理约束。如果目标是构建能灵活适应变化的物理推理引擎,应考虑设计多步交互、带有连续状态转移的环境,使模型必须连续预测和修正才能获得高回报。
-
将物理知识显式注入奖励结构或辅助任务:论文表明,即使模型内部已编码了稳定性等属性,行为上也无法调用。一种可能的工程突破是使用多任务训练:在 RL 奖励之外加入辅助的解码损失(例如直接预测方块偏移量或稳定性标签),强迫模型将内部表征与所需输出对齐。
-
混合训练策略:虽然 GRPO 未展现泛化优势,但它在多任务顺序训练中比 SFT 更不易遗忘(见附录 A.9.4)。若业务场景要求模型不断适应新增的物理任务,可采用 RL+SFT 混合 或 GRPO 顺序训练,用 SFT 稳定基础格式,再用 RL 微调特定子任务,同时保留对旧任务的记忆。
-
谨慎对待模拟到真实的迁移:合成图像训练出的物理判断能力在真实图像上严重退化,提示在机器人或自动驾驶等对物理常识要求极高的应用中,务必在训练早期引入真实世界的多样性数据,避免对渲染器特定视觉特征的过度依赖。
-
监测模型是否习得捷径:定期进行线性探针分析或分布外测试,确保模型的行为提升并不仅仅源于某种表层统计模式(如图像中部某条水平像素线)。若解码能力远高于行为表现,表明模型仍有大量能力未被调动,需调整训练目标。
总体而言,本文以严谨的实验告诉我们:让 VLM 像人类一样通过交互 “玩会” 物理,远比想象中困难。开发真正具备物理直觉的模型,可能需要超越现有的参数高效微调范式,在预训练阶段就嵌入具身交互或世界模型,这将是未来研究的重要方向。