想象力感知词元增强多模态语言模型的空间推理
Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models
论文信息
标题: Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models
作者: Mahtab Bigverdi, Lindsey Li, Weikai Huang, et al.
发布日期: 2026-06-02
arXiv ID: 2606.03988v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:多模态语言模型在需要 “想象” 未观测视角或整合碎片化空间信息的任务上表现很差,现有方法只优化可见结构,不预测缺失的空间布局。论文要解决如何让模型像人类一样,通过中间视觉想象来增强空间推理。
- 核心方法:提出想象力感知令牌(IPT),训练统一多模态模型 BAGEL 生成表示未观测空间结构的中间图像(例如新视角、鸟瞰图),再基于该图像回答问题。围绕此设计了三项任务:视角变换、路径追踪、多视角计数,并为每项任务构建了配对的中间想象真值数据集。
- 关键结果:仅用 AI2-THOR 合成数据微调,IPT 训练在多视角计数上比纯答案监督提升 3.4%(63.9%→67.3%),在路径追踪上与 GPT-5 性能持平(61.1% vs. 61.1%,answer-only 模式)。更值得注意的是,即使推理时不生成中间图像,IPT 训练带来的空间推理能力依然保留,且明显优于文本思维链。
- 主要局限:模型生成的想象图像质量有限,尤其在路径追踪任务中,不准确的生成图像反而会误导后续推理(表 4)。IPT 是任务特定的(透视生成不同视角,计数生成鸟瞰图),无法直接迁移到新任务。跨场景泛化的能力也受分辨率影响,存在轻微过拟合。
- 适合读者:从事多模态模型、空间推理、视觉语言模型研究,或关注中间表示训练(如思维链的可视化版本)的 AI 研究人员与工程师,尤其是正在探索如何让模型 “在脑海中进行场景变换” 的团队。
论文背景和研究动机
视觉语言模型(VLM)在对象识别、属性描述上进步显著,但一到空间推理就频繁 “翻车”。比如,给定一张房间照片,问 “走到标记位置左转后,椅子在你左边还是右边?”,多数模型只能胡猜。这些问题的共同难点在于:答案无法直接从输入图像中读出,必须先在脑海中构造一个从未见过的空间结构——人类会自然地进行此类想象,但模型缺乏这种机制。
已有工作试图引入中间视觉表示来辅助推理,例如生成深度图、边界框、甚至思维草图。但这些方法本质上是对可见信息的重组织或提炼,并不预测缺失的三维结构。而真正棘手的空间问题,恰恰来自 “看不见” 的部分。
论文作者指出,人类解决这类问题依靠的是 “想象性感知”(imaginative perception)——当被问到移动到新位置后会看到什么,我们会不自觉地在脑内模拟那个视角的场景。以此为灵感,他们提出想象力感知令牌(Imaginative Perception Tokens, IPT),将未观测视角或整合后的空间地图作为训练目标,强制模型在生成答案前先 “画出” 想象画面。
为系统研究这一能力,他们专门设计了三项需要想象力的任务:视角变换(PET)、路径追踪(PT)、多视角计数(MVC),并为每个任务构建了约 2 万例的合成+真实数据集,每条数据都配有中间想象图像的真值。这使得中间想象不再是模糊的修辞,而成为可监督、可评估的计算基元。
核心方法和技术细节
论文的方法核心可以概括为:把 “想象图像” 作为语言模型输出的一部分,并对它施加监督。
想象力的形式化
给定观测图像 和空间查询 ,模型首先预测想象图像 :
然后以该想象图像为条件,预测答案 :
这里的想象图像不是任意生成,而是必须与观测场景一致:它代表如果站在另一个位置、或从上方俯瞰、或把多个视角合并之后,你会看到什么。
统一多模态架构 BAGEL
选择 BAGEL 作为骨干,是因为它是一个原生支持 “理解+生成” 的统一模型,内部使用混合专家 transformer(MoT),理解专家和生成专家共享自注意力层。图像被编码为两种令牌:用于理解的 SigLIP ViT 令牌(),和用于生成的 FLUX VAE 令牌()。所有令牌处于同一序列,让想象与推理无缝交互。
训练与损失
训练时,模型需联合生成想象图像和答案,损失函数为流匹配损失和语言建模损失的加权和。
- 流匹配损失 :让模型学习从噪声到目标 VAE 隐变量的速度场,生成想象图像。
- 语言建模损失 :基于观测上下文和真实想象令牌,最大化答案令牌的负对数似然。
也就是说,训练阶段使用 oracle 想象图像,让模型学会 “如果我能准确想象出这个视角,答案应该是什么”;同时,也通过流匹配让模型学会自己生成这个想象图像。
推理时有两种模式:一是 “想象模式”,先迭代去噪生成想象图像并重新编码回上下文,再作答;二是 “纯答案模式”,直接输出文本答案,不生成任何图像。论文发现,即使在纯答案模式下,经 IPT 训练的模型也能表现出更强的空间推理能力,表明想象任务的训练本身已经内化了空间表征。
三项任务的数据构建
- 视角变换(PET):输入一张带有目标点标记的房间照片,问移动并旋转后某物体的远近或左右。想象目标为新视角渲染图。
- 路径追踪(PT):输入俯视图和可能有的端点视图,问行走至路径中点时侧面可见的物体。想象目标为中点处的第一人称侧视图。
- 多视角计数(MVC):输入 4 张分散视角的场景图片,问某类物体的总数。想象目标为该区域的鸟瞰图,能直接去重计数。
每项任务的数据都经过严格清洗和人工验证,总计约 2 万条/任务,覆盖 AI2-THOR 合成环境、Habitat 真实扫描以及 Matterport 等真实图像,确保多样性。
创新点和贡献
本文的创新并不仅停留在 “又一种中间视觉表示”,而是重新定义了中间表示的角色:
-
从 “优化可见结构” 到 “预测缺失结构”:之前的深度图、视觉思维等方法只是在精细化已经看到的内容,而 IPT 明确指向那些根本不可见的空间配置。这一原则性的区分,使得想象不再是一种花哨的附加物,而是解决空间推理难题的必要条件。
-
将想象力作为可监督信号:通过模拟器为每个训练样本配上想象真值(新视角渲染、鸟瞰图),让模型有了明确的 “该想象什么” 的指引,这与纯粹依赖强化学习或间接反馈的方法形成对比。
-
揭示想象训练的内部化效应:实验发现,即使推理时完全抛弃图像生成,IPT 训练也能显著超过纯答案微调和文本思维链。这说明想象监督的主要价值不在于生成漂亮图片,而在于重塑模型内部的空间表征能力。
-
指出语言模态在空间推理中的结构性劣势:文本思维链在多项任务上非但没有提升,反而大幅降低性能,例如在 PET 上降至 83.1%(纯答案 97.5%),PT 上降至 49.7%(纯答案 65.7%)。这清晰暴露出用自然语言去序列化视角变换、遮挡关系等几何运算时,会产生严重的模态不匹配(表 2)。
实验结果分析
主表格(表 2)
在 AI2-THOR 的域内评估中,经 IPT 训练的 BAGEL 在 PET 上达到 96.8%,接近完美;在 MVC 上 67.3%,为最佳。更令人印象深刻的是跨域表现:在真实环境的 Habitat 基准上,IPT 在 PET 上达到 87.0%(混训后 87.7%),远超所有零样本超大模型。在路径追踪真实图片测试中,IPT 混训后也取得 58.6%,优于多数闭源模型。
值得注意的是,表 2 中报告的是 answer-only 模式下的结果(论文注明为最大准确率),这意味着模型完全不使用生成图像就取得了这些成绩,想象力训练已内化。
消融实验的关键发现
- 潜空间分辨率至关重要(表 3):分辨率从 提升至 时,PET 准确率从 87.4% 涨至 96.8%,MVC 从 53.5% 涨至 63.1%。不过,过高分辨率在 Habitat 上略有回落(83.3%),说明可能对 AI2-THOR 外观过拟合。
- 生成的想象图像质量仍是瓶颈(表 4):在路径追踪上,使用模型自己生成的想象图像推理时准确率仅 50.4%,而若提供真实想象图像,准确率飙升至 86.7%,说明想象质量直接制约推理上限。这种巨大差距在 PET 上几乎不存在(96.8% vs 96.7%),暗示不同任务对图像精度的敏感度差异很大。
- 混合训练进一步提升(表 2,表 5):将一部分训练数据改为纯答案监督(无想象目标),可以在保留想象能力的同时减少强制生成带来的负面影响,其跨域泛化效果通常最优。
外部基准迁移(表 5,6)
用 AI2-THOR 的 MVC 数据微调(纯答案模式)后,在其他空间任务(如 ScanNet 计数、MindCube 几何推理、All-Angles 跨视角匹配)上一致提升 7-12 个百分点,表明该合成数据蕴含的空间表征是通用的,而不只是任务特化。
实践建议
对于希望在自己的模型中引入想象力感知的团队,本文提供了可借鉴的工程路径:
-
优先选用统一多模态架构。BAGEL 等模型让理解和生成在同一序列中自然融合,是 IPT 训练的基础。若使用分离式的 “理解模型+外部图像生成器”,则难以通过这种内部想象损失进行端到端训练。
-
为任务设计可监督的想象目标。利用仿真器(如 AI2-THOR、Habitat)或已有的多视角数据集,为每条训练样本生成中间想象真值(可以是 RGB 图像,也可以是深度图或鸟瞰图)。哪怕只使用一部分合成数据,也能显著提升推理能力。
-
从 Latent-16()起步,逐步提高分辨率。较高分辨率带来更好的空间细节,但会增加计算开销和过拟合风险;在真实场景或新环境下,Latent-32 往往是最佳平衡点。
-
训练时混合使用带想象目标和不带想象目标的数据。这能避免模型在推理时过度依赖自身可能不准确的生成图像,同时保留想象力对内部表征的正向影响。
-
推理时优先采用 “纯答案模式”,除非想象质量已足够可靠。实验结果显示,生成图像的质量不稳定时,强行将不精确的想象注入推理反而有害。可以在偏差小的任务(如 PET)中使用生成图像,在偏差大的任务(如 PT)中关闭图像生成。
-
谨慎对待文本思维链。空间关系的文字描述极易引入歧义,与其让模型写出一大段不精确的空间推演,不如让它训练一个隐式的视觉想象空间,哪怕最终不显式生成图像。
最后,虽然当前 IPT 需要任务特定的想象目标定义,但论文在路径追踪和多视角计数上的泛化结果表明,想象能力是可迁移的。后续可以探索统一的 “空间想象力” 模块,通过大量合成数据预训练,使其适用于更广泛的三维推理场景。