基于多模态基础模型扩展空间智能
Scaling Spatial Intelligence with Multimodal Foundation Models
论文信息
标题: Scaling Spatial Intelligence with Multimodal Foundation Models
作者: Zhongang Cai, Ruisi Wang, Chenyang Gu, et al.
发布日期: 2025-11-17
arXiv ID: 2511.13719v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:这篇论文要解决什么 当前多模态基础模型在空间智能(spatial intelligence)上存在明显缺陷,难以完成需要精确空间推理与理解的任务。
-
核心方法:用什么办法解决 通过系统构建一个包含八百万样本的多样化数据集 SenseNova-SI-8M,并基于此训练多种多模态模型(如 Qwen3-VL、InternVL3、Bagel),以提升模型的全局空间能力。
-
关键结果:最重要的一个结论或数字 系列模型在多项空间智能基准上获得前所未有的性能,例如在 VSI-Bench 上达到 68.7%,同时在通用多模态理解(MMBench-En 84.9%)上仍保持强劲表现。
-
主要局限:作者自己承认的、或方法本身固有的限制 论文指出了数据缩放中过拟合风险、语言捷径(language shortcut)问题,并且对空间链式思维推理仅做了初步研究,下游应用验证尚处探索阶段。
-
适合读者:什么背景的人值得读 从事多模态学习、空间推理、具身智能及数据构建研究的学者,以及希望了解如何系统性提升模型三维空间理解能力的工程师。
论文背景和研究动机
多模态基础模型在图像描述、视觉问答等任务上已取得长足进步,然而当任务涉及精确空间关系、三维视角转换或物体位置推理时,这些模型的性能却急剧下降。例如,判断 “左边的红色球在绿色箱子的前面还是后面”,或从不同视角识别同一房间内的物体布局,现有的多模态大模型经常给出错误回答。这些缺陷表明模型并未真正习得稳定、可泛化的空间心智表征,只是依赖肤浅的文本或二维像素相关性。
论文旨在回答一个核心问题:能否通过有原则地规模化数据,使多模态基础模型获得强大的空间智能?为此,研究团队提出了 SenseNova-SI 系列模型,并系统性地构建了 SenseNova-SI-8M 数据集。该数据集包含八百万个样本,覆盖了从基础空间视觉问答到复杂三维重建与空间关系推理的多种能力范畴。其根本动机在于验证:大规模、精心策划的空间数据训练,能否让模型涌现出更泛化的空间智能,而非仅仅记住训练样本中的模式。
核心方法和技术细节
空间能力分类体系的构建
工作的基础是一个严谨的空间能力分类法(taxonomy),它定义了多维度空间任务类别,包括但不限于:
- 空间关系理解(如方位介词、相对位置描述)
- 多视角一致性(从不同相机位姿识别同一场景)
- 三维场景推理(基于单图或视频推理物体深度、遮挡关系与布局)
- 空间想象与心理旋转(对物体进行虚拟旋转后回答问题)
- 空间思维链(多步空间推理)
研究团队依据此分类法,从多种现有数据源筛选、重标注并生成新数据,确保每个类别的覆盖与平衡。详细的类别定义可参考论文第 3 节,论文未完整公开具体类别数量,但强调其覆盖了 “rich set of spatial capabilities”。
SenseNova-SI-8M 数据集的构建
SenseNova-SI-8M 不是简单爬取现有数据,而是混合了以下来源(见论文第 3.2 节):
- 从互联网图像和视频中自动生成空间问答对(利用现有视觉模型和大语言模型自动标注)
- 从三维仿真环境(如 Habitat、MuJoCo 等)渲染合成图像和对应的空间标注
- 人工重标注或增强现有空间推理数据集(例如 VSI-Bench 的一部分原始数据可能被纳入)
- 对室内扫描数据(如 ScanNet、HM3D)进行空间关系抽取
自动生成过程中,论文使用多阶段验证流水线来过滤低质量样本,以减少标注噪声。所有样本统一整理为图文问答格式,或用于视觉理解的图像-文本对格式。
模型架构与训练策略
SenseNova-SI 是建立在三种已有基础模型上的系列,包含:
- 视觉理解模型:Qwen3-VL、InternVL3
- 统一的视觉理解与生成模型:Bagel
训练策略并非从头预训练,而是对基座模型进行持续的指令微调或参数高效微调(论文第 4.1 节)。微调数据不仅包括 SenseNova-SI-8M 中的空间任务,还混入一定比例的通用多模态数据,防止模型遗忘基础视觉-语言能力。具体的混合比例、学习率调度、优化器配置等细节论文并未全部披露,只说明 “carefully designed multi-task training scheme”。
推理阶段,部分实验引入了空间链式思维(Spatial Chain-of-Thought, SCoT)提示,要求模型分步骤给出空间推理过程。论文将 SCoT 的初步研究作为未来方向,正文中仅少量实验展示了 SCoT 对某些困难任务的改进。
创新点和贡献
系统性空间数据构建方法论
论文首次提出基于能力分类法来指导空间数据集的大规模构建,从数万扩展到八百万样本,融合真实照片、三维仿真和自动标注等多渠道,弥补了以往空间数据集规模小、范围窄的问题。这项系统性工作使得模型能够接触到丰富多样的空间场景。
首个全面评测的空间智能模型系列
SenseNova-SI 在五个代表性基准上设立了新标杆:VSI-Bench(复杂空间推理)、MMSI(多模态空间智能)、MindCube(心理旋转与立方体推理)、ViewSpatial(多视角空间感知)、SITE(空间交互与导航理解)。特别是 VSI-Bench 的 68.7%,显著超越之前最佳方法(论文表 1)。同时,它并未牺牲通用多模态能力,MMBench-En 仍达 84.9%。
从数据缩放角度分析空间智能的涌现
作者通过消融实验分析了数据量从 1M 到 8M 时各项空间基准的性能变化(见论文图 4 和第 5.2 节),观察到性能持续提升,某些指标在某一数据量后具有加速提升的趋势,暗示多样化数据驱动了更一般的空间推理能力,降低了特定类型的捷径依赖。
明确了空间智能训练中的关键风险
论文坦诚地讨论了过拟合和语言捷径:模型可能在训练中学会利用数据中的语言先验(如 “左边” 常和特定颜色词共现)来答题,而非真正理解空间关系。这种分析为后续设计去偏训练策略指明方向。
实验结果分析
总体性能达成
在五个主要空间基准上,SenseNova-SI 系列模型(具体变体以 InternVL3 为骨干的版本为主)取得了创纪录成绩(表 1、表 2)。以 VSI-Bench 为例,68.7% 这个绝对数值相比之前最佳的 44.2%(一个基于 GPT-4V 的系统)有大幅度提升。MindCube 上 85.6% 的成绩尤其突出,表明模型对心理旋转任务有了较强掌握。
数据缩放效应
消融实验显示,当训练样本从 100 万增至 800 万时,VSI-Bench 分数从约 52% 升至 68.7%,趋势基本呈单调上升(图 4)。不过,某些基准如 MMSI 提升幅度初期增长更快,后期趋于平缓,论文认为这可能与任务复杂度和数据多样性饱和有关。
过拟合与语言捷径分析
通过构建控制实验,将空间关系与词汇统计相关性加强或打破,论文检测到模型在初始阶段容易利用语言捷径。当数据多样性增加后,模型对纯粹语言相关性的依赖降低,表明规模化数据的确有助于学习更鲁棒的空间表示(见第 5.3 节)。这一发现为数据集设计提供了指引:不能仅追求数量,必须主动增加空间配置与语言表面形式之间的非对应样本。
空间链式思维初步结果
论文仅用很小篇幅展示了 SCoT 提示后的改进。在 VSI-Bench 的部分困难子集上,SCoT 可将准确率再提高 1-2 个百分点(见第 5.4 节)。由于实验尚未完善,论文未给出大规模自动评估,仅作为未来探索方向的初探。
下游应用验证
论文简短提及了 SenseNova-SI 在机器人操作和自主导航中定性验证的潜力,但未提供定量指标,因而实际落地能力仍待后续工作。
实践建议
尽管 SenseNova-SI 主要以研究为导向,但其构建的空间智能训练方案可被工程团队直接借鉴:
-
构建空间训练数据流水线 参考论文的分类法,团队应首先梳理自身产品中涉及的空间能力种类(如 AR/VR 场景中的 6D 位姿估计、自动驾驶中的交通参与物关系预测),然后利用自动标注工具从真实数据和仿真环境采集样例。建议从三维引擎(如 NVIDIA Omniverse、Blender)渲染大量可控的空间配置图像并自动生成问答,这是低成本覆盖 corner case 的有效方法。
-
避免语言捷径的去偏策略 在数据混合时,主动增加与空间词汇统计关联相反的样本(例如特意改变物体颜色与方位词的固定搭配),从而训练模型回归真正的几何关系。可以在实践中用对抗性数据增强来测试模型是否仍依赖文本先验。
-
**多阶段微调的实践】 论文的经验表明直接将大量空间数据注入基座模型可能导致通用能力下降。推荐采用两阶段微调:先在小规模高质量空间数据上做领域适应,再混入通用多模态数据做多任务合并训练,这已被诸多多模态领域微调实践验证。
-
评估闭环 构建自有的空间智能测试集(可借鉴 VSI-Bench 的构建方式),对每次数据迭代进行评测,监控语言捷径指标(如去除关键空间词后模型性能是否断崖下跌),从而指导下一步数据策展。
最后,公开的 SenseNova-SI 模型权重可直接用于下游任务的基础空间感知模块,但如要用于安全关键场景,仍需结合自建的域内数据做充分验证。