分享自:

Omnispatial:面向视觉语言模型的全面空间推理基准

期刊:ICLR

学术研究报告:OmniSpatial——面向视觉语言模型的全面空间推理基准

一、 研究团队与发表信息

本研究报告介绍了一项名为“OmniSpatial”的基准研究。这项研究的主要作者包括Mengdi Jia、Zekun Qi、Shaochen Zhang、Wenyao Zhang、Xinqiang Yu、Jiawei He、He Wang和Li Yi。他们来自清华大学、西安交通大学、上海交通大学、Galbot、北京大学和上海期智研究院等多个机构。该研究以会议论文的形式发表于ICLR 2026。

二、 研究背景与目的

科学领域: 本研究属于人工智能(AI)领域,具体聚焦于多模态大模型(尤其是视觉语言模型,VLM)的空间推理(Spatial Reasoning)能力评估与提升。

研究背景与动因: 空间推理是人类认知心理学的关键组成部分,也是连接视觉感知与物理世界交互(如机器人操作、自动驾驶、AR/VR)的核心能力。尽管已有大量研究致力于评估或提升视觉语言模型对基本空间关系(如左右、远近、物体计数)的理解,但这些任务仅覆盖了空间推理最基础的层面。最新的推理模型(如GPT-4o、Gemini-2.5-Pro、O3等)在这些现有基准(如SpatialBot-Bench、EmbSpatial-Bench)上的准确率已超过90%,表明基础任务已接近饱和。然而,人类与物理世界的交互往往涉及对模糊、动态、上下文依赖的复杂空间关系的理解,现有基准未能充分评估这种复杂的空间认知能力。

研究目标: 为了填补这一空白,本研究团队旨在构建一个全面且具有挑战性的空间推理基准——OmniSpatial。该基准基于认知心理学理论,旨在超越简单的关系判断,系统性地评估视觉语言模型在更复杂、更贴近真实世界的空间推理任务上的能力。其核心目标是:1)建立一个覆盖空间推理多维度、细粒度的评估框架;2)通过大量人工标注数据,为模型能力评估提供可靠依据;3)探索并验证能够增强模型空间推理能力的有效策略。

三、 研究详细工作流程

本研究的工作流程主要包括基准构建、数据收集与标注、评估方法设计以及增强策略探索四个核心环节。

第一环节:基准设计与分类体系构建 研究团队首先从认知心理学和实际应用需求出发,提出了一个全新的视觉空间推理分类学(Taxonomy)。他们将复杂的空间推理能力系统地划分为四个主要维度: 1. 动态推理(Dynamic Reasoning,占27%): 从视觉证据推断运动和时序变化,包括运动分析(23%)和操作推理(5%)。 2. 复杂空间逻辑(Complex Spatial Logic,占16%): 涉及关系、变换和几何结构的高阶推理,包括几何推理(10%)和模式识别(6%)。 3. 空间交互(Spatial Interaction,占20%): 在环境约束和任务目标引导下的推理,涵盖地理空间策略(7%)、定位(7%)和交通分析(6%)。 4. 视角采择(Perspective-Taking,占37%): 采纳替代视角的能力,包括他心参照(Allocentric,25%)、自我中心参照(Egocentric,7%)和假设性视角采择(5%)。 在此框架下,进一步细分为50个子类别任务。这种分类为全面评估模型能力提供了原则性基础。

第二环节:数据集构建与标注 为了构建一个高质量、多样化的基准,研究团队采用了多元化的数据收集策略和严格的人工标注流程。 1. 数据来源: * 网络图像: 针对视角采择、动态推理和空间交互任务,使用特定关键词(如“室内布局”、“家具摆放”)通过API和手动搜索获取,并过滤掉合成或空间信息简单的图像。 * 考试类试题: 为评估抽象空间逻辑(如3D变换、旋转),收集了公开的空间认知测试题,并按焦点和难度分类,筛选出专注于纯空间推理的题目。 * 驾驶测试题: 为评估动态环境下的推理,从至少三个国家的驾照考试网站、标准化任务库和互动视频中提取图像和帧,并设计情境化问题。 * 现有数据集图像: 整合了MME(提供RGB-D数据,用于基于深度的空间推理问题)和HOI4D(包含人-物交互视频,用于创建运动预测任务)等数据集,以引入真实世界的运动和交互复杂性。 * 扩展训练集: 为了增加数据多样性,训练集还整合了SpatialViz、PhysBench、ViewSpatial和DrivingVQA等现有数据集的部分样本。 2. 数据规模与划分: 最终构建的OmniSpatial基准包含超过8.4K个精心设计的问答对,基于6.5K张图像/视频帧。数据集被划分为1.5K的测试集(完全由人工标注)和6.9K的训练集。 3. 问题设计与标注流程: 问题采用选择题形式(二元判断或四选一)。为确保自然性和挑战性,问题以对话式和上下文丰富的风格提出,而非僵化的模板。例如,使用“如果你正走进教室,学生在哪一边?”而非“[A]在[B]的右边吗?”。为确保答案清晰唯一,进行了多轮验证和交叉检查。六名经过培训的标注员参与工作,最终标注者间一致性(Krippendorff‘s α)达到0.84,表明标注质量很高。

第三环节:评估方法与实验设置 研究设计了一套系统的评估协议,以全面衡量不同模型在OmniSpatial上的表现。 1. 评估模型: 涵盖了四大类最先进的模型: * 专有模型(Proprietary Models): 如GPT-4o系列、GPT-4.1系列、Claude系列和Gemini系列,通过API在零样本(Zero-shot)设置下测试。 * 推理模型(Reasoning Models): 如O1、O3、O4-mini和Gemini-2.5(带有思维链,CoT),由于输出非结构化,采用“LLM-as-a-judge”范式(使用GPT-4.1-mini)自动判断答案正确性。 * 开源模型(Open-source Models): 如Qwen-VL、InternVL、Gemma和LLaVA-OneVision,在本地部署并采用标准化提示词。 * 专用空间模型(Specialized Spatial Models): 如SpatialVLM、RoboPoint、SpatialBot和SoFAR,这些模型集成了显式的空间信号(如3D度量信息)。 2. 评估指标: 主要使用多选题准确率。对于标准模型,测试了直接输出、正则表达式解析、JSON解析和LLM-as-a-judge四种输出协议。

第四环节:空间推理能力增强策略探索 研究提出了两种新颖的策略来增强视觉语言模型的空间推理能力: 1. PointGraph(显式对象关系建模): 该方法旨在通过构建图像内对象关系的结构化表示来增强模型对空间关系的理解。具体流程是:首先使用开放词汇的接地模型(如Florence-2)定位图像中的多个物体,提取其中心点和边界框。然后将这些检测结果组装成JSON格式的场景图(Scene Graph),编码物体身份和相对位置。最后,将这个结构化的空间描述与原始查询拼接,一并输入给视觉语言模型,为其提供明确的几何线索,以辅助进行关于距离、方向和配置的更准确推理。 2. SpatialCoT(通过新视角合成刺激空间想象): 受人类依赖心理意象进行空间推理的启发,该方法通过3D新视角合成来丰富视觉输入,从而增强模型的空间想象力。具体操作是:采用InstantMesh为每张输入图像合成六个额外的视角,并将它们组合成一个多视角拼贴图(Collage)。然后将这个拼贴图与问题一起,作为思维链提示流程的一部分输入给视觉语言模型。额外的视角提供了强大的几何先验,帮助模型消除遮挡、视角采择等依赖于视角的推理任务的歧义。

四、 主要研究结果

整体性能分析: 在OmniSpatial测试集上的评估结果(见表2)显示: 1. 专有推理模型(如O3和Gemini-2.5-Pro)取得了最高性能,整体准确率超过56%,但它们与人类水平(92.63%)仍有巨大差距,且推理时间和令牌消耗大。 2. 开源模型也表现出竞争力,大规模模型如InternVL3-78B和Qwen-VL2.5-72B的性能与GPT-4.1-mini和Gemini-2.0-Flash-Exp相当。 3. 专用空间推理模型由于数据集覆盖和模型容量限制,在综合性基准上未能取得显著提升。

分类别性能分析: 不同空间推理类别存在显著的性能差异: 1. 动态推理与空间交互: 专有模型凭借其广泛的世界知识和局部理解能力,在这些类别上表现出色,表明推理模型在时间理解、空间关系分析和基于地图的理解方面具有较高水平。 2. 复杂逻辑(几何推理与模式识别): 即使是为长链条思考设计的推理模型,准确率也只有30%到40%左右,仅略高于随机基线。这揭示了当前模型在涉及空间想象的平面几何推理方面存在严重短板。 3. 视角采择: 当前模型表现出有限的视角采择能力,主要擅长从自我中心视角分析场景,而在想象他人视角方面存在困难。

增强策略的有效性验证: 1. PointGraph的效果: 在GPT-4.1、Gemini-2.5-Flash和Qwen-VL2.5-3B等模型上应用PointGraph作为预处理步骤后,结果(见表3)显示准确率有明确提升,特别是在动态推理和视角采择任务上。这验证了集成结构化对象表征的益处。相比之下,传统的文本思维链(Textual CoT)难以带来显著改进。 2. SpatialCoT的效果: 表4显示,在视角采择任务上,通过InstantMesh进行新视角合成后,GPT-4.1-mini和Qwen-VL2.5-3B的性能均有显著提升(约+2%),验证了显式空间想象力增强的有效性。

训练探索结果: 1. 在OmniSpatial训练集上的监督微调: 从一个强大的开源基线(Qwen-VL2.5-3B)出发,在6.9K个样本上进行监督微调,相比零样本(Zero-shot)带来了平均+7.82分的显著提升,且在动态、交互和视角采取相关任务上均有稳定改进。 2. 与模板数据的对比: 相比之下,在一个更大的(200K)遵循VSI-Bench构建过程的模板式语料库上进行训练,仅带来平均+1.29分的边际提升。这凸显了多样化、人工精心策划的空间任务相对于合成模板的价值。 3. 向VSI-Bench的泛化: 为了检验跨基准的泛化能力,研究采用SPACER-7B流程,比较了使用和不使用OmniSpatial数据进行监督训练的效果。添加OmniSpatial数据将VSI-Bench上的总体得分从41.68提升至43.68,特别是在需要排序、计数和度量/房间大小推理的类别上表现更佳。这表明OmniSpatial提供了互补的监督信号,能够迁移到外部空间任务,而非过度拟合基准内的特定模式。

五、 研究结论与价值

本研究成功构建并发布了OmniSpatial,一个用于全面评估视觉空间推理能力的基准。该基准将空间认知提炼为动态推理、复杂逻辑、空间交互和视角采择四大核心类别,涵盖50个细粒度子任务和8.4K个人工精心策划的问答对。

科学价值: 1. 理论框架贡献: 提出了一个基于认知心理学、系统且全面的视觉空间推理分类学,为未来该领域的研究提供了清晰的理论框架和评估维度。 2. 基准建设贡献: 创建了一个规模大、多样性高、挑战性强的新基准,弥补了现有基准在复杂性和全面性上的不足,为准确衡量和追踪视觉语言模型的空间推理进展提供了可靠工具。 3. 方法学贡献: 提出的PointGraph和SpatialCoT两种增强策略,为提升模型的空间推理能力提供了有效且可解释的技术路径,证明了结构化场景表示和多视角推理的重要性。 4. 诊断性发现: 通过大规模评估,揭示了当前最先进模型在复杂空间推理(尤其是几何推理和非自我中心视角采择)方面的显著局限性,明确了未来研究需要攻克的关键难点。

应用价值: 1. 模型开发指南: 为AI和机器人领域的研究者与开发者提供了明确的模型能力评估标准和改进方向,有助于开发下一代具备空间和物理感知的智能系统。 2. 技术推动: 所提出的增强策略可直接应用于需要高级空间理解的现实任务,如机器人精细操作、自动驾驶场景理解、AR/VR中的沉浸式交互等。 3. 数据集资源: 公开发布的数据集和评估代码,将促进社区在该领域的进一步研究、模型比较和技术创新。

六、 研究亮点

  1. 全面性与系统性: OmniSpatial是首个基于认知心理学理论,系统覆盖空间推理四大核心维度及50个子类别的综合性基准,突破了以往基准仅关注基础空间关系的局限。
  2. 高质量数据构建: 采用多源数据(网络图像、认知测试、驾驶考试、现有数据集)和严格的人工标注流程,确保了数据的多样性、真实性和高质量,避免了过度依赖生成图像或LLM生成模板所带来的偏差。
  3. 深刻的评估洞察: 对36个最新视觉语言模型进行了大规模、细粒度的评估,不仅给出了性能排名,更深入分析了模型在不同类型空间任务上的优势与短板,提供了宝贵的诊断信息。
  4. 创新的增强方法: 提出了PointGraph和SpatialCoT两种新颖的增强策略,从“显式结构提示”和“隐式视角扩展”两个不同角度提升模型的空间推理能力,并通过实验验证了其有效性。
  5. 强调泛化与实用价值: 通过训练探索证明了OmniSpatial数据能有效提升模型的空间技能而非仅仅拟合模板,并且能泛化到其他基准(如VSI-Bench),体现了其作为训练数据的实用价值。

七、 其他有价值内容

本研究还包含了详尽的伦理声明和可复现性声明,承诺遵守ICLR行为准则,负责任地使用所提出的方法,并已发布源代码以支持其他研究者的复现与后续工作。此外,论文中提供了与现有多个空间推理基准(如EmbSpatial-Bench、Space3D-Bench、VSI-Bench等)的详细对比(见表1),清晰地阐述了OmniSpatial在任务类别、数据领域、标注方式、数据规模和问题数量上的优势与特色。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com