OmniSpatial
收藏官方服务:
资源简介:
OmniSpatial是一个全面的视觉-语言模型(VLM)空间推理基准,涵盖了动态推理、复杂空间逻辑、空间交互和视角采取四个主要类别。该数据集包含来自互联网数据爬取和手动注释的超过1.5K的问题-答案对,旨在挑战和评估VLM的空间推理能力。
OmniSpatial is a comprehensive visual-language model (VLM) spatial reasoning benchmark encompassing four core categories: dynamic reasoning, complex spatial logic, spatial interaction, and perspective taking. This dataset contains over 1.5k question-answer pairs sourced from web data crawling and manual annotation, and is designed to challenge and evaluate the spatial reasoning capabilities of VLMs.
创建时间:
2025-06-04
搜集汇总
数据集介绍

构建方式
在认知心理学与视觉-语言模型交汇的背景下,空间推理能力的系统评测成为亟待突破的瓶颈。OmniSpatial数据集的构建遵循了系统化与精细化的设计原则。研究者通过互联网数据爬取、标准化考试题目、驾驶测试题目以及现有数据集(如MME与HOI4D)等多维渠道,收集了涵盖不同场景、分辨率、光照与天气条件的图像与视频帧。所有数据均经过人工严格筛选,剔除低质量、无空间复杂度或AI生成的内容,最终保留1387张图像。针对每张图像,由六位经过培训的标注员手动构建了1533个多项选择题(含二选一与四选一),确保问题以自然语言表达、答案唯一且与视觉场景高度对齐,并通过多轮交叉验证保证标注的准确性与一致性。
使用方法
OmniSpatial作为评测基准,其使用方法遵循标准化与可复现的流程。研究者需将图像/视频帧与对应的多项选择问题输入待评估的视觉-语言模型,模型输出被限定为选项字母。对于常规模型,推荐采用带人工模板的思维链(Manual CoT)提示策略,并通过正则表达式提取答案;对于具备内部长链推理能力的推理模型(如o1、o3),则采用自由回答配合GPT-4.1-mini作为裁判(LLM-as-a-Judge)进行评估。此外,数据集内置了两种增强空间推理的辅助方法:PointGraph通过分割与构建场景图强化结构感知,SpatialCoT利用新视角合成(如InstantMesh)激发空间想象力,均已在实验中展现效果。研究者可依此框架系统测试模型的动态推理、复杂逻辑、空间交互与视角转换四大类能力,并通过细粒度子任务分析定位模型的优势与短板。
背景与挑战
背景概述
在认知心理学与人工智能交叉领域中,空间推理能力被视为视觉语言模型(VLM)从感知迈向行动的关键桥梁。然而,现有基准如SpatialBot-Bench和EmbSpatial已在基础空间关系识别任务上趋于饱和,亟需更高阶的评估体系。基于此,清华大学、北京大学、上海人工智能实验室等机构于2025年联合提出了OmniSpatial基准,该工作由Mengdi Jia、Zekun Qi等人主导。该数据集从认知心理学理论出发,将空间推理系统划分为动态推理、复杂空间逻辑、空间交互与视角采择四大核心维度,囊括50余个细分类别及超过1500个高质量问答对,旨在全面审视VLM在复杂空间理解中存在的系统性缺陷。
当前挑战
OmniSpatial所解决的领域挑战在于传统基准过度聚焦于左右、远近等静态关系,忽视了现实世界中歧义性、动态性及上下文依赖的复杂空间推理需求。现有顶尖模型如o3与Gemini-2.5-Pro在该基准上准确率仅为57%,较人类表现落后逾30个百分点,尤其在几何推理与非自我中心视角采择类任务中表现疲弱。在构建过程中,团队面临多源数据整合的障碍,需从网络图像、标准化测试、驾考题库及现有数据集(如HOI4D)中筛选并过滤AI生成的低质或缺乏空间复杂度的冗余样本;同时通过多轮人工审核与交叉验证确保问答对与视觉场景的高度对齐,避免模板化注释可能引入的偏置,从而保证评估的严苛性与真实性。
常用场景
经典使用场景
在视觉语言模型(VLM)的研究浪潮中,空间推理能力被视为衡量机器认知智能的试金石。OmniSpatial 被设计为一座覆盖全面的空间推理基准,其经典使用场景在于对 VLM 进行系统性评估。该基准将空间认知凝练为四大维度——动态推理、复杂空间逻辑、空间交互与视角转换,并细分为五十余项细粒度的子任务。通过手工收集与精密标注的一千五百余道问答对,研究者得以衡量模型在从运动预判到几何变换、从路径规划到多视角认知等多样场景中的表现,从而精准诊断现存模型在复杂空间理解上的薄弱之处。
解决学术问题
长期以来,既有空间基准多聚焦于“左-右”、“近-远”等基础空间关系,且日益趋于饱和。OmniSpatial 的出现,解决了学术界缺乏对高阶空间认知进行系统评测的痛点。它从认知心理学出发,填补了模型在动态世界推理、3D空间结构逻辑分析、具身环境交互以及视角采择等深层次能力上的评估空白。该基准揭示出,即便是最前沿的推理模型,在几何推理与非自我中心视角任务上的准确率仍远低于人类基线,这一发现为未来研究指明了方向:亟需推动物理感知与视角感知的多模态模型发展。
实际应用
精准的空间推理是机器在物理世界中自主行动的核心引擎,OmniSpatial 的构建因而具有鲜明的应用价值。在自动驾驶领域,其交通分析子任务可促使模型更准确地理解路权规则、预测行人轨迹并识别潜在碰撞风险。在服务机器人与工业操控场景中,空间兼容性判断与操作位置选择等任务能够帮助系统优化抓取策略,实现安全且高效的物品搬运与装配。此外,地图理解与导航能力评测可赋能智能导盲系统与室内外物流机器人,使其在复杂环境中做出更智能的路径决策。
数据集最近研究
最新研究方向
当前关于空间推理的前沿研究正从基础空间关系理解迈向更复杂的认知维度。OmniSpatial的提出标志着该领域的一个重要转折点,它基于认知心理学理论,将空间推理系统性地划分为动态推理、复杂空间逻辑、空间交互和视角转换四大类别,并细分为50余个子任务。这一基准的发布恰逢其时,因为现有的视觉语言模型在经典的左右判别等基准上已接近饱和,但在几何变换、异源视角想象等复杂任务上表现远逊于人类(准确率仅约30%-40%)。该数据集通过手动标注的1500余道高质量问答对,揭示了当前顶尖模型在高级空间认知上的系统性缺陷,为下一代具备物理世界感知和视角感知能力的人工智能研究提供了关键的评估标尺与错误分析平台。
相关研究论文
- 1通过清华大学, 西安交通大学, 上海交通大学, Galbot, 北京大学, 上海期智研究院, 上海人工智能实验室 · 2025年
以上内容由遇见数据集搜集并总结生成



