SpatialScore
收藏资源简介:
SpatialScore是一个全面的、多样化的多模态空间理解基准数据集,旨在评估多模态大型语言模型(MLLMs)的空间理解能力。该数据集由28,093个样本组成,涵盖了各种空间理解任务、模态和QA格式,并包含一个精心策划的具有挑战性的子集SpatialScore-Hard。SpatialScore整合了VGBench和来自其他11个现有数据集的相关数据,涵盖了计数、物体定位、3D位置关系、深度和距离、物体属性、相机和图像转换、点/物体跟踪等多个类别。该数据集的创建旨在为未来MLLMs的发展提供一个有价值的资源和严格的测试平台。
SpatialScore is a comprehensive and diverse multimodal spatial understanding benchmark dataset designed to evaluate the spatial understanding capabilities of multimodal large language models (MLLMs). Comprising 28,093 samples, this dataset covers a wide range of spatial understanding tasks, modalities and QA formats, and includes a carefully curated challenging subset named SpatialScore-Hard. SpatialScore integrates VGBench and relevant data from 11 existing datasets, covering multiple categories such as counting, object localization, 3D positional relationships, depth and distance, object attributes, camera and image transformations, point/object tracking, and others. This dataset is created to provide a valuable resource and a rigorous test platform for the future development of MLLMs.
SpatialScore数据集概述
数据集基本信息
- 名称: SpatialScore
- 目标: 评估多模态大语言模型(MLLMs)的空间理解能力
- 开发团队:
- Haoning Wu (上海交通大学人工智能学院/上海AI实验室)
- Xiao Huang (上海交通大学人工智能学院/天津大学)
- Yaohui Chen (上海交通大学人工智能学院)
- Ya Zhang (上海交通大学人工智能学院/上海AI实验室)
- Yanfeng Wang (上海交通大学人工智能学院/上海AI实验室)
- Weidi Xie (上海交通大学人工智能学院/上海AI实验室)
- 状态: Under Review
数据集组成
- VGBench: 专门评估视觉几何感知能力的基准(如相机姿态和运动估计)
- SpatialScore:
- 整合VGBench和其他11个现有数据集的相关数据
- 包含28K样本,涵盖各种空间理解任务、模态和QA格式
- 包含精选的挑战性子集SpatialScore-Hard
任务类别
- Counting (计数)
- Object Localization (物体定位)
- 3D Positional Relation (3D位置关系)
- Depth & Distance (深度和距离)
- Object Properties (物体属性)
- Camera & Image Transformation (相机和图像变换)
评估方法
- SpatialAgent:
- 包含9个专门用于空间理解的专业工具
- 支持Plan-Execute和ReAct两种推理范式
资源链接
- 代码: GitHub
- 论文: arXiv
- 数据: HuggingFace
- 引用: BibTeX




