遇见数据集

SpaceVista-Bench

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

SpaceVista是一个用于评估全尺度视觉空间推理能力的基准数据集,覆盖从毫米到公里的空间范围。该数据集旨在推动多模态空间推理研究,特别适用于机器人、自动驾驶和具身智能体等需要理解不同尺度空间关系的应用场景。数据集包含四个明确分类的空间尺度:TinyTabletop(毫米级,聚焦桌面小物体的细粒度空间细节)、Tabletop(厘米级,标准桌面场景与常见物体)、Indoor(米级,房间级室内环境)和Outdoor(公里以下级,大规模户外与驾驶场景)。核心数据以统一的JSON格式文件(bench_final.json)提供,包含了所有评估条目。实际数据由两部分组成:一是提取的视频帧(PNG格式),组织在image_data目录下按类别和场景存放;二是原始源视频(MP4格式),组织在raw_data目录下。数据集提供了交互式网页预览工具,支持视频帧播放、搜索过滤以及服务器端的标注渲染(点、边界框、掩码覆盖),便于浏览和检查数据。

SpaceVista is a benchmark dataset for evaluating full-scale visual spatial reasoning capabilities, covering spatial scales ranging from millimeters to kilometers. This dataset aims to advance multimodal spatial reasoning research, and is particularly tailored for application scenarios that require understanding spatial relationships across different scales, such as robotics, autonomous driving, and embodied AI Agents. The dataset includes four explicitly categorized spatial scales: TinyTabletop (millimeter scale, focusing on fine-grained spatial details of small desktop objects), Tabletop (centimeter scale, standard desktop scenes and common objects), Indoor (meter scale, room-level indoor environments), and Outdoor (sub-kilometer scale, large-scale outdoor and driving scenarios). The core dataset is provided via a unified JSON file named bench_final.json, which contains all evaluation entries. The actual dataset consists of two parts: first, extracted video frames in PNG format, organized in the image_data directory by category and scene; second, the original source videos in MP4 format, stored in the raw_data directory. The dataset provides an interactive web preview tool that supports video frame playback, search and filtering, as well as server-side annotation rendering (points, bounding boxes, mask overlays) to facilitate data browsing and inspection.

创建时间:
2026-05-18
原始信息汇总

数据集概述

SpaceVista-Bench 是一个用于全尺度视觉空间推理的评估基准数据集,覆盖从毫米(mm)到千米(km)的多种空间尺度。

核心信息

  • 语言: 英语 (en)
  • 许可协议: CC-BY-4.0
  • 数据规模: 1M < n < 10M
  • 任务类型: 视频-文本到文本 (video-text-to-text)
  • 标签: 视频、推理、空间、多模态、空间推理、机器人、自动驾驶、具身智能

数据类别

该数据集包含四个空间尺度的类别,每个类别对应不同的场景和物体:

类别 尺度 描述
TinyTabletop 毫米级 具有精细空间细节的小型桌面物体
Tabletop 厘米级 标准桌面场景中的常见物体
Indoor 米级 房间级别的室内环境
Outdoor 小于千米 大规模户外与驾驶场景

数据文件

文件 描述
bench_final.json 统一的基准数据JSON格式,包含四个空间尺度的所有评估条目

数据获取与解压

  • 数据通过Git LFS从HuggingFace仓库下载:git clone https://huggingface.co/datasets/SpaceVista/SpaceVista-Bench

  • 数据以两个压缩包形式分发:

    • image_data.tar.gz:提取的视频帧(PNG格式),按类别/场景组织
    • raw_data.tar.gz:原始源视频(MP4格式),按类别/场景组织
  • 解压后目录结构:

    . ├── bench_final.json ├── image_data/ │ ├── TinyTabletop/<scene>/<frame>.png │ ├── Tabletop/<scene>/<frame>.png │ ├── Indoor/<scene>/<frame>.png │ └── Outdoor/<scene>/<frame>.png └── raw_data/ ├── TinyTabletop/<scene>/<video>.mp4 ├── Tabletop/<scene>/<video>.mp4 ├── Indoor/<scene>/<video>.mp4 └── Outdoor/<scene>/<video>.mp4

  • 注意:bench_final.json中的路径均为相对路径,需将该JSON与数据文件夹置于同一目录。

预览工具

提供一个交互式Web预览工具,支持:

  • 视频帧播放与进度条(2帧/秒)
  • 服务器端标注渲染(点、边界框、遮罩叠加)
  • 按输入类型筛选(Mask / Point / BBox / Text)
  • 根据ID、任务类型和问题内容进行关键词搜索

使用方式: bash cd preview_script python3 serve.py [port] # 默认端口:8081

然后在浏览器中打开 http://localhost:<port>/preview_script/preview.html

评估

评估代码和详细说明请参考GitHub仓库:https://github.com/PeiwenSun2000/SpaceVista/tree/main/eval

参考论文

  • 论文标题:SpaceVista: All-Scale Visual Spatial Reasoning from mm to km
  • arXiv链接:https://arxiv.org/abs/2510.09606
搜集汇总
数据集介绍
SpaceVista-Bench 数据集图片
构建方式
SpaceVista-Bench 是 SpaceVista 项目推出的全尺度视觉空间推理评测基准,覆盖从毫米级桌面微距到千米级户外场景的四个空间层级:TinyTabletop、Tabletop、Indoor 与 Outdoor。该基准通过整合已有数据集并补充精细标注的视觉空间问答对构建而成,标注形式涵盖点、边界框、掩膜与文本描述,以支持多样化的推理任务。数据以统一 JSON 格式整合,并随附提取的视频帧与原始视频文件,确保评测的可复现性与灵活性。
使用方法
使用者可通过 Git LFS 从 HuggingFace 仓库克隆基准数据,解压后获得 bench_final.json 与按类别场景组织的图片或视频文件夹。评测时需将 JSON 文件与数据目录置于同级路径,并参考官方 GitHub 仓库中的评测脚本进行模型推理。为便捷浏览,基准附带基于 Flask 的预览服务器,启动后可在浏览器中逐条播放视频帧、渲染标注覆盖层,并根据需求筛选特定类型的测试样本。
背景与挑战
背景概述
视觉空间推理是人工智能领域迈向通用智能的关键能力之一,要求模型在理解场景中物体位置、尺度与空间关系的基础上完成高阶认知任务。现有数据集多局限于特定尺度或领域,难以评估模型在跨尺度场景中的泛化能力。2025年,由Peiwen Sun、Shiqiang Lang等来自多所机构的研究者共同构建的SpaceVista-Bench正式发布,旨在填补这一空白。该基准专注于从毫米级桌面微小物体至千米级户外驾驶场景的全尺度视觉空间推理,覆盖TinyTabletop、Tabletop、Indoor与Outdoor四个层级,提供了超过百万规模的视频-文本对数据,并统一采用点、边界框与掩码等多种标注形式。其发布为多模态大模型的空间推理能力评估建立了标准化平台,对机器人、自动驾驶与具身智能等领域的系统性评测具有重要推动作用。
当前挑战
SpaceVista-Bench所解决的领域核心挑战在于,现有视觉推理数据集普遍缺失对跨数量级尺度空间关系的系统覆盖,导致模型在从微观桌面操作到宏观环境导航的连续空间任务中表现欠佳。该基准特别针对尺度变换对空间关系产生的语义漂移现象,设计了涵盖四类典型场景的细粒度评测框架。在构建过程中,研究者面临多重困难:一则需协调不同尺度场景的数据采集方式,包括水下摄像头捕捉毫米级细节与车载传感器录制城市街景;二则需统一异构标注体系,将空间关系从精细坐标映射至跨尺度语义空间;此外,大规模视频帧的预处理、标注一致性校验与多源异构数据的融合管理,均对工程实现提出了严苛要求。
常用场景
经典使用场景
SpaceVista-Bench作为跨尺度视觉空间推理的标杆性评测基准,其核心使用场景集中于评估多模态大模型在从毫米级微距到公里级广域场景下的空间理解能力。通过对TinyTabletop、Tabletop、Indoor和Outdoor四类尺度任务的系统构建,该基准能够全面度量模型在点、边界框、掩码及文本四种输入条件下的空间定位与关系推理表现。研究者和开发者可以利用该基准对视觉语言模型进行标准化评测,深入分析模型在不同细粒度空间尺度上的推理缺陷与优势,从而推动模型架构的优化与空间认知能力的提升。
解决学术问题
该数据集有效填补了现有视觉空间推理研究中缺乏全尺度统一评测框架的空白。学术层面,它系统性地解决了两个关键问题:一是跨尺度空间推理能力的标准化评估难题,传统基准往往局限于单一粒度范围,无法反映模型在跨场景泛化中的真实表现;二是多模态空间理解中视觉线索与语言描述的对齐与泛化挑战。SpaceVista-Bench通过精细化的任务分层和多样化的标注形式,为衡量模型的空间认知能力提供了可靠标尺,其影响还体现在推动了视觉推理研究从单一场景向全尺度泛化迈进,促进了机器人视觉、自动驾驶等领域的认知算法突破。
实际应用
在现实世界中,SpaceVista-Bench所评估的空间推理能力直接服务于多个关键技术领域。于自主驾驶场景,模型需理解厘米级障碍物与公里级交通流的空间关系,基准中的Outdoor类别正对应此类复杂路况中的目标定位与轨迹预测。在智能机器人领域,TinyTabletop和Tabletop任务支撑着机械臂在微细操作中的空间感知,如零件装配、手术辅助等精细作业。Indoor场景则赋能家庭服务机器人在室内环境中的导航与物体抓取。这一基准为跨尺度空间智能的落地提供了可靠的评测工具与训练样本,加速了从实验室研究到实际系统的技术转化。
数据集最近研究
最新研究方向
SpaceVista-Bench作为一个跨越毫米至千米的全尺度视觉空间推理基准,正引领多模态大模型在空间理解领域的前沿探索。该基准整合了微距桌面、室内场景与户外驾驶等四级空间尺度,涵盖点、框、掩码和文本等多种输入模态,精准评估模型在细粒度空间推理上的能力。当前研究热点聚焦于结合该基准推动具身智能体在机器人操作、自动驾驶等复杂环境中的空间感知与决策能力,其多尺度、多模态的设计为检验和提升模型的空间泛化性提供了关键测试平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务