遇见数据集

purespace

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

PureSpace是一个用于评估视觉语言模型(VLMs)抽象空间推理能力的基准数据集,专注于几何推理任务,要求模型理解三维物体的空间变换,例如旋转、投影视图(如俯视图)以及立方体补全。数据集中包含三种核心任务:旋转(rotation)、投影(projection)和补全(completion)。每个任务样本由一个提问图像、一组困难选项图像(及其对应的正确答案索引)、一组简单选项图像(及其对应的正确答案索引)以及相关的元数据文件构成。提问文本根据任务类型而定,例如“哪个选项是给定物体的旋转版本?”。数据集以结构化的目录形式组织,包含images/和labels/两个主要目录,labels/下按任务和训练/测试划分存储文本标签文件。该数据集旨在为视觉语言模型的空间智能提供一个纯净、具有挑战性的评估基准。

PureSpace is a benchmark dataset for evaluating the abstract spatial reasoning capabilities of vision-language models (VLMs). It focuses on geometric reasoning tasks, requiring models to understand spatial transformations of 3D objects, such as rotation, projection views (e.g., top views), and cube completion. The dataset includes three core tasks: rotation, projection, and completion. Each task sample consists of a query image, a set of hard option images (with corresponding correct answer indices), a set of easy option images (with corresponding correct answer indices), and related metadata files. The query text varies based on the task type, e.g., "Which option is the rotated version of the given object?". The dataset is organized in a structured directory format, with two main directories: images/ and labels/, where labels/ stores text label files divided by task and train/test splits. It aims to provide a pure and challenging evaluation benchmark for the spatial intelligence of vision-language models.

创建时间:
2026-06-02
原始信息汇总
  • 数据集名称: PureSpace
  • 许可协议: cc-by-nc-4.0
  • 任务类型: 视觉问答 (visual-question-answering)、图像到文本 (image-text-to-text)
  • 语言: 英文 (en)
  • 标签: 空间智能 (spatial-intelligence)、几何推理 (geometric-reasoning)、基准测试 (benchmark)
  • 简介: PureSpace 是一个用于评估视觉-语言模型在抽象空间推理能力上的基准测试数据集。
  • 数据集结构:
    • images/: 包含多层级的图像文件,例如 l3_c221/000009/000009_iso.jpg000009_top.jpg 等。
    • labels/: 包含三个子任务目录:
      • rotation/: 旋转任务
      • projection/: 投影任务
      • completion/: 补全任务
      • 每个子任务下再分为 train/test/ 文件夹,内部为 .txt 标签文件。
  • 使用示例: 通过读取标签文件,可以获取每个样本的问题图像、硬选项/易选项图像及其对应的答案索引,以及元数据路径。
  • 引用: 论文题为 "PureSpace: A Benchmark for Abstract Spatial Reasoning in Vision-Language Models",收录于 CVPR 2026 Findings,作者为 Li, Jinkai 等。
搜集汇总
数据集介绍
purespace 数据集图片
构建方式
PureSpace基准数据集专为评估视觉语言模型在抽象空间推理能力而设计,其构建基于对三维几何对象的多视角渲染与智能任务衍生。数据集包含丰富的图像素材,每一对象均提供等轴测视图与俯视图等多种角度影像,并按照旋转、投影与立方体补全三类核心空间推理任务进行标注。每一条样本记录均涵盖原始问题图像、候选选项图像及其对应的正确答案索引,同时区分了不同难度层级(简单与困难),以实现对模型能力的精细度度量。标注数据以文本文件形式组织,便于高效解析与批量处理。
使用方法
使用PureSpace数据集时,研究者需指定数据根目录,并依据任务类型(旋转、投影、补全)加载相应的标注文件。通过解析文本文件中的字段,可获得问题图像路径、候选选项路径、答案索引以及元数据链接。代码示例展示了如何遍历标注文件并读取每条样本的详细信息,包括设置名称、对象标识与任务类型。该设计支持灵活的数据加载与模型输入构建,用户可轻松整合至现有的视觉语言模型训练或评估流程中,并依据任务难度分层进行性能分析。
背景与挑战
背景概述
在视觉-语言模型(VLM)飞速发展的当下,如何评估模型对抽象空间关系的理解能力已成为一个关键课题。PureSpace 数据集于 2026 年由李金凯、张振亮、范立峰和王伟等研究者在 CVPR Findings 会议上提出,旨在填补现有基准在纯几何推理方面的空白。该基准专注于三项核心空间任务——旋转识别、投影匹配与立方体补全,通过精心设计的合成三维物体图像与多选问答形式,系统性地考察模型不依赖语义知识或现实世界先验的抽象空间推理能力。PureSpace 的发布为衡量 VLMs 在空间智能维度的真实水平提供了标准化平台,对推动该领域从表观理解向深层结构化认知迈进具有重要引领作用。
当前挑战
PureSpace 所应对的领域核心挑战在于,当前视觉-语言模型普遍缺乏对空间关系的深层抽象推理能力,尤其是在脱离真实世界物体背景知识的情境下,模型往往依赖语言先验或表面纹理特征来作答,而非真正理解几何变换。在构建过程中,研究者面临如何生成高保真度且任务多样化的合成图像、确保选项在视觉复杂度和区分度上一致、以及设计严格没有语义线索的多选题型等难题。此外,还需平衡任务难度梯度(如Easy与Hard选项),以灵敏探测模型在不同复杂层次上的潜能与局限。这些挑战共同定义了 PureSpace 作为专项空间推理评测工具的独特价值。
常用场景
经典使用场景
PureSpace数据集旨在评估与提升视觉语言模型在抽象空间推理任务上的能力。其经典使用场景涵盖三个核心子任务:三维物体旋转匹配、正交投影识别以及立体补全。在旋转任务中,模型需从多个候选图像中识别出给定物体的正确旋转变体;投影任务要求判断哪个视角图像是对应物体的俯视图;补全任务则需选择能够与给定物体拼接成一个完整立方体的正确部件。这些任务均以图文问答的形式呈现,适合作为视觉语言模型在几何推理与空间智能方面的标准化测试基准。
解决学术问题
该数据集系统性地解决了现有视觉语言模型在抽象空间推理能力评估中缺乏高质量、可控基准的问题。以往的视觉问答数据集多聚焦于场景理解、常识推理或物体识别,而PureSpace首次将三维空间变换的抽象推理作为独立维度进行评测,区分了“简单”与“困难”两种难度层级,能够精准衡量模型在低层感知与高层抽象之间的认知差距。这一设计推动了空间智能研究方向的发展,为理解模型是否真正具备几何变换的泛化能力提供了关键的量化分析工具。
实际应用
在实际应用中,PureSpace所评测的空间推理能力对于多个前沿领域具有重要价值。例如,在机器人操作与自主导航中,模型需要理解物体的三维形态并预测其在不同视角下的外观;在增强现实与虚拟现实系统中,用户交互依赖于对虚拟物体的旋转与对称性进行准确判断。此外,该数据集还可用于辅助教育场景下的空间思维训练,帮助诊断学习者在几何想象方面的认知特征,从而推动个性化学习路径的生成。
数据集最近研究
最新研究方向
在视觉-语言模型(VLM)领域,抽象空间推理能力的研究正成为推动智能系统从感知走向认知的关键突破口。PureSpace数据集的提出恰逢其时,它聚焦于评估模型对三维物体的旋转、投影与立方体补全等抽象几何关系的理解,直击当前多模态大模型在空间智能方面的短板。该基准通过精心设计的“硬/易”两档难度选项,揭示了模型在非语义空间操作中的表现层次,为探索VLM的因果推理与几何直觉提供了严谨的衡量标尺。结合近期CVPR等顶级会议对具身智能、空间理解的升温关注,PureSpace不仅为模型诊断提供了标准化工具,更可能催生面向空间常识的预训练范式革新,其影响力正从纯视觉的几何推理延伸至机器人导航、增强现实等需要深度空间交互的热点应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务