遇见数据集

view2space-v1

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

VIEW2SPACE v1 是一个用于空间推理的多视图视觉语言评估数据集。该数据集与题为《VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations》的 ECCV 2026 论文相关联。数据集公开发布版本包含三个子集:`count`(计数)、`detect`(检测)和 `mcq`(多项选择题)。数据以 JSONL 格式组织,每个文件(如 `overall.jsonl`)的每一行代表一个问题。每个数据记录包含以下字段:问题ID (`q_idx`)、问题类型 (`q_type`)、问题文本 (`question`)、多选题选项 (`options`,仅适用于 `mcq` 类型)、附加提示 (`question_prompt`)、正确答案 (`answer`)、问题所使用图像的相对路径列表 (`image_paths`),以及可选的辅助输入框信息 (`supporting.draw_boxes`)。数据集中的问题基于从同一静态场景的不同位置和角度捕获的多个视图图像,旨在评估模型的空间推理能力。该数据集主要用于视觉问答(VQA)任务的评估,特别侧重于多视图场景下的空间关系理解、物体检测和计数。

VIEW2SPACE v1 is a multi-view visual-language evaluation dataset for spatial reasoning. The dataset is associated with the ECCV 2026 paper titled VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations. The publicly released version includes three subsets: `count`, `detect`, and `mcq`. The data is organized in JSONL format, with each line in files such as `overall.jsonl` representing a question. Each data record contains the following fields: question ID (`q_idx`), question type (`q_type`), question text (`question`), multiple-choice options (`options`, applicable only to `mcq` type), additional prompt (`question_prompt`), correct answer (`answer`), list of relative paths to images used for the question (`image_paths`), and optional supporting input box information (`supporting.draw_boxes`). The questions in the dataset are based on multiple view images captured from different positions and angles of the same static scene, aiming to evaluate models spatial reasoning capabilities. The dataset is primarily used for evaluating visual question answering (VQA) tasks, with a particular focus on spatial relationship understanding, object detection, and counting in multi-view scenarios.

创建时间:
2026-06-21
原始信息汇总

VIEW2SPACE v1 数据集概述

VIEW2SPACE v1 是一个面向空间推理的多视角视觉-语言评估数据集。该数据集包含了三个子集:countdetectmcq

基本信息

  • 名称: VIEW2SPACE v1
  • 任务类别: 视觉问答 (Visual Question Answering)
  • 标签: 多视角、视觉-语言、空间推理、计数、检测、多选题
  • 关联论文: VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations(ECCV 2026)
  • 论文地址: https://arxiv.org/abs/2603.16506
  • 项目页面: https://pokerme7777.github.io/VIEW2SPACE/
  • 许可证: Creative Commons Attribution 4.0 International License (CC BY 4.0)

相关发布

子集与数据文件

数据集包含三个子集,每个子集对应一个测试分片 (test) 的 JSONL 文件:

配置名称 分片 文件路径
count test count/overall.jsonl
detect test detect/overall.jsonl
mcq test mcq/overall.jsonl

目录结构

view2space-v1-release/ README.md count/ overall.jsonl detect/ overall.jsonl mcq/ overall.jsonl images/ img_000001.png img_000002.png ...

数据格式

每条 JSONL 记录包含以下字段:

  • q_idx:问题 ID,例如 mcq_000001
  • q_type:问题类别,值为 mcqdetectcount
  • question:问题文本。
  • options:多选题的选项;非多选题为空。
  • question_prompt:附加提示文本。
  • answer:真实答案。
  • image_paths:问题所使用图片的相对路径列表(相对于数据集根目录,例如 images/img_000123.png)。
  • supporting.draw_boxes:可选的、与一张或多张图片关联的输入框。

示例记录

json { "q_idx": "mcq_000001", "q_type": "mcq", "question": "All views are captured from the same static scene arrangement, but from different positions and angles. In view 2, consider the nearest man with an orange hat, crouching. Where is the white temple relative to this man with an orange hat, crouching?", "options": { "A": "left", "B": "right", "C": "front", "D": "back" }, "question_prompt": "", "answer": "C", "image_paths": [ "images/img_000813.png", "images/img_000806.png", "images/img_000815.png" ], "supporting": { "draw_boxes": null } }

使用示例

python import json from pathlib import Path

dataset_root = Path("/path/to/view2space-v1-release") jsonl_path = dataset_root / "mcq" / "overall.jsonl"

with jsonl_path.open("r", encoding="utf-8") as f: first = json.loads(next(f))

image_files = [dataset_root / rel_path for rel_path in first["image_paths"]] print(first["q_idx"]) print(first["q_type"]) print(image_files)

引用信息

bibtex @article{ke2026view2space, title={VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations}, author={Ke, Fucai and Cai, Zhixi and Li, Boying and Chen, Long and Lin, Beibei and Wang, Weiqing and Haghighi, Pari Delir and Haffari, Gholamreza and Rezatofighi, Hamid}, journal={arXiv preprint arXiv:2603.16506}, year={2026} }

搜集汇总
数据集介绍
view2space-v1 数据集图片
构建方式
VIEW2SPACE v1是一个面向空间推理的多视角视觉-语言评估数据集。该数据集基于稀疏视角下的静态场景设置构建,通过从不同位置与角度捕获同一场景的图像,并设计三类核心视觉推理任务——数量计数(count)、目标检测(detect)与多项选择题(mcq)。每条数据以JSONL格式存储,包含问题标识、问题文本、选项、答案及多张关联图像路径等字段,其中图像路径相对于数据集根目录。数据集结构清晰,每个子集仅包含一个overall.jsonl文件,共约数万条样本,覆盖了从简单计数到复杂空间关系推理的多样化场景。
特点
该数据集的核心特点在于其多视角与稀疏观测的结合。不同于传统视觉问答数据集仅依赖单张图像,VIEW2SPACE要求模型从三张不同视角的图片中综合理解三维空间布局,从而推理物体间的相对位置关系。数据集精心设计了三个子任务:count考验对特定物体的数量感知能力,detect关注目标的精准定位,mcq则侧重于空间关系推理,如判断物体间的左右、前后方位。所有样本均具有高质量的标注和一致的数据格式,为评估多模态大模型的空间推理能力提供了标准化基准。
使用方法
使用VIEW2SPACE v1数据集时,用户需首先下载数据集压缩包,并保持目录结构不变。通过Python脚本加载对应子集的overall.jsonl文件,解析每条JSON记录即可获取问题文本、选项及图像路径。图像路径应拼接数据集根目录以正确读取图片。该数据集主要用于模型评估,用户可直接调用预训练的多模态大模型进行零样本或少样本测试,计算不同子任务上的准确率。详细的代码示例和更新说明已在官方GitHub仓库发布,用户可参考其文档进行自定义评估流程。
背景与挑战
背景概述
VIEW2SPACE v1数据集于2026年由Ke Fucai、Cai Zhixi等来自多家机构的研究人员联合创建,旨在探究多视角稀疏观测下的视觉空间推理能力。该数据集聚焦于视觉问答任务,覆盖计数、检测与多项选择三大子集,通过模拟真实世界中仅从有限视角感知场景的困境,推动视觉语言模型对三维空间关系的深层理解。作为ECCV 2026的收录工作,VIEW2SPACE为多视角推理领域提供了标准化评测基准,其开源发布有力促进了跨视角几何与语义联合建模的研究进展。
当前挑战
所解决的领域挑战在于视觉语言模型长期难以利用稀疏多视角信息进行精确空间推理,例如在仅有2-3张图像时判断物体相对方位或计数,这要求模型具备跨视角对应与三维重构能力。构建过程中,研究者需克服真实多视角数据采集成本高、空间标注一致性难保证等问题,通过合成场景自动生成带精确空间标签的多视图样本,并设计多样化问题模板以覆盖不同推理维度,最终形成高度可控的评测集。
常用场景
经典使用场景
VIEW2SPACE v1作为多视角视觉语言评估基准,其核心应用场景在于评估和比较视觉语言模型在多视角稀疏观测条件下的空间推理能力。该数据集通过精心设计的计数、检测和多项选择问答三个子集,系统性地测试模型在缺乏完整观测信息时,能否从多个不完整视角中整合空间线索,准确判断物体间的相对位置、数量关系及隐式空间结构。研究人员常利用该数据集的标准化评估协议,对多模态大模型进行零样本或少样本条件下的空间理解能力评测,从而为模型在复杂视觉环境中的泛化性能提供可量化的衡量标准。
解决学术问题
该数据集精准地解决了视觉语言领域长期存在的学术难题——如何系统评估模型在多视角稀疏观测下的空间推理能力。传统视觉问答数据集往往依赖单张图像或完整的多视角信息,忽略了实际场景中观测数据不完整、视角稀疏的现实约束。VIEW2SPACE v1通过引入有限视角下的计数、检测和空间关系问答任务,揭示了现有大模型在空间理解上的脆弱性,推动了学术界对多视角信息融合、隐式三维推理、视角变换不变性等基础问题的深入研究。其意义在于为多模态推理研究设立了更贴近真实世界的评测标杆,激励研究者开发具备更强空间认知能力的视觉语言模型。
衍生相关工作
基于VIEW2SPACE v1数据集,研究社区已衍生出多项重要的创新工作。其配套发布的训练数据集(Pokerme/view2space-train)和4B量级的模型检查点(Pokerme/view2space_4b)为后续研究提供了直接可用的基线和训练资源。相关论文《VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations》已被ECCV 2026接收,系统阐述了多视角稀疏观测推理的理论框架。此外,该数据集促进了对多视角视觉提示工程、跨视角特征对齐、空间关系图推理等子方向的研究,催生了多个基于该基准进行改进的视觉语言模型架构,推动了多模态推理从单视角向多视角范式的转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务