遇见数据集

view2space-train

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

VIEW2SPACE训练数据集是一个专门用于多视角视觉语言空间推理的大规模公开数据集,包含604,779个训练示例和22,205张公开图像,旨在支持多视角视觉推理任务的研究。数据集涵盖三种公开问题类型:计数(count)、检测(detect)和多项选择题(mcq)。与评估版本不同,训练版本保留了支持推理链(chain_of_thought),可用于监督学习。每个训练示例以JSONL格式存储,包含匿名化的问题ID、问题类型、问题文本、多项选择选项(仅限MCQ问题)、正确答案、图像路径(相对路径)以及支持信息(包括可选的绘制框和推理链)。图像路径指向数据集根目录下的images文件夹。该数据集适用于视觉问答、空间推理、多模态理解等任务的研究和模型训练。

The VIEW2SPACE training dataset is a large-scale public dataset specifically designed for multi-view visual-language spatial reasoning. It contains 604,779 training instances and 22,205 public images, and aims to support research on multi-view visual reasoning tasks. The dataset covers three public question types: count, detect, and multiple choice question (MCQ). Unlike the evaluation split, the training split retains chain-of-thought support, which can be used for supervised learning. Each training instance is stored in JSONL format, including anonymized question ID, question type, question text, multiple choice options (only for MCQ questions), correct answer, image path (relative path), and supporting information (including optional bounding boxes and chain-of-thought). The image path points to the images folder under the root directory of the dataset. This dataset is applicable to research and model training for tasks such as visual question answering, spatial reasoning, and multimodal understanding.

创建时间:
2026-06-22
原始信息汇总

数据集概述:VIEW2SPACE Training

VIEW2SPACE Training 是一个用于多视角视觉-语言空间推理的训练数据集,旨在通过稀疏观察研究多视角视觉推理。

核心信息

  • 数据集名称:VIEW2SPACE Training
  • 任务类别:视觉问答 (Visual Question Answering)
  • 关联论文:VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations (ECCV 2026)
  • arXiv2603.16506
  • 项目主页Project Page

数据规模与构成

  • 训练样本:604,779 个
  • 公开图片:22,205 张
  • 问题类型:包含三种公开问题族:
    • count(计数)
    • detect(检测)
    • mcq(多选题)

注意:训练包保留了 supporting.chain_of_thought 字段,可用于监督训练。

目录结构

view2space-train-release/ README.md overall.jsonl images/ img_000001.png img_000002.png ...

数据格式

每条训练样本以 JSONL 格式存储,每条记录包含以下字段:

字段 说明
q_idx 匿名化的问题ID,例如 count_000001
q_type 问题类型:countdetectmcq
question 问题文本
options 多选题选项(仅 MCQ 问题有效,非 MCQ 问题为空)
question_prompt 额外提示文本(如有)
answer 标准答案
image_paths 相关图片的相对路径列表
supporting.draw_boxes 可选输入框(与部分图片关联)
supporting.chain_of_thought 用于训练的推理过程记录

说明

  • image_paths 相对于数据集根目录,例如 images/img_000123.png
  • 原始场景名称、图片名称及细粒度问题类型已在公开版本中匿名化

示例记录

json { "q_idx": "mcq_000001", "q_type": "mcq", "question": "Based on these four images (image 1, 2, 3, and 4) showing the ball from different viewpoints (front, left, back, and right), with each camera aligned with walls and partially capturing the surroundings: From the viewpoint presented in image 4, what is to the left of ball?", "options": { "A": "tv", "B": "fountain", "C": "sofa", "D": "table" }, "question_prompt": "", "answer": "B", "image_paths": [ "images/img_000001.png", "images/img_000002.png", "images/img_000003.png", "images/img_000004.png" ], "supporting": { "draw_boxes": null, "chain_of_thought": "<think> ... </think> <answer> B </answer>" } }

许可与引用

  • 许可证:Creative Commons Attribution 4.0 International License (CC BY 4.0)
  • 预期用途:学术与研究用途,用于训练、评估、基准测试、数据分析或作为更大数据集的一部分时,需引用本数据集。
  • 引用格式

bibtex @article{ke2026view2space, title={VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations}, author={Ke, Fucai and Cai, Zhixi and Li, Boying and Chen, Long and Lin, Beibei and Wang, Weiqing and Haghighi, Pari Delir and Haffari, Gholamreza and Rezatofighi, Hamid}, journal={arXiv preprint arXiv:2603.16506}, year={2026} }

相关发布

搜集汇总
数据集介绍
view2space-train 数据集图片
构建方式
VIEW2SPACE训练数据集专为多视图视觉语言空间推理任务而设计,其构建过程依托于稀疏观测条件下的空间理解挑战。该数据集汇集了604,779个训练样本,覆盖22,205张公开图像,样本以JSONL格式存储于overall.jsonl文件中,每行对应一个独立样本。每个样本包含匿名化问题标识符、问题类型(计数、检测或多选题)、问题文本、答案、图像路径列表以及辅助信息。特别地,支持字段中保留了draw_boxes(可选输入框)与chain_of_thought(推理链),为模型提供显式的逐步推理监督信号。图像路径均相对于数据集根目录组织,原始场景名称与细粒度问题类型在公开版本中已做匿名化处理。
特点
该数据集最具特色之处在于其针对多视图空间推理的精细设计,涵盖计数(count)、检测(detect)与多选题(mcq)三大公开问题族,全面评估模型从不同视角整合视觉信息的能力。与评测版本不同,训练集公开了chain_of_thought字段,提供完整的推理链作为监督,便于研究者进行可解释性分析与知识蒸馏。每个样本通常包含同一场景下多个视角的图像(如正面、左面、背面、右面),并带有对齐的摄像机参数描述,模拟真实世界中从稀疏观测理解三维空间布局的挑战。数据集的多样性体现在超过60万样本与2万张图像上,为大规模训练提供了坚实基础。
使用方法
使用该数据集时,研究者需首先解压文件并定位至数据集根目录,随后通过读取overall.jsonl文件逐行加载JSONL记录。一个典型的加载流程包括:使用json.loads解析每一行文本,提取q_idx、q_type、question、answer等字段;根据image_paths列表构建完整图像路径并加载对应图像;若需要利用推理链进行训练,可访问supporting.chain_of_thought获取逐步推理文本。对于多选题样本,还需解析options字段以获取候选答案。数据集的Python加载示例已集成至官方代码库,支持快速启动训练或评估流程。所有数据均采用CC BY 4.0许可,并鼓励学术引用。
背景与挑战
背景概述
VIEW2SPACE训练数据集由Fucai Ke、Zhixi Cai等研究者在2026年发布,旨在探索多视图视觉语言空间推理这一前沿领域。该数据集由ECCV 2026接收论文衍生而来,包含超过60万个训练样本和2.2万张公开图像,围绕计数、检测和多项选择三大问题族构建,为多视角稀疏观测下的空间关系理解提供了大规模监督资源。其核心研究问题在于如何利用有限视角的图像信息,结合语言描述进行精确的空间推理,这一方向对具身智能、自动驾驶和三维场景理解等领域具有重要推动意义。数据集通过公开思维链推理过程,为模型学习多视图空间知识提供了独特的训练信号,促进了多模态大模型在空间推理任务上的能力提升。
当前挑战
该数据集所解决的领域挑战在于多视图空间推理中稀疏观测与丰富空间语义之间的鸿沟,传统方法往往依赖密集视角或三维重建,难以在仅有少数几个图像的情况下完成准确的物体定位与空间关系判断。具体而言,学生模型需从四个不同视角的图像中推断物体之间左右、前后等相对位置,这对视觉特征对齐与空间抽象能力提出了极高要求。在构建过程中,研究者面临了大规模合成场景的生成、视角对齐、问题类型的多样性设计以及歧义样本过滤等挑战,同时匿名化处理以保证数据隐私,并确保不同问题族之间的难度可控与分布平衡,最终形成了兼顾数据规模与任务难度的训练资源。
常用场景
经典使用场景
VIEW2SPACE训练集是视觉与语言交叉领域的一项开创性资源,专为多视角视觉空间推理任务设计。该数据集包含超过六十万条训练样本,覆盖count、detect和mcq三大问题族,每条样本均提供多视角图像对、空间位置标注及完整的思维链(chain-of-thought)推理过程。研究者可基于此数据集,训练模型从稀疏视角的图像中理解三维场景布局、推断物体间空间关系,并执行计数、检测与多选问答等细粒度推理任务。其独特的带思维链监督设计,为探索可解释、可推理的多模态模型提供了理想的学习基准。
实际应用
在实际应用层面,VIEW2SPACE训练集为诸多需要三维空间理解能力的智能系统注入了关键数据动力。例如,在家庭服务机器人领域,机器人可通过多摄像头图像快速判断“电视左侧是什么物体”,从而规划抓取或导航路径;在自动驾驶场景中,车辆可利用稀疏视角的感知信息推理出障碍物的精确方位;在增强现实(AR)设备中,系统能更准确地理解用户视角变化带来的空间关系重构。此外,该数据集所训练的模型还可辅助虚拟现实内容生成、三维场景重建以及智能监控中的异常行为分析,展现出广泛而深远的产业化潜力。
衍生相关工作
基于VIEW2SPACE数据集,学术界已涌现出一系列具有代表性的衍生工作。包括基于多视角视觉编码器的空间特征提取方法、融合思维链监督的可解释推理框架,以及专门针对稀疏视角优化的轻量级空间理解模型。其中,配套发布的4B参数模型checkpoint(Pokerme/view2space_4b)为后续研究提供了强有力的基线,许多后续工作在此基础上改进了对遮挡、视角变化与复杂空间语义的鲁棒性。此外,该数据集还与评估版本view2space-v1共同构成了完整的“训练-评测”体系,催生了关于多视角问答基准构建、跨视角知识迁移及多模态推理链优化等多个方向的深入探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务