遇见数据集

jdopensource/JoyAI-Image-OpenSpatial

收藏
Hugging Face2026-07-16 更新2026-04-26 收录
官方服务:

资源简介:

JoyAI-Image-OpenSpatial是一个基于OpenSpatial构建的空间理解数据集,用于JoyAI-Image项目。完整数据集包含约600万个多轮视觉空间问答样本,覆盖7个开源数据集(ARKitScenes、ScanNet、ScanNet++、HyperSim、Matterport3D、WildRGB-D和Ego-Exo4D)和网络数据。任务涵盖广泛的空间理解能力,包括3D物体定位、深度排序、空间关系推理、距离估计等。数据集分为两个子集:default配置(约234万样本,来自开源场景数据集)和web配置(约363万样本,来自带有3D提升注释的网络图像)。每个样本包含多轮对话、唯一ID、数据源、图像数据、类型标签和元信息(如图像尺寸)。

JoyAI-Image-OpenSpatial is a spatial understanding dataset built on OpenSpatial, used in the JoyAI-Image project. The full dataset contains approximately 6 million multi-turn visual-spatial QA samples across 7 open-source datasets (ARKitScenes, ScanNet, ScanNet++, HyperSim, Matterport3D, WildRGB-D, and Ego-Exo4D) and web data. Tasks cover a wide range of spatial understanding capabilities, including 3D object grounding, depth ordering, spatial relation reasoning, distance estimation, and more. The dataset is released as two subsets: the default config (about 2.34 million samples from open-source scene datasets) and the web config (about 3.63 million samples from web images with 3D lifting annotations). Each sample includes multi-turn conversations, a unique ID, data source, image data, type label, and meta information (e.g., image dimensions).

提供机构:
jdopensource
搜集汇总
数据集介绍
jdopensource/JoyAI-Image-OpenSpatial 数据集图片
构建方式
JoyAI-Image-OpenSpatial数据集由京东开源团队构建,旨在推动视觉空间理解领域的发展。该数据集以OpenSpatial为基础,融合了ARKitScenes、ScanNet、ScanNet++、HyperSim、Matterport3D、WildRGB-D和Ego-Exo4D七个开源场景数据集,以及海量网络图像数据。通过多视角三维重建与深度估计技术,对每张图像进行精细的空间标注,生成涵盖3D物体定位、深度排序、空间关系推理与距离估计等多维度任务的问答对。数据集分为两个子集:default配置包含约234万样本,源自七类开源场景;web配置包含约363万样本,来源于带有三维提升注释的网络图像。所有数据均以Parquet格式存储,便于高效加载与处理。
特点
JoyAI-Image-OpenSpatial数据集拥有约600万轮次的多轮视觉空间问答样本,规模宏大且内容丰富。其核心特色在于覆盖了从室内场景到野外环境的多样化图像来源,任务类型全面,包括3D物体定位、深度顺序判别、空间关系推理与距离估计等,能够全面评估模型的空间理解能力。数据格式设计精巧,每样本包含图像、多轮对话、数据来源及元信息,其中对话以人类提问与GPT回答形式呈现,问答内容结构化且包含相机参数与三维空间标注。此外,数据集的类型标签与元信息字段进一步增强了数据的可解释性与灵活性,为不同研究需求提供了便利。
使用方法
用户可通过HuggingFace的datasets库快速加载JoyAI-Image-OpenSpatial数据集。使用load_dataset函数并指定配置名称(default或web)即可获取对应子集,加载时支持流式模式以节省内存。每个数据样本包含conversations、id、data_source、images、type和meta_info字段,其中conversations为多轮对话列表,每轮包含发言者(from)与内容(value);images字段以二进制形式嵌入图像数据;meta_info以JSON字符串存储图像尺寸信息。用户可根据任务需求选择子集,例如使用default配置进行开源场景的空间理解训练,或使用web配置探索网络图像中的空间关系。数据集格式统一,便于集成到现有视觉语言模型训练流程中。
背景与挑战
背景概述
三维空间理解是计算机视觉与机器人领域的核心难题,旨在赋予模型从二维图像中感知深度、空间关系及物体布局的能力。JoyAI-Image-OpenSpatial数据集由京东探索研究院于2025年创建,基于OpenSpatial框架构建,整合了ARKitScenes、ScanNet、Matterport3D等七个开源场景数据集与网络图像数据,形成约600万条多轮视觉空间问答样本。该数据集专注于解决多视角几何推理、3D目标定位与空间关系建模等任务,为多模态大模型的空间感知能力评估提供了标准化基准。其发布推动了视觉语言模型从二维语义理解向三维物理世界认知的跨越,对具身智能、增强现实等前沿领域具有重要影响力。
当前挑战
该数据集所应对的领域核心挑战在于,现有视觉语言模型普遍缺乏对三维空间结构的系统理解,难以准确完成深度排序、物体遮挡推理或跨视角几何关联等任务。在构建过程中,研究者面临多重障碍:首先,需统一来自七个异构数据集的不同坐标系、标注粒度与传感器规格(如RGB-D相机与激光扫描仪),设计兼容的数据融合管线;其次,网络图像的3D提升注解涉及从单目图像推断深度与空间布局,依赖几何先验与多视图一致性约束,存在尺度歧义与噪声累积问题;此外,多轮对话格式的标注需兼顾自然语言交互的流畅性与空间参数的精确性,平衡了结构化表达与开放域回答之间的矛盾。
常用场景
经典使用场景
在三维视觉与空间理解领域,JoyAI-Image-OpenSpatial数据集被广泛用于训练和评估多模态大语言模型的空间感知能力。该数据集汇聚了来自ARKitScenes、ScanNet、Matterport3D等七个开源场景数据集以及网络图像的三维提升标注,形成了约六百万条多轮视觉空间问答样本。研究者利用这些样本进行三维物体定位、深度排序、空间关系推理与距离估计等经典任务的模型开发,显著提升了模型在复杂室内外场景中理解物体间空间布局的能力。数据集统一的多轮对话格式,将相机参数与结构化空间标注巧妙结合,为空间推理问题提供了标准化的训练范式,成为该领域基准评估的重要基石。
衍生相关工作
围绕JoyAI-Image-OpenSpatial数据集,学术界已衍生出多项具有标志性的研究工作。其依托的OpenSpatial基准平台,催生了一系列专注于三维空间理解的全新评估协议与模型架构。例如,部分工作利用该数据集的多轮对话特性,发展了基于多视角对齐的空间关系编码器,显著提升了模型在未见场景中的接地性能。另有研究将其与视觉语言预训练范式结合,设计出兼顾局部深度排序与全局场景图构建的联合学习框架。这些衍生工作不仅验证了数据集的广泛适用性,还反哺了数据集本身的演进,推动了数据生成策略的创新,如自动化三维标注与跨域数据增强技术,形成了一个蓬勃发展的研究生态。
数据集最近研究
最新研究方向
随着具身智能与三维视觉的深度融合,空间理解能力成为多模态大模型突破的关键瓶颈。JoyAI-Image-OpenSpatial数据集应运而生,其以约600万条多轮视觉-空间问答样本为核心,整合了ARKitScenes、ScanNet、Matterport3D等七个开源场景数据集与网络三维提升标注数据,全面覆盖3D目标定位、深度顺序推理、空间关系推断与距离估计等前沿任务。该数据集的设计紧密契合了从二维感知向三维推理跃迁的研究热点,尤其为弱监督下的空间推理与跨场景泛化提供了规模化训练基础。通过引入相机参数与结构化空间标注的对话范式,它推动了视觉问答系统在复杂三维环境中的认知能力演化,对构建具有空间意识的通用人工智能代理具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务