遇见数据集

SpatialForge

收藏
Hugging Face2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

SpatialForge-10M是一个专为从开放世界2D图像中进行3D感知的空间感知与推理而设计的大规模视觉-语言数据集。它包含超过1000万个问答对,源自280万张经过精心筛选的真实世界图像,覆盖从低层空间感知到高层空间推理的多种任务。图像数据来源于多样化的开放世界图像集(如Objects365、Pixmo和OpenImages),确保了在室内、室外、自我中心视角及互联网规模场景中的广泛视觉多样性。数据集旨在支持空间推理预训练、多任务视觉语言模型监督、3D感知学习、基础与指代研究、相机中心与人类中心推理以及空间指令微调。核心内容包含六大空间任务,分为感知任务(包括基础定位、指代描述和对象计数)和关系推理任务(包括远近深度判断、左右空间关系推断以及人类中心视角推理)。数据以统一的问答对格式组织,适用于训练现代多模态大语言模型(如Qwen-VL、InternVL、LLaVA),关键特征包括覆盖对象中心与人类中心的推理、边界框坐标归一化为[0, 1000]的格式(遵循Qwen3-VL预训练惯例),并强调从2D图像中构建几何一致且具有视角感知的空间监督信号。

SpatialForge-10M is a large-scale vision-language dataset designed for spatial perception and reasoning with 3D awareness from open-world 2D images. It contains over 10 million question-answer pairs derived from 2.8 million carefully curated real-world images, covering a range of tasks from low-level spatial perception to high-level spatial reasoning. The image data is sourced from diverse open-world image collections, including Objects365, Pixmo, and OpenImages, ensuring broad visual diversity across indoor, outdoor, egocentric, and internet-scale scenes. The dataset aims to support spatial reasoning pre-training, multi-task vision-language model supervision, 3D-aware learning, grounding and referring research, camera-centric and human-centric reasoning, and spatial instruction tuning. Its core content comprises six spatial tasks, divided into two categories: perception tasks (including grounding localization, referring description, and object counting) and relational reasoning tasks (including far-near depth judgment, left-right spatial relationship inference, and human-centric perspective reasoning). Data is organized in a unified question-answer pair format, suitable for training modern multimodal large language models such as Qwen-VL, InternVL, and LLaVA. Key features include coverage of object-centric and human-centric reasoning, bounding box coordinates normalized to [0, 1000] (following Qwen3-VL pre-training conventions), and an emphasis on constructing geometrically consistent and viewpoint-aware spatial supervision signals from 2D images.

创建时间:
2026-05-21
原始信息汇总

数据集概述:SpatialForge-10M

SpatialForge-10M 是一个大规模视觉语言数据集,专为从开放世界二维图像中学习三维感知的空间感知与推理而设计。

核心数据

  • 规模:包含超过 1000 万 个问答对,源自 280 万 张经过筛选的真实世界图像。
  • 许可:Creative Commons Attribution Non Commercial 4.0 (cc-by-nc-4.0)。
  • 语言:英语。
  • 数据来源:基于大规模的公开图像数据集构建,包括 Objects365PixmoOpenImages,覆盖室内、室外、自我中心视角及互联网规模的多样化场景。

任务架构

数据集包含六大空间任务,分为感知关系推理两个层级:

层级 任务 描述 数量
感知 定位 (Grounding) 根据文本描述定位物体 → 预测边界框 360 万
指代 (Referring) 根据区域/边界框生成物体描述 360 万
计数 (Counting) 计算满足语义条件的物体数量 49.5 万
关系推理 远近 (Near-Far) 判断物体之间的相对深度 260 万
左右 (Left-Right) 推断以相机为中心的水平空间关系 9.3 万
视角 (Perspective) 以人为中心的视角与空间推理 0.8 万
总计 1020 万

关键特性

  • 统一格式:采用统一的问答格式,适用于训练现代多模态大语言模型,如 Qwen-VL、InternVL 和 LLaVA。
  • 边界框格式:边界框坐标归一化至 [0, 1000] 范围内。
  • 设计目标:适用于空间推理预训练、多任务视觉语言模型监督、三维感知学习、指代与定位研究、以相机/人为中心的推理以及空间指令微调。

重要说明

该数据集仅提供完整的注释文件(问答对与任务划分),用户需要自行从图像来源数据集(Objects365、OpenImages、Pixmo)获取对应的原始图像。

搜集汇总
数据集介绍
SpatialForge 数据集图片
构建方式
SpatialForge-10M是一个面向三维感知空间推理的大规模视觉语言数据集,其构建过程基于对公开开放世界二维图像的深度挖掘与自动化标注。研究团队从Objects365、Pixmo和OpenImages等多样化图像源中精选了约280万张真实世界图像,覆盖室内外场景、人机交互、拥挤物体布局及互联网图像等丰富视觉域。通过自研的引导式管道,系统自动从二维图像中提取空间监督信号,融合几何一致性与视角感知,生成了跨越低层次空间感知与高层次关系推理的超过1000万个问答对。所有边界框均归一化至[0, 1000]范围,与Qwen3-VL预训练格式一致,确保了对现代多模态大语言模型的高效适配。
特点
该数据集的核心特色在于其系统性设计的六维空间任务体系,分为感知与关系推理两大层次。感知层涵盖定位、指代与计数任务,分别对应从文本描述定位物体、从区域生成描述以及统计满足条件的物体数量,总计约770万个问答对;关系层则包含远近深度比较、左右水平关系推断以及以人为中心的视角理解,总计约270万个问答对。这种结构不仅实现了从基础感知到高阶推理的递进式覆盖,还兼顾了物体中心与人类中心的空间理解,为视觉语言模型提供了兼具广度与深度的空间知识训练资源。
使用方法
SpatialForge-10M以统一问答格式发布全套标注数据,包括所有问答对与任务划分文件,可与Qwen-VL、InternVL、LLaVA等主流多模态大语言模型无缝集成。用户需从原始图像源获取对应图片,随后通过Hugging Face Hub下载标注压缩包。数据集支持空间推理预训练、多任务视觉语言模型监督、三维感知学习、定位指代研究以及空间指令微调等多种应用场景。研究团队建议用户在模型微调时按照任务类型灵活采样,以充分发挥感知与关系层次结合的训练优势,进而提升模型在真实世界空间理解任务中的泛化能力。
背景与挑战
背景概述
SpatialForge-10M是由香港岭南大学与XPENG Robotics团队合作创建的视觉-语言数据集,发表于2026年。其核心研究问题在于如何从开放世界的2D图像中自举出3D感知空间推理能力,以弥补当前多模态大语言模型在空间关系理解方面的结构性缺失。该数据集以超过1000万个问答对、280万张多样化真实世界图像为基础,整合了Objects365、Pixmo和OpenImages三大公开数据集,覆盖室内、室外、以自我为中心及互联网场景,为视觉与空间推理的交叉领域提供了前所未有的资源支持。它已迅速成为空间推理预训练、多任务视觉语言模型监督及3D感知学习的重要基准,显著推动了多模态人工智能的空间认知能力发展。
当前挑战
SpatialForge所解决的领域挑战在于,现有视觉-语言模型普遍缺乏对物体间深度、左右、视角等三维空间关系的可靠理解,而这种能力正是迈向通用智能的关键。构建过程中,团队面临核心挑战:如何在仅依赖二维图像、无3D标注的前提下,自动生成具有几何一致性的空间监督信号。为此,他们设计了一套自举流水线,从大规模真实图像中合成低阶感知(如定位与计数)和高阶推理(如远近与视角关系)任务,并确保标注质量与视角合理性。此外,跨源图像的格式、尺寸与标注风格差异也需统一,以适配如Qwen3-VL等主流模型的训练格式,这些都是数据工程层面难以回避的障碍。
常用场景
经典使用场景
在三维感知与空间推理的研究浪潮中,SpatialForge数据集以其海量的十亿级问答对和丰富多样的开放世界图像来源,成为训练现代多模态大语言模型(如Qwen-VL、InternVL、LLaVA等)的核心基石。其最经典的使用场景是作为大规模空间推理预训练的监督信号,覆盖从低层级空间感知(如物体定位、描述与计数)到高层级关系推理(如近远判断、左右区分、视角理解)的完整任务谱系,为模型习得三维空间认知能力提供了统一的问答格式与标准化标注。
衍生相关工作
SpatialForge的推出催生了一系列影响深远的衍生工作。其发布的六类空间任务标注直接支撑了面向三维感知的多任务联合训练框架,激发了研究者探索如何将空间推理指令融入多模态大模型微调流程的新范式。此外,围绕该数据集的基准测试与模块化任务设计,衍生出大量关于视角自适应定位、跨场景空间泛化以及人类中心推理的可解释性研究。这些工作不仅丰富了空间推理的理论体系,还为后续构建更具真实世界认知能力的具身智能系统提供了可复用的数据基础与评测基准。
数据集最近研究
最新研究方向
当前,三维空间感知与推理能力正成为多模态大语言模型从平面视觉理解迈向具身智能的关键瓶颈。SpatialForge-10M数据集应运而生,通过从Objects365、OpenImages和Pixmo等开放世界二维图像中自举生成超过1000万对空间问答数据,涵盖了目标定位、引用描述、计数、远近深度比较、左右空间关系及人类视角推理六大任务。这一大规模资源不仅有效弥合了二维视觉与三维空间认知之间的鸿沟,还为Qwen-VL、InternVL、LLaVA等现代视觉语言模型提供了统一的多任务预训练与指令微调方案。其核心价值在于利用几何一致性与视角感知约束,从海量无标注的开放世界图像中自动挖掘空间监督信号,从而推动模型在城市导航、人机交互、自动驾驶等复杂场景中实现鲁棒的三维空间推理能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务