遇见数据集

shana643/SpatialForge

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

SpatialForge-10M是一个大规模视觉语言数据集,专为从开放世界2D图像进行3D感知空间感知和推理而设计。该数据集包含超过1000万个问答对,这些问答对源自280万张精选的真实世界图像,覆盖了低层空间感知和高层空间推理任务。数据集构建自多样化的开放世界图像源,包括Objects365、Pixmo和OpenImages,确保了室内、室外、自我中心和互联网规模场景的广泛视觉多样性。它适用于空间推理预训练、多任务视觉语言模型监督、3D感知学习、接地和指代研究、相机中心和人本中心推理以及空间指令调优,并支持统一问答格式,适合训练现代多模态大语言模型,如Qwen-VL、InternVL和LLaVA。

SpatialForge-10M is a large-scale vision-language dataset designed for 3D-aware spatial perception and reasoning from open-world 2D images. The dataset contains over 10 million QA pairs generated from 2.8 million curated real-world images, covering both low-level spatial perception and high-level spatial reasoning tasks. It is constructed from diverse open-world image sources including Objects365, Pixmo and OpenImages, enabling broad visual diversity across indoor, outdoor, egocentric, and internet-scale scenes. The dataset is designed for spatial reasoning pretraining, multitask VLM supervision, 3D-aware perception learning, grounding and referring research, camera-centric and human-centric reasoning, and spatial instruction tuning, and supports a unified QA format suitable for training modern multimodal large language models such as Qwen-VL, InternVL, and LLaVA.

提供机构:
shana643
搜集汇总
数据集介绍
shana643/SpatialForge 数据集图片
构建方式
SpatialForge-10M是一个面向三维空间感知与推理的大规模视觉语言数据集,其构建基于从Objects365、Pixmo及OpenImages等公开图像数据集中精选的280万张真实世界图像。研究者通过自动化标注流水线,从二维图像中挖掘三维空间关系,包括物体级与人际间的相对深度、水平方位及视角理解,并生成超过1000万对涵盖感知与推理任务的问题-答案对。数据集的标注格式统一,边界框坐标归一化至[0,1000]区间,以确保与Qwen3-VL等现代多模态大语言模型的预训练流程兼容。
特点
该数据集的核心特点在于其同时覆盖低层空间感知与高层空间推理两大任务层级,具体包含定位、指代、计数、远近判断、左右关系及视角理解六类任务,其中定位与指代任务各贡献360万对样本,远近推理任务亦有260万对,形成了结构化的空间知识体系。数据来源的开放世界特性赋予其丰富的场景多样性,涵盖室内外环境、人机交互及互联网图像,从而支持从物体中心到人类中心的多种空间推理范式,尤其适用于多任务视觉语言模型的预训练与指令微调。
使用方法
使用SpatialForge-10M时,需先从Hugging Face Hub下载完整的标注文件,包含所有问答对与任务划分,随后从原始图像源(如Objects365等)获取对应的图片数据。数据集以统一的JSON格式组织,可直接用于训练Qwen-VL、InternVL及LLaVA等模型,其边界框坐标的标准化处理简化了模型输入接口。用户可依据任务类型(感知或关系推理)和图像来源进行灵活的数据拆分,以适应不同的训练需求与研究目标。
背景与挑战
背景概述
SpatialForge-10M是由岭南大学与XPENG Robotics团队于2026年联合推出的大规模视觉-语言数据集,旨在突破二维图像中三维空间感知与推理的瓶颈。核心研究问题聚焦于如何从开放世界的单目RGB图像中自动生成具有几何一致性与视角感知能力的空间监督信号,从而赋能多模态大模型(如Qwen-VL、InternVL)在低层次空间感知(如目标定位、计数)与高层次空间关系推理(如远近、左右及视角理解)上的联合学习。该数据集包含超过一千万问答对,源自Objects365、Pixmo和OpenImages等多元公开图像库,覆盖室内外、自我中心及互联网规模场景,显著拓展了空间推理预训练的视觉多样性。其通过自动引导(Bootstrapping)范式构建,无需人工标注三维真实信息即可为模型注入三维感知能力,对推动机器人、自动驾驶及增强现实等领域中的空间智能研究具有重要影响力。
当前挑战
SpatialForge-10M所面对的领域核心挑战在于,现有视觉-语言模型普遍缺乏对三维空间中物体相对关系(如深度比较、左右方位)的显式理解能力,而传统的三维数据采集依赖昂贵的传感器与人工标注,难以规模化推广。该数据集通过从二维图像中自动派生出上下米级别的深度排序以及基于相机坐标系的空间关系标签,解决了这一监督信号匮乏的难题。在构建过程中,团队面临的主要挑战包括:从异质开放世界图像中确保几何一致性——不同来源的图像视角、光照与遮挡模式迥异,需设计鲁棒的自动标注流水线以避免噪声传播;其次,在千万级问答对的编排中,需平衡感知与推理任务的比例,防止模型对简单定位任务过拟合而忽视复杂关系推理;此外,边界框的归一化尺度需适配不同预训练框架(如Qwen3-VL的[0,1000]格式),增加了数据格式统一的工程复杂度。
常用场景
经典使用场景
SpatialForge-10M作为专为三维感知空间推理设计的大规模视觉语言数据集,其核心应用场景聚焦于赋能多模态大模型在开放世界二维图像中习得三维感知能力。通过提供涵盖地面真值、指代表达、计数、远近关系、左右空间及人类视角推理等六大任务的超千万问答对,该数据集成为模型预训练与指令微调的关键基石,尤其适用于需要理解物体间几何关系和场景深度的视觉语言任务,为从二维像素到三维空间认知的跨越提供了高质量的训练资源。
实际应用
在现实应用中,SpatialForge-10M可用于提升机器人自主导航、增强现实交互、自动驾驶场景理解等需要精准空间判断的系统性能。例如,机器人可借助基于该数据集训练的模型实现“将杯子放在桌子左侧的盘子旁边”这类复杂指令,或在拥挤环境中准确识别并计数特定物体。此外,在视障辅助设备中,模型能够描述场景中物体间的左右与远近关系,为低视力用户提供更丰富的环境认知信息。该数据集还支持智能安防中的空间异常检测,以及虚拟现实中的场景自动构建与理解。
衍生相关工作
基于SpatialForge-10M,研究社区已衍生出多项经典工作:首先,它作为预训练语料显著提升了Qwen-VL、InternVL、LLaVA等主流多模态模型的空间推理基准表现;其次,围绕其任务结构,学者们进一步探索了3D感知与语言基础的联合学习范式,催生了诸如“场景图增强的视觉问答”、“动态空间关系推理”等研究方向。此外,数据集的分层任务设计启发了一系列针对空间感知的精细化评估基准,如SpatialBench,推动了领域评价体系的完善。其自举数据生成管线也被后续工作借鉴,用于构建更大规模的多样化空间理解数据集。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务