遇见数据集

GEM-250K

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

GEM-250K是一个用于具身智能的大规模视觉语言数据集,隶属于GEM(Generative-supervised Embodied vision-language Model)项目。该数据集旨在通过集成生成式监督(特别是深度图生成任务)来增强视觉语言模型在具身环境中的性能,弥合高级语义理解与低级空间物理知识之间的差距。数据集包含约250,800个样本,涵盖三种核心任务类型:时空规划、具身接地和空间推理。数据以两种配置组织:默认配置包括图像、问题、答案和问题类型字段,适用于图像-文本到文本任务;空间推理配置则包含视频、问题、答案和问题类型字段。所有数据均为英文,规模在100万到1,000万样本之间。该数据集支持视觉语言模型和视觉-语言-动作框架的训练与评估,特别适用于机器人技术中的接地、推理和规划等具身智能任务。

GEM-250K is a large-scale vision-language dataset for embodied intelligence, belonging to the GEM (Generative-supervised Embodied vision-language Model) project. This dataset aims to enhance the performance of vision-language models in embodied environments by integrating generative supervision, particularly depth map generation tasks, and bridge the gap between high-level semantic understanding and low-level spatial physical knowledge. The dataset contains approximately 250,800 samples, covering three core task types: spatio-temporal planning, embodied grounding, and spatial reasoning. The data is organized in two configurations: the default configuration includes fields such as image, question, answer, and question type, which is suitable for image-text to text tasks; the spatial reasoning configuration contains video, question, answer, and question type fields. All data is in English, with a scale ranging from 1 million to 10 million samples. This dataset supports the training and evaluation of vision-language models and vision-language-action frameworks, and is particularly suitable for embodied intelligence tasks such as grounding, reasoning, and planning in robotics.

创建时间:
2026-05-25
原始信息汇总

数据集概述

数据集名称:GEM-250K
发布机构:清华大学与腾讯混元
许可证:MIT
语言:英文

目的与应用

GEM-250K 是 GEM(Generative-supervised Embodied vision-language Model) 项目的一部分,旨在通过引入深度图生成任务作为视觉-语言模型预训练的监督信号,弥补标准文本引导预训练范式与具身智能所需低层空间、物理知识之间的鸿沟。该数据集支持具身智能中的语义理解与物理操作能力提升。

数据规模与组成

  • 总下载大小:约 2.50 GB
  • 总数据集大小:约 2.54 GB
  • 样本数量:约 250,800 个(标注为 1M<n<10M 类别)

数据集包含两个配置(config):

  1. default(默认配置)

    • 特征:question_type(字符串)、image(图像)、question(字符串)、answer(字符串)
    • 子集
      • spatiotemporal_planning:49,800 个样本,约 666.69 MB
      • embodied_grounding:100,000 个样本,约 1.87 GB
    • 任务类型:图像-文本到文本
  2. spatial_reasoning(空间推理配置)

    • 特征:video(字符串)、question(字符串)、answer(字符串)、question_type(字符串)
    • 子集spatial_reasoning:101,000 个样本,约 36.65 MB
    • 任务类型:图像-文本到文本(注意:特征中视频为字符串路径)

数据内容与任务

  • 具身接地(embodied_grounding):包含图像及对应问题-答案对,用于地面实体与任务理解。
  • 时空规划(spatiotemporal_planning):包含图像及规划类问答,涉及时间与空间推理。
  • 空间推理(spatial_reasoning):以视频路径形式(字符串)提供视频文件,附带空间推理问答。

数据格式

  • 文件格式:Parquet

  • 目录结构

    GEM-250K/ ├── assets/ │ ├── GEM-demo.mp4 │ ├── overview.png ├── data/ │ ├── embodied_grounding-00000-of-00002.parquet │ ├── embodied_grounding-00001-of-00002.parquet │ ├── spatial_reasoning-00000-of-00001.parquet │ └── spatiotemporal_planning-00000-of-00001.parquet └── README.md

标签与分类

  • 任务类别:image-text-to-text
  • 标签:hunyuan、vision-language-model、vision-language-action、embodied、Spatial-Intelligence

引用

如需引用该数据集,请参考以下 BibTeX 格式:

@article{zhao2026gem, title={GEM: Generative Supervision Helps Embodied Intelligence}, author={Zhao, Ruowen and Li, Bangguo and Liu, Zuyan and Liang, Yinan and Ye, Junliang and Liu, Fangfu and Wu, Diankun and Wang, Zhengyi and Yu, Xumin and Rao, Yongming and others}, journal={arXiv preprint arXiv:2605.28548}, year={2026} }

搜集汇总
数据集介绍
GEM-250K 数据集图片
构建方式
GEM-250K 数据集是 GEM(生成式监督具身视觉-语言模型)项目的核心组成部分,旨在弥合标准文本引导预训练范式与具身环境执行所需低层空间物理知识之间的鸿沟。该数据集通过精心策划与整合,包含三个主要子集:具身定位(embodied_grounding)子集包含10万条样本,提供物体定位与场景理解的高质量配对数据;时空规划(spatiotemporal_planning)子集含4.98万条样本,专注于时序与空间推理任务;空间推理(spatial_reasoning)子集则贡献了10.1万条视频-问答对数据,强调空间关系的深度理解。所有样本均以 Parquet 格式存储,并附有详尽的问题类型、图像或视频路径、问题文本及标准答案等字段,形成了结构化且多模态的数据生态。
特点
GEM-250K 数据集最显著的特点在于其深度监督的生成式预训练范式。与传统的仅依赖语义标注的视觉-语言数据集不同,GEM-250K 创新性地将深度图生成任务融入预训练阶段,每一条样本均与高质量的深度监督信号紧密耦合。这种设计使得模型在训练过程中不仅关注高层次的语义理解,更能同时习得低层次的空间物理知识,显著增强了智能体在3D场景中的定位精度与运动规划能力。数据集覆盖了从基础物体接地到复杂时空推理的多样任务场景,规模达25万条,为具身智能研究提供了兼具广度与深度的训练资源,支持视觉-语言-动作(VLA)框架下的端到端学习。
使用方法
GEM-250K 数据集可通过 HuggingFace Datasets 库便捷加载与使用。用户可以通过指定配置名称(config_name)为 'default' 来访问全部三个子集,或通过 'spatial_reasoning' 配置单独获取空间推理数据。加载后,数据呈现为标准的数据集对象,包含 'question_type'、'image'(或 'video')、'question' 和 'answer' 等字段,便于直接用于视觉-语言模型的微调与评估。开发者可结合 transformers 或自定义的视觉-语言模型框架,将深度图生成任务作为辅助损失函数融入训练流程。该数据集兼容多模态输入处理管道,并已在其配套的 GEM-VLA 模型中验证了卓越的任务执行性能,适合模拟环境与真实世界机器人应用的研究与开发。
背景与挑战
背景概述
GEM-250K数据集由清华大学与腾讯混元团队于2026年联合创建,核心研究人员包括赵若闻、李邦国、刘祖岩等,旨在弥合具身视觉-语言模型(VLM)在高层次语义理解与低层次空间物理知识之间的鸿沟。该数据集作为GEM(生成监督具身视觉-语言模型)项目的重要组成部分,通过集成深度图生成任务到VLM预训练阶段,显著提升了模型在语义理解与物理操作两方面的能力。GEM-250K包含约25万条样本,涵盖具身定位、时空规划与空间推理等子集,并配有高质量深度监督信息,为具身智能研究提供了标准化的大规模训练资源。其在仿真环境与真实世界任务中的卓越表现,已使GEM成为具身人工智能领域具有影响力的基准数据集之一。
当前挑战
GEM-250K所解决的领域核心挑战在于传统文本引导的预训练范式过度关注高层语义,而忽视了具身环境执行所必需的低层空间与物理知识,导致模型在精细操作和物理交互中表现受限。构建过程中,团队需同时采集多模态数据(图像、视频、问题与答案),并配准高质量的深度图进行监督,这面临数据规模大、标注成本高以及模态对齐复杂等困难。此外,为确保数据集涵盖真实机器人场景的多样性,还需平衡接地、推理与规划等不同任务类型的样本分布,并保证时空一致性,从而有效支撑生成式监督训练的通用性需求。
常用场景
经典使用场景
GEM-250K作为GEM(生成式监督赋能的具身视觉语言模型)的核心训练数据集,主要用于具身智能领域中视觉-语言-动作(VLA)模型的预训练与微调。该数据集精心设计了三个关键子集:具身接地(embodied_grounding)包含10万条图像-问答对,用于培养模型对物理世界物体的精准定位与语义关联;时空规划(spatiotemporal_planning)包含约5万条样本,侧重于训练模型在动态环境下进行序列动作推理与路径规划;空间推理(spatial_reasoning)则包含约10.1万条视频-问答对,专注于提升模型对三维空间关系的理解能力。三个子集共同构建了一个从感知到决策的完整训练链条,使得模型能够同时掌握语义理解与物理操作所需的空间知识。
衍生相关工作
GEM-250K的发布催生了多项重要的衍生研究工作。其核心贡献——将深度图生成任务作为生成式监督信号引入视觉语言模型预训练——启发了后续一系列关于多模态生成式监督策略的探索。围绕该数据集,研究者们开展了包括基于深度信息的任务分解与因果推理、面向动态环境的空间感知动作规划、以及视觉-语言-动作联合建模中的多任务学习范式等方向的研究。此外,GEM-250K提出的接地、推理与规划三类任务协同训练框架,为构建更加通用的具身智能基础模型提供了重要的参考范式,推动了整个领域向更强大、更通用的具身智能系统演进。
数据集最近研究
最新研究方向
当前,具身智能领域正致力于弥合高级语义理解与低级空间物理知识之间的鸿沟,GEM-250K数据集应运而生,开辟了生成式监督助力具身视觉-语言模型(VLM)的新范式。该数据集通过整合深度图生成任务至预训练阶段,强化了模型在时空规划、具身定位与空间推理等前沿方向的能力。其独特价值在于融合了大规模、多粒度的接地、推理与规划数据,并辅以高质量的深度监督信号,显著推动了VLM从静态语义理解迈向动态物理执行。这一研究不仅提升了机器人在仿真与真实环境中的任务完成能力,更深刻影响了具身智能体对三维空间交互的认知,为构建兼具语义与物理智能的下一代机器人系统奠定了关键数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务