遇见数据集

GSA_volc

收藏
Hugging Face2026-06-19 更新2026-06-20 收录
官方服务:

资源简介:

GSA_volc是一个大规模、多维度、面向具身感知的视觉-语言训练数据集,旨在训练能够理解、推理并与物理世界交互的具身智能体(教师模型)。数据集围绕“接地-空间-可供性”(Grounding-Spatial-Affordance, GSA)三大能力支柱构建,细化为六个具体维度:目标定位(G_grounding)、空间关系(S_spatial)、物体属性识别(A_identity_attr)、物体状态理解(A_obj_state)、动作前提条件判断(A_action_precondition)以及动作接口生成(A_action_interface)。数据规模庞大,包含约58万张图像、超过326万条标注,其中专门为监督微调(SFT)准备了100万个样本,为基于策略梯度优化的强化学习(GRPO)准备了约25万个样本。数据来源于多个知名公开数据集(如Visual Genome、Grasp-Anything、Bridge Data V2)以及通过内部GSA数据飞轮流程自动生成并验证的标注。数据集采用与ms-swift训练框架兼容的格式进行组织,标注以JSONL文件存储,每条数据包含一个系统提示、用户问题(可包含图像占位符)和助手的标准答案(通常为结构化JSON)。所有空间坐标,包括边界框和点坐标,均统一归一化到[0, 1000)的千分尺范围。该数据集适用于视觉问答、目标检测、空间关系理解、机器人操作规划等多种具身AI相关的研究与模型训练任务。

创建时间:
2026-06-09
原始信息汇总

数据集总览

数据集名称:GSA_volc - GSA Embodied Perception Training Dataset

许可证:Apache-2.0

任务类别:视觉问答、目标检测

语言:英文、中文

标签:具身智能、基础定位、空间推理、可供性、机器人

数据规模:1M < n < 10M

数据规模统计

指标 数量
总图像 约58万张
总标注 3,267,527个
SFT样本 1,000,000条
GRPO样本 250,526条
数据维度 6维(G_grounding / S_spatial / A_identity_attr / A_obj_state / A_action_precondition / A_action_interface)

数据维度分布(SFT)

类别 目标占比 实际数量
G (Grounding) 40% 400,000
S (Spatial) 40% 400,000
A (Affordance) 20% 200,000

目录结构

GSA_volc/ 数据集根目录包含以下子目录:

  • images/:按来源组织的图像文件夹
    • visual_genome/:108K张图像
    • grasp_anything/:398K张图像
    • benchmark/:47K张图像
    • bridgev2/:25K张图像
    • 以及其他来源
  • annotations/:标注文件
    • flywheel_verified/:经过GSA数据飞轮验证的标注(6维)
    • converted/:从公开数据集转换的标注(160万条)
    • sft_train.jsonl:ms-swift SFT格式(100万条)
    • grpo_train.jsonl:ms-swift GRPO格式(25万条)
  • flywheel_batches/:额外生成的批次配置
  • metadata/:元数据文件
    • manifest.json
    • image_entries.jsonl

能力维度说明

维度 描述 典型字段
G_grounding 目标定位 object_class, bbox
S_spatial 空间关系 subject, predicate, object, subject_bbox, object_bbox
A_identity_attr 属性识别 object_class, attributes
A_obj_state 物体状态 state_type, state_value
A_action_precondition 动作前提条件 can_do_now, blocked_by
A_action_interface 动作接口 grasp_point_2d, jaw_axis_2d

数据来源

  • Visual Genome(108K张图像):包含关系、物体、属性
  • Grasp-Anything(398K张图像):抓取点标注
  • Bridge Data V2(25K张):桌面操作轨迹
  • GSA Data Flywheel(73K张经验证):自动生成并经VLM管线验证
  • Benchmark Eval(47K张):机器人室内评估场景
  • 其他来源:SpatialSense、DROID、Embodied-Reasoner、RefSpatial等

坐标约定

所有坐标均归一化为千分位比例 [0, 1000)

  • BBox格式:[x1, y1, x2, y2],取值范围 [0, 999]
  • 点格式:[x, y],取值范围 [0, 999]
搜集汇总
数据集介绍
GSA_volc 数据集图片
构建方式
GSA_volc数据集是一座精心构筑的具身感知训练宝库,其构建根植于大规模、多源的视觉与机器人数据生态。数据源横跨Visual Genome、Grasp-Anything、Bridge Data V2等公开数据集,并融合了GSA数据飞轮自动生成与VLM管线验证的高质量样本。总计约58万张图像与超过326万条标注,通过系统化的维度划分与格式转换,最终整理为面向SFT与GRPO训练的一百万条与二十五万条样本,确保了数据规模与多样性的统一。
特点
该数据集的核心魅力在于其六维能力架构,深度融合了定位、空间与可供性三大感知维度。具体包括物体定位、空间关系、属性识别、物体状态、动作前提及动作接口,使得模型能同时理解“物体在哪”、“物体间关系如何”以及“我能对其做什么”。所有坐标采用千分制归一化,保证了标注的一致性与泛化性,为具身智能体提供了从感知到行动的完整认知图谱。
使用方法
使用GSA_volc数据集时,可无缝集成ms-swift训练框架。用户需配置图像根目录,随后直接调用SFT或GRPO训练脚本,加载准备好的JSONL标注文件即可。数据集采用标准的多轮对话格式,以系统提示词引导模型扮演具身感知助手,用户交互包含图像标记与结构化问答,助理回答则以JSON格式输出检测框、空间关系或可供性信息,极大方便了视觉语言模型在机器人领域的微调与强化学习。
背景与挑战
背景概述
具身智能研究旨在赋予机器人理解物理世界并与环境自主交互的能力,其中视觉感知作为核心感知通道,亟需大规模、多模态的训练数据以支撑模型的学习。GSA_volc数据集由字节跳动等机构的研究团队于近期创建,专为具身感知教师模型设计,聚焦于接地(Grounding)、空间关系(Spatial)与可供性(Affordance)三大维度。该数据集包含约58万张图像与超过326万条标注,整合了Visual Genome、Grasp-Anything、Bridge Data V2等公开资源,并通过自主学习数据飞轮(GSA Data Flywheel)生成高质量验证样本。GSA_volc在视觉问答与目标检测任务中引入六维能力标注,为具身智能体的空间推理与动作规划提供了系统化的训练范式,对推动机器人自主感知与操作领域的发展具有重要影响。
当前挑战
GSA_volc数据集面临的核心挑战在于构建覆盖完整具身感知链的高质量标注体系。首先,领域问题方面,传统数据集多聚焦于单一视觉任务(如目标检测或属性识别),难以支撑机器人对物体位置、空间关系、状态及动作接口的联合推理,而GSA_volc需同时涵盖接地、空间与可供性六维信息,对标注粒度和一致性提出极高要求。其次,构建过程中,数据来源多样(模拟生成、机器人轨迹、真实场景),需解决异构标注格式的标准化转换与坐标归一化(千分制)问题;同时,通过自主数据飞轮生成的73万条验证样本需经视觉大语言模型流水线严格校验,以平衡自动标注的效率与人工验证的成本,确保标注质量满足教师模型训练需求。
常用场景
经典使用场景
在具身智能与机器人感知领域,GSA_volc数据集被广泛用于训练多模态大模型,使其在视觉问答与目标检测任务中具备精准的定位能力。该数据集的经典使用方式在于将细粒度视觉信息与自然语言指令相结合,通过监督微调(SFT)范式,使模型能够根据用户提出的诸如“图像中的杯子位于何处”或“该物体的抓取点在哪里”等问题,输出标准化的边界框或空间坐标。这种端到端的训练流程,不仅提升了模型对物体类别和位置的识别精度,还强化了其在杂乱场景中理解空间关系与交互可能性的能力。因此,GSA_volc已成为构建高鲁棒性具身感知教师模型的基石,推动着视觉语言模型从单纯的识别迈向真正意义上的空间推理与操作规划。
实际应用
在实际应用层面,GSA_volc赋能的服务机器人或工业机械臂能够通过单张图像迅速理解环境布局,从而执行精准抓取、避障导航与物品整理等复杂操作。例如,在家庭服务场景中,机器人可依据“将水杯放在茶壶左侧”的指令,先定位水杯与茶壶的空间位置,再规划抓取轨迹并执行移动。在仓储物流领域,该数据集训练的模型可识别包裹的朝向与堆叠状态,判断“能否抬起上层箱子”或“抓取点是否被遮挡”,从而优化分拣效率。此外,在自动驾驶与增强现实等涉及人机协作的系统中,这些感知能力也助力设备实时解析周围物体的可操作空间,大幅提升了交互的智能性与安全性。
衍生相关工作
GSA_volc数据集的发布催生了一系列重要的衍生研究工作,尤其是在视觉语言模型的规则化推理与自监督学习方面。基于其提供的SFT与GRPO训练格式,研究者开发了如Embodied-Reasoner等融合空间推理与常识知识的多模态架构。GSA数据飞轮(Data Flywheel)机制也被借鉴并扩展,形成了自动生成-验证-再训练的迭代优化流程,有效降低了高质量标注数据的获取成本。同时,该数据集的六维能力标签系统启发了一系列细粒度感知基准,如针对抓取点预测与动作前提判断的专项测评任务。这些工作共同推动了具身智能领域从静态数据集训练迈向动态环境适应与持续学习的新阶段。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务