GSA_volc
收藏资源简介:
GSA_volc是一个大规模、多维度、面向具身感知的视觉-语言训练数据集,旨在训练能够理解、推理并与物理世界交互的具身智能体(教师模型)。数据集围绕“接地-空间-可供性”(Grounding-Spatial-Affordance, GSA)三大能力支柱构建,细化为六个具体维度:目标定位(G_grounding)、空间关系(S_spatial)、物体属性识别(A_identity_attr)、物体状态理解(A_obj_state)、动作前提条件判断(A_action_precondition)以及动作接口生成(A_action_interface)。数据规模庞大,包含约58万张图像、超过326万条标注,其中专门为监督微调(SFT)准备了100万个样本,为基于策略梯度优化的强化学习(GRPO)准备了约25万个样本。数据来源于多个知名公开数据集(如Visual Genome、Grasp-Anything、Bridge Data V2)以及通过内部GSA数据飞轮流程自动生成并验证的标注。数据集采用与ms-swift训练框架兼容的格式进行组织,标注以JSONL文件存储,每条数据包含一个系统提示、用户问题(可包含图像占位符)和助手的标准答案(通常为结构化JSON)。所有空间坐标,包括边界框和点坐标,均统一归一化到[0, 1000)的千分尺范围。该数据集适用于视觉问答、目标检测、空间关系理解、机器人操作规划等多种具身AI相关的研究与模型训练任务。
数据集总览
数据集名称:GSA_volc - GSA Embodied Perception Training Dataset
许可证:Apache-2.0
任务类别:视觉问答、目标检测
语言:英文、中文
标签:具身智能、基础定位、空间推理、可供性、机器人
数据规模:1M < n < 10M
数据规模统计
| 指标 | 数量 |
|---|---|
| 总图像 | 约58万张 |
| 总标注 | 3,267,527个 |
| SFT样本 | 1,000,000条 |
| GRPO样本 | 250,526条 |
| 数据维度 | 6维(G_grounding / S_spatial / A_identity_attr / A_obj_state / A_action_precondition / A_action_interface) |
数据维度分布(SFT)
| 类别 | 目标占比 | 实际数量 |
|---|---|---|
| G (Grounding) | 40% | 400,000 |
| S (Spatial) | 40% | 400,000 |
| A (Affordance) | 20% | 200,000 |
目录结构
GSA_volc/ 数据集根目录包含以下子目录:
- images/:按来源组织的图像文件夹
- visual_genome/:108K张图像
- grasp_anything/:398K张图像
- benchmark/:47K张图像
- bridgev2/:25K张图像
- 以及其他来源
- annotations/:标注文件
- flywheel_verified/:经过GSA数据飞轮验证的标注(6维)
- converted/:从公开数据集转换的标注(160万条)
- sft_train.jsonl:ms-swift SFT格式(100万条)
- grpo_train.jsonl:ms-swift GRPO格式(25万条)
- flywheel_batches/:额外生成的批次配置
- metadata/:元数据文件
- manifest.json
- image_entries.jsonl
能力维度说明
| 维度 | 描述 | 典型字段 |
|---|---|---|
| G_grounding | 目标定位 | object_class, bbox |
| S_spatial | 空间关系 | subject, predicate, object, subject_bbox, object_bbox |
| A_identity_attr | 属性识别 | object_class, attributes |
| A_obj_state | 物体状态 | state_type, state_value |
| A_action_precondition | 动作前提条件 | can_do_now, blocked_by |
| A_action_interface | 动作接口 | grasp_point_2d, jaw_axis_2d |
数据来源
- Visual Genome(108K张图像):包含关系、物体、属性
- Grasp-Anything(398K张图像):抓取点标注
- Bridge Data V2(25K张):桌面操作轨迹
- GSA Data Flywheel(73K张经验证):自动生成并经VLM管线验证
- Benchmark Eval(47K张):机器人室内评估场景
- 其他来源:SpatialSense、DROID、Embodied-Reasoner、RefSpatial等
坐标约定
所有坐标均归一化为千分位比例 [0, 1000):
- BBox格式:[x1, y1, x2, y2],取值范围 [0, 999]
- 点格式:[x, y],取值范围 [0, 999]




