遇见数据集

grounding-data

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

grounding_data 是一个汇总的注释数据集,专为 grounding(定位)和分割(segmentation)训练堆栈而设计。它包含来自多个权威数据集的图像注释、视频帧注释以及相关的标签信息,包括掩码、边界框、指代表达式、标题和类别词汇表。数据集总量约为 9,331,994 个文件,总大小约 1.20 TiB,以 255 个 tar 分片的形式存储,分布在 34 个组中。这些组涵盖视频数据(如 ViCaS、SA-FARI、BOSTVG、VIPOSeg)和图像数据(如 Adobe EntitySeg、COCO 2014/2017、GoldG、RF100-VL、COCONut、SA-1B 注释缓存、PixMo 指向缓存、RefCLEF 等),以及多个小规模数据集。数据以文件树形式组织,每个组有对应的索引文件(parquet 格式),支持按路径查找分片以提高访问效率。使用说明包括如何解压所有分片重建原始文件树,以及如何仅下载特定数据集的索引和关联分片。注意:注释中的绝对路径在解压后需要根据实际安装路径进行前缀替换。该数据集是第三方数据集的再分发镜像,并非新数据集,用户必须遵守各上游数据集(如 Adobe 非商业许可等)的许可条款。

grounding_data is a consolidated annotation dataset designed for grounding and segmentation training stacks. It contains image annotations, video frame annotations, and associated label information from multiple authoritative datasets, including masks, bounding boxes, referring expressions, captions, and category vocabularies. The dataset totals approximately 9,331,994 files with a total size of about 1.20 TiB, stored as 255 tar shards distributed across 34 groups. These groups cover video data (e.g., ViCaS, SA-FARI, BOSTVG, VIPOSeg) and image data (e.g., Adobe EntitySeg, COCO 2014/2017, GoldG, RF100-VL, COCONut, SA-1B annotation cache, PixMo pointing cache, RefCLEF, etc.), along with several small-scale datasets. Data is organized in a file tree structure, with each group having corresponding index files (parquet format) that support finding shards by path to improve access efficiency. Usage instructions include how to decompress all shards to reconstruct the original file tree, and how to download only the indices and associated shards of specific datasets. Note: Absolute paths in annotations need to be prefix-replaced based on the actual installation path after decompression. This dataset is a redistribution mirror of third-party datasets, not a new dataset; users must comply with the license terms of each upstream dataset (e.g., Adobe non-commercial license, etc.).

创建时间:
2026-09-10
原始信息汇总

grounding_data 数据集概述

基本信息

  • 数据集地址:https://huggingface.co/datasets/royguw/grounding-data
  • 名称:grounding_data - annotations and images
  • 许可证:other(mixed-upstream-licenses)
  • 许可证链接:https://huggingface.co/datasets/royguw/grounding-data#licensing-and-attribution
  • 规模:1M < n < 10M
  • 数据量:9,331,994 个文件 / 1.20 TiB
  • 打包方式:255 个 tar 分片,分布于 34 个分组

任务类别

  • image-segmentation
  • object-detection
  • mask-generation
  • image-to-text

标签

  • grounding
  • referring-expression-segmentation
  • video-object-segmentation
  • panoptic-segmentation
  • grounded-captioning

数据集内容

该数据集是 grounding/分割训练栈背后的标注树,同时包含与之共存的图像和视频帧。与仅含像素的配套数据集 royguw/mm-olmo-images 不同,本仓库包含标注:各数据集 cache/ 目录下的 parquet 缓存、JSON 标签文件和词表,掩码、边界框、指代表达、描述文本和类别词表均存于此。

目录结构

shards/<group>/<group>-00000.tar # 每个约 5 GiB;成员为相对于 grounding_data 根目录的路径 index/<group>.parquet # 路径 -> 分片、大小(用于选择性获取)

采用 tar 分片而非松散文件的原因:Hub 限制每个文件夹 1 万个条目、每个仓库不超过 10 万个文件,而 930 万个松散文件超出这两个限制两个数量级。由于有效载荷是文件树而非表格行,因此不适用数据集查看器。

分组

视频分组命名为 video_data__<dataset>,与树中的 video_data/<dataset>/ 对应。

分组 分片数 大小 内容
video_data__ViCaS 78 388.2 GiB ViCaS 接地视频描述 + 帧
video_data__SA-FARI 37 242.2 GiB SA-FARI 野生动物视频,帧 + masklets
Adobe_EntitySeg 38 193.9 GiB EntitySeg 图像 + 标注
coco 25 143.2 GiB COCO 2014/2017 图像、标注、缓存
video_data__BOSTVG 11 55.0 GiB BOSTVG / OmniSTVG + SAM3 掩码
GoldG 12 53.0 GiB GoldG(Flickr30k entities + GQA)
rf100 9 43.4 GiB RF100-VL
coconut 10 41.7 GiB COCONut 全景 PNG + 缓存
video_data__VIPOSeg 4 17.7 GiB VIPOSeg 帧 + panomasks
SA-1B 4 17.1 GiB SA-1B 标注缓存(不含图像)
pixno_points 3 9.9 GiB PixMo pointing 缓存
refclef 2 5.6 GiB RefCLEF / saiapr_tc-12
其余 22 个 各 1 约 14 GiB reasonseg、lvis、manual_annotation、refcoco/+/g、grefcoco、panoptic-narrative-grounding、PhraseCutDataset、pixmo、VidSTG 及小型视频缓存

重建文件树

bash hf download royguw/grounding-data --repo-type dataset --local-dir ./dl GD=/your/path/to/grounding_data for t in ./dl/shards//.tar; do tar -xf "$t" -C "$GD"; done

仅拉取单个数据集时,读取其索引并只获取它引用的分片:

python import pyarrow.parquet as pq from huggingface_hub import hf_hub_download

idx = pq.read_table(hf_hub_download("royguw/grounding-data", "index/coco.parquet", repo_type="dataset")).to_pydict() for shard in dict.fromkeys(idx["shard"]): hf_hub_download("royguw/grounding-data", shard, repo_type="dataset")

索引也是在不下载全部内容的情况下查找单个文件的方式:查询其路径,即可获知需要获取的唯一分片。

路径说明

标注 parquet 在 image_pathpng_pathframes_dir 等列中存储绝对源路径。解压后必须将这些前缀重写为数据实际存放位置。会出现两种前缀:

  • grounding_data 根目录下的路径 -> $GD
  • mm-olmo/ 下的路径 -> 解压 royguw/mm-olmo-images 的位置

视频帧列表以无扩展名的词干存储在 frame_basenames_json 中,依据目录列表解析;当该列缺失时,帧为 f"{i:05d}",其中 i in range(num_frames)

许可与归属

这是为可复现性而组装的第三方数据集再分发镜像,并非新数据集,且不对底层图像、视频帧或上游标注主张任何新许可证。

各分组携带不同的上游许可证——部分仅限研究或非商业用途(例如 EntitySeg 为 Adobe 非商业许可),部分要求在使用前接受上游条款。使用任何分组前请检查其许可证并遵守。 若您是此处上游数据集的作者或权利人并希望移除某子集,请在本仓库开启讨论,相关内容将被下架。

搜集汇总
数据集介绍
grounding-data 数据集图片
构建方式
该数据集并非从零构建的新数据资源,而是为可复现性而整合的第三方数据集镜像,汇集了支撑基础指代与分割训练流程的注解体系及配套图像与视频帧。其构建以文件树形态组织,将掩码、边界框、指代表达、字幕与类别词表等注解缓存统一纳入各数据集目录下的cache/路径,并通过将约933万文件、1.20 TiB内容打包为255个tar分片(分属34组)来规避Hub单目录文件数限制。同时提供index/<group>.parquet索引文件,记录路径到分片及大小的映射,以支持按需选择性获取。
使用方法
使用时可借助huggingface_hub与pyarrow读取索引文件以定位并下载特定数据集所需的分片,或直接全量下载后依次解压各tar分片以重建文件目录树。注解parquet中存有绝对源路径(如image_path、png_path、frames_dir),解压后须将前缀重写至实际存放位置,涉及grounding_data根目录与mm-olmo/两处。视频帧列表以无扩展名的主干名存于frame_basenames_json,需对照目录列表解析;若该列缺失,则帧名按f"{i:05d}"格式依num_frames生成。
背景与挑战
背景概述
在视觉-语言理解领域,指代分割与视觉定位任务长期依赖分散、异构的多源数据,研究社区始终缺乏一个兼顾图像与视频、统一标注格式的大规模聚合资源。grounding-data由royguw整理发布,汇集了COCO、SA-1B、EntitySeg、GoldG、ViCaS、SA-FARI等三十余个上游数据集的图像、视频帧及标注缓存,总计约933万文件、1.20 TiB,以255个tar分片组织,覆盖指代表达分割、视频目标分割、全景分割与接地描述等任务,为可复现的定位与分割训练栈提供了关键基础设施。
当前挑战
该数据集所应对的核心难题在于跨模态定位与分割任务中标注语义的异质性与规模瓶颈:指代表达、掩码、边界框与类别词汇表在不同上游数据集中定义不一,统一整合需消解路径、帧命名与格式差异。构建过程中,近千万级松散文件超出Hub单目录与仓库条目上限,故须设计分片索引与选择性下载机制;标注中存储的绝对路径需在解压后重写,视频帧列表依赖目录解析,且各组许可条款混杂,含非商业与研究限制,合规使用与权利追溯构成持续挑战。
常用场景
经典使用场景
在视觉 grounding 与指代分割研究中,grounding-data 最为经典的使用场景是支撑多任务联合训练与评测。研究者可从中抽取 COCO、GoldG、RefCOCO 等图像标注,以及 ViCaS、SA-FARI 等视频掩码与指代表达,构建涵盖目标检测、指代分割、全景分割与 grounded captioning 的统一数据管线。其目录结构保留掩码、边界框、类别词表与帧列表,便于按索引选择性下载,大幅降低大规模训练的数据准备成本。
解决学术问题
该数据集直面视觉 grounding 领域长期存在的数据碎片化与复现困难问题。通过将分散于 EntitySeg、COCONut、LVIS、RefCLEF 等来源的标注缓存与图像帧整合为统一索引,它缓解了跨数据集训练时标注格式不一、路径错乱与许可不清的痛点。此举为指代分割、视频目标分割与全景分割的可复现研究提供了基础设施,推动模型在开放词汇与跨模态指代理解上的稳健评测。
实际应用
在产业实践中,grounding-data 可用于训练与微调具备指代理解能力的多模态模型,服务于图像编辑、智能标注、机器人视觉导航与视频内容检索等场景。开发者借助索引文件按需拉取特定 shard,即可在有限带宽下获取掩码与指代标注,快速搭建从数据加载到模型评估的闭环,尤其适合需要统一处理图像与视频 grounding 任务的工程团队。
数据集最近研究
最新研究方向
在视觉 grounding 与指代分割领域,grounding-data 作为汇聚九百万级文件、逾 1.2 TiB 的注释镜像,正推动着多模态大模型从“像素感知”迈向“语义落地”的关键跃迁。其囊括的 ViCaS 视频指代字幕、SA-FARI 野生动物掩码轨迹、EntitySeg 细粒度实体标注以及 RefCOCO 系列指代表达式,为统一图像与视频的指代分割、全景分割及 grounded captioning 提供了异质化训练基底。当下研究热点聚焦于跨帧掩码传播、指代歧义消解与开放词汇接地,此类工作依托该数据集的多源注释缓存,得以在视频对象分割与交互式分割任务中验证时序一致性与语言-视觉对齐的鲁棒性。该数据集的镜像属性亦折射出学界对可复现性与许可合规的日益重视,为基准复现和长尾场景泛化研究奠定了关键数据基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务