GBC10M
收藏资源简介:
GBC10M数据集是一个用于视觉语言预训练和图像标注的大型数据集,包含超过1000万张图像。该数据集采用了一种新型的图像注释格式——Graph-based captions (GBC),这种格式通过连接区域标题来创建统一的描述,同时提供结构化信息,类似于场景图。每张图像的注释以JSON行格式存储,包含图像URL和GBC格式的注释,其中每个图像的注释是一个GbcGraph对象,包含图像URL、原始标题和顶点字典,每个顶点包含边界框信息和合成标题。
数据集概述
基本信息
- 许可证: CC BY-NC 4.0
- 任务类别:
- 图像到文本
- 文本到图像
- 语言: 英语
- 数据集大小: 10M<n<100M
- 标签:
- 视觉语言预训练
- 图像描述
- 牛角面包
数据集配置
- 配置名称: default
- 数据文件:
- 训练集:
data/jsonl/train/*.jsonl - 测试集:
data/jsonl/test/*.jsonl
- 训练集:
数据集描述
- 数据集名称: GBC10M
- 数据来源: 从CC12M原始图像中构建
- 数据格式: JSON lines
- 数据结构:
GbcGraph包含图像URL、原始描述和顶点列表GbcVertex包含顶点ID、边界框、标签、描述和边列表GbcEdge包含源顶点ID、文本和目标顶点IDDescription包含文本和标签Bbox包含边界框的相对位置和置信度
数据集统计
- 图像数量: 10,138,757
- 每张图像的顶点数: 12.24
- 每张图像的边数: 21.81
- 每张图像的描述数: 17.67
- 每张图像的单词数: 533.98
- 平均图直径: 4.41
使用方法
- 加载数据集: 使用HuggingFace
datasets库
python from datasets import load_dataset
gbc_graphs = [] ds = load_dataset("graph-based-captions/GBC10M", split="test")
for record in ds: gbc_graphs.append(GbcGraph.model_validate(record))
许可证
- 合成注释: CC BY-NC 4.0
- 原始图像URL-文本样本: Google特定许可证
- 单个图像: 各自版权
引用
@article{GBC2024, title={Graph-Based Captioning: Enhancing Visual Descriptions by Interconnecting Region Captions}, author={Yu-Guan Hsieh and Cheng-Yu Hsieh and Shih-Ying Yeh and Louis Béthune and Hadi Pouransari and Pavan Kumar Anasosalu Vasu and Chun-Liang Li and Ranjay Krishna and Oncel Tuzel and Marco Cuturi}, journal={arXiv preprint arXiv:2407.06723}, year={2024} }




