Open Images dataset
收藏资源简介:
Open Images是一个包含约900万张图片的数据集,这些图片被标注了超过6000个类别的标签。数据集分为训练集和验证集,每张图片可能有一个或多个标签,标签信息来源于Freebase或Google Knowledge Graph API。数据集提供了机器和人工两种标注方式,以及详细的元数据信息。
Open Images is a dataset comprising approximately 9 million images, each annotated with labels from over 6,000 categories. The dataset is divided into training and validation sets, with each image potentially bearing one or multiple labels sourced from Freebase or the Google Knowledge Graph API. It offers both machine-generated and human-annotated labels, along with comprehensive metadata.
数据集概述
名称: Open Images dataset
大小: 约900万张图片
类别: 超过6000个类别
许可证:
- 注释: CC BY 4.0
- 图片: CC BY 2.0
数据集内容
图像信息:
- ID: 每张图片有唯一的64位ID
- URL: 图片的URL
- 元数据: 包括标题、作者、许可证信息、原始大小、MD5校验和、缩略图URL
标签信息:
- 类型: 机器生成和人工验证
- 数量: 7844个标签,其中约6000个为“可训练”标签
- 描述: 每个标签有短描述,可从
dict.csv获取 - 置信度: 机器标签置信度为0.0至1.0,人工标签为确定性(1.0或0.0)
数据集组织
分割: 分为训练集(9011219张图片)和验证集(167057张图片)
文件类型:
- images.csv: 包含图片的详细信息
- labels.csv: 将标签与图片ID关联
数据集质量
标签分布: 高度不均匀,部分标签关联超过百万张图片,部分少于100张
准确性: 机器注释存在噪声,但标签关联的图片越多,准确性越高
数据集应用
模型训练: 基于Open Images注释训练的Inception v3模型,适用于微调和艺术风格转换等应用




