遇见数据集

pemujo/GLDv2_Top_51_Categories

收藏
Hugging Face2023-05-18 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: id dtype: string - name: landmark_id dtype: int64 - name: category dtype: string - name: image dtype: image - name: label dtype: int64 splits: - name: train num_bytes: 2428986323.125 num_examples: 36463 - name: test num_bytes: 606874794.5 num_examples: 9116 download_size: 3034360629 dataset_size: 3035861117.625 language: - en pretty_name: GLDv2 Top 51 Categories size_categories: - n<1K --- # Dataset Card for Dataset Name ### Dataset Summary This dataset is a subset of Kaggle's Google Landmark Recognition 2021 competition with only the categories with more than 500 images. https://www.kaggle.com/competitions/landmark-recognition-2021/data The dataset consists of a total of 45579 224x224 color images in 51 categories. ### Languages English ## Dataset Structure ### Data Fields - `landmark_id`: Int - Numeric identifier of the category - `category` : String - Name of the category - `id` : String - Image identifier - `image` : Image - PIL image object - `label` : Int - Numeric label from 0 to 50 ### Data Splits The dataset was randomly split with 80% of the images for the train set and 20% for the test set. | | train | test | |----------------------|------:|-----:| | Dataset | 36463 | 9116 | ### Source Data The full dataset is from Kaggle Landmark Recognition 2021 "Towards A Fairer Landmark Recognition Dataset", Z. Kim, A. Araujo, B. Cao, C. Askew, J. Sim, M. Green, N. Yilla and T. Weyand, arxiv:2108.08874 https://www.kaggle.com/competitions/landmark-recognition-2021/data ### Citation Information "Google Landmarks Dataset v2 - A Large-Scale Benchmark for Instance-Level Recognition and Retrieval", T. Weyand, A. Araujo, B. Cao and J. Sim, Proc. CVPR'20 "Towards A Fairer Landmark Recognition Dataset", Z. Kim, A. Araujo, B. Cao, C. Askew, J. Sim, M. Green, N. Yilla and T. Weyand, arxiv:2108.08874

--- dataset_info: 数据集信息: features: - 名称: id,数据类型: 字符串 - 名称: landmark_id,数据类型: 64位整数 - 名称: category,数据类型: 字符串 - 名称: image,数据类型: 图像 - 名称: label,数据类型: 64位整数 splits: - 名称: 训练集(train), 字节数: 2428986323.125, 样本数: 36463 - 名称: 测试集(test), 字节数: 606874794.5, 样本数: 9116 download_size: 3034360629 字节 dataset_size: 3035861117.625 字节 language: 英语 pretty_name: GLDv2前51类数据集(GLDv2 Top 51 Categories) size_categories: - 样本数<1000 --- # 数据集卡片 ### 数据集概览 本数据集是Kaggle平台2021年谷歌地标识别竞赛数据集的子集,仅包含图像数量超过500张的类别。 https://www.kaggle.com/competitions/landmark-recognition-2021/data 本数据集共包含51个类别的45579张224×224彩色图像。 ### 语言 英语 ## 数据集结构 ### 数据字段 - `landmark_id`: 整数型——类别的数字标识符 - `category`: 字符串型——类别名称 - `id`: 字符串型——图像标识符 - `image`: 图像型——PIL图像对象 - `label`: 整数型——取值范围为0至50的数字标签 ### 数据划分 本数据集按随机划分,训练集包含80%的图像,测试集包含20%的图像。 | | 训练集 | 测试集 | |----------------------|-------:|-------:| | 样本量 | 36463 | 9116 | ### 源数据 完整数据集来源于Kaggle平台的2021年地标识别竞赛。 《迈向更公平的地标识别数据集》(*Towards A Fairer Landmark Recognition Dataset*),Z. Kim、A. Araujo、B. Cao、C. Askew、J. Sim、M. Green、N. Yilla及T. Weyand,arxiv:2108.08874 https://www.kaggle.com/competitions/landmark-recognition-2021/data ### 引用信息 《谷歌地标数据集v2——面向实例级识别与检索的大规模基准数据集》(*Google Landmarks Dataset v2 - A Large-Scale Benchmark for Instance-Level Recognition and Retrieval*),T. Weyand、A. Araujo、B. Cao及J. Sim,发表于CVPR'20 《迈向更公平的地标识别数据集》(*Towards A Fairer Landmark Recognition Dataset*),Z. Kim、A. Araujo、B. Cao、C. Askew、J. Sim、M. Green、N. Yilla及T. Weyand,arxiv:2108.08874

提供机构:
pemujo
原始信息汇总

数据集概述

  • 名称: GLDv2 Top 51 Categories
  • 数据集大小: 总大小为3035861117.625字节
  • 下载大小: 3034360629字节
  • 语言: 英语
  • 类别数量: 51
  • 图像总数: 45579张
  • 图像尺寸: 224x224像素,彩色图像
  • 数据分割:
    • 训练集: 36463张图像,占80%
    • 测试集: 9116张图像,占20%

数据字段

  • id: 字符串类型,图像标识符
  • landmark_id: 整数类型,类别数字标识
  • category: 字符串类型,类别名称
  • image: 图像类型,PIL图像对象
  • label: 整数类型,数值标签,范围从0到50

数据集来源

  • 原始数据集: Kaggle Landmark Recognition 2021
  • 相关研究:
    • "Google Landmarks Dataset v2 - A Large-Scale Benchmark for Instance-Level Recognition and Retrieval", T. Weyand, A. Araujo, B. Cao and J. Sim, Proc. CVPR20
    • "Towards A Fairer Landmark Recognition Dataset", Z. Kim, A. Araujo, B. Cao, C. Askew, J. Sim, M. Green, N. Yilla and T. Weyand, arxiv:2108.08874
搜集汇总
数据集介绍
pemujo/GLDv2_Top_51_Categories 数据集图片
构建方式
该数据集源自Kaggle平台上的Google Landmark Recognition 2021竞赛,是对原始大规模地标识别数据集GLDv2的精炼与再组织。构建过程中,研究者严格筛选出包含超过500张图像的类别,最终汇聚成涵盖51个地标类别的子集。数据集共包含45,579张尺寸统一为224x224的彩色图像,按照80%与20%的比例随机划分为训练集与测试集,分别拥有36,463和9,116个样本。每个样本均包含图像标识符、地标编号、类别名称、图像数据以及从0至50的数值标签,为地标识别任务提供了结构清晰、类别均衡的数据基础。
特点
此数据集的核心特点在于其高度的类别代表性与数据纯净性。通过设定每类至少500张图像的门槛,有效规避了长尾分布中罕见类别带来的训练偏差,使得模型能够在信息量充足的地标类别上进行充分学习。51个类别覆盖了全球范围内的知名地标,兼具文化多样性与视觉辨识度。此外,所有图像均经过标准化预处理为224x224像素,降低了数据加载与模型输入的处理复杂度。数据集的划分方式确保了训练集与测试集之间的随机性与独立性,为模型性能的可靠评估提供了保障。
使用方法
该数据集适用于基于深度学习的图像分类与地标识别任务。使用者可通过HuggingFace Datasets库直接加载,利用其内置的image字段获取PIL图像对象,并结合label字段进行监督学习。在模型训练阶段,建议采用预训练的卷积神经网络作为特征提取器,对51类地标进行微调。数据集的标准化图像尺寸与均衡类别分布,使其成为验证地标识别算法性能的理想基准。同时,研究者可基于该数据集开展跨域泛化、细粒度分类等进阶实验,以探索地标识别领域的深层问题。
背景与挑战
背景概述
pemujo/GLDv2_Top_51_Categories 数据集源自Google Landmarks Dataset v2(GLDv2),这是一个由Google Research团队在2020年发布的大规模地标识别基准,核心研究人员包括T. Weyand、A. Araujo、B. Cao和J. Sim等。该数据集的创建旨在推动实例级别图像识别与检索的研究,解决地标识别领域因数据长尾分布和类别不均衡带来的挑战。作为GLDv2的精简版本,pemujo/GLDv2_Top_51_Categories 提取了其中图像数量超过500张的51个类别,共45579张224x224彩色图像,主要面向Kaggle Google Landmark Recognition 2021竞赛。这一子集聚焦于高频地标类别,为研究者提供了更均衡的数据基础,便于评估和比较模型在有限类别上的识别性能,对地标识别领域的公平性研究具有重要影响力。
当前挑战
该数据集所解决的领域挑战在于地标识别任务中类别长尾分布导致的模型偏差问题——原始GLDv2包含数百万张图像,但大量类别仅有极少样本,使得模型倾向于过拟合高频类别而忽略低频类别。构建过程中,研究者面临的主要挑战包括:从海量、噪声标注的网络图像中筛选出可靠的地标类别,确保类别间图像数量均衡以降低数据偏斜;同时,需处理图像来源的多样性和质量差异,如光照、视角和遮挡变化,以保证数据集在真实场景中的代表性。此外,随机划分训练集(80%)和测试集(20%)时,需避免类别分布泄露,确保评估的公正性。这些挑战共同推动了更公平地标识别数据集的构建方法论发展。
常用场景
经典使用场景
GLDv2_Top_51_Categories数据集作为Google Landmarks Dataset v2的精简版本,聚焦于包含超过500张图像的51个地标类别,专为细粒度图像分类任务设计。在计算机视觉领域,该数据集常被用于地标识别与检索的基准测试,尤其是在类别分布更为均衡的场景下,研究者可借此评估模型在有限类别上的泛化能力与鲁棒性。其224×224的标准化图像尺寸和明确的类别标签,为卷积神经网络、视觉Transformer等架构的对比实验提供了便捷的数据基础。
衍生相关工作
基于该数据集,研究者衍生出多项经典工作。例如,在模型压缩方向,有工作利用此子集探索知识蒸馏与剪枝技术,以在保持地标识别精度的同时降低计算开销。在跨模态学习领域,它被用于联合图像与文本描述的地标检索任务,催生了视觉-语言预训练模型的微调范式。此外,围绕公平性分析,后续研究以此为核心数据,对比不同采样策略对模型偏差的缓解效果,推动了‘Towards A Fairer Landmark Recognition Dataset’等公平性导向的工作进展。
数据集最近研究
最新研究方向
在计算机视觉领域,地标识别一直是衡量模型对细粒度图像理解能力的重要基准。pemujo/GLDv2_Top_51_Categories数据集作为Google地标数据集v2的精炼子集,聚焦于样本量超过500张的51个高频类别,剔除了长尾分布中的稀疏类别,从而为地标识别研究提供了更加均衡、可控的实验环境。当前前沿研究方向正围绕该数据集展开两方面的探索:一是利用其在训练集与测试集上的明确划分(80%/20%),评估和改进基于Transformer与卷积神经网络混合架构的细粒度分类性能;二是结合公平性研究(如“Towards A Fairer Landmark Recognition Dataset”所倡导的),通过控制类别分布偏差,推动模型在跨地域、跨文化地标识别中的鲁棒性与去偏见能力。该数据集的出现不仅为地标识别竞赛提供了标准化的去噪基准,更在热点事件如全球文化遗产数字化保护中,成为验证模型能否从有限但高质量的数据中习得通用地标特征的关键工具,其影响在于促进计算机视觉从“数据多即好”向“数据精且公平”的研究范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务