遇见数据集

CVdatasets/ImageNet15_animals_unbalanced_aug1

收藏
Hugging Face2023-02-28 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: labels dtype: class_label: names: '0': Italian_greyhound '1': Coyote '2': Beagle '3': Rottweiler '4': Hyena '5': Greater_Swiss_Mountain_dog '6': Triceratops '7': French_bulldog '8': Red_wolf '9': Egyptian_cat '10': Chihuahua '11': Irish_terrier '12': Tiger_cat '13': White_wolf '14': Timber_wolf - name: img dtype: image - name: is_generated dtype: bool splits: - name: validation num_bytes: 60570648.125 num_examples: 1439 - name: train num_bytes: 174270537.875 num_examples: 3705 download_size: 234762621 dataset_size: 234841186.0 --- # Dataset Card for "ImageNet15_animals_unbalanced_aug1" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

数据集信息: 特征: - 名称:labels(标签),数据类型:类别标签(class_label),类别名称如下: '0': 意大利灵缇犬(Italian_greyhound) '1': 郊狼(Coyote) '2': 比格犬(Beagle) '3': 罗威纳犬(Rottweiler) '4': 鬣狗(Hyena) '5': 大瑞士山地犬(Greater_Swiss_Mountain_dog) '6': 三角龙(Triceratops) '7': 法国斗牛犬(French_bulldog) '8': 红狼(Red_wolf) '9': 埃及猫(Egyptian_cat) '10': 吉娃娃(Chihuahua) '11': 爱尔兰㹴犬(Irish_terrier) '12': 虎斑猫(Tiger_cat) '13': 白狼(White_wolf) '14': 森林狼(Timber_wolf) - 名称:img(图像),数据类型:图像(image) - 名称:is_generated(是否生成),数据类型:布尔值(bool) 数据集划分: - 名称:验证集(validation),字节数:60570648.125,样本数量:1439 - 名称:训练集(train),字节数:174270537.875,样本数量:3705 下载大小:234762621 字节,数据集总大小:234841186.0 字节 # "ImageNet15_animals_unbalanced_aug1"数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
CVdatasets
原始信息汇总

数据集概述

数据集信息

特征

  • labels: 类别标签,包含以下类别:
    • 0: Italian_greyhound
    • 1: Coyote
    • 2: Beagle
    • 3: Rottweiler
    • 4: Hyena
    • 5: Greater_Swiss_Mountain_dog
    • 6: Triceratops
    • 7: French_bulldog
    • 8: Red_wolf
    • 9: Egyptian_cat
    • 10: Chihuahua
    • 11: Irish_terrier
    • 12: Tiger_cat
    • 13: White_wolf
    • 14: Timber_wolf
  • img: 图像数据
  • is_generated: 布尔值,表示图像是否为生成

数据分割

  • validation: 验证集,包含1439个样本,大小为60570648.125字节
  • train: 训练集,包含3705个样本,大小为174270537.875字节

数据集大小

  • 下载大小: 234762621字节
  • 数据集大小: 234841186.0字节
搜集汇总
数据集介绍
CVdatasets/ImageNet15_animals_unbalanced_aug1 数据集图片
构建方式
在计算机视觉领域,细粒度图像分类任务对数据集的质量与多样性提出了严苛要求。该数据集基于ImageNet中的动物类别精心筛选而成,涵盖15个动物亚类,包括意大利灵缇、郊狼、比格犬等,共计5144张图像。数据集的构建采用非均衡分布策略,以模拟真实场景中类别样本数量的自然差异,同时引入数据增强技术(aug1)扩充训练样本,提升模型的泛化能力。数据集被划分为训练集(3705张)和验证集(1439张),并额外标注了每个样本是否为生成图像的布尔字段,为后续研究提供更多分析维度。
特点
该数据集的核心特点在于其非均衡类别分布与增强策略的结合,有效反映了实际应用中长尾分布的挑战。每个样本均包含类别标签、图像数据及生成标记三要素,其中生成标记字段尤为独特,可支持对生成图像与真实图像混合场景的探索。类别涵盖犬科、猫科、鬣狗科及史前恐龙(三角龙)等,生物学多样性丰富,且部分类别间视觉相似度极高(如红狼与白狼),为细粒度判别任务提供了理想的测试平台。验证集与训练集的样本比例约为1:2.6,进一步强化了模型鲁棒性评估的可靠性。
使用方法
研究者可通过HuggingFace Datasets库直接加载该数据集,使用`load_dataset('CVdatasets/ImageNet15_animals_unbalanced_aug1')`命令即可获取训练与验证分割。图像数据以PIL或张量格式读取,便于接入PyTorch或TensorFlow等深度学习框架。类别标签为整数索引,需通过配置的class_label映射转换为具体动物名称。生成标记字段可用于过滤或对比分析生成图像的影响。建议在训练时采用加权采样策略以缓解类别非均衡问题,或利用增强后的数据设计对比学习任务,充分挖掘细粒度特征。
背景与挑战
背景概述
图像分类作为计算机视觉领域的基石任务,长期以来依赖大规模、均衡分布的数据集以推动模型泛化能力的提升。然而,现实世界中的视觉数据往往呈现长尾分布与类别不均衡的特征,对传统监督学习方法构成严峻考验。在此背景下,CVdatasets/ImageNet15_animals_unbalanced_aug1数据集应运而生,由计算机视觉研究团队于近年来构建,旨在模拟真实场景下动物图像识别的非均衡分布问题。该数据集精选自ImageNet的15个动物子类,涵盖意大利灵缇犬、郊狼、比格犬、罗威纳犬、鬣狗、大瑞士山地犬、三角龙、法国斗牛犬、红狼、埃及猫、吉娃娃、爱尔兰梗、虎斑猫、白狼及森林狼等物种,通过引入不平衡采样与数据增强策略,为研究类别不均衡条件下的鲁棒分类算法提供了标准化的评估基准。其发布不仅丰富了细粒度动物识别的研究资源,更推动了领域内对长尾分布、小样本学习及数据增强有效性等核心问题的深入探索。
当前挑战
该数据集所聚焦的核心挑战在于解决现实场景中图像分类的类别不均衡问题。首先,训练集中各类别样本数量存在显著差异,如常见犬种(如比格犬)可能拥有远超稀有物种(如三角龙)的样本量,这导致传统分类器易偏向多数类,忽视少数类的判别特征。其次,数据集构建过程中面临数据采集的天然瓶颈:部分动物(如白狼、红狼)在自然环境中影像资料稀缺,需依赖生成图像(is_generated字段标记)补充,但合成数据与真实图像之间的域偏移可能引入额外噪声,影响模型对真实分布的拟合。此外,不平衡数据与增强策略的耦合效应尚未被充分理解——不恰当的数据增强(如对稀有类过度旋转或裁剪)可能扭曲物种关键形态特征,加剧过拟合风险。最后,验证集与训练集的不平衡分布差异(验证集1439例、训练集3705例)要求模型在有限监督信号下同时兼顾泛化能力与类别敏感性,这对损失函数设计(如焦点损失)、重采样策略及元学习范式提出了更高要求。
常用场景
经典使用场景
该数据集源自ImageNet的子集,聚焦于15种动物类别,包括意大利灰狗、郊狼、比格犬、罗威纳犬、鬣狗、大瑞士山地犬、三角龙、法国斗牛犬、红狼、埃及猫、吉娃娃、爱尔兰梗、虎斑猫、白狼和森林狼。其经典使用场景在于细粒度图像分类与不平衡学习研究,通过提供非均衡的样本分布与数据增强版本,为评估模型在类别不均衡条件下的泛化能力提供了标准化基准。研究者常利用该数据集探索重采样、代价敏感学习或生成式数据扩充等策略对分类性能的影响,尤其在动物形态相似性较高的子类中测试特征判别能力。
实际应用
在实际应用中,该数据集可模拟生态监测、野生动物保护与宠物识别等场景中的类别失衡问题。例如,在野外相机陷阱图像中,常见物种(如郊狼)的样本远多于稀有物种(如白狼),模型需克服偏差以实现公平识别。该数据集通过包含真实图像与生成样本(is_generated字段),可验证数据增强技术在缓解生产环境数据稀缺方面的可靠性。此外,兽医诊断辅助系统可借助此数据集训练对犬猫品种的细粒度鉴别能力,提升对罕见品种的识别准确率,从而降低误诊风险。
衍生相关工作
该数据集衍生了一系列经典工作,主要集中在类别不平衡学习与数据增强方法的交叉验证上。例如,研究者基于此数据集对比了SMOTE、Mixup、CutMix及生成对抗网络(GAN)生成样本对分类器性能的提升效果,揭示了不同增强策略在动物细粒度特征上的适用边界。此外,部分工作将其作为基准,评估了元学习与自监督预训练在缓解不平衡问题中的潜力,推动了如Class-Balanced Loss、LDAM等损失函数的提出。这些研究不仅深化了对分布鲁棒性的理论认知,也为后续长尾识别领域的数据集构建与评估协议提供了参照范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务