遇见数据集

meganariley/inat-wildflowers-75

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

iNaturalist北美野花数据集是一个精心整理的图像分类数据集,包含75种北美野花物种的图像,源自iNaturalist研究级观察记录。数据集总共有59410张图像,其中训练集包含47527张图像,验证集包含11883张图像。这些图像涵盖了75个物种,属于28个植物科。所有图像均来自iNaturalist的研究级观察(仅使用CC许可的照片),地理范围限定在北美地区。

The iNaturalist North American Wildflowers dataset is a curated image classification dataset containing images of 75 North American wildflower species, sourced from iNaturalist research-grade observations. The dataset consists of a total of 59,410 images, with 47,527 images in the training split and 11,883 images in the validation split. It includes 75 species belonging to 28 plant families. All images are from iNaturalist research-grade observations (CC-licensed photos only) and are geographically limited to North America.

提供机构:
meganariley
搜集汇总
数据集介绍
meganariley/inat-wildflowers-75 数据集图片
构建方式
该数据集源自iNaturalist平台上经社区验证的研究级观测记录,聚焦于北美地区75种野花物种。通过iNaturalist API v1进行数据采集,严格筛选质量等级为“research”、采用知识共享许可协议且位于北美区域的照片,并依据社区投票对图像质量进行排序。所有图像均被统一调整至最长边不超过512像素,并以JPEG格式存储,最终形成包含59,410张图片的精细数据集,其中训练集与验证集分别占47,527张和11,883张。
特点
数据集最显著的特点在于其专业性与系统性:涵盖28个植物科属的75个北美野花物种,每个物种的图片数量绝大部分达到800张,确保了类别的均衡分布。所有图像均来自iNaturalist社区研究级观测,具有严格的科学验证背景,为图像分类任务提供了可靠的高质量数据。此外,数据集在收集过程中对图像质量进行了社区投票排序,进一步保障了样本的代表性与清晰度。
使用方法
该数据集旨在服务于图像分类任务,使用方式极为简便。用户可通过Hugging Face的datasets库直接加载,仅需一行代码即可获取完整数据集:from datasets import load_dataset; dataset = load_dataset('meganariley/inat-wildflowers-75')。加载后的数据集已预分为训练集和验证集,便于直接用于模型训练与评估,尤其适用于植物识别、细粒度分类等计算机视觉研究方向。
背景与挑战
背景概述
生物多样性监测与保护日益依赖计算机视觉技术实现植物物种的自动识别。在此背景下,iNaturalist North American Wildflowers 75 Species数据集由Hugging Face社区的机器学习研究代理ML Intern于2024年创建,旨在为北美野生花卉的细粒度图像分类提供标准化基准。该数据集精选了来自iNaturalist研究级观测记录的59410张图像,涵盖75个常见野花物种,横跨28个植物科,所有图像均遵循创用CC许可协议,经社区投票筛选以确保质量。其创建填补了现有植物图像数据集在区域性、物种多样性与版权合规性方面的空白,为迁移学习、细粒度分类及生态监测算法提供了可靠的训练与评估资源。
当前挑战
该数据集致力于解决植物自动识别领域的核心挑战:由于野花物种间形态高度相似且存在光照、背景、生长阶段等环境变异,传统分类模型常难以区分相近物种。同时,数据构建过程面临诸多难题:需从iNaturalist海量观测记录中通过API筛选出研究级(community-verified)且明确标注许可协议的图像;为平衡类别分布,对多数物种收集800张样本,但部分物种(如Harebell仅321张)因野外分布稀疏或记录不足而难以保证数量;此外,图像尺寸统一缩放及JPEG压缩可能导致细节损失,影响细粒度特征提取。这些挑战促使数据集在样本筛选、类别均衡与视觉保真度间寻求折中,以服务实际应用。
常用场景
经典使用场景
iNaturalist North American Wildflowers 75 Species数据集在计算机视觉领域中被广泛用作细粒度图像分类的基准。该数据集精心挑选了北美地区75种野生花卉物种,涵盖了28个植物科属,共计近六万张经社区验证的科研级图片。研究者常利用这一高质量数据集来训练和评估深度学习模型在辨识形态相似、颜色纹理差异微妙的植物种类上的能力。其物种丰富的类别标签和均衡的图像分布为探讨类间差异极小情况下的视觉识别难题提供了理想的实验平台。
衍生相关工作
围绕该数据集,学术界衍生出了一系列经典工作,包括基于注意力机制的细粒度分类模型、针对长尾分布的类平衡采样策略以及跨数据集的领域自适应方法。诸如使用Vision Transformer进行迁移学习的实验,以及将对比学习应用于无监督花卉特征表示的研究,均以此数据集为验证基石。这些探索成果进一步激发了在更具挑战性的野外植物识别任务上的创新,推动了计算视觉与生态保护交叉领域的蓬勃发展。
数据集最近研究
最新研究方向
该数据集聚焦于北美野花物种的图像分类,源于iNaturalist社区的研究级观测数据,包含75个物种近6万张高品质图像。当前前沿方向在于利用此类细粒度分类数据集推动植物智能识别系统的生态多样性监测能力,尤其结合公民科学数据,解决传统植物调查中人力与时间成本高昂的瓶颈。随着计算机视觉与生态学交叉研究的深化,该数据集为开发高精度、多物种识别模型提供了优质训练基础,在生物多样性保护、入侵物种预警及授粉网络动态研究中具有关键价值,也呼应了全球生物信息学中开放科学与公众参与的热潮。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务