遇见数据集

Herbarium Half-Earth dataset

收藏
arXiv2021-05-28 更新2024-06-21 收录
官方服务:

资源简介:

Herbarium Half-Earth数据集是由苏黎世联邦理工学院等机构创建,包含超过250万张植物标本图像,涵盖近64,500个分类群,主要来自美洲和太平洋地区。该数据集旨在通过高分辨率图像自动识别植物分类群,解决现有数据集规模小、多样性不足的问题。数据集内容丰富,包括从种级到科级的分类标签,支持多级分类研究。创建过程中,数据集通过标准化标签和图像预处理,确保数据质量和可用性。该数据集广泛应用于植物学研究,特别是在生物多样性监测、气候变化影响评估等领域。

The Herbarium Half-Earth Dataset was developed by institutions including ETH Zurich and other collaborating organizations. It contains over 2.5 million high-resolution plant specimen images, covering nearly 64,500 plant taxa, with most specimens sourced from the Americas and the Pacific region. This dataset is designed to enable automatic plant taxon identification using high-resolution imagery, addressing the limitations of small scale and inadequate taxonomic diversity in existing datasets. It features comprehensive annotation labels spanning from species to family taxonomic ranks, supporting multi-level taxonomic research. During the dataset construction process, standardized labeling and image preprocessing workflows were implemented to guarantee data quality and usability. The Herbarium Half-Earth Dataset has been widely adopted in botanical research, especially in areas such as biodiversity monitoring and climate change impact assessment.

创建时间:
2021-05-28
搜集汇总
数据集介绍
Herbarium Half-Earth dataset 数据集图片
构建方式
Herbarium Half-Earth数据集汇集了来自美洲与大洋洲五个知名植物标本馆(纽约植物园、毕晓普博物馆、自然生物多样性中心、昆士兰标本馆及奥克兰战争纪念博物馆)的逾250万张维管植物标本图像,覆盖近64,500个分类单元。为统一异源标签,研究者将标本名称对齐至《莱比锡维管植物目录》这一权威分类学参考体系,通过精确匹配、部分匹配及模糊匹配(tre-agrep)结合人工审核,剔除了约7.3万张无法归类的图像。随后,利用预训练的EAST文本检测模型对标本标签、条码等文字区域进行定位并施以多重模糊处理,迫使模型聚焦于植物本身的形态特征。所有图像被统一缩放至长边1000像素(保持宽高比),并按分类单元以80%/20%比例划分训练集与测试集,确保每类至少3张图像,测试集每类最多10张。
特点
该数据集是迄今规模最大、多样性最丰富的植物标本自动分类基准,其显著特点在于极端的类别不均衡(不均衡因子高达1654.5)与长尾分布。种内变异极为丰富,涵盖不同生长阶段(如幼株与成株)、不同器官组合(如叶与花、叶与果)以及因压制、干燥、装订技术差异导致的形态变化。种间视觉相似性高,诊断性形态特征往往微小且局部,对高分辨率图像处理与细粒度特征提取提出严苛要求。此外,数据集还提供了科、目等高层级分类标签,支持层级分类与标签相似性研究,为探索多粒度识别方法提供了独特资源。
使用方法
研究者可将此数据集用于训练和评估细粒度分类模型,尤其适合应对长尾分布与类间相似性挑战。建议采用平衡采样策略缓解类别不均衡,并利用数据增强(如小角度旋转、水平翻转、色彩抖动及中心裁剪)提升泛化能力。模型可选用预训练于ImageNet的ResNet-50等架构,以交叉熵损失函数结合SGD优化器进行训练,学习率采用阶梯式衰减策略。评估指标推荐使用F1分数以综合衡量精度与召回率。数据集已按标准划分训练集与测试集,图像经预处理后可直接加载,也支持研究者自定义分层采样或基于分类学层级的多任务学习范式。
背景与挑战
背景概述
植物标本馆藏作为全球植物多样性历史的珍贵记录,承载着从表型到基因型的丰富信息,为理解生物演化、应对栖息地丧失与气候变化提供了不可替代的实证基础。近年来,随着计算机视觉技术在细粒度分类领域的突破,自动识别植物标本成为加速植物学研究的潜在利器。然而,现有数据集普遍面临规模有限、类群覆盖狭窄、地理分布单一或机构来源匮乏等问题,且不同数据库间的分类学名称不统一,严重阻碍了大规模自动化识别模型的研发。为突破这一瓶颈,Riccardo de Lutio 等人于2021年联合苏黎世联邦理工学院、纽约植物园、康奈尔科技与谷歌研究院,构建了 Herbarium Half-Earth 数据集。该数据集汇聚了来自美洲和大洋洲5家权威机构的逾250万张维管植物标本图像,涵盖近64,500个分类单元,是迄今为止规模最大、多样性最丰富的植物标本自动分类数据集,为植物细粒度识别研究树立了新的标杆。
当前挑战
Herbarium Half-Earth 数据集的构建与应用面临多重严峻挑战。其一,数据分布呈现极端长尾特性,不平衡因子高达1,654.5,部分分类单元仅含3张图像,而少数类群却拥有上百张样本,这给模型学习带来巨大偏置。其二,种内变异极为显著,同一物种的标本可能因采集季节、生长阶段、压制干燥工艺差异而呈现截然不同的外观,甚至同一植株的不同部位标本亦形态迥异,加之年代久远导致的标本破损与残缺,进一步加剧了分类难度。其三,种间视觉相似性极高,许多近缘物种在形态上难以区分,而植物学家赖以鉴定的关键诊断特征往往极其细微,要求模型具备处理高分辨率图像并聚焦局部细节的能力。此外,数据预处理阶段还需解决跨机构标本标签名称不统一的问题,通过复杂的文本匹配与人工审核流程对齐至通用分类学参考名录,同时需对标本上的手写标签、条形码等文本信息进行精确模糊处理,以迫使模型专注于植物本体特征而非辅助文字。
常用场景
经典使用场景
Herbarium Half-Earth dataset 作为迄今规模最大、多样性最丰富的植物标本图像数据集,其经典使用场景集中于细粒度视觉分类任务,尤其是面向极度不平衡的长尾分布数据集的物种自动识别。该数据集包含超过250万张维管植物标本图像,涵盖近64,500个分类单元,来自美洲和大洋洲的五个主要标本馆,为研究者提供了一个兼具高类内变异与高类间相似性的挑战性基准。其典型应用包括训练深度卷积神经网络以区分形态细微差异的植物类群,并验证模型在真实世界复杂条件下的泛化能力。
解决学术问题
该数据集系统性地解决了植物标本自动分类领域中长期存在的三大学术瓶颈:数据集规模有限、地理与分类学覆盖狭窄、以及多源数据整合时因命名法差异导致的标签对齐困难。通过统一采用莱比锡维管植物名录进行标准化处理,并模糊标本标签以消除文本信息干扰,该数据集迫使模型专注于植物本身的形态特征。其发布推动了长尾分布下的细粒度识别算法研究,为理解类间相似性与类内变异性的权衡提供了宝贵实验平台,显著提升了自动分类系统在真实生态学场景中的鲁棒性。
衍生相关工作
该数据集衍生了一系列具有里程碑意义的经典工作,其中最引人注目的是连续三届 Herbarium Challenge 竞赛的举办。2019年的挑战聚焦于野牡丹科植物,2020年扩展至美洲维管植物,而2021年则依托此数据集将竞争推向全球尺度,参赛方案在F1评分上从基线模型的0.46跃升至冠军方案的0.76。这些竞赛催生了多种针对极端不平衡与细粒度分类的创新架构,如分层标签嵌入、注意力机制增强的卷积网络以及对比学习策略。此外,该数据集还启发了将系统发育树信息融入分类模型的研究方向,为融合形态学与进化关系提供了新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务