遇见数据集

PV-ALE Dataset

收藏
arXiv2024-10-30 更新2025-06-09 收录
官方服务:

资源简介:

PV-ALE数据集是由约克大学和都柏林城市大学创建的,旨在增强苹果叶病分类的多样性和复杂性。该数据集扩展了广泛使用的PlantVillage数据集,增加了新的苹果叶病类别,包含3,383张原始图像和20,808张通过数据增强技术生成的图像。数据集的创建过程包括图像收集、验证、裁剪和背景去除等步骤,确保了数据的质量和可靠性。PV-ALE数据集主要应用于苹果叶病的自动检测和分类,旨在提高模型的准确性和鲁棒性,解决全球粮食安全问题。

The PV-ALE dataset was developed by York University and Dublin City University, with the aim of enhancing the diversity and complexity of apple leaf disease classification tasks. It expands upon the widely used PlantVillage dataset by adding new apple leaf disease categories, and contains 3,383 raw images as well as 20,808 images generated through data augmentation techniques. The dataset construction process includes steps such as image collection, validation, cropping, and background removal, ensuring the quality and reliability of the data. Primarily applied to the automatic detection and classification of apple leaf diseases, the PV-ALE dataset is designed to improve model accuracy and robustness and address global food security issues.

创建时间:
2024-10-30
搜集汇总
数据集介绍
PV-ALE Dataset 数据集图片
构建方式
PV-ALE数据集是在广泛使用的PlantVillage苹果叶片数据集基础上扩展而来。研究者通过互联网图像检索,以疾病名称作为关键词,收集了Alternaria叶斑病和白粉病两类新增病害的叶片图像。在数据预处理阶段,严格遵循了图像下载、标题验证、URL来源核实、图像匹配、人工标注验证以及背景去除等多重质量控制流程,确保数据的可靠性与标注的准确性。最终将新收集的图像与PlantVillage原有的四类(苹果疮痂病、黑腐病、雪松锈病及健康叶片)整合,形成包含3383张原始图像的数据集。为缓解类别不平衡,采用70%训练集与30%测试集的划分,并对训练集应用了角度旋转、光照强度变化和缩放等数据增强技术,最终生成20808张图像,各类别样本数量达到相对均衡的分布。
特点
该数据集的核心特点在于其显著的现实复杂性和多样性。与PlantVillage中高分辨率、单一叶片且背景简洁的图像不同,PV-ALE新增的两类病害图像包含低分辨率、叶片簇生以及复杂背景等挑战性特征,更贴近真实农业场景中的成像条件。数据集的构建引入了更具挑战性的分类任务,实验表明,在原始PlantVillage上表现优异的模型(如ResNet50的F1分数达99.63%)在PV-ALE上性能下降至97.87%,证实了新增类别带来的分类难度提升。此外,PV-ALE通过数据增强实现了各类别样本的公平分布,克服了原始数据中健康叶片占比过高的偏差,为评估模型在类别均衡条件下的泛化能力提供了可靠基准。
使用方法
PV-ALE数据集适用于基于深度学习的苹果叶片病害多分类任务,可直接用于训练和评估卷积神经网络模型。使用时,建议将图像统一缩放至225×225像素以适配常见网络输入层。研究者可采用迁移学习策略,如使用在ImageNet上预训练的ResNet50作为骨干网络,替换其分类头为包含全局平均池化、全连接层及Dropout层的定制结构,最终输出对应六类病害的概率。亦可从头构建轻量级CNN架构进行训练。为防止过拟合,应严格分离训练集与测试集,并利用早停法监控验证损失。数据集已在Kaggle平台公开,便于社区复现实验并推动苹果叶部病害诊断领域的标准化对比研究。
背景与挑战
背景概述
苹果叶片病害的精准识别是保障全球粮食安全与农业可持续发展的重要环节。传统依赖人工视觉的诊断方法耗时费力且易受主观因素干扰,难以满足大规模农业生产的迫切需求。近年来,深度学习的突破性进展为自动化病害检测开辟了新路径,然而现有数据集如PlantVillage虽应用广泛,却仅涵盖苹果疮痂病、黑腐病和锈病等有限类别,且图像多为高分辨率单叶背景,与真实田间复杂场景脱节,制约了模型的泛化能力。为弥补这一空白,Joseph Damilola Akinyemi与Kolawole John Adebayo于2024年提出了PV-ALE数据集。该工作在PlantVillage基础上,新增了链格孢叶斑病和白粉病两个类别,并通过严谨的多重验证流程(包括人工标注与图像裁剪)构建了包含3383张原始图像、经数据增强后达20808张的综合性基准。该数据集不仅扩展了苹果病害的多样性,更通过引入低分辨率、叶片簇及复杂背景等真实挑战,为开发鲁棒的计算机视觉模型提供了更严苛的测试平台,其公开性亦促进了领域内研究的可重复性与公平比较。
当前挑战
PV-ALE数据集面临的核心挑战首先在于领域问题的复杂性:新增的链格孢叶斑病与白粉病类别视觉特征模糊,且样本数量稀少(原始仅85张和127张),导致模型在分类时易混淆,尤其链格孢叶斑病的F1分数仅为88.9%,显著低于其他类别。此外,真实场景中图像的低分辨率、多叶片重叠及复杂背景显著增加了特征提取难度,使得即便采用ResNet50等先进架构,在PV-ALE上的F1分数(97.87%)仍低于原始PlantVillage数据集(99.63%),表明现有模型对新增挑战的适应能力不足。构建过程中,数据收集面临互联网图像质量参差、标注一致性难以保证等问题,研究团队为此设计了包含URL验证、人工复核在内的七步质量控制流程,但依然受限于初始数据集规模小及类别分布严重失衡(健康叶片占原始数据的48.6%),最终需依赖数据增强技术平衡类别,然而增强后的图像多样性仍有限,且测试集样本量较小(1015张),可能影响评估的统计稳健性。这些挑战共同凸显了构建大规模、高多样性且标注精准的苹果病害数据集对推动领域发展的关键作用。
常用场景
经典使用场景
在智慧农业与植物病理学交叉领域中,PV-ALE数据集被广泛用作苹果叶片病害分类任务的基准评估平台。该数据集在经典PlantVillage基础上,新增了链格孢叶斑病和白粉病两种具有挑战性的类别,并引入了低分辨率图像、叶片簇及复杂背景等真实场景元素,从而为卷积神经网络和迁移学习方法提供了一个更具难度与多样性的测试环境。研究者通常利用该数据集来验证模型在细粒度病害识别上的鲁棒性与泛化能力,尤其关注模型面对类不平衡、图像质量退化及背景干扰时的表现。
实际应用
在实际农业生产中,PV-ALE数据集支撑着智能病害诊断系统的开发与部署,尤其适用于移动端或边缘设备上的实时叶片病害检测。借助该数据集训练的模型,农户可通过拍摄叶片图像快速识别苹果黑星病、锈病、白粉病等常见病害,从而在早期采取精准施药或隔离措施,有效降低产量损失。此外,该数据集的复杂背景与多叶片场景设计,使其训练出的模型更适应田间非结构化环境,如光照变化、叶片重叠及杂物干扰,显著提升了在果园实地巡检测试中的准确率与可靠性,为可持续农业的精准植保提供了技术支撑。
衍生相关工作
PV-ALE数据集的发布催生了一系列衍生研究工作,主要集中在轻量化网络设计与跨域泛化优化两方面。例如,研究者基于该数据集探索了注意力机制增强的轻量级CNN(如CA-ENet)以平衡精度与计算效率,同时利用生成对抗网络进行数据扩充以缓解小样本难题。此外,该数据集还被用于对比不同迁移学习骨干(如ResNet、DenseNet、EfficientNet)在复杂背景下的特征提取能力,并催生了多尺度融合与双分支结构(如CNN-Swin Transformer混合模型)的提出。这些工作共同推动了苹果叶部病害诊断从实验室理想条件向真实农业场景的实质性跨越。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务