遇见数据集

Voxel51/PlantSeg-Test

收藏
Hugging Face2025-12-12 更新2025-12-20 收录
官方服务:

资源简介:

PlantSeg是一个大规模野外植物病害分割数据集,包含11,458张带有高质量分割掩码的图像,涵盖115种病害类别和34种植物类型。与现有在受控实验室环境中收集的植物病害数据集不同,PlantSeg主要包含具有复杂背景、不同视角和光照条件的真实世界田间图像。数据集还包括按植物类型分类的8,000张健康植物图像。数据集由昆士兰大学和CSIRO农业与食品部门策划,采用CC BY-NC-ND 4.0许可。

PlantSeg is a large-scale in-the-wild dataset for plant disease segmentation, containing 11,458 images with high-quality segmentation masks across 115 disease categories and 34 plant types. Unlike existing plant disease datasets that are collected in controlled laboratory settings, PlantSeg primarily comprises real-world field images with complex backgrounds, various viewpoints, and different lighting conditions. The dataset also includes an additional 8,000 healthy plant images categorized by plant type. The dataset is curated by The University of Queensland and CSIRO Agriculture and Food, with a CC BY-NC-ND 4.0 license.

提供机构:
Voxel51
搜集汇总
数据集介绍
Voxel51/PlantSeg-Test 数据集图片
构建方式
PlantSeg-Test数据集源自PlantSeg大规模野外植物病害分割数据集,由昆士兰大学与CSIRO农业与食品研究所联合构建。该测试子集包含1200个样本,其原始数据通过多源网络爬取策略从Google Images、Bing Images及Baidu Images等平台收集,确保了地理分布的多样性。在数据清洗阶段,每张图像经过至少两名标注员的交叉验证及植物病理学专家的最终审核,以剔除不准确或模糊的样本。分割标注采用LabelMe工具进行多边形勾勒,严格遵循统一的标注标准:对独立病斑单独标注,重叠病灶标注为联合区域,而对锈病、白粉病等微小聚集性症状则进行精细标注以反映真实分布。最终,所有标注结果由专家病理学家复核,保障了像素级掩码的高质量与可靠性。
使用方法
PlantSeg-Test通过FiftyOne框架集成于HuggingFace平台,用户可便捷地加载与探索数据。使用前需安装FiftyOne库(pip install -U fiftyone),随后通过load_from_hub函数从HuggingFace加载数据集,支持max_samples等参数控制样本数量。加载完成后,可调用fo.launch_app启动可视化界面,交互式浏览图像及其对应的分割掩码。该数据集适用于语义分割模型的训练与基准测试,亦可服务于自动化病害诊断系统及精准农业决策工具的研发。其标准化的80/20分层划分(按病害类型)确保了训练与测试集的一致性与可比性,而JSON格式的原始标注文件则便于用户自定义解析或适配其他框架。
背景与挑战
背景概述
植物病害的精准识别与分割是智能农业与植物病理学交叉领域的一项核心任务,其对于作物产量保障与可持续农业发展具有深远意义。然而,现有公开数据集多源于受控实验室环境,图像背景单一、病害种类有限,难以反映复杂田间条件下的真实分布。在此背景下,由昆士兰大学与澳大利亚联邦科学与工业研究组织(CSIRO)的研究团队于2024年共同创建的PlantSeg数据集应运而生。该数据集汇聚了11,458张野外病害图像与8,000张健康植物图像,涵盖115种病害类别与34种植物类型,并提供了像素级分割标注。其核心研究问题在于推动从实验室到田间场景的语义分割模型泛化能力,为精准农业中的自动化诊断系统提供规模化、高保真的数据基石。PlantSeg的发布填补了大规模野外植物病害分割数据的空白,对相关领域的研究范式产生了显著影响。
当前挑战
PlantSeg数据集所面临的核心挑战首先体现在领域问题的复杂性上:真实田间图像常伴随杂乱背景、多光照条件、不同视角以及病害症状的异质性,使得模型在复杂场景下实现稳健的语义分割极具难度。此外,病害区域与健康组织间的边界模糊、小尺度病斑的密集分布(如锈病、白粉病)以及病害重叠导致的形态畸变,进一步加剧了分割任务的挑战性。在数据集构建过程中,研究团队亦遭遇诸多难题:从互联网多源(Google、Bing、百度)采集的图像需经过严格清洗以剔除错误或歧义样本,标注标准需兼顾多样性病害形态的精确表达,而十名标注员在专家植物病理学家监督下的多轮交叉验证流程,虽保证了标注质量,却也显著提升了人力与时间成本。这些挑战共同构成了PlantSeg在推动野外植物病害分割研究时必须克服的关键障碍。
常用场景
经典使用场景
PlantSeg数据集最经典的使用场景在于训练和评估面向真实农田环境的植物病害语义分割模型。与以往在受控实验室条件下采集的植物病害数据集不同,PlantSeg汇聚了11,458张来自互联网的野外图像,涵盖34种植物类型和115种病害类别,并提供了高质量的像素级分割标注。研究者可借助该数据集构建能够应对复杂背景、多变光照和多样化视角的鲁棒分割算法,推动计算机视觉技术在精准农业中的落地应用。
解决学术问题
PlantSeg数据集解决了植物病害分割领域长期存在的三大核心学术难题:其一,现有数据集多为分类标签或边界框标注,缺乏像素级分割掩码,难以支撑细粒度病害区域的精准定位;其二,实验室图像背景单一,无法反映真实田间的复杂场景;其三,已有分割数据集规模小且宿主-病原体关系覆盖有限。PlantSeg凭借其大规模、野外采集和专家验证的标注,为开发泛化能力更强的分割模型提供了坚实基准,促进了植物病理学与计算机视觉的交叉研究。
实际应用
在实际应用中,PlantSeg数据集为自动化植物病害诊断系统的研发提供了关键支撑。基于该数据集训练的模型可集成到智能农业设备(如无人机、田间监测机器人)中,实现对作物病害的实时检测与定位,辅助农民进行精准施药和病害早期预警。此外,该数据集还适用于开发面向综合病害管理的决策支持工具,通过量化病害严重程度,优化农业资源投入,减少农药滥用,从而提升作物产量与食品安全水平。
数据集最近研究
最新研究方向
近年来,植物病害分割研究正从实验室受控环境向野外复杂场景迁移,PlantSeg数据集的问世标志着该领域迈入大规模真实世界影像分析的新阶段。该数据集包含11,458张病害图像与8,000张健康植物图像,覆盖115种病害类别和34种植物类型,并首次提供像素级分割标注,突破了现有数据集在标注粒度、场景多样性和规模上的瓶颈。当前前沿研究聚焦于利用PlantSeg训练鲁棒的语义分割模型,以应对田间复杂背景、多变光照和视角变化带来的挑战,进而推动自动化病害诊断系统在精准农业中的落地。与集成病害管理(IDM)决策工具的结合,使得该数据集在提升作物产量、减少农药滥用和保障粮食安全方面具有深远意义,尤其为发展中国家的小农户提供了可及的技术支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务