遇见数据集

greenhouse_crop_weed_classification

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

该数据集名为“温室作物杂草分类”(Greenhouse Crop Weed Classification),是一个用于温室环境下作物和杂草分类的图像数据集。数据集包含28,000张图像,覆盖14个类别,每个类别各有2,000张图像。类别包括:Blackbean(黑豆)、Canola(油菜)、Corn(玉米)、Field Pea(田豌豆)、Flax(亚麻)、Horseweed(加拿大蓬)、Kochia(地肤)、Lentil(扁豆)、Palmer Amaranth(帕尔默苋)、Ragweed(豚草)、Redroot Pigweed(红根苋)、Soybean(大豆)、Sugar beet(甜菜)和Waterhemp(水麻)。该数据集适用于图像分类任务,可用于训练和评估作物与杂草识别模型。数据集采用CC-BY-4.0许可,并已在AgML平台上索引。

The dataset named Greenhouse Crop Weed Classification is an image dataset for crop and weed classification in greenhouse environments. It contains 28,000 images covering 14 categories, with 2,000 images per category. The categories include: Blackbean, Canola, Corn, Field Pea, Flax, Horseweed, Kochia, Lentil, Palmer Amaranth, Ragweed, Redroot Pigweed, Soybean, Sugar beet, and Waterhemp. This dataset is suitable for image classification tasks and can be used to train and evaluate crop and weed recognition models. It is licensed under CC-BY-4.0 and indexed on the AgML platform.

创建时间:
2026-08-11
原始信息汇总

数据集概述:Greenhouse Crop Weed Classification

基本信息

  • 数据集名称:Greenhouse Crop Weed Classification(温室作物与杂草分类)
  • 许可证:CC-BY-4.0
  • 任务类型:图像分类(image-classification)
  • 数据规模:10K < n < 100K(28,000个样本)
  • 数据集大小:约1.44 GB(下载大小约1.42 GB)
  • 访问地址:https://huggingface.co/datasets/Project-AgML/greenhouse_crop_weed_classification

数据内容

数据集中包含 28,000张图像,涵盖 14个类别,每个类别包含2,000张图像。这些类别包括6种作物和8种杂草:

类别 类型 图像数量
Blackbean(黑豆) 作物 2,000
Canola(油菜) 作物 2,000
Corn(玉米) 作物 2,000
Field Pea(田豌豆) 作物 2,000
Flax(亚麻) 作物 2,000
Soybean(大豆) 作物 2,000
Sugar beet(甜菜) 作物 2,000
Horseweed(加拿大飞蓬) 杂草 2,000
Kochia(地肤) 杂草 2,000
Lentil(小扁豆) 杂草 2,000
Palmer Amaranth(帕尔默苋) 杂草 2,000
Ragweed(豚草) 杂草 2,000
Redroot Pigweed(红根苋) 杂草 2,000
Waterhemp(水麻) 杂草 2,000

数据结构

  • 图像字段image(图像数据)
  • 标签字段label(类别标签,为整数索引,对应上述14个类别名称)

数据划分

  • 训练集(train):28,000个样本
    • 数据大小:1,444,316,236字节
    • 数据文件位于 data/train-*

其他信息

  • 该数据集已被收录于 AgML Python 库,并在 https://project-agml.github.io/ 上建立索引。
  • 数据集原始格式经过了重新格式化,以符合 HuggingFace 标准。
  • 该数据集来源于一篇学术论文,并已在 Mendeley Data 上发布(doi: 10.17632/hs7d7kpd3z.3),相关引用信息可参考数据集页面提供的 BibTeX 格式引用。
搜集汇总
数据集介绍
greenhouse_crop_weed_classification 数据集图片
构建方式
该数据集源自一项针对温室环境中作物与杂草精准识别的研究,由北达科他州立大学等机构的科研团队构建。原始图像数据经过严格采集与整理,后依据HuggingFace标准进行格式重构,形成包含28,000张图像、覆盖14个类别的分类数据集。每个类别均包含2,000张样本,类别涵盖黑豆、油菜、玉米等8种作物及马唐、豚草等6种常见杂草,确保了类别间的均衡性与代表性。数据集的构建旨在支持高通量表型分析及杂草自动分类研究,其规模与结构为深度学习模型的训练提供了坚实基础。
特点
此数据集的核心特点在于其高度均衡的类别分布与专业化的应用导向。14个类别各含2000张图像,有效避免了类别不平衡问题,有利于模型训练的稳定性和分类精度的提升。图像均采集自温室环境,贴近实际农业生产场景,增强了模型的实用性与泛化能力。此外,数据集以CC-BY-4.0许可发布,鼓励学术研究与商业应用,且已集成至AgML库,便于科研人员直接获取与使用。其高质量的图像数据与明确的类别标注,为图像分类、目标检测等任务提供了理想的基准数据集。
使用方法
该数据集适用于图像分类任务,主要面向机器学习与计算机视觉领域的研究人员。使用时,可将数据集加载为训练集,通过深度学习框架(如PyTorch、TensorFlow)构建分类模型。数据集的目录结构清晰,包含28,000张训练图像,可直接用于模型训练与验证。为充分发挥数据效能,建议采用数据增强技术以提升模型泛化能力,并可结合迁移学习策略,利用预训练模型进行微调。此外,该数据集已收录于AgML库,用户可借助AgML的API接口便捷地访问与处理数据,实现高效的数据加载与实验流程。
背景与挑战
背景概述
精准农业与杂草管理是现代农业面临的重大课题,传统杂草识别依赖人工经验,耗时且易错,难以满足大规模、高效率的田间管理需求。随着深度学习与计算机视觉技术的迅猛发展,基于图像的高通量作物与杂草分类已成为智能农业的研究热点。在此背景下,由G C Sunil、Cengiz Koparan等研究人员于2024年创建的温室作物杂草分类数据集应运而生,该数据集包含28,000张图像,覆盖14个类别,涵盖黑豆、油菜、玉米等作物及马唐、苋菜等常见杂草,为模型训练提供了丰富的样本基础。作为AgML开源库的重要成员,该数据集推动了自动化云平台在高通量表型分析中的应用,为杂草精准识别与管理提供了核心数据支撑,对智能农业和可持续农业发展具有深远影响。
当前挑战
该数据集的核心挑战在于温室环境下作物与杂草的精准分类,具体包括:其一,温室光照、湿度及背景复杂度高,图像中作物与杂草形态相似,尤其在幼苗期,种间差异微小,给分类模型的特征提取带来显著困难;其二,杂草种类多样且生长阶段多变,需模型具备较强的泛化能力以适应不同生长期的视觉变化;其三,构建过程中,数据采集需在受控环境中进行,确保14个类别每类2,000张图像的平衡性,同时需克服人工标注的耗时与主观性,以及云平台数据存储与处理的传输效率问题,确保数据集的质量与可用性,这些因素共同构成了该数据集在推动农业自动化应用中的关键挑战。
常用场景
经典使用场景
在精准农业与计算机视觉交叉领域,greenhouse_crop_weed_classification数据集扮演着基石角色。其经典使用场景聚焦于温室环境下作物与杂草的细粒度图像分类任务,涵盖14类植物(含8种作物与6种杂草),共计28,000张高分辨率图像,每类均衡分布2,000张。这一数据集为训练和评估深度学习模型(如卷积神经网络、Vision Transformer)提供了标准化的基准,推动植物表型分析中目标识别技术的迭代与验证。研究者常以此为基础,开展模型架构对比、迁移学习策略探索及数据增强技术优化等工作。
解决学术问题
该数据集系统性地解决了温室环境中作物与杂草自动识别所面临的核心学术难题,尤其在类别间形态相似度高、背景复杂多变的场景下,传统人工特征工程方法泛化能力不足的问题。其构建遵循严格类别平衡与规模化采样原则,为多类别细粒度分类研究提供了高质量训练语料,有效支撑了特征表示学习、域适应算法及半监督/无监督学习方向的探索。由此,数据集促进了计算机视觉技术在农业表型分析中的理论深化,助推了从传统机器学习到现代深度学习的范式迁移。
衍生相关工作
该数据集的发布催生了多项衍生工作,影响深远。它作为AgML开源农业机器学习库的核心索引数据集之一,驱动了作物/杂草分类领域的广泛研究,后续衍生出模型压缩(知识蒸馏、剪枝)与轻量化网络设计(如MobileNet变体)的优化研究。同时,基于此数据集,研究者拓展了半监督学习、域随机化及生成对抗网络(GAN)增强等方向,以应对真实田间场景的不可控因素。此外,数据集的标准化格式(HuggingFace基准)促进了跨学科协作,催生了农业视觉中多任务学习、跨数据集泛化等前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务