遇见数据集

AgriStress-500

收藏
Hugging Face2026-07-10 更新2026-07-11 收录
官方服务:

资源简介:

AgriStress-500 是一个专门为农业人工智能系统设计的压力测试数据集,包含 500 张来自实际农田作业的无人机图像,覆盖多种作物、地理区域、传感器类型、飞行高度和光照条件,旨在模拟真实部署中的挑战性场景(如阳光眩光、叶片倾斜等)。数据集主要用于测试图像嵌入、语义分割模型、分类器和视觉语言模型的鲁棒性,并识别从实验室到田间的故障模式。它包括 451 张源图像及其语义分割掩码、4041 个植物实例裁剪,组织为 20 个 L1 簇和 121 个 L2 簇。分割掩码包含 18 个类别(共定义 29 个),涵盖 10 种作物(如小麦、大麦等)和 4 种特定杂草(如草、蒲公英等),以及一个通用“杂草”类别。实例标签共 14 种。数据集结构清晰,包含源图像文件夹、掩码文件夹、实例裁剪文件夹和多个JSON映射文件,支持图像分割和分类任务。

AgriStress-500 is a stress test dataset specifically designed for agricultural artificial intelligence systems. It contains 500 drone images from actual field operations, covering various crops, geographic regions, sensor types, flight altitudes, and lighting conditions, aiming to simulate challenging scenarios in real-world deployments (such as sun glare, leaf tilting, etc.). The dataset is primarily used to test the robustness of image embeddings, semantic segmentation models, classifiers, and vision-language models, and to identify failure modes that may occur from laboratory to field. It includes 451 source images with their corresponding semantic segmentation masks, 4,041 plant instance crops, organized into 20 L1 clusters and 121 L2 clusters. The segmentation masks contain 18 categories (out of 29 defined), covering 10 crops (e.g., wheat, barley) and 4 specific weeds (e.g., grass, dandelion), along with a generic weed category. There are 14 instance labels in total. The dataset has a clear structure, including source image folders, mask folders, instance crop folders, and multiple JSON mapping files, supporting image segmentation and classification tasks.

创建时间:
2026-06-26
原始信息汇总

数据集概述

数据集名称:AgriStress-500
发布方:Precision AI
许可证:CC-BY-NC-4.0(非商业用途)
版本:1.0.2
数据集规模:总计 451 张源图像,小于 1K 样本
任务类型:图像分割(image-segmentation)、图像分类(image-classification)
标签:农业、作物、杂草、语义分割、遥感


数据集描述

AgriStress-500 是一个专为农业人工智能设计的压力测试数据集,包含 500 张来自实际农田的无人机图像。这些图像涵盖多种作物、地理区域、传感器类型、飞行高度和光照条件,旨在模拟真实部署中面临的挑战,如太阳眩光、叶片倾斜、行遮挡、混合物种、罕见生长阶段等边缘情况。

该数据集可用于测试嵌入模型、分割模型、分类器以及视觉语言模型(VLM)在从实验室到田间的部署过程中可能出现的失败模式。


数据统计

指标 数值
源图像总数 451
分割掩膜数量 451(与图像一一对应)
包含实例裁剪的图像数 309
无实例裁剪的图像数 142
植物实例总数 4,041
L1 聚类数 20 (A – T)
L2 聚类数 121
含实例图像的实例数(最小/平均/最大) 1 / 13.08 / 16
实例标签数 14(10种作物,4种杂草)
掩膜中出现的分割类别数 18(共定义29类,位于 class_map.json

各类别分割面积统计

总前景像素面积为 790,645,121 像素,各类别占比及出现图像数如下:

类别 颜色 面积(像素) 占前景比例 出现图像数
作物 小麦 #55f2c3 281,167,283 35.56%
作物 大麦 #5f8c31 242,783,764 30.71%
杂草 杂草(通用) #9ab236 96,086,144 12.15%
作物 扁豆 #55f26f 37,830,935 4.79%
作物 燕麦 #318c4c 37,017,606 4.68%
作物 豌豆 #55f299 27,364,943 3.46%
作物 油菜 #8ff255 23,334,035 2.95%
作物 亚麻 #318c34 13,056,746 1.65%
杂草 #f2494c 12,269,868 1.55%
作物 大豆 #318c65 9,433,879 1.19%
作物 玉米 #65f255 8,096,337 1.02%
作物 鹰嘴豆 #468c31 1,166,951 0.15%
杂草 阔叶草 #b2365b 913,862 0.12%
杂草 蒲公英 #b23644 38,055 0.01%
杂草 帕尔默苋菜 #b28536 37,433 0.01%
杂草 牵牛花 #f2a549 26,362 <0.01%
杂草 红根马齿苋 #b29d36 13,446 <0.01%
杂草 #f26549 7,472 <0.01%

关键观察:作物前景以密集的小粒谷物田为主(小麦+大麦约占总标注面积的66%);杂草除通用类别外,占地较小且稀疏。


实例标签分布

实例裁剪数据包含 4,041 个植物实例,对应 14 个标签:

标签 实例数
作物 小麦
作物 燕麦
作物 大麦
作物 豌豆
作物 扁豆
作物 油菜
作物 玉米
作物 大豆
杂草
作物 亚麻
杂草 阔叶草
作物 鹰嘴豆
杂草 蒲公英
杂草 牵牛花

作物(10种):小麦、燕麦、大麦、豌豆、扁豆、油菜、玉米、大豆、亚麻、鹰嘴豆
杂草(4种):草、阔叶草、蒲公英、牵牛花

注意:通用/未指定种类的杂草不作为标注实例输出。


目录结构

AgriStress-500/ ├── README.md ├── class_map.json # 分割类别→RGB颜色映射(29类) ├── image2image.json # L2聚类元数据(121条) ├── plant2image.json # 图像→实例裁剪映射(309张图像) ├── plant2plant.json # 实例→物种标签映射(4,041条) ├── images/ # 121个文件夹,451张PNG源图像 │ ├── A1/ … │ └── T4/ ├── masks/ # 121个文件夹,451张PNG语义分割掩膜(与images/一一对应) │ └── … └── instances/ # PNG格式的逐植物实例裁剪(共4,041个) └── …

其中142张图像没有实例裁剪(未达到采样纯度和覆盖阈值),但仍有完整的分割掩膜。


分割掩膜说明

  • 每张源图像 images/<L2>/pai-<token>.pngmasks/ 下有像素对齐的语义分割掩膜(451对451,一一对应)。
  • 掩膜为RGB PNG格式:背景为黑色 (0,0,0),每个前景类别使用固定颜色填充。
  • 可通过 class_map.json 查找掩膜像素的RGB值以恢复其类别。
  • class_map.json 定义了29个条目(28个前景类包括作物、杂草、残茬,以及背景),本次发布中18个类别出现在掩膜中。

图像命名规则

所有图像和实例裁剪文件名使用匿名标识符:

pai-<8位字符token>.png # 源图像/掩膜 pai-<8位字符token>-<N>.png # 实例裁剪(N从1开始,最大16)

8位字符token由字母数字组成(A–Z, a–z, 0–9);同一个token在 images/masks/instances/ 中指向同一张源图像,便于交叉引用。文件名中不包含拍摄时间、作物类型、相机型号等内部标识。


访问模式

模式 入口 用途
Image2Image image2image.json / images/ 按L2聚类分组的完整图像及成像属性元数据
Segmentation masks/ + class_map.json 密集像素级语义分割,与 images/ 一一对应
Plant2Image plant2image.json 将每张源图像映射到其包含的实例裁剪
Plant2Plant plant2plant.json 将每个实例裁剪映射到其植物物种标签

示例数据结构:

json // plant2image.json { "instance_to_image": { "images/<L2>/<token>.png": ["instances/<L2>/<token>-1.png", "..."] } }

// plant2plant.json { "instance_labels": { "instances/<L2>/<token>-<N>.png": "<Type> | <Name>" } }

搜集汇总
数据集介绍
AgriStress-500 数据集图片
构建方式
AgriStress-500数据集由Precision AI精心构建,旨在作为农业人工智能领域的压力测试基准。该数据集收录了451幅真实作业农田的无人机航拍图像,跨越多种作物类型、地理区域、传感器型号、飞行高度及光照条件。每幅图像均配有像素级语义分割掩膜,同时从309幅图像中提取出4041个植物实例,涵盖10种作物和4种杂草类别。数据构建过程中,特别筛选了包含太阳眩光、叶片倾斜、行间遮挡、物种混生及罕见生长阶段等现实部署挑战的场景,确保其能够全面反映田间实际复杂环境。
特点
AgriStress-500数据集的核心特点在于其高度的挑战性与覆盖范围。数据划分了20个L1集群和121个L2集群,以组织不同成像条件下的样本。语义分割掩膜包含29个预定义类别中的18个实际出现类别,其中小麦和大麦的标注面积占前景总面积的66%以上,而杂草类别虽然分布广泛,但多数为未指定种类的通用标签,特定杂草物种则较为稀少。实例标签分布显示作物类别主导,杂草实例仅占少数,这种不平衡设计真实模拟了农业生产中的实际数据分布,有效暴露了模型在稀疏目标识别上的脆弱性。
使用方法
AgriStress-500数据集支持多种接入模式,以满足不同研究需求。通过Image2Image模式,研究者可利用`images/`文件夹和`image2image.json`元数据访问按L2集群分组的完整图像。Segmentation模式提供`masks/`文件夹与`class_map.json`颜色映射文件,适用于像素级语义分割任务。Plant2Image和Plant2Plant模式则分别通过`plant2image.json`和`plant2plant.json`文件,建立图像与实例作物之间的关联以及实例到物种标签的映射。研究者可灵活运用这些模式,在部署前对嵌入、分割、分类及视觉语言模型进行全面压力测试,识别从实验室到田间过程中最可能出现的失败模式。
背景与挑战
背景概述
在精准农业领域,无人机遥感影像的语义分割与作物分类技术正逐步成为智慧农业的核心支撑,然而现有数据集多聚焦于理想条件下的标准场景,难以真实反映田间部署时面临的复杂光照、植株形态多变及物种混生等挑战。由Precision AI团队于2025年创建的AgriStress-500数据集,正是为弥补这一关键缺口而设计。该数据集精心收集了500幅来自实际田间的无人机影像,覆盖多种作物、地理区域、传感器类型、飞行高度及光照条件,并提供了451张像素级语义分割掩码和4041个植株实例标注,涵盖10种作物与4种杂草。作为农业AI模型的压力测试基准,AgriStress-500不仅填补了领域内现实场景数据匮乏的空白,更通过暴露模型在野外环境中的失效模式,对提升农业视觉系统的鲁棒性产生了深远影响。
当前挑战
AgriStress-500数据集的核心价值在于直面农业AI从实验室走向田间部署所面临的严峻挑战。首先,它聚焦于领域内长期存在的图像分割与分类难题,如强光直射造成的叶片高光过曝、倾斜叶片导致的形态畸变、作物行间遮挡引起的边界模糊、多物种混生带来的类别混淆,以及稀有生长阶段样本的稀缺——这些问题在现有公共数据集中往往被忽略,却正是模型实际失效的主因。其次,数据集构建过程本身也充满挑战:团队需在真实作业条件下大规模采集影像,并确保标注的精细度与一致性,尤其是针对杂草种类中仅占据极少数像素的罕见物种(如豚草、牵牛花)进行准确识别,同时平衡作物与杂草间极度不均衡的像素分布(如小麦与大麦占据66%的标注区域),这要求标注流程具备极高的专业性与耐心。此外,142张无实例裁剪的图像反映了在复杂田间环境中提取纯净植株样本的低成功率,进一步凸显了数据清洗与质量控制的技术难度。
常用场景
经典使用场景
在农业人工智能领域,模型的田间部署常因环境复杂性而面临性能骤降,AgriStress-500正是为应对这一挑战而生。该数据集精选500张来自真实农田的无人机航拍影像,覆盖不同作物种类、地理区域、传感器型号、飞行高度与光照条件,尤其聚焦于阳光眩光、叶片倾斜、行间遮挡、物种混杂、罕见生长阶段等极端案例。其核心用途在于作为压力测试基准,系统性地评估语义分割模型、图像分类器、视觉语言模型(VLM)在从实验室迁移至实际田间场景时的鲁棒性与泛化能力,精准揭示模型最易失效的薄弱环节。
衍生相关工作
AgriStress-500的发布催生了一系列围绕田间鲁棒性的后续研究工作。在算法层面,研究者利用其提供的多层级标注(Image2Image聚类、Plant2Plant实例标签)开发了新型域自适应框架与注意力机制增强的语义分割网络,专门应对野外极端案例。在评估体系上,该数据集被纳入多个农业视觉挑战赛的测试基准,促使学界提出更全面的鲁棒性评价指标。此外,基于其严重类不平衡特性(如杂草仅占前景像素的少量比例),衍生出针对性的重加权损失函数与数据增强策略,显著提升了模型对长尾分布数据的鉴别能力。这些工作共同推动了农业AI从学术验证迈向工程落地。
数据集最近研究
最新研究方向
在精准农业与遥感智能的交叉前沿,AgriStress-500作为首个专为农业AI野外部署设计的压力测试基准,正引领着鲁棒性评估范式从实验室封闭环境向开放田间的关键跃迁。该数据集精准捕获了真实作业中无人机俯视视角下的光照耀斑、叶片倾角、行间遮挡及多物种混杂等边缘条件,通过451张高分辨率语义分割掩码与4041个精细植株实例标注,系统构建了涵盖小麦、大麦等10种作物及禾草、阔叶草等4类杂草的物种层级结构。当前研究正利用其Image2Image与Plant2Plant双重索引架构,深度剖析视觉基础模型与语义分割网络在野外出苗率估计、泛化性量化及品种间混淆模式上的失效机理,为农业机器人在复杂生境下的自主决策提供了不可替代的对抗性验证平台,加速了从模型微调到跨地域部署的可靠性闭环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务