遇见数据集

PlantExpertVQA

收藏
Hugging Face2026-06-06 更新2026-06-07 收录
官方服务:

资源简介:

PlantExpertVQA是一个用于植物病害诊断的大规模视觉问答数据集,基于45个开源图像库构建,包含150,841张图像和765,186个问答对,涵盖38种作物和89种疾病条件。所有问答对经过植物学家的两阶段专家评审,并基于包含203张专家策划卡片的疾病知识库。问题分为9个类别,分布在三个认知复杂度级别:L1基础级别(如存在性检查、植物物种识别)、L2分析级别(如视觉属性定位)和L3推理级别(如特定疾病识别、因果推理)。数据集采用图像级分层分割,确保无图像重复,分割比例为70/10/20(训练/验证/测试)。每个数据样本包含唯一标识符、图像路径、作物种类、疾病标签、严重程度、问题文本、答案、问题类别和认知级别等字段,适用于视觉问答、多模态学习、细粒度识别和农业人工智能等任务,特别适合评估和开发植物科学领域的视觉语言模型。

PlantExpertVQA is a large-scale visual question answering dataset for plant disease diagnosis, constructed from 45 open-source image libraries. It contains 150,841 images and 765,186 question-answer pairs, covering 38 crop species and 89 disease conditions. All question-answer pairs undergo a two-stage expert review by botanists and are based on a disease knowledge base with 203 expert-curated cards. Questions are organized into 9 categories across three cognitive complexity levels: L1 basic level (e.g., existence checks, plant species identification), L2 analytical level (e.g., visual attribute localization), and L3 reasoning level (e.g., specific disease identification, causal reasoning). The dataset uses image-level hierarchical splitting to ensure no image appears in multiple splits, with a split ratio of 70/10/20 (train/validation/test). Each data sample includes fields such as unique identifier, image path, crop type, disease label, severity, question text, answer, question category, and cognitive level. It is suitable for tasks like visual question answering, multimodal learning, fine-grained recognition, and agricultural AI, particularly for evaluating and developing vision-language models in plant science.

创建时间:
2026-05-24
原始信息汇总

数据集概述:PlantExpertVQA

PlantExpertVQA 是一个大规模视觉问答 (VQA) 数据集,专用于植物病害诊断。它基于 45 个开源图像库构建,并由专业植物学家通过两阶段领域专家审核。

核心规模与属性

属性 数值
总问答对数 765,186
总图像数 150,841
作物物种 38
病害条件 89
知识库卡片 203
问题类别 9 (3个认知层级)
数据划分 70 / 10 / 20 (训练/验证/测试)
图像来源 45 个开源数据集
许可证 CC BY 4.0

数据集划分

数据集按照图像级别进行分层划分,确保同一张图像不会出现在不同划分中,并在问题类别、作物物种、病害条件和来源数据集之间保持平衡。

划分 问答对数 图像数
训练集 535,881 105,586
验证集 76,384 15,080
测试集 152,921 30,175

问题类别

问题按照布鲁姆认知层级组织为 3 个认知层级

层级 类别 描述
L1 基础层 存在性与合理性检查 确认图像包含植物材料
L1 基础层 植物物种识别 识别宿主作物
L1 基础层 整体健康评估 “健康”与“患病”的二分类判断
L2 分析层 视觉属性定位 检测特定可见症状
L2 分析层 详细验证 验证指定的作物-病害组合
L3 推理层 特定病害识别 无候选选项的开放式诊断
L3 推理层 综合描述 包含严重程度的完整整体描述
L3 推理层 因果推理 识别致病因子和风险因素
L3 推理层 反事实推理 关于假设健康状态的推理

数据模式

每个 CSV 文件 (train.csv / val.csv / test.csv) 包含以下列:

列名 描述
qa_id 唯一问答对 UUID
image_id 图像文件名
image_path 图像相对路径 (images/<filename>)
crop 作物物种 (如 tomato, apple)
disease 病害或状况标签
category 大类: disease, healthy, 或 senescence
severity MILD / MODERATE / SEVERE / HEALTHY / UNKNOWN
question_text 问题
answer 真实答案
answer_type open, closed, 或 free_form
question_category 9 个问题类别之一
cognitive_level Level 1 (Foundational) / Level 2 (Analysis) / Level 3 (Reasoning)
dataset_source PlantVQAPlantVillageVQA

病害知识库

该数据集包含一个 disease_kb/ 目录,内含 203 个 JSON 卡片,覆盖 38 种作物物种 × 89 种病害条件。每个卡片编码了分类学、传播途径、症状、严重程度分级、相似病症区分及管理策略。卡片组织为 disease_kb/<crop>/<disease>.json,并汇总于 disease_kb/all_cards.jsonl

零样本基准测试结果

在测试集的 250 张图像 (1,178 个问答对) 上进行了评估,主要指标为 ROUGE-L。结果显示,Gemma-3-4B-IT 模型在零样本设置下表现最佳 (ROUGE-L = 15.26)。通过对 Qwen3-VL-2B 模型在仅 500 张图像 (2,337 个问答对) 上进行参数高效 LoRA 微调,性能提升显著,ROUGE-L 达到 61.70,较最佳零样本模型提升约 4 倍。

使用方法

可直接通过 pandas 读取 CSV 文件,或使用 datasets 库加载。

仓库结构

PlantExpertVQA/ ├── images_part1.zip # 37,711 张图像 (4.1 GB) ├── images_part2.zip # 37,711 张图像 (4.1 GB) ├── images_part3.zip # 37,711 张图像 (2.9 GB) ├── images_part4.zip # 37,708 张图像 (0.6 GB) ├── disease_kb/ # 203 个 JSON 知识库卡片 │ ├── all_cards.jsonl │ └── <crop>/<disease>.json └── data/ ├── train.csv / train.jsonl (535,881 问答对) ├── val.csv / val.jsonl ( 76,384 问答对) ├── test.csv / test.jsonl (152,921 问答对) └── split_statistics.json

搜集汇总
数据集介绍
PlantExpertVQA 数据集图片
构建方式
PlantExpertVQA源自对45个开源图像库的系统整合,覆盖150,841张植物图像,并由植物病理学家构建了包含203张专家策展卡片的结构化病害知识库。在此基础上,研究团队设计了涵盖3个认知复杂度层级、共计9类问题的视觉问答对,每对均经过两轮植物学家审核,最终形成765,186个高质量问答对,并按7:1:2比例分层划分为训练、验证与测试集。
特点
该数据集以精细化的认知层次结构为显著特点,从基础的存在性确认与作物识别,到分析性的视觉属性定位与病害验证,再至推理层面的具体病害诊断与反事实推理,全面覆盖了植物病害诊断的多维认知需求。其病害知识库详尽编码了病原体分类、传输途径、器官特异性症状与严重度评分标准,为模型提供了可溯源的专家知识支撑。
使用方法
数据集以CSV和JSON格式提供,用户可通过Pandas直接读取分割文件,或利用HuggingFace Datasets库通过一句代码加载。图像文件以四个压缩包形式发布,解压至同一目录后与CSV中的相对路径匹配即可使用。研究团队还提供了基于LoRA的微调基准,仅需500张图像即可在零样本基础上实现ROUGE-L分数的4倍提升。
背景与挑战
背景概述
PlantExpertVQA数据集由Syed Nazmus Sakib与孟加拉国工程技术大学等机构的研究人员于2025年创建,旨在弥补现有视觉问答数据集在植物病理学细粒度诊断推理方面的不足。该数据集整合了45个开源图像存储库中的150,841幅图像,覆盖38种作物与89种病害条件,包含765,186对问答实例。依托由植物学家精心编撰的203张疾病知识卡片,问题设计跨越三个认知层次(基础、分析、推理),涵盖存在性检查、物种识别、视觉属性定位与因果推理等九大类别。作为开源社区在精细化农业智能诊断领域的重要贡献,PlantExpertVQA为多模态大语言模型在真实植物病害场景中的视觉-语言对齐能力提供了大规模、多层次、专家验证的基准测试平台。
当前挑战
植物病害视觉问答面临两大核心挑战。领域层面,病害症状具有品种特异性、部位多样性与阶段变异性,同一病原菌在不同宿主或生长阶段会呈现迥异的视觉模式,要求模型具备跨类别泛化与细粒度区分能力;同时,开放场景下的相似症状(如真菌感染与生理性缺素)极易混淆,对视觉-语言推理的稳健性构成严峻考验。构建层面,大规模多源图像的质量参差不齐,标注一致性需经两轮领域专家审查方可达成;问答对生成需依赖结构化知识卡片与认知层级叠合设计,手工与半自动流程衔接繁复,确保问题覆盖度与认知梯度均衡性对数据工程提出了极高要求。
常用场景
经典使用场景
在植物病理学与计算机视觉的交叉研究领域,PlantExpertVQA 作为大规模视觉问答数据集,其经典应用场景聚焦于基于图像的植物病害诊断推理。该数据集囊括了38种作物、89种病害状态的150,841张图像,并配套构建了涵盖203张专家策展知识卡的结构化知识库。研究者可借助此数据集训练多模态模型,使其不仅能够识别植物种类与健康状态,还能完成视觉属性定位、因果推理及反事实假设等不同认知层级的问答任务。这种从基础存在性检查到高阶认知推理的渐进式设计,为评估和提升模型在开放域环境下的细粒度视觉理解能力提供了标准化测试平台。
实际应用
在精准农业的落地部署中,PlantExpertVQA 为智能植物诊断助手提供了关键的数据基石。基层农技推广人员或农户可通过移动终端拍摄作物异常部位,系统即可依据模型分析结果,自动生成从病害名称、严重程度到防控建议的综合性诊断报告。数据集中细化的严重程度分级(轻度、中度、重度)知识卡信息,使得模型能够辅助决策者判别病害处于爆发初期还是流行阶段,进而规划化学药剂使用或生物防治策略。结合图像级分层切分的设计,该数据集的验证与测试样本覆盖了真实生产中可能出现的情景变化,有效支撑了实地部署前模型的鲁棒性评估与优化。
衍生相关工作
自 PlantExpertVQA 发布以来,其多层级认知架构与结构化知识库设计已催生了一系列高质量研究工作。基于该数据集构建的零样本评估基准,研究人员系统检验了 GPT-4V、LLaVA 及 InstructBLIP 等主流视觉语言模型在植物病理问答中的表现差异,揭示了当前大语言模型在具体症状量化与因果推断环节的薄弱之处。参数高效微调领域的工作进一步展示,利用仅500张图像的 LoRA 微调即可实现四倍于零样本最佳的 ROUGE-L 分数提升。数据集的分层切分策略与155个字段丰富的元数据,亦被后续研究采纳作为跨数据集泛化性测试的标准协议,推动了农业多模态学习领域的评价体系构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务