farmerchat-image-samples
收藏资源简介:
FarmerChat Crop Image Samples 是一个由 Digital Green 发布的农业图像数据集,源自 FarmerChat 农业咨询服务,该服务面向印度、埃塞俄比亚、肯尼亚和尼日利亚的小农用户。数据集包含 5,946 条记录(5,814 张不同照片,部分照片属于多个类别),涵盖 2025 年 8 月至 2026 年 7 月期间提交的作物照片。所有图像均经过服务自身图像质量门控和自动内容检查(确保为真实农业照片,排除模糊、剪贴画、AI生成图像等),并进行了个人数据(面部、证件、GPS位置等)自动筛查和文本脱敏。数据集包含 6 个类别,代表自动作物诊断流程的不同结果:multimodal_organic_text(附有农民原始文本,非快速回复模板)、low_confidence_diagnosis(低置信度诊断)、diagnosis_returned(识别出作物并给出具体病害/虫害诊断)、crop_identified_diagnosis_unresolved(识别出作物但健康状态未确定)、healthy_crop(识别出作物且评估为健康)、crop_unresolved(无法识别作物)。每张照片可能属于多个类别,在 metadata.csv 中以独立行记录。字段包括:file_name(图像相对路径)、image_id(稳定图像标识符)、category(类别)、country(国家)、month(提交年月)、crop(识别出的作物,标准化名称)、diagnosis(诊断结果,标准化名称)、query_present(是否附有农民文本)、farmer_query(原始语言农民问题,已脱敏)、farmer_query_en(英文翻译,已脱敏)。诊断和作物/健康标签来自自动化管道,未经专家验证。数据集适用于图像分类(如作物健康状态识别)和表格分类(如基于元数据的预测)任务,许可协议为 CC BY 4.0。
FarmerChat Crop Image Samples is an agricultural image dataset published by Digital Green, sourced from the FarmerChat agricultural advisory service serving smallholder farmers in India, Ethiopia, Kenya, and Nigeria. The dataset contains 5,946 records (5,814 unique photos, some belonging to multiple categories) covering crop photos submitted from August 2025 to July 2026. All images have passed service image quality gates and automatic content checks (ensuring real agricultural photos, excluding blurry, clip art, AI-generated images, etc.), and have undergone automatic screening of personal data (faces, IDs, GPS locations, etc.) and text desensitization. The dataset includes 6 categories representing different outcomes of the automated crop diagnosis pipeline: multimodal_organic_text, low_confidence_diagnosis, diagnosis_returned, crop_identified_diagnosis_unresolved, healthy_crop, crop_unresolved. Each photo may belong to multiple categories, recorded as separate rows in metadata.csv. Fields include: file_name, image_id, category, country, month, crop, diagnosis, query_present, farmer_query, farmer_query_en. Diagnoses and crop/health labels come from an automated pipeline without expert validation. The dataset is suitable for image classification and tabular classification tasks. License: CC BY 4.0.
FarmerChat Crop Image Samples 数据集详情
数据集概述
FarmerChat Crop Image Samples 是由 Digital Green 发布的一个农业图像样本数据集,来源于面向印度、埃塞俄比亚、肯尼亚和尼日利亚小农户的农业咨询服务 FarmerChat。该数据集包含 6,096 条记录(涉及 5,964 张独立照片,部分照片属于多个类别),涵盖 7 个类别,代表自动化作物诊断流程的不同结果。照片提交时间跨度为 2025年8月至2026年7月。
数据筛选流程
数据集中的每张照片均经过两道独立筛选:
- 服务自身的图像质量门控:拒绝模糊、光线不佳、构图不当或未检测到植物的提交。仅包含该门控运行期间的提交。
livestock类别为例外,因门控默认寻找植物主体,故此类照片依据第二道筛选纳入。 - 自动化内容检查:使用视觉语言模型审查每张图片,仅保留真正属于农业范畴、是合理的诊断提交(而非偶然或离题内容)、且为原始拍摄照片(非截图、模板图、库存图或 AI 生成图)的图片。对于
livestock类别,依赖模型对照片的确认来判断是否实际显示动物。
经过筛选,排除了农民发送的截屏、文档照片、宠物、食物、AI 生成图片等离题内容,确保数据集仅包含真实的农作物和牲畜照片。
类别明细
| 类别 | 记录数 | 含义 |
|---|---|---|
multimodal_organic_text |
999 | 照片附有农民手写文本(非重复快捷回复模板) |
low_confidence_diagnosis |
995 | 返回了诊断结果,但模型置信度较低 |
diagnosis_returned |
991 | 识别出作物并返回具体的病虫害诊断 |
crop_identified_diagnosis_unresolved |
991 | 识别出作物但未确定健康状况 |
healthy_crop |
987 | 识别出作物且评估为健康 |
crop_unresolved |
983 | 照片中无法识别出作物 |
livestock |
150 | 照片显示的是动物而非作物 |
同一张图片可属于多个类别,每个类别成员身份在 metadata.csv 中为独立行,共享相同 file_name。livestock 行的 crop 和 diagnosis 字段为 not_applicable 或 no_crop_detected,且 farmer_query / farmer_query_en 多为空白。
数据列说明
| 列名 | 描述 |
|---|---|
file_name |
图像文件的相对路径 |
image_id |
每张图片的稳定标识符 |
category |
上述类别之一 |
country |
提交来源国家 |
month |
照片提交的年月(YYYY-MM格式) |
crop |
照片中识别的作物(如已解析),已标准化为统一名称 |
diagnosis |
识别出的诊断结果(如已解析),已标准化,非原始标签 |
query_present |
农民是否随照片发送了文本 |
farmer_query |
农民的原始语言问题(已进行 PII 脱敏) |
farmer_query_en |
同一问题的英文翻译(已进行 PII 脱敏) |
个人数据保护
所有照片均经过自动筛查(人脸、个人文件、GPS 位置叠加等),被标记的内容已排除。农民文本中的姓名、电话号码、电子邮箱和物理地址均已替换为 [REDACTED]。但自动筛查不能完全消除残留个人内容的风险,部分照片可能带有相机水印或时间戳。
局限性
- 诊断结果和作物/健康标签来自自动化流程,并非经过验证的专家标签。
- 步骤2中的内容检查本身是自动化模型判断,可能存在双向错误。
许可与联系
- 许可协议:CC BY 4.0
- 联系邮箱:lakshmi@digitalgreen.org
- 加载方式:可通过 Hugging Face
datasets库使用load_dataset("DigiGreen/farmerchat-image-samples", split="train")加载,或直接读取metadata.csv并根据file_name列访问images/文件夹中的图像。




