遇见数据集

UTAD Grapevine Varieties Dataset 2023

收藏
arXiv2025-06-16 更新2025-11-28 收录
数据链接:
官方服务:

资源简介:

该数据集收集了来自葡萄牙两个地点,即University of Trás-os-Montes and Alto Douro和Palácio de Mateus,在四年内(2020-2023)的葡萄园叶子图像。数据集包含了35种葡萄园品种,涵盖了世界范围内种植最广泛的五种葡萄品种中的五种,以及用于杜罗法定产区葡萄酒生产的主要品种。图像是在不同的季节和环境下使用多种设备采集的,包括智能手机、平板电脑和相机。数据集被分为训练、验证和测试子集,以代表不同的生长阶段。

This dataset compiles grapevine leaf images collected from two sites in Portugal: the University of Trás-os-Montes and Alto Douro, and Palácio de Mateus, over a four-year span from 2020 to 2023. It contains 35 grapevine cultivars, covering the five most widely cultivated grape varieties globally, as well as the primary varieties used for wine production in the Douro Denominação de Origem Controlada (DOC) region. Images were acquired across diverse seasons and environmental conditions using multiple devices, including smartphones, tablets, and digital cameras. The dataset is partitioned into training, validation, and test subsets to represent distinct growth stages of grapevines.

创建时间:
2025-06-16
搜集汇总
数据集介绍
UTAD Grapevine Varieties Dataset 2023 数据集图片
构建方式
葡萄品种的精准识别对葡萄酒产业的质量管控与溯源至关重要,然而传统形态学与分子鉴定方法在效率与成本上存在局限。为突破这一瓶颈,本研究构建了UTAD Grapevine Varieties Dataset 2023数据集,旨在为基于深度学习的葡萄品种图像分类提供标准化基准。该数据集在葡萄牙维拉雷亚尔地区的UTAD与Mateus宫两处采集点,历时四个生长季(2020-2023年),使用智能手机、平板电脑及多种相机在距植物20-40厘米处拍摄叶片图像。数据涵盖43个品种,包含健康与患病叶片、不同叶位与植株龄期,并融入自然光变化与多采集者差异。训练集含7939样本,验证集1508样本,测试集4032样本,通过控制各类别最大样本量不超过最小类别的四倍来缓解类别不平衡,并依据采集日期划分数据以体现不同物候期。
特点
该数据集的核心优势在于其规模与多样性的有机融合,为细粒度葡萄品种分类提供了前所未有的挑战与机遇。相较于现有公开数据集常局限于不足10个品种或单一生长季,本数据集囊括43个品种,覆盖全球13种主栽葡萄中的5种、杜罗河产区主要酿酒品种及26种波特酒推荐品种,实现了品类广度上的显著突破。历时四年的跨季节采集策略,确保了数据包含叶片发育、开花、果实发育等多个物候阶段的形态变异,使模型能够学习品种内在的稳定性特征。此外,数据集包含不同健康状态、植株年龄与拍摄角度的图像,并采用多源设备与自然光环境,真实模拟了田间应用中的噪声与变化,从而有效提升模型的泛化能力与鲁棒性。
使用方法
该数据集专为评估自监督学习在农业图像分类中的效能而设计,特别是掩码自编码器的预训练范式。使用者可遵循两阶段训练协议:首先,利用提供的无标注数据集(Dataset 3或Dataset 3+)对ViT架构(ViT-T、ViT-S、ViT-B)进行MAE预训练,通过随机掩码与图像重建任务让模型学习领域相关的视觉表征;预训练时推荐掩码比率0.6,并采用随机裁剪作为唯一数据增强方式。随后,使用本数据集对预训练编码器进行全模型微调,附加分类头后以交叉熵损失在100个epoch内完成品种分类任务。研究表明,该协议优于ImageNet1K迁移学习方案,在低数据量场景尤其有效,且简单增强策略效果优于复杂增强,为葡萄栽培领域的精准生产提供了可复现的技术路径。
背景与挑战
背景概述
葡萄品种的精准识别在葡萄酒产业中具有举足轻重的地位,直接影响酒品品质、风味特性及产区经济价值。传统依赖于叶片形态学的葡萄品种鉴定方法和分子生物学分析虽有一定成效,却各自存在主观性强、成本高昂或耗时长久的缺陷。为突破这些桎梏,葡萄牙特拉兹-奥斯-蒙蒂斯和阿尔托杜罗大学的研究团队,在加布里埃尔·卡内罗博士的带领下,于2023年创建了UTAD Grapevine Varieties Dataset。该数据集跨越2020至2023四个生长季,涵盖43个葡萄品种、超过13,000张野外叶片图像,旨在为基于深度学习的葡萄品种分类提供极具代表性的基准。这项成果推动了精准葡萄栽培中自监督学习方法的探索,显著影响了农业计算机视觉领域的研究范式。
当前挑战
该领域面临的核心挑战在于解决传统识别方法的固有局限:一方面,基于专家经验的叶片形态学鉴定难以保证客观一致性,且专业人才稀缺;另一方面,分子分析技术虽精确却成本高昂、周期漫长。在数据集构建过程中,研究人员遭遇了多重难题,包括在自然光照和复杂背景下获取高质量、多样化叶片图像,以及平衡不同品种间的样本不平衡问题。此外,现有公开数据集普遍样本量小、品种有限且仅覆盖单一生长季,导致深度模型在跨季节和田间实际应用中泛化能力不足。同时,转移学习广泛依赖ImageNet等自然图像数据集,与农业图像间存在显著域差异,引发监督崩溃,影响分类性能。
常用场景
经典使用场景
在精准农业与计算机视觉交汇的学术前沿,UTAD Grapevine Varieties Dataset 2023作为迄今为止最为详实的葡萄品种图像基准数据集,为葡萄品种的细粒度分类任务提供了坚实的实验平台。该数据集囊括了43个广泛栽培的葡萄品种,图像采集横跨2020至2024四个生长季,覆盖了叶片发育、开花及果实成熟等多个关键物候期,显著提升了模型在真实田间场景下的泛化能力评估。研究者常利用该数据集构建和验证基于深度学习的分类模型,尤其关注如何克服葡萄叶片在形态上的类间模糊性以及复杂背景带来的干扰,从而推动品种识别技术从实验室可控环境迈向具有挑战性的开放田野。
解决学术问题
该数据集精准回应了葡萄品种识别领域长期存在的数据瓶颈与跨领域迁移障碍。传统研究方法或依赖成本高昂且主观性强的形态学鉴定,或受限于小规模、单季节、少品种的数据集,导致模型在实际部署时性能大幅衰退。UTAD Grapevine Varieties Dataset 2023通过大规模、多时相、多品种的精心设计,从根本上解决了过往研究中缺乏代表性训练数据的问题,使得自监督学习范式如掩码自编码器能够在无标注数据上进行有效预训练,有效缓解了因域偏移和标签崩塌而引起的性能退化,为深度学习在农业识别任务中的应用树立了新的评估标准。
衍生相关工作
该数据集的发布催生了一系列具有启发性的衍生研究工作,尤其在无监督与自监督学习的农业应用领域产生了深远影响。基于该数据集,研究者系统评估了掩码自编码器在长期预训练、低标注数据训练及数据增强等场景下的表现,揭示了预训练时长与模型规模对下游任务性能的非线性提升规律。同时,该工作还深入比较了自监督重构范式与对比学习范式在解决领域偏移时的优劣势,为后续将自监督预训练推广至果实检测、叶片病害识别及花卉计数等细分农业任务提供了关键的经验法则与优化路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务