遇见数据集

加利福尼亚作物产量基准数据集

收藏
arXiv2025-06-12 更新2025-11-28 收录
官方服务:

资源简介:

加利福尼亚作物产量基准数据集是一个包含超过70种作物,覆盖加利福尼亚州所有县的数据集。该数据集整合了多种数据来源,包括Landsat卫星图像、每日气候记录、每月蒸发蒸腾量和高分辨率土壤属性。数据集的时间跨度为2008年至2022年。该数据集为县一级、特定作物的产量预测提供了标准化和全面的输入。数据集的创建旨在通过整合多源数据,提高作物产量预测的准确性,确保模型在作物类型、地区和管理条件方面具有鲁棒性。数据集及其代码库已在GitHub上公开提供,可供公众访问和使用。

The California Crop Yield Benchmark Dataset is a comprehensive dataset covering all counties in California, encompassing over 70 crop varieties. It integrates multiple data sources, including Landsat satellite imagery, daily climate records, monthly evapotranspiration data, and high-resolution soil properties. The dataset spans the period from 2008 to 2022, and provides standardized and comprehensive input features for county-level, crop-specific yield prediction tasks. Developed to enhance the accuracy of crop yield prediction via multi-source data integration, this dataset ensures the robustness of predictive models across diverse crop types, geographic regions, and agricultural management conditions. The dataset and its accompanying codebase are publicly released on GitHub for unrestricted public access and use.

创建时间:
2025-06-12
搜集汇总
数据集介绍
加利福尼亚作物产量基准数据集 数据集图片
构建方式
该数据集构建于加利福尼亚州,覆盖2008至2022年(缺2012年)期间所有县的70余种作物。整合了来自Landsat卫星的月度多光谱影像(30米分辨率)、DayMet提供的八项日尺度气象变量(1000米分辨率)、OpenET估算的月蒸散量(30米分辨率)以及SSURGO高分辨率土壤属性(30米分辨率)。通过USDA的农作物数据层(CDL)精准识别不小于10公顷的作物田块,进而将上述多源数据按空间位置对齐,形成年度作物产量与时空环境变量一一关联的基准数据集,旨在支持县级尺度的产量预测模型开发。
特点
该数据集最显著的特点在于其前所未有的多模态融合与广度。不仅整合了卫星遥感、气候、蒸散发与土壤四类异质数据,还覆盖了加利福尼亚所有农业县及超过70种作物,远超以往仅关注少数主粮作物的研究。数据采用30米高空间分辨率(气候数据为1000米)与月/日级时间分辨率,能够精细刻画作物生长季内的时空动态。此外,土壤属性作为静态输入融入每个时间步,有效捕捉了土壤特性对产量的长期影响,为模型提供了关键的基础信息。
使用方法
该数据集专为基于深度学习的县级作物产量预测设计。使用时,可通过CDL识别作物类型后,从Landsat影像、气候、蒸散发和土壤数据中按像素提取对应特征。论文提供了一个多模态Vision Transformer模型作为基准,该模型采用分层特征提取与时间序列编码器,分别处理卫星(12月×6波段)、气候(365天×8变量)、蒸散发(12月×1变量)和静态土壤(5属性),并通过交叉注意力机制融合。数据已按时间划分(2021-2022年作为测试集),并开放于GitHub,可直接用于训练、验证与评估,支持研究者在相同框架下开展可复现的产量预测实验。
背景与挑战
背景概述
加利福尼亚作物产量基准数据集(California Crop Yield Benchmark)由加州大学戴维斯分校的Hamid Kamangir、Mona Hajiesmaeeli及Mason Earles等研究人员于2025年发布,旨在应对农业产量预测中多源异构数据整合的挑战。加州作为全球第五大食品和棉花供应地,贡献了美国农业总产值的12.5%,但复杂的环境、气候及土壤因素使得精准产量预估困难重重。该数据集整合了2008至2022年间Landsat卫星影像、日气候记录、月蒸散发数据及高分辨率土壤属性,覆盖加州所有县区及70余种作物,为多模态深度学习模型提供了标准化训练基础。其显著影响力在于填补了大规模、跨作物、县域级基准数据的空白,为农业预测、气候适应及精准农业研究奠定了坚实基础。
当前挑战
该数据集面临的核心挑战包括:一是解决领域内长期存在的多源数据融合难题,即卫星影像、气候、土壤和蒸散发等异质模态在时空分辨率与语义上的不统一,导致传统方法难以捕捉作物生长的复杂动态;二是构建过程中需克服数据缺失与质量不均的障碍,例如2012年因Landsat单星运行而难以获取无云影像,被迫剔除该年份数据;三是模型在70余种作物上的泛化性能存在差异,对玉米、杏仁等高变异作物预测精度较低,测试集RMSE超过8吨/英亩,反映出有限的样本量与季节性波动对模型鲁棒性的制约。这些挑战凸显了扩展时间序列深度、增强地域覆盖及开发作物专属特征的迫切需求。
常用场景
经典使用场景
加利福尼亚作物产量基准数据集最为经典的使用场景在于为多模态深度学习模型提供标准化的训练与评估平台,以实现县域尺度、作物特异性的产量预测。该数据集整合了Landsat卫星影像、逐日气候记录、月度蒸散发数据以及高分辨率土壤属性,覆盖加州所有县域逾70种作物从2008年至2022年的生长季信息。研究者可借此将遥感植被指数、气象胁迫因子、土壤水热条件与作物类型编码等异构模态输入统一融合,构建能够捕捉时空动态的时序编码器与分层特征提取器,从而在复杂农业生态系统中实现稳健的产量估算。这一场景不仅验证了多模态Transformer架构在农业领域的泛化能力,也为后续跨作物、跨区域的迁移学习研究奠定了数据基础。
实际应用
在实际农业生产中,该数据集为精准农业与气候适应性管理提供了关键的决策支持工具。基于加州产量基准训练的多模态预测模型,能够在作物生长季内动态输出县域尺度的产量预估,从而辅助农业保险机构精算风险、农场管理者优化灌溉与施肥策略,以及政府部门评估干旱或极端温度对粮食供给的潜在冲击。例如,模型可依据月度蒸散发与土壤有效蓄水量的时序变化,提前识别缺水产区的产量受损概率,指导水务部门进行差异化调水调度。此外,该数据集还可用于构建早期预警系统,结合气候变化情景模拟不同农作物的长期产量趋势,为可持续农业规划与粮食安全战略提供数据驱动的科学依据。
衍生相关工作
该数据集的发布催生了若干重要的衍生研究工作。首先,研究者基于其标准化的多模态基准,开发了改良的多模态视觉Transformer(Multi-modal Vision Transformer)模型,通过引入分层注意机制与时序编码器,显著提升了对玉米、杏仁等复杂作物产量的预测精度。其次,该数据集被用于验证跨作物知识迁移的有效性,相关工作探讨了如何利用加州70余种作物的共性生长特征预训练一个通用编码器,再通过微调适配至数据稀缺的作物或区域。此外,受该基准启发,后续研究将卫星遥感与网格化气象再分析数据进一步耦合,并引入管理变量(如播种日期、品种选择),形成了面向田间尺度的产量预测框架,极大地拓展了高分辨率农业监测的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务