遇见数据集

nusa-pheno-indonesia-rice-forecasting

收藏
Hugging Face2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

NUSA-PHENO 印度尼西亚水稻预测数据集是一个面向县级(kabupaten/kota)收获前预测的数据集,专注于印尼水稻收割面积和产量的估算。数据集以 ADM2-年份为基本建模单元,包含 3595 个可用行(从 3598 个检索行中剔除 3 个异常记录)。每个样本包含稳定的 ADM2 标识符、源 URL、SHA-256 校验值、捕获/可用性元数据、解析器版本、边界年份、数据集分割标识和验证状态。主要标签为收割面积(公顷)和稻谷产量(吨干未脱壳稻谷,GKG),官方产量(公担/公顷)保留用于审计。时间分割明确:2019 年为滞后上下文,2020-2022 年为训练集,2023 年为验证/校准集,2024 年为时间测试集,2025 年为最终保留测试集。数据来源包括印尼统计局(BPS)的官方农业统计、Planetary Computer 的 Sentinel-1 RTC(43575 个目录项)和 Sentinel-2 L2A(397131 个唯一项)遥感影像、CHIRPS v2 降水数据(2019-2025 年候值)、ECMWF C3S 实时天气集合(System 5 和 System 51)、ERA5-Land 再分析数据,以及静态先验数据(Open-SEA-Rice10、GlobalRice20 图块)。数据集还包含一个因果事件计划(72236 条记录)和原生分辨率试点数据(15 个真实 S1+S2 事件)。该数据集适用于表格回归和时间序列预测任务,主要用于农业产量预测、遥感应用和官方统计验证。

The NUSA-PHENO Indonesian Rice Prediction Dataset is a pre-harvest prediction dataset at the district level (kabupaten/kota), focusing on estimating rice harvested area and production in Indonesia. The dataset uses ADM2-year as the basic modeling unit, containing 3595 available rows (with 3 anomalous records removed from 3598 retrieved rows). Each sample includes stable ADM2 identifiers, source URLs, SHA-256 checksums, capture/availability metadata, parser version, boundary year, dataset split identifier, and validation status. The main labels are harvested area (hectares) and paddy production (tons of dry unhusked rice, GKG), with official yields (quintals/hectare) retained for auditing. The temporal split is clear: 2019 as lag context, 2020-2022 as training set, 2023 as validation/calibration set, 2024 as temporal test set, and 2025 as final held-out test set. Data sources include official agricultural statistics from BPS (Statistics Indonesia), remote sensing imagery from Planetary Computer (Sentinel-1 RTC with 43575 catalog items and Sentinel-2 L2A with 397131 unique items), CHIRPS v2 precipitation data (pentad values from 2019-2025), ECMWF C3S real-time weather ensembles (System 5 and System 51), ERA5-Land reanalysis data, and static prior data (Open-SEA-Rice10, GlobalRice20 tiles). The dataset also includes a causal event plan (72236 records) and native resolution pilot data (15 real S1+S2 events). This dataset is suitable for tabular regression and time series forecasting tasks, primarily used for agricultural yield prediction, remote sensing applications, and official statistical validation.

创建时间:
2026-08-11
原始信息汇总

数据集概述

NUSA-PHENO Indonesia Rice Forecasting Data 是一个专注于印度尼西亚县级(kabupaten/kota)水稻收获面积和产量收获前预测的数据集,采用"来源优先"(provenance-first)的设计理念,以 ADM2-年份为建模单元,行政省仅作为来源封装和协调控制使用。

核心目标数据

数据集共包含 3,595 个可用的 ADM2-年份行(从 3,598 行中提取),所有 54 项独立质量门控全部通过。每行数据携带稳定的 ADM2 标识符、来源 URL、SHA-256 字节校验、采集/可用性元数据、解析器版本、边界版本、数据划分及验证状态。

年份 角色 检索 ADM2 可用 ADM2 隔离
2019 滞后上下文 514 514 0
2020 训练 514 513 1
2021 训练 514 514 0
2022 训练 514 514 0
2023 验证/校准 514 514 0
2024 时序测试 514 514 0
2025 最终测试 514 512 2

主要标签为水稻收获面积(公顷)和稻谷产量(吨,干未脱壳稻谷 GKG)。官方单产(公担/公顷)保留用于审计,派生单产按公式 10 * production_t_gkg / area_ha 计算。

时间与测试契约

  • 2019 年为滞后上下文;2020-2022 年为训练集;2023 年为选择/校准集;2024 年为时序测试集;2025 年为最终留出测试集。
  • 2024 年和 2025 年的标签物理隔离存放在 targets/test/ 下,加载器会拒绝在训练和模型选择阶段使用测试路径,评估器访问需冻结运行密封。
  • 缺失或模糊值一律隔离,不会静默插补或编码为零。

动态地球观测目录

公共动态 EO 轨道为元数据/选择发布,非全国原始栅格镜像,包含 2019-07 至 2025-06 的 72 个月度窗口,数据源自 Planetary Computer STAC:

  • Sentinel-1 RTC:43,575 条目录项,剔除 146 条仅 VV 极化记录后,43,429 条符合严格双极化候选。
  • Sentinel-2 L2A:397,131 条唯一项,273,459 条严格选择;每条均接受目标年份发布截止时间和生成时间检查,119,498 条发布后重处理版本被隔离,不进入因果特征。
  • 发布包含原始 STAC 页面、精简目录、严格决策、选择凭证、摘要和独立审计,但不声称提供地块级水稻分割。

因果事件计划与原生分辨率试点

event_plan/event_plan_2020_2025.jsonl.gz 包含 72,336 条确定性 ADM2-年份/原型/事件记录(每条可用行对应八个内部覆盖原型和三个生物窗口),记录精确的 BIG 边界版本、BPS 交叉表、源条目 ID、点边框检查、发布截止时间和原生资产 URL。计划中明确记录了 67 个历史几何间隙和 2020 年 S2 因果可用性间隙。

event_pilot/2021/ 为验证性烟雾发布,包含 15 个真实 S1+S2 事件,存储在两个 NPZ 分片中,保留 S2 10/20/60 米波段、SCL 质量指标、S1 VV/VH 10 米数据、原生数据类型、源 ID 和载荷哈希,作为物化器验证证据,而非完整训练语料。

天气主线路

因果天气发布包含 453 个验证对象(总计 713,857,676 字节):

  • CHIRPS v2 每十天数据(2019-2025):215 个已接受的发行时资产;2022 年 6 月第二个十天初步资产因发布商时间戳晚于 7 月 10 日截止而被有意排除,不虚构数值。
  • ECMWF C3S 实时 GRIB 资产 六个:2020-2022 年 System 5 和 2023-2025 年 System 51,各保留 51 成员集合、7 月 1 日初始化、24-4416 小时前置期及印度尼西亚边界窗口。
  • ERA5-Land 最终版和 CHIRPS v3 回顾性替代数据被排除在严格评分之外。

静态先验与评估资产

九个校验和验证对象(总计 1,374,152,424 字节)单独发布:

  • 先验数据priors/):Open-SEA-Rice10 和四个 GlobalRice20-2015 瓦片。
  • 评估专用数据eval_only/):四个 GlobalRice20-2024 瓦片,这些资产在训练、掩膜构建、原型选择或模型选择期间永远不会被打开。

许可与引用

数据集为来源编译的研究数据集,遵循来源特定条款,许可证声明为 other。引用时需注明 BPS(含出版/表格标题、访问日期和直接来源 URL),以及 Planetary Computer、CHIRPS、ECMWF/C3S、Zenodo 等提供方各自的条款。行级和对象级来源凭证对归因和可复现性具有权威性。

搜集汇总
数据集介绍
nusa-pheno-indonesia-rice-forecasting 数据集图片
构建方式
本数据集以印度尼西亚省级以下行政区(ADM2)为预测单元,整合了BPS官方统计的稻谷收获面积与产量作为目标变量,并构建了包含时间序列与面板数据的特征体系。数据构建严格遵循时序逻辑,将2019年作为滞后上下文,2020-2022年训练,2023年校准,2024-2025年作为时间外推测试集,并明确划分了有效行与隔离行,确保数据完整性。同时,数据集融合了来自Planetary Computer的动态地球观测影像目录,通过严格筛选与时间截止验证,排除了因果泄漏风险。此外,还引入了与因果事件计划链接的本地化试点数据,以及CHIRPS、ECMWF C3S等气象数据,构建了多维度的特征空间。所有数据均附带详细的来源追踪信息与校验码,保障了可复现性。
特点
该数据集最显著的特点是其来源优先(provenance-first)的设计哲学,每一行数据均包含稳定的行政区划标识、源URL、SHA-256校验值及采集元数据,确保数据的可追溯性与可信度。时间序列结构严谨,明确划分了训练、验证与测试时段,并确保测试标签物理隔离,防止无意中的数据泄漏。数据涵盖多源异构信息,包括哨兵1号与2号的遥感影像、气象再分析数据及静态水稻种植先验地图,但并未直接提供像元级分割,而是通过行政区域遮罩聚合,保持了生态学意义的输入。同时,数据对缺失值采取隔离而非插补策略,并记录了历史几何缺口与选择版本,如实反映数据的不确定性,为模型开发提供了稳健且诚实的基准。
使用方法
使用该数据集时,用户应遵循官方划分的时序协议:仅可使用2019-2022年数据进行特征工程与模型训练,2023年用于模型选择或超参数校准,而2024-2025年数据仅允许在测试阶段使用。加载程序会拒绝将测试路径用于训练或选择,因此需要严格遵守数据驱动的因果性。遥感影像数据需通过内置的选取规则(如时间截止、极化组合)进行过滤,再结合行政区划掩膜进行时空聚合,以构建特征矩阵。气象数据需注意其发布时滞,避免使用未经时间校验的替代版本。建议参考事件计划文件来明确各地块的特征来源,并利用验证元数据评估覆盖率。用户可通过预编译的加载器或自定义管道,按步骤输出ADM2年份级别的预测结果,并对照官方产量进行模型评估。
背景与挑战
背景概述
NUSA-PHENO Indonesia Rice Forecasting Data是2025年发布的一个面向印度尼西亚县级(ADM2)水稻收获面积与产量预测的前瞻性数据集。由研究团队基于印尼中央统计局(BPS)官方数据及多源遥感与气象资料精心构建,旨在解决印尼水稻产量估算中行政边界动态变化、数据版本不一致及预测时效性不足等核心问题。该数据集严格遵循“来源优先”(provenance-first)原则,详细记录每行数据的来源URL、SHA-256校验值、捕获时间及边界版本,确保了数据的可追溯性与可重复性。其时间划分清晰(2019-2025年),并设置严格的时序测试集,为水稻预收获预测研究提供了标准化基准,对粮食安全监测与农业政策制定具有重要参考价值,推动了遥感与统计融合的精细化农业预测研究。
当前挑战
该数据集构建与使用面临多重挑战:首要挑战在于遥感特征与产量标签间存在时空错位,如Sentinel-2数据在2020年存在因果可用性缺口,以及2022年CHIRPS降水初步产品发布时间晚于设定截止日,需严格审核以避免信息泄漏。行政边界逐年变动及不同年份BPS行政区划编码不一致,增加了数据整合的复杂性,数据集通过保留边界版本与交叉映射来应对,但仍有67个历史几何缺口未回填。此外,水稻物候期长度不一,需利用事件计划(event_plan)将每县每作物季的遥感像素与物候窗口精确匹配,涉及8个内部覆盖原型与3个生物学窗口,算法复杂度极高。最终,构建过程中对缺失值坚持隔离而非插补,为下游建模带来了数据不均衡与稀疏性难题,需后续研究开发适应该隔离策略的稳健预测算法。
常用场景
经典使用场景
NUSA-PHENO数据集专为印度尼西亚县级(ADM2)水稻收获面积与产量的收获前预测而设计,其核心应用场景是时间序列回归与表格回归任务。研究者可利用该数据集构建基于遥感植被指数和气象数据的预测模型,以预先估计水稻产量。数据集严格划分了训练、验证和时间测试集,支持多年度时序分析,尤其适合利用历史气象(如CHIRPS降水)和Sentinel-1/2卫星影像特征进行监督学习,实现区域尺度的作物产量预测。
实际应用
在实际应用中,该数据集可用于支持印度尼西亚国家级和地区级的粮食安全监测体系。通过整合官方统计、卫星遥感和气象数据,有助于提前预警潜在的水稻减产风险,指导农业保险定价和粮食进口决策。政府机构和农业部门可利用预测结果优化资源分配,如精准投放肥料和水利设施,从而提升粮食生产稳定性和区域经济韧性。
衍生相关工作
该数据集的发布催生了多个衍生的研究工具和数据集。例如,Open-SEA-Rice10和GlobalRice20-2015/2024提供了水稻种植区域的空间先验,用于改进作物掩膜。此外,事件计划(event_plan)和原生分辨率试点(event_pilot)推动了高效的遥感数据材料化工具链的开发,支持基于STAC的时空数据检索和端到端预测流程。这些衍生工作促进了可复现的农业遥感研究,为区域作物评估提供了标准化管道。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务