遇见数据集

karhutla

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

Karhutla Riau Early-Warning System 数据集是一个用于泥炭地火灾早期预警的特征和标签数据集。它覆盖印度尼西亚 Riau 省及周边区域,基于一个固定的 5 km 等面积网格(Albers Indonesia Equal Area Conic 投影),网格包含 85 列 × 82 行,共 6970 个网格单元,其中 3598 个单元位于 Riau 省内。数据集时间范围为 2019 年 1 月 1 日至 2023 年 12 月 31 日(共 1826 天),包含以下数据源: - VIIRS 热点标签:基于 NASA FIRMS VIIRS S-NPP 375 m 主动火灾检测数据,通过空间分箱和持久性过滤(≥2 次检测,窗口为 (t+1, t+7])生成每日二元标签(1 表示火灾,0 表示无火灾,-1 表示非陆地单元)。训练集(2019-2022)有 32,600 个正样本,测试集(2023)有 4,941 个正样本。 - CHIRPS v3 SAT 降雨:来自 UCSB-CHC 的每日卫星降雨数据(0.05° 分辨率),在每个网格单元上取平均,覆盖所有陆地单元(6,506 个),无缺失值。 - Sentinel-1 SAR 后向散射:来自 ESA Sentinel-1 GRD IW 模式,10 m 分辨率,包含 VV、VH 极化及入射角,以中值作为单元值。由于重访周期为 6-12 天,通过前向填充(最长 14 天)生成每日数据,超过 14 天的间隙标记为 NaN 并附带有效掩码。 - ERA5-Land 每日气象:来自 ECMWF ERA5-Land 再分析数据,状态变量(2m 温度、露点温度、10m 风分量、土壤湿度)取日平均,通量变量(总降水量、地表太阳辐射)取日累计。覆盖 5,821 个网格单元,边缘单元通过最近邻空间填充。 - Dynamic World 土地覆盖概率:来自 Google Dynamic World V1(10 m,Sentinel-2 衍生),每类概率取网格单元平均值,因云覆盖缺失时赋值为 0 并附带可用性掩码。 - 泥炭深度/范围:来自 BIG/Satupeta 的静态图层,通过面积加权方法将泥炭厚度类别转换为中点深度(米),共 722 个单元有泥炭。 所有数据已对齐至固定网格,并通过 `cell_idx` 作为联合键。预构建的张量 `data.npy` 形状为 [1826, 82, 85, 23](float32),对应 23 个通道:ERA5 变量(8 个)、CHIRPS 降雨(1 个)、SAR 特征(3 个,含可用性掩码)、Dynamic World 类概率(8 个)及可用性掩码(1 个)、泥炭深度(1 个)、滞后热点计数(1 个)。标签张量 `labels.npy` 形状为 [1826, 82, 85](int8)。所有缺失数据已通过空间填充、前向填充或掩码通道处理,张量中无 NaN。该数据集适用于时间序列预测任务,特别是基于多源遥感与气象数据的泥炭地火灾预警模型。

The Karhutla Riau Early-Warning System dataset is a feature and label dataset for peatland fire early warning. It covers the Riau province of Indonesia and surrounding areas, based on a fixed 5 km equal-area grid (Albers Indonesia Equal Area Conic projection) with 85 columns × 82 rows, totaling 6970 grid cells, of which 3598 are within Riau province. The time range is from January 1, 2019, to December 31, 2023 (1826 days), and includes the following data sources: VIIRS hotspot labels, CHIRPS v3 SAT precipitation, Sentinel-1 SAR backscatter, ERA5-Land daily meteorology, Dynamic World land cover probabilities, and peat depth/extent. All data are aligned to the fixed grid with cell_idx as the joint key. The pre-built tensor data.npy has shape [1826, 82, 85, 23] (float32) with 23 channels; the label tensor labels.npy has shape [1826, 82, 85] (int8). All missing data are handled via spatial interpolation, forward filling, or mask channels, with no NaN in the tensors. This dataset is suitable for time series prediction tasks, especially for peatland fire early warning models based on multi-source remote sensing and meteorological data.

创建时间:
2026-08-06
原始信息汇总

数据集概述:Karhutla Riau 泥炭地火灾早期预警系统

这是一个面向印度尼西亚廖内省(Riau)泥炭地火灾早期预警模型的特征与标签数据集,所有数据统一对齐在一个固定的 5 公里等面积网格 上,覆盖廖内省及其周边边界框区域。cell_idx 是所有数据源之间的通用连接键。

存储结构

  • 原始数据 (raw/<source>/):包含 8 个数据源的 389 个 CSV 文件
  • 预构建张量 (tensors/):包含 data.npy [1826,82,85,23] float32labels.npy [1826,82,85] int8 (-1/0/1)meta.json
  • 时间范围为 2019-01-01 至 2023-12-31,数据中 无 NaN

网格定义

  • 总面积:6,970 个网格单元(85 列 × 82 行,覆盖边界框)
  • 廖内省内:3,598 个单元(主要预测目标)
  • 陆地单元:6,506 个(廖内省 3,598 + 非廖内陆地 2,908);剩余 464 个为海洋单元
  • 单元大小:5,000 米;坐标系为 Albers 印度尼西亚等面积圆锥投影
  • 所有 6,970 个边界框单元均保留特征,因为周边单元(包括海洋)为时空模型的 15×15 补丁提供上下文信息

数据源详情

1. VIIRS 热点(标签)

  • 来源:NASA FIRMS VIIRS S-NPP 375 米主动火灾探测
  • 标签定义:某单元在时间 t 的二元标签为 1,当且仅当该单元在 (t+1, t+7] 窗口内有 ≥ 2 次探测(持久性过滤,减少阴燃泥炭误报)
  • 数据量:2019-2023 年共 11.89M 行;训练集(2019-2022)32,600 个正标签,测试集(2023)4,941 个正标签
  • 正样本率:0.13% - 0.91%

2. CHIRPS v3 SAT 降雨

  • 来源:UCSB-CHC/CHIRPS/V3/DAILY_SAT(0.05° 分辨率,每日,mm/day)
  • 覆盖范围:6,506 个陆地单元,60 个文件,11.88M 行,无 NaN,无负值
  • 数值范围:0-385 mm/day;无需插补(完整日产品)

3. Sentinel-1 SAR 后向散射

  • 来源:COPERNICUS/S1_GRD IW 10 米,VV/VH 分贝 + 入射角
  • 原始采集频率:6-12 天,非每日,按轨道(升轨/降轨)分文件
  • 前向填充(默认开启):将真实采集值前向填充至每日,最大间隔 14 天,超过则该值被置为 NaN 并记录 filled 标记
  • 降轨数据 25.3% 无效 vs 升轨数据 2.2% 无效(无效率本身作为信号通道信息)
  • 填充方法为因果性(无未来泄漏),与实时 BPBD 仪表盘操作一致

4. 泥炭深度/范围(静态)

  • 来源:BIG/Satupeta FEG 第 48 层“泥炭生态系统功能图 1:50.000”
  • 处理方式:将泥炭厚度等级解析为中间值(米),使用面积加权叠加栅格化
  • 数据量:6,970 行;722 个单元有泥炭peat_frac > 0);深度范围 0-13.32 米

5. ERA5-Land 每日数据

  • 来源:ECMWF/ERA5_LAND/HOURLY,降为每日
  • 处理规则:状态波段(温度、露点、风、土壤水分)取日均值;通量波段(总降水、地表太阳辐射)取日求和(修正版本
  • 数据量:60 个文件,10.83M 行;1,149 个静态边缘单元位于 ERA5 足迹之外,通过最近有效单元空间填充(中位距离约 10 公里)

6. Dynamic World 土地覆盖

  • 来源:GOOGLE/DYNAMICWORLD/V1(10 米,Sentinel-2 衍生,云掩膜 ≤35%)
  • 处理方式:每个单元取类概率均值;缺失的(单元、日期)行中类概率设为 0,并增加 dw_available = 0 掩膜通道
  • 数据量:60 个文件,430 个唯一日期,所有 6,970 个单元至少覆盖 11 次(中位数 50 次)

预构建张量

  • 通道布局(23 通道):
    • 0-7:ERA5 变量
    • 8:CHIRPS 降水
    • 9-11:SAR VV/VH/可用性
    • 12-19:Dynamic World 类概率
    • 20:DW 可用性
    • 21:泥炭深度
    • 22:滞后热点计数
  • 输入窗口:14 天输入,7 天预测窗口,15×15 补丁
  • 标签定义:1 = 在 (t+1, t+7] 内有 ≥2 个热点;0 = 无火;-1 = 非陆地单元
  • 无 NaN(ERA5 通过空间填充,S1/DW 使用掩膜通道)

数据源汇总

数据源 角色 频率 覆盖范围 总行数 缺失情况
网格 空间框架 静态 6,970 单元 6,970
VIIRS 标签 每日 6,506 陆地单元 11.89M
CHIRPS 降雨特征 每日 6,506 陆地单元 11.88M 仅海洋单元
S1 原始 雷达特征 6-12 天 6,970 单元 2.18M 幅宽间隙(已填充)
S1 填充 雷达特征(每日) 每日 6,970 单元 25.40M >14 天间隙 → NaN + 掩膜
ERA5-Land 天气+土壤湿度 每日 5,821 单元原生 10.83M 边缘单元 → 空间填充
Dynamic World 土地覆盖概率 2-5 天 6,970 单元 0.39M 云 → 0 + 掩膜
泥炭 静态特征 静态 6,970 单元 6,970
搜集汇总
数据集介绍
karhutla 数据集图片
构建方式
Karhutla数据集专为廖内省泥炭地火灾早期预警系统设计,整合多源遥感与气象数据,统一对齐至5公里等面积网格。构建流程严谨:首先依据行政边界界定6970个网格单元(含3598个陆地目标单元),随后分别从CHIRPS v3、ERA5-Land、Sentinel-1 SAR、Dynamic World及VIIRS等数据源提取降雨、气象、雷达后向散射、土地覆盖及火点标签,并通过空间填充或掩码通道处理缺失值,最终组装为无NaN的每日张量,覆盖2019至2023年。
使用方法
数据集预设了完整的复现流程,用户可通过HuggingFace镜像直接获取原始CSV(raw/)及预处理张量(tensors/)。模型输入为data.npy和labels.npy,其中标签以-1/0/1区分非陆地、无火与有火状态。推荐采用15×15空间补丁结合时间序列的架构,利用通道中的有效性掩码(如sar_available、dw_available)自适应降权弱信号区。复现时,可运行数据摄取脚本(如viirs.py、chirpsv3.py等)重新生成数据,或直接加载预构建张量进行模型训练与评估。
背景与挑战
背景概述
karhutla数据集诞生于印度尼西亚廖内省泥炭地火灾早期预警系统的研究背景下,由研究团队于2019年至2023年间构建并维护,旨在提供高时空分辨率的火灾预测特征与标签数据。该数据集针对泥炭地火灾这一区域性环境灾害,整合了卫星遥感(如VIIRS、Sentinel-1、CHIRPS)与再分析资料(ERA5-Land)等多源数据,并采用统一的5公里等面积网格进行对齐,为机器学习模型提供了标准化的输入。其核心研究问题在于利用多模态时空数据提前预测火灾热点,以支持防灾决策。该数据集在泥炭地火灾预警领域具有开创性意义,为相关研究提供了第一个公开可复现的基准数据集,推动了基于深度学习的火灾预测方法的发展,并影响了政府间气候变化专门委员会等机构对泥炭地火灾风险的评估策略。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两大方面。在领域问题层面,泥炭地火灾具有隐蔽性强、持续时间长、受气象与地下水位影响显著等特点,导致标签存在稀疏性(正样本率不足1%)与时空不均衡性,模型需克服极端类别不平衡并捕捉跨周的滞后效应。构建过程中,多源数据的时间与空间分辨率不匹配(如Sentinel-1的6-12天重访周期与CHIRPS的日尺度)、云覆盖导致的光学数据缺失、ERA5-Land边缘格点的无效值,以及雷达数据超过14天间隔的有效性衰减等问题,要求设计精细的数据填充策略(如前向填充、空间最近邻插值)和有效性掩码机制。此外,数据总量庞大(超过380个文件,数百万行记录),在存储、处理与版本控制方面亦需高效的数据工程方案,以确保数据完整性与可复现性。
常用场景
经典使用场景
该数据集为泥炭地火灾早期预警研究提供了标准化、多源融合的时空数据框架。其核心使用场景是基于5公里等面积网格,整合VIIRS火点标签、CHIRPS降水、Sentinel-1 SAR后向散射、ERA5-Land气象与土壤湿度、Dynamic World土地覆盖及静态泥炭深度等多维特征,构建每日更新的时空预测模型。研究者可利用其预构建的张量数据,输入14天历史窗口,预测未来7天内火灾发生的概率,从而开展区域尺度火灾风险动态评估与预警算法验证。
解决学术问题
该数据集解决了泥炭地火灾预测中多源异构数据对齐难、标签稀疏和时空依赖性建模难等核心学术问题。通过统一的网格系统和时间对齐,消除了遥感数据在空间分辨率与重访周期上的差异;利用VIIRS热点持久性过滤策略降低了闷烧型误报,并采用前向填充与有效性掩码机制处理SAR和动态世界数据的缺失,保障了模型的因果性与鲁棒性。该数据集为探讨极端干旱与人类活动驱动的火灾机理、量化气象-水文因子对火险的贡献提供了高质量基准,推动了遥感与深度学习在该领域的交叉研究。
实际应用
在实际应用中,该数据集支撑了印度尼西亚廖内省泥炭地火灾的日常监测与应急响应。其产品可直接部署于BPBD等运营平台,实时输入气象、雷达与火点数据,输出未来一周的高分辨率火灾风险图,辅助消防资源调度与预防性巡逻。此外,数据集的网格化设计便于与土地利用规划及碳排放核算系统集成,为区域性的环境治理与灾害风险管理提供了数据驱动的决策工具。
数据集最近研究
最新研究方向
该数据集聚焦于印度尼西亚廖内省泥炭地火灾的早期预警,整合了多源遥感与气象数据,构建了高时空分辨率的预测框架。最新研究方向包括利用深度学习模型(如时空卷积网络)处理多模态特征,探索动态世界土地覆盖分类与SAR后向散射在火点检测中的协同作用,并通过有效性掩码机制应对雷达间隙与云层干扰。数据集的精心设计(如7天预测窗口、5公里均匀网格)使其成为评估火灾预警系统实际部署效果的基准,对东南亚热带泥炭地保护及全球碳循环研究具有重要支撑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务