遇见数据集

wildfire-prediction

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

该数据集为野火检测与分析而构建,包含125个火灾场景和375个对照场景,每个场景由Sentinel-1雷达影像(前后各一)、Sentinel-2光学影像(前后各一)、ERA5再分析数据序列以及一个包含所有数据元数据的JSON文件组成。所有火灾的过火面积均超过1万英亩,火灾与对照场景按1:3比例配对,且对照场景与对应火灾位于同一EPA三级生态区。数据覆盖美国七个州(阿拉斯加、加利福尼亚、爱达荷、蒙大拿、内华达、俄勒冈、华盛顿),时间范围从2016年至今。数据集总大小约2.1TB,以场景为单位组织,目录结构为fires/{state}/{scene_id}/和controls/{state}/{scene_id}/,每个场景文件夹包含六个文件:四个SAFE格式的哨兵产品、一个ERA5的GRIB文件和一个metadata.json。元数据包含事件ID、MTBS后火灾ID、火灾名称、州、点火日期、总英亩数、至后火灾评估的天数、轨道方向、后火灾来源、同传感器前后影像时间间隔(天)、哨兵1与哨兵2前后影像时间差(小时)、空间边界、各数据源对火灾边界框的空间覆盖率以及文件列表。数据可用于多模态野火风险评估、燃烧严重度分析、遥感变化检测等任务。注意:该数据集未提供预定义的训练/验证/测试划分,用户需自行划分以避免空间泄漏。

This dataset is constructed for wildfire detection and analysis, containing 125 fire scenes and 375 control scenes. Each scene consists of Sentinel-1 radar imagery (one pre-fire and one post-fire), Sentinel-2 optical imagery (one pre-fire and one post-fire), an ERA5 reanalysis data sequence, and a JSON file containing metadata for all data. All fires have burned areas exceeding 10,000 acres, and fire scenes are paired with control scenes in a 1:3 ratio, with control scenes located in the same EPA Level III ecoregion as the corresponding fire. The data covers seven U.S. states (Alaska, California, Idaho, Montana, Nevada, Oregon, Washington), with a time range from 2016 to present. The total dataset size is approximately 2.1 TB, organized by scene with directory structures of fires/{state}/{scene_id}/ and controls/{state}/{scene_id}/. Each scene folder contains six files: four Sentinel products in SAFE format, one ERA5 GRIB file, and one metadata.json. Metadata includes event ID, MTBS post-fire ID, fire name, state, ignition date, total acres, days to post-fire assessment, orbit direction, post-fire source, time interval between pre- and post-fire images from the same sensor (days), time difference between Sentinel-1 and Sentinel-2 pre- and post-fire images (hours), spatial boundary, spatial coverage of each data source over the fire bounding box, and file list. The data can be used for multimodal wildfire risk assessment, burn severity analysis, remote sensing change detection, and other tasks. Note: This dataset does not provide predefined training/validation/test splits; users need to create their own splits to avoid spatial leakage.

创建时间:
2026-09-05
原始信息汇总

数据集概述

基本信息

  • 数据集名称:Curated Wildfire Detection & Analysis Dataset(精选野火检测与分析数据集)
  • 许可协议:CC-BY-4.0
  • 数据集总量:约 2.1 TB

数据规模与组织

  • 包含 125 个野火场景375 个对照场景,共计 500 个场景。
  • 每个野火场景配对 3 个对照场景,对照场景与野火场景位于相同的 EPA Level III 生态区。
  • 数据覆盖美国 7 个州:阿拉斯加、加利福尼亚、爱达荷、蒙大拿、内华达、俄勒冈、华盛顿。

场景数据结构

每个场景文件夹中包含 6 个文件:

  1. Sentinel-1 火灾前影像(SAFE 格式)
  2. Sentinel-1 火灾后影像(SAFE 格式)
  3. Sentinel-2 火灾前影像(SAFE 格式)
  4. Sentinel-2 火灾后影像(SAFE 格式)
  5. ERA5 再分析数据文件(GRIB 格式)
  6. metadata.json 元数据文件,包含场景的详细描述信息

数据来源

数据类型 来源 分辨率/说明
Sentinel-1 影像 Copernicus 开放获取中心 合成孔径雷达(SAR),20米分辨率
Sentinel-2 影像 Copernicus 开放获取中心 高分辨率光学,10米分辨率
ERA5 气象数据 Copernicus 气候数据存储 ECMWF 再分析数据
MTBS 燃烧严重度数据 USGS/USDA 联合项目 提供火灾引燃日期、面积及燃烧严重度作为真值

场景筛选约束

  • 所有火灾总面积 > 10,000 英亩。
  • 火灾与控制场景的引燃日期范围为 2016 年至今。
  • Sentinel-1 火灾前后影像的轨道方向一致(同为升轨或同为降轨)。
  • 同一传感器火灾前后影像的时间间隔不超过 180 天。
  • Sentinel-1 与 Sentinel-2 影像获取时间差不超过 18 小时。
  • 每个数据源的空间覆盖率至少占火灾边界框的 70%。
  • ERA5 数据涵盖引燃日期前至少 30 天的再分析数据。

ERA5 气象变量

  • 2米温度(t2m)
  • 2米露点温度(d2m)
  • 东向风速(u10)
  • 北向风速(v10)
  • 总降水量(tp)

元数据字段(metadata.json)

包含事件 ID(event_id、mtbs_post_id)、火灾名称、州、引燃日期、总面积、火灾后参考天数、轨道方向、火灾后来源、传感器时间间隔(S1_days、S2_days)、传感器时间差(小时)、空间边界、空间覆盖率及文件内容清单。

对照场景选择与验证

  • 对照组从与火灾相同 EPA Level III 生态区中选取,确保植被、气候和地形条件可比。
  • 通过 MTBS 记录交叉验证,确保对照场景在采集窗口期内未发生未被记录的火灾。
  • 通过检查对照场景 Sentinel-2 前后影像的 NBR 差异,捕捉可能未被 MTBS 记录的小型火灾。

数据集局限性

  • 仅覆盖美国西部/西北部 7 个州,不适用于其他火灾多发地区(如美国东南部、地中海、澳大利亚等)。
  • 仅包含 >10,000 英亩的大型火灾,对小型火灾预测帮助有限。
  • 火灾与对照比例为 1:3,属于人为设计的类别不平衡。
  • 数据集未提供预定义的训练/验证/测试划分,用户需自行分区数据,建议按火灾事件和生态区划分以避免空间泄漏。

引用格式

bibtex @dataset{sankoh2026wildfire, author = {Sankoh, Aroon}, title = {Curated Wildfire Detection & Analysis Dataset}, year = {2026}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/aroon-sankoh/wildfire-prediction} }

搜集汇总
数据集介绍
wildfire-prediction 数据集图片
构建方式
该数据集由125个火灾场景与375个对照场景构成,每个场景均整合了Sentinel-1与Sentinel-2的灾前及灾后影像、ERA5再分析气象数据序列及元数据文件。火灾事件依据MTBS计划的燃烧严重度评估进行标注,并限定于2016年至今、过火面积超过1万英亩的实例。每个火灾事件在相同的EPA III级生态区内匹配三个对照场景,以确保植被、气候与地形的可比性。数据构建严格遵循时间与空间约束,如影像轨道方向一致性、时间跨度限制及空间覆盖率要求,保障了数据的科学严谨性。
特点
数据集覆盖美国西部七个州,总量约2.1 TB,呈现多源异构特性。其独到之处在于将主动微波遥感(Sentinel-1 SAR)、高分辨率光学影像(Sentinel-2)与高时空分辨率的气象再分析数据(ERA5)进行像素级融合,并辅以详尽的元数据(如过火日期、面积、轨道参数及时间间隔),为野火预测模型提供了多维度的特征输入。此外,严格的对照场景筛选流程,包括对未记录火灾的交叉验证及NBR差异检测,显著提升了数据的可信度,为时空建模与遥感分析提供了坚实的基准。
使用方法
数据以火灾/对照事件为单元组织,目录结构清晰,便于按需下载子集。使用时应依据元数据中经纬度及时间信息进行场景对齐,将Sentinel影像的SAFE格式产品、ERA5的GRIB文件以及元数据JSON解析为模型可读的张量。鉴于类不平衡(1:3)及无预定义划分,建议用户按火灾事件与生态区自行划分训练/验证/测试集,以避免空间泄漏。该数据集适用于训练卷积-Transformer等混合架构,以预测1、3、6个月内的野火风险,亦可用于烧毁面积评估、可燃物湿度反演等下游任务。
背景与挑战
背景概述
该数据集由Aroon Sankoh于2026年创建,旨在支持 wildfire 预测模型的训练与评估。研究团队整合多源遥感与气象数据,构建了一个覆盖美国西部七州的火灾场景集合,包含125个火灾场景与375个对照场景,每个场景均配备 Sentinel-1 和 Sentinel-2 的灾前/灾后影像、ERA5 再分析气象序列及详尽的元数据。该数据集的核心研究问题在于探索多模态时空数据在火灾风险评估中的应用潜力,特别是通过混合卷积-Transformer架构实现1、3、6个月尺度的火灾风险预测。数据集的发布为机器学习与气候科学界提供了宝贵的基准资源,促进了跨学科研究的发展,并为火灾预警系统的优化提供了数据支撑。
当前挑战
该数据集面临多重挑战。领域层面,火灾预测本身具有高度复杂性,需综合气象、植被、地形等因素,而现有数据仅覆盖特定生态区域和大型火灾(>10k英亩),限制了模型的泛化能力,难以适用于其他火灾多发区域或中小型火灾场景。构建过程中,数据集整合了多源异构数据,需严格对齐时空分辨率与轨道方向,控制影像间隔在180天内、传感器时间差在18小时内,并确保空间覆盖率超过70%,同时通过对照选择与验证排除未记录火灾的干扰,这些精细的条件约束增加了数据处理的难度。此外,数据总量高达2.1TB,存储与访问开销巨大,且未预设数据划分,需用户自行分区以避免空间泄漏,进一步提升了使用门槛。
常用场景
经典使用场景
在遥感与机器学习交叉领域,此数据集为多模态 wildfire 预测研究提供了宝贵资源。其核心包含 125 个火灾场景与 375 个匹配的控制场景,每个场景融合了 Sentinel-1 的合成孔径雷达图像、Sentinel-2 的高分辨率光学影像、ERA5 的气象再分析时序数据及详尽的元数据。研究者可借助此数据集开展基于深度学习的 wildfire 发生概率预测、火灾前兆模式识别以及灾后严重程度评估等经典任务。其设计强调多源数据的时间同步与空间匹配,支持构建融合模型以捕捉地表变化、植被指数与气象条件的动态交互,是评估和比较不同 wildfire 预测算法性能的基准平台。
衍生相关工作
该数据集衍生了一系列开创性工作,涵盖 wildfire 检测模型架构的设计、多模态数据融合算法的改进以及预测不确定性的量化等方面。例如,其创建者基于该数据集提出了一种混合卷积-Transformer 模型,该模型通过集成 Sentinel-1、Sentinel-2 和 ERA5 数据,实现了对短期和中期火灾风险的准确预测,相关模型代码已在 GitHub 开源,推动了可复现研究的发展。此外,数据集的公开促使其他研究者探索半监督学习在标签不完美场景中的应用,以及利用此类多时相、多传感器数据迁移学习以应对其他地区火灾预测的挑战,进而形成了一个活跃的研究社区。
数据集最近研究
最新研究方向
在气候变化加剧野火频发与烈度上升的严峻背景下,该数据集融合多源遥感对地观测与再分析气象数据,构建了面向大尺度野火预测的精细样本库。其前沿研究方向聚焦于利用合成孔径雷达与高分辨率光学影像的时空协同,结合ERA5再分析气象场,驱动混合卷积-Transformer架构进行风险概率的时序推演,旨在突破短期至中期(1-6个月)野火发生潜势预测的精度瓶颈。数据集的生态区匹配对照设计与严格的质量控制,为发展具备空间泛化能力的深度学习模型提供了关键训练语料,对推动气候变化适应性火险预警系统的智能化转型具有重要的基准价值与示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务