遇见数据集

geoid-flood

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

GEOID-Flood 是一个大规模、多模态的洪水分割基准数据集。它基于 219 次 Copernicus 紧急管理服务(EMS)快速制图洪水激活事件,覆盖 65 个国家,时间跨度为 2016 年至 2026 年。数据集包含 165,329 个栅格,总大小约 584 GB,分布在 319 个分片中。共有 14,282 个瓦片,其中 8,938 个用于训练,1,241 个用于验证,2,674 个用于测试,另有 1,429 个保留瓦片用于分布外评估。每个瓦片为 1024×1024 像素,地面分辨率 10 米,提供配准的多模态数据:事件前后的 Sentinel-1 GRD 和 RTC 后向散射(VV/VH 波段,线性 sigma0 格式,加载时转为 dB)、事件前的 Sentinel-2 L2A 地表反射率合成(12 波段)、Copernicus GLO-30 数字高程模型(DEM,从 30 米重采样至 10 米),以及手动验证的三类标签(0=背景,1=永久水,2=洪水,255 为忽略像素)。此外,还包括云掩膜、洪水掩膜、永久水掩膜和有效性掩膜等辅助层。数据以 Cloud-Optimized GeoTIFF 格式存储于未压缩的 tar 分片中,支持按模态和拆分选择性下载。该数据集专为洪水分割任务设计,也可用于多模态遥感图像分析、变化检测等研究。

GEOID-Flood is a large-scale, multi-modal benchmark dataset for flood segmentation. It is based on 219 Copernicus Emergency Management Service (EMS) rapid mapping flood activation events, covering 65 countries with a time span from 2016 to 2026. The dataset contains 165,329 rasters, approximately 584 GB in total size, distributed across 319 shards. There are 14,282 tiles in total, among which 8,938 are used for training, 1,241 for validation, 2,674 for testing, and an additional 1,429 reserved tiles for out-of-distribution evaluation. Each tile is 1024×1024 pixels with a ground resolution of 10 meters, providing co-registered multi-modal data: pre- and post-event Sentinel-1 GRD and RTC backscatter (VV/VH bands, linear sigma0 format, converted to dB upon loading), pre-event Sentinel-2 L2A surface reflectance composite (12 bands), Copernicus GLO-30 Digital Elevation Model (DEM, resampled from 30m to 10m), and manually validated three-class labels (0=background, 1=permanent water, 2=flood, 255=ignore pixel). Additionally, auxiliary layers such as cloud masks, flood masks, permanent water masks, and validity masks are included. The data is stored as Cloud-Optimized GeoTIFFs in uncompressed tar shards, supporting selective download by modality and split. This dataset is specifically designed for flood segmentation tasks, and can also be used for multi-modal remote sensing image analysis, change detection, and other research.

创建时间:
2026-07-31
原始信息汇总

GEOID-Flood 数据集概述

GEOID-Flood 是一个大规模多模态洪水分割基准数据集,基于 2016-2026 年间 65 个国家的 **219 次 Copernicus EMS 快速测绘洪水事件构建而成。该数据集旨在为基于地球观测数据的洪水分割研究提供标准化的训练与评估资源。

数据集规模

  • 总计 165,329 个栅格文件,体积约 584 GB,分布在 319 个分片中。
  • 共有 14,282 个瓦片(tile),其中:训练集 8,938 个、验证集 1,241 个、测试集 2,674 个。
  • 另有 1,429 个预留瓦片(来自 EMSR857-871 事件),用于分布外(out-of-distribution)评估。

数据格式与空间分辨率

每个瓦片尺寸为 1024×1024 像素,空间分辨率为 10 米。每个瓦片均包含以下九层数据(全部在统一的事件 UTM 网格上配准):

层名称 波段数 时间属性 体积 说明
s1grd 2 × float32 事件前 + 事件后 204.6 GB Sentinel-1 GRD 后向散射(线性 sigma0),波段顺序 VV、VH,读取时转换为 dB
s1rtc 2 × float32 事件前 + 事件后 192.2 GB 同一两次采集的辐射地形校正版本,无效像素以 NaN 标记
s2l2a 12 × uint16 事件前 177.6 GB 云过滤的 Sentinel-2 L2A 地表反射率合成影像,12 个波段
dem 1 × float32 静态 9.5 GB Copernicus GLO-30 高程数据(米),从 30 米重采样至 10 米网格
label 1 × uint8 静态 0.1 GB 训练目标,人工验证的三类标签:0=背景、1=永久水体、2=洪水水体,255 表示未映射区域(忽略索引)
cloudmask 1 × uint8 事件前 0.1 GB S2 合成影像的云和阴影掩膜(来自 OmniCloudMask)
floodmask 1 × uint8 静态 0.1 GB 二值 CEMS 快速测绘洪水范围,是 label 的两个来源产品之一
permwater 1 × uint8 静态 0.1 GB 二值永久水体范围,label 的另一个来源产品
validity 1 × uint8 静态 0.1 GB 逐像素有效性二值掩膜,与 label == 255 基本冗余

数据组织与下载

数据以 未压缩的 tar 分片 形式提供,其中包含云优化 GeoTIFF。目录结构为:

{tree}/shards/{split}/{layer}/{split}-{layer}-NNNNN-of-NNNNN.tar

用户可通过 get_data.py 脚本按需要下载特定模态和特定划分的数据。常见选择包括:

  • 全部数据:约 584 GB
  • 仅 S1-GRD 基准(含标签):约 205 GB
  • 仅训练+验证划分的 S1-GRD:约 140 GB
  • 早期/中期融合(S1+S2+DEM):约 392 GB
  • 仅预留 S1-RTC 评估:约 20 GB

元数据文件

文件 作用
data_tiles_s256_st128.csv 数据加载器唯一读取的元数据。枚举 256×256 的芯片(chips),训练集步长 128,验证/测试集步长 256,并记录每个芯片的有效比例、正样本比例、云覆盖率和划分信息
tile_catalog.parquet 1024×1024 瓦片清单:几何信息、UTM 坐标系、灾害范围时间、有效性、无效像素比例和划分。训练时不读取,用于按地理或日期筛选事件。论文中的瓦片筛选条件为 is_valid AND invalid_pixel_frac <= 0.95,满足条件的瓦片数为 12,853 个(训练 8,938 / 验证 1,241 / 测试 2,674),另有 1,429 个在 geoid-flood-heldout

样本数据

sample/ 目录包含来自 EMSR712 事件的完整两个 AoI(EMSR712-10 为训练划分,EMSR712-3 为测试划分),涵盖全部九层数据、47 个瓦片和 8,076 个芯片行,无需完整下载即可端到端测试数据加载器。

划分策略

划分按兴趣区(AoI)进行,相互接触的 AoI 共享同一划分,确保同一洪水事件不会跨训练、验证和测试集。

许可与引用

  • 数据集编译、划分和标签:CC BY 4.0
  • 代码:MIT(位于代码仓库)
  • dem 层单独许可:Copernicus WorldDEM-30 许可
  • 数据包含修改后的 Copernicus 数据,分发时需保留相应的版权声明
  • 引用格式见代码仓库中的 CITATION.cff 文件
搜集汇总
数据集介绍
geoid-flood 数据集图片
构建方式
GEOID-Flood数据集基于2016年至2026年间欧洲Copernicus应急管理服务快速测绘计划中的219次洪水激活事件构建,覆盖65个国家。数据集共包含165,329个栅格数据,总存储量达584 GB,分成319个分片。每个1024x1024像素的瓦片以10米分辨率呈现,提供了包括Sentinel-1 GRD与RTC(事件前后各一次,含VV和VH极化)、事件前Sentinel-2 L2A合成影像、Copernicus GLO-30 DEM以及经人工验证的三类标签(背景、永久水域、洪水水域)在内的多种模态数据。所有模态严格配准至统一的事件UTM网格,确保空间一致性。数据划分依据洪灾事件区域(AoI)进行,确保同一事件不会跨训练、验证和测试集,并额外保留1,429个来自独立激活的瓦片用于分布外评估。
特点
该数据集的核心特点在于其大规模、多模态与精细标注的紧密结合。每一瓦片均包含9个图层,覆盖从雷达回波强度到地形高程的全方位地表信息,且所有影像均经过严格的辐射定标与几何配准,保证了多源数据的可比性。标签采用三分类体系,并利用255作为无效区域忽略索引,同时提供云掩膜和有效掩膜,为研究人员提供了灵活的像素级过滤选项。数据以云优化的GeoTIFF格式存储于未压缩的tar分片中,用户可按需下载特定模态与分割子集,极大节省存储与传输开销。此外,数据集附带详细的元数据文件,可精准筛选训练样本,支持多样化的深度学习实验设计。
使用方法
使用该数据集时,用户可通过提供的get_data.py脚本直接从HuggingFace Hub流式下载所需数据分片,并自动重建规范的目录结构。典型操作包括下载全部数据(约584 GB)或精选组合,例如仅获取S1-GRD与标签用于单模态基准测试(约205 GB),或融合S1、S2与DEM进行多模态研究(约392 GB)。数据集内置了用于训练、验证和测试的256x256像素切片索引,支持标准训练流程。此外,用户可参考样例子集(包含完整图层的小规模数据)快速验证代码运行,再扩展至全量数据。训练代码中建议将数据转换为分贝单位的S1后向散射强度,并根据标签中的忽略值对损失函数进行掩膜处理,以提升模型性能。
背景与挑战
背景概述
GEOID-Flood数据集由国际研究团队于2026年发布,旨在应对全球洪灾监测的迫切需求。该数据集基于2016至2026年间欧洲委员会应急管理服务中心的219次快速测绘行动,覆盖65个国家,构建了包含165,329幅栅格的多模态基准。研究团队整合了Sentinel-1合成孔径雷达、Sentinel-2光学影像以及Copernicus DEM高程数据,并提供了人工验证的三类标签,为洪水分割任务提供了大规模、高精度的训练与评估资源。该数据集的发布填补了现有洪水数据集在规模、模态多样性和地理覆盖上的空白,显著推动了遥感与深度学习在灾害响应领域的交叉研究。
当前挑战
数据集构建面临多重挑战。领域方面,洪水分割需区分永久水体与洪水水体,且云层遮蔽、地形起伏及雷达噪声导致影像解释困难。构建过程中,需处理来自多源传感器的配准问题,确保各模态像素级对齐;同时,标签生成依赖专家目视解译,耗时且主观性强。此外,数据来自不同事件与时段,需统一坐标系与分辨率,并解决样本分布不均问题。存储与传输亦具挑战,584GB的数据量需高效压缩与分片策略,以支持灵活下载与训练。这些挑战在数据集的划分策略(如按事件分割)和验证流程中得到了针对性应对。
常用场景
经典使用场景
GEOID-Flood数据集作为大规模多模态洪水分割基准,其经典使用场景聚焦于利用Sentinel-1合成孔径雷达(SAR)影像、Sentinel-2光学影像及数字高程模型(DEM)进行像素级的洪水范围识别。该数据集提供了1024×1024像素、10米分辨率的协同配准影像对,并附有手工验证的三类标签(背景、永久水体、洪水水体),使得研究者能够针对洪水事件的时序变化开展语义分割模型的训练与评估。特别是,数据集设计的训练/验证/测试划分严格按区域独立,避免了事件泄漏,为跨区域、跨事件的洪水泛化能力提供了可靠测试平台。研究者通常采用U-Net、DeepLabV3+等架构,以Sentinel-1的VV/VH极化通道或融合多模态数据作为输入,优化模型在复杂地形和云雨天气下的洪水提取精度,推动遥感图像分割技术在灾害监测中的落地应用。
解决学术问题
GEOID-Flood数据集解决了洪水分割领域长期缺乏大规模、多模态、全球覆盖基准的问题。以往研究多依赖局部区域或单一传感器数据,难以验证模型的泛化性。该数据集汇集219次洪水事件、覆盖65个国家,整合了SAR的穿透云雨能力和光学影像的丰富光谱信息,并引入DEM地形特征,有效缓解了洪水与永久水体混淆、阴影遮挡等核心难题。其提供的手工验证标签和云掩膜、永久水体掩膜等辅助产品,支持了更细致的消融研究和误差分析。通过引入留出事件(EMSR857-871)进行分布外评估,数据集为检验模型在未知灾难场景下的鲁棒性提供了严格标准,推动了地理空间人工智能中关于多源数据融合和灾难响应可迁移性的学术讨论。
衍生相关工作
GEOID-Flood数据集衍生了多个方向的后续研究。首先,基于其多模态和时间序列设计,研究者开发了早期融合(融合S1、S2、DEM)和中融合(结合SAR和光学特征)的网络架构,探索了不同输入组合对分割性能的影响。其次,数据集提供的成对SAR影像(事件前后)催生了变化检测研究,并启发后续工作利用时间一致性提升洪水动态提取精度。此外,该数据集的大规模和分布外划分被用来评估自监督预训练和基础模型(如利用Masked Autoencoder)在遥感分割任务上的迁移能力。围绕其提供的云掩膜和永久水体掩膜,衍生工作研究了如何通过辅助任务提升模型在遮挡区域的鲁棒性。这些工作共同推动了地理空间AI领域从特定场景模型向通用灾害分析模型的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务