GEOID-Flood
收藏资源简介:
GEOID-Flood是由LINKS基金会与都灵理工大学联合构建的大规模多模态洪水分割基准数据集,基于哥白尼应急管理服务十年间的219次洪水事件,覆盖65个国家。该数据集包含超过14,000个10米分辨率的瓦片,每个瓦片提供前后事件Sentinel-1 SAR(GRD/RTC格式)、前事件Sentinel-2光学合成影像、数字高程模型及手动校验的标签,明确区分背景、永久水体与洪水水体。创建过程历经空间对齐、多源数据检索、云掩膜生成、标签融合及质量筛选,确保了数据的一致性与可靠性。该数据集旨在评估地理空间基础模型在洪水分割任务中的泛化能力,尤其聚焦于多时相变化分析与多模态融合,弥补了现有数据集在规模、模态完整性和事件级划分上的不足。
GEOID-Flood is a large-scale multimodal flood segmentation benchmark dataset jointly developed by the LINKS Foundation and the Polytechnic University of Turin. Leveraging 219 flood events spanning a decade from the Copernicus Emergency Management Service, the dataset covers 65 countries globally. It contains over 14,000 10-meter resolution image tiles, with each tile providing pre- and post-event Sentinel-1 SAR imagery in GRD/RTC formats, pre-event Sentinel-2 optical composite imagery, a Digital Elevation Model (DEM), and manually validated labels that explicitly differentiate between background, permanent water bodies, and flood water bodies. The dataset construction pipeline encompasses spatial alignment, multi-source data retrieval, cloud mask generation, label fusion, and quality screening, which ensures the consistency and reliability of the data. This benchmark is designed to assess the generalization capability of geospatial foundation models for flood segmentation tasks, with a specific focus on multi-temporal change analysis and multimodal fusion, filling the gaps of existing datasets in scale, modal completeness, and event-level partitioning.
数据集概述
GEOID-Flood 是一个大规模、多模态的洪水分割基准数据集,基于 Copernicus 应急管理服务(CEMS)快速测绘激活数据构建。数据集覆盖 2016 年至 2026 年间全球 65 个国家的 219 次洪水事件,共分解为 14,282 块 1024×1024 像素的瓦片。每块瓦片包含 Sentinel-1 GRD 和 RTC(洪水前后,VV/VH 极化)、洪水前 Sentinel-2 L2A 合成影像以及 Copernicus GLO-30 DEM,所有数据均以 10 米分辨率提供,并附带人工验证的三类标签(背景、永久水体、洪水水体)。数据集发布在 Hugging Face Hub 上,仓库包含训练/评估代码及论文中使用的 TerraTorch 实验配置。
核心特性
- 规模:219 次洪水事件,覆盖 65 个国家,时间跨度 2016–2026。
- 数据组成:每个瓦片包含 5 种模态(S1 GRD、S1 RTC、S2 L2A、DEM、标签),所有模态均为 10 米分辨率。
- 数据划分:训练/验证/测试按区域分配,确保同一洪水事件不会跨划分。
- 数据量:完整数据集约 586 GB;仅 S1 GRD 和标签约 205 GB;仅 S1 RTC 的测试集约 20 GB。
- 标签体系:三类标签(背景、永久水体、洪水水体),标签由人工验证。
数据访问与使用
- 数据获取:使用仓库中的
scripts/get_data.py脚本下载数据,支持按模态、划分或抽样下载。 - 元数据:根目录包含两个元数据文件:
data_tiles_s256_st128.csv:数据加载器读取的唯一元数据,记录每个 256×256 像素块的模态信息。tile_catalog.parquet:1024×1024 瓦片的完整清单,包括几何信息、UTM CRS、有效性、无效像素比例、国家及划分。
- 自定义瓦片:可通过
scripts/make_tiles.py重新生成不同尺寸和步长的瓦片清单。
训练与评估
- 训练:使用 TerraTorch 框架运行配置目录下的 YAML 配置文件,支持多种骨干网络和训练场景。
- 评估:支持单图像、成对融合及三类融合模型的评估,指标包括 IoU 和 F1 分数(二分类和多分类)。
- 指标选择:配置中可监控验证集上的
val/IoU_1(二值水体 IoU)或val/IoU_flood(三类融合 IoU)等指标。
许可与引用
- 代码许可:MIT 许可证。
- 数据许可:CC BY 4.0 许可证,包含修改的 Copernicus 数据,需按 Hugging Face 数据集卡要求注明出处。
- 引用:建议引用 ECCV 2026 TerraBytes 研讨会论文(作者:Gaetano Chiriaco 等)。

- 1GEOID-Flood: A Large-Scale Multi-Modal Benchmark Dataset for Flood SegmentationLINKS基金会; 都灵理工大学 · 2026年



