遇见数据集

GEOID-Flood

收藏
arXiv2026-08-03 更新2026-08-05 收录
官方服务:

资源简介:

GEOID-Flood是由LINKS基金会与都灵理工大学联合构建的大规模多模态洪水分割基准数据集,基于哥白尼应急管理服务十年间的219次洪水事件,覆盖65个国家。该数据集包含超过14,000个10米分辨率的瓦片,每个瓦片提供前后事件Sentinel-1 SAR(GRD/RTC格式)、前事件Sentinel-2光学合成影像、数字高程模型及手动校验的标签,明确区分背景、永久水体与洪水水体。创建过程历经空间对齐、多源数据检索、云掩膜生成、标签融合及质量筛选,确保了数据的一致性与可靠性。该数据集旨在评估地理空间基础模型在洪水分割任务中的泛化能力,尤其聚焦于多时相变化分析与多模态融合,弥补了现有数据集在规模、模态完整性和事件级划分上的不足。

GEOID-Flood is a large-scale multimodal flood segmentation benchmark dataset jointly developed by the LINKS Foundation and the Polytechnic University of Turin. Leveraging 219 flood events spanning a decade from the Copernicus Emergency Management Service, the dataset covers 65 countries globally. It contains over 14,000 10-meter resolution image tiles, with each tile providing pre- and post-event Sentinel-1 SAR imagery in GRD/RTC formats, pre-event Sentinel-2 optical composite imagery, a Digital Elevation Model (DEM), and manually validated labels that explicitly differentiate between background, permanent water bodies, and flood water bodies. The dataset construction pipeline encompasses spatial alignment, multi-source data retrieval, cloud mask generation, label fusion, and quality screening, which ensures the consistency and reliability of the data. This benchmark is designed to assess the generalization capability of geospatial foundation models for flood segmentation tasks, with a specific focus on multi-temporal change analysis and multimodal fusion, filling the gaps of existing datasets in scale, modal completeness, and event-level partitioning.

创建时间:
2026-08-03
原始信息汇总

数据集概述

GEOID-Flood 是一个大规模、多模态的洪水分割基准数据集,基于 Copernicus 应急管理服务(CEMS)快速测绘激活数据构建。数据集覆盖 2016 年至 2026 年间全球 65 个国家的 219 次洪水事件,共分解为 14,282 块 1024×1024 像素的瓦片。每块瓦片包含 Sentinel-1 GRD 和 RTC(洪水前后,VV/VH 极化)、洪水前 Sentinel-2 L2A 合成影像以及 Copernicus GLO-30 DEM,所有数据均以 10 米分辨率提供,并附带人工验证的三类标签(背景、永久水体、洪水水体)。数据集发布在 Hugging Face Hub 上,仓库包含训练/评估代码及论文中使用的 TerraTorch 实验配置。

核心特性

  • 规模:219 次洪水事件,覆盖 65 个国家,时间跨度 2016–2026。
  • 数据组成:每个瓦片包含 5 种模态(S1 GRD、S1 RTC、S2 L2A、DEM、标签),所有模态均为 10 米分辨率。
  • 数据划分:训练/验证/测试按区域分配,确保同一洪水事件不会跨划分。
  • 数据量:完整数据集约 586 GB;仅 S1 GRD 和标签约 205 GB;仅 S1 RTC 的测试集约 20 GB。
  • 标签体系:三类标签(背景、永久水体、洪水水体),标签由人工验证。

数据访问与使用

  • 数据获取:使用仓库中的 scripts/get_data.py 脚本下载数据,支持按模态、划分或抽样下载。
  • 元数据:根目录包含两个元数据文件:
    • data_tiles_s256_st128.csv:数据加载器读取的唯一元数据,记录每个 256×256 像素块的模态信息。
    • tile_catalog.parquet:1024×1024 瓦片的完整清单,包括几何信息、UTM CRS、有效性、无效像素比例、国家及划分。
  • 自定义瓦片:可通过 scripts/make_tiles.py 重新生成不同尺寸和步长的瓦片清单。

训练与评估

  • 训练:使用 TerraTorch 框架运行配置目录下的 YAML 配置文件,支持多种骨干网络和训练场景。
  • 评估:支持单图像、成对融合及三类融合模型的评估,指标包括 IoU 和 F1 分数(二分类和多分类)。
  • 指标选择:配置中可监控验证集上的 val/IoU_1(二值水体 IoU)或 val/IoU_flood(三类融合 IoU)等指标。

许可与引用

  • 代码许可:MIT 许可证。
  • 数据许可:CC BY 4.0 许可证,包含修改的 Copernicus 数据,需按 Hugging Face 数据集卡要求注明出处。
  • 引用:建议引用 ECCV 2026 TerraBytes 研讨会论文(作者:Gaetano Chiriaco 等)。
搜集汇总
数据集介绍
GEOID-Flood 数据集图片
构建方式
GEOID-Flood数据集源自哥白尼应急管理服务(CEMS)的快速测绘激活,覆盖2016年至2026年间全球65个国家的219次洪水事件。构建流程分为五个自动化阶段:首先依据CEMS元数据将每个事件的影响区域(AoI)划分为10,240米见方的规则瓦片;随后通过Sentinel Hub API检索对应的Sentinel-1 GRD与RTC影像(含VV/VH极化,事件前后各一景),并获取事件前Sentinel-2合成影像(采用中值合成以减少云层影响)及GLO-30 DEM;继而生成有效像素掩膜和云掩膜,以排除无效区域;标签来源于CEMS人工校验的洪水多边形,并利用基于AlphaEarth基础嵌入训练的水体提取模型生成独立的永久水体层,最终将标签组合为背景、永久水体、洪水和无效四类;最后通过质量过滤,剔除模态缺失或云覆盖过多的瓦片。
使用方法
数据集专为洪水分割任务设计,支持多种训练与评估协议。用户可分别进行单图像二分类(将洪水与永久水体合并为水体类别)或利用前后时相影像进行多时相三分类(区分背景、永久水体、洪水)。数据集提供了包括早期融合(通道堆叠)和中期融合(孪生分支差分)在内的多种光学与SAR融合策略,便于比较不同模态的组合效果。官方基准建议以IoU_flood作为主要指标,并使用U-Net解码器,同时提供了针对冻结或微调的基础模型(如TerraMind、DOFA)的标准化训练流程,方便研究者在统一协议下进行公平比较。
背景与挑战
背景概述
GEOID-Flood数据集由意大利LINKS基金会与都灵理工大学的研究团队于2026年构建,旨在弥补现有洪水测绘基准在多模态、大规模及事件级划分上的不足。该数据集基于哥白尼应急管理服务(CEMS)的激活数据,覆盖2016年至2026年间全球65个国家的219次洪水事件,提供了超过14,000幅包含双时相Sentinel-1(GRD与RTC格式)、灾前Sentinel-2合成影像及DEM的多模态影像块,并配备了经人工验证的标签,将背景、永久水体与洪泛区分离。其核心研究问题在于评估地理空间基础模型在洪水分割任务中的泛化能力及多模态融合的效能,通过事件级划分和独立留出集设计,确保评估的公平性与时间外推性。GEOID-Flood的发布为遥感基础模型在灾害响应领域的验证提供了标准化基准,推动了洪水测绘从单一传感器向多模态、大规模、可复现评估的转变。
当前挑战
GEOID-Flood的构建面临多重挑战:领域层面,洪水分割需从SAR影像中区分短暂洪泛与永久水体,而单一SAR回波难以分离二者,需借助时间变化和多模态融合;现有数据集普遍缺失双时相SAR与光学影像的联合,且标签质量参差,永久水体层来源不统一,限制了模型的泛化与评估。构建过程中,需处理CEMS大量异构的AoI与传感器数据,实现严格的共配准和一致性质量控制;灾后常伴云蔽,难以获取清晰光学影像,需采用合成影像策略;永久水体层的生成需避免现有全球产品的低分辨率与缺失问题,最终基于AlphaEarth嵌入训练轻量模型,实现10米分辨率的精细刻画。此外,事件级划分与时间不相交留出集的设计,要求严格避免空间泄漏,确保模型评估的可靠性。
常用场景
经典使用场景
GEOID-Flood数据集的核心应用场景聚焦于洪涝灾害的精细化分割任务,其多模态、多时相的数据设计为地理空间基础模型的评估提供了基准平台。该数据集涵盖219次洪灾事件、跨越65个国家及十年时间跨度,整合了灾前与灾后的Sentinel-1 SAR影像(GRD与RTC格式)、灾前Sentinel-2光学合成影像以及DEM数据,并附带人工校验的标签,可区分背景、永久水体与洪水水体。此数据集的经典使用模式包括单影像分割、双时相变化检测以及多模态融合分割,研究者可基于此设计统一的训练与评估协议,从而在受控条件下衡量模型在洪水制图任务中的表现。
解决学术问题
该数据集解决了现有洪水制图研究中长期存在的关键学术难题:缺乏兼具大尺度、多模态、双时相及独立永久水体层的数据集,导致基础模型评估不全面且跨数据集泛化性能难以可靠度量。GEOID-Flood通过提供统一处理级别的SAR数据、云层影响最小的光学合成影像以及高分辨率(10米)的永久水体层,显著降低了数据异构性和标注噪声带来的干扰。它支持严谨的事件级数据划分,避免了空间泄漏,使研究者能够客观比较地理空间基础模型与传统编码器的性能,并系统探究时相建模、传感器融合及跨区域泛化等前沿课题,为洪水分割算法的理论发展提供了坚实的实证基础。
实际应用
在实际应用中,GEOID-Flood为洪灾应急响应与风险管理提供了关键的数据支撑。其快速制图能力可辅助灾害监测机构在洪水发生后数小时内生成高精度的淹没范围图,尤其适用于云层覆盖频繁或夜间等光学影像受限的场景。数据集的多模态特性支持融合SAR和光学信息,提升对短暂洪水和永久水体的区分精度,有助于优化灾后损失评估、救援路径规划及保险理赔流程。此外,其全球分布的事件覆盖范围使得训练出的模型具备良好的跨区域迁移能力,可推广至数据稀缺地区,为全球洪水预警系统提供可复用的技术方案,显著提升防灾减灾的效率和准确性。
数据集最近研究
最新研究方向
当前,基于深度学习的洪涝灾害分割领域正迅猛发展,但现有数据集普遍面临多模态融合不足与时空覆盖有限的瓶颈。GEOID-Flood的问世恰逢其时,它整合了双时相Sentinel-1 SAR、无云Sentinel-2影像及DEM,构建了覆盖65国219起事件的大规模基准,并细致区分永久水体与洪水水体。该数据集不仅推动了光学-SAR融合策略在突发事件中的验证,还率先引入事件级划分与跨数据集泛化评估,为地理空间基础模型在灾害应急中的落地应用提供了关键测试平台,其意义在于大幅提升极端气候下遥感分割的鲁棒性与实际响应效率。
相关研究论文
  • 1
    GEOID-Flood: A Large-Scale Multi-Modal Benchmark Dataset for Flood SegmentationLINKS基金会; 都灵理工大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务