遇见数据集

flood-detection-dataset

收藏
Hugging Face2026-08-05 更新2026-08-06 收录
官方服务:

资源简介:

该数据集基于欧洲航天局哥白尼哨兵-1号任务(Sentinel-1A和Sentinel-1B)的合成孔径雷达(SAR)图像,用于洪水检测研究。数据包含两种极化通道(VV和VH),其中VV极化适用于检测开阔水域的洪水(水体表现为低回波暗区),VH极化对植被淹没区的双次散射敏感(表现为亮区)。数据集提供了从L1数据中提取的L0原始数据,共包含6个不同的SAR场景,每个场景由时间序列组成,包含L1 GRD(地距检测)和SLC(单视复数)产品。场景选择基于Kuro Siwo数据库,该数据库提供手动标注的43个全球洪水事件的多时相数据集。标签采用XML格式,包含多边形和额外信息。数据集组织为训练、验证和测试文件夹,每个patch提供:512x512的VV和VH L1 SLC图像块、对应的L1 GRD图像块、对应的L0原始图像块、对应的L0距离压缩重缩放图像块、包含补丁和场景信息及水体多边形和额外信息的XML文件、以及二进制水体掩码。

This dataset is based on Synthetic Aperture Radar (SAR) images from the European Space Agencys Copernicus Sentinel-1 mission (Sentinel-1A and Sentinel-1B) for flood detection research. It contains two polarization channels (VV and VH), where VV polarization is suitable for detecting open water floods (water appears as low-backscatter dark areas), and VH polarization is sensitive to double-bounce scattering over flooded vegetation (appearing as bright areas). The dataset provides L0 raw data extracted from L1 data, comprising 6 different SAR scenes, each composed of time series, including L1 GRD (Ground Range Detected) and SLC (Single Look Complex) products. Scene selection is based on the Kuro Siwo database, which provides a multi-temporal dataset of 43 manually annotated global flood events. Labels are in XML format, containing polygons and additional information. The dataset is organized into training, validation, and test folders, with each patch providing: 512x512 VV and VH L1 SLC image patches, corresponding L1 GRD image patches, corresponding L0 raw image patches, corresponding L0 range-compressed rescaled image patches, XML files containing patch and scene information along with water polygons and additional information, and binary water masks.

创建时间:
2026-07-30
原始信息汇总

数据集概述

该数据集由 ESA(欧洲航天局)哥白尼 Sentinel-1 任务的合成孔径雷达(SAR)图像构建,数据源自 Sentinel-1A 和 Sentinel-1B 两颗极轨卫星,具备全天候、昼夜成像能力。所选 Level 1 SAR 产品包括宽幅干涉模式(IW)下的 Ground Range Detection(GRD)产品和 Single Look Complex(SLC)突发产品。

关键特性

  • 极化通道:利用 VV 和 VH 两种极化通道。VV 极化适用于开放水域洪涝检测,水面平滑导致镜面反射,洪涝区域呈现暗区;VH 极化对双反弹散射敏感,对洪泛植被区域呈现亮区,且对水面粗糙度敏感性较低。
  • Level 0 数据:该数据集的重要特点是提供了从 Level 1 数据(L1)提取的 Level 0(L0,RAW)数据。
  • 数据来源:以 Kuro Siwo 数据库为主要来源,该库包含 43 个全球不同地区的洪涝事件,基于 SAR GRD 产品和经过最少预处理的 SAR SLC 产品构建,支持基于相位和幅度信息的研究。
  • 标注格式:基于 XML(Extensible Markup Language)格式进行标注。

数据集结构

数据集分为训练集、验证集和测试集文件夹。每个 patch 提供以下内容:

  • /patches:512x512 的 VV 和 VH L1 SLC patches
  • /patches:对应的 VV 和 VH L1 GRD patches
  • /raw:对应的 VV 和 VH L0 patches
  • /range_compressed_rescaled:对应的 VV 和 VH L0 距离压缩 patches
  • /labels/xml_labelling:包含 patch 和场景信息、水体多边形及附加信息的 XML 文件
  • /labels/binary_masks:二进制水体掩码

数据下载

可通过 Hugging Face Hub 下载该数据集,使用 snapshot_download 方法,指定 repo_id="opensar-insight/flood-detection-dataset"repo_type="dataset" 即可。

场景统计

数据集共包含 6 个不同的 SAR 场景,每个场景由时间序列组成,每个时间序列包含不同的 Sentinel-1 Level 1 GRD 和 SLC 产品。

搜集汇总
数据集介绍
flood-detection-dataset 数据集图片
构建方式
本数据集基于欧洲空间局哥白尼计划哨兵一号任务的合成孔径雷达(SAR)影像构建,涵盖双极化(VV与VH)数据,并创新性地整合了Level 0原始数据与Level 1产品。数据集以Kuro Siwo数据库为蓝本,选取6幅SAR场景,每场景包含时间序列的Ground Range Detected(GRD)与Single Look Complex(SLC)产品。标注策略采用XML格式,记录水体多边形等详细信息,并生成相应的二值掩膜。数据按训练、验证与测试划分,每个影像块均提供VV与VH极化下不同处理级别的图像,以及对应的标签文件。
特点
该数据集的核心特色在于其多层级数据整合能力,同时提供L1 SLC、GRD以及L0原始和距离压缩数据,为研究者提供了极大的灵活性。双极化通道的设计使得数据集在开放水域与植被淹没区域的检测上均具优势,VV极化通过镜面反射原理清晰呈现开阔水域,而VH极化则对双反弹散射敏感,有效识别植被下的洪水。此外,数据集基于Kuro Siwo数据库,覆盖全球43个洪灾事件,具备丰富的时空多样性,能够支撑基于相位和振幅信息的深入研究。
使用方法
使用方法简便,可通过Hugging Face Hub的snapshot_download函数下载整个数据集至本地。下载后,研究者可依据任务需求选用不同处理级别的图像,如进行像素级分割可调用二值掩膜,而进行相位分析则可利用SLC或L0数据。数据集的目录结构清晰,每个样本包含影像、掩膜及XML标注,便于直接输入深度学习模型进行训练与评估。推荐配置Python环境并安装huggingface_hub库,即可无缝集成至现有工作流中。
背景与挑战
背景概述
该洪水检测数据集由欧洲空间局哥白尼哨兵-1任务提供基础数据,由相关研究机构于近年发布,旨在利用合成孔径雷达(SAR)影像实现洪水的精准、及时检测。其核心研究问题在于如何充分利用SAR数据的极化信息(VV与VH)以及多级产品(L0、L1 GRD、L1 SLC)来提升洪水制图的准确性与鲁棒性。数据集的构建基于Kuro Siwo数据库,选取了全球43个洪水事件中的6个场景,并提供512x512的图像块、原始数据、压缩数据及精细的XML格式标签和二元水掩膜,为洪水检测研究提供了标准化、多层次的基准,对推动SAR遥感在灾害响应中的应用具有重要价值。
当前挑战
该数据集所应对的领域挑战在于洪水检测中SAR影像的复杂解译,如水体在VV极化下的低后向散射与植被区域在VH极化下的双弹散射效应,需有效区分洪水与永久水体、城市区域等。同时,构建过程面临多重困难:从L1数据提取L0原始数据并生成距离压缩图像,涉及复杂的信号处理流程;多时相、多极化的数据配准与辐射校准精度要求高;手工标注(基于XML)需兼顾不同地域、不同地物类型的洪水形态,耗时且需专业知识;不同SAR产品(GRD与SLC)之间的信息一致性维护亦是一大挑战。数据集的多元异构特性对后续研究中的预处理与模型泛化能力提出了更高要求。
常用场景
经典使用场景
该数据集基于欧空局哨兵一号卫星的合成孔径雷达(SAR)影像,涵盖VV和VH双极化通道,并结合Level 0原始数据、Level 1 GRD和SLC产品,为洪水检测研究提供了多层级、多时相的丰富数据源。其经典使用场景聚焦于利用SAR对水体的高敏感性,通过分析洪水区域在VV极化下的低后向散射特性,以及VH极化下植被淹没区的双弹散射增强现象,实现洪水的精准识别与制图。研究者可采用该数据集训练和验证深度学习模型,如卷积神经网络(CNN)或U-Net架构,用于像素级洪水分割,或开发更先进的SAR时间序列分析算法,以捕捉洪水动态演变过程。
解决学术问题
该数据集有效解决了SAR洪水检测领域面临的多项学术难题。它提供了L0级原始数据,使研究者能够探索原始信号处理对洪水检测精度的潜在影响,突破了以往仅依赖L1产品的局限。同时,数据集的XML标签格式不仅包含二进制水体掩膜,还提供了水体多边形等精细地理信息,支持更复杂的目标检测和语义理解任务。通过提供多种数据级别,它促进了不同预处理策略的比较研究,有助于理解数据处理步骤对最终检测性能的贡献。这些设计为解决SAR影像中水体与噪声区分难、标注标准不一、数据层级单一等关键问题提供了有力支撑,推动了遥感智能解译的学术进展。
衍生相关工作
围绕该数据集,衍生出了一系列影响深远的研究工作。其基础框架源自Kuro Siwo数据库,后者汇集了全球43次洪水事件的标注SAR图像,为大规模洪水检测研究奠定了数据基础。在此基础上,研究者开发了多种基于深度学习的分割模型,如结合注意力机制的U-Net变体,以及在SAR图像上专门优化的编码器-解码器架构。更有学者利用该数据集的L0数据开展原始信号级洪水特征提取,提出了新颖的成像后处理算法。同时,数据集促进了SAR与光学数据融合的研究,以及跨传感器、跨区域的迁移学习探索,这些工作共同推动了洪水检测从传统阈值法向智能化、自动化方向的变革。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务