遇见数据集

Flood Extent Data for Machine Learning

收藏
arXiv2023-11-16 更新2024-06-21 收录
官方服务:

资源简介:

本数据集名为‘Flood Extent Data for Machine Learning’,由美国国家航空航天局创建,旨在通过机器学习技术精确捕捉洪水范围。数据集覆盖美国大陆和孟加拉国约36,000平方公里的区域,包含36,000个标记的水体范围和洪水区域。创建过程中,利用了Sentinel-1 C波段合成孔径雷达(SAR)图像,并通过公民科学方法,如公开数据集和举办开放竞赛,加速洪水范围检测模型的原型开发。该数据集主要应用于洪水监测和灾害响应决策,以提高全球洪水范围模型的稳健性。

This dataset is named "Flood Extent Data for Machine Learning" and was developed by the National Aeronautics and Space Administration (NASA) to accurately capture flood extents using machine learning technologies. It covers an area of approximately 36,000 square kilometers across the continental United States and Bangladesh, and contains 36,000 labeled water body extents and flood regions. During its development, Sentinel-1 C-band synthetic aperture radar (SAR) images were utilized, and citizen science approaches including public datasets and open competitions were adopted to accelerate the prototype development of flood extent detection models. This dataset is primarily applied to flood monitoring and disaster response decision-making to enhance the robustness of global flood extent models.

创建时间:
2023-11-16
搜集汇总
数据集介绍
构建方式
该数据集基于哨兵一号C波段合成孔径雷达(SAR)影像构建,覆盖美国本土(阿拉巴马州、内布拉斯加州、爱荷华州)及孟加拉国约36,000平方公里的已知洪水事件区域。首先,通过HyP3处理流水线将SAR VV和VH极化影像进行辐射定标与地形校正,并转换为0-255灰度图像。随后,利用协同标注工具ImageLabeler,由专家对洪水淹没范围进行多边形勾画,重点标注开阔水域及因双反弹效应产生的暗区。标注过程中辅以MODIS光谱数据验证非水体暗区。最终将VV、VH灰度图及永久水体标签、洪水标签裁剪为256×256像素的瓦片,剔除无数据或无水体的瓦片,形成训练集、验证集与测试集(红河北部区域作为测试集),并去除时空信息以支持竞赛匿名化需求。
特点
该数据集的核心特色在于融合了专家知识与公民科学机制。一方面,标注过程由SAR影像专家通过双重目视检验完成,精准区分开阔水域与复杂地物(如建筑、植被)引起的双反弹效应暗区,并纳入永久水体标签以辅助模型学习淹没特异性特征。另一方面,数据集通过开放竞赛形式引入公民科学,吸引了16支团队提交194份模型方案,获胜模型采用自注意力U-Net、弱监督集成U-Net及特征金字塔网络等先进架构,相较于基线U-Net模型(IOU 0.6198)实现了最高15%的性能提升(IOU达0.7681),显著推动了洪水范围检测的算法创新。
使用方法
数据集以GeoTIFF格式提供,包含VV极化、VH极化、永久水体标签及洪水标签四类图像,每类均为256×256像素的灰度瓦片,空间分辨率约30米。使用者可将VV、VH与永久水体图像堆叠为三通道输入,训练语义分割模型(如U-Net、FPN)。数据已按地理区域划分:训练集涵盖北阿拉巴马、孟加拉国、佛罗伦萨及密苏里河流域,验证集与训练集同源,测试集为红河北部独立区域,确保无数据泄漏。模型性能评估采用交并比(IoU)指标。数据集通过Radiant MLHub注册(DOI: 10.34911/RDNT.EBK43X),采用CC-BY-4.0许可,支持直接下载用于研究与开发。
背景与挑战
背景概述
洪水作为破坏性极强的自然灾害,其淹没范围的精准提取对应急响应与灾后重建至关重要。合成孔径雷达(SAR)凭借其穿透云层、不受光照限制的优势,成为洪水监测的核心数据源。然而,传统阈值分割方法在复杂地物(如建筑物、植被)引发的“双次散射”效应下表现欠佳。为攻克这一难题,美国阿拉巴马大学亨茨维尔分校、德国航空航天中心及美国国家航空航天局的研究团队于2023年联合构建了面向机器学习的洪水范围数据集(Flood Extent Data for Machine Learning)。该数据集覆盖美国本土及孟加拉国约36,000平方公里的区域,基于Sentinel-1 C波段SAR影像,通过专家协作标注水体与洪泛区,旨在推动深度学习模型在洪水范围检测中的泛化能力与鲁棒性。
当前挑战
该数据集所应对的核心挑战在于复杂环境下的洪水范围精准分割。SAR影像中,建筑物与植被导致的“双次散射”效应使淹没区域呈现高后向散射异常值,传统阈值法难以区分水体与非水体。此外,永久水体与动态洪泛区的边界模糊、热带地区云层对光学影像的干扰,进一步加剧了检测难度。在数据集构建过程中,标注面临双重困境:一是需从36,000平方公里SAR影像中人工识别因双次散射产生的非连续暗斑,并借助MODIS光谱数据排除永久水体的误判;二是需平衡开放水域与复杂洪泛区(如积水农田)的标注精度,确保标签能有效引导模型学习淹没特征的时空差异性。
常用场景
经典使用场景
在遥感与计算机视觉交叉领域,Flood Extent Data for Machine Learning 数据集被广泛用于训练和评估基于合成孔径雷达(SAR)影像的洪水范围语义分割模型。该数据集提供了来自Sentinel-1卫星的VV和VH极化波段灰度图像,并配以专家标注的洪水范围掩膜及永久水体掩膜,覆盖美国本土及孟加拉国约36,000平方公里的区域。研究者通常将其划分为256×256像素的图块,构建输入-标签对,用于监督学习范式下的像素级分类任务。该数据集尤其擅长应对建筑物和植被引起的“双次散射”效应,从而挑战传统阈值法难以处理的复杂场景,成为推动高精度洪水范围提取算法发展的标杆性基准。
衍生相关工作
基于该数据集,衍生了一系列创新性的深度学习架构与训练策略。竞赛优胜方案中,西安电子科技大学团队提出了在U-Net瓶颈层引入Transformer自注意力机制,有效捕获局部特征的长程依赖关系,将IoU提升至0.7681。亚军团队则采用U-Net集成与弱监督学习,通过生成高质量伪标签增强标注数据,提升了模型在标注稀缺场景下的鲁棒性。季军方案利用特征金字塔网络(FPN)结合EfficientNet-B7编码器,实现了多尺度特征融合。这些工作不仅验证了数据集对模型性能的显著推动作用(较基线提升15%),还催生了结合注意力机制、集成学习和半监督学习的洪水检测新范式,为后续研究提供了坚实的基准与灵感源泉。
数据集最近研究
最新研究方向
在全球气候变化加剧的背景下,洪水灾害频发,对应急响应与灾后重建提出了严峻挑战。基于此,Flood Extent Data for Machine Learning数据集应运而生,聚焦于利用Sentinel-1 C波段合成孔径雷达(SAR)影像与深度学习技术实现洪水范围的精准提取。当前前沿研究方向主要围绕如何克服SAR影像中因建筑物和植被引起的“双弹射”效应导致的复杂散射干扰,以及提升模型在多种地理环境下的泛化能力。该数据集通过整合公民科学机制,以开放竞赛形式推动社区创新,催生了融合自注意力机制与弱监督学习的U-Net变体等先进模型,将检测精度提升了约15%。这一研究路径不仅强化了机器学习在灾害监测中的实际应用价值,也为构建全球尺度的洪水泛化分割模型奠定了关键数据基础,具有重要的科学与现实意义。
相关研究论文
  • 1
    Leveraging Citizen Science for Flood Extent Detection using Machine Learning Benchmark Dataset美国国家航空航天局 · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务