遇见数据集

tacofoundation/cloudsen12

收藏
Hugging Face2025-01-05 更新2025-04-12 收录
官方服务:

资源简介:

CloudSEN12+是一个专门用于云和云影检测的大型专家标记像素数据集,基于Sentinel-2卫星数据。它提供了三个不同的模式,包括基于Sentinel-2 Level-1C和Level-2A图像的数据,以及额外的元数据集,以增强对地形的理解。数据集包含四个类别:晴朗、厚云、薄云和云影。所有图像都已填充至512x512和2048x2048的大小,以确保补丁可被32整除。数据集遵循TACO规范,并在公共领域发布,允许任何人免费使用、修改和分发。

The CloudSEN12+ dataset is a large expert-labeled pixel dataset for cloud and cloud shadow detection using Sentinel-2 satellite data. It offers three distinct modes, including data based on Sentinel-2 Level-1C and Level-2A imagery, as well as an extra metadata collection for enhanced landscape understanding. The dataset includes four classes: clear, thick cloud, thin cloud, and cloud shadow. All images are padded to 512x512 and 2048x2048 sizes to ensure patch divisibility by 32. The dataset follows the TACO specification and is released into the public domain under the CC0 license, allowing free use, modification, and distribution by anyone.

提供机构:
tacofoundation
搜集汇总
数据集介绍
tacofoundation/cloudsen12 数据集图片
构建方式
CloudSEN12+数据集是CloudSEN12的显著扩展版本,其构建核心在于大幅扩充专家标注的像素数量,使之成为迄今为止Sentinel-2卫星影像中最大的云与云影检测数据集。构建过程中,所有旧版本的标签均经过精心整理与优化,确保了数据的高可信度。该数据集提供了三种不同的模式:基于Sentinel-2 Level-1C影像的cloudsen12-l1c、基于Level-2A数据的cloudsen12-l2a,以及包含地形、土地覆盖、雷达后向散射系数和多种云掩膜产品等辅助信息的cloudsen12-extra模式。影像被填充至512x512或2048x2048像素,以保证尺寸可被32整除,填充区域以零值填补。数据集以CC0许可证发布,置于公共领域,允许自由使用、修改和分发。
特点
该数据集的核心特点在于其规模宏大与标注精细。作为目前最大的Sentinel-2云检测专家标注数据集,它涵盖了全球范围的空间覆盖,并提供了两种主要的影像块尺寸(509×509和2000×2000像素)。标签类型包括高质量的专家标注、涂鸦式标注和无标签数据,能够满足从监督学习到弱监督学习等多种研究需求。数据集定义的四类像素(晴空、厚云、薄云和云影)为云检测任务提供了清晰的分类基准。此外,cloudsen12-extra模式集成了来自不同算法的多种云掩膜产品,以及高程、土地覆盖和雷达数据,为多源数据融合分析和算法对比提供了宝贵的资源。
使用方法
使用CloudSEN12+数据集推荐采用tacoreader库进行高效加载,该库支持远程读取云优化数据集。用户可通过简单的API调用,如tacoreader.load("tacofoundation:cloudsen12-l1c"),即可获取数据。加载后,可以方便地读取影像和对应的标签数据。数据集采用分层抽样策略划分训练、验证和测试集,确保了数据分布的均衡性。对于偏好传统格式的用户,GeoTIFF文件也可从ScienceDataBank仓库获取。此外,数据集的HuggingFace页面提供了详细的讨论区和相关科学出版物,便于用户深入理解和引用该数据集。
背景与挑战
背景概述
CloudSEN12+是由西班牙瓦伦西亚大学图像与信号处理实验室(ISP)主导,联合欧洲空间局(ESA)等机构,于2024年发布的一个面向Sentinel-2卫星影像的云与云阴影检测数据集。该数据集由Cesar Aybar等人构建,其核心研究问题在于构建迄今为止规模最大、标注质量最高的专家级像素标注云检测基准,以应对遥感领域中云覆盖对地表信息提取的严重干扰。作为CloudSEN12的显著扩展,v1.1.0版本将专家审核的标注数量翻倍,并对早期版本进行了全面精炼与修正,同时采用CC0公共领域许可,极大促进了数据的开放共享与复用。该数据集通过提供L1C、L2A及附带高程、土地覆盖、多种自动云掩膜等辅助信息的扩展模式,为云检测算法的训练、评估与跨方法比较提供了统一且权威的平台,对推动遥感图像语义分割领域的发展具有里程碑式的影响力。
当前挑战
该数据集所应对的领域核心挑战在于,Sentinel-2影像中的云与云阴影检测长期受制于薄云透明度高、云阴影几何畸变复杂以及地物光谱混淆等问题,导致传统自动云掩膜算法(如QA60、Sen2Cor、S2Cloudless等)在不同地表景观下鲁棒性不足。CloudSEN12+通过提供覆盖全球的多样本专家标注,旨在为深度学习模型提供高质量训练数据,解决现有数据集规模小、标注不一致的瓶颈。在构建过程中,团队面临了多项挑战:一是需对509×509与2000×2000两种尺寸的影像块进行空间对齐与唯一性标识,避免地理区域混淆;二是必须对旋转、质量不佳的样本进行逐一修正与剔除,确保标注可信度;三是需将多种来源的自动云掩膜(如CloudScore、UNetMobV2、Sensei等)纳入统一框架,但由于各掩膜分类体系未归一化,使用者在多源融合时需额外处理标准化问题。
常用场景
经典使用场景
在遥感图像智能解译领域,CloudSEN12+数据集以其海量专家标注像素和精细的语义分割标签,成为云与云阴影检测研究的黄金标准。该数据集基于Sentinel-2卫星影像,提供了L1C和L2A两种辐射定标级别的图像,并包含清晰、厚云、薄云和云阴影四类地物标签。研究者通常利用其509×509或2000×2000像素的影像块,训练深度卷积神经网络实现像素级云覆盖识别,从而推动遥感影像预处理中云掩膜自动生成技术的进步。
实际应用
在实际应用中,CloudSEN12+衍生的云检测模型被广泛集成于卫星数据预处理流水线。例如,农业监测中需要剔除云污染像元以准确估算植被指数;环境遥感系统则依赖精确云掩膜进行大气校正与地表反射率反演。此外,灾害应急响应中,快速获取无云影像对于洪涝、火灾等灾情评估至关重要。该数据集训练的轻量化模型已部署于云端计算平台,实现了对海量Sentinel-2数据的实时清洗,大幅提升了遥感数据服务的可用性和可靠性。
衍生相关工作
CloudSEN12+催生了多项具有影响力的衍生工作。其中,Aybar等人基于该数据集提出了UNetMobV2轻量级云检测网络,在保持高精度的同时实现了高效推理;Pasquarella等人则利用其多源标注信息,开发了CloudScore弱监督质量评估框架,解决了标注不一致问题。此外,该数据集还被用于验证S2Cloudless、Sen2Cor等经典云检测算法的性能上限,并启发了基于SAR与光学数据融合的云阴影补偿研究,成为遥感领域算法创新的重要基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务