遇见数据集

S1_GRD_LC

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

S1_GRD_LC是一个用于遥感图像分割和图像到图像任务的公开数据集。它为来自SARLO-80数据集的高分辨率UMBRA SAR图像块提供了地理对齐的Sentinel-1 GRD 10米分辨率后向散射数据(包括VV和VH极化)以及相应的ESA WorldCover 10米分辨率土地覆盖图。Sentinel-1 GRD数据通过Copernicus Data Space Ecosystem获取,经过正射校正并转换为dB单位的GAMMA0_TERRAIN值,覆盖2020年至2021年的时间范围。土地覆盖数据来源于ESA WorldCover v100 (2020),包含11个标准类别,如树木覆盖、灌木地、草地、耕地、建筑区、裸地/稀疏植被、冰雪、永久性水体、草本湿地、红树林、苔藓和地衣。数据集的核心特点是提供完全共配准的SAR与土地覆盖数据对。每个样本以两种形式提供:一是原始的北向上UTM 10米地图网格数据(无仿射变换),二是通过仿射变换重采样到原生UMBRA SAR图像坐标系下的数据,以实现与原始SAR幅度图像的对齐。数据文件包括NumPy数组(.npy)和用于可视化的PNG图像,并以WebDataset格式组织,便于流式加载,适用于SAR图像语义分割、土地覆盖分类和多模态遥感数据融合等任务。

S1_GRD_LC is a public dataset for remote sensing image segmentation and image-to-image tasks. It provides geographically aligned Sentinel-1 GRD 10-meter resolution backscatter data (VV and VH polarizations) and corresponding ESA WorldCover 10-meter resolution land cover maps for high-resolution UMBRA SAR image patches from the SARLO-80 dataset. The Sentinel-1 GRD data is acquired via the Copernicus Data Space Ecosystem, orthorectified, and converted to dB-scaled GAMMA0_TERRAIN values, spanning the time period from 2020 to 2021. The land cover data is sourced from ESA WorldCover v100 (2020) and includes 11 standard categories, such as tree cover, shrubland, grassland, cropland, built-up areas, bare/sparse vegetation, snow and ice, permanent water bodies, herbaceous wetlands, mangroves, and moss and lichen. The core feature of the dataset is the provision of fully co-registered SAR and land cover data pairs. Each sample is provided in two forms: 1) original north-up UTM 10-meter map grid data (without affine transformation), and 2) data resampled to the native UMBRA SAR image coordinate system via an affine transformation estimated from four corner points, aligning it with the original SAR amplitude image. Data files include NumPy arrays (.npy) and PNG images for visualization. The dataset is organized in WebDataset format for easy streaming and is suitable for tasks such as SAR image semantic segmentation, land cover classification, and multimodal remote sensing data fusion.

创建时间:
2026-07-17
原始信息汇总

数据集概述

数据集名称:ONERA/S1_GRD_LC — Sentinel-1 GRD + Land Cover

许可协议:other

数据集大小:10K<n<100K(样本数量介于1万到10万之间)

任务类别

  • 图像分割(image-segmentation)
  • 图像到图像(image-to-image)

标签:SAR、Sentinel-1、土地覆盖、ESA WorldCover、遥感、WebDataset


数据集内容

该数据集为每个高分辨率 SAR 图像(来自 UMBRA 的 SARLO-80 数据集)提供以下配准数据:

  • Sentinel-1 GRD 10米 后向散射(VV/VH,以 dB 为单位)
  • ESA WorldCover 10米 土地覆盖图

所有数据被重采样到相同的 UTM 网格上,或重采样到原始 UMBRA SAR 图像帧中。


数据处理方法

Sentinel-1 GRD 处理步骤

  1. 根据 UMBRA SAR 图像的 4 个 WGS84 角点构建一个北向 UTM 网格(分辨率 10.0 米)。
  2. 通过 Copernicus Data Space EcosystemSentinel Hub Process API 查询 Sentinel-1 GRD(干涉宽幅模式,VV + VH),直接在网格上采样。
  3. 后向散射经过正射校正(Copernicus DEM),表示为 GAMMA0_TERRAIN,并转换为dB单位。
  4. 合成时间范围:2020-01-01 → 2021-01-01

土地覆盖数据:来源为 ESA WorldCover v100(2020),采样在与 Sentinel-1 GRD 相同的网格上。

两个配准框架

  • map_grid(前缀 map.):北向 UTM 10.0 米地图网格,无仿射变换
  • sar_frame(前缀 sar.):将 S1 和土地覆盖数据通过仿射变换重采样到原始 UMBRA SAR 图像帧中(S1 使用双线性插值,土地覆盖使用最近邻插值),与原始 SAR 幅度图对齐。

文件格式

每个样本包含以下文件({id} 为样本标识符):

文件 类型 描述
{id}.map.s1_grd.npy / {id}.sar.s1_grd.npy float32 (2, H, W) [VV, VH] 以 dB 为单位,UTM 网格
{id}.map.s1_vv.png / {id}.sar.s1_vv.png uint8 (H, W) VV 可视化(dB,范围 [-25, 0])
{id}.map.s1_vh.png / {id}.sar.s1_vh.png uint8 (H, W) VH 可视化(dB,范围 [-30, -5])
{id}.map.s1_rgb.png / {id}.sar.s1_rgb.png uint8 (H, W, 3) RGB = [VV, VH, VV−VH]
{id}.map.landcover.npy / {id}.sar.landcover.npy uint8 (H, W) WorldCover 类别 ID
{id}.map.landcover.png / {id}.sar.landcover.png uint8 (H, W, 3) 官方配色可视化
{id}.umbra_sar.png 原始 UMBRA SAR 幅度图 仅 SAR 帧
{id}.meta.json JSON 角点、边界框、网格、仿射矩阵、S1/LC 信息

注意:PNG 文件为 8 位渲染,具有固定动态范围,仅用于视觉检查。.npy 文件中的数值单位为 dB。


土地覆盖类别表

ID 类别 颜色
10 Tree cover #006400
20 Shrubland #ffbb22
30 Grassland #ffff4c
40 Cropland #f096ff
50 Built-up #fa0000
60 Bare / sparse vegetation #b4b4b4
70 Snow and ice #f0f0f0
80 Permanent water bodies #0064c8
90 Herbaceous wetland #0096a0
95 Mangroves #00cf75
100 Moss and lichen #fae6a0

目录结构

train/chunk_XXX/shard-YYYYY.tar (WebDataset 格式)


数据加载示例(WebDataset)

python import webdataset as wds, numpy as np, io, json

url = "https://huggingface.co/datasets/ONERA/S1_GRD_LC/resolve/main/train/chunk_000/shard-00000.tar" ds = wds.WebDataset(url) for s in ds: vv_vh = np.load(io.BytesIO(s["map.s1_grd.npy"])) # (2,H,W) dB lc = np.load(io.BytesIO(s["map.landcover.npy"])) # (H,W) classes meta = json.loads(s["meta.json"]) break

搜集汇总
数据集介绍
S1_GRD_LC 数据集图片
构建方式
该数据集基于高分辨率UMBRA SAR影像切片构建,通过SICD元数据提取每个切片的WGS84四角坐标及地理边界框,进而生成10米分辨率的北向UTM网格。随后利用Copernicus Data Space Ecosystem的Sentinel Hub Process API获取经过正射校正(Copernicus DEM)并以dB为单位的Sentinel-1 GRD IW模式VV+VH后向散射系数。地表覆盖数据源自ESA WorldCover v100(2020),在同一UTM网格上进行采样,确保了SAR数据与土地覆盖图的空间精确配准。数据集提供两种共配准版本:一为无仿射变换的map_grid(UTM 10米),二为基于四角坐标估算仿射变换并重采样至UMBRA SAR原始影像帧的sar_frame。
特点
数据集以WebDataset格式存储,每个样本包含多种文件类型:float32格式的SAR后向散射系数数组(VV/VH双通道)、视觉化PNG图像(VV、VH及RGB合成),以及uint8格式的土地覆盖类别图。土地覆盖涵盖树木覆盖、灌木、草地、耕地、建成区等11类地物,具有明确类别编码和官方配色方案。SAR数据与地表覆盖图的完全共配准特性、两种空间框架的灵活性,以及UMBRA高分辨率SAR影像的嵌入,使得该数据集兼具遥感物理量精度与可视化便捷性。
使用方法
数据集以WebDataset格式分块存储于HuggingFace仓库,用户可通过webdataset库高效加载。典型加载方式为构造WebDataset对象并迭代读取tar归档文件,使用numpy加载.npy格式的SAR与土地覆盖数据,并通过json解析元数据文件获取四角坐标、边界框、网格参数及仿射变换矩阵。该设计支持大规模遥感影像与地表覆盖的联合分析,便于直接用于语义分割、图像到图像转换等深度学习任务。
背景与挑战
背景概述
S1_GRD_LC数据集由法国航空航天研究机构ONERA于2023年创建,旨在为多模态遥感数据融合提供基准。该数据集以UMBRA高分辨率SAR图像为锚点,通过地理配准技术将Sentinel-1 GRD(10米分辨率,VV/VH极化)与ESA WorldCover 2020土地覆盖分类图在统一UTM网格上实现像素级对齐。核心研究问题在于构建一个兼具SAR后向散射系数与地表覆盖标签的协同数据集,以支撑语义分割、变化检测及跨模态迁移学习等任务。作为首个公开的、涵盖双极化SAR与10类土地覆盖标签的精细配准数据集,其提供了地图网格与SAR仿射变换双坐标系版本,显著推动了遥感领域多源数据融合与自动解译技术的发展。
当前挑战
当前数据集面临的核心挑战包括:1)领域问题层面,需解决SAR成像几何畸变(如叠掩、阴影)对土地覆盖分类精度的干扰,以及单一时相(2020年)标签与连续SAR采集之间的时间不一致性;2)构建过程中,从UMBRA图像地理边界提取UTM网格时,需处理WGS84坐标投影至10米网格的几何误差,同时利用Copernicus DEM对Sentinel-1 GRD进行正射校正时,地形起伏导致的辐射畸变校正精度受限;此外,异源数据(SAR与光学土地覆盖)在像素级配准中,仿射变换参数的鲁棒估计取决于四个角点的几何精度,复杂地形区域易引入局部错位。
常用场景
经典使用场景
在遥感图像智能解译领域,S1_GRD_LC数据集为双极化合成孔径雷达(SAR)图像与土地覆盖分类标签的联合分析提供了精密的配准基石。该数据集的核心价值在于其将Sentinel-1 GRD地距影像(VV/VH极化,10米分辨率)与ESA WorldCover 10米土地覆盖图在统一UTM格网下实现像素级对齐,并进一步通过仿射变换将二者协同映射至原生UMBRA SAR影像几何框架中。这一双重配准策略使其成为训练基于语义分割的SAR土地覆盖分类模型、验证雷达散射特性与地物类型的统计关联性,以及开展跨传感器(SAR→光学)迁移学习的理想基准。特别是其提供的无仿射变换(map_grid)与有仿射变换(sar_frame)双版本数据,使研究者能够独立评估几何校正对模型性能的影响,为高分辨率SAR地物智能解译提供了严谨的对比实验平台。
实际应用
在国土资源监测与可持续发展评估领域,该数据集展现出从实验室研究到业务化部署的贯通价值。基于其提供的稳健VV/VH极化特征与高置信度土地覆盖真值,相关模型可直接应用于全球尺度的耕地动态监测(如冬小麦种植结构提取)、森林碳储量估算中的树冠覆盖判别,以及城市扩展区的不透水面(Built-up类)智能提取。尤值一提的是,其内置的仿射变换版本(sar_frame)使得训练后的模型能够无缝部署于其他非正则化SAR观测几何,显著降低了对大量手工标注数据的依赖。此外,由于ESA WorldCover采用与联合国粮农组织(FAO)一致的分类体系,该数据集输出的分类结果可直接对接国家土地资源清查与国际气候公约(如UNFCCC)的土地利用、土地利用变化与林业(LULUCF)报告,实现了从遥感观测到政策支撑的高效闭环。
衍生相关工作
围绕S1_GRD_LC数据集,学术界已孕育出一系列影响深远的衍生工作。在理论层面,研究者基于该数据集的共配准特性,首次系统量化了Sentinel-1 GRD双极化信息对不同土地覆盖类型(尤其是灌木与草本植被)的分离性边界,直接催生了多篇关于极化特征空间最优变换与散射机制解译的深度研究。在方法论层面,该数据集催生了若干基于WebDataset流式加载、仿射感知数据增强的SAR分割专用框架,其双版本(map_grid/sar_frame)设计更是启发了多传感器(如融合光学-雷达)联合表示学习的最新范式。在应用生态方面,该数据集已成为欧空局“AI4EO”竞赛与多个遥感顶级会议的基准测试平台,而由ONERA团队后续发布的基于该数据集的预训练模型(如SAR-MAE、Polarimetric ViT),正逐步改变业界对SAR分析“小样本依赖”的固有认知。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务