遇见数据集

Major-TOM/Core-S1RTC

收藏
Hugging Face2024-08-29 更新2024-04-19 收录
官方服务:

资源简介:

Core-S1RTC数据集包含全球覆盖的Sentinel-1 (RTC)图像块,每个图像块大小为1,068 x 1,068像素。数据集的主要内容包括VV和VH极化下的接收线性功率,以及缩略图。数据集的空间覆盖范围是全球性的,几乎涵盖了Sentinel-1捕获的每一块地球区域。此外,README还提供了数据集的示例使用方法和引用信息。

The Core-S1RTC dataset consists of globally covered Sentinel-1 (RTC) image patches, each with a size of 1,068 × 1,068 pixels. The dataset primarily contains received linear power under VV and VH polarizations, alongside thumbnails. Its spatial coverage is global, covering almost every terrestrial area captured by Sentinel-1. In addition, the accompanying README document provides example usage guidelines and citation information for the dataset.

提供机构:
Major-TOM
原始信息汇总

数据集概述

基本信息

  • 名称: Core-S1RTC
  • 许可证: cc-by-sa-4.0
  • 标签: earth-observation, remote-sensing, sentinel-1, sar, synthethic-aperture-radar, satellite
  • 大小: 1M<n<10M

数据集内容

  • : Sentinel-1 RTC
  • 传感类型: Synthetic Aperture Radar
  • 补丁数量: 1,469,955
  • 补丁大小: 1,068 x 1,068 pixels (10 m resolution)
  • 总像素数: > 1.676 Trillion

数据集特征

  • product_id: 字符串类型
  • grid_cell: 字符串类型
  • product_datetime: 字符串类型
  • thumbnail: 图像类型
  • vv: 二进制类型
  • vh: 二进制类型

数据集分辨率

  • VV: 10m
  • VH: 10m
  • thumbnail: 10m

空间覆盖

  • 类型: 全球单时相数据集
  • 覆盖范围: 几乎覆盖了Sentinel-1捕捉到的每一块地球表面,覆盖率比Core Sentinel-2数据集低约35%。

示例使用

  • 提供了接口脚本,用于访问和处理数据集中的图像。
搜集汇总
数据集介绍
Major-TOM/Core-S1RTC 数据集图片
构建方式
Core-S1RTC数据集由欧洲空间局Φ-lab构建,基于Sentinel-1卫星的合成孔径雷达(SAR)辐射地形校正(RTC)产品。该数据集采用全球覆盖的采集策略,将地表分割为1,068×1,068像素的规则图块,每个图块对应10米空间分辨率。通过处理Sentinel-1的VV和VH极化通道数据,生成包含线性功率信息的二进制图像,同时以假彩色合成方式生成缩略图。数据集最终以Parquet格式存储,包含约147万个图块,总像素数超过1.676万亿,实现了近乎全球的单一时间点覆盖。
特点
该数据集的核心特点在于其全球尺度的单时相SAR覆盖能力,几乎囊括了Sentinel-1卫星捕获的每一寸地表,仅因传感器覆盖限制缺失约35%的区域。数据包含VV和VH两个极化通道的原始线性功率信息,为地物散射特性分析提供了基础。缩略图采用独特的假彩色合成方案(R:VV, G:VV+VH, B:VH),通过对比度拉伸增强视觉可解释性,但需注意其归一化处理使得不同样本间无法直接比较。这种设计在保留物理信息的同时,兼顾了可视化需求。
使用方法
用户可通过HuggingFace平台直接访问该数据集,推荐使用配套的接口脚本(GitHub仓库ESA-PhiLab/Major-TOM)。典型调用流程包括:利用fsspec库的open_parquet_file函数打开远程Parquet文件,通过PyArrow读取指定行组的缩略图或极化通道数据。例如,选择Parquet文件编号和行索引后,可将二进制缩略图数据通过BytesIO转换为PIL图像对象。对于VV和VH极化数据,可直接以二进制格式加载进行后续分析。数据集还提供独立的元数据配置文件,便于按产品ID、网格单元或时间戳进行筛选检索。
背景与挑战
背景概述
合成孔径雷达(SAR)因其全天候、全天时的地表观测能力,成为地球观测领域不可或缺的遥感技术。然而,大规模、标准化、全球覆盖的SAR训练数据集的匮乏,长期制约着深度学习模型在该领域的应用与发展。在此背景下,欧洲空间局(ESA)Φ-lab实验室的研究人员Alistair Francis与Mikolaj Czerkawski于2024年推出了Major-TOM/Core-S1RTC数据集。该数据集基于Copernicus Sentinel-1卫星的辐射地形校正(RTC)产品构建,包含超过146万个尺寸为1068×1068像素的全球影像切片,总像素数突破1.676万亿,堪称目前规模最大的开源SAR数据集。其核心研究问题在于为地球观测领域提供一个标准化、可扩展的SAR影像基准,推动遥感图像分类、变化检测、地表参数反演等任务的深度学习研究。该数据集的出现,有望填补SAR领域大型预训练数据集的空白,对全球遥感社区产生深远影响。
当前挑战
Core-S1RTC数据集面临的首要挑战在于解决SAR影像特有的领域难题:与光学影像不同,SAR数据受斑点噪声、几何畸变及极化散射机制复杂等因素影响,传统图像分类与分割模型难以直接迁移应用。此外,构建过程亦遭遇多重技术障碍:首先,Sentinel-1传感器覆盖范围有限,导致数据集全球覆盖率较同系列光学数据集低约35%,大量陆地与海洋区域存在数据缺失;其次,RTC产品需对原始SAR信号进行辐射定标、地形校正及多视处理,涉及复杂的信号处理流程与海量计算资源;最后,数据存储与分发面临巨大压力——近150万张10米分辨率影像需以高效压缩的Parquet格式组织,并确保用户可快速访问与解析,这对数据架构的鲁棒性与可扩展性提出了严苛要求。
常用场景
经典使用场景
Core-S1RTC数据集作为全球首个大规模、标准化、单时相的Sentinel-1合成孔径雷达(SAR)辐射地形校正(RTC)影像库,经典使用场景集中于遥感图像语义分割、变化检测与地表分类任务。研究者可利用其1068×1068像素的VV与VH双极化影像,开展城市扩展监测、水体识别、农田分类及森林覆盖制图等典型地理空间分析。数据集的全球覆盖特性与10米空间分辨率,使其成为训练深度学习模型进行大尺度环境监测的理想基准资源。
解决学术问题
该数据集有效解决了SAR领域长期面临的高质量、大规模、一致性标注样本匮乏的学术瓶颈。传统SAR数据集常受限于区域覆盖不均、辐射校正标准不一或样本数量不足,难以支撑深度学习模型的泛化能力。Core-S1RTC通过提供全球近乎全覆盖的RTC影像,并统一采用10米分辨率和标准化极化通道,显著提升了遥感分类、目标检测与语义分割等任务的训练数据质量。其发布推动了SAR图像分析从手工特征工程向数据驱动范式的转型,为地球观测领域的可复现研究奠定了坚实基础。
衍生相关工作
基于Core-S1RTC数据集,已衍生出多项经典研究工作。最典型的是ESA Phi-Lab团队同期发布的Major TOM框架,该框架提供了高效的数据接口与预处理管线,使得大规模SAR影像的分布式加载与模型训练成为可能。此外,该数据集已被广泛应用于自监督学习预训练、SAR与光学影像跨模态融合、以及基于Transformer架构的时序分析网络等前沿方向,催生了诸如SAR-Swin、GeoEncoder等代表性模型,进一步拓展了雷达遥感在智能解译领域的学术边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务