遇见数据集

GFM-Bench/NA-SAR

收藏
Hugging Face2026-05-14 更新2026-05-31 收录
官方服务:

资源简介:

NA-SAR 是一个基于NASA OPERA档案构建的北美合成孔径雷达预训练数据集,旨在用于SAR基础模型的自监督和掩码图像预训练。

查看器:关闭 数据集昵称:"NA-SAR" 标签: - 地理空间 - 遥感 - 合成孔径雷达(SAR, Synthetic Aperture Radar) - 地球观测 - 自监督学习 - 预训练 - WebDataset - PyTorch 样本规模类别: - 1M < 样本量 < 10M 任务类别: - 图像特征提取 --- # NA-SAR NA-SAR是一套基于NASA OPERA档案构建的北美合成孔径雷达(SAR, Synthetic Aperture Radar)预训练数据集,旨在用于SAR基础模型的自监督与掩码图像预训练。 本次发布的是未拆分的预训练语料库。由于本数据集并非用于定义评估协议,因此未设置训练/验证/测试划分。下游评估任务可自行定义符合地理与时间适配性的数据集拆分方式。 ## 数据集内容 - 样本总数:1,099,604 - 斑块尺寸:128 × 128 像素 - 辐射地形校正(RTC, Radiometric Terrain Correction)视图:每个样本包含两个空间视图 - 时间序列RTC采集数据:主采集(prime)与次采集(secondary) - RTC通道:同极化(co-pol)与交叉极化(cross-pol),缺失的极化通道以零值填充 - 入射角:每个空间视图对应一个入射角通道 - 干涉合成孔径雷达(InSAR, Interferometric Synthetic Aperture Radar)相位:以cos(φ)、sin(φ)的形式存储 - 相干性:每个空间视图对应一个相干性通道 每个张量样本包含以下键值对: | 键名 | 形状 | 描述 | | --- | --- | --- | | `prime_rtc_view_0` | `(2, 128, 128)` | 主RTC视图0,包含同极化/交叉极化数据 | | `secondary_rtc_view_0` | `(2, 128, 128)` | 次RTC视图0,包含同极化/交叉极化数据 | | `prime_rtc_view_1` | `(2, 128, 128)` | 主RTC视图1,包含同极化/交叉极化数据 | | `secondary_rtc_view_1` | `(2, 128, 128)` | 次RTC视图1,包含同极化/交叉极化数据 | | `inc_angle_view_0` | `(1, 128, 128)` | 视图0对应的入射角数据 | | `inc_angle_view_1` | `(1, 128, 128)` | 视图1对应的入射角数据 | | `ifg_view_0` | `(2, 128, 128)` | 视图0对应的InSAR相位数据,以cos/sin形式存储 | | `coh_view_0` | `(1, 128, 128)` | 视图0对应的相干性数据 | | `ifg_view_1` | `(2, 128, 128)` | 视图1对应的InSAR相位数据,以cos/sin形式存储 | | `coh_view_1` | `(1, 128, 128)` | 视图1对应的相干性数据 | ## 元数据 `metadata_hf.parquet`是本次分块发布的可公开获取的元数据表,包含OPERA溯源信息、斑块几何信息、质量评分、极化可用性,以及以下分块相关列: - `sample_key`:WebDataset分块内的样本唯一键 - `shard_path`:tar分块文件的相对路径 - `shard_index`:整数型分块ID - `sample_index_in_shard`:该分块内的样本行顺序 元数据已完成过滤,仅保留`quality_score > 0.53`的样本。 ## 使用Hugging Face Datasets加载 分块发布的数据集可通过WebDataset加载器进行流式加载: python from io import BytesIO import numpy as np from datasets import load_dataset ds = load_dataset( "webdataset", data_files={"train": "data/nasar-train-*.tar"}, split="train", streaming=True, ) sample = next(iter(ds)) arrays = np.load(BytesIO(sample["npz"])) print(arrays.files) ## 使用PyTorch加载 本仓库包含轻量级PyTorch辅助加载工具: python from nasar_dataset import NASARRTCDataset, NASARInSARDataset rtc_ds = NASARRTCDataset("/path/to/NA-SAR") insar_ds = NASARInSARDataset("/path/to/NA-SAR") 如需进行大规模流式加载,可使用`data/`目录下的WebDataset tar分块文件。每个tar包内的成员均为以`{sample_key}.npz`命名的压缩`.npz`张量文件。 ## 预处理说明 RTC数组以原始线性后向散射系数形式存储,无效、非有限值及负值均被置零。默认情况下,辅助加载器会应用预训练阶段的标准RTC变换: python x = log1p(20.0 * x) co_pol = clip_and_rescale(co_pol, p1=0.15, p99=2.39) cross_pol = clip_and_rescale(cross_pol, p1=0.01, p99=1.09) 由于交叉极化后向散射强度显著低于同极化,因此同极化与交叉极化RTC通道使用独立的归一化范围。预处理完成后,完全缺失的极化通道仍保持零填充状态。 InSAR相位以余弦与正弦通道而非缠绕相位弧度形式存储,以避免相位环绕边界处出现不连续问题。 ## 数据来源与覆盖范围 本数据集的源数据来自覆盖北美地区的OPERA SAR产品。用户需遵守OPERA源产品的适用条款与引用规范。 ## 预期用途 本数据集旨在用于SAR与InSAR表征学习任务,尤其是自监督预训练,本身并非官方评估基准。 ## 局限性 - 数据集的地理覆盖范围集中于北美地区。 - 质量过滤步骤会移除低质量样本,可能导致语料库偏向于更容易获取或成像质量更优的采集数据。 - 缺失的RTC极化通道以零填充形式表示。元数据中包含极化可用性标记,以便用户区分真实零值与缺失的极化通道。

提供机构:
GFM-Bench
二维码
社区交流群
二维码
科研交流群
商业服务