遇见数据集

L-Band_DLPU

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

LB-DLPU是一个物理模拟的L波段(NISAR/UAVSAR)InSAR相位解缠基准数据集,旨在为基于学习和经典方法的解缠器提供训练、验证和测试平台。数据集包含10,000个256×256的patch,每个patch提供缠绕相位(输入)、真实绝对相位(目标)、相干性、水平与垂直边缘的整数模糊度标签({−2,…,+2})、Goldstein环残差以及有效像素掩膜。数据集分为训练集(8,000)、验证集(1,000)和测试集(1,000),覆盖NISAR(星载,20米分辨率,含电离层效应)和UAVSAR(机载,6米分辨率,无电离层效应)两种传感器模式,并按地形复杂度分为平滑(3,090)、混合(4,015)和密集(2,895)三个难度层。所有场景均通过良定性证明:在正确边缘代价下,无噪声最小费用流(MCF)解缠器可恢复每个patch,均方根误差低于0.035 rad,确保任何方法误差归因于方法本身而非不可解问题。数据集的相位噪声、相干性(基于Beta分布拟合真实数据)和电离层屏均校准至真实NISAR/UAVSAR数据,陡峭近断层梯度使边缘模糊度范围扩展至{−2,…,+2}。地形来自29个Copernicus GLO-30 DEM图块,按整图块划分,确保训练/验证/测试集无地形泄露。每个patch以HDF5格式存储(约0.7 MB),包含7个数据集和丰富的元数据属性(传感器、难度、相干性、残差数等),同时提供快速查看的PNG图像和索引JSONL文件。数据集适用于L波段相位解缠方法的训练与基准测试,支持像素级和边缘级监督,并提供了方法无关的评估框架(RMSE、MAE、PSNR、SSIM、跳变率等)。参考基线显示深度网络在密集/高梯度区域优于经典和统计解缠器(如SNAPHU),但基准尚未饱和,仍存在与oracle上限的差距。数据集采用CC-BY-4.0许可,使用时需注明数据来源及Copernicus DEM的归属。

LB-DLPU is a physically simulated L-band (NISAR/UAVSAR) InSAR phase unwrapping benchmark dataset designed to provide training, validation, and test platforms for both learning-based and classical unwrapping methods. The dataset contains 10,000 256×256 patches, each providing wrapped phase (input), ground-truth absolute phase (target), coherence map, integer ambiguity labels for horizontal and vertical edges ({−2, …, +2}), Goldstein phase residuals, and valid pixel mask. It is split into a training set (8,000 samples), validation set (1,000 samples), and test set (1,000 samples), covering two sensor modes: NISAR (spaceborne, 20 m resolution, with ionospheric effects) and UAVSAR (airborne, 6 m resolution, without ionospheric effects). The dataset is also categorized into three difficulty layers based on terrain complexity: flat (3,090 samples), mixed (4,015 samples), and dense (2,895 samples). All scenarios are proven to be well-posed: with correct edge costs, the noise-free minimum cost flow (MCF) unwrapping algorithm can recover each patch with a root-mean-square error (RMSE) below 0.035 rad, ensuring that the error of any unwrapping method is attributable to the method itself rather than an unsolvable problem. The phase noise, coherence (fitted to real-world InSAR data via Beta distribution), and ionospheric screens of the dataset are calibrated to match real NISAR/UAVSAR data. Steep near-fault gradients expand the range of edge ambiguities to {−2, …, +2}. The terrain data is derived from 29 Copernicus GLO-30 DEM tiles, which are divided as complete tiles to ensure no terrain leakage occurs between the training, validation, and test sets. Each patch is stored in HDF5 format (approximately 0.7 MB per patch), containing 7 distinct datasets and rich metadata attributes including sensor type, difficulty level, coherence value, number of phase residuals, and more. PNG images for quick visualization and an indexed JSONL file are also provided alongside the dataset. This dataset is suitable for training and benchmarking L-band phase unwrapping methods, supporting both pixel-level and edge-level supervision. A method-agnostic evaluation framework is provided, with metrics including RMSE, MAE, PSNR, SSIM, and jump rate. Reference baselines demonstrate that deep networks outperform classical and statistical unwrappers (e.g., SNAPHU) in dense and high-gradient regions, yet the benchmark remains unsaturated, with a remaining performance gap relative to the oracle upper bound. The dataset is released under the CC-BY-4.0 license, and users must cite the data source and Copernicus DEM attribution when utilizing the dataset.

创建时间:
2026-08-02
原始信息汇总

LB-DLPU: L波段(NISAR/UAVSAR)InSAR相位解缠基准数据集

数据集概述

LB-DLPU是一个物理模拟的L波段干涉合成孔径雷达(InSAR)相位解缠基准数据集,针对NISAR(星载,20米分辨率)和UAVSAR(机载,6米分辨率)两种观测模式校准。数据集包含10,000个256×256的影像块,每块均提供缠绕相位、真实绝对相位、相干性、逐边整数模糊度标签、残差点和有效掩膜,可用于训练、验证和测试基于学习及经典算法的解缠方法。

核心特性

  • 可解性认证:每个场景均可证明可恢复——无噪声理想最小费用流(MCF)解缠器在正确逐边代价下可将每块重建至0.035弧度以内(全部10,000个场景均通过,最大清洁理想RMSE=0.0347弧度),确保方法误差归因于算法本身而非不可解目标。
  • L波段特有难度:基于真实数据校准的相干性(Beta分布拟合)、克拉美-罗相位噪声、电离层屏(NISAR模式)以及陡峭的近断层梯度(真实逐边模糊度范围{−2,…,+2})。

数据规模与划分

项目 数值
影像块总数 10,000(256×256)
划分 训练8,000 / 验证1,000 / 测试1,000
观测模式 NISAR(20米,含电离层)、UAVSAR(6米,无电离层)
难度层级 平滑(3,090)/ 混合(4,015)/ 密集(2,895)
标签类型 绝对相位、逐边模糊度(kx, ky)、残差点
地形来源 29个Copernicus GLO-30 DEM瓦片,按整瓦片划分(无地形泄漏)

各模式统计:

传感器 样本数 平均相干性 像元间距 每百万像元残差点(模拟) 每百万像元残差点(真实)
NISAR 5,940 0.57 20米 19,535 18,100
UAVSAR 4,060 0.40 6米 33,948 28,794

文件结构与格式

目录结构包含:

  • sim/:按划分存放HDF5格式数据(每个约0.7 MB)
  • sim_wrapped_png/:对应的缠绕相位快速预览PNG
  • index.jsonl:每个影像块的元数据记录(不含数组)
  • dem_manifest.csv:DEM瓦片到划分的分配表
  • datasheet.md:自动生成的统计与可解性认证

每个.h5文件包含以下数据集:

数据名称 形状 数据类型 描述
psi (256, 256) float32 缠绕相位(网络输入,含噪声),弧度(−π, π]
phi (256, 256) float32 真实绝对(解缠)相位,弧度
coherence (256, 256) float32 干涉相干性,[0, 1]
kx (256, 255) int8 水平逐边整数模糊度,{−2,…,+2}
ky (255, 256) int8 垂直逐边整数模糊度,{−2,…,+2}
residues (255, 255) int8 psi的Goldstein环残差点,{−1, 0, +1}
water_mask (256, 256) bool 无效/无信号像元(评估时排除)

划分策略

训练/验证/测试集按完整DEM瓦片划分:29个Copernicus GLO-30瓦片(全球构造、火山和冰川地形)按17/5/7分配,确保无地形跨划分共享,测试集衡量对未见地理区域的泛化能力。

预期用途

用于训练和评测L波段相位解缠方法——包括深度网络(缠绕计数回归/分类、梯度估计)和经典/最小费用流算法,支持按模式×难度层级进行评估。逐边标签同时支持像素级和边级监督。

参考基准结果

  • 深度网络在此数据上训练良好,优于经典和统计算法(如SNAPHU),尤其在密集/高梯度层。
  • 最小费用流算法族通过构造无残差;在正确逐边代价下,认证的理想上限接近零误差。
  • 基准未饱和:每种可部署方法与理想上限之间仍有差距,且难度梯度真实(平滑→混合→密集误差递增)。

局限性与注意事项

  • 合成真值phi为物理建模生成(地形来自真实Copernicus DEM;相干性、噪声和电离层基于真实NISAR/UAVSAR数据校准),非实地验证的绝对真值,真实场景泛化需另行评估。
  • 仅两种观测模式:传感器特性为NISAR和UAVSAR近似,其他L波段传感器可能存在差异。
  • 无纯去相干场景:所有场景在给定正确代价下均可恢复,基准聚焦代价/先验估计而非不可恢复噪声区域。

来源与许可

  • 地形:Copernicus GLO-30 DEM(© ESA / Copernicus;免费开放,需注明出处)
  • 噪声/相干性/电离层模型:基于真实NISAR L2 GUNW和UAVSAR数据校准
  • 模拟相位、标签和快速预览:本数据集发布

许可证:CC-BY-4.0,可自由使用、分享和改编,需注明出处并保留Copernicus GLO-30 DEM的署名要求。

搜集汇总
数据集介绍
L-Band_DLPU 数据集图片
构建方式
LB-DLPU数据集是一个基于物理模拟的L波段InSAR相位解缠基准,其构建过程精细校准于NISAR星载(20米分辨率)和UAVSAR机载(6米分辨率)两种观测模式。数据集包含10,000个256×256像素的影像块,每个影像块均提供缠绕相位、真实绝对相位、相干性、边缘整周模糊度标签、残差点及有效掩膜。地形源自29个Copernicus GLO-30 DEM瓦片,并按整瓦片划分训练(8,000)、验证(1,000)和测试(1,000)子集,确保无地形泄漏。模拟过程中融入了与真实数据校准的相干性Beta拟合、Cramér–Rao相位噪声、电离层屏(NISAR)以及近断层陡峭梯度,以模拟L波段特有的解缠难度。每个场景均通过无噪声oracle最小费用流(MCF)算法验证其可恢复性,确保所有样本具有良态性认证。
特点
该数据集的核心特色在于其良态性认证和L波段专属难度设计。所有10,000个场景均被证明在给定正确边缘成本下,通过oracle MCF算法可达到0.035弧度以内的重建精度(最大RMSE=0.0347弧度),从而将误差来源明确归因于算法本身而非目标不可解。数据集针对L波段特性进行了校准,包括相干性分布(NISAR平均0.57,UAVSAR平均0.40)、相位噪声模型、电离层扰动(仅NISAR)以及接近断层的高梯度区域,这些区域迫使真实边缘模糊度进入五弧程范围{−2,…,+2}。此外,数据集提供丰富的标签,包括绝对相位、逐边缘整周模糊度(kx, ky)、残差点及水掩膜,支持像素级和边缘级监督学习。其难度分层(平滑、混合、密集)为评估算法在不同地形复杂度下的表现提供了梯度基准。
使用方法
使用LB-DLPU数据集时,用户可通过HDF5文件加载每个影像块,其中`psi`作为网络输入(噪声缠绕相位),`phi`作为目标(真实绝对相位),同时可获取相干性、边缘模糊度标签和残差等辅助信息。数据集附带的`index.jsonl`文件允许快速过滤元数据(如传感器类型、难度层、相干性等),无需打开每个文件。针对不同用途,用户可采用像素级或边缘级监督训练深度学习模型,或评估经典最小费用流等解缠算法。评估指标包括RMSE、MAE、PSNR、SSIM、周期跳变率、残差计数及五弧程边缘准确率。数据集按传感器(NISAR/UAVSAR)和难度层(平滑/混合/密集)提供标准化评估协议,并附带方法盲测的参考基准,便于公平比较。
背景与挑战
背景概述
合成孔径雷达干涉测量(InSAR)相位解缠是获取地表形变与高程信息的关键技术环节,其精度直接制约着地震、火山及冰川等地球动力学研究的定量化水平。然而,传统相位解缠方法在低相干性、高形变梯度及电离层扰动等复杂场景下常面临严重的解缠误差累积问题。2026年,Dagbanja、Qian与Haitao等研究者构建了L-Band_DLPU(LB-DLPU)基准数据集,旨在系统性地推动L波段(NISAR与UAVSAR)InSAR相位解缠算法的研发与评估。该数据集包含10,000个256×256像素的物理模拟影像块,其模拟过程严格校准自真实NISAR与UAVSAR获取参数,涵盖了从平滑到高密度形变梯度的多级难度分层。尤为关键的是,数据集为每个影像块提供了可验证的可解缠性证明,即基于无噪声理想最小费用流(MCF)算法的重构均方根误差不超过0.035弧度,这为客观衡量各类解缠算法的性能提供了坚实且公平的理论基准,对推动InSAR相位解缠领域的规范化发展具有里程碑式意义。
当前挑战
该数据集所应对的核心挑战源于InSAR相位解缠本身固有的病态性与实际观测的复杂性。首先,在领域问题层面,由于缠绕相位在数学上存在多值性,解缠算法极易受相位噪声、去相干效应及欠采样区域的显著影响,导致解缠结果出现整数周跳错位,尤其是在高形变梯度或电离层闪烁的L波段场景下,传统算法往往失效。该数据集通过物理模拟真实L波段观测条件(如相干性Beta分布拟合、克拉美-罗相位噪声及电离层相位屏),并引入五区间整数模糊度标签,旨在精确量化这些物理因素对解缠过程的影响。其次,在数据集构建层面,确保模拟数据具备物理真实性与可解缠性是一项严峻挑战。构建者需精心调配29幅Copernicus GLO-30 DEM地形数据,以在影像块级别实现训练/验证/测试集的地形全不重叠分配,从而杜绝地形泄漏;同时,必须详尽模拟并校准从相位噪声、相干性到电离层效应的全链路物理过程,并将真实卫星或机载数据中观测到的残差点密度等统计特性作为校准目标,最终在10,000个场景中逐一验证其无噪声MCF下限,这一系统性工程对数据生成的保真度与计算可行性提出了双重要求。
常用场景
经典使用场景
在合成孔径雷达干涉测量(InSAR)领域,相位解缠是获取地表形变信息的关键步骤。L-Band_DLPU数据集作为专门针对L波段(NISAR和UAVSAR)的物理仿真基准,为这一经典问题提供了标准化的训练与测试平台。其核心用途在于开发和评估各类相位解缠算法,涵盖基于深度学习的回归、分类方法以及经典的最小费用流(MCF)求解器。数据集精心设计了平滑、混合、密集三种难度分层,并提供了完整的标签体系,包括缠绕相位、真值绝对相位、相干性、逐边整数模糊度及残差点,使得研究人员能够在统一框架下进行算法性能的横向对比与纵向优化,从而有力推动InSAR相位解缠技术的进步。
解决学术问题
该数据集系统性地解决了相位解缠领域长期存在的两大核心难题。其一,现有公开数据集多基于C波段构建,且仅以RMSE作为评价指标,难以捕捉相位解缠中常见的跳变错误,导致算法评估的不全面。L-Band_DLPU通过严谨的良定性证明,确保每个场景在理想条件下均可由MCF解缠器恢复至0.035 rad以内的精度,从而为算法开发提供了可靠的参考上限,使误差分析归因于算法本身而非数据不可解。其二,数据集创新性地引入了L波段特有的电离层相位屏以及陡峭的形变梯度,这些因素导致了多周期(五弧)模糊度的出现,极大地挑战了传统解缠算法的极限,促进了针对高梯度、低相干区域鲁棒性算法的研究,填补了该领域基准数据的空白。
衍生相关工作
该数据集的发布预期将催生一系列围绕L波段相位解缠的衍生研究工作。其开创性的良定性认证机制,为后续基准数据集的构建树立了新的规范,激励研究者从‘可解性’视角设计仿真实验。基于数据集中丰富的逐边模糊度标签,可衍生出基于边或图神经网络的新一代解缠架构,推动深度学习方法在像素级预测之外向更精细的拓扑结构建模演进。此外,数据集对噪声、相干性和电离层效应的精细建模,为发展鲁棒的相位噪声估计、相干性融合以及电离层校正等前处理技术提供了实验场。其配套的标准化评估体系也有望成为领域内公认的算法对比协议,引领一个更为严谨、可复现的研究新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务