遇见数据集

OceanVariableReconstruction

收藏
Hugging Face2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

DepthDif数据集是一个专为海洋学机器学习模型训练设计的综合数据集包,旨在提供模型就绪的输入-目标对,用于海洋变量(如温度、盐度)的重建、插值或数据同化任务。数据集包含两部分核心内容:一是基于GLORYS 0.1度全球网格的GeoTIFF栅格产品,涵盖1283个周目标日期(2000-01-01至2024-07-26),包括深度分辨的GLORYS变量(50个深度层的位温和盐度)和多个表面产品(如OSTIA分析海表温度、绝对动态地形、海表盐度、海表密度),所有像素编码为uint8格式;二是对齐的ARGO剖面数据,以Zarr格式存储,包括紧凑的网格索引存储和完整的富集剖面级并置数据集,其中包含采样的GLORYS、OSTIA、海平面和海表盐度上下文。数据集还提供了完整的PyTorch数据加载器,支持创建空间补丁、基于陆地比例过滤、使用合成稀疏观测、选择不同表面上下文变量等功能。默认样本包括稀疏ARGO温度输入、密集GLORYS温度目标、密集表面上下文、有效性掩码、海洋陆地掩码、目标日期和坐标信息,并可选择包含盐度变量。数据集规模庞大,包含约948.6万个富集ARGO剖面和约945.2万个紧凑网格索引ARGO剖面,覆盖全球海洋区域,遵循CC BY 4.0许可,但要求用户遵守上游数据源(EN4/ARGO, GLORYS, OSTIA, 海平面, 海表盐度产品)的引用规定。

The DepthDif dataset is a comprehensive dataset package designed for training oceanography machine learning models, aiming to provide model-ready input-target pairs for tasks such as reconstruction, interpolation, or data assimilation of ocean variables like temperature and salinity. The dataset consists of two core components: first, GeoTIFF raster products based on the GLORYS 0.1-degree global grid, covering 1283 weekly target dates from 2000-01-01 to 2024-07-26, including depth-resolved GLORYS variables (potential temperature thetao and salinity so across 50 depth layers) and multiple surface products (such as OSTIA analyzed sea surface temperature, absolute dynamic topography, sea surface salinity, and sea surface density), with all pixels encoded in uint8 format; second, aligned ARGO profile data stored in Zarr format, including a compact grid-index storage for use with raster data and a complete enriched profile-level collocated dataset containing sampled GLORYS, OSTIA, sea level, and sea surface salinity contexts. The dataset also provides a complete PyTorch data loader that supports functions like creating spatial patches (with customizable patch sizes and overlap strides), filtering based on land proportion, using synthetic sparse observations, and selecting different surface context variables (e.g., sea surface salinity instead of sea surface temperature). Default samples include sparse ARGO temperature inputs, dense GLORYS temperature targets, dense surface context, validity masks, ocean-land masks, target dates, and coordinate information, with the option to include salinity variables. The dataset is large-scale, containing approximately 9.486 million enriched ARGO profiles and about 9.452 million compact grid-indexed ARGO profiles, covering global ocean regions. It is licensed under CC BY 4.0 but requires users to comply with citation rules for upstream data sources (EN4/ARGO, GLORYS, OSTIA, sea level, sea surface salinity products).

创建时间:
2026-05-21
原始信息汇总

数据集概述

DepthDif GeoTIFF Raster and Aligned ARGO Dataset 是一个为模型训练准备的地理空间数据集,包含对齐的 GeoTIFF 栅格存储和 ARGO 剖面数据。

数据构成

栅格产品

所有 GeoTIFF 栅格基于 GLORYS 0.1 度全球网格(EPSG:4326,3600 x 1800 像素),覆盖 2000年1月1日至2024年7月26日,共 1283 个周目标日期。文件名格式为<变量名>_YYYYMMDD.tif

  • GLORYS 变量(50 波段深度分辨 GeoTIFF):
    • thetao:位温(开尔文)
    • so:盐度(PSU)
  • 表面产品(单波段 GeoTIFF,7 天滑动平均):
    • analysed_sst:OSTIA 海面温度(开尔文)
    • adt:绝对动力地形(米)
    • sos:海面盐度(PSU)
    • dos:海面密度(kg/m³)

栅格像素存储为 uint8255 表示无数据,有效值 0..254 通过 manifest.yaml 中的拉伸范围线性解码。

ARGO 数据

提供两种 Zarr 存储:

  • argo/argo_profiles_on_grid.zarr:紧凑型网格索引存储,配合 GeoTIFF 栅格使用。
  • data/argo_glors_ostia_ssh.zarr:完整富集剖面级存储,包含 GLORYS、OSTIA、海平面和海面盐度上下文。

索引文件

  • profiles.parquet:ARGO 剖面索引
  • variables.parquet:变量索引

覆盖范围

  • 栅格目标日期:2000-01-01 至 2024-07-26(每个产品 1283 个日期)
  • 富集 ARGO 剖面:9,485,977 个(日期范围 2000-01-01 至 2024-07-31)
  • 紧凑网格索引 ARGO 剖面:9,451,644 个
  • GLORYS 深度层:50 层

PyTorch 数据集和数据加载器

数据集包含独立的加载器包 depthdif_dataset/,基于固定 0.1 度 GLORYS 网格构建方形图块。

默认图块尺寸 tile_size=128,覆盖 12.8 x 12.8 度区域,包含 50 个深度带。patch_stride 控制图块重叠:

  • 128:无重叠全局图块
  • 96:32 像素重叠(3.2 度)
  • 32:96 像素重叠(9.6 度)

max_land_fraction 过滤陆地比例过高的图块(默认 0.30)。

样本字典

默认返回的归一化张量:

  • x:稀疏 ARGO 温度输入(50 x 图块大小 x 图块大小)
  • y:密集 GLORYS 温度目标(50 x 图块大小 x 图块大小)
  • eo:密集表面上下文(1 x 图块大小 x 图块大小)
  • x_valid_mask / y_valid_mask:布尔温度掩码
  • x_valid_mask_1d:深度折叠稀疏输入支持掩码
  • land_mask:海洋/支持掩码(1 x 图块大小 x 图块大小)
  • date:目标日期(YYYYMMDD)
  • coords:图块中心经纬度(需设置 return_coords=True
  • info:图块/日期元数据(需设置 return_info=True

设置 include_salinity=True 可增加盐度相关张量。支持使用海面盐度替代 OSTIA SST 作为表面上下文,以及使用合成稀疏观测替代真实 ARGO 剖面。

许可证

数据集采用 CC BY 4.0 许可。上游产品(EN4/ARGO、GLORYS、OSTIA、海平面、海面盐度)的许可和引用要求依然适用。

搜集汇总
数据集介绍
OceanVariableReconstruction 数据集图片
构建方式
OceanVariableReconstruction数据集基于GLORYS 0.1度全球网格构建,整合了多种海洋遥感与再分析产品。核心构建流程包括:将ARGO浮标剖面投影至固定的50层GLORYS深度轴后进行空间栅格化,生成紧凑的网格索引Zarr存储;同时将GLORYS温盐场、OSTIA海表温度、绝对动态地形及海表盐度等产品输出为uint8编码的GeoTIFF栅格,并以1283个周目标日期对齐。最终通过预设的补丁采样策略(如128×128像素)在栅格上生成训练样本,并利用manifest.yaml记录线性解码参数。
特点
该数据集的显著特点在于其多尺度对齐与紧凑存储设计。GLORYS温盐变量以50波段深度分辨GeoTIFF呈现,而海表变量则以单波段形式提供,所有栅格均采用uint8编码并保留255作为无效值,有效支持线性解码。ARGO剖面数据经深度对齐后形成网格索引Zarr,与栅格数据集无缝配合。此外,数据集还提供完整的剖面级Zarr存储(含GLORYS、OSTIA等上下文信息),并预置Parquet索引用于快速过滤。PyTorch数据加载器支持补丁重叠配置、陆地比例过滤及盐度扩展,灵活适配不同训练需求。
使用方法
用户可通过depthdif_dataset模块直接调用PyTorch数据加载器。典型用法包括:指定geotiff_root_dir加载栅格目录,设置tile_size与patch_stride控制补丁大小与重叠度,利用max_land_fraction筛选海洋像素占比。数据加载器返回归一化张量,包含稀疏ARGO温度输入、密集GLORYS温度目标、海表上下文及掩码,可通过include_salinity参数扩展盐度变量。建议使用时间维度的验证划分(如val_year=2018)避免补丁重叠导致的数据泄露,同时利用metadata_cache_dir缓存索引以提升重复加载效率。
背景与挑战
背景概述
OceanVariableReconstruction数据集由Simon Donike等研究人员于近期创建,旨在解决海洋学领域中关键变量(如温度、盐度)的稀疏观测与高分辨率重建问题。该数据集融合了ARGO浮标剖面数据、GLORYS再分析产品、OSTIA海表温度、海面高度及海表盐度等多源数据,通过严格的时间与空间对齐,生成了覆盖2000年至2024年全球0.1度网格的量化GeoTIFF栅格与配套的ARGO训练存储。其核心研究问题在于如何利用深度学习高效重构海洋三维场,为海洋环流、气候预测及生态系统建模提供基准数据。该数据集的发布为海洋遥感与人工智能交叉领域注入了新动力,推动了从稀疏观测到密集场重建的方法论进步。
当前挑战
该数据集面临的核心领域挑战是海洋观测数据固有的稀疏性与异质性:ARGO浮标在全球大洋中的空间覆盖不均匀,且时间采样离散,难以直接用于连续场建模。此外,深层海洋的垂直结构复杂,不同深度层间的物理关联性强,对重建算法的泛化能力提出高要求。在构建过程中,技术挑战集中于多源产品的协同对齐:需将ARGO剖面投影至GLORYS的固定50层深度轴,并统一时间窗口(7天均值)与空间分辨率(0.1度)。同时,海陆掩膜过滤、重叠采样策略的设计,以及将连续物理量量化为uint8格式时的精度损失与动态范围标定,均是保障数据集实用性的关键难题。
常用场景
经典使用场景
OceanVariableReconstruction数据集的核心用途在于支撑海洋次表层变量的空间重构与深度推测任务。它巧妙地将稀疏的ARGO剖面观测与高分辨率的GLORYS再分析产品、OSTIA海表温度、海面高度及海表盐度等多源遥感数据进行协同配准,构建了全球0.1度网格上的密集训练样本。研究者可借助该数据集训练深度学习模型,以从稀疏的ARGO剖面推断出完整的海洋三维温盐场,填补观测空白,实现从离散点到连续场的跨越。其预制的PyTorch数据加载器支持灵活的时空切片与块状采样,为海洋物理信息驱动的神经隐式表达或U-Net结构模型提供了标准化的训练范式。
解决学术问题
该数据集针对海洋观测资料时空分布不均与再分析产品同化偏差这一核心学术困境,提供了全球尺度上对齐且可量化的样本库。它解决了因ARGO浮标分布稀疏导致次表层重构模型训练数据匮乏的瓶颈,以及不同来源物理场在分辨率、投影与时间窗口上的异构性难题。通过将GLORYS再分析场作为标签,ARGO观测作为输入,辅以海表遥感变量作为环境上下文,数据集首次在大范围、长时序基准上实现了稀疏—密集映射任务的规范化评测。其深远意义在于为数据驱动的海洋动力过程模拟提供了可复现的公共基准,推动了物理约束与深度学习融合的研究发展。
衍生相关工作
该数据集直接催生了多个上游预训练与下游精调研究。其共生项目OceanTACO从保留原始产品物理表示的视角出发,提供了互补的全球海洋栅格数据。基于本数据集的DepthDif框架已衍生出针对大西洋与太平洋区域的分支预训练版本,以及与物理守恒定律耦合的物理信息神经网络(PINN)扩展研究。研究者利用其提供的合成稀疏采样模式接口,开展了观测网络优化的工作,评测在固定浮标数量下如何通过自适应布放提升重构精度。在学术界,它启发了将海面遥感信息与稀疏垂向剖面进行跨模态注意力融合的架构设计,成为机器学习驱动物理海洋学基准实验的重要构成。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务