遇见数据集

ArchesClimate-data

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

ArchesClimate-SSP 数据集是 ArchesClimate 模型(gclyne/ArchesClimate)的物理数据配套资源,包含了模型推理时除权重本身之外所需的所有数据:初始条件、强迫轨迹、静态参考场以及归一化统计量。数据集分为三个部分:static/ 目录存放时间不变的网格特定场(如地形),目前提供 IPSL-CM6A-LR 和 CanESM5 原生网格的两个地形文件;scenarios/ 目录按 realization/experiment 组织,每个文件包含来自同一底层 memmap 的初始条件(索引 0)和完整强迫轨迹,当前已发布 ssp434、ssp534-over、ssp585 三个实验(均为 IPSL 网格,r1i1p1f1 实现);stats/ 目录存储归一化统计张量(表面、层、强迫等的均值和标准差),按检查点配置中的归一化方案命名。用户可通过 huggingface-cli 下载整个数据集,并在推理时根据检查点需求引用相应文件。

The ArchesClimate-SSP dataset is a companion physical data resource for the ArchesClimate model (gclyne/ArchesClimate), containing all data required for model inference besides the weights themselves: initial conditions, forcing trajectories, static reference fields, and normalization statistics. The dataset is organized into three parts: the static/ directory holds time-invariant grid-specific fields (e.g., topography), currently providing two topography files for the IPSL-CM6A-LR and CanESM5 native grids; the scenarios/ directory is organized by realization/experiment, with each file containing initial conditions (index 0) and complete forcing trajectories from the same underlying memmap, currently releasing three experiments (ssp434, ssp534-over, ssp585) on the IPSL grid with realization r1i1p1f1; the stats/ directory stores normalization statistics tensors (means and standard deviations for surface, layer, forcing, etc.) named according to the normalization scheme in the checkpoint configuration. Users can download the entire dataset via huggingface-cli and reference the appropriate files during inference based on checkpoint requirements.

创建时间:
2026-08-19
原始信息汇总

ArchesClimate-SSP 数据集概述

数据集基本信息

  • 许可证:MIT
  • 标签:气候、天气预报
  • 用途:作为 gclyne/ArchesClimate 模型权重的物理数据配套,包含推理时除权重外所需的一切数据。

数据内容与结构

数据集几乎完全镜像了代码运行时在 cluster.data_path 下期望的磁盘布局,并非重新打包的格式。主要包含以下目录:

  • scenario_data/:每个情景的完整原始内存映射文件(每个约 15 GB),包含:

    • r1i1p1f1_ssp434_interpolation.memmap/
    • r1i1p1f1_ssp534-over_interpolation.memmap/
    • r1i1p1f1_ssp585_interpolation.memmap/

    每个 .memmap 目录是 tensordict.TensorDict.load_memmap() 格式,包含 meta.json 和按字段划分的 .memmap 文件(surfacelevellevspatial_forcingsnon_spatial_forcingsozonetime),存储真实的 CMIP6 目标轨迹及用于条件化展开的强迫轨迹。

  • reference_data/:包含 IPSL 网格的 orography.pt 文件。

  • reference_data_canesm5_native/:包含 CanESM5 原生网格的 orography.pt 文件。

  • stats/:归一化统计张量({surface,level,lev,spatial_forcings,non_spatial_forcings}_{mean,std}),按检查点 config.yaml 中的 norm_scheme 键控。此目录不属于 data_path 镜像的一部分,运行时从代码仓库的 stats/ 目录加载。

使用说明

  1. 下载数据: bash huggingface-cli download gclyne/ArchesClimate-data --local-dir <data_dir>

  2. 目录链接:由于代码内部原名称 memmap_filled_in 与发布名称 scenario_data/ 不一致,需创建符号链接: bash ln -s "$(realpath <data_dir>/scenario_data)" <data_dir>/memmap_filled_in

  3. 统计文件链接:将需要的归一化统计文件链接到代码仓库的 stats/ 目录: bash ln -s "$(realpath <data_dir>/stats/cmip_stats_new_ozone.pt)" <code_repo>/stats/cmip_stats_new_ozone.pt

  4. 配置数据路径:在代码仓库中设置 configs/cluster/external.yamldata_root:<data_dir>,详细步骤参见代码仓库的 README.md Quickstart。

当前发布数据

  • 情景ssp434ssp534-overssp585
  • 实现:均为 r1i1p1f1,使用 IPSL 网格

相关代码

代码仓库:https://github.com/grahamclyne/ArchesClimate-SSP,其中 INFERENCE.md 提供完整推理配方,README.md 的 Quickstart 提供精确的设置步骤。

搜集汇总
数据集介绍
ArchesClimate-data 数据集图片
构建方式
ArchesClimate-data数据集作为ArchesClimate模型推理阶段的物理数据伴侣,其构建方式紧密贴合代码库的磁盘布局,近乎直接镜像而非重新打包。数据集包含情景数据、参考数据及统计归一化参数三大模块。情景数据以TensorDict内存映射格式存储,涵盖ssp434、ssp534-over及ssp585三种共享社会经济路径的完整CMIP6目标轨迹及驱动轨迹,字段包括地表、层次、空间强迫、非空间强迫、臭氧及时间维度。参考数据提供IPSL及CanESM5天然网格的orography张量。统计模块存储各归一化方案的均值和标准差张量,虽独立于数据路径但在推理时由代码库动态加载。
特点
该数据集的结构高度仿真代码运行时的内部路径,以减少数据加载的额外开销。其设计精髓在于将实际数据目录与代码中的内部命名通过符号链接巧妙衔接,实现数据路径的透明化。情景数据每个实验均为完整的长时间序列,涵盖从驱动到目标的全部必要变量,为模型滚动预测提供了物理一致的输入。归一化统计与模型检查点配置中的方案一一对应,确保了推理过程中数据预处理的一致性。此外,数据集的划分清晰,原始数据与衍生统计分离,便于用户按需取用。
使用方法
使用者可通过HuggingFace CLI直接下载数据至本地目录,并将代码仓库中的data_root配置指向该路径,随后依据README中的快速入门指南完成检查点布置、模型滚动推理及结果可视化。对于数据路径与代码内部命名不一致的问题,需建立符号链接以桥接scenario_data与memmap_filled_in,以及将统计文件链接至代码仓库的stats目录。整个使用流程强调与现有代码库的无缝集成,减少了数据迁移和格式转换的繁琐步骤。
背景与挑战
背景概述
ArchesClimate-data数据集由Graham Clyne等研究人员于近期开发,旨在为ArchesClimate气候预测模型提供完整的推理时数据支持,涵盖多种共享社会经济路径(SSP)情景下的CMIP6气候模拟数据。该数据集与模型权重紧密耦合,通过存储原始情景内存映射文件和标准化统计量,确保模型在推理时能够高效、准确地访问所需的物理数据。作为ArchesClimate项目的重要组成部分,该数据集推动了基于深度学习的气候预报技术发展,为气候科学研究提供了标准化的数据基础设施,对提升中长期气候预测的可靠性和可复现性具有重要影响。
当前挑战
该数据集面临的核心挑战包括:其一,气候预测领域本身对数据的规模、时空分辨率和多情景覆盖要求极高,现有数据仅涵盖部分SSP情景,且需处理大气变量间的复杂耦合关系;其二,数据构建过程中需保持原始CMIP6数据的物理一致性,同时设计高效的存储格式(如内存映射)以支持大规模数据的高吞吐读取,并解决代码库中目录命名的历史遗留问题,确保数据加载的兼容性和易用性;此外,标准化统计量的管理和部署也需精确匹配不同模型配置,以保证推理结果的准确性。
常用场景
经典使用场景
ArchesClimate-data数据集作为ArchesClimate模型的物理数据伴侣,专为气候科学与天气预报领域的深度学习推理而设计。其经典使用场景在于为模型提供除权重之外的全部必要数据支持,包括SSP434、SSP534-over及SSP585三种典型浓度路径下的CMIP6目标轨迹与强迫轨迹。研究人员可依托其直接映射的磁盘布局与标准化统计信息,无缝衔接现有数据加载器,进而高效执行气候情景模拟、多年代际预测及极端事件归因分析等任务,为气候动力学研究提供了坚实的数据基石。
解决学术问题
该数据集直面气候预测研究中长期存在的‘数据-模型’割裂问题,通过提供经过插值与标准化处理的CMIP6高分辨率数据,有效解决了模型训练与推理过程中数据格式不一致、预处理繁琐及统计基准缺失等痛点。其完整的归一化统计量(mean/std)与多情景覆盖,使研究者能够客观评估模型在不同温室气体排放路径下的预测能力,从而推动气候敏感性估计、不确定性量化及模式比较计划(如CMIP6)的深入发展,显著提升了气候模拟研究的可重复性与科学性。
衍生相关工作
该数据集的发布催生了一系列衍生研究,例如基于其多情景数据开发的可解释性气候预测模型、耦合物理约束的混合神经网络架构,以及针对极端温度与降水事件的迁移学习框架。同时,其规范的目录结构与标准化流程也为后续数据集的构建树立了范例,推动了气候领域开放科学实践,衍生出数据可视化工具、在线推理服务及教学科研平台等多项工作,进一步拓展了机器学习在气候科学中的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务