遇见数据集

apac-nwp-forecast-raw

收藏
Hugging Face2026-07-13 更新2026-07-14 收录
官方服务:

资源简介:

APAC NWP Forecast原始数据集是一个按模型运行捕获的、不可变的亚太地区数值天气预报(NWP)原始数据集合,采用Parquet格式存储。该数据集属于青铜层原始导出层,保持数据获取时的原始状态,未重构成便于分析的数据立方体。它包含日本气象厅(JMA)的MSM模型和德国气象局(DWD)的ICON模型提供的预报数据,数据组织采用Hive风格分区,路径结构为`data/model=<model>/year=YYYY/month=MM/<run>.parquet`,文件名代表模型运行的初始化时间(UTC)。数据结构为长表格,每一行对应一个特定的地理位置ID和时间点,包含经纬度、海拔坐标、数据来源信息(如运行初始化和抓取时间)以及多种天气变量,例如辐照度、温度、湿度、风、气压、降水、云量等(仅DWD ICON模型包含雪相关变量)。数据点构成完整的规则经纬度网格。数据集基于Open-Meteo.com提供的JMA和DWD开放数据,采用CC BY 4.0许可证。注意:大多数用户更适合使用经过处理、分析就绪的白银层数据集(jimtseng/apac-nwp-forecast),该原始数据集主要用于数据流水线的初始捕获和存档。

The APAC NWP Forecast Raw Dataset is an immutable collection of raw Asia-Pacific numerical weather prediction (NWP) data captured per model run, stored in Parquet format. This dataset belongs to the 'Bronze' tier of the data family, i.e., the raw export layer, where the data remains in its original state at the time of acquisition and has not been restructured into analysis-ready data cubes. The dataset includes forecast data from the Japan Meteorological Agency (JMA) MSM model and the German Weather Service (DWD) ICON model. The data is organized using Hive-style partitioning, with the path structure `data/model=<model>/year=YYYY/month=MM/<run>.parquet`, where the filename represents the initialization time (UTC) of the model run. The data structure is a long-format table, where each row corresponds to a specific geographic location ID and time point, containing latitude and longitude, elevation coordinates, data source information (run initialization and ingestion time), and various weather variables such as irradiance, temperature, humidity, wind, atmospheric pressure, precipitation, cloud cover, etc. (only the DWD ICON model includes snow-related variables). The data points form a complete regular latitude-longitude grid. The dataset is based on open data from JMA and DWD provided by Open-Meteo.com, and is licensed under CC BY 4.0. It is worth noting that most users are better suited to use the processed, analysis-ready 'Silver' tier dataset (jimtseng/apac-nwp-forecast), as this raw dataset is primarily intended for initial capture and archiving of data pipelines.

创建时间:
2026-06-30
原始信息汇总

数据集概述

APAC NWP Forecast — raw per-run parquet (Bronze) 是一个不可变的、按模型运行(per-run)存储的 Parquet 格式数据集,捕获了亚太地区数值天气预报(NWP)的原始数据,包含 JMA MSM 和 DWD ICON 两种模型。该数据集属于同一系列数据集中的 Bronze(青铜) 层,即原始导出层,数据保持提取时的原样,未进行重塑处理。对于需要可直接分析的数据,建议使用同系列的 Silver(白银)层数据集: jimtseng/apac-nwp-forecast(Zarr 格式)。

数据集家族

数据集 格式 角色
jimtseng/apac-nwp-forecast Zarr cube (Mode A) 分析就绪的 Silver 层(推荐使用)
jimtseng/apac-nwp-forecast-raw (本数据集) 按运行存储的 Parquet 文件 Bronze 层 — 不可变的运行级捕获
jimtseng/apac-nwp-forecast-zip 按运行存储的 .zarr.zip 历史冷归档(Bronze 层之前的原始数据)

时间覆盖说明: Bronze 层仅从前向管道开始运行后累积数据。历史运行的数据在旧管道中被丢弃(转换后即删除 Parquet),因此历史原始数据保存在 apac-nwp-forecast-zip 中。Silver 层则同时覆盖历史与新增数据。

数据布局

数据采用 Hive 风格分区,层级结构如下:

data/model=<model>/year=YYYY/month=MM/<run>.parquet

示例: data/model=dwd_icon/year=2026/month=07/20260701T00Z.parquet

  • model:模型名称(如 jma_msmdwd_icon
  • year / month:根据运行初始时间划分的年和月
  • 文件名:模型运行初始化时间(UTC),如 20260701T00Z 表示 2026-07-01 的 00z 运行

数据模式

数据为长表格式,每一行对应一个 (location_id, time) 组合,包含以下列:

  • 位置信息latitudelongitudeelevation
  • 来源信息run_init(运行初始化时间)、scraped_at(抓取时间)
  • 气象变量:辐照度、温度、湿度、风、气压、降水量、云覆盖率,以及仅 dwd_icon 模型包含的雪数据。

数据采用整数量化存储(辐射为 uint16,云覆盖率/湿度为 uint8),以 zstd 压缩。数据点覆盖完整的规则经纬网格。

加载示例

python import pandas as pd from huggingface_hub import hf_hub_download p = hf_hub_download("jimtseng/apac-nwp-forecast-raw", "data/model=dwd_icon/year=2026/month=07/20260701T00Z.parquet", repo_type="dataset") df = pd.read_parquet(p)

许可与归属

  • 许可协议CC BY 4.0
  • 数据来源:由 Open-Meteo.com 提供的天气数据,基于 JMA(MSM)和 DWD(ICON)的开放数据。
  • 要求:在重新分发或展示数据时,请保留上述归属信息。
搜集汇总
数据集介绍
构建方式
本数据集为亚太地区数值天气预报(NWP)的原始逐运行Parquet捕获层(Bronze层),涵盖JMA MSM和DWD ICON两个模型。每个模型运行生成一个独立的Parquet文件,严格按照从API获取的原始状态保存,未经任何重塑或转换。数据采用Hive风格分区,按模型、年份和月份组织,文件名以模型初始化的UTC时间命名。每条记录为长表格式,包含位置标识、时间、经纬度、海拔及多种气象变量,整数变量沿用源数据的量化精度并采用Zstd压缩。
特点
该数据集的核心特点在于其不可变性和原始性。作为数据家族中的Bronze层,它忠实保留了每次模型运行的原始快照,为下游分析提供了可追溯的基准。其分区布局高效,便于按时间和模型进行筛选。数据集包含丰富的变量集,如辐射、温度、湿度、风、气压、降水和云量,其中DWD ICON模型还提供了积雪数据。注意,该层仅积累自前向管道启动后的数据,历史数据需参考同系列的Zarr Silver层或ZIP冷归档。
使用方法
推荐大多数用户直接使用分析就绪的Silver层(jimtseng/apac-nwp-forecast),该层以Zarr格式提供更为便捷的立方体数据。如确实需要原始Parquet文件,可通过Hugging Face Hub下载指定路径的文件,例如使用hf_hub_download函数获取特定模型和运行时间的Parquet文件,随后利用Pandas的read_parquet方法读取。文件路径遵循data/model=<模型>/year=<年份>/month=<月份>/<运行时间>.parquet的格式。使用时需遵守CC BY 4.0许可协议,并保留对Open-Meteo.com及原始数据源JMA和DWD的署名。
背景与挑战
背景概述
在可再生能源领域,特别是太阳能发电中,精确的数值天气预报(NWP)对于功率预测和电网调度至关重要。apac-nwp-forecast-raw数据集由研究人员jimtseng创建,旨在为亚太地区提供高时空分辨率的NWP预报数据,其核心研究问题是处理与分析来自日本气象厅(JMA MSM)和德国气象局(DWD ICON)的原始预报输出。该数据集于2024年发布,作为数据集体系中的青铜层,记录了模型运行的原始帕奎特文件,为后续的分析就绪立方提供了不可变的数据基础。对相关领域而言,该数据集填补了亚太地区高质量、开放获取的NWP数据空白,有助于推动太阳能预测、气象研究和可再生能源整合的技术进步。
当前挑战
该数据集面临的核心挑战是解决领域问题中的原始数据复杂性与可用性之间的矛盾。在NWP预报中,原始输出通常具有大量网格点、不同变量和量化格式,直接用于机器学习或统计分析极为困难,需要将其重塑为分析就绪的立方格式。此外,构建过程中也遭遇了显著挑战,包括从多个异构源(JMA与DWD)捕获数据、处理不同模型运行的时序一致性、维护不可变数据层的历史连续性,以及确保帕奎特格式下的存储效率与可访问性。这些挑战要求构建一套高效的数据管道,以实现从原始抓取到标准化存储的平滑转换。
常用场景
经典使用场景
在亚太地区新能源气象与能源预测研究中,APAC NWP Forecast原始逐次预报数据集扮演了基础数据底座的经典角色。该数据集以不可变的Parquet格式捕获日本JMA MSM与德国DWD ICON两大数值天气预报模型的逐次运行输出,每一文件对应一次模型初始化的网格化预报场。其典型用法在于为后续的数据清洗、格式转换与特征工程提供原始物料——研究者可基于此数据通过时空插值、变量筛选与质量控制,构建面向特定能源站点的气象特征矩阵,是支撑太阳能、风能功率预测模型开发的不可或缺的原材料层级。
实际应用
在工业界,该数据集直接服务于亚太地区光伏电站与风电场的超短期与短期功率预报系统。通过实时接入DWD ICON与JMA MSM的逐时次预报场,新能源运维团队能够将原始辐射、温度、风速等变量输入机器学习回归模型,结合场站历史功率数据进行在线更新与校准。此外,该数据还为电力调度中的多模型集成预报提供底层支撑,使得不同大尺度模式对局地微气象影响的融合成为可能,从而提升电网侧对波动性可再生能源预测的可靠性与鲁棒性。
衍生相关工作
该数据集的衍生产品显著体现在其银层(Silver)分析就绪数据立方体上,该立方体对原始逐次Parquet文件进行了时空重采样与属性规整,形成统一的Zarr格式多维数组,极大便利了端到端的深度学习气象预报后处理工作。基于该数据家族,衍生出如面向太阳能辐照度超分辨率重建的卷积网络训练集、融合多种NWP模式特征的风速时序预测基准库等经典工作。这些后续成果不仅验证了原始数据层在保障数据溯源完整性方面的设计价值,也推升了亚太区域从NWP原始输出到可操作预报模型的整个数据谱系的研究规范。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务