遇见数据集

apac-nwp-forecast-archive

收藏
Hugging Face2026-06-14 更新2026-06-15 收录
官方服务:

资源简介:

APAC NWP预报存档是一个专门为亚太地区(覆盖日本、台湾、东南亚、澳大利亚及周边陆地,纬度范围-44至46,经度范围92至154)构建的数值天气预报(NWP)历史预报数据集。该数据集旨在支持太阳能应用,其变量选择侧重于辐照度、温度、云量等相关气象要素,且仅包含陆地网格点数据。数据来源于Open-Meteo开放数据平台,并利用其开源工具链进行导出和归档。数据集以每6小时一次的频率,存档来自多个全球和区域天气模型的预报数据,形成了按模型运行初始时间和预报时效组织的完整历史预报记录。这种结构特别适用于需要历史预报数据进行训练和评估的机器学习任务,例如天气预报修正、多模型融合以及太阳能发电预测等,这些信息无法从再分析数据中重建。数据集包含以下主要天气模型:德国气象局(DWD)的ICON模型(分辨率约11公里)、美国国家海洋和大气管理局(NOAA)的GFS模型(分辨率约13公里)、日本气象厅(JMA)的MSM区域模型(分辨率约5公里)以及欧洲中期天气预报中心(ECMWF)的IFS模型(分辨率约25公里)。各模型的运行频率、存储的预报时效(从3天到15天不等)和辐射变量的计算方式(原生值或通过分离模型估算)有所不同。数据以Parquet文件格式存储,采用Hive风格的分区结构(按模型、年份、月份组织),便于高效查询。文件名对应模型运行的初始化时间(UTC)。数据模式中,每一行数据代表一个预报小时内一个陆地网格点的状态。核心字段包括:网格点索引、经纬度坐标、高程、预报有效时间、多种太阳辐射变量(总水平辐照度GHI、直接水平辐照度、漫射辐照度、直接法向辐照度DNI)、2米气温、2米相对湿度、10米风速、地表气压、小时降水量、各层云量百分比,以及模型运行初始化时间和数据抓取时间等元数据。辐射、湿度和云量等字段以整数形式存储以反映源数据的量化精度,而温度、风等字段则保留为浮点数。数据为原始网格值,未进行基于坐标的高程降尺度处理。

The APAC NWP Forecast Archive is a numerical weather prediction (NWP) historical forecast dataset specifically built for the Asia-Pacific region (covering Japan, Taiwan, Southeast Asia, Australia, and surrounding land areas, with latitude range -44 to 46 and longitude range 92 to 154). This dataset is designed to support solar energy applications, with variable selection focusing on meteorological elements such as irradiance, temperature, cloud cover, and includes only land grid point data. The data is sourced from the Open-Meteo open data platform and exported and archived using its open-source toolchain. The dataset archives forecast data from multiple global and regional weather models at a frequency of every 6 hours, forming a complete historical forecast record organized by model run initialization time and forecast lead time. This structure is particularly suitable for machine learning tasks that require historical forecast data for training and evaluation, such as weather forecast correction, multi-model fusion, and solar power generation prediction, which cannot be reconstructed from reanalysis data. The dataset includes the following main weather models: the German Meteorological Service (DWD) ICON model (resolution approximately 11 km), the U.S. National Oceanic and Atmospheric Administration (NOAA) GFS model (resolution approximately 13 km), the Japan Meteorological Agency (JMA) MSM regional model (resolution approximately 5 km), and the European Centre for Medium-Range Weather Forecasts (ECMWF) IFS model (resolution approximately 25 km). The models differ in run frequency, stored forecast lead times (ranging from 3 to 15 days), and the calculation method for radiation variables (native values or estimated via separate models). The data is stored in Parquet file format with a Hive-style partitioning structure (organized by model, year, month) to facilitate efficient querying. File names correspond to the model run initialization time (UTC). In the data schema, each row represents the state of a land grid point for one forecast hour. Core fields include: grid point index, latitude and longitude coordinates, elevation, forecast valid time, various solar radiation variables (global horizontal irradiance GHI, direct horizontal irradiance, diffuse irradiance, direct normal irradiance DNI), 2-meter air temperature, 2-meter relative humidity, 10-meter wind speed, surface pressure, hourly precipitation, cloud cover percentages at different layers, and metadata such as model run initialization time and data fetch time. Fields for radiation, humidity, and cloud cover are stored as integers to reflect the quantization precision of the source data, while fields for temperature and wind are retained as floating-point numbers. The data consists of raw grid values without elevation downscaling based on coordinates.

创建时间:
2026-06-12
原始信息汇总

数据集概述

APAC NWP Forecast Archive 是一个面向亚太区域的数值天气预报(NWP)历史归档数据集,专为太阳能应用场景设计。

核心特征

  • 覆盖范围:亚太区域(纬度 −44° 至 46°,经度 92° 至 154°),覆盖日本、台湾、东南亚、澳大利亚及周边陆地,仅包含陆地网格点。
  • 时间分辨率:每小时一次预报,每6小时归档一次(不同模型存在差异)。
  • 数据来源:基于 Open-Meteo 平台的开源数据分发,使用其工具链导出。
  • 数据格式:Parquet 文件,按 Hive 风格分区存储(model/year/month)。

包含的预报模型

模型名称 提供方 空间分辨率 每日运行次数 存储预报时长 辐射数据来源
dwd_icon 德国气象局 (DWD) 0.125°(约11公里) 4次 7天 原生直接辐射和散射辐射
ncep_gfs013 美国国家海洋和大气管理局 (NOAA) ~0.117°(约13公里) 4次 7天 散射辐射原生,直接辐射通过总辐射减散射辐射计算
jma_msm 日本气象厅 (JMA) 0.0625°×0.05°(约5公里) 8次 3天(按运行次变化) 总辐射原生;直接/散射通过分离模型计算
ecmwf_ifs025 欧洲中期天气预报中心 (ECMWF) 0.25°(约25公里) 4次 15天(3小时间隔) 总辐射原生;直接/散射通过分离模型计算

特别说明ecmwf_aifs025_single 模型已于2026年6月13日停止归档(保留已有文件)。JMA MSM 和 APAC 区域 ICON 预报无公开等价替代。

数据字段结构

每个文件代表一个模型的一次初始运行,每行对应一个陆地网格点在一个预报时刻的值。

字段名称 类型 描述
location_id int32 网格点在模型网格中的索引
latitude, longitude float32 网格点坐标(度)
elevation float32 网格点海拔(米)
time timestamp (UTC) 预报有效时间
shortwave_radiation_wattPerSquareMetre uint16 太阳总辐射(GHI),前一小时反向平均
direct_radiation_wattPerSquareMetre uint16 直接水平辐射
diffuse_radiation_wattPerSquareMetre uint16 散射辐射
direct_normal_irradiance_wattPerSquareMetre uint16 直接法向辐照度(DNI,太阳高度角<5°时不稳定)
temperature_2m_celsius float32 2米空气温度
relative_humidity_2m_percentage uint8 2米相对湿度
wind_speed_10m_metrePerSecond float32 10米风速
surface_pressure_hectopascal float32 地表气压
precipitation_millimetre float32 小时降水量
cloud_cover_percentage (+ _low/_mid/_high) uint8 云量(总云量、低云、中云、高云)
run_init, scraped_at timestamp (UTC) 模型初始运行时间 / 管道抓取时间(溯源)

存储结构与文件命名

  • 目录布局data/model={model_name}/year={yyyy}/month={mm}/{yyyymmddTHH}Z.parquet
  • 文件名:模型初始运行时间(UTC),如 20260612T00Z.parquet 表示2026年6月12日00Z的运行。
  • 文件覆盖:同一运行若被多次抓取,新文件覆盖旧文件。
  • 时间过滤:仅存储 time >= run_init 的数据,因此所有记录的 lead_time >= 0。部分文件可能从预报开始后数小时开始(如最小领先时间为3小时)。

注意事项

  • 超过模型原生小时分辨率(如ICON >78小时、GFS >120小时)的预报值,Open-Meteo 使用太阳几何感知的晴空指数法(辐射)或 Hermite 插值(其他变量)从3小时间隔插值得到。日总量可靠,但该区间内次3小时云量变化被平滑。
  • jma_msm 的预报时长交替变化(00/12 UTC运行:78小时;其他运行:39小时),文件尾部会出现变长的 NaN 序列。
  • NaN 尾部出现在请求窗口超过可用预报时长的情况,丢弃 NaN 行可得到干净数据。
  • ECMWF 数据集时间步长较粗(3小时/6小时),其他模型为小时级。AIFS 为数据驱动(AI)模型,中长期趋势预测能力强,但场分布较物理模型平滑。
  • jma_msm 存在混合运行现象:文件标签为 T03Z 可能包含03Z运行的短期预报和上一次00/12 UTC主运行的远期预报。
  • 2026年6月12日12 UTC之前上传的文件所有字段均为 float32(后期为整数量化)。

使用建议

  • 单文件读取:使用 pandas.read_parquet() 配合 hf:// 路径。
  • 批量筛选过滤:使用 DuckDB 或 PyArrow 通过通配符路径读取,并利用分区列(modelyearmonth)及坐标条件进行过滤。

许可与引用

  • 数据许可CC BY 4.0
  • 来源归属:需保留 Open-Meteo.com 的归属声明,数据基于 DWD(ICON)、NOAA(GFS)和 JMA(MSM)的开放数据。
搜集汇总
数据集介绍
apac-nwp-forecast-archive 数据集图片
构建方式
该数据集以亚太地区为地理范畴,系统收集了多个数值天气预报模型的逐时预报结果。数据源自由Open-Meteo平台提供的开放数据分发体系,并通过其开源工具链进行导出与封装。数据集按照模型名称、年份和月份进行Hive风格的分区存储,每个文件代表某一模型在特定初始化时刻的运行记录,形成以初始化时间和预报步长为维度的历史预报档案。文件中仅保留陆地格点数据,并基于模型对陆地占比的判定阈值筛选,确保数据纯净且适用于太阳能相关分析。
特点
数据集跨越了多种主流气象模型,包括DWD的ICON、NOAA的GFS、JMA的MSM以及ECMWF的IFS和AIFS,覆盖从全球尺度到区域高分辨率的预报能力。其特色在于精选了与太阳能应用密切相关的变量,如多种辐射组分、温度、云量和气压等。特别值得注意的是,对于超出模型原生逐时范围的预报步长,数据采用太阳几何感知的清晰度指数方法对辐射量进行插值,保证了日总量的可靠性。同时,数据集还清晰标注了不同模型在预报时长和时空分辨率上的差异,为使用者提供了透明的数据谱系。
使用方法
使用者可通过Python的pandas库直接读取Parquet格式文件,或借助duckdb等高性能引擎对大规模分区数据进行流式过滤与查询。由于数据集遵循Hive分区命名规则,星号通配符可高效实现按模型、时间或地理范围的数据筛选。建议在处理包含缺失值的预报步长尾部时,去除包含NaN的行以确保数据完整性。此外,对于JMA MSM模型,需注意其因交替运行而产生的不同预报时长特性,以及在读取时应理解其混合不同运行时段的文件结构。
背景与挑战
背景概述
亚太地区数值天气预报(NWP)预报档案(APAC NWP Forecast Archive)是一个面向太阳能应用的高时间分辨率气象数据集,由Open-Meteo平台基于公开气象数据构建,创建于2026年。该数据集整合了来自德国气象局(DWD)的ICON、美国国家海洋和大气管理局(NOAA)的GFS、日本气象厅(JMA)的MSM以及欧洲中期天气预报中心(ECMWF)的IFS和AIFS等多个全球与区域数值模型,覆盖亚太地区(纬度-44°至46°,经度92°至154°),包括日本、台湾、东南亚、澳大利亚及周边陆地。核心研究问题在于为太阳能预测及机器学习驱动的预报后处理提供丰富的历史NWP初始时间与预测时长的配对记录,这一特性使其在模型校正与融合研究中具有不可替代的价值。该数据集在太阳能相关变量(如辐射、温度、云量)的精细化选择与高频存档方面填补了现有公开气象数据集的空白,成为气象数据驱动与物理模型结合研究的关键基础资源。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两个层面。在领域问题方面,数值天气预报固有的分辨率限制与物理参数化方案导致太阳能相关变量(尤其是直接辐射与散射辐射)存在系统性偏差,不同模型的时空分辨率与预测时长不一致(如JMA MSM的交替预测时长与ECMWF的3小时步长),给多模型融合与机器学习校正带来数据对齐与特征工程上的困难。在构建过程中,数据来源的异构性与质量控制成为关键难题:不同模型的地面网格点定义(如陆海判断基于模型陆面分数掩膜)、原始数据量化精度差异(部分变量为整型存储,部分为浮点型)、以及JMA MSM数据源中短时运行与主运行预测场混合导致的起始时间非对齐,均对数据的一致性提出要求。此外,早期训练任务的数据版本控制(如浮点型与整型格式更迭)与跨模型辐射反演方法的差异(如直接辐射为原生输出或通过分离模型推导)也增加了数据集的使用壁垒。
常用场景
经典使用场景
APAC NWP Forecast Archive数据集专为亚太地区的太阳能应用精心构建,其经典使用场景聚焦于基于数值天气预报(NWP)的太阳辐照度预测与模型校正。该数据集汇集了来自多个全球及区域气象模型(如DWD ICON、NCEP GFS、JMA MSM、ECMWF IFS)的逐小时预报数据,涵盖全球水平辐照度(GHI)、直接辐射、散射辐射及直接法向辐照度(DNI)等关键变量,并结合温度、云量、湿度等辅助气象要素。研究者可通过该数据集,基于历史预报与实测辐照度的对比,训练统计或机器学习模型以校正NWP系统性偏差,或利用多模型集成方法进行预报融合,从而提升光伏电站功率预测的精度与鲁棒性。
解决学术问题
该数据集的核心学术贡献在于解决了多模式NWP预报偏差校正与融合中的关键数据缺失问题。传统再分析数据仅提供已发生的“最佳估计”状态,而无法反映预报时刻的初始场不确定性随预报时效的演化特征,导致基于再分析的偏差校正方法难以推广至实时预报场景。APAC NWP Forecast Archive通过保留每6小时滚动更新的预报初始时间与超前时间结构,使得研究者得以系统量化不同模型在不同预报时效、不同天气类型下的系统偏差与随机误差特征。基于此,学术界可深入探索物理过程参数化误差与统计修正策略之间的内在关联,推动可解释人工智能与物理引导的深度学习模型在气象-能源交叉领域的发展。
衍生相关工作
基于该数据集已衍生了若干具有影响力的经典工作。在模型校正方面,研究者利用多模型初始场-超前时间二维结构,发展了基于时序卷积网络的多尺度偏差消除框架,实现了从中期(15天)到短临(3小时)的统一预报订正。在预报融合领域,相关论文提出了基于竞争学习与注意力机制的多源NWP自动加权策略,显著提升了多云环境下的辐射预测稳定性。此外,JMA MSM独特的高时空分辨率特性(0.0625°×0.05°,约5公里、3天预报时效)催生了针对台风季光伏出力骤降事件的智能预警研究,而ECMWF AIFS纯数据驱动模型作为对照,则推动了物理模型与AI模型不确定性对比分析的方法论探索。这些工作共同推动了亚太区域天气-能源耦合建模的边界扩展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务