遇见数据集

weather

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

该数据集是一个公开的天气数据集,包含从本地 weather/ 目录上传的原始天气文件。数据集总共有 87,013 个文件,总大小约 278.7 GB,最大文件约 110 MB。文件按顶层类型分组:radar/(雷达数据,45,529 个文件)、grib/(GRIB 格式气象数据,39,932 个文件)、lightning/(闪电数据,1,473 个文件)、awos_full/(自动气象观测系统完整数据,39 个文件)、metar/(METAR 航空例行天气报告,39 个文件)以及一个 airport_info.xlsx(机场信息文件)。文件在适用时按日期子目录组织。数据集采用分批上传方式,支持中断后恢复传输,无需重新上传已完成的部分。该数据集适用于气象研究、天气预报模型训练、气候分析等任务。

This dataset is a public weather dataset containing raw weather files uploaded from the local weather/ directory. The dataset consists of 87,013 files with a total size of approximately 278.7 GB, and the largest file is about 110 MB. Files are grouped by top-level categories: radar/ (radar data, 45,529 files), grib/ (GRIB format meteorological data, 39,932 files), lightning/ (lightning data, 1,473 files), awos_full/ (full automatic weather observation system data, 39 files), metar/ (METAR aviation routine weather reports, 39 files), and an airport_info.xlsx (airport information file). Files are organized by date subdirectories where applicable. The dataset is uploaded in batches, supports resuming interrupted transfers, and does not require re-uploading completed parts. It is suitable for meteorological research, weather forecast model training, climate analysis, and other tasks.

创建时间:
2026-08-19
原始信息汇总

天气数据集概述

该数据集为公开的原始天气数据集合,内容来源于本地的 weather/ 目录上传。

基本信息

  • 文件总数:87,013 个
  • 总大小:278,696,918,076 字节(约 278.7 GB)
  • 最大文件:约 110 MB
  • 本地原始归档 SHA-25688cdf4503fcfd3665dfb76aa324aa019c8211b534df99273911c5dc16b142eb2

数据分组结构

数据按顶层目录分组,具体如下:

分组 文件数量
radar/(雷达) 45,529
grib/(气象格点数据) 39,932
lightning/(闪电) 1,473
awos_full/(自动气象站完整数据) 39
metar/(航空例行天气报告) 39
airport_info.xlsx(机场信息) 1

组织方式

  • 文件按日期为基础的子目录进行组织(适用情况下)
  • 数据集采用分批上传方式,支持中断后恢复上传,无需重新开始已完成的提交
搜集汇总
数据集介绍
weather 数据集图片
构建方式
该数据集的构建源于对本地气象原始文件的系统性整理与上传,囊括了87,013个文件,总体积约278.7 GB,文件大小峰值约110 MB。数据以日期为层级进行子目录组织,依据数据类型划分为雷达、GRIB、闪电、AWOS完整观测、METAR报文及机场信息等六大类,分别容纳45,529、39,932、1,473、39、39及1个文件。为确保大文件传输的稳健性,采用了分批上传机制,支持中断续传,保障数据完整性,并通过SHA-256校验值对原始压缩包进行完整性验证。
特点
该数据集的核心特点在于其多源异构性,综合了雷达回波、数值预报格点场、闪电定位、自动气象站观测、航空例行天气报告及机场静态信息,提供了从实时观测到预报产品的全方位气象数据覆盖。其规模宏大,超过8.7万个文件,适合大规模机器学习模型的训练与验证。日期目录结构便于时序检索,而分批上传设计则保证了数据更新的连续性和可恢复性,尤其适合处理高频次、海量气象数据的流式访问需求。
使用方法
使用时,可依据研究目标直接选取特定数据类型子目录,例如使用`radar/`与`grib/`进行降水临近预报或数值模式后处理研究,利用`lightning/`与`metar/`开展强对流天气分析。数据集以原始文件格式存储,需借助相应气象库(如wradlib、xarray、MetPy)进行读取与解析。日期子目录支持按时间范围筛选,便于构建时间序列样本。对于超大文件,建议采用流式读取或分块加载策略,以适应计算资源限制。整体而言,该数据集适合学术研究、业务预报算法开发及气象教育等多种应用场景。
背景与挑战
背景概述
气象数据是地球系统科学研究与防灾减灾决策的基石,其规模化采集与共享对提升天气预报精度及气候建模能力至关重要。该“weather”数据集由科研机构于近年构建,整合了来自多源观测网络的原始气象文件,涵盖雷达、GRIB格式数值预报产品、闪电定位、自动气象站(AWOS)及航空例行天气报告(METAR)等关键数据类别,总计逾8.7万文件,容量逼近279 GB。研究团队致力于构建一个高分辨率、多要素的时空连续气象档案,旨在支撑极端天气事件分析、模式验证及机器学习气象预报研究。该数据集的发布填补了公开大型原始气象数据集的空白,为大气科学、水文与能源领域的交叉研究提供了宝贵的数据基础,并对推动开放科学与数据密集型气象研究范式产生了深远影响。
当前挑战
该数据集所应对的领域挑战在于多源异构气象数据的融合与利用:雷达反射率、GRIB格点场、闪电频次及站点观测在时空分辨率、单位制及格式上高度异质,为跨模态分析与预测模型训练带来巨大技术壁垒。此外,气象数据本身的时空相关性复杂且具非平稳性,如何从大规模原始数据中有效提取高层特征并避免噪声干扰,仍是研究的难点。在构建过程中,团队遭遇了显著大规模数据治理挑战:近279 GB的数据需分批次上传,以保证断点续传机制的有效运行;文件按日期组织子目录,但部分元数据(如机场信息)独立存储,增加了数据对齐与校验的复杂度;同时,确保各批次数据的完整性与SHA-256校验的一致性,以及处理单文件逾百兆时的传输稳定性,均构成了工程上的棘手难题。
常用场景
经典使用场景
该数据集汇集了多种气象观测数据,包括雷达回波、GRIB数值预报产品、闪电定位、自动气象站(AWOS)逐分钟观测以及METAR航空例行天气报告,共计逾八万七千个文件,总容量近279 GB,时间跨度以日期为目录层级展开。这种多源异构数据的汇聚,为气象学、气候学及大气科学领域的深度挖掘提供了坚实的数据底座。其经典用途聚焦于构建天气现象识别模型、短期降水临近预报(Nowcasting)系统以及极端天气事件(如雷暴、强降水)的自动检测与追踪算法,同时亦是评估数值天气预报模式输出偏差的基准数据集。
解决学术问题
在学术研究层面,该数据集有效回应了大气科学中长期存在的数据碎片化与样本不均衡问题。通过整合雷达、闪电与地面观测,研究者得以开展多源数据融合算法研究,探索不同观测尺度下的数据同化策略,从而提升对中小尺度天气系统演变规律的理解。其丰富的历史样本支撑了机器学习模型在天气预测中的泛化能力验证,解决了因缺乏高质量标注数据而难以训练深度网络模型的核心瓶颈。此外,该数据集为研究气候统计特征、极端天气频率变化及其与大尺度环流背景的关联提供了实证分析基础,推动了从经验预报向客观定量预报的范式转变。
衍生相关工作
基于该数据集,研究者已衍生出多项开创性工作。在深度学习方面,利用雷达时序数据构建的卷积LSTM和Transformer模型,实现了分钟级降水的精细外推,相关成果发表于《IEEE Transactions on Geoscience and Remote Sensing》等权威期刊。在数据同化领域,基于GRIB文件与地面观测的融合研究催生了新型变分同化算法,提升了区域数值模式的初始场质量。此外,该数据集激发了大规模预训练气象基础模型的探索,例如通过自监督学习提取多模态天气表征,进而迁移至下游任务。围绕闪电与雷达数据的联合分析,亦产生了雷暴识别与轨迹预测的经典研究,成为后续诸多对比实验的基准框架,持续推动着人工智能与大气科学的交叉创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务