1980-2019年中国PM2.5浓度数据集
收藏资源简介:
我国全国统一标准化地面PM2.5人工监测自2014年起全面铺开,2014年之前缺少长时序、高精度的连续地面观测序列,极大制约了空气污染气候效应、区域污染演变、人为排放与气候协同作用等方向的长期机理研究。现有历史污染替代数据存在明显短板:基于能见度、相对湿度反演得到的霾日人工观测数据人为误差偏大;卫星AOD、气溶胶指数产品的连续有效时序普遍不足30年,且受云覆盖、地表反射干扰存在系统性反演偏差;传统单一再分析气溶胶产品缺乏地面观测约束,模拟精度有限,难以支撑空气质量延伸期气候预测、长期健康暴露评估等精细化研究。行业长期缺少一套兼顾长时间跨度、全域空间覆盖、多因子物理约束、高模拟精度的网格化PM2.5历史同化数据集,为此本研究融合多源观测与再分析资料,采用多机器学习算法构建区域分层重建模型,生成了1980–2019年长时序中国大陆PM2.5网格化数据集,填补了工业化关键阶段细颗粒物连续观测数据的空白。 (一)建模数据源。 地面真值观测:2013–2018年全国主要城市国控站点PM₂.₅日监测数据,来自中国环境监测总站官方观测资料,作为模型训练、校验的基准; 气象约束数据:ERA5全球逐小时气象再分析要素,提供温度、湿度、边界层高度、风场等光化学与扩散控制因子; 气溶胶背景场:MERRA-2再分析PM₂.₅格点产品、气溶胶光学厚度AOD序列,表征区域气溶胶本底与排放的时空变化特征; 静态辅助因子:植被覆盖NDVI、人口空间分布栅格,刻画下垫面与人为排放的空间分异规律。 (二)重建技术流程。 整合多元线性回归、梯度提升、深度学习等多类机器学习算法,分城市独立构建PM₂.₅浓度时序重建模型;采用十折交叉验证(10-CV)完成多方案精度对比,筛选各城市最优模型参数,形成区域分层重建体系,最终插值生成统一的0.5°×0.5°网格化PM₂.₅长时序数据集。 (三)核心性能指标。 经多维度交叉验证、站点独立样本比对,本套1980–2019年网格化PM₂.₅数据集的整体模拟精度优于国内外同期同类长时序气溶胶重建产品,对时序趋势、空间分异、重污染过程的模拟一致性更高,可稳定支撑气候尺度、年际尺度的污染定量分析。 (四)数据集核心应用适配方向。 空气污染气候预测、延伸期预报建模的基础基准数据;PM₂.₅污染与气候变化相互作用机理、区域污染溯源的长期研究;大气细颗粒物人群健康暴露风险、农作物损失的定量评估;空气质量中长期预报模型训练、参数校正的支撑数据集。 (五)数据结构与基础参数。 存储格式:标准NetCDF(NC)栅格格式,符合气象、环境领域通用数据读写规范; 时间覆盖范围:1980年1月1日 —2019年12月31日; 空间覆盖范围:纬度10°N~60°N,经度70°E~135°E,完整覆盖中国大陆全域; 空间分辨率:0.5°×0.5°经纬度网格; 文件划分:共3套独立NC文件,分别存储PM₂.₅日均浓度、月均浓度、年均浓度三维时序格点场,变量单位统一为μg/m³,文件内置缺失值标识与完整的时空维度元信息。




