NOAA Global Historical Climatology Network Daily (GHCN-D)|气候数据数据集|历史气候数据集
收藏数据集描述
NOAA全球历史气候网络每日数据(GHCN-D)
- 来源:NOAA
- 内容:包含全球陆地区域的每日观测数据(如TMAX, SNOW等)
- 更新频率:每日更新
- 数据格式:CSV
- 数据范围:从1763年至今
- 文件结构:每个文件对应一年,包含该年所有站点的所有天气观测数据
- 附加信息:站点和国家的详细信息(包括地理位置)存储在单独的文件中
数据集处理目标
- 开发数据基础设施,包括数据管道和仪表板
- 创建数据处理管道,将数据从数据湖移动到数据仓库
- 在数据仓库中转换数据,准备仪表板数据
- 创建仪表板,支持高级分析任务
技术栈
- 云服务:GCP
- 基础设施即代码:Terraform
- 工作流编排:Airflow
- 数据仓库:BigQuery
- 数据湖:GCS
- 批处理/转换:dbt cloud 或 DataProc/Spark
- 流处理:无
- 仪表板:Google Data Studio
数据处理流程
- 数据摄取
- 使用Airflow从AWS桶获取数据到GCS,再到BigQuery
- 创建不同的DAG处理不同类型的数据(如站

中国交通事故深度调查(CIDAS)数据集
交通事故深度调查数据通过采用科学系统方法现场调查中国道路上实际发生交通事故相关的道路环境、道路交通行为、车辆损坏、人员损伤信息,以探究碰撞事故中车损和人伤机理。目前已积累深度调查事故10000余例,单个案例信息包含人、车 、路和环境多维信息组成的3000多个字段。该数据集可作为深入分析中国道路交通事故工况特征,探索事故预防和损伤防护措施的关键数据源,为制定汽车安全法规和标准、完善汽车测评试验规程、
北方大数据交易中心 收录
LFW
人脸数据集;LFW数据集共有13233张人脸图像,每张图像均给出对应的人名,共有5749人,且绝大部分人仅有一张图片。每张图片的尺寸为250X250,绝大部分为彩色图像,但也存在少许黑白人脸图片。 URL: http://vis-www.cs.umass.edu/lfw/index.html#download
AI_Studio 收录
中国1km分辨率逐月降水量数据集(1901-2023)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
微博与抖音评论数据集
数据集源自微博平台与抖音平台的评论信息,基于两个热点事件来对评论等信息进行爬取收集形成数据集。原数据一共3W5条,但消极评论与中立评论远远大于积极评论。因此作特殊处理后,积极数据2601条,消极数据2367条,中立数据2725条,共7693条数据。
github 收录
The Global Forest Watch (GFW)
The Global Forest Watch (GFW) 是一个全球森林监测平台,提供关于森林覆盖变化、火灾、森林砍伐和土地利用的实时数据和分析。数据集包括全球森林覆盖地图、森林砍伐警报、火灾热点、土地覆盖变化等信息。
globalforestwatch.org 收录