遇见数据集

aquascope-gauges

收藏
Hugging Face2026-08-17 更新2026-08-18 收录
官方服务:

资源简介:

AquaScope gauges 是一个全球水文观测站目录,由 AquaScope 项目(https://github.com/Rekin226/aquascope)定期采集并发布。数据集包含来自 6 个数据源的 45,919 个站点,覆盖法国、爱尔兰、德国、台湾、英国和美国。每个站点记录包括:数据源(source)、站点ID(station_id)、名称(name)、经纬度(latitude/longitude)、观测变量(variables,如径流、水位、地下水、降水等)、数据起止时间(period_start/period_end)、机构页面链接(url)、河流(river)、国家(country)、机构(agency)、许可协议(license)、是否可再分发(redistributable)以及额外信息(extra)。数据以 GeoParquet 1.0 格式(WGS84 点几何)和 GeoJSON 格式提供,便于直接通过 DuckDB 或 Pandas 远程查询。此外,Phase 1 提供了部分数据源的每日均值观测数据(CSV 格式),按变量、来源和站点ID组织。数据集适用于水文研究、径流/水位/地下水分析、气候变化监测等任务。所有数据源均遵守各自开放许可协议,允许再分发的源已镜像观测数据。

AquaScope gauges is a global directory of hydrological observation stations, regularly collected and published by the AquaScope project (https://github.com/Rekin226/aquascope). The dataset contains 45,919 stations from 6 data sources, covering France, Ireland, Germany, Taiwan, the United Kingdom, and the United States. Each station record includes: source, station_id, name, latitude/longitude, observed variables (such as runoff, water level, groundwater, precipitation, etc.), data period start/end, agency page URL, river, country, agency, license, redistributable flag, and extra information. The data is provided in GeoParquet 1.0 format (WGS84 point geometry) and GeoJSON format, enabling direct remote querying via DuckDB or Pandas. Additionally, Phase 1 offers daily mean observation data (CSV format) for some data sources, organized by variable, source, and station ID. The dataset is suitable for hydrological research, runoff/water level/groundwater analysis, climate change monitoring, and other tasks. All data sources comply with their respective open licenses, and redistributable sources have mirrored observation data.

创建时间:
2026-08-17
原始信息汇总

AquaScope gauges 数据集概述

基本信息

  • 数据集名称:AquaScope gauges (world station catalog)
  • 许可协议:遵循各数据源的开放许可(per-source open licences),详见 许可说明
  • 数据规模:1K-10K 站点(实际为 45,919 个站点)
  • 标签:水文学、河流流量、水位、地下水、GeoParquet、开放数据

数据内容

该数据集是 AquaScope 项目可访问的所有水文观测站点的全球目录,按计划定期采集并发布为 GeoParquet 格式。最近一次运行时间为 2026-08-18,共收录来自 6 个数据源的 45,919 个站点

主要文件

文件 说明
stations.parquet GeoParquet 1.0 格式(WKB 点几何,WGS84),每个站点一行,包含 source、station_id、name、latitude、longitude、variables、period_start、period_end、url、river、country、agency、license、redistributable、extra 字段
stations.geojson 与 parquet 相同数据的 GeoJSON 格式
health.json 最近一次运行中各数据源的状态(站点数、耗时、错误信息)

数据源详情

数据源 国家 观测变量 许可 站点数
HubEau hydrométrie 法国 流量、水位 etalab-2.0 4,150
Ireland OPW 爱尔兰 水位 CC-BY-4.0 460
PEGELONLINE 德国 水位、流量 DL-DE-BY-2.0 729
Taiwan CWA climate stations 台湾 气候、降水 OGDL-Taiwan-1.0 1,265
UK Environment Agency 英国 流量、水位、降水、地下水位 OGL-UK-3.0 9,536
USGS Water Services 美国 流量、水位、水质 US-PD 29,779

观测数据

数据集还包含按站点的日观测值,存储在 obs/<variable>/<source>/<station_id>.csv.gz(格式:date,value;流量单位为 m³/s,水位和地下水位单位为 m,降水单位为 mm/day),以及每个变量和数据源的 Parquet 汇总文件。obs/manifest.json 列出了所有已采集站点的周期、数量和单位。

当前已采集的观测数据包括:

  • hubeau_hydrometrie 流量数据(72 站)
  • taiwan_cwa 降水数据(14 站)
  • uk_ea 流量数据(98 站)
  • usgs 流量数据(86 站)

使用方式

可通过 DuckDB 或 Python 直接在线查询 parquet 文件,无需下载:

  • DuckDB:INSTALL httpfs; LOAD httpfs; 后直接查询 URL
  • Python:pandas.read_parquet("hf://datasets/Rekin226/aquascope-gauges/stations.parquet")

构建方式

数据由 GitHub Actions 每周自动运行 aquascope harvest stations --out archive --publish Rekin226/aquascope-gauges 生成,所有数据均从各机构的 API 自动采集,无人工编辑。

引用说明

使用数据时需引用 AquaScope 软件(Zenodo DOI 见仓库 README)及所用数据源的对应机构。

搜集汇总
数据集介绍
aquascope-gauges 数据集图片
构建方式
AquaScope gauges的构建依托于AquaScope开源软件框架,通过自动化采集流程实现全球水文观测站点元数据的持续汇聚。该数据集由GitHub Actions工作流按周调度,运行aquascope harvest stations命令,从10个国家级或区域级水文机构API中提取站点信息,涵盖美国地质调查局、英国环境署、澳大利亚气象局等权威来源。采集过程完全程序化,无人工编辑干预,确保数据可重复性与时效性。当前快照基于aquascope 0.16.0版本,于2026年9月11日完成最近一次采集,共整合67,099个站点,并以GeoParquet与GeoJSON双格式发布,形成可追溯、可扩展的开放数据档案。
特点
该数据集的核心特征在于其跨源异构水文观测站点的标准化整合与开放许可的精细管理。站点记录包含来源标识、站号、名称、经纬度、观测变量、时段范围、机构深链、河流、国家、许可协议及可再分发标志等丰富字段,兼顾元数据完整性与机器可读性。数据集覆盖流量、水位、地下水、降水、水质、水库蓄量等多类水文变量,并附有各来源运行健康状态文件。尤为突出的是,数据集严格区分仅编目与可镜像观测的源,尊重原始机构的数据共享条款,以透明许可标注保障合规使用,体现了开放科学与数据伦理的平衡。
使用方法
使用该数据集可通过多种轻量级途径实现无需下载的原地查询与分析。用户借助DuckDB的httpfs扩展或Python的pandas.read_parquet,可直接通过HTTPS或hf://协议读取stations.parquet,执行按来源统计、空间筛选或与观测数据联表等操作。观测数据以按变量与来源组织的CSV压缩文件及Parquet包形式提供,支持单站读取或整源批量加载,并可利用obs/manifest.json快速定位所需序列。此外,数据集还集成BasinATLAS流域边界文件,允许用户通过aquascope命令或MCP工具将任意陆地点位映射至相应子流域,实现水文站点与流域属性的无缝关联,为水资源分析提供便捷的数据接口。
背景与挑战
背景概述
水文观测数据的整合与开放共享是水文学研究与水资源管理的基础支撑。AquaScope gauges数据集由AquaScope项目团队构建,于2026年9月发布,旨在汇聚全球水文观测站点的目录信息。该数据集覆盖澳大利亚、巴西、希腊、法国、爱尔兰、德国、中国台湾、英国和美国等10个数据源,包含67,099个站点,以GeoParquet格式存储,支持高效的空间查询与云端分析。其核心研究问题在于打破水文数据的孤岛状态,通过标准化目录和开放许可筛选,实现多源异构水文站点元数据的统一索引,为全球水文建模、水资源评估及气候变化研究提供可复用的数据基础设施。
当前挑战
该数据集所应对的领域挑战在于全球水文观测网络长期存在数据分散、格式不一、许可条款各异的问题,导致跨区域水文分析难以规模化开展。构建过程中面临多重挑战:其一,各源数据接口的异构性要求针对不同机构API设计适配采集器,并保证每周自动化运行的稳定性;其二,许可条款的差异性使得部分数据仅能编目而无法镜像观测值,需在开放共享与合规之间取得平衡;其三,站点标识、变量命名和时空基准的标准化需要跨源协调,以避免合并分析时产生歧义。此外,观测数据的持续更新与历史序列的完整性维护也对数据管道的容错能力提出较高要求。
常用场景
经典使用场景
在水文学与地球系统科学的宏大叙事中,aquascope-gauges数据集扮演着全球水文观测站目录的基石角色。其最经典的使用场景在于,研究者借助DuckDB或Pandas等工具,以原地查询的方式高效聚合来自十个国家或地区、逾六万七千个水文站点的元数据,涵盖流量、水位、地下水、降水等多类要素。通过GeoParquet格式的空间索引,用户可迅速筛选特定流域或行政区域的站点,进而关联观测数据,支撑从区域水文评估到全球尺度水资源分析的多样化研究。
解决学术问题
针对水文研究中长期存在的站点信息孤岛与元数据异构难题,aquascope-gauges数据集提供了标准化的站点编目,统一了字段结构与许可标识。它有效解决了跨源站点匹配困难、坐标参考不一以及观测周期不透明等常见学术障碍,使得大范围水文模型校准、趋势检测与极端事件归因分析成为可能,从而提升了研究结果的可复现性与跨区域可比性,对全球水循环研究具有深远的推动意义。
衍生相关工作
基于aquascope-gauges的开放编目,学界与开源社区衍生了一系列经典工作。例如,利用其站点目录与观测数据开展全球河流流量再分析产品的验证,或借助BasinATLAS属性进行大样本水文相似性分析。该数据集亦催生了自动化数据同化流程与机器学习径流预测模型的基准测试,推动了水文学与数据科学的交叉融合,为后续研究提供了可复用的数据基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务