ithaca_dataset
收藏官方服务:
资源简介:
该数据集是一个全球概率集合,用于陆地-大气水交换,基于IPCC区域和生物群落采样,通过数据集一致性加权,使用蒙特卡洛模拟生成降水(P)和蒸散发(E)的概率集合,可用于推导水可用性和水通量变化。
This dataset is a global probabilistic ensemble for land-atmosphere water exchange. Sampled based on IPCC regions and biomes, it applies consistency weighting across the dataset and generates probabilistic ensembles of precipitation (P) and evapotranspiration (E) via Monte Carlo simulations. This dataset can be used to derive water availability and water flux variations.
创建时间:
2026-07-07
原始信息汇总
数据集概述
该数据集专注于陆地-大气水循环通量(降水 P 与蒸散发 E)的全球概率集成估算,旨在基于IPCC区域×生物群落分层抽样,结合数据集一致性加权,通过蒙特卡洛模拟生成可量化水可用性与水通量变化的概率集成产品。数据集配套论文计划投稿至 Earth System Science Data (ESSD)。
数据集的协作与开发原则
- 任务协调:所有科学和技术决策通过GitHub Issues和Pull Requests进行,避免使用Teams、邮件或私信。
- Issues记录:包含任务、决策、错误、方法问题、脚本变更、稿件修改、图表请求及审稿意见。
- 分支规则:不直接提交到
main分支,每个任务或问题使用独立分支,完成后通过Pull Request合并。 - Issue优先工作流:任何实质性改动(新脚本、稿件章节、方法决定、数据记录描述、验证检查等)均需先创建Issue。
- Pull Request要求:每个PR对应一个Issue,需链接Issue、描述变更、列出影响文件并说明是否需要重新生成输出或更新方法文档。
项目结构
| 目录 | 用途 |
|---|---|
code/ |
活动脚本与可复现工作流 |
docs/ |
内部沟通文档(含方法说明 methodology_short.md、methodology_long.md 及角色说明 group_roles.md) |
manuscript/ |
稿件主文件(manuscript.tex,使用Copernicus/ESSD模板,与Overleaf同步) |
manuscript/fig_main/ |
稿件主图 |
manuscript/fig_sm/ |
补充材料图 |
manuscript/tab_main/ |
稿件主表 |
manuscript/tab_sm/ |
补充材料表 |
脚本与稿件开发规范
- 脚本:放置于
dev/目录,需遵循统一结构(库加载、输入、常量、函数、分析、输出、验证)。每个脚本聚焦单一任务,避免隐藏依赖,使用显式输入/输出文件名。 - 稿件:稿件文本在
manuscript/中开发,内部笔记使用docs/。Overleaf版本通过GitHub集成与本仓库同步,仓库为协调的权威来源,Overleaf仅提供编译视图。 - 沟通风格:Issue评论需简短、具体、可操作,避免模糊表述,应明确指出问题所在、文件位置及建议修改。
决策与审查机制
- 方法决策:需在Issue中讨论,结论清晰写入Issue,更新相关文档或脚本,并通过Pull Request合并后方视为正式采纳。
- 审查检查清单:分支需与
main同步,变更与Issue一致,脚本可运行或说明原因,列出受影响输出,更新文档。
数据输出管理
- 大型生成数据文件不应提交至仓库,除非有意作为仓库组成部分;大型输出应保留在共享的数据/输出位置。
搜集汇总
数据集介绍

构建方式
ithaca数据集以陆-气水交换通量为核心研究对象,采用蒙特卡洛模拟方法构建全球概率集成数据集。研究基于IPCC区域与生物群落类型的交叉采样策略,通过加权数据集一致性指标生成降水与蒸散的集成估算。数据集的构建依托严格的版本控制与协作流程,所有方法论决策均需在GitHub Issue中明确讨论并记录,确保每一步骤的透明性和可重复性。脚本集中于dev目录,遵循统一的结构模板,每个脚本专注于单一任务,避免隐藏依赖,并嵌入验证环节以保障数据生成质量。
特点
该数据集最显著的特点在于其概率性集成框架,通过多数据集加权与区域-生物群落映射,生成全球尺度上降水与蒸散的不确定性分布,而非单一的确定性估值。数据集构建过程完全基于GitHub Issue驱动的工作流,确保所有任务、决策与修改均有案可查。版本分支策略严格,每个问题对应独立分支,通过Pull Request合并至主分支,从制度上规避了随意改动。同时,项目规范要求避免大型生成文件入库,仅保留核心代码与文档,增强了数据集的轻量性与可复现性。
使用方法
使用ithaca数据集时,用户需从GitHub仓库的code目录获取重现工作流的核心脚本。数据集的使用严格遵循文档docs/中的方法论说明,脚本依赖关系通过显式的输入输出文件名进行管理,降低了使用门槛。推荐用户在独立分支上进行探索或扩展,并遵循Issue-first原则:任何实质性改动或新分析任务应首先创建Issue,经讨论后再通过Pull Request集成。论文文稿同步在Overleaf上,提供编译后的协同视图,但GitHub仓库中manuscript目录下的.tex文件被视为最终权威版本,确保数据集描述与代码逻辑的一致性。
背景与挑战
背景概述
陆地水循环通量(如降水与蒸散发)的精确量化对于理解全球水资源分布与气候系统相互作用至关重要。现有数据集多基于单一模型或观测,其不确定性难以表征。为此,由国际研究团队于近期发起的“ithaca_dataset”项目,旨在构建一个基于蒙特卡洛模拟的全概率集合数据集,融合IPCC区域与生物群系划分的多源数据,通过加权一致性评估,系统描述陆地-大气水交换通量的不确定性与动态变化。该数据集面向《Earth System Science Data》期刊投稿,其创新性在于将概率思维引入传统水通量估算,为气候变化背景下的水资源可用性分析提供了统计稳健的基准,有望推动水文学与气候学交叉领域的研究范式革新。
当前挑战
该数据集面临的核心挑战在于:其一,多源降水与蒸散发数据在时空覆盖、反演算法与系统偏差上存在显著差异,如何设计合理的加权方案实现区域-生物群系尺度上的最优融合,避免单一数据主导,是确保集合统计量可靠性的关键难点。其二,蒙特卡洛模拟的运算复杂度随数据维度急剧攀升,需要在有限计算资源下平衡模拟次数与精度,并处理生物群系边缘的插值异常。此外,数据集构建流程强调基于GitHub的协作可重复性,这要求所有代码、参数与决策过程公开可溯,大幅提升了数据管理与版本控制的难度,对跨团队科学沟通效率构成了组织性挑战。
常用场景
经典使用场景
在陆气交互通量研究的广阔天地中,ITHACA数据集以其独特的概率集成视角,成为量化陆地水循环通量的经典工具。该数据集基于蒙特卡洛模拟框架,融合IPCC区域与生物群系采样策略,通过加权数据集一致性,生成了降水和蒸散发的概率集成产品。研究者可借助这一数据集,深入剖析全球尺度的水可用性与水通量变化,尤其适用于在数据稀缺或异质性强的区域开展陆面过程模拟与不确定性分析。其经典用法聚焦于为水文气候研究提供一套稳健的、包含不确定性信息的陆气交换通量基准,从而支撑从流域到全球尺度的水循环评估。
衍生相关工作
围绕ITHACA数据集,学术界已衍生出一系列经典工作,深化了对其方法论与物理内涵的理解。后续研究基于该概率集成框架,发展了区域尺度的水循环通量校正策略,通过引入高分辨率局地观测数据,进一步细化了流域尺度的通量模拟。亦有工作利用该数据集作为验证基准,评估了新一代气候模式与陆面过程模式对水通量的模拟能力,揭示了不同参数化方案的不确定性来源。在方法层面,研究者借鉴其区域×生物群系加权思路,将集成思想推广至碳通量、辐射通量等其他陆面变量,构建了多圈层耦合的概率化数据集体系。这些衍生产出不仅拓展了原数据集的科学边界,更推动了地球系统科学的集成化与概率化发展。
数据集最近研究
最新研究方向
ITHACA数据集聚焦于陆地-大气水交换通量的全球概率集成建模,代表了水文气候研究从确定性估计向不确定性量化的重要范式转换。结合IPCC区域分类与生物群落分层采样,该研究通过蒙特卡洛模拟生成降水与蒸散的集合概率分布,并以数据共识度作为权重依据,精准刻画水循环通量的时空变异特征。当前前沿方向集中于构建网格化集成产品,探索不同加权方案对水可利用性及通量变化评估的敏感性,特别是在极端干旱与洪涝事件频发的背景下,为全球水资源管理与生态系统适应性决策提供科学支撑。
以上内容由遇见数据集搜集并总结生成



