遇见数据集

Reservoir

收藏
arXiv2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

Reservoir是由密歇根大学开发的一个大规模模拟流行病数据集,旨在为训练和评估流行病学AI模型提供丰富、带完整真实标签的合成数据。该数据集包含500,000条疫情爆发轨迹,覆盖十亿个模拟日,涉及多种病原体特征、人口结构和干预策略。数据通过随机模拟器生成,结合了真实噪声和报告伪影,并提供了可配置的干预措施。Reservoir主要用于反事实实验、监测设计研究以及流行病模型训练,能够解决真实世界数据规模不足且无法提供潜在真实值(如真实感染数、时变再生数)的问题。

Reservoir is a large-scale simulated epidemic dataset developed by the University of Michigan, designed to provide rich, fully labeled synthetic data for training and evaluating epidemiological AI models. This dataset contains 500,000 outbreak trajectories, covering one billion simulated days, and involves multiple pathogen characteristics, population structures and intervention strategies. The data is generated via a stochastic simulator, incorporates real-world noise and reporting artifacts, and offers configurable intervention measures. Reservoir is primarily used for counterfactual experiments, surveillance design research and epidemic model training, and can address the limitations of real-world data, including insufficient scale and the unavailability of latent ground truth values such as actual infection counts and time-varying reproduction numbers.

提供机构:
密歇根大学
创建时间:
2026-08-28
原始信息汇总

Reservoir:大规模模拟流行病学数据集

数据集概述

Reservoir 是一个面向流行病学模型训练与评估的大规模模拟数据集,由密歇根大学公共卫生学院“爆发分析与建模综合中心”(MICOM)的研究人员 Carson Dudley、Reiden Magdaleno 和 Marisa Eisenberg 开发。

核心特点

  • 用途:用于训练和评估流行病学模型
  • 规模:大规模模拟数据集
  • 实现语言:包含需要本地编译的 C++ 代码,并提供 R 接口
  • 许可协议:PolyForm 非商业 1.0.0 许可证

使用方式

安装要求

  • 需要 R 4.4 或更高版本
  • 需要本地编译器:
    • macOS:运行 xcode-select --install
    • Windows:安装与 R 版本匹配的 Rtools
    • Linux:运行 sudo apt install r-base-dev

安装步骤

  1. 通过 GitHub 安装:在 R 中运行 remotes::install_github("micom-hub/Reservoir")

  2. 或直接下载 ZIP 包后,在 R 中运行: r install.packages("Rcpp") install.packages(path.expand("~/Downloads/Reservoir-main"), repos = NULL, type = "source")

  3. 重启 R 会话

  4. 加载库:library(Reservoir)

教程与文献

  • 提供入门教程文件:reservoir_tryit_getting_started.qmd(可通过 GitHub 仓库获取)
  • 配套研究论文:《Reservoir: A Large-Scale Simulated Dataset for Training and Evaluating Epidemiological Models》

版权信息

© 2025 密歇根大学董事会及 Carson Dudley、Reiden Magdaleno、Marisa Eisenberg 版权所有。

搜集汇总
数据集介绍
Reservoir 数据集图片
构建方式
Reservoir数据集的构建依托于一个高度可配置的随机流行病模拟器,其核心架构由C++实现的适应性tau-leaping引擎与R语言的分层参数采样器及观测模型组成。构建流程始于用户通过model_structure()、population_spec()、intervention_policy()和reservoir_config()四个函数分别定义模型结构、人口与初始条件、干预策略及参数先验分布。随后,generate_dataset()函数执行完整的模拟流水线,涵盖分层抽样、配置组装、初始条件设定、随机模拟、有效再生数计算及观测模型应用。每个模拟轨迹同时记录潜在的真实流行病学动态(如真实感染数、时变再生数)和经观测模型处理的带噪监测信号(如报告病例、住院人数、废水浓度等),从而确保每个数据点都携带完整的真值标签。
使用方法
Reservoir数据集的使用十分灵活,用户既可通过默认参数一键生成数据集,也可自定义模型结构、参数分布和干预策略。对于AI模型训练,用户可直接利用generate_dataset()生成大规模有标签数据,用于传染病预测、实时再生数估计等任务。此外,由于每个轨迹携带完整的真值标签,数据集可用于对现有流行病学方法进行基准测试,例如评估序列间隔、再生数等指标的估计精度。模拟器的可配置性还支持反事实实验和监测系统设计研究,使得探索不同干预策略或监测方案对推断结果的影响成为可能。通过R包提供的extract_all_runs_single_csv()函数,可将生成的数据导出为长格式表格,便于与主流数据分析流程集成。
背景与挑战
背景概述
Reservoir数据集由密歇根大学数学系与公共卫生学院的Carson Dudley、Reiden Magdaleno及Marisa Eisenberg于2026年联合创建,旨在应对传染病流行病学中大规模标注数据匮乏的困境。该数据集通过随机模拟器生成50万条疫情轨迹,涵盖十亿模拟天,跨越多种病原特征、人口结构与干预策略,并提供了真实感染数、时变再生数及反事实干预效应等无法直接观测的地面真值标签。作为首个大规模模拟流行病数据集,Reservoir已成功用于训练Mantis基础模型,显著提升了跨16种真实疾病的预测精度,推动了AI在公共卫生领域的应用。
当前挑战
Reservoir面临的核心挑战包括:其一,真实世界疫情数据规模有限且缺乏完整标注,难以支撑深度学习模型对海量数据的需求,而模拟数据虽能扩充规模,却需精确模拟现实报告偏差与干预异质性,以保证模型可迁移性。其二,构建过程中需平衡生物机制复杂度与计算效率,例如在C++自适应tau-leaping引擎中整合多种传播路径,并对低计数区间进行精细的随机模拟,同时确保生成的疫情轨迹在流行病学上合理且具多样性。此外,观察模型需真实再现漏报、延迟和过度离散等特征,这对模拟器的参数空间设计提出了极高要求。
常用场景
经典使用场景
Reservoir数据集作为大规模、带有完整真实标签的合成流行病模拟数据源,其最经典的使用场景是训练和评估流行病学AI模型。与传统真实世界数据相比,Reservoir提供了50万条覆盖多样化病原体特性、人口结构和干预策略的暴发轨迹,使得深度学习模型(如时间序列预测、参数推断和异常检测)能够在远超真实数据规模的语料上进行训练。其精确的潜在状态标签,如真实感染数、时变再生数和反事实干预效果,为模型提供了准确的监督信号,解决了真实数据无法提供ground truth的难题,推动了计算流行病学中数据驱动方法的发展。
解决学术问题
Reservoir解决了传染病流行病学中两大核心学术难题:一是训练数据稀缺,二是缺乏潜在变量的真实标签。真实世界监测数据受限于地域、病原体范围和数据共享协议,且无法直接测量真实感染数或时变再生数。Reservoir通过模拟生成海量且完全标注的数据,使研究者能够在受控条件下基准测试现有方法(如序列间隔和再生数估计),并系统评估推断的鲁棒性。它支持反事实实验和监测系统设计研究,填补了真实数据无法提供的验证空白,加速了AI方法在流行病学中的可靠应用。
实际应用
在实际应用中,Reservoir已被用于训练人工智能基础模型Mantis,该模型仅基于模拟数据训练,却能在16种真实疾病上实现高精度预测,并已被公共卫生机构用于多个国家的疫情监测。此外,Reservoir支持实时Rt估计、异常检测和跨模态翻译(如从废水信号推断真实病例轨迹),有助于突发公共卫生事件的早期预警。其模拟器的模块化架构允许定制干预策略和监测信号,为公共卫生决策制定和监测系统的优化设计提供了实用工具。
数据集最近研究
最新研究方向
Reservoir数据集的最新研究聚焦于利用大规模、具备完整ground truth标签的模拟流行病数据,推动传染病流行病学中人工智能方法的发展。该数据集通过生成50万条跨越十亿模拟日的疫情轨迹,覆盖多种病原体特征、人口结构和干预策略,为训练如Mantis这样的基础模型提供了前所未有的数据规模。当前研究热点包括基于模拟数据训练的模型在真实疫情中的零样本泛化能力、实时有效再生数(Rt)的精准估计、异常检测以及跨模态推断(如从污水信号反推真实感染轨迹)。此外,Reservoir支持反事实实验、监测系统设计和数据质量对推断影响的系统评估,其可配置性和高保真观测模型使其成为验证流行病学方法、推动AI驱动疾病预测和监测范式转变的关键基础设施。
相关研究论文
  • 1
    Reservoir: A Large-Scale Simulated Dataset for Training and Evaluating Epidemiological Models密歇根大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务