遇见数据集

denguedatasets

收藏
github2026-07-16 更新2026-07-17 收录
官方服务:

资源简介:

denguedatasets包提供了一个精心策划的开放获取登革热监测和气候数据集集合,用于流行病学研究和机器学习。包括来自孟加拉国、菲律宾、台湾、斯里兰卡、巴西、哥伦比亚、巴基斯坦、印度、秘鲁、印度尼西亚和塞拉利昂的监测记录、气候协变量和死亡率指标,涵盖病例数、死亡人数、病死率以及相关的气象变量(温度、湿度、降水量),适用于时空分析、疫情预测、机器学习和时间序列建模。

The denguedatasets package provides a curated collection of open-access dengue surveillance and climate datasets for epidemiological research and machine learning applications. It comprises surveillance records, climate covariates, and mortality metrics from Bangladesh, Philippines, Taiwan, Sri Lanka, Brazil, Colombia, Pakistan, India, Peru, Indonesia, and Sierra Leone. These datasets cover case counts, fatalities, case fatality rates, and associated meteorological variables including temperature, humidity, and precipitation, and are suitable for spatiotemporal analysis, epidemic prediction, machine learning, and time series modeling.

创建时间:
2026-06-21
原始信息汇总

数据集概述:denguedatasets

denguedatasets 是一个经过精心整理的、开放获取的登革热监测与气候数据集集合,专为流行病学研究与机器学习设计。

数据内容与覆盖范围

  • 主要变量:涵盖登革热病例数、死亡数、病死率,以及相关的气象变量(温度、湿度、降水量)。
  • 地理覆盖:数据来自孟加拉国、菲律宾、台湾、斯里兰卡、巴西、哥伦比亚、巴基斯坦、印度、秘鲁、印度尼西亚和塞拉利昂。
  • 数据用途:适用于时空分析、疫情暴发预测、机器学习以及时间序列建模。

可用数据集列表

该包包含多个按国家/地区划分的数据集,部分示例包括:

数据集键名 国家/地区 覆盖时段 许可证
dengue_bangladesh 孟加拉国(达卡) CC BY 4.0
dengue_bangladesh_mortality 孟加拉国 2000–2024 MIT
dengue_brazil 巴西 2000–2019 GPL 2
dengue_brazil_labels 巴西(数据字典) 2000–2019 GPL 2
dengue_colombia 哥伦比亚(所有市镇) 2007–2019 Unknown
dengue_colombia_medellin 哥伦比亚(麦德林) 2007–2019 Unknown
dengue_india 印度 CC0
dengue_jakarta 印度尼西亚(雅加达) 2021–2024 Unknown
dengue_pakistan 巴基斯坦 2016–2020 CC BY-SA 4.0
dengue_peru 秘鲁 2019–2022 Apache 2.0
dengue_philippines 菲律宾 2016–2020 CC0
dengue_sierra_leone 塞拉利昂(弗里敦) 2015–2024 CC BY-SA 4.0
dengue_sri_lanka 斯里兰卡 2010–2020 © Original Authors
dengue_sri_lanka_2019 斯里兰卡 2019 CC0
dengue_sri_lanka_2020 斯里兰卡 2020 CC0
dengue_sri_lanka_2021 斯里兰卡 2021 CC0
dengue_taiwan 台湾 1998–2024 CC0

每个数据集的原始来源URL、许可证文本、原始文件名及完整描述,均记录在 datasets.md 文件中。

安装与快速使用

  • 安装方式:通过PyPI安装 pip install denguedatasets
  • 快速上手
    • import denguedatasets as dd 导入包。
    • dd.list_datasets() 列出所有可用数据集。
    • dd.dataset_info("dengue_taiwan") 查看数据集元数据(来源、许可证、描述)。
    • dd.load_dataset("dengue_taiwan") 将数据集加载为 pandas DataFrame。
    • dd.describe("dengue_taiwan") 描述数据集。
  • 灵活加载load_dataset 支持所有 pandas.read_csv 的关键字参数,例如 df = dd.load_dataset("dengue_brazil", sep=";", encoding="latin-1")

数据来源与声明

  • 数据来源:该包中的每个数据集均源自公开的Kaggle数据集,每个数据集保留其原始声明中的许可证。
  • 免责声明:数据集仅供教育、研究和信息目的使用。作者不对数据的准确性、完整性或适用性作任何保证。

引用与作者

  • 引用格式

    Dzul Manzanilla, F.A. & Correa Morales, F. (2026). denguedatasets: A curated collection of open-access dengue fever datasets for epidemiological research (Version 0.1.0) [Software]. https://github.com/fdzul/denguedatasets_py

  • 作者
    • Felipe A. Dzul Manzanilla — ORCID: 0000-0002-2085-9141 — 墨西哥国家公共卫生研究所 (INSP)
    • Fabián Correa Morales — ORCID: 0000-0002-6193-1242 — 墨西哥国家预防计划与疾病控制中心 (CENAPRECE)

许可证

  • denguedatasets 库本身采用 GNU General Public License v3.0 (GPL-3.0) 许可证发布。
  • 各个数据集保留其各自的原始许可证。
搜集汇总
数据集介绍
denguedatasets 数据集图片
构建方式
denguedatasets 数据集通过系统性地整合来自孟加拉国、菲律宾、台湾、斯里兰卡、巴西、哥伦比亚、巴基斯坦、印度、秘鲁、印度尼西亚和塞拉利昂等多个国家的登革热监测与气候变化数据构建而成。该集合基于公开的Kaggle数据集,包含病例数、死亡人数、病死率以及气温、湿度、降水量等气象协变量,适用于时空分析、疫情预测、机器学习和时间序列建模。每个子数据集均保留其原始许可条款,并附有详细的元数据信息,包括来源、许可和描述。
使用方法
使用denguedatasets十分便捷,可通过Python包管理器pip安装:pip install denguedatasets。加载后,利用import denguedatasets as dd即可访问。用户可通过dd.list_datasets()浏览所有可用数据集,使用dd.dataset_info('dengue_taiwan')查看特定数据集的元数据,并通过dd.load_dataset('dengue_taiwan')将其加载为pandas DataFrame进行后续分析。该方法支持直接传递给pandas.read_csv的关键字参数,便于灵活处理不同格式的数据文件。
背景与挑战
背景概述
登革热作为一种由蚊媒传播的急性传染病,在全球热带与亚热带地区构成重大公共卫生威胁,其暴发频率与地理范围因气候变化与城市化进程而持续扩大。denguedatasets数据集由墨西哥国家公共卫生研究所的Felipe A. Dzul Manzanilla与CENAPRECE的Fabián Correa Morales于2026年创建,旨在为流行病学与机器学习研究提供一个经过精心筛选的开放获取登革热数据集集合。该数据集整合了来自孟加拉国、菲律宾、巴西、哥伦比亚等11个国家的监测记录、气候协变量与死亡率指标,涵盖病例数、死亡数、病死率及温度、湿度、降水等气象变量,为时空分析、暴发预测与时序建模提供了统一的数据基础,显著降低了研究者跨来源整合数据的门槛。其对登革热领域的影响力在于,通过标准化多源异构数据并保留原始许可,促进了全球合作与可重复性研究的发展。
当前挑战
该数据集面临的领域挑战在于登革热本身复杂的时空传播动态:疾病暴发受气象条件、人口流动、媒介生态与免疫水平的交互影响,现有数据往往缺乏高分辨率空间粒度与实时更新的能力,难以捕捉局部暴发前兆。在构建过程中,主要挑战包括从Kaggle等分散平台收集并验证来自多个国家、版权协议各异的数据源,确保数据完整性并协调不同时间跨度(如印度数据缺失明确时期)与许可兼容性;此外,部分数据集(如哥伦比亚、印度尼西亚)未明确许可证,增加了法律与伦理合规的复杂性。数据格式的异构性(如分隔符、编码差异)也需通过工具链的灵活适配来克服,而长期维护以应对原始数据更新与许可证变更同样是持续性挑战。
常用场景
经典使用场景
在登革热流行病学与时空分析领域,denguedatasets数据集为研究人员提供了跨越多个热带与亚热带国家的标准化监测记录与气候协变量数据。其最经典的使用场景是构建多元时间序列模型,结合病例数、死亡率与温度、湿度、降水等气象变量,揭示登革热传播的动态规律。通过整合孟加拉国、巴西、哥伦比亚、菲律宾等国长期连续的公共卫生数据,该数据集使得学者能够对登革热暴发的阈值条件与环境驱动因素进行精细化探索,有力地推动了传染病因时空异质性建模的发展。
解决学术问题
该数据集系统性地解决了登革热研究中长期存在的关键学术难题:即不同国家与地区间监测数据格式不一、元数据缺失、难以横向对比的痛点。通过提供经统一整理且附有许可证信息的开放数据,研究者可以跨越行政边界进行多国别、多气候带的比较流行病学分析,检验气候变迁对登革热传播的影响假设。这一整合不仅提升了模型预测的可重复性,还弥补了传统单一区域研究中统计效力不足的缺陷,其意义在于为全球登革热预警系统的构建奠定了数据基础,推动了从描述性流行病学向预测性科学范式的转变。
实际应用
在实际公共卫生应用中,denguedatasets数据集的核心价值在于支持各国疾控部门与政策制定者开发早期预警系统。通过加载菲律宾、巴基斯坦或塞拉利昂等地的历史疫情与气象数据,地方卫生机构能够训练机器学习模型以实时评估暴发风险。此外,该数据集为国际组织如世界卫生组织提供了统一的跨区域基线数据,助力全球登革热风险评估地图的绘制。基于这些数据开发的分析工具可指导疫苗分发策略、医疗资源调配及公众健康宣教时机的选择,从而显著降低登革热的疾病负担与死亡率。
数据集最近研究
最新研究方向
在全球气候变暖与登革热疫情频发的背景下,denguedatasets作为首个跨区域、多源融合的开源登革热数据集集合,正成为时空流行病学与机器学习交叉领域的前沿工具。当前研究热点聚焦于利用该数据包中的历史病例、气候协变量及死亡率指标,构建高精度的早期预警模型与疫情传播动力学模拟。特别是在巴西、斯里兰卡及印尼等热带与亚热带地区,学者们依托其涵盖的长时间序列气象变量,深度挖掘温度、湿度与降水对登革热暴发周期的非线性驱动机制。该数据集的发布不仅解决了传统研究中数据碎片化与许可不兼容的痛点,更为全球病媒疾病监测网络的标准化与可复现研究奠定了基准资源,有力推动了从描述性统计向预测性流行病学的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务