Data-Gouv-FR/covid19-world-data-published-by-john-hopkins-csse
收藏数据链接:
官方服务:
资源简介:
该数据集包含约翰·霍普金斯大学系统科学与工程中心(CSSE)每日发布的全球COVID-19数据,涵盖确诊病例、治愈病例和死亡病例。这些数据最初存储在GitHub仓库中,由Gisaïa公司重新利用并在ARLAS Exploration平台上展示。根据约翰·霍普金斯CSSE的使用条款,数据仅供教育和学术研究目的使用,禁止用于医疗指导或商业用途。
This dataset encompasses global COVID-19 data released daily by the Center for Systems Science and Engineering (CSSE) at Johns Hopkins University, covering confirmed cases, recovered cases, and fatalities. Originally stored in a GitHub repository, this data was repurposed and displayed on the ARLAS Exploration platform by Gisaïa. Per the terms of use of Johns Hopkins CSSE, the data is solely permitted for educational and academic research purposes, and is prohibited for use in medical guidance or commercial applications.
提供机构:
Data-Gouv-FR搜集汇总
数据集介绍

构建方式
本数据集源自约翰·霍普金斯大学系统科学与工程中心(CSSE)发布的COVID-19全球疫情数据。构建过程依托官方公开的每日疫情统计报告,通过自动化采集与人工校验相结合的方式,系统性地整合了各国卫生部门、世界卫生组织(WHO)及区域疾控中心的权威数据。数据以每日更新的时间序列形式呈现,涵盖确诊病例、死亡病例、康复病例及检测数量等核心指标,并按照国家和地区维度进行分类汇总,确保全球疫情动态的全面性与时效性。
特点
该数据集的核心特色在于其高频率的更新机制与全球覆盖广度,提供了自疫情爆发以来逐日记录的详细指标,如累计确诊、新增确诊、死亡率及康复率等。数据字段设计严谨,包括地理编码、时间戳和统计口径说明,支持跨区域比较与趋势分析。此外,数据来源的权威性(约翰·霍普金斯CSSE)与透明度(附带原始报告链接)使其成为全球研究者、政策制定者及公共卫生机构广泛引用的基准资源。
使用方法
使用该数据集时,可直接加载CSV或JSON格式的每日更新文件,利用Pandas等工具按时间列进行排序与筛选,提取特定国家或日期范围的疫情动态。支持通过地理编码(如ISO国家代码)关联其他社会经济数据,用于建模分析疫情传播规律或政策影响。建议结合可视化库(如Matplotlib或Plotly)绘制疫情曲线,或构建机器学习模型预测趋势,注意需定期同步最新版本以避免数据滞后。
背景与挑战
背景概述
自2019年底新型冠状病毒肺炎(COVID-19)疫情爆发以来,全球公共卫生体系面临前所未有的考验。约翰霍普金斯大学系统科学与工程中心(CSSE)于2020年初开始系统收集并整理全球各国家与地区的疫情数据,创建了covid19-world-data-published-by-john-hopkins-csse数据集。该数据集由John Hopkins University的研究团队维护,核心研究问题在于实时追踪全球确诊病例、死亡人数与康复病例的时空分布,为流行病学建模、政策评估及公众信息传递提供高精度、高时效性的数据支撑。作为疫情数据领域的标杆资源,该数据集被广泛用于论文、政府决策及疫情可视化平台,对理解病毒传播规律、评估封锁措施成效具有深远影响。
当前挑战
该数据集在解决疫情数据标准化与动态追踪这一领域问题时面临多重挑战。全球各国数据报告标准不一,存在确诊定义差异、统计延迟与数据缺失问题,导致模型预测偏差与跨区域比较困难。构建过程中,研究团队需从不同语言与格式的官方来源中实时整合数据,处理因数据回溯修正带来的版本一致性难题,同时应对资源分布不均与人工核验的繁重负担。此外,数据隐私与政府信息透明度的平衡,以及保持长时间序列数据在政策突变下的连续性,构成持续考验。
常用场景
经典使用场景
该数据集由约翰霍普金斯大学系统科学与工程中心(CSSE)持续维护,收录了全球范围内新冠病毒(COVID-19)疫情的逐日统计数据。其经典使用场景涵盖疫情时空演变分析、各国防疫政策效果评估、以及流行病学传播模型的构建。研究者通常借助该数据集提取确诊病例、死亡病例与康复病例的动态序列,从而绘制疫情热力图、计算基本再生数(R₀),或结合移动性数据量化干预措施对传播速率的影响。在比较流行病学领域,该数据为跨国家、跨地区的疫情阶段划分与峰谷识别提供了标准化基础,成为全球抗疫研究中不可或缺的基石性资源。
衍生相关工作
基于该数据集,衍生了大量具有学术影响力的二次研究工作。其中之一是整合多源辅助信息(如谷歌移动性报告、政策响应追踪数据)的开源疫情分析框架,例如“COVID-19 Policy Response Database”与“Our World in Data—Coronavirus Pandemic”扩展面板。另一方面,研究者利用该数据发起了多项预测挑战赛,推动了时序预测模型(如Prophet、长短时记忆网络LSTM)在流行病学中的适应性改进。此外,该数据集催生了空间流行病学领域的跨学科协同,包括利用地理加权回归分析疫情与人口密度、医疗可及性的异质性关联,以及构建可解释人工智能系统用于早期暴发点检测。这些衍生工作不仅深化了对COVID-19疫情的理解,也为未来大流行数据基础设施建设树立了范式。
数据集最近研究
最新研究方向
聚焦于疫情时空传播动力学建模与公共卫生决策支持。随着全球新冠疫情进入常态化管理阶段,该数据集被广泛应用于构建高精度预测模型与干预策略评估。研究者利用其提供的逐日确诊病例、康复及死亡数据,结合地理空间分析技术,解析病毒变异株扩散规律、医疗系统承压阈值及非药物干预措施(如封锁、社交距离)的量化效果。尤其在变种病毒(如奥密克戎株)爆发期间,数据动态更新特性支持了实时风险评估与资源调配优化,助力跨区域协同防控策略的制定,深刻影响了后疫情时代全球公共卫生应急体系的韧性构建。
以上内容由遇见数据集搜集并总结生成



