electricsheepasia/asia-who-number-of-people-notified-with-new-episode-of-tb-in-a-given
收藏数据链接:
官方服务:
资源简介:
该数据集包含5,258个观测值,记录了48个亚洲国家在2000年至2021年间每年新发结核病病例的通报人数数据。数据来源于世界卫生组织全球健康观察站(WHO GHO),由Electric Sheep Asia重新打包发布,采用CC-BY-4.0许可证。数据集专注于一个指标:TB_notif_num,涵盖了国家代码、年份、数值等字段,适用于表格分类、回归和时间序列预测任务。
This dataset comprises 5,258 observations, recording the annual number of newly notified tuberculosis cases across 48 Asian countries between 2000 and 2021. The data is derived from the World Health Organization Global Health Observatory (WHO GHO), repackaged and distributed by Electric Sheep Asia, and is licensed under CC-BY-4.0. The dataset focuses on a single metric: TB_notif_num, and includes fields such as country code, year, and case count, making it applicable for tabular classification, regression, and time series forecasting tasks.
提供机构:
electricsheepasia搜集汇总
数据集介绍

构建方式
该数据集源自世界卫生组织(WHO)全球卫生观察站(GHO),由Electric Sheep Asia团队进行重新封装与标准化处理。原始数据经过系统性爬取与清洗后,被统一转化为Parquet格式,并构建了包含48个亚洲国家、覆盖2000年至2021年间、共计5258条观测记录的结构化表格。数据架构中设计了国家代码(country_iso3)、年份(year)、指标代码(indicator_code)及细分维度(dim1)等多个字段,以支持多维度分析。此外,数据集提供了细分维度的枚举值,如结核病例类型(新发、复治等),确保了数据在流行病学研究中的可解释性与复用性。
特点
该数据集的核心特点在于其地理与时间覆盖的广度与一致性,囊括了亚洲48个国家长达22年的结核病通报病例数,构建了区域性的纵向时间序列。数据结构清晰规范,包含一个核心指标“TB_notif_num”,同时提供病例类型等细分维度,便于进行亚组分析。数据集采用行业标准格式,并遵循CC-BY-4.0许可协议,保证了开放性与合规性。此外,数据经过统一归一化处理,可直接用于表格分类、回归分析及时间序列预测等机器学习任务,体现了高度的实用价值。
使用方法
用户可通过HuggingFace的datasets库,以一行代码`load_dataset`快速加载数据,并转换为Pandas DataFrame进行后续操作。该数据集支持多种典型分析模式:可按国家代码筛选特定地区的结核病通报数据;可对单一指标按年份排序生成时间序列并进行可视化;还可通过透视表操作,将数据重塑为国家×年份的矩阵格式,便于进行横向比较与面板数据分析。这种简洁而灵活的数据接口设计,使得研究人员能够高效地开展流行病学建模、趋势预测及健康政策评估等工作。
背景与挑战
背景概述
结核病(Tuberculosis, TB)作为全球公共卫生领域的重大挑战之一,长期位列单一传染病致死病因的榜首,尤其在亚洲地区,其疾病负担尤为沉重。世界卫生组织(WHO)全球卫生观测站(GHO)系统旨在系统性地收集、整合与发布各国关键卫生指标数据,为全球疾病监测与政策制定提供循证基础。该数据集由Electric Sheep Asia于2024年对WHO GHO原始数据进行了重新封装与标准化处理,涵盖了2000年至2021年间48个亚洲国家每年新增结核病例报告人数的观测记录,共计5258条。其核心研究问题聚焦于量化亚洲区域结核病通报的动态变化,揭示不同地区、不同病例分型(如新发、复发、肺外结核等)的流行病学特征,为结核病防治策略的评估与优化提供高质量的时间序列数据支持。数据集的发布显著提升了亚洲地区结核病数据的可获取性与机器学习友好度,对全球健康数据科学、时空流行病学分析以及卫生政策研究具有重要推动作用。
当前挑战
该数据集所应对的核心领域问题在于结核病防控中的通报病例监测与疾病负担精确量化。尽管WHO GHO提供了权威数据源,但各国在结核病诊断能力、报告系统完善度与数据透明度上存在显著差异,导致病例漏报、误报及时间序列不连续等数据质量问题频发。在数据集构建过程中,主要挑战包括:跨国家、跨年份的原始数据格式异构与缺失值处理,需通过标准化模式将多源异构数据统一为规范的表格结构;来自不同数据来源(如WHO GHO原始API与本地化报告)的数据在时间跨度、指标定义与分类体系上存在冲突,需要严谨的映射与去重策略;此外,病例分型维度(如新发与复发、肺结核与肺外结核)的标签一致性维护、以及低资源国家数据稀疏性对模型训练的潜在偏差问题,均为构建可靠时间序列数据集带来了技术挑战。
常用场景
经典使用场景
在结核病流行病学与公共卫生监测领域,该数据集作为亚洲地区结核病通报病例数的标准化时序记录,最经典的应用场景是进行跨国家、跨年份的结核病负担量化分析与趋势建模。研究人员可借助其统一的指标定义与结构化字段,构建面板数据模型,评估不同亚洲国家在2000至2021年间结核病发现能力的动态演变,揭示地区内部分异格局。此外,该数据亦常用于时间序列预测任务,通过整合历史通报数据与协变量信息,对未来结核病新发病例数进行推断,为区域疾病防控策略的制定提供数据支撑。
衍生相关工作
该数据集在衍生研究方面催生了一系列具有代表性的学术工作。围绕其核心变量,研究者构建了融合社会经济与气象协变量的多层次贝叶斯时空模型,用以解释结核病通报数字背后的空间异质性与时间滞后效应。另有多项工作聚焦于数据缺失值插补与机器学习预测的交叉领域,利用全球疾病负担数据和政策干预指标增强原始序列的预测稳定性。此外,以该数据集为基础开发的端到端时序预测管道已被纳入多个开源公共卫生分析库,成为相关领域方法学实验的标准基准之一。
数据集最近研究
最新研究方向
该数据集基于世界卫生组织全球卫生观察站(WHO GHO)的权威数据,覆盖2000至2021年间48个亚洲国家的结核病新发通报人数,为区域结核病流行病学建模、时间序列预测以及政策效果评估提供了关键支撑。当前前沿研究方向聚焦于利用机器学习与深度学习模型,结合社会经济与气候变量,预测结核病发病趋势及其空间异质性,尤其是在印度、中国等高负担国家。此外,随着全球实现终结结核病战略目标的紧迫性增加,该数据也助力于研究疫情后通报率的变化、病例检测缺口以及干预措施的优先级排序,对指导亚洲地区的公共卫生资源配置与防控策略优化具有深远意义。
以上内容由遇见数据集搜集并总结生成



