electricsheepasia/asia-who-number-of-people-diagnosed-with-new-episode-of-pulmonary-tb-umnewrelep
收藏数据链接:
官方服务:
资源简介:
该数据集包含亚洲地区被诊断患有肺结核新病例且同时患有肺外结核的人数数据,涵盖48个亚洲国家,时间跨度为2000年至2021年,共1,054个观测值。数据来源于世界卫生组织全球健康观察站,涉及1个独特指标(TB_notif_num_newrel_ep),包括指标代码、国家代码、年份、数值等列。数据集由Electric Sheep Asia重新打包,旨在为亚洲地区提供统一的、机器学习就绪的数据层。
This dataset contains data on the number of people diagnosed with a new episode of pulmonary tuberculosis who also have extrapulmonary tuberculosis in Asia, covering 48 Asian countries from 2000 to 2021, with 1,054 observations. The data is sourced from the WHO Global Health Observatory and includes one distinct indicator (TB_notif_num_newrel_ep), with columns such as indicator code, country code, year, and numeric values. The dataset is repackaged by Electric Sheep Asia as part of a unified, ML-ready data layer for Asia.
提供机构:
electricsheepasia搜集汇总
数据集介绍

构建方式
该数据集由Electric Sheep Asia从世界卫生组织全球卫生观察站(WHO GHO)官方数据源整合、清洗并重新打包而成。原始数据经过标准化模式处理,以Parquet格式存储,确保机器学习就绪。数据集涵盖2000年至2021年间48个亚洲国家的单一指标——新诊断肺外结核病例数,共计1054条观测记录。每个样本包含国家ISO代码、WHO区域、年份、病例类型维度及对应的数值与高低估计范围,结构清晰便于直接使用。
特点
数据集的突出特点在于其聚焦性、区域完整性与时间跨度。它专门针对亚洲地区肺外结核新发病例这一特定公共卫生指标,覆盖了从阿富汗到中国的48个亚洲国家,时间序列长达22年。每个国家均提供22个年度观测点,形成近乎平衡的面板数据。此外,数据附带了病例类型(TB_CASETYPE)作为唯一分解维度,并包含数值的上下置信区间,为流行病学分析与时空建模提供了稳健基础。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据集,并将其转换为Pandas DataFrame进行后续分析。典型用法包括按国家ISO代码筛选单一国家的时间序列数据,按指标代码对数值列进行时间序列可视化,或通过透视表将数据重构为国家×年份的矩阵形式,便于进行跨国家比较或面板数据回归。数据集兼容表格分类、回归与时序预测等多种任务范式。
背景与挑战
背景概述
结核病(Tuberculosis, TB)作为全球公共卫生领域的重大威胁,尤其在亚洲地区呈现出高度的疾病负担。世界卫生组织(WHO)全球卫生观察站(GHO)自2000年起系统收集结核病相关流行病学数据,旨在为各国制定防控策略提供科学依据。由Electric Sheep Asia于2021年重新整合发布的“asia-who-number-of-people-diagnosed-with-new-episode-of-pulmonary-tb-umnewrelep”数据集,聚焦于亚洲48个国家中确诊新发肺结核并伴有肺外结核的患者数量,涵盖2000至2021年间共1054条观测记录。该数据集的核心研究问题在于量化肺外结核在肺结核患者中的共发情况,弥补了区域级细粒度流行病学数据的空白,为流行病学建模、卫生资源分配及跨国比较研究提供了标准化基础,显著推动了亚洲结核病监测与分析领域的进展。
当前挑战
该数据集所应对的领域挑战在于,肺外结核的诊断常因其临床表现的非特异性而被低估或漏报,导致疾病负担的精确评估产生偏差。跨国家、跨时间的数据收集面临多重构建难题:首先,48个亚洲国家的卫生信息系统参差不齐,诊断标准与报告流程的差异使得数据可比性大打折扣,WHO需协调各国采用统一指标编码(如TB_notif_num_newrel_ep)以缓解异质性;其次,2000至2021年间部分国家存在历史数据缺失或记录不连续问题,原始来源中“value_low”与“value_high”字段常为缺失值(以“—”表示),反映出数据估计的不确定性;再者,跨越22年的长期监测需应对诊断技术演进与报告政策变化带来的结构性断点,而在重新包装过程中,将非结构化数据转化为机器学习就绪的表格格式时,需维护时间序列与地理维度的完整性,避免因数据清洗而丢失关键流行病学信号。
常用场景
经典使用场景
该数据集收录了2000年至2021年间亚洲48个国家新诊断肺外结核病例的官方通报数据,共计1054条观测记录。其经典使用场景集中于时间序列分析与跨国横向比较,研究者常利用该数据集的年份与国别维度,绘制单一国家或区域的肺外结核发病趋势曲线,或构造国家×年份的矩阵面板,用于揭示亚洲地区肺外结核负担的时空演变规律。数据集中标准化后的数值字段(value_numeric)为量化模型提供了整洁的输入,使得基于Python的统计计算与可视化工作流得以高效开展。
衍生相关工作
围绕该数据集衍生的工作主要集中在三个方向:一是构建亚洲肺外结核负担的时空统计模型,利用面板数据回归或贝叶斯层次模型估计漏报率与真实发病率;二是将其与结核病诊治覆盖率、耐药性监测等关联指标融合,开发多变量预测工具以评估防控干预的长期影响;三是催生了一系列可视化仪表盘与交互式地图项目,如整合WHO GHO数据的亚洲健康指标浏览器,使公共卫生数据对非专业用户更为可及,推动了数据民主化在流行病学领域的实践。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区肺外结核新发病例的时空分布与监测趋势,为全球结核病防控研究提供了关键的流行病学证据。在WHO终结结核病战略的宏大框架下,基于2000至2021年间48个亚洲国家的面板数据,研究者得以深入剖析疾病负担的地域异质性与时间演化规律,尤其为评估新冠疫情对结核病诊断中断的影响、优化区域性筛查资源配置,以及构建基于机器学习的疫情预警模型开辟了前沿路径。该数据的价值在于弥合了公共卫生统计与可计算数据科学之间的鸿沟,使因果推断与时间序列预测在亚洲高负担国家成为可能,对推进精准防控与实现可持续发展目标下的健康指标具有不可替代的实证意义。
以上内容由遇见数据集搜集并总结生成



