electricsheepasia/asia-who-number-of-people-diagnosed-with-new-episode-of-pulmonary-tb-wrelclindx
收藏数据链接:
官方服务:
资源简介:
该数据集包含亚洲48个国家在2000年至2021年间临床诊断为肺结核新发病例的人数统计数据,共1054个观测值。数据来源于世界卫生组织全球健康观察站,涵盖1个核心指标(TB_notif_num_newrel_clindx),包含国家代码、年份、数值型数据及分类维度等信息。数据集经过Electric Sheep Asia重新打包,采用标准化模式,适用于表格分类、回归和时间序列预测等机器学习任务。
This dataset contains 1,054 observations of Number of people diagnosed with new episode of pulmonary TB who are clinically diagnosed data across 48 Asia countries, spanning 2000-2021, covering 1 distinct indicator. The data is sourced from WHO Global Health Observatory, repackaged by Electric Sheep Asia, and includes structured fields such as indicator code, country ISO3 codes, year, numeric values, and disaggregation dimensions for tabular machine learning tasks.
提供机构:
electricsheepasia搜集汇总
数据集介绍

构建方式
该数据集源自世界卫生组织全球卫生观察站(WHO GHO),由Electric Sheep Asia团队进行清洗、标准化并重新封装而成。原始数据经由权威公共卫生机构采集,覆盖2000年至2021年间亚洲48个国家的年度统计数值。数据集以单一指标“TB_notif_num_newrel_clindx”为核心,记录了临床诊断的初发肺结核病例数量。所有观测值均以Parquet格式存储,并经由自动化管道整合,确保数据结构一致、便于机器读取。每一条记录均包含国家ISO代码、WHO区域、年份及数值字段,且提供了分解维度列以标识病例类型,从而保证数据的可解释性与跨时间、跨地域的可比性。
特点
本数据集共包含1,054条观测记录,涵盖48个亚洲国家,时间跨度22年,是研究亚洲地区肺结核临床诊断病例时空分布的重要资料。其显著特点在于数据的高度结构化与标准化:所有字段均具有明确的类型定义,且包含统一的指标编码体系,便于进行跨国与跨年度的比较分析。此外,数据集提供了数值的低值和高值估计范围,以及显示格式的数值,便于不同精度需求的统计建模与可视化呈现。数据许可证为CC-BY 4.0,允许广泛使用,同时保留了WHO原始数据的权威属性。
使用方法
使用者可通过HuggingFace Datasets库的load_dataset函数直接加载该数据集,其返回的Dataset对象可便捷地转换为Pandas DataFrame,以便进行后续的数据探索与建模。典型操作包括按国家ISO代码过滤特定国家的数据序列,或按年份排序构建时间序列曲线。研究人员亦可利用pivot_table方法将数据重塑为国家×年度的矩阵格式,适用于面板数据分析或机器学习中的特征工程。数据集已内置分解维度,支持按病例类型等分组进行聚合运算,从而满足多层次统计分析需求。参考示例代码可在几行Python命令内完成从加载到可视化的完整流程。
背景与挑战
背景概述
结核病(TB)作为全球公共卫生领域的重大挑战,尤其在亚洲地区,其监测与防控一直是世界卫生组织(WHO)关注的核心议题。该数据集由WHO全球卫生观察站(GHO)整理,经Electric Sheep Asia于2021年重新封装并发布至HuggingFace平台,聚焦于亚洲48个国家2000年至2021年间临床诊断为新发肺结核病例的人数统计。这一资源为流行病学建模、区域疾病负担评估及卫生政策制定提供了关键数据支撑,尤其在描绘亚洲结核病的时空分布特征上具有重要价值,推动了该领域从经验性描述向数据驱动分析的转型。
当前挑战
当前数据面临的核心挑战在于,临床诊断病例的数量统计易受到各国卫生系统覆盖能力、诊断标准差异及漏报现象的影响,导致数据存在潜在的系统性偏差,进而影响区域间比较的可靠性与时间序列分析的稳健性。此外,数据集仅包含单一指标,缺乏对于病例确诊手段(如分子检测与镜检)的细分以及年龄、性别等人口学分层信息,限制了其对结核病传播动态与高危人群识别的深入解析能力。构建过程中,跨年代、跨国别的数据整合亦需应对WHO报告格式变化与缺失值处理的挑战,以确保时间序列的连续性与可比性。
常用场景
经典使用场景
在传染病流行病学与全球公共卫生监测领域,该数据集凭借其覆盖亚洲48个国家、跨越2000年至2021年的纵向时序结构,构成了研究肺结核临床诊断病例分布格局的基石。研究者通常将其用于构建面板数据模型,以揭示不同国家间新发肺结核临床诊断人数的时空演变轨迹;亦或通过时间序列分析方法,捕捉诊断率在年度尺度上的波动特征与潜在趋势,为区域疾病负担评估提供量化依据。
解决学术问题
该数据集精准填补了亚洲区域内肺结核临床诊断病例长期、跨国可比数据的空白,解决了既往研究中因各国统计口径不一或时间跨度不足而难以开展跨国比较的学术困境。它使学者得以量化分析临床诊断在肺结核病例发现体系中的角色变迁,评估诊断策略有效性,并探索社会经济、卫生政策等因素与诊断人数之间的关联,从而推动全球健康治理中证据驱动的决策范式发展。
衍生相关工作
该数据集衍生出一系列以亚洲肺结核诊断动态为核心的经典工作,包括跨国诊断趋势的可视化分析报告、基于机器学习的诊断人数预测模型,以及融合WHO其他健康指标的关联性研究。此外,它常被用作时序预测基准数据集,驱动针对稀疏面板数据的算法改进;部分学者还将其与地理空间数据结合,绘制肺结核诊断热力图,深化对环境与诊断率交互作用的理解。
以上内容由遇见数据集搜集并总结生成



