遇见数据集

electricsheepasia/asia-who-number-of-people-diagnosed-with-new-episode-of-pulmonary-tb-numlabconf

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含1048个观测值,涉及“经细菌学确诊的初诊肺结核患者人数”的数据,覆盖48个亚洲国家,时间跨度为2000年至2021年,涵盖1个独特指标。数据来源于世界卫生组织全球健康观察站(WHO GHO),由Electric Sheep Asia重新打包发布,用于表格分类、回归和时间序列预测等任务。数据集包括指标代码、国家ISO3代码、WHO区域、年份、分解维度、数值和显示值等列,支持过滤、时间序列分析和矩阵转换等使用场景。

This dataset contains 1,048 observations of Number of people diagnosed with new episode of pulmonary TB who are bacteriologically confirmed. data across 48 Asia countries, spanning 2000–2021, covering 1 distinct indicator. The data is sourced from the WHO Global Health Observatory, repackaged by Electric Sheep Asia, and is intended for tabular classification, regression, and time-series forecasting tasks. It includes columns such as indicator code, country ISO3 code, WHO region, year, disaggregation dimensions, numeric and display values, and supports usage scenarios like filtering, time-series analysis, and matrix pivoting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-who-number-of-people-diagnosed-with-new-episode-of-pulmonary-tb-numlabconf 数据集图片
构建方式
该数据集源自世界卫生组织全球卫生观察站(WHO GHO)的官方数据,由Electric Sheep Asia团队重新封装发布。原始数据经过系统化的清理与标准化处理,最终形成包含1,048条观测记录的表格型数据集。构建过程聚焦于亚洲地区48个国家在2000年至2021年间经细菌学确诊的肺结核新发病例人数这一核心指标,确保每个国家对应22个年度数据点,并保留了国家ISO代码、区域分类、病例类型等结构化字段,以支撑多维度分析与时间序列建模。
使用方法
用户可通过HuggingFace Datasets库中的load_dataset函数一键加载数据,并利用Pandas进行数据操作。典型使用路径包括按国家筛选以聚焦区域疫情趋势,选取单一指标绘制时间序列图以观察变化规律,或通过数据透视将长格式转换为国家×年度矩阵,便于构建监督学习特征。数据集兼容多种机器学习任务,可直接用于回归或时间序列预测模型的训练与评估,极大简化了从原始静态数据到可分析数据框架的转换流程。
背景与挑战
背景概述
结核病(TB)作为全球主要的传染病死因之一,其精准监测对于疾病防控至关重要。该数据集由世界卫生组织(WHO)全球卫生观察站(GHO)整理,由Electric Sheep Asia于2021年重新封装发布,聚焦于亚洲48个国家和地区2000年至2021年间经细菌学确诊的新发肺结核病例数量。核心研究问题在于量化亚洲地区结核病诊断的实验室确认情况,为区域流行病学分析、卫生政策制定及干预措施效果评估提供标准化数据支撑。该数据集整合了WHO权威的官方统计,覆盖时空跨度广泛的纵向记录,是结核病负担评估和公共卫生研究中不可替代的基础资源,对推动亚洲乃至全球结核病防控策略的科学化具有重要影响力。
当前挑战
该数据集所解决的领域问题主要在于结核病流行病学监测的精准化挑战:传统上亚洲各国结核病诊断报告标准不一,细菌学确认比例差异显著,缺乏统一可比的高质量数据结构来追踪确诊病例的时间序列变化。构建过程中则面临多重障碍:首先,WHO原始数据来源分散,不同国家上报格式与时间粒度不同,需进行严格的标准化与清洗;其次,48个国家的历史数据存在缺失或低置信区间值,如数据表中'value_low'和'value_high'字段常显示为空值,反映指标估算的不确定性;此外,数据集仅提供单一指标'TB_notif_num_labconf',缺乏病例分类如复发与新发的细粒度划分,限制了深层次病因分析的能力。
常用场景
经典使用场景
在公共卫生与流行病学领域,该数据集常被用于分析亚洲各国肺结核(TB)确诊病例的时空分布特征。研究者可利用其覆盖2000至2021年间48个亚洲国家的年度观测数据,通过时间序列分析揭示区域结核病负担的动态演变规律,或借助面板数据模型探索社会经济、卫生政策等因素对结核病发现率的影响。数据集的标准化结构使得跨国家、跨年份的比较研究变得便捷,尤其适用于评估世界卫生组织“终结结核病战略”在亚洲地区的实施进展。
解决学术问题
该数据集有效解决了亚洲结核病监测数据碎片化、口径不统一的学术难题。通过提供经WHO标准化的、可追溯至国家层面的年度确诊病例数值,它弥补了全球健康数据库中亚洲区域精细化分析的缺口。研究者利用这些数据可以验证结核病传播动力学模型的预测准确性,量化诊断覆盖率提升对病例报告数量的贡献,并识别数据缺失或报告延迟的系统性偏差,从而为优化疾病监测体系提供统计证据。
实际应用
在实际应用中,该数据集支持各国卫生部门开展结核病防控资源的精准规划。基于历史病例趋势,公共卫生机构能够预测特定区域未来可能出现的诊断需求高峰,从而合理调配实验室检测试剂、药品储备和医疗人力。国际组织如WHO和亚洲开发银行也可借助数据集追踪国家层面的防控目标达标情况,评估资金投入与病例发现的关联效率,为制定区域性结核病联合干预策略提供数据依凭。
数据集最近研究
最新研究方向
该数据集源于世界卫生组织全球卫生观察站,聚焦于亚洲48个国家2000至2021年间经细菌学确诊的新发肺结核病例人数。在当今全球结核病防控形势依然严峻的背景下,尤其是亚洲地区作为结核病高负担区域,该数据集为流行病学建模、时空传播规律挖掘以及卫生政策评估提供了关键基础。前沿研究正借助此类细粒度时间序列数据,结合机器学习与深度学习技术,构建预测预警系统,以优化资源配置和干预策略。此外,结合新冠疫情对结核病诊疗服务的冲击,研究者利用该数据分析诊断延误、病例报告波动等动态变化,为在后疫情时代重建和强化结核病防控体系提供了实证依据,具有显著的公共卫生与现实意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务