遇见数据集

electricsheepasia/asia-who-new-or-unknown-treatment-history-cases-pulmonary

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲48个国家从2000年至2023年关于新发或未知治疗史病例:肺部、细菌学确诊的640个观测值,涵盖1个独立指标。数据来源于世界卫生组织全球健康观察站(WHO GHO),重点关注结核病健康领域,具体涉及肺部、细菌学确诊的结核病新发病例或治疗史未知病例的统计信息。数据集经过Electric Sheep Asia重新打包,以表格形式提供,包括指标代码、国家代码、年份、数值等字段,适用于表格分类、回归或时间序列预测等机器学习任务。

This dataset contains 640 observations of New or unknown treatment history cases: Pulmonary, bacteriologically confirmed data across 48 Asia countries, spanning 2000–2023, covering 1 distinct indicators. The data is sourced from the WHO Global Health Observatory (GHO), focusing on tuberculosis health topics, specifically statistics on new or previously unknown treatment history cases of pulmonary, bacteriologically confirmed tuberculosis. Repackaged by Electric Sheep Asia, it is provided in tabular format with fields such as indicator code, country code, year, and numeric values, suitable for machine learning tasks like tabular classification, regression, or time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-who-new-or-unknown-treatment-history-cases-pulmonary 数据集图片
构建方式
本数据集源自世界卫生组织全球卫生观察站(WHO GHO),由Electric Sheep Asia团队进行重新整理与封装。数据提取自WHO官方数据库,聚焦于亚洲地区新发或未知治疗史的细菌学确诊肺结核病例。构建过程中,原始数据经过标准化模式处理,以Parquet格式存储,确保机器学习友好的数据结构。最终数据集包含640条观测记录,覆盖48个亚洲国家,时间跨度从2000年至2023年,涵盖单一指标编码'TB_new_labconf',并附有数值、置信区间及显示格式等多元字段。
特点
该数据集的核心特色在于其地理与时间维度的精细覆盖:横跨48个亚洲国家,时间跨度达24年,为区域结核病流行病学分析提供了连贯的长序列数据。数据收录了'新发或未知治疗史'这一关键临床分类,辅以数值、低值、高值及显示格式等多重字段,便于研究者进行数值计算与可视化呈现。此外,数据集采用cc-by-4.0许可协议,确保了学术使用的灵活性与合规性。
使用方法
用户可通过HuggingFace datasets库直接加载数据集,调用`load_dataset("electricsheepasia/asia-who-new-or-unknown-treatment-history-cases-pulmonary")`即可获取训练集并转换为Pandas DataFrame。支持按国家ISO代码筛选特定地区数据,如过滤印度尼西亚(IDN)的病例记录;亦可通过指示器代码对'TB_new_labconf'进行时间序列分析,按年份排序后绘制趋势图。此外,矩阵透视功能允许将数据重塑为国家×年份的二维结构,便于跨区域比较与建模研究。
背景与挑战
背景概述
该数据集由世界卫生组织全球卫生观测站(WHO GHO)于2000年至2023年间系统收集,后经Electric Sheep Asia团队重新整理并发布于HuggingFace平台。数据集聚焦于亚洲48个国家中初治或治疗史未知的肺结核病例,具体涵盖经细菌学确诊的肺结核患者数量。作为全球公共卫生监测的关键指标,这一数据集为研究亚洲地区结核病流行趋势、评估防控政策效果提供了宝贵的时间序列数据。其发布极大便利了流行病学研究者与公共卫生政策制定者,通过标准化格式和可复现接口,助力实现区域健康数据的开放共享与机器学习驱动的预测分析。
当前挑战
该数据集所应对的领域挑战在于:传统结核病监测数据常因报告标准不一、历史记录缺失而难以准确评估疫情演变,尤其针对‘治疗史未知’这一模糊群体,其病例的真实负担与传播风险常被低估。数据构建过程中,挑战在于整合来自48个国家、跨越24年的分散上报数据,各国诊断能力、报告时效与数据编码方式差异显著,需通过WHO GHO的统一标准化流程进行清洗与对齐。此外,部分国家早期年份数据稀疏,低值和高值置信区间常以占位符表示,给完整时间序列构建与模型训练带来插补与不确定性处理的难题。
常用场景
经典使用场景
在公共卫生与传染病流行病学领域,该数据集最为经典的使用场景是作为时间序列分析的基础资源,用于揭示亚洲地区肺结核新发或未知治疗史病例的长期演变趋势。通过整合48个国家长达24年的观测数据,研究者能够借助纵向建模方法,描绘结核病传播的动态轨迹,识别不同国家在疾病控制成效上的异质性,并评估特定干预措施对病例数量的影响。其结构化的国家-年份矩阵设计,使得跨区域比较和纵向因果关系推断变得便捷,为区域性的结核病负担估算提供了可靠的量化支撑。
解决学术问题
该数据集有效回应了亚洲结核病研究中长期存在的数据碎片化与标准缺失问题。此前,针对亚洲地区新发或未知治疗史结核病例的系统性横截面与纵向数据较为匮乏,导致跨国间疾病负担的比较难以开展。该数据集通过统一指标定义(TB_new_labconf)和标准化采集时点,填补了亚洲区域结核病流行病学数据库的关键空白,使学者得以系统性地考察疫情的空间扩散特征、时间周期性规律以及经济社会发展水平对疾病传播的影响,为全球结核病终结战略的亚洲版块提供了不可或缺的经验证据。
衍生相关工作
基于该数据集已衍生出若干具有启发性的研究工作。一条典型线索是利用其时间序列特性构建自回归移动平均(ARIMA)或长短期记忆(LSTM)模型,对亚洲各国结核病确诊数量进行短期预测,比较不同建模策略在有限样本下的预测精度。另一重要方向是将该数据与更广泛的社会经济指标(如人均GDP、医疗支出占比)进行关联分析,运用面板数据回归模型揭示疾病发生率的结构性驱动因素。此外,也有工作将其作为基准测试集,用于评估跨库联邦学习框架在处理稀疏、异质医疗时间序列时的有效性,推动了隐私保护下的区域健康协作研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务