遇见数据集

electricsheepasia/asia-who-cases-started-on-mdr-tb-treatment

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于开始接受耐多药结核病(MDR-TB)治疗的病例的数据,涵盖48个亚洲国家,时间跨度为2008年至2024年,共有761个观测值,涉及1个不同的指标。数据来源于世界卫生组织全球健康观察站(WHO GHO),由Electric Sheep Asia重新打包,以支持机器学习和研究使用。数据集包括指标代码、国家ISO3代码、世界卫生组织区域、年份、数值型值、显示值等字段,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 761 observations of Cases started on MDR-TB treatment data across 48 Asia countries, spanning 2008–2024, covering 1 distinct indicators. The data is sourced from the WHO Global Health Observatory (GHO), repackaged by Electric Sheep Asia, and is designed for machine learning and research purposes. It includes fields such as indicator code, country ISO3 code, WHO region, year, numeric value, and display value, and is suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-who-cases-started-on-mdr-tb-treatment 数据集图片
构建方式
本数据集源自世界卫生组织全球卫生观测站(WHO Global Health Observatory)的官方公开数据,经Electric Sheep Asia团队重新封装与标准化处理而成。原始数据涵盖2008年至2024年间亚洲48个国家的耐多药结核病(MDR-TB)治疗启动病例记录。构建过程中,团队统一了数据模式,将指标代码、国家ISO3代码、年份、数值及置信区间等字段以Parquet格式存储,并上传至HuggingFace Datasets平台,确保研究者可通过`load_dataset()`函数快速调用。
使用方法
用户可通过HuggingFace的`datasets`库直接加载该数据集:`load_dataset("electricsheepasia/asia-who-cases-started-on-mdr-tb-treatment")`,随后转换为Pandas DataFrame进行探索。典型操作包括按国家过滤数据、对特定指标进行时间序列可视化,或通过透视表构建国家×年份的数值矩阵。这些功能使得研究人员能够高效地分析亚洲地区耐多药结核病治疗的时空动态,为公共卫生决策提供数据支撑。
背景与挑战
背景概述
耐多药结核病(MDR-TB)作为全球公共卫生领域的重大威胁,其治疗覆盖率的监测与评估是遏制结核病流行的关键环节。世界卫生组织(WHO)通过全球卫生观察站(GHO)长期系统性地收集各国结核病防控数据,为跨国比较与政策制定提供了科学依据。该数据集由Electric Sheep Asia于2024年重新整理并发布,聚焦亚洲48个国家和地区在2008年至2024年间启动MDR-TB治疗的患者数量,共计761条观测记录。作为亚洲区域唯一标准化的MDR-TB治疗启动数据资源,该数据集填补了高负担区域在耐药结核病治疗覆盖率精细化分析上的空白,为流行病学建模、资源配置优化及健康公平性研究提供了基础支撑,显著提升了区域卫生决策的数据驱动能力。
当前挑战
该数据集所解决的核心领域问题在于,耐多药结核病治疗覆盖率长期存在数据碎片化与报告不一致的现象,导致各国难以有效评估防控进展,亦无法精准识别治疗缺口。在构建过程中,主要挑战包括:其一,原始数据来源复杂,涉及WHO-GHO多国多年度上报机制,需统一处理不同国家在指标定义、统计口径上的差异;其二,数据存在大量缺失值与异常值,如置信区间字段及部分年份的统计空白,需采用规范化填充策略以保证时间序列分析的连续性;其三,跨年跨国的数据对齐任务繁重,需将48个国家17年的非平衡面板数据转换为适用于机器学习的结构化格式,以支持分类、回归及时间序列预测等下游任务。
常用场景
经典使用场景
该数据集收录了世界卫生组织全球卫生观测站发布的2008至2024年间48个亚洲国家启动耐多药结核病治疗病例的观测数据,共包含761条记录。作为横跨时序与截面维度的标准化表格数据,其经典使用场景聚焦于跨国界、长周期的耐多药结核病治疗覆盖率的趋势分析。研究者常通过将数据透视为国家×年份矩阵,结合单一指标'TB_c_mdr_tx'构建面板数据,以便利用时间序列预测、聚类分析或回归模型揭示区域内不同国家在耐多药结核病治疗启动规模上的演变规律与异质性特征。
解决学术问题
在公共卫生与流行病学领域,该数据集系统性地填补了亚洲地区耐多药结核病治疗启动病例长期跨国可比数据的空白,解决了既往因各国报告口径不一、数据零散而难以开展区域综合评估的难题。学者得以基于此量化分析治疗覆盖率的时空分布格局,识别治疗缺口持续存在的脆弱国家,并通过面板计量模型探索卫生投入、政策干预与治疗启动率之间的关联。这为全球终止结核病策略的效果评估提供了关键的经验证据,推动针对亚洲高负担地区的精准干预方案设计。
实际应用
在实际应用层面,该数据集为国际卫生组织、各国疾控部门及非政府组织优化耐多药结核病防治资源调配提供了数据驱动的决策支持。具体而言,公共卫生机构可依据各国逐年治疗启动病例的变化趋势,动态调整药品采购与实验室诊断能力的区域配置,例如优先加强对印度、缅甸等持续高病例国家或治疗覆盖率骤降地区的支持。此外,基于该数据构建的预测模型还可用于早期预警,当检测到某国治疗启动数异常下降时,及时启动流行病学调查以排查诊断延误或治疗可及性下降的深层原因。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区耐多药结核病(MDR-TB)治疗启动病例的监测,为全球卫生治理和传染病流行病学研究提供了关键的时序数据支撑。在当前耐药结核病成为公共卫生重大挑战的背景下,数据集覆盖48个亚洲国家2008至2024年的观测值,可推动基于时间序列的疾病负担评估、治疗覆盖率分析及区域卫生政策效果量化研究。特别是与WHO全球卫生观察站(GHO)的深度对接,使其成为探索MDR-TB治疗可及性差异、评估“终止结核病”战略进展的理想数据源,并助力机器学习模型在卫生资源分配与疫情预警中的前沿应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务