moukaii/Tuberculosis_Dataset
收藏资源简介:
该数据集是从原始“MultiCaRe数据集”中筛选出的专注于肺结核患者的多模态数据集,包含肺部计算机断层扫描(CT)影像数据和肺结核患者的临床病例记录,以及病例关键词、CT图像描述、患者ID、性别和年龄信息。数据集支持的任务包括胸部CT图像分割和肺结核分类算法的开发,以及从临床记录中提取医学术语的NLP方法。数据集的语言为英语,数据字段包括case_id、gender、age、case_text、keywords、pics_array和Caption。数据集的初始收集和预处理过程包括从原始MultiCaRe数据集中筛选出与肺结核相关的病例报告、图像和描述,并通过Hugging Face Python脚本进行进一步处理。数据集的社会影响主要体现在提高肺结核诊断的准确性和效率。数据集的偏差、风险和局限性包括选择偏差、技术偏差、解释偏差、隐私和保密风险、数据完整性和质量风险,以及数据质量的局限性。
该数据集是从原始“MultiCaRe数据集”中筛选出的专注于肺结核患者的多模态数据集,包含肺部计算机断层扫描(CT)影像数据和肺结核患者的临床病例记录,以及病例关键词、CT图像描述、患者ID、性别和年龄信息。数据集支持的任务包括胸部CT图像分割和肺结核分类算法的开发,以及从临床记录中提取医学术语的NLP方法。数据集的语言为英语,数据字段包括case_id、gender、age、case_text、keywords、pics_array和Caption。数据集的初始收集和预处理过程包括从原始MultiCaRe数据集中筛选出与肺结核相关的病例报告、图像和描述,并通过Hugging Face Python脚本进行进一步处理。数据集的社会影响主要体现在提高肺结核诊断的准确性和效率。数据集的偏差、风险和局限性包括选择偏差、技术偏差、解释偏差、隐私和保密风险、数据完整性和质量风险,以及数据质量的局限性。
数据集概述
数据集简介
该数据集是从原始的“The MultiCaRe Dataset”中精心筛选,专注于胸结核患者。这是一个多模态数据集,包含肺部计算机断层扫描(CT)影像数据和结核病患者的临床病例记录,以及病例关键词、CT图像的说明、患者ID、性别和年龄信息。
支持的任务
该数据集可用于:
- 开发胸部CT图像分割和结核阳性或对照分类的算法。
- 开发新的自然语言处理(NLP)方法和无监督机器学习方法,从临床笔记中提取医学术语。
语言
英语
数据结构和实例
数据遵循以下结构: json { "case_id": "PMC10129030_01", "gender": "male", "age": 62, "case_text": "A 62-year-old man presented with acute dyspnea at rest, requiring high-flow…", "keywords": "["dendriform pulmonary ossification", "lung transplant", "pulmonary fibrosis"]", "pics_array": image, "Caption": "coronal. chest CT shows ground-glass and reticular opacities in the dependent…" }
数据字段
- case_id (string): 患者ID,由文章的PMC加上一个顺序号组成。
- gender (string): 患者性别,可以是Female, Male, Transgender或Unknown。
- age (int): 患者年龄,低于1岁的年龄被分配为0。
- case_text (string): 自解释。
- keywords (string): 关键词,有时在文章内容的关键词部分提供。
- pics_array (int): 图像
- Caption (string): 图像说明。
初始数据收集和预处理
- 原始的MultiCaRe Dataset大约9GB,涵盖多种医学专业。为了创建专注于结核病的子集,数据集根据特定标准进行过滤:
- 病例报告选择:选择标准是包含关键词如tuberculosis或tb的报告。
- 说明过滤:进一步过滤包含关键词如ct, lung, 或chest的说明。
- 图像标注:最后,根据标签ct和lung选择图像。
- 在从MultiCaRe Dataset初步过滤后,通过Hugging Face的Python脚本实施额外的处理步骤:
- 排除缺少年龄信息的记录。
- 合并来自不同文件的数据,包括.csv, .JSON和.jpg。
社会影响
精心筛选的结核病患者多模态数据集,从更大的MultiCaRe Dataset中提取,有望在公共卫生和医学研究领域产生重大社会影响。通过促进更精确的CT图像分割和分类算法的开发,以及增强从临床笔记中提取医学术语的自然语言处理(NLP)技术,该数据集有可能提高结核病诊断的准确性和效率。
个人和敏感信息
病例报告设计为公开可访问,因此故意省略任何个人识别细节,以确保患者隐私和保密性。
偏差、风险和局限性
偏差
- 选择偏差:原始的MultiCaRe Dataset是从1990年至2023年的75,382篇开放获取PubMed Central文章中生成的。因此,无法保证从不同人口统计群体中随机抽样的病例。数据可能存在偏差,因为收集过程并不代表更广泛的人口。
- 技术偏差:先进的成像技术可能在所有环境中并不平等可用,导致数据集不成比例地代表来自更好装备设施的患者。这可能使数据集偏向于在更好装备环境中更容易诊断的条件。
- 解释者偏差:对于
"case_text"和"caption",放射科医生或临床医生的专业知识和经验差异可能导致诊断或报告的发现不同。
风险
- 隐私和保密性风险:患者数据,包括病例记录和图像,非常敏感。即使数据被正确匿名化,也有识别个人的风险。
- 数据完整性和质量风险:数据集中的不准确性、缺失数据和不一致性可能损害基于数据的研究发现或临床决策的有效性。这可能导致无效或有害的干预措施。
局限性
- 数据质量:
- 对于文本数据,某些患者记录缺少关键描述性术语。同时,未进行成像研究的病例缺少图像及其相应的描述性说明。
- 关于图像,主要关注的是数据集的不完整性,因为并非所有患者记录都附有图像。此外,图像分辨率的变化可能阻碍详细检查。图像大小和患者照片定位的不一致性也可能对一致的图像分析构成挑战。




