遇见数据集

InteractiveRadiologyTutor_datssets

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

该数据集是一个胸部X光图像(CXR)数据集,包含112,120个训练样本。每个样本包括X光图像(image)、图像索引(image_index)、发现标签(finding_labels,字符串列表,表示图像中的异常发现)、患者ID(patient_id)、视图位置(view_position,如PA、AP等)以及边界框(bboxes,浮点数列表的列表,用于标注异常区域)。数据集采用cc-by-nc-4.0许可,适用于胸部X光异常检测、分类、目标检测等医学影像分析任务。

This dataset is a chest X-ray (CXR) dataset containing 112,120 training samples. Each sample includes an X-ray image (image), image index (image_index), finding labels (finding_labels, a list of strings indicating abnormal findings in the image), patient ID (patient_id), view position (view_position, e.g., PA, AP), and bounding boxes (bboxes, a list of lists of floats for annotating abnormal regions). The dataset is licensed under cc-by-nc-4.0 and is suitable for medical image analysis tasks such as chest X-ray abnormality detection, classification, and object detection.

创建时间:
2026-09-04
原始信息汇总

数据集概述:InteractiveRadiologyTutor_datssets

该数据集包含两个子配置(config),分别为 cxrmimic_cxr,均用于医学影像(X光胸片)相关任务。

1. cxr 子集

  • 用途/特点:包含胸部X光图像及其对应的影像发现标签(finding_labels)和边界框(bboxes),适用于目标检测或多标签分类任务。
  • 数据字段
    • image:图像数据
    • image_index:图像索引(字符串)
    • finding_labels:发现标签列表(字符串列表)
    • patient_id:患者ID(整型)
    • view_position:拍摄位置(字符串,如前后位/侧位)
    • bboxes:边界框坐标(浮点数列表的列表)
  • 数据划分:仅提供训练集,包含 112,120 个样本。
  • 数据规模:数据集总大小约 45.4 GB,下载大小约 45.06 GB

2. mimic_cxr 子集

  • 用途/特点:来自 MIMIC-CXR 数据库的胸部X光图像集合,可能用于图像检索、预训练或分类任务。
  • 数据字段
    • image:图像数据
    • image_id:图像ID(字符串)
    • file_path:文件路径(字符串)
  • 数据划分:仅提供训练集,包含 261,137 个样本。
  • 数据规模:数据集总大小约 16.86 GB,下载大小约 17.73 GB

3. 许可证与结构

  • 许可证:cc-by-nc-4.0(非商业使用许可)。
  • 数据文件结构:每个子集通过通配符路径指向训练数据文件(如 cxr/train-*mimic_cxr/train-*)。

总体而言,该数据集主要面向胸部X光影像的机器学习和深度学习研究,提供了带详细标注(发现类别、位置框)的影像数据以及一个大规模的原始影像集,适用于模型训练、评估及多模态研究。

搜集汇总
数据集介绍
InteractiveRadiologyTutor_datssets 数据集图片
构建方式
InteractiveRadiologyTutor数据集涵盖了CXR与MIMIC-CXR两大子集,其构建源于对医学影像教育需求的深度洞察。CXR部分汇集了逾11.2万张胸部X光片,每张图像均配有详尽的影像学发现标签、患者标识及投照体位信息,并附带边界框标注,为病灶定位提供了坚实的基础。该子集的数据源与处理流程经过精心设计,确保了图像与元数据的完整对齐,使研究者能够直接利用预标注信息进行模型训练与评估。MIMIC-CXR子集则整合了超过26万张影像及对应的文件路径与唯一标识符,延续了MIMIC数据库一贯的严谨性与规模性,为大规模预训练与跨中心验证提供了充足的数据养分。整个数据集以cc-by-nc-4.0许可发布,兼顾了科学共享与版权保护,其构建过程严格遵循去标识化原则,保障了患者隐私安全。
特点
该数据集最鲜明的特质在于其双轨并行的结构设计。CXR配置的丰富语义标注,包括病症分类标签与边界框坐标,使得它成为一个天然的监督学习资源,能够满足从图像分类到目标检测的多任务需求。每个样本不仅包含原始影像,还记录了检查时的体位信息(如正位或侧位),这对于理解影像学特征的空间变异性至关重要。这种基于真实临床场景的细粒度元数据,赋予了模型训练更高的生态效度。同时,MIMIC-CXR配置以其庞大的体量和纯粹的数据构成,成为自监督表征学习的理想土壤,其规模优势有助于推动视觉基础模型的鲁棒性提升。两个子集相互补充,既有利于跨数据集泛化能力的检验,也为医患隐私保护下的数据共享树立了典范。
使用方法
数据集通过HuggingFace平台分发,用户可借助datasets库轻松加载,支持按需选择cxr或mimic_cxr配置。CXR子集已将图像存储为可解码的image格式,并附有finding_labels、view_position及bboxes等结构化字段,研究者可无缝将其输入PyTorch或TensorFlow数据管道,用于构建强监督的疾病识别与定位模型。为便于教学交互,基于此数据开发的系统将模拟放射科医师的读片思路,引导学习者跟随边界框的指引逐步分析影像。MIMIC-CXR子集则提供file_path以指向原始文件,适合需自定义预处理流程或结合外部工具链开展研究的场景。建议用户在遵守cc-by-nc-4.0许可的前提下,将数据用于非商业性科研与教学目的,并在发表成果时致谢原始数据提供方。
背景与挑战
背景概述
InteractiveRadiologyTutor_datssets数据集由医学影像人工智能领域的研究人员构建,旨在推动胸部X光影像的自动化解读与交互式医学教育。该数据集整合了大规模胸部X光图像、对应的发现标签(如病变类型)、边界框标注以及患者元数据,并包含MIMIC-CXR子集,为开发多模态学习模型和可解释性诊断系统提供了丰富资源。其创建时间可追溯至深度学习在医学影像中广泛应用的时代,研究团队重点关注如何利用视觉-语言预训练技术提升放射学报告生成的准确性与临床可用性。该数据集对相关领域的影响体现在促进了胸部影像智能诊断算法从单一分类向细粒度、区域级分析的演进,同时为医学教育中的交互式案例学习奠定了数据基础,受到计算机视觉与医疗健康交叉学界的广泛关注。
当前挑战
构建该数据集面临的首要挑战在于领域问题的复杂性:胸部X光影像包含多种重叠解剖结构及病理特征,需在全局与局部层面同时进行精准识别,而弱监督标注(如影像级发现标签)难以捕捉细微病变,导致模型训练易陷入噪声干扰。其次,数据构建需克服多源数据整合困难,包括处理来自不同设备和协议的图像分辨率差异、统一标注标准(如框坐标与标签的规范化)、以及应对海量数据存储与预处理的高昂成本。此外,隐私保护与伦理合规要求对患者元数据(如patient_id)实施脱敏处理,同时需确保图像质量与标注一致性,尤其当数据源自临床环境时,标注依赖专家知识,存在主观偏差。这些挑战要求研究者在数据规模、标注精度与计算效率之间寻找平衡,并推动半监督学习与模型鲁棒性研究的发展。
常用场景
经典使用场景
在医学影像分析领域,InteractiveRadiologyTutor_datssets以其丰富的胸部X光图像资源,成为训练和评估计算机辅助诊断模型的基石。该数据集包含两个子集:cxr子集整合了超过11万张图像及详细的标注信息,如发现标签、边界框和患者元数据,为病灶检测与定位提供了精细的监督信号;mimic_cxr子集则提供了逾26万张来自MIMIC-CXR数据库的原始图像,适用于大规模预训练和表征学习。研究者常利用该数据集开展胸片异常分类、多标签疾病识别、视觉语言对齐等经典任务,其高容量和多维度标注设计,为开发鲁棒的深度学习模型提供了可靠的实验平台。
衍生相关工作
该数据集自发布以来,衍生出众多具有影响力的学术工作。研究者基于其cxr配置,开发了多任务学习框架,同时进行疾病分类与定位,并集成注意力机制以增强可解释性;另有一些工作利用mimic_cxr进行自监督预训练,提出了用于医学影像的对比学习模型,如MoCo-CXR和ConVIRT,显著提升了后续任务的特异性与敏感性。此外,该数据集促进了视觉-语言预训练模型在医学领域的适配,例如MedCLIP和BioViL,这些模型能够处理图文联合任务,开创了医学视觉问答与跨模态检索的新范式。围绕该数据集的评测基准也相继涌现,为衡量新兴算法提供标准化参照。
数据集最近研究
最新研究方向
InteractiveRadiologyTutor数据集的最新研究方向聚焦于医学影像与人工智能的深度融合,特别是在胸部X光片的自动化诊断领域。该数据集整合了大规模临床影像数据及精细的标注信息,为开发具备可解释性和交互性的辅助诊断系统提供了坚实基础。当前研究热点包括利用该数据集训练多模态大模型,实现从影像到自然语言报告生成的端到端学习,以及针对开放世界中的新发疾病进行快速适应。其独特之处在于将患者级信息与病灶边界框结合,支持细粒度的异常定位,推动了从简单分类向复杂推理的范式转变。在此背景下,该数据集已成为连接临床实践与前沿AI技术的桥梁,有望显著提升放射科医师的工作效率,并在医疗资源分配不均的背景下具有重大社会意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务