遇见数据集

openm3chest-npy-v2

收藏
Hugging Face2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

OpenM3Chest NPY v2是一个用于医疗影像分析的数据集,专门为大型视觉语言模型MedGemma 1.5-4B-IT的LoRA(低秩适应)微调而构建。它包含从国家肺癌筛查试验(NLST)获取的胸部CT扫描数据,通过影像数据共享平台(IDC)处理得到。数据集以NumPy数组(.npy)格式存储,数据类型为float16,数值单位为亨氏单位(HU)。每个样本代表一个完整的CT扫描体积,形状为[Z, H, W],其中Z轴(切片数量)因扫描而异,通常在100到300片之间。数据集规模约为3,793个独立的CT体积,文件按照`{患者ID}/{序列实例UID}.npy`的层级结构组织。主要应用于胸部CT的放射学分析,支持的任务流程包括:第一步进行胸部异常筛查和结节存在性检测;若检测到结节,则进一步分析其位置、衰减特性、边缘特征和大小。数据预处理包含将单张CT切片转换为RGB图像的关键步骤,采用三个特定的HU窗位(分别针对骨骼/肺、软组织以及脑部组织)进行融合,以满足模型输入要求。数据集的标签(如结节存在性、属性等)存储在一个独立的关联数据集中。

OpenM3Chest NPY v2 is a dataset for medical image analysis, specifically built for LoRA (Low-Rank Adaptation) fine-tuning of the large vision-language model MedGemma 1.5-4B-IT. It contains chest CT scan data obtained from the National Lung Screening Trial (NLST) and processed via the Imaging Data Commons (IDC). The dataset is stored in NumPy array (.npy) format with data type float16 and values in Hounsfield Units (HU). Each sample represents a complete CT scan volume with shape [Z, H, W], where the Z-axis (number of slices) varies per scan, typically between 100 and 300 slices. The dataset comprises approximately 3,793 independent CT volumes, organized in a hierarchical file structure as `{patient ID}/{series instance UID}.npy`. Its primary application is radiological analysis of chest CT scans, supporting a task workflow that includes: first, screening for chest abnormalities and detecting nodule presence; if nodules are detected, further analyzing their location, attenuation characteristics, margin features, and size. Data preprocessing involves a key step of converting single CT slices into RGB images by fusing three specific HU window settings (for bone/lung, soft tissue, and brain tissue) to meet model input requirements. Labels for the dataset (such as nodule presence and attributes) are stored in a separate associated dataset.

创建时间:
2026-05-27
原始信息汇总

数据集概述:OpenM3Chest NPY v2

该数据集是一个专为医学影像任务设计的CT扫描体积数据集,主要用于对MedGemma 1.5-4B-IT模型进行LoRA微调。

  • 数据集名称:OpenM3Chest NPY v2 (pretty_name)
  • 语言:英语 (en)
  • 许可证:其他 (other),具体依据为 NLST Data Use Agreement (PDF链接)
  • 数据规模:1K < n < 10K
  • 标签和任务:关联标签数据集位于 UngLong/openm3chest-labels-v2

数据内容与格式

  • 扫描数量:约 3,793 个独特的CT体积。
  • 数据格式:NumPy float16 (.npy) 文件。
  • 数据形状[Z, H, W],其中Z轴(切片数量)因扫描而异,通常在100到300层之间。
  • 数据单位:亨氏单位 (Hounsfield Units, HU)。
  • 数据来源:数据源自 NLST(国家肺部筛查试验),通过 IDC(影像数据共享平台)获取。

文件结构

文件按照 {PatientID}/{SeriesInstanceUID}.npy 的路径组织。例如:118553/1.2.840.113654.2.55.100014252814244258018667405625953775316.npy

加载与使用

  • 加载体积数据:可使用 huggingface_hub 库的 hf_hub_download 函数,通过指定患者ID和序列UID来下载特定的 .npy 文件,然后使用 numpy.load() 加载。
  • 加载标签数据:可通过 datasets 库加载标签数据集(如 nodule_presence),并将标签中的ID信息与NPY文件路径结合,实现数据与标签的联合加载。
  • 预处理(针对MedGemma 1.5):提供了将单张CT切片(HU值)转换为RGB图像的示例代码。该方法使用三个不同的HU窗口(骨/肺、软组织、脑)进行映射并堆叠,适用于模型的推理。

任务与使用流程(放射学顺序推理)

该数据集设计了一个分步推理流程:

  1. 筛查步骤:使用 chest_abn_54–61nodule_presence 标签,判断是否存在异常或结节。
  2. 结节分析步骤:如果存在结节,则进一步分析结节的 位置衰减边缘大小
搜集汇总
数据集介绍
openm3chest-npy-v2 数据集图片
构建方式
OpenM3Chest NPY v2数据集源自美国国家肺部筛查试验(NLST),经由影像数据共享平台(IDC)获取原始DICOM影像,再经OpenM3Chest项目处理转换为NumPy float16格式的CT体素数据。每个扫描体积以三维数组形式存储,维度为[Z, H, W],其中Z轴切片数因个体不同而异,通常介于100至300层之间。数据保留原始亨氏单位(HU)值,以患者ID和序列实例UID为目录结构组织,形成约3,793例独特的胸部CT扫描数据集。
特点
本数据集的核心优势在于其直接面向大语言模型微调需求的存储格式与粒度。所有CT体积均以高精度的float16编码保存,在保持影像学特征的同时显著压缩存储空间。数据保留原始HU值,为下游任务提供最大灵活性,可支持从结节检测到器官分割的多种放射学应用。特别值得注意的是,数据集配备对应的标签系统,涵盖结节存在性、位置、衰减特性、边缘形态及尺寸等多维标注信息,形成了一套完整的医学影像分析基座。
使用方法
使用者可通过Hugging Face Hub的`hf_hub_download`函数按患者ID与序列UID精准下载特定.npy文件,再借助NumPy的`load`方法读取三维CT体素数据。结合配套的标签数据集,可采用`load_dataset`接口实现影像与标注的同步加载。针对MedGemma 1.5等视觉语言模型微调场景,提供了基于三个HU窗口的逐切片RGB转换方案,分别突出骨/肺窗、软组织窗和脑窗的密度特征。放射学推理流程遵循先筛查后定位的临床逻辑,即首步进行胸部异常与结节存在性判断,若为阳性则进一步分析结节的具体属性。
背景与挑战
背景概述
随着深度学习在医学影像分析领域的蓬勃发展,肺部疾病尤其是肺结节的计算机辅助诊断成为研究热点。美国国家肺部筛查试验(NLST)作为大型前瞻性研究,为胸部CT数据分析提供了宝贵资源。OpenM3Chest NPY v2数据集应运而生,由UngLong等研究者在2024年左右基于NLST原始DICOM数据加工而成,旨在构建面向CT体数据的标准化预训练资源。该数据集约包含3793个独立的CT扫描体,均以NumPy float16格式存储,保持原始Hounsfield单位,形状随扫描层数变化(100-300层)。其设计初衷之一是为MedGemma 1.5-4B-IT这类多模态大模型提供高效的LoRA微调数据,从而推动肺部异常筛查任务向更灵活、参数效率更高的方向发展。数据集的发布为胸部影像的自动化分析提供了统一基准,在低资源条件下的模型适应中展现了潜力。
当前挑战
该数据集所面对的领域挑战主要集中于医学影像中肺结节检测的准确性与泛化性。由于肺结节的形态、大小和密度差异极大,且CT图像中背景噪声与伪影干扰严重,传统模型在跨中心、跨设备数据上的迁移性能往往受限。此外,数据集的构建过程同样困难重重:原始NLST数据需从Imaging Data Commons获取并通过严格的伦理与数据使用协议(含NLST Data Use Agreement);将DICOM转换为标准化NPY格式时,需处理采样不一致、扫描范围差异和HU值校准等问题;为确保模型训练的可靠性,需精心设计标签体系(如结节存在性、位置、边缘特征等)并配合合理的推理流程(如先筛查再定位的分步策略)。尤为关键的是,如何在保留医学影像物理含义的同時适配视觉语言模型的输入需求(例如3窗口调窗策略),也是构建中必须跨越的技术难点。
常用场景
经典使用场景
OpenM3Chest NPY v2数据集的核心应用在于为胸部CT三维体数据提供高效、标准化的存储与加载范式,广泛服务于深度学习模型对医学影像的预处理与微调环节。该数据集将原始DICOM图像转换为NumPy float16格式的HU值矩阵,并保持每个扫描的原始空间分辨率,因此特别适合用于开发基于CNN或Vision Transformer的肺结节检测、分类与分割任务。研究人员可直接利用其提供的多级标签结构进行监督学习,或者作为预训练模型在胸部影像领域微调的骨干数据源。
衍生相关工作
围绕OpenM3Chest NPY v2,衍生出了一系列代表性学术工作。最典型的包括将CT切片转换为三窗口RGB图像的预处理方案,该方案被应用于MedGemma 1.5大语言模型的视觉指令微调流程,使通用多模态模型能够理解放射学语义。此外,其配套的开放标签库(OpenM3Chest Labels v2)催生了多阶段级联诊断框架,从全局异常筛查到局部结节属性识别逐步递进,为构建解释性更强的计算机辅助诊断系统奠定了基础。
数据集最近研究
最新研究方向
OpenM3Chest NPY v2数据集聚焦于医学影像领域的前沿研究方向,特别是针对胸部CT扫描的深度学习模型微调与多任务诊断推理。其底层数据源自美国国家肺筛查试验(NLST),通过预处理为NumPy float16格式并保留Hounsfield单位,极大降低了计算资源门槛,使得大规模胸部CT的视觉大模型(如MedGemma 1.5-4B-IT)的高效适配成为可能。该数据集所整合的三窗RGB转换策略(骨/肺窗、软组织窗、脑窗)展现出对肺结节、软组织病变等多结构病理的敏感性,推动了放射学中分层诊断流程的智能化:从粗粒度异常筛查到细粒度结节特征(位置、衰减、边缘、大小)的逐层推理。这一设计思路与当前医学影像领域对轻量化、多模态及可解释性AI的需求高度契合,为后续在大型筛查队列中实现自动化肺癌风险评估提供了坚实的基准资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务