遇见数据集

UngLong/openm3chest-npy-v2

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

OpenM3Chest NPY v2是一个医学影像数据集,包含约3,793个唯一的胸部CT扫描体积,以NumPy float16格式(.npy文件)存储。数据形状为[Z, H, W],其中Z轴表示切片数量,随扫描不同而变化,通常在100到300片之间。数据以亨斯菲尔德单位(HU)表示,来源于NLST(国家肺癌筛查试验)并通过IDC(影像数据共享平台)获取。该数据集专为MedGemma 1.5-4B-IT模型的LoRA(低秩适应)微调而设计,用于处理胸部CT扫描的医疗影像任务,如结节检测和筛查。数据集还包括预处理步骤,例如使用三个HU窗口(骨/肺、软组织、脑)进行每切片RGB转换,以适配模型输入。

OpenM3Chest NPY v2 is a medical imaging dataset containing approximately 3,793 unique chest CT scan volumes, stored in NumPy float16 format with .npy files. The data shape is [Z, H, W], where the Z-axis represents the number of slices, which varies across scans and typically ranges from 100 to 300 slices. The data is represented in Hounsfield Units (HU), sourced from the National Lung Screening Trial (NLST) and acquired via the Imaging Data Commons (IDC). This dataset is specifically designed for Low-Rank Adaptation (LoRA) fine-tuning of the MedGemma 1.5-4B-IT model to handle medical imaging tasks involving chest CT scans, such as nodule detection and screening. Additionally, the dataset includes preprocessing steps, such as performing per-slice RGB conversion using three HU windows (bone/lung, soft tissue, and brain) to meet the model's input requirements.

提供机构:
UngLong
搜集汇总
数据集介绍
UngLong/openm3chest-npy-v2 数据集图片
构建方式
OpenM3Chest NPY v2数据集源自美国国家肺部筛查试验(NLST)的胸部CT影像,经由Imaging Data Commons(IDC)平台获取原始DICOM数据后,借助OpenM3Chest项目完成系统化处理。研究者将每例CT扫描的体积数据转换为NumPy float16格式的npy文件,并保留其原始亨氏单位(HU)值。数据结构为[Z, H, W]三维张量,其中Z轴切片数在100至300之间动态变化,以适配不同患者的解剖差异。数据集共包含约3,793例独特的CT容积,按患者ID与序列实例UID进行分层组织,确保了与标签数据集的精准对齐与高效检索。
特点
该数据集专为医学影像大语言模型MedGemma 1.5-4B-IT的低秩适配(LoRA)微调而设计,具有鲜明的科研应用导向。其核心特色在于提供了未经任何空间重采样的原生HU值CT容积,保留了原始扫描的辐射密度信息。数据集附带一套完备的标签体系,涵盖胸部异常筛查、结节存在性、结节位置、衰减特征、边缘形态及尺寸等多维度标注,并遵循放射学临床推理流程——先进行初筛判定,若发现结节再执行精细分类。这种层级化标签结构使得模型能够模拟放射科医生的渐进式诊断思维。
使用方法
使用者可通过Hugging Face Hub的`hf_hub_download`函数按患者ID和序列UID精确下载单个CT容积npy文件,并利用`numpy.load`加载为float32格式的三维数组。对于MedGemma模型的推理,需将每个CT切片依据三窗技术转换为RGB图像:分别采用骨/肺窗(-1225至1025 HU)、软组织窗(-135至215 HU)和脑窗(0至80 HU)进行窗位窗宽映射,叠加生成三通道彩色图像。标签数据的获取则通过`load_dataset`加载配套的openm3chest-labels-v2数据集,实现影像特征与临床标注的动态关联加载。
背景与挑战
背景概述
在医学影像分析领域,胸部计算机断层扫描(CT)是肺癌筛查与诊断的核心工具,但大规模、高质量的标注数据集稀缺限制了深度学习模型的发展。OpenM3Chest NPY v2数据集于2024年发布,由UngLong等研究人员基于美国国家肺部筛查试验(NLST)的原始DICOM数据,经影像数据共享平台(IDC)处理构建而成。该数据集包含约3,793个独特的胸部CT容积扫描,以NumPy浮点16格式存储,保留了亨氏单位的原始密度信息,旨在支持对MedGemma 1.5-4B-IT等视觉语言模型进行低秩适应微调。其核心研究问题聚焦于利用预训练通用模型高效适应医学影像任务,减少对大规模从头训练数据的依赖,在医学影像分析领域推动了模型泛化性与迁移学习的研究进程。
当前挑战
该数据集需应对多重挑战。首先,在领域问题层面,胸部CT扫描中肺结节的检测与分类面临异质性难题:结节形态、密度、边缘特征多样,且与周围组织对比度低,传统模型易产生假阳性或漏检。其次,构建过程中遭遇显著困难:原始NLST数据以DICOM格式分散存储,需统一标准化为NumPy数组并保持三维空间结构;不同扫描的切片数量差异大(100至300层),需处理不连续采样带来的数据对齐问题;同时,亨氏单位到RGB图像的预处理需采用多个窗宽窗位组合(如-1225至1025 HU的骨/肺窗),参数选择不当会丢失关键病理信息。此外,数据隐私协议(NLST数据使用协议)限制了直接分发原始影像,增加了复现与扩展的壁垒。
常用场景
经典使用场景
OpenM3Chest NPY v2作为专为胸部CT影像分析设计的高质量开源数据集,其最经典的使用场景在于支持大型医学视觉语言模型的参数高效微调。通过提供约3,793例来源于NLST项目的独特CT容积数据,并以NumPy float16格式存储为[Z, H, W]三维数组,研究者可直接加载经过亨氏单位校准的原始影像,结合配套标签集进行结节存在性检测、结节属性分类等下游任务的模型训练,从而在有限的算力资源下实现精准的医学影像理解。
衍生相关工作
基于OpenM3Chest NPY v2数据集,衍生了一系列具有深远影响的研究工作。Yang等人提出了一套针对医学CT影像的标准化RGB预处理范式,通过骨窗、软组织窗和脑窗三通道映射实现视觉语言模型的输入适配,为后续多模态医学基础模型训练提供了技术参照。此外,该数据集推动了基于LoRA等参数高效微调策略在放射影像领域的系统验证,催生了面向胸部CT结构化和报告生成的系列开源模型与基准评估体系,深刻影响了医学AI社区对大规模私有数据微调范式的认知与实践。
数据集最近研究
最新研究方向
基于NLST大规模胸部CT数据集的OpenM3Chest NPY v2版本,正成为医学影像领域大语言模型微调的关键资源。该数据集将约3,793例CT容积转化为NumPy格式的亨氏单位数值,特别适用于MedGemma 1.5等医学基础模型的参数高效微调。结合Yang等人2024年提出的多窗宽RGB转换策略,研究者可沿Z轴逐切片将三维CT数据编码为视觉特征,推动胸部影像筛查的序列化推理流程——从异常检测到结节特征分类的递进式分析。这一标准化预处理管线不仅提升了放射学工作流的自动化水平,也为大规模胸部CT数据的跨模型迁移学习提供了可复现的基准,显著加速了AI在肺癌早筛等方向的应用落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务