遇见数据集

PI-CAI-Lite

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

PI-CAI-Lite 是 PI-CAI 数据集的预处理精简版本,专注于前列腺癌的医学图像分割任务。该数据集包含 425 张前列腺 T2 加权磁共振(T2W)扫描图像,以及对应的 425 个由人类专家标注的临床显著性前列腺癌(csPCa)病灶掩膜。掩膜经过二值化处理,其中标签 1 表示临床显著性前列腺癌病灶。数据仅保留非空掩膜的病例,并排除了原始 PI-CAI 数据集中的 ADC 和 HBV 序列。所有图像和掩膜均已转换为 NIfTI 格式,并标准化为 RAS+ 方向。数据集还提供了病灶主轴和副轴端点的地标标注(P1-P4)。该数据集适用于开发、训练和评估用于前列腺癌病灶分割、肿瘤尺寸测量等任务的深度学习模型,并可集成到 MedVision 框架中,支持多种训练/测试配置(如轴向、冠状、矢状面视图)。

PI-CAI-Lite is a preprocessed lightweight version of the PI-CAI dataset, focusing on medical image segmentation for prostate cancer. It contains 425 prostate T2-weighted magnetic resonance (T2W) scans and corresponding 425 clinical significant prostate cancer (csPCa) lesion masks annotated by human experts. The masks are binarized, with label 1 indicating clinically significant prostate cancer lesions. Only cases with non-empty masks are retained, and the ADC and HBV sequences from the original PI-CAI dataset are excluded. All images and masks have been converted to NIfTI format and standardized to RAS+ orientation. The dataset also provides landmark annotations (P1-P4) for the endpoints of the major and minor axes of the lesions. This dataset is suitable for developing, training, and evaluating deep learning models for tasks such as prostate cancer lesion segmentation and tumor size measurement, and can be integrated into the MedVision framework, supporting various training/testing configurations (e.g., axial, coronal, sagittal views).

创建时间:
2026-07-26
原始信息汇总

PI-CAI-Lite 数据集概述

基本信息

  • 数据集名称:PI-CAI-Lite
  • 许可证:CC BY-NC 4.0
  • 任务类型:图像分割(image-segmentation)
  • 语言:英语
  • 标签:医学、图像、MRI、前列腺、癌症、分割
  • 规模:少于1000个样本(n<1K)

数据集内容

本数据集是PI-CAI数据集(原始来源:Zenodo及picai_labels)的预处理再分发版本,仅保留经人类专家标注且含有临床显著性前列腺癌(csPCa)病灶掩膜的病例。

  • Images/:425个T2加权(T2W)MRI扫描文件
  • Masks/:425个对应的病灶掩膜文件

核心内容:前列腺T2加权MRI扫描及配套的人类专家标注的临床显著性前列腺癌(csPCa)病灶掩膜。

与源数据的关联

项目 说明
源数据集 1500例,每例包含T2W+ADC+HBV序列,均有专家csPCa勾画
排除内容 ADC和HBV序列,以及专家掩膜为空的病例
本仓库 425个图像 + 425个掩膜

筛选原则:仅保留人类专家掩膜非空的病例。在原始1500例中,只有少数包含勾画出的临床显著性病灶,其余病例的专家掩膜全为零,不适用于肿瘤-病灶-尺寸测量任务,因此未纳入分发。

专家掩膜来源picai_labels为全部1500例发布了专家csPCa勾画,包括两个独立文件夹——human_expert/resampled/(1295例)及human_expert/Pooch25/(205例,由Pooch等人于2025年补充),本数据集同时使用了这两部分。

序列选择:仅包含T2W序列。由于原始标注是在T2W、ADC或DWI/HBV图像分辨率下绘制的,只有重采样至T2W网格的勾画才能保证图像与掩膜的精确对应。

预处理说明

  • T2W图像由.mha格式转换为nii.gz;掩膜与T2W网格对齐。
  • 掩膜原始编码为ISUP分级值({2,3,4,5},无标签1),已被二值化为{0,1},标签1表示病灶。
  • 图像和掩膜统一重定向至RAS+方向。

分割标签

python labels_map = { "1": "clinically significant prostate cancer lesion" }

地标标注

python landmarks_map = { "P1": "most right/anterior/superior endpoint of the major axis", "P2": "most left/superior/inferior endpoint of the major axis", "P3": "most right/anterior/superior endpoint of the minor axis", "P4": "most left/superior/inferior endpoint of the minor axis" }

数据使用协议

  • 必须遵守源数据集的CC BY-NC 4.0许可条款。
  • 建议在出版物中引用本数据集来源:https://huggingface.co/datasets/YongchengYAO/PI-CAI-Lite
  • 必须引用原始出版物:
    • https://doi.org/10.5281/zenodo.6667655
    • https://doi.org/10.1101/2025.05.13.25327456

官方发布

详细信息请访问官方网站:https://pi-cai.grand-challenge.org/

下载方式

python

python

from huggingface_hub import snapshot_download snapshot_download(repo_id="YongchengYAO/PI-CAI-Lite", repo_type=dataset, local_dir="/your/local/folder")

关联资源

数据集与🔥MedVision(https://huggingface.co/datasets/YongchengYAO/MedVision)🔥集成,可从中加载完整图像和标注,支持多个任务配置(包括BoxSize、MaskSize、TumorLesionSize任务,各有轴位、冠状位、矢状位的训练/测试配置)。

搜集汇总
数据集介绍
PI-CAI-Lite 数据集图片
构建方式
该数据集的构建遵循严格的医学影像预处理与筛选流程,旨在为临床显著性前列腺癌的病灶分割任务提供高质量的基准数据。研究团队以PI-CAI原始数据集为基础,仅保留携带人类专家标注且掩膜非空的病例,并从中剔除ADC与HBV序列,仅保留T2加权成像以确证图像与标注的精确定位对应。所有T2W图像均从.mha格式转换为.nii.gz格式,掩膜对齐至T2W网格,并统一重定向至RAS+坐标系。原始掩膜中的ISUP分级值被二值化为{0,1},最终形成425例图像与掩膜严格配对的精简数据集。
特点
该数据集的核心特征体现在其精炼的规模与明确的临床指向性。相较于原始PI-CAI数据集中1500例病例,本数据集仅纳入425例经人类专家确认存在临床显著性前列腺癌病灶的样本,有效规避了空掩膜对肿瘤病灶尺寸测量任务造成的干扰。所有图像与掩膜均完成格式归一化、几何标准化及方向统一,消除了多模态序列间因标注分辨率差异带来的空间不一致性。此外,数据集附带地标标注信息,涵盖病灶长轴与短轴的四个端点,为病灶形态学量化分析提供了精确的空间参照。
使用方法
在使用方法上,该数据集依托HuggingFace平台提供便捷的数据获取与集成途径。研究者可通过huggingface_hub库中的snapshot_download函数直接下载至本地目录,亦可通过MedVision数据集平台利用预置配置名称加载完整图像与标注,配置项涵盖轴位、冠状位及矢状位的训练与测试划分,并针对肿瘤病灶尺寸、掩膜尺寸及边界框尺寸等任务分别设定。使用该数据集须严格遵循CC BY-NC 4.0许可条款,并在学术出版物中引用原始数据来源及Pooch等人的相关工作,以确保数据使用的合规性与学术规范性。
背景与挑战
背景概述
前列腺癌是男性群体中发病率高居前列的恶性肿瘤,其临床显著病灶的精准定位与分割直接影响诊断分级与治疗决策。PI-CAI 数据集由荷兰 Radboud 大学医学中心与诊断影像分析组(DIAG Nijmegen)等机构于 2022 年前后发起,作为 grand-challenge 平台上的国际挑战赛核心资源,旨在推动人工智能在前列腺多参数 MRI 中的病灶检测与分割能力。该数据集汇聚了 1500 例双参数 MRI 扫描及专家标注,并持续吸纳新增病例与专家复核结果。PI-CAI-Lite 系其派生版本,保留了 425 例携带非空专家掩膜且经几何标准化处理的 T2 加权影像,为肿瘤病灶尺寸测量等下游任务提供了图像与掩膜严格配准的轻量级基准,对前列腺影像组学与可复现研究具有重要支撑价值。
当前挑战
该数据集所应对的核心领域难题在于临床显著前列腺癌在 T2 加权影像中常呈现低对比度、边界模糊且形态异质的特征,病灶与周围腺体组织的灰度差异微弱,导致自动分割模型易产生漏检与欠分割。构建过程中,源数据集的多参数序列(T2W、ADC、HBV)标注分辨率不统一,掩膜需依标注者习惯重采样至 T2 网格,增加了配准误差风险;同时,仅少数病例含临床显著病灶,大量全零掩膜样本被剔除,造成阳性样本稀缺且类别分布高度不平衡。此外,将 ISUP 分级编码的多类掩膜二值化、统一重定向至 RAS+ 坐标系等预处理步骤,虽保障了图像与掩膜的精确对应,亦可能引入几何形变与信息损失,对模型泛化能力构成潜在考验。
常用场景
经典使用场景
前列腺磁共振成像分析领域中,精准描绘临床显著性前列腺癌病灶的空间边界始终是核心挑战之一。PI-CAI-Lite数据集汇聚了425例经专家手工勾画的T2加权影像与对应病灶掩膜,为分割模型的训练与评估提供了高质量监督信号。研究者惯常将其用于构建深度学习分割网络,通过端到端学习实现病灶体素级识别,亦常用于验证迁移学习策略在跨中心影像上的泛化能力,构成前列腺癌计算机辅助诊断研究的基准测试平台。
衍生相关工作
作为PI-CAI的轻量化衍生版本,PI-CAI-Lite已被整合至MedVision数据集体系,衍生出针对轴向、冠状及矢状面的多平面配置,并划分出病灶框尺寸、掩膜尺寸及肿瘤病灶尺寸等系列任务。这些配置催生了围绕前列腺癌分割与尺寸估计的基准评测工作,促进了多平面融合策略与跨任务学习方法的探索,为后续研究提供了标准化的实验基线。
数据集最近研究
最新研究方向
前列腺癌磁共振成像的精准诊断与病灶量化分析是当前医学影像人工智能领域的焦点议题。PI-CAI-Lite数据集通过整合经专家标注的T2加权影像与临床显著性前列腺癌病灶掩膜,为病灶分割、尺寸测量及三维空间定位等任务提供了标准化基准。该数据集与MedVision框架的深度融合,催生了多平面(轴位、冠状位、矢状位)与多任务(掩膜尺寸、肿瘤病灶尺寸)联合评估范式,推动了算法在跨平面泛化能力上的进步。2025年新增的Pooch25专家标注进一步扩充了阳性样本,回应了AI辅助诊断中标注稀缺与异质性难题。相关研究有望提升前列腺癌早期检出率与风险分层精度,为临床决策提供可解释的影像学依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务