遇见数据集

kits23-hf-2d-preview

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于医学图像分割的肾脏CT影像数据集,专门针对肾脏、肾脏肿瘤和肾脏囊肿的自动分割任务而构建。数据集包含多例患者的腹部CT扫描数据,每个病例提供三个正交轴向(轴状面、冠状面、矢状面)的切片图像。对于每个轴向切片,数据集提供原始CT图像、器官分割掩码图像(包括肾脏、肿瘤和囊肿的独立二值掩码)以及可视化叠加图像。此外,数据集还包含重要的医学影像元数据,如图像空间分辨率(spacing)、原始图像尺寸、各器官的边界框坐标以及切片索引。数据集共包含489个样本,划分为训练集(391例)、验证集(49例)和测试集(49例),总数据量约为288MB。该数据集适用于计算机辅助诊断、医学影像分析、器官分割算法开发与评估等任务。

This dataset is a kidney CT imaging dataset for medical image segmentation, specifically constructed for the automatic segmentation tasks of kidneys, renal tumors and renal cysts. The dataset contains abdominal CT scan data from multiple patients. For each case, three orthogonal axial (axial plane, coronal plane, sagittal plane) slice images are provided. For each axial slice, the dataset provides the original CT image, organ segmentation mask images (including independent binary masks for kidneys, tumors and cysts), and visualized overlay images. Additionally, the dataset also includes important medical imaging metadata, such as image spatial resolution (spacing), original image dimensions, bounding box coordinates of each organ, and slice index. The dataset contains a total of 489 samples, which are divided into training set (391 cases), validation set (49 cases) and test set (49 cases), with a total data volume of approximately 288 MB. This dataset is applicable to tasks such as computer-aided diagnosis, medical image analysis, organ segmentation algorithm development and evaluation.

创建时间:
2026-05-30
原始信息汇总

数据集概述:kits23-hf-2d-preview

该数据集是 KiTS23 的 2D 预览版本,专为肾脏、肿瘤和囊肿的医学图像分割任务设计。数据集基于原始 3D CT 扫描数据,提取了沿三个正交轴(轴位、冠状位、矢状位)的 2D 切片,并提供了对应的分割掩膜和边界框信息。

数据集特征(Features)

每条数据记录包含以下字段:

  • case_id(字符串):病例的唯一标识符。
  • original_image_path(字符串):原始 3D CT 图像的路径。
  • original_segmentation_path(字符串):原始 3D 分割掩膜的路径。
  • image_shape(字符串):原始 3D 图像的形状。
  • spacing(字符串):原始图像的体素间距。
  • unique_labels(字符串):该病例中存在的标签类别。

对于每个切片,数据集提供了沿三个轴(axis0、axis1、axis2)的以下信息:

  • ...slice_idx(int32):该轴上的切片索引。
  • ...kidney_bbox...tumor_bbox...cyst_bbox(list of int32):对应器官的边界框坐标。
  • ...ct_image(Image):该切片的 CT 图像。
  • ...overlay_image(Image):叠加了分割轮廓的 CT 图像。
  • ...kidney_mask...tumor_mask...cyst_mask(Image):对应器官的二值掩膜图像。

数据集划分与大小

数据集已划分为三个子集,均以 Parquet 文件格式存储:

划分(Split) 样本数 数据大小(Dataset Size/Num Bytes)
train 391 226,833,984 字节
validation 49 28,367,896 字节
test 49 32,828,090 字节
总计 489 288,029,970 字节

下载大小(Download Size):286,434,192 字节。

配置文件

  • config_namedefault
  • 数据文件路径
    • traindata/train-*
    • validationdata/validation-*
    • testdata/test-*

访问地址

搜集汇总
数据集介绍
kits23-hf-2d-preview 数据集图片
构建方式
kits23-hf-2d-preview数据集源于权威的肾脏肿瘤分割挑战(KiTS23),旨在为医学影像分析领域提供标准化的二维切片数据。该数据集对原始三维CT扫描进行多轴向采样,沿轴向(axis0)、冠状面(axis1)和矢状面(axis2)三个维度提取切片,每个切片均对应生成CT图像、分割掩膜及覆盖图像。同时,每个切片记录了原始病例标识、图像空间信息(如形状与像素间距)以及区域包围盒锚点,涵盖肾脏、肿瘤和囊肿三类目标的精确位置,从而构建出结构化的多视角二维数据集。
特点
该数据集的核心优势在于其多维度的纵深细节与精细标注。每个病例均提供三个正交方向的切片序列,并附带对应的肾脏、肿瘤和囊肿像素级掩膜,以及包围盒信息,极大丰富了空间上下文特征。数据划分为训练(391例)、验证(49例)和测试(49例)三部分,保持了挑战赛的原始划分。此外,所有图像均以标准图像格式存储,便于直观加载与可视化,同时又保留了与原始三维体素空间的关联路径,兼顾了二维模型的轻量与三维语义的完整性。
使用方法
本数据集可无缝集成于HuggingFace Datasets框架中,用户通过指定配置名称“default”即可加载训练、验证和测试分片。每个样本包含多轴向的图像与掩膜字段,适合训练多视角或单视角的二维分割模型。研究者可提取单一轴向的切片与掩膜进行常规分割任务,亦可结合多轴向数据设计融合策略以提升分割鲁棒性。包围盒字段便于目标检测或区域裁剪预处理,而空间属性字段可用于体素间距归一化,适配多种医学影像深度学习流水线。
背景与挑战
背景概述
肾癌作为泌尿系统常见的恶性肿瘤,其早期精准诊断与治疗规划高度依赖于医学影像的精确解析。近年来,深度学习技术在医学图像分割领域取得了突破性进展,但高质量、标准化的公开数据集仍是推动算法发展的关键瓶颈。kits23-hf-2d-preview数据集源自著名的KiTS23挑战赛,由多家国际顶尖医疗机构与科研团队联合创建,旨在解决肾脏、肾肿瘤及囊肿的精细分割问题。该数据集于2023年发布,包含391例训练样本、49例验证样本和49例测试样本,每例均提供多轴(冠状位、矢状位、轴位)的CT影像及其对应的像素级掩膜,标注了肾脏、肿瘤和囊肿三类结构。其构建不仅为跨机构算法评估提供了统一基准,更通过二维切片化处理降低了计算门槛,显著推动了肾癌影像学分析在临床辅助系统中的落地应用,成为该领域极具影响力的参考标准。
当前挑战
本数据集面临的核心挑战源自其解决的领域问题与构建过程。在领域层面,肾癌影像分割需应对肿瘤形态多样(如囊性、实性、浸润性)、边界模糊及病灶大小差异悬殊等医学难题,同时肾脏周围的复杂解剖结构容易导致误分割。构建过程中,团队需处理CT影像中不同采集协议导致的体素间距差异,以及多中心数据标注一致性难以保证的问题——例如三位专家对同一病灶的勾画可能差异显著。此外,将原始三维体数据转换为2D切片时,如何选择最优切片方向(轴0、轴1、轴2)并保留三维空间上下文信息成为关键权衡,而漏检细小囊肿或误将正常肾组织判为肿瘤的风险始终存在,这对模型鲁棒性和临床可信度构成了严峻考验。
常用场景
经典使用场景
在医学影像分析领域,kits23-hf-2d-preview数据集为肾脏及肿瘤的语义分割任务提供了标准化的二维切片级参考基准。该数据集的独特之处在于其从三维CT影像中提取了沿三个正交轴向的切片,并配备了肾脏、肿瘤和囊肿的精细掩膜,使得研究者能够系统性地评估不同平面上的分割性能。这一设计规避了传统三维体素级分割中计算资源与标注成本高昂的困境,为基于二维卷积神经网络的经典架构——如U-Net及其变体——提供了可直接训练与测试的完善数据基础。此外,通过对切片索引与边界框信息的显式存储,该数据集还支持对局部病灶区域的聚焦分析,成为深入探索器官多结构精确分割任务的理想平台。
衍生相关工作
kits23-hf-2d-preview数据集的诞生催生了一系列出色的衍生研究,尤其是在半监督学习、对比学习和注意力机制等前沿方向上。例如,部分工作利用该数据的多平面切片特性,提出了跨轴向一致性正则化框架,以利用无标注切片提升分割的鲁棒性;另一些研究则基于其丰富的边界框标记,设计了自监督的弱监督预训练策略,显著降低了全监督标注需求。此外,还有团队针对该数据集中肿瘤与囊肿边界模糊的问题,引入了边缘感知的形变卷积模块,实现了更为精细的病灶勾勒。这些衍生工作不仅深化了对医学影像上下文关联机制的理解,还推动了统一的肾脏病变分析基准的建立,充分彰显了该数据集作为一个经典知识节点的催化价值。
数据集最近研究
最新研究方向
肾脏肿瘤与囊肿的多轴多模态分割研究。随着医学影像分析技术的飞速发展,精准医学对肾脏病变的自动化识别提出了更高要求。kits23-hf-2d-preview数据集以KiTS23挑战赛为依托,提供了涵盖冠状面、矢状面和横断面三个解剖轴向的CT影像、分割掩膜及边界框标注,尤其细化了肾脏、肿瘤和囊肿的独立掩膜。这一多维度的精细标注架构,为开发能够同时处理多器官、多病变类型的深度学习模型奠定了坚实基础。该数据集近期被广泛用于探索基于Transformer与卷积神经网络混合架构的2D切片序列分析,旨在提升对不同轴向信息融合的理解,从而在肾癌术前规划与囊性病变风险分层中实现更鲁棒的自动分割与检测。其影响在于推动了从单一任务向多病变、多位姿协同分析的范式转变,为临床实践中的个性化治疗决策提供了数据驱动的创新支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务