遇见数据集

ULS23-processed-data

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

ULS23 Processed Data是一个用于3D通用病灶分割的医学影像数据集,源自ULS23挑战赛的处理后训练数据。该数据集旨在为CT扫描中的病灶分割任务提供基准数据,支持医学图像分析研究。数据内容包含全标注和弱标注两部分:全标注数据约62GB,涵盖LIDC-IDRI、LiTS、NIH_LN_ABD、NIH_LN_MED、kits21、MDSC_Task06_Lung、MDSC_Task07_Pancreas和MDSC_Task10_Colon等多个子数据集;弱标注数据约149GB,包括DeepLesion和CCC18。数据格式为NIfTI zip等处理后的标准格式,适用于使用MONAI(版本≥1.2.0)等工具加载。数据集规模在10K到100K之间,专注于医学CT影像的病灶分割任务,适用于图像分割和病灶检测等应用场景。

ULS23 Processed Data is a medical imaging dataset for 3D universal lesion segmentation, derived from the processed training data of the ULS23 challenge. It aims to provide benchmark data for lesion segmentation tasks in CT scans, supporting medical image analysis research. The dataset consists of two parts: fully annotated data (approximately 62GB) covering multiple sub-datasets such as LIDC-IDRI, LiTS, NIH_LN_ABD, NIH_LN_MED, kits21, MDSC_Task06_Lung, MDSC_Task07_Pancreas, and MDSC_Task10_Colon; and weakly annotated data (approximately 149GB) including DeepLesion and CCC18. The data is in processed standard formats like NIfTI zip, suitable for loading with tools like MONAI (version ≥1.2.0). The dataset size ranges from 10K to 100K, focusing on lesion segmentation tasks in medical CT images, and is applicable to scenarios such as image segmentation and lesion detection.

创建时间:
2026-07-01
原始信息汇总

数据集概述

  • 名称: ULS23 Processed Data
  • 许可证: CC-BY-NC-4.0(非商业用途)
  • 任务类型: 图像分割(image-segmentation)
  • 标签: 医疗、CT、病灶分割、ULS23
  • 语言: 英语
  • 数据规模: 10K < n < 100K

数据集内容

该数据集是 ULS23 Challenge 的已处理训练数据,目录结构如下:

  • fully_annotated/(全标注数据,约 62 GB)

    • LIDC-IDRI
    • LiTS
    • NIH_LN_ABD
    • NIH_LN_MED
    • kits21
    • MDSC_Task06_Lung
    • MDSC_Task07_Pancreas
    • MDSC_Task10_Colon
  • partially_annotated/(弱标注数据,约 149 GB)

    • DeepLesion
    • CCC18

数据格式与使用

  • 数据采用 ULS23 官方 processed 格式(NIfTI、zip 等)。
  • 使用 MONAI 加载时,请确保版本 >= 1.2.0。

引用信息

若使用本数据,请引用以下原始论文:

M.J.J. de Grauw, E.Th. Scholten, E.J. Smit, M.J.C.M. Rutten, M. Prokop, B. van Ginneken, A. Hering,
The ULS23 challenge: A baseline model and benchmark dataset for 3D universal lesion segmentation in computed tomography,
Medical Image Analysis, Volume 102, 2025, 103525.
https://doi.org/10.1016/j.media.2025.103525

原始数据来源

搜集汇总
数据集介绍
ULS23-processed-data 数据集图片
构建方式
ULS23-processed-data 数据集是面向CT影像中通用病变分割任务的权威基准资源,由ULS23挑战赛官方发布。该数据集以统一的处理流程整合了来自多个公开数据集的原始医学影像,涵盖LIDC-IDRI、LiTS、NIH_LN_ABD等8个全标注子集(约62 GB)以及DeepLesion和CCC18两个弱标注子集(约149 GB),所有数据均以标准化的NIfTI格式和zip压缩包形式存储,确保了跨中心、跨病变类型数据的高兼容性和可复现性。
特点
该数据集最显著的特点在于其大规模、多源异构与标注层次的多样性。全标注数据提供了逐体素的精确分割掩膜,而弱标注数据则以较低标注密度覆盖更广泛的病变形态,两者结合既保证了模型训练的高质量监督信号,又拓展了病变类型的覆盖面。此外,数据源自国际知名医学影像挑战赛和公开库,涵盖肺、肝、肾、胰腺、结肠等多个解剖部位,为3D通用病变分割模型的开发与评估提供了坚实的临床相关性与泛化能力基础。
使用方法
使用该数据集时,推荐采用MONAI框架进行加载与预处理,并确保MONAI版本不低于1.2.0以兼容NIfTI格式与特定数据增强管线。用户可直接将processed_data目录下的子集按需求组合训练,注意全标注与弱标注数据可并行使用以平衡标注质量与数据规模。对于弱标注部分,建议结合半监督或一致性正则化策略利用其不确定性信息。所有数据均需遵循CC-BY-NC 4.0许可证,并引用原始ULS23论文以示学术规范。
背景与挑战
背景概述
ULS23-processed-data数据集由荷兰拉德堡德大学医学中心的研究人员于2025年创建,旨在推动三维计算机断层扫描(CT)图像中通用病变分割技术的发展。该数据集源自ULS23挑战赛,核心研究问题是构建一个能够处理多类别、多部位病变的通用分割模型,以克服现有方法仅针对特定器官或病变类型的局限性。数据集整合了多个公开数据集(如LIDC-IDRI、LiTS、DeepLesion等),覆盖肺部、肝脏、肾脏、胰腺及结肠等多种解剖结构,为医学影像分析领域的通用病变分割研究提供了标准化基准,对提升计算机辅助诊断系统的泛化能力具有重要影响。
当前挑战
该数据集所解决的领域问题在于医学影像中的病变分割长期面临病灶形态多样、边界模糊、数据标注不一致等挑战,传统方法难以在跨器官场景下保持鲁棒性。构建过程中,研究人员需协调来自不同机构、不同扫描协议的多源数据,面临数据格式差异(如NIfTI与DICOM)、标注粒度不一(全标注与弱标注数据并存)以及存储规模庞大(全标注约62GB,弱标注约149GB)等技术难题。此外,数据集的平衡性与代表性亦需精心设计,以确保模型在罕见病变部位也能取得可靠性能。
常用场景
经典使用场景
ULS23-processed-data数据集是专为计算机断层扫描(CT)图像中的三维通用病变分割任务而设计的基准资源。其经典使用场景在于,研究人员可利用其中包含了来自LIDC-IDRI、LiTS、NIH_LN_ABD等多个公开数据源的全标注与弱标注子集,训练和评估能够处理不同器官、不同病变类型的统一分割模型。该数据集以标准化的NIfTI格式和统一的预处理流程,为模型提供了跨病灶类型的一致性训练数据,从而推动构建具有泛化能力的医学图像分割算法。
解决学术问题
该数据集有效解决了医学图像分析领域中,现有病变分割方法往往只能针对特定器官或病变类型进行建模的困境。ULS23-processed-data通过整合多个异构的医学图像标注资源,形成了一个规模庞大且病变类型多样的训练集合,从而为研究通用型三维病变分割模型提供了数据基石。其发布使学术界得以系统性探索跨病变、跨器官的分割特征表达,推动了从单一任务模型向统一分割框架的范式转变,显著提升了CT图像中病变自动化识别的研究水平。
衍生相关工作
围绕ULS23-processed-data数据集,衍生出了一系列推动通用病变分割领域发展的经典研究工作。首当其冲的是随挑战赛发布的基线模型,它利用MONAI框架搭建了一个基于三维U-Net架构的基准分割网络,为后续方法对比提供了参照。此外,部分研究者在该数据基础上探索了基于Transformers和多尺度注意力机制的分割网络,旨在进一步提升跨病变类型的分割精度。弱标注子集也催生了半监督学习和伪标签增强等技术,拓宽了数据高效利用的研究路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务