CancerVerse
收藏官方服务:
资源简介:
CancerVerse 是一个用于3D医学图像分割的大规模数据集,专注于腹部区域,包含详细的结构化标注。数据来源于多个医疗中心,旨在支持高效的迁移学习和开放的算法基准测试。数据集规模在1万到10万样本之间,适用于监督学习模型的迁移评估和3D图像分割任务的研究与开发。
CancerVerse is a large-scale dataset for 3D medical image segmentation, focusing on the abdominal region with detailed structured annotations. The data is sourced from multiple medical centers and aims to support efficient transfer learning and open algorithm benchmarking. The dataset size ranges from 10,000 to 100,000 samples, suitable for transfer evaluation of supervised learning models and research and development in 3D image segmentation tasks.
创建时间:
2026-06-17
原始信息汇总
数据集概述
基本信息
- 数据集名称:CancerVerse
- 许可证:CC BY-NC-ND 4.0(非商业性使用,禁止演绎)
- 数据规模:10,000 < 样本数量 < 100,000
下载方式
通过以下命令下载数据集: bash mkdir CancerVerse cd CancerVerse bash download_cancerverse.sh
引用信息
若在研究中使用了CancerVerse,建议引用以下论文:
- Li et al., "How well do supervised models transfer to 3d image segmentation", ICLR 2024.
- Li et al., "AbdomenAtlas: A large-scale, detailed-annotated, & multi-center dataset for efficient transfer learning and open algorithmic benchmarking", Medical Image Analysis, 2024.
搜集汇总
数据集介绍

构建方式
CancerVerse数据集通过整合来自多个公开来源的3D医学影像数据构建而成,涵盖不同解剖部位和病理类型的癌症病例。其构建过程依赖于系统化的数据收集与预处理流程,包括影像格式统一、标注质量审核以及数据划分,最终形成一个规模在10K至100K样本之间、适用于深度学习模型训练与评估的高质量医学影像数据集。
特点
CancerVerse数据集的核心特点在于其多中心、多模态的3D医学影像覆盖,有效支撑跨域迁移学习研究。数据集包含了丰富的癌症类型与解剖结构标注,为监督学习模型的泛化性能评估提供了坚实基础。此外,其规模适中且数据来源多样,显著降低了领域适应中的分布偏移问题,使其成为连接基础研究与临床应用的理想桥梁。
使用方法
用户可通过提供的bash脚本一键下载CancerVerse数据集,即执行`mkdir CancerVerse && cd CancerVerse && bash download_cancerverse.sh`指令。下载完成后,数据可直接用于3D医学图像分割任务的模型训练、验证与测试。研究人员应遵循CC-BY-NC-ND-4.0许可协议,在非商业用途下使用,并引用相关论文以确保学术规范。
背景与挑战
背景概述
CancerVerse数据集由李文轩、Alan Yuille和Zongwei Zhou等研究人员于2024年发布,隶属于国际学习表征会议(ICLR)相关研究项目。该数据集聚焦于三维医学图像分割中监督模型迁移学习的性能评估,旨在解决医学影像分析领域中标注数据稀缺的核心难题。通过整合大规模多中心腹部CT数据(如AbdomenAtlas相关工作),CancerVerse为跨场景、跨器官的病变分割提供了基准测试平台,显著推动了深度学习在精准医疗中的应用。其在医学图像分析领域的影响力体现在促进了模型泛化能力的研究,并为后续的开放算法评估奠定了数据基础。
当前挑战
CancerVerse所面临的领域挑战主要体现在三维医学图像分割中监督模型的迁移学习效果不稳定,现有模型在跨数据集、跨解剖结构场景下普遍存在性能衰减问题,难以满足临床对鲁棒性和准确性的双重要求。构建过程中的挑战包括:多中心CT数据的异质性(如扫描参数、对比剂使用差异)导致标注一致性维护困难;获取高质量大规模三维体素级标注需要耗费大量专家时间与医疗资源;数据集规模(10K至100K样本)虽已较大,但相较于实际临床场景中的病灶多样性仍显不足,易引发长尾分布下的样本偏差问题。
常用场景
经典使用场景
在医学影像分析领域,CancerVerse数据集作为一项关键资源,被广泛用于三维医学图像分割模型的训练与评估。其核心使用场景聚焦于跨器官、跨模态的肿瘤分割任务,尤其适用于从腹部CT扫描中精准勾勒肝脏、肾脏、胰腺等器官内的癌变区域。研究人员常将其与公共预训练模型结合,探索迁移学习在三维分割中的效能,从而推动模型在小样本或稀疏标注场景下的泛化能力提升。
实际应用
在实际临床环境中,CancerVerse数据集推动了智能辅助诊断系统的落地与优化。基于该数据集训练的模型可自动识别和分割CT影像中的恶性肿瘤区域,帮助放射科医生快速定位病灶、量化肿瘤体积,并支持治疗前后疗效对比与手术规划。此外,该数据集还在多中心医疗协作中发挥重要作用,有助于构建标准化的影像分析流程,降低人工判读的异质性。
衍生相关工作
CancerVerse数据集的诞生衍生了一系列具有影响力的学术成果,例如Li等人提出的迁移学习框架系统验证了监督模型向三维分割任务的迁移效能,并发表在ICLR 2024上。此外,AbdomenAtlas项目作为其延伸工作,进一步整合了更大规模的多中心标注数据,推动了开放基准测试与高效迁移学习范式的发展。这些工作共同构成了医学影像分析从数据积累到算法评估的完整生态链。
以上内容由遇见数据集搜集并总结生成



