CLIMB
收藏资源简介:
CLIMB是一个综合的多模态临床基准数据集,整合了影像、语言、时间和基因组等多种医学数据。该框架通过利用多种数据类型,能够全面评估患者健康状况,并在临床任务表现上展示了显著的改进。
CLIMB is a comprehensive multimodal clinical benchmark dataset that integrates multiple types of medical data including imaging, textual, temporal, and genomic data. This framework leverages diverse data modalities to enable comprehensive assessment of patient health status, and achieves significant improvements in clinical task performance.
CLIMB 数据集概述
CLIMB(Clinical Large-scale Integrative Multi-modal Benchmark)是一个全面的跨模态临床基准数据集,它统一了跨影像、语言、时间和基因组等多种医疗数据。该框架通过利用多种数据类型,实现对患者健康状况的整体评估,并在临床任务性能上展示显著改进。
数据集构成
- 样本数量:4.51百万患者样本
- 总数据量:19.01太字节
- 来源机构:33个医疗机构
- 临床条件:96种不同的临床条件
- 临床领域:13个临床领域
数据集包括的详细列表可以在Dataset Info中找到。
数据下载
完整数据集下载
创建相应数据集类的对象即可下载。例如: python d = BinaryBrainTumorDataset(base_root=data, download=True)
如果从根目录运行此代码,数据将被下载到data目录。每个数据集将位于自己的目录中,数据集目录按模态分类。例如,Brain Tumor 2将下载到data/mri/brain_tumor_2。
其他下载方式请参考Download Instructions。
数据分布
- 3D/视频样本(超声波、CT扫描、内窥镜图像、MRI图像):40.56%
- 多模态数据组合:22.90%
- 1D数据(电子健康记录、EEG、ECG、步态和基因组数据):19.31%
- 2D影像数据(X射线、皮肤镜检查、眼底图像、病理切片):15.68%
- 图数据(脑网络、分子):1.54%
文件夹结构
fusion:多模态融合策略的代码models:视觉、EEG和ECG编码器src:数据集收集和预处理脚本




