遇见数据集

Real-World Multi-Modal and Longitudinal Lung Cancer Dataset

收藏
github2026-09-07 更新2026-09-10 收录
官方服务:

资源简介:

该数据集是一个新整理的多中心、多模态、纵向数据集,包含1365名肺癌患者,具有三种影像模态(全切片图像、CT扫描和PET扫描)、结构化临床数据、转录组学以及纵向随访和治疗信息。每个影像模态包含多个实例,且跨模态存在显著且不均匀的缺失,适用于研究鲁棒的多模态融合策略。

This dataset is a newly curated multi-center, multi-modal, and longitudinal dataset comprising 1365 lung cancer patients. It includes three imaging modalities (whole-slide images, CT scans and PET scans), structured clinical data, transcriptomics, as well as longitudinal follow-up and treatment information. Each imaging modality contains multiple instances, and there is significant and non-uniform missingness across modalities, making it suitable for researching robust multi-modal fusion strategies.

创建时间:
2026-08-11
原始信息汇总

MMIST-LUNG 数据集概述

该数据集是论文“Real-World Multi-Modal and Longitudinal Lung Cancer Dataset”(发表于 ECCV DCA-MI Workshop)中使用的基准数据集,托管于 MMIST 网站,可通过 https://multi-modal-ist.github.io/datasets/Lung/ 访问。

核心特点

  • 多中心、多模态、纵向:数据集来自多个中心,包含多种数据模态,并记录了纵向随访和治疗信息。
  • 真实世界条件:数据收集方式不一致且常有缺失,能够反映真实临床场景。
  • 数据规模:共包含 1,365 名肺癌患者。

数据类型

数据集包含以下模态:

  • 三种影像模态:全切片图像(whole-slide images)、CT 扫描和 PET 扫描,每种影像模态均有多于一个实例。
  • 结构化临床数据。
  • 转录组学数据。
  • 纵向随访和治疗信息。

缺失性特征

数据集在不同模态间表现出显著且不均匀的缺失性,适合用于研究鲁棒的多模态融合策略。

基准任务

提供了单模态和多模态基准,涵盖以下任务:

  • 12个月总生存期预测
  • 疾病特异性生存预测
  • 在严重数据缺失条件下的纵向风险(hazard)预测基准

主要发现

研究结果显示,尽管存在高水平的缺失性,整合互补模态相比单模态方法始终能提高预测性能,这凸显了在真实临床环境中进行多模态融合的价值。

搜集汇总
数据集介绍
Real-World Multi-Modal and Longitudinal Lung Cancer Dataset 数据集图片
构建方式
该数据集是基于多中心、多模态与纵向随访的临床资源整合而成,覆盖1,365例肺癌患者。构建过程旨在模拟真实世界数据非理想化特征,包括影像(全玻片图像、CT、PET)、结构化临床记录、转录组学及治疗结局等。每个影像模态都包含多个实例,且数据缺失呈现显著非均匀分布。这一设计使得数据集既能支持单元像研究,亦为多模态融合算法提供基准测试环境。
特点
该数据集的显著特点在于其纵向设计与高度缺失性。数据密集地采集了多个时间点的随访与治疗信息,同时模态间缺失模式复杂,挑战了传统多模态融合方法的鲁棒性。此外,多中心来源保证了数据的异质性与临床代表性,为评估模型泛化能力提供了严苛条件。因此,它特别适用于开发抗缺失、跨模态的学习策略。
使用方法
研究者可通过MMIST官网获取该数据集,利用提供的基准代码进行模型评估。其典型应用包括在12个月总生存期、疾病特异性生存期及风险预测等任务上,开展单模态或多模态学习。该数据集的有效使用需关注缺失数据处理,可结合数据插补或多模态融合框架,以适应纵向随访和复杂临床场景的需求。
背景与挑战
背景概述
多模态学习在医学领域的应用日益广泛,通过整合医学影像、临床记录和基因组学等异构数据源,有望提升预测性能并辅助临床决策。然而,现有研究常受限于缺乏反映真实世界条件的高质量数据集,这些数据往往采集不一致且不完整,同时异构数据模态的整合也充满挑战。为填补这一空白,ECCV DCA-MI Workshop上发布的“Real-World Multi-Modal and Longitudinal Lung Cancer Dataset”应运而生。该数据集由多中心团队精心构建,涵盖1365例肺癌患者,包含全切片图像、CT和PET三种影像模态,以及结构化临床数据、转录组学、纵向随访和治疗信息。每种影像模态均包含多个实例,且数据缺失严重且非均匀,为研究鲁棒的多模态融合策略提供了理想平台。该数据集发表于2023年,其基准测试涵盖12个月总体生存预测、疾病特异性生存及纵向风险预测,结果表明即使在高缺失率下,多模态融合仍优于单模态方法,凸显了其在真实临床场景中的价值,对医学影像分析及多模态学习领域产生了重要影响。
当前挑战
该数据集面临的挑战多维且严苛。在领域层面,核心挑战在于真实临床环境中数据的高度不完整性和非均匀缺失,这要求多模态融合算法具备强大的鲁棒性,以应对模态间信息的非同步缺失。同时,整合来自医学影像、临床文本和基因组学等异构数据源,需克服特征表示与对齐的固有困难。在构建过程中,团队面临诸多实际难题:数据来自多个中心,需统一格式并确保隐私合规;病理全切片图像与CT/PET影像的尺度与分辨率差异巨大,需精细的数据预处理与标准化。此外,纵向随访信息的收集耗时且易中断,导致时间相关数据的稀疏性。最终基准测试显示,尽管多模态融合在性能上优于单模态,但数据缺失的严重性对模型泛化能力和临床可解释性提出了更高要求,这些挑战共同构成了该领域亟待攻克的科研前沿。
常用场景
经典使用场景
该数据集作为真实世界多模态、纵向肺癌数据的典范,其核心使用场景聚焦于多模态融合策略的评估与验证。研究人员可借助其包含的病理全切片图像、CT与PET影像、结构化临床记录、转录组数据及纵向随访信息,系统性地训练和比较多种学习流水线。尤其值得注意的是,数据集刻意保留了临床实践中常见的非均匀缺失模式,为模拟真实数据分布、测试鲁棒融合算法提供了不可多得的基准。基于此,该数据集常被用于12个月总生存期预测、疾病特异性生存分析以及严重数据缺失条件下的风险预测等任务,以衡量不同模态互补性对预测效能的提升。
实际应用
在临床实践中,该数据集驱动的模型可直接赋能肿瘤科医生进行个体化治疗决策。通过整合患者的影像、病理与分子特征,预测12个月内的生存概率并细化风险分层,有助于合理规划治疗方案并避免过度治疗。同时,数据集中纵向信息的利用为动态监测疾病进展和及时调整干预策略提供了依据,尤其适用于晚期非小细胞肺癌患者的全程管理。上述能力在影像科、病理科与肿瘤内科联合工作流中具有显著应用潜力,能够促进多学科团队协作,提升癌症诊疗的精准度和效率。
衍生相关工作
此数据集的发布催生了一系列高质量研究,尤其在视觉-语言模型、图神经网络与多模态Transformers的融合应用上。后续工作常以该数据集为基准,探索如何克服模态缺失、时序不规则采样等挑战,发展基于注意力机制或生成式填补的融合策略。部分研究进而延伸至联邦学习框架,以在不共享原始数据的前提下实现多中心模型协作,进一步优化对隐私敏感医疗数据的利用。此外,该数据集亦被用于开发多模态生存分析模型,如基于Transformer的生存预测架构,推动了医疗机构对纵向多模态数据价值的深入挖掘。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务