遇见数据集

Awesome-Medical-Vision-Language-Learning

收藏
github2026-04-24 更新2026-06-04 收录
官方服务:

资源简介:

该合集专注于收集和索引医学视觉语言学习领域的公共数据集,涵盖医学影像模态如胸部X光、CT、超声、MRI等,并提供数据集的年份、图像数量、文本信息及相关论文链接。同时,合集还包括相关调查、教程和视觉语言预训练方法,旨在为研究人员提供全面的资源索引。

This collection focuses on collecting and indexing public datasets in the field of medical vision-language learning, covering medical imaging modalities such as chest X-rays, CT scans, ultrasound, MRI and other modalities. It provides the release year, number of images, textual information and relevant paper links for each dataset. Additionally, the collection includes relevant surveys, tutorials and vision-language pre-training methods, aiming to offer comprehensive resource indexes for researchers.

创建时间:
2023-01-24
原始信息汇总

数据集详情总结

数据集列表

该页面整理了4个医学视觉语言数据集,涵盖年份、模态、图像数量和文本数量:

数据集 年份 模态 图像数量 文本数量
MIMIC-CXR 2019 胸部X光 377,110 227,827
CheXpert 2019 胸部X光 224,316 224,316
ROCO 2018 CT、超声、X光、透视、PET、乳腺摄影、MRI、血管造影、PET-CT 81,825 81,825
MedICaT 2020 CT、超声、X光、透视、PET、乳腺摄影、MRI、血管造影、PET-CT 217,060 217,060

综述论文

  • 2022年《VLP: A Survey on Vision-Language Pre-training》(arXiv)
  • 2022年《Vision-Language Pre-training: Basics, Recent Advances, and Future Trends》(arXiv)
  • 2022年《Beyond Medical Imaging: A Review of Multimodal Deep Learning in Radiology》(techrxiv)

教程

  • 2022年ACL《Vision-Language Pretraining: Current Trends and the Future》
  • 2022年CVPR《Recent Advances in Vision-and-Language Pre-training》

视觉语言预训练

文本编码器

编码器 年份 语料库
BioBERT 2020 PubMed
ClinicalBERT 2019 MIMIC-III
PubMedBERT 2022 PubMed
CXR-BERT 2022 PubMed+MIMIC-III/CXR

训练方法(按年份)

2023年:

  • PMC-CLIP(arXiv)
  • BiomedCLIP(arXiv)
  • Vision-Language Modelling for Radiological Imaging and Reports in the Low Data Regime(MIDL)
  • PTUnifier(arXiv)
  • MRM(ICLR)
  • BioViL-T(CVPR)
  • MedKLIP(arXiv)

2022年:

  • MGCA(NIPS)
  • MedCLIP(EMNLP)
  • M3AE(MICCAI)
  • Breaking with Fixed Set Pathology Recognition through Report-Guided Contrastive Training(MICCAI)
  • ARL(MM)
  • MedViLL(JHB1)
  • REFERS(Nature Machine Intelligence)
  • BioViL(ECCV)
  • LoVT(ECCV)

2021年:

  • Local-MI(MICCAI)
  • GLoRIA(ICCV)
  • Self-supervised Image-text Pre-training With Mixed Data In Chest X-rays(arXiv)

2020年:

  • A Comparison of Pre-trained Vision-and-Language Models(BIBM)
  • ConVIRT(MLHC)

2018年:

  • Unsupervised Multimodal Representation Learning across Medical Images and Reports(NIPS workshop)

使用方法(按年份)

2023年:

  • Medical Image Understanding with Pretrained Vision Language Models(ICLR)

2022年:

  • Adapting Pretrained Vision-Language Foundational Models to Medical Imaging Domains(NIPS workshop)

2021年:

  • PubMedCLIP(arXiv)

视觉语言任务

分割

  • LViT(2022,arXiv)

生成

  • RoentGen(2022,arXiv)

更多相关论文可参考:Awesome-Multimodal-Applications-In-Medical-Imaging

搜集汇总
数据集介绍
Awesome-Medical-Vision-Language-Learning 数据集图片
构建方式
该数据集以系统化综述的形式构建,通过全面检索并筛选2018年至2023年间发表的医学视觉-语言学习领域文献,整合了多个公开可用的多模态数据集。核心数据源自MIMIC-CXR、CheXpert、ROCO和MedICaT等权威资源,涵盖胸部X光、CT、超声、MRI等多种影像模态,并配以对应的文本报告或描述。数据集还收录了相关的预训练模型、文本编码器及下游任务应用,形成层次分明的知识体系。
特点
其显著特点在于时间跨度广、模态覆盖全,囊括了从早期无监督方法到近期基于提示学习的先进范式。数据集不仅提供了影像-文本对的量化统计(如MIMIC-CXR包含377,110张图像与227,827份报告),还梳理了不同预训练策略(如对比学习、掩码建模)及其对应的模型架构。此外,数据集按任务类型(分割、生成等)分类论文,便于研究者快速定位特定方向的最新进展。
使用方法
研究者可直接通过数据集内链接访问原始数据源(如MIMIC-CXR的PhysioNet页面)及论文全文。对于模型复现,数据集提供了代码仓库(如GitHub链接)和预训练权重(如HuggingFace模型卡)。使用者可按年份或任务筛选文献,或直接参考'How to Train'与'How to Use'板块中的方法,结合MedKLIP、BioViL等开源实现开展实验,也可依据数据集统计信息评估不同模态组合的适用性。
背景与挑战
背景概述
医学视觉语言学习是人工智能与临床影像交叉领域的前沿方向,旨在通过融合医学影像与自由文本报告,构建能够理解复杂医学语义的多模态模型。自2018年以来,以MIMIC-CXR、CheXpert等为代表的大规模胸部X光数据集相继涌现,为这一领域的研究奠定了数据基础。该资源汇总了从2018年至2023年间的重要数据集、预训练方法及应用研究,涵盖了影像模态包括CT、超声、MRI等,文本形式涵盖放射学报告及临床笔记。核心研究问题聚焦于如何利用对比学习、掩码建模等策略,在医学领域实现视觉与语言的高效对齐与推理。该领域的快速发展推动了医学影像分析从单模态向多模态理解的范式转变,显著提升了疾病诊断、报告生成等任务的性能。
当前挑战
医学视觉语言学习面临多重挑战。首先,医学影像与文本之间天然存在语义鸿沟,影像特征与临床描述的映射关系复杂,且标注数据稀缺,限制了模型的泛化能力。其次,现有数据集多集中于胸部X光(如MIMIC-CXR、CheXpert),缺乏对多器官、多模态(如PET、MRI)的覆盖,导致模型在其他影像模态上的迁移效果不佳。构建过程中,医学报告的隐私保护要求使得数据获取与共享困难,且报告文本存在术语不统一、噪声多等问题。此外,模型需要处理长尾疾病类别、不同影像设备的域偏移,以及时序信息(如前后对比)的有效建模,这些都增加了预训练与微调的难度。
常用场景
经典使用场景
在医学影像分析领域,视觉语言预训练模型常被用于胸部X光片的自动解读与报告生成。该数据集整合了MIMIC-CXR、CheXpert等大规模影像-文本对,支持模型学习从放射影像到自然语言描述的跨模态映射。研究者通过对比学习或掩码建模,使模型能够同时理解图像中的病理特征与对应的临床报告,从而实现零样本或少样本下的疾病分类、异常检测与报告摘要生成。这一场景不仅降低了人工标注成本,还显著提升了模型在稀缺标注数据下的泛化能力。
解决学术问题
该数据集系统性地解决了医学领域中视觉与语言模态对齐困难的核心学术问题。传统方法依赖大量手工标注,且难以捕捉影像中细微的病理语义。通过提供统一的多模态预训练基准,该数据集推动了对比学习(如ConVIRT)、掩码建模(如M3AE)等范式在医学场景的落地,使模型能够从非结构化的影像-报告对中自主学习有临床意义的表征。其意义在于为跨模态推理、可解释性分析及低资源场景下的稳健诊断提供了可复现的验证平台,加速了医学人工智能从监督学习向自监督学习的范式转换。
衍生相关工作
该数据集催生了一系列经典工作,包括对比学习框架ConVIRT和GLoRIA,开创了医学视觉语言预训练的先河。后续的BioViL-T引入时间结构建模,MGCA实现多粒度跨模态对齐,而RoentGen则探索了基于扩散模型的胸部X光片生成。在任务层面,LViT将语言先验融入医学图像分割,MedViLL统一了图像理解与报告生成。这些工作不仅验证了数据集在预训练中的有效性,还推动了医学影像分析向更精细的语义理解与生成能力演进,形成了从表征学习到下游任务的全链条研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务