遇见数据集

medpmc-11m-dataset_jun24_baseline

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

MedPMC是一个从PubMed Central (PMC)文章中整理的大规模医学图像-文本数据集,包含约1100万图像-文本对,基于2024年6月的PMC基线。该数据集旨在为医学人工智能研究提供高质量的临床相关视觉内容。与原始PMC资源相比,MedPMC进行了两项主要改进:一是通过过滤非医学图表、绘图、表格、工作流程图等,专注于临床相关的医学图像,涵盖放射学、病理学、眼科学、皮肤病学、内窥镜检查、显微镜检查和临床摄影等多种医学专业和成像模式;二是特别处理了生物医学出版物中常见的多面板图,不仅保留完整的多面板图及其图级标题,还提供从多面板图中提取的单个子图及其对应的子标题。数据集分为三个子集:multipanel(医学多面板图及图级标题)、singlepanel(医学单面板图及图级标题)和subfigure(从多面板图中提取的医学子图与子标题配对)。每个样本包含一个图像文件(如JPG、PNG、WebP格式)和一个对应的JSON元数据文件,存储在.tar分片中。元数据包含来源类型、PubMed Central文章标识符(pmcid)、唯一图像标识符(image_id)、原始图标签(figure_label)、标题(caption)、文章中的引用文本(references)等字段,对于子图还包含父图像标识符(parent_image_id)和父标题(parent_caption)。该数据集适用于医学多模态学习、图像标注、视觉问答等任务,采用CC BY-NC-SA 4.0许可证,供非商业研究使用。

MedPMC is a large-scale medical image-text dataset curated from PubMed Central (PMC) articles, containing approximately 11 million image-text pairs based on the PMC baseline from June 2024. The dataset aims to provide high-quality clinically relevant visual content for medical AI research. Compared to the original PMC resources, MedPMC introduces two main improvements: first, it focuses on clinically relevant medical images by filtering out non-medical charts, drawings, tables, workflow diagrams, etc., covering various medical specialties and imaging modalities such as radiology, pathology, ophthalmology, dermatology, endoscopy, microscopy, and clinical photography; second, it specially handles multi-panel figures common in biomedical publications, not only retaining complete multi-panel figures with their figure-level captions but also providing individual subfigures extracted from multi-panel figures paired with their corresponding subcaptions. The dataset is divided into three subsets: multipanel (medical multi-panel figures with figure-level captions), singlepanel (medical single-panel figures with figure-level captions), and subfigure (medical subfigures extracted from multi-panel figures paired with subcaptions). Each sample includes an image file (e.g., in JPG, PNG, WebP formats) and a corresponding JSON metadata file, stored in .tar shards. The metadata includes fields such as source type, PubMed Central article identifier (pmcid), unique image identifier (image_id), original figure label (figure_label), caption, references in the article, and for subfigures, parent image identifier (parent_image_id) and parent caption (parent_caption). The dataset is suitable for tasks like medical multimodal learning, image captioning, and visual question answering, and is licensed under CC BY-NC-SA 4.0 for non-commercial research use.

创建时间:
2026-06-03
原始信息汇总

数据集概述

MedPMC 是一个大规模医学图像-文本数据集,从 PubMed Central (PMC) 文章库中整理而成。本版本(June 2024 baseline)包含约 1100 万 对图像-文本对。

两大核心改进

  1. 医学图像筛选:过滤掉图表、流程图、表格等非医学图像,聚焦于放射学、病理学、眼科、皮肤科、内窥镜、显微镜、临床摄影等临床相关的视觉内容。
  2. 多面板图像处理:保留原始的多面板完整图像,同时提取单个子面板及其对应的子标题,支持在完整图像和子面板级别使用。

数据集子集

数据集分为三个子集,所有子集均以 .tar 分片形式存储。

子集名称 描述
multipanel 医学多面板图像,包含图像级别的标题。
singlepanel 医学单面板图像,包含图像级别的标题。
subfigure 从多面板图像中提取的子图像,配有子标题。

数据格式

每个样本包含一个图像文件和一个对应的 JSON 元数据文件。

JSON 元数据字段:

  • source_type: 数据来源类型(multipanel, singlepanel, subfigure)。
  • pmcid: PubMed Central 文章标识符。
  • image_id: 基于 PMCID 和图像图形标识符构成的唯一图像级别标识符。
  • figure_label: 文章中的原始图像标签(例如 "Figure 2")。
  • caption: 当前图像样本配对的标题。
  • references: 文章中引用该图像的文本段落。
  • parent_image_id (仅 subfigure 子集): 源多面板图像的 image_id
  • subfigure_index (仅 subfigure 子集): 子图像在源图像中的索引。
  • parent_caption (仅 subfigure 子集): 源多面板图像的完整标题。

许可协议

采用 CC BY-NC-SA 4.0 许可,仅限非商业研究用途。

联系方式

如有问题,可联系 Hyunjae Kim (hyunjae.kim@yale.edu)。

搜集汇总
数据集介绍
medpmc-11m-dataset_jun24_baseline 数据集图片
构建方式
MedPMC数据集源自PubMed Central(PMC)数据库2024年6月的文献基线,通过精心设计的过滤流程,剔除了图表、流程图等非医学图像材料,仅保留具有临床相关性的视觉内容,如放射学、病理学、眼科学等专科影像。针对生物医学文献中常见的多面板复合图,该数据集不仅保留了原始的多面板图形,还进一步提取了单个面板及其对应的子标题,从而构建出包含约1100万图像-文本对的三大子集:多面板图、单面板图与子图。每一样本以图像文件和JSON元数据文件的形式储存于.tar分片中,通过PMCID和图形标识符建立唯一索引。
特点
该数据集的核心特色在于其精细的多面板图像处理与广泛的专业覆盖。不同于多数仅处理单张图像的医学AI数据集,MedPMC既提供完整的多面板图与其图级标题,又分离出各子面板与子标题,赋予研究者灵活选择粗粒度或细粒度图文对的能力。数据集横跨放射学、病理学、皮肤科、内窥镜等多种成像模态,确保了临床场景的多元性。此外,元数据中保留了图像来源的PMCID、图形标签、标题及文献中引用该图形的文本段落,极大增强了数据的可溯性与应用价值。
使用方法
使用者可通过Hugging Face CLI或`datasets`库便捷地下载或流式读取任一子集。例如,使用`huggingface-cli download`命令可整体下载或按子集选择性获取.tar分片;利用`WebDataset`库可构建高效的数据流水线,将分片URL直接映射为图像与JSON元组的迭代器。对于需要按PMCID筛选样本的场景,数据集提供了元数据索引文件,允许仅下载包含目标文章的分片并从中提取对应图文对,显著节省存储与带宽资源。
背景与挑战
背景概述
MedPMC-11M数据集由耶鲁大学BIDS-Chen实验室的研究团队于2024年6月构建,从PubMed Central(PMC)文献库中精选了约1100万对医学图像-文本数据。该数据集致力于解决生物医学领域大规模多模态数据稀缺的核心问题,通过独特的图像筛选策略剔除了图表、流程图等非临床图像,聚焦于放射学、病理学、眼科学等多科室的医学影像内容。其创新性地保留了多面板复合图像结构,同时提供了子图级别的图注匹配,为医学视觉语言模型、跨模态检索及自动化报告生成等前沿研究奠定了重要数据基础,有望推动AI辅助临床诊断和医学知识挖掘的范式革新。
当前挑战
该数据集面临的挑战主要来自两方面:其一,生物医学文献中图像类型繁杂,非医学图表与临床图像混杂,准确筛选高质量、多模态的医疗影像并覆盖跨学科领域是一项艰巨任务;其二,原始文献中大量多面板复合图的拆分与子图注的精准对齐存在技术难点,需要处理面板边界模糊、图注语义依赖上下文及层级结构不统一等问题。此外,构建过程中还需应对PMC语料中图像格式差异、元数据稀疏及伦理合规性要求,确保数据集在规模扩展的同时维持高精度注释与临床相关性,并持续整合新发表文献以保持时效性。
常用场景
经典使用场景
在医学影像分析与自然语言处理交叉领域,MedPMC数据集最为经典的使用场景是构建大规模的医学图像-文本多模态预训练模型。该数据集汇聚了来自PubMed Central(PMC)的约1100万对医学影像与对应描述文本,覆盖放射学、病理学、眼科、皮肤科、内窥镜、显微镜及临床摄影等广泛专科与成像模态。研究者可利用其精心整理的‘单面板’、‘多面板’及‘子图’三种子集,灵活适配不同粒度的图文对齐任务。例如,借助‘多面板’子集训练能够理解复合医学图像的模型,或利用‘子图’子集实现精细的局部-文本关联学习。这种以大规模、多模态、结构化数据为基础的预训练范式,为后续的医学视觉问答、图像检索与报告生成等下游应用奠定了坚实基础。
解决学术问题
该数据集有效解决了医学图像自动理解领域中两大关键学术瓶颈。其一,以往研究常受限于非医学图表、流程图等无关视觉信息的干扰,而MedPMC通过严格的医学图像筛选流程,剔除了图表、图表、表格、工作流示意图等非临床相关内容,显著提升了训练数据的领域纯净度与临床相关性。其二,生物医学论文中频繁出现的多面板复合图像,其内部子图与对应子标题的精细关联长期以来缺乏大规模标注资源。MedPMC创新性地保留了原始多面板图像,并额外提取了带有子标题的单个子图,使得模型能够学习从宏观图像到微观结构的层级化视觉语义,从而推动了医学图像细粒度描述生成与跨模态对齐这一研究领域的实质性进展。
衍生相关工作
MedPMC数据集的发布已催生了一系列富有影响力的相关研究工作。在预训练范式方面,研究者借鉴其多层级图文组织方式,开发了专门针对医学多面板图像的解耦表征学习算法,显著提升了跨模态检索精度。在细粒度分析领域,有工作以此数据集为基础,结合图神经网络建模子图间的空间与语义关联,实现了对复杂病理图像中多病灶区域的联合描述。另有团队利用MedPMC的‘子图’子集构建了更精确的医学视觉定位基准,推动了解释性更强的医学视觉问答系统发展。此外,该数据集的筛选与处理流程也为后来者构建专科专属影像-文本数据集提供了方法学参考,促进了医学多模态人工智能领域的开源生态繁荣。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务