遇见数据集

zju-eye-pretrain

收藏
Hugging Face2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

ZJU Eye-Pretrain是一个为医学基础模型预训练及下游任务设计的大规模、统一多源眼科影像数据集。它整合了来自私人采集和25个公开数据集的资源,总计包含超过110万张图像,涵盖26个不同的队列。数据集主要由三部分构成:1) 私人采集的上海Topcon DRI OCT Triton扫频源OCT数据,约41.9万张图像,包含OCT B扫描、彩色眼底图和灰度扫描激光检眼镜图像;2) 公共眼底数据集,约19.9万张彩色眼底图像,部分包含GAMMA OCT数据;3) 公共OCT数据集,约48.9万张OCT B扫描图像。所有数据遵循一个严格的41列统一数据清单模式,确保了跨源数据的一致性。该模式包含了图像标识符、研究/患者信息(匿名哈希)、采集设备信息(厂商、型号)、临床信息(诊断分组、病变标签、严重程度)、图像元数据(模态、解剖部位、分辨率、质量评分)以及技术参数(扫描协议、B扫描索引)等。部分队列还提供了像素级的分割掩码,用于血管、视盘/视杯、视网膜层、病变区域等。此外,每张图像都配有5个文本描述。数据集适用于多种计算机视觉任务,包括图像分类、图像分割、图像到图像转换、文本到图像生成以及无条件图像生成,是进行眼科医学影像分析、模型预训练和迁移学习的宝贵资源。数据集采用混合许可证,使用者需遵守各原始数据源的许可条款,其中私人数据仅限于研究用途。

创建时间:
2026-05-25
原始信息汇总

数据集概述:ZJU Eye-Pretrain

这是一个统一的多源眼科影像数据集,专为基础模型预训练及下游任务设计。

核心规模

  • 总图像数量:约 110.6万张
  • 总队列数:整合 26个 独立队列
  • 总数据量:约 287 GB

数据组成

数据集由三大部分构成:

来源 图像数量 影像模态 队列数
私有上海Topcon DRI OCT Triton (SS-OCT) 419,042 OCT B-scan, 彩色眼底, SLO灰度 1
公开眼底图像 198,629 彩色眼底, GAMMA OCT 6
公开OCT图像 488,705 OCT B-scan 19
总计 1,106,376 26

影像模态

数据集包含多种眼科影像模态:

  • OCT B-scan (光学相干断层扫描B扫描)
  • Fundus Color (彩色眼底照相)
  • SLO Gray (扫描激光检眼镜灰度图)

主要任务

页面元数据定义的task_categories表明该数据集可用于以下任务:

  • 图像分类
  • 图像分割
  • 图像到图像转换
  • 文本到图像生成
  • 无条件图像生成

数据配置

数据集提供 28个 可加载的配置(config),包括按来源划分的大批次和单一队列。主要配置如下:

大批次配置

配置名称 包含数据
private_topcon 私有上海Topcon数据
public_fundus 所有公开眼底数据
public_oct 所有公开OCT数据

单队列配置(部分列举)

  • 公开眼底队列drive_vessel, eyepacs_combo_dr_aug, gamma_multimodal, idrid, messidor2_dr, refuge2_disc_cup
  • 公开OCT队列kermany, octa500, amd_sd, areds2, aroi, c8, chiu_dme_2015, glaucoma, neh_ut_2021, nyu_poag, octdl, octid, oimhs, olives, retouch, sparsity_sdoct_2012, srinivasan_2014, thoct1800, uestc
  • 私有队列private

数据模式 (Schema)

所有批次共享一个严格的 41列统一清单模式,关键字段包括:

  • 样本信息cohort, study_id, patient_hash, eye, visit_date
  • 设备信息device_vendor, device_model, device_serial_hash, device_software_version
  • 临床信息diagnosis_group, lesion_tags, severity, crt_um, choroid_thickness_um
  • 影像信息image_id, file_path, modality, anatomy, scan_protocol, image_height_px, image_width_px, axial_resolution_um
  • 分割信息has_segmentation, n_layers_visible, fovea_x_norm, 以及每个队列特有的mask列(如vessel_mask, disc_cup_mask等)

标注与字幕

  • 分割标注:部分队列(如DRIVE, IDRiD, REFUGE2, AROI等)提供相应的分割掩码。
  • 字幕:每张图像提供 5条字幕(4个L1变体 + 1个L3衍生),总计约 550万条 字幕,可在captions配置中加载。

许可协议

  • 许可:该数据集整合了多种来源,采用混合许可。详细许可条款见LICENSE文件。
  • 私有数据:私有的上海Topcon数据仅供研究使用,禁止商业用途

语言

支持英语和中文。

搜集汇总
数据集介绍
zju-eye-pretrain 数据集图片
构建方式
ZJU Eye-Pretrain数据集通过整合上海拓普康私有数据与25个公开眼科影像队列构建而成,总计包含来自26个研究队列的逾110万张图像。数据涵盖眼底彩照、OCT B扫描及SLO灰度图等多种模态,所有样本均遵循严格的41列统一清单格式进行规范化处理。私有数据源自上海DRI OCT Triton SS-OCT设备,公开队列则广泛纳入DRIVE、IDRiD、REFUGE2及OCTA500等经典眼科影像数据集,形成了规模宏大且模态多样的预训练数据基座。
特点
该数据集的核心特色在于其多源异构数据的统一化与结构化设计。所有图像均附带详细的元数据清单,涵盖队列来源、设备参数、解剖部位、疾病诊断与严重程度分级等41个标准化字段,确保了跨队列数据的高度可比性与可追溯性。此外,部分队列提供了血管分割、视盘杯盘分割、视网膜层与病灶等多种标注掩膜,极大丰富了监督学习任务的适用性。数据集还额外生成了550万条分层式图像描述文本,支持多模态预训练与图文检索任务。
使用方法
数据集通过HuggingFace Datasets库提供便捷的加载接口,用户可按批次或单个队列灵活调用。加载时需将二进制图像列转换为Image类型以实现自动解码,对于含掩膜的队列需额外标注对应的掩膜列。若需跨批次合并,建议仅保留共同的元数据字段以避免掩膜列不一致问题。对于大规模训练场景,数据集支持流式加载模式,可避免下载全部的287GB数据。此外,图像描述文本以独立配置加载,可通过图像ID与主数据集进行关联使用。
背景与挑战
背景概述
ZJU Eye-Pretrain数据集由浙江大学团队于近年推出,聚合了上海拓普康私有数据与25个公开眼科影像队列,共计超过110万张图像,涵盖OCT、眼底彩照、SLO等多种模态。该数据集旨在为眼科基础模型预训练与下游任务(如分类、分割、生成)提供统一的多源训练资源,其核心研究问题在于如何利用大规模、多中心、多设备、多种疾病标签的异质性影像数据,推动医学影像人工智能模型向泛化能力更强、少样本适应更优的方向发展。该数据集的发布有望缓解眼科领域数据孤岛现象,提升模型在真实临床场景中的鲁棒性与迁移学习效果。
当前挑战
该数据集所应对的领域核心挑战在于眼科影像人工智能模型长期受限于单源、小规模训练数据,导致在面对不同设备、人群和疾病亚型时泛化能力不足,难以胜任真实临床诊断需求。在构建过程中,团队面临多重障碍:26个队列来源广泛,需统一来自不同国家、机构、设备的41列元数据模式与掩码标注格式,确保数据兼容性;私有与公开数据许可协议差异巨大,需对每批数据单独合规授权;数据总量达287GB,需设计高效流式加载机制与增量更新策略,以保证大型训练运行的可行性;此外,不同队列间的疾病标签体系、图像质量、成像协议均不统一,需通过多层级语义描述(5种字幕)与严格的质量过滤来弥合语义鸿沟。
常用场景
经典使用场景
在眼科医学影像分析领域,ZJU Eye-Pretrain数据集以其规模宏大和模态丰富的特性,成为预训练基础模型的理想数据源。该数据集汇聚了超过110万张眼底彩照、光学相干断层扫描(OCT)B扫描及扫描激光检眼镜(SLO)图像,覆盖26个独立队列,为自监督学习、对比学习及多模态表征学习提供了海量训练样本。研究者通常利用其统一的41列清单架构,直接加载各批次的影像数据,并借助流式加载机制高效处理高达287GB的数据量,从而在多种下游任务中实现模型性能的显著提升。
衍生相关工作
基于ZJU Eye-Pretrain数据集,学术界已衍生出多项代表性研究工作。在自监督预训练方面,研究者利用其大规模未标注数据构建了视网膜影像专用的掩码自编码器或对比学习框架,显著提升了OCT扫描中脉络膜层分割的精度。在多模态融合领域,有工作通过联合眼底彩照与OCT图像的跨模态对齐,实现了视网膜血管结构的联合分割与配准。此外,该数据集也被用于探索基础模型在眼科疾病分类中的少样本学习能力,相关工作证明了在1%标注数据条件下,预训练模型仍能达到与全监督方法相近的性能,为降低临床标注成本开辟了新路径。
数据集最近研究
最新研究方向
ZJU Eye-Pretrain数据集汇聚了来自26个队列、超过110万张眼底及OCT影像,构建了统一的多模态眼科预训练基准。当前前沿研究聚焦于利用其大容量、多设备、多病种的异构数据特征,推动眼科基础模型的自监督预训练与迁移学习范式突破。该数据集特别适用于探索跨模态表征对齐(如OCT与眼底彩照间的病变区域映射)、自动分割模型在多种成像设备上的泛化能力,以及基于统一元数据架构的罕见眼病诊断知识蒸馏。其高规模、高兼容性设计为临床级眼病筛查与个性化治疗评估提供了数据基石,助力深度学习在眼科影像分析中迈向工业化落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务