遇见数据集
官方服务:

资源简介:

EBRAINS Digital Brain Tumour Atlas — EBRAINS-30 Subset 是一个专注于脑肿瘤组织病理学全切片图像的数据集,来源于 EBRAINS 知识图谱(UUID: 8fc108ab-e2b4-406f-8999-60269dc1f994),并作为 TITAN 基准测试的一部分(Ding, Wagner, Song, Chen et al., Nature Medicine 2025)。该数据集包含 2320 张全切片图像,用于图像分类任务,每张图像配有细粒度(30 类)和粗粒度(12 类)诊断标签,标签信息存储在 labels.csv 文件中。数据集使用受 EBRAINS 数据使用协议约束,仅允许非商业学术研究用途。

The EBRAINS Digital Brain Tumour Atlas — EBRAINS-30 Subset is a dataset focusing on histopathological whole-slide images of brain tumors, derived from the EBRAINS Knowledge Graph (UUID: 8fc108ab-e2b4-406f-8999-60269dc1f994) and part of the TITAN benchmark (Ding, Wagner, Song, Chen et al., Nature Medicine 2025). It contains 2,320 whole-slide images for image classification tasks, each with fine-grained (30 classes) and coarse-grained (12 classes) diagnostic labels stored in labels.csv. The dataset is subject to the EBRAINS Data Use Agreement and is restricted to non-commercial academic research only.

创建时间:
2026-08-08
原始信息汇总

EBRAINS Digital Brain Tumour Atlas — EBRAINS-30 子集

数据集概述

  • 名称:EBRAINS Digital Brain Tumour Atlas — EBRAINS-30 Subset
  • 来源:EBRAINS 知识图谱,数据集 UUID 为 8fc108ab-e2b4-406f-8999-60269dc1f994
  • 许可:其他(非商用学术研究专用,受 EBRAINS 数据使用协议约束)
  • 任务类型:图像分类
  • 标签:病理学、组织学、脑肿瘤、全切片成像、EBRAINS、TITAN 基准

数据规模与内容

  • 上传切片数:2,320 / 2,320 张(完整上传)
  • 标签信息:提供 labels.csv 文件,包含细粒度(30 类)和粗粒度(12 类)诊断标签

基准与更新

  • 基准参考:TITAN(Ding, Wagner, Song, Chen 等,Nature Medicine 2025)
  • 最后检查点更新:2026-08-10T14:35:40.045176+00:00
搜集汇总
数据集介绍
EBR 数据集图片
构建方式
该数据集源自EBRAINS知识图谱,专注于脑肿瘤病理学领域,以全切片成像(Whole-Slide Imaging)为核心载体,整合了2,320张高分辨率病理切片影像。其构建过程严格遵循EBRAINS数据使用协议,仅限非商业学术研究用途,确保了数据来源的合规性与伦理性。每张切片均配套细粒度(30类)与粗粒度(12类)两级诊断标注,形成层次化的标签体系,为多尺度医学图像分析提供了坚实基础。数据集的构建参考了TITAN基准(Nature Medicine 2025),旨在推动脑肿瘤病理诊断的标准化与可复现性研究。
特点
该数据集的核心特征在于其双重标签结构,即同时提供30类精细诊断与12类粗略分类,兼顾了临床病理学的细分需求与大规模分析的简洁性。此外,其依托EBRAINS数字化脑肿瘤图谱,确保了数据的高度专业性。2,320张全切片影像的完整性,以及定期更新的检查点,保障了数据集的时效性与一致性。尤为重要的是,该数据集严格限定于非商业学术研究,有效规避了伦理与隐私风险,成为脑肿瘤病理人工智能模型训练与验证的理想资源。
使用方法
使用该数据集时,研究者需首先遵守EBRAINS数据使用协议的条款,确保研究目的符合非商业学术要求。数据以全切片影像格式提供,配合labels.csv文件中的分级标签,可便捷地加载至深度学习框架中。建议结合TITAN基准的评估协议,进行模型性能的公平比较。对于图像分类任务,可将30类标签用于细粒度预测,或将12类标签用于粗粒度分析,以适配不同研究目标。此外,数据集的层级结构允许研究者探索多任务学习或标签层次化建模,从而提升病理诊断的泛化能力。
背景与挑战
背景概述
脑肿瘤的精准诊断高度依赖组织病理学检查,然而传统人工阅片面临效率低下与主观性强的双重瓶颈。随着数字病理学与人工智能的深度融合,大规模、高质量的全切片图像(WSI)数据集成为推动智能辅助诊断模型发展的关键基石。在此背景下,EBRAINS数字脑肿瘤图谱(EBRAINS-30子集)应运而生,由欧洲EBRAINS知识图谱团队联合TITAN基准项目(Ding, Wagner, Song, Chen等,发表于Nature Medicine 2025)于近期构建,共计包含2,320张全切片图像,覆盖30种细粒度及12种粗粒度脑肿瘤诊断标签。该数据集依托EBRAINS基础设施,遵循严格的数据使用协议,致力于为非商业学术研究提供标准化、可复现的基准资源,对脑肿瘤病理图像分类领域具有深远的推动意义。
当前挑战
该数据集所应对的领域挑战尤为突出:脑肿瘤亚型繁多、形态学特征高度异质,且不同医疗中心染色方案与扫描设备差异显著,使得通用图像分类模型难以直接迁移应用,亟需大规模、多类别标注数据以捕捉关键的诊断特征。在构建过程中,EBRAINS团队遭遇了多重困难,包括全切片图像的超高分辨率导致存储与计算开销巨大,肿瘤区域标注需要多名病理专家协同以确保一致性,跨机构数据整合时需协调伦理审批与数据使用协议,以及确保2,320张切片在时间跨度内的质量控制与标签校验。此外,非商业限制进一步增加了数据共享与复用的复杂性,对研究者的合规意识与数据处理能力提出了更高要求。
常用场景
经典使用场景
EBR数据集,作为EBRAINS数字脑肿瘤图谱的核心子集,其经典使用场景聚焦于脑肿瘤的自动分类与分级任务。基于2,320张全切片图像(WSI),该数据集提供了细粒度30类与粗粒度12类诊断标签,为病理图像分析领域的研究者提供了高维度的基准测试平台。研究者可借助此数据集,运用深度学习模型对脑肿瘤进行精确判别,推动组织病理学诊断从传统显微观察向计算病理学范式转变,尤其在胶质瘤、脑膜瘤等常见肿瘤亚型的识别上发挥关键作用。
解决学术问题
该数据集直面脑肿瘤病理诊断中存在的标注稀缺、类别不均衡及跨中心泛化难题。通过提供标准化标注的WSI集合,EBR支持开发鲁棒性强的视觉特征提取算法,有效缓解了单中心数据导致的模型过拟合问题。其意义在于建立了可复现的基准(如TITAN基准),使学者能够公平对比不同方法的性能,促进了多模态融合、弱监督学习等前沿技术在神经肿瘤学中的落地,并为精准医疗中的分子分型与预后预测奠定数据基石。
衍生相关工作
围绕EBR数据集,衍生出一系列开创性研究,如基于自监督预训练的病理基础模型、图神经网络聚合的WSI表示学习,以及结合临床影像的多模态诊断系统。TITAN基准本身即是该数据集的标志性衍生工作,其提出的评估框架激励了后续研究在可解释性与不确定性量化上的突破。此外,该数据集还催生了跨机构联邦学习协议的设计,以解决数据隐私与共享矛盾,这些工作共同推动了计算病理学从单纯分类向全面临床决策支持系统的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务