遇见数据集

EMory BrEast imaging Dataset (EMBED)

收藏
arXiv2022-02-08 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

EMory BrEast imaging Dataset (EMBED)是由埃默里大学创建的一个大型、细粒度且种族多样的乳腺影像数据集,包含365万次筛查和诊断性乳腺X光片,涉及11.6万名女性,其中白人和非洲裔美国患者各占一半。数据集还包含4万个注释病变,与结构化影像描述符和61个基于严重程度分类的病理结果相关联。创建过程涉及使用自动化和半自动化技术,确保数据的高质量和一致性。该数据集旨在支持开发和验证公平服务于所有患者的乳腺AI模型,减少医疗AI中的偏见,特别关注改善非洲裔美国女性的乳腺影像研究代表性。

The EMory BrEast imaging Dataset (EMBED) is a large-scale, fine-grained, and racially diverse breast imaging dataset developed by Emory University. It comprises 3.65 million screening and diagnostic mammography examinations across 116,000 female patients, with half of the cohort identifying as White and the other half as African American. Additionally, the dataset contains 40,000 annotated lesions, which are associated with structured imaging descriptors and 61 severity-stratified pathological findings. Its development utilized automated and semi-automated techniques to ensure high data quality and consistency. This dataset aims to support the development and validation of breast AI models that equitably serve all patients, mitigate bias in medical AI, with a particular focus on enhancing the representation of African American women in breast imaging research.

提供机构:
埃默里大学
创建时间:
2022-02-08
搜集汇总
数据集介绍
EMory BrEast imaging Dataset (EMBED) 数据集图片
构建方式
在乳腺影像人工智能研究领域,构建具有广泛代表性和精细标注的数据集是推动算法公平性与泛化能力的关键。EMBED数据集通过回顾性收集2013年至2020年间四家医院机构的筛查与诊断性乳腺X线影像,运用自动化与半自动化技术流程进行系统构建。其核心步骤包括利用Niffler开源管道从PACS系统中提取DICOM格式影像,并转换为16位PNG格式;通过结合DICOM元数据规则与深度学习模型,精准区分二维影像、数字乳腺断层合成影像及特殊投照视图;进而采用基于EfficientDet架构的目标检测模型,从屏幕保存图像中自动提取约4万个病灶感兴趣区域,并通过图像配准技术将其映射回原始影像。病理结局通过MagView系统结构化编码,并辅以自然语言处理模型对自由文本报告进行二次校验,确保了数据标注的准确性与一致性。
特点
EMBED数据集在规模、多样性与粒度层面呈现出显著优势。其囊括了约36.5万张乳腺X线影像,覆盖11.6万名女性患者,其中白人与非洲裔患者比例均衡,有效弥补了既往数据集中种族代表性不足的缺陷。数据集不仅包含丰富的影像数据,还整合了基于BI-RADS的结构化影像描述符、61种病理结局的严重程度分级,以及人口统计学、家族史与治疗史等多维度临床信息。尤为突出的是,约4万个病灶区域注释与影像描述符及病理结局实现了高比例自动关联,为模型训练提供了精准的监督信号。数据存储采用MongoDB数据库与分层文件结构,兼顾了灵活性与可扩展性,整体规模达16TB,为大规模深度学习研究提供了坚实基础。
使用方法
为促进乳腺人工智能模型的稳健开发与验证,EMBED数据集在构建之初便设计了清晰的用途框架。数据集已按患者层级随机划分为80%的训练验证集与20%的内部测试集,确保患者数据无交叉,其中测试集描述信息予以保留,专用于模型性能的客观评估。研究者可利用训练验证集开发病灶检测、病理分类或风险预测模型,并借助丰富的结构化标注信息进行多任务学习。数据集提供的病灶区域坐标、影像描述符及病理严重程度标签可直接用于监督学习;同时,其均衡的种族分布支持算法公平性研究,有助于探查并缓解模型在不同人群中的性能差异。外部合作者可通过个案审查机制申请数据访问,初步开放的千例患者子集亦为研究者评估数据适用性提供了便利。
背景与挑战
背景概述
在医学影像人工智能领域,乳腺癌症检测一直是深度学习技术应用的核心场景之一。然而,现有公开乳腺影像数据集普遍存在规模有限、标注粒度不足或人口多样性缺失等问题,导致模型泛化能力受限,尤其在非洲裔患者群体中表现不佳。为应对这一挑战,埃默里大学研究团队于近期构建了EMory BrEast imaging Dataset (EMBED),该数据集收录了2013年至2020年间约36.5万张筛查与诊断性乳腺X线影像,涵盖11.6万名女性患者,其中白人与非洲裔患者比例均衡。数据集不仅包含4万个标注病灶区域,还整合了结构化影像描述符与六类病理严重程度分级,旨在为开发公平、低偏差的乳腺AI模型提供关键数据基础,推动影像诊断的普惠化发展。
当前挑战
EMBED数据集致力于解决乳腺影像人工智能模型在多样性与泛化性方面的核心挑战。现有模型常因训练数据缺乏种族代表性而产生隐性偏差,导致在非洲裔患者群体中诊断性能下降;同时,数据标注的粒度不足也限制了模型对复杂病灶的识别能力。在构建过程中,研究团队面临多重技术难题:影像数据需区分二维、数字乳腺断层合成及合成二维视图等多种模态;特殊诊断视图中的组织提取与区域标注依赖复杂的计算机视觉流程;病灶区域与结构化诊断信息的自动关联在多发征象场景下存在歧义;此外,多制造商设备生成的DICOM元数据异构性与影像窗位差异亦增加了数据标准化处理的复杂度。
常用场景
经典使用场景
在乳腺影像人工智能研究领域,EMBED数据集以其大规模、高粒度和种族多样性特征,成为开发与验证深度学习模型的经典资源。该数据集整合了36.5万张筛查与诊断性乳腺X线影像,涵盖等比例的白人与非裔美国患者群体,并包含4万余个标注病灶区域及结构化影像描述符。研究者常利用其丰富的影像与病理关联数据,训练用于乳腺癌早期检测与风险评估的卷积神经网络,旨在提升模型在不同人群中的泛化性能与公平性。
衍生相关工作
EMBED数据集已催生多项具有影响力的学术工作,尤其在乳腺癌风险预测与筛查策略优化领域。例如,研究团队利用该数据验证了多机构乳腺影像风险模型的性能,并探索了基于强化学习的风险分层筛查政策。这些衍生研究不仅证实了数据集在模型泛化验证中的价值,还推动了AI在临床决策支持中的应用,为后续大规模、多中心协作研究提供了可复现的数据基准与方法框架。
数据集最近研究
最新研究方向
在乳腺影像人工智能领域,EMBED数据集以其种族多样性、大规模和高粒度特性,正推动着公平性人工智能模型的前沿探索。该数据集整合了约36.5万张筛查与诊断性乳腺X线影像,并包含4万处标注病灶及病理结果,特别强调了非裔与白人患者的均衡代表性。当前研究聚焦于利用EMBED开发可减少种族偏见的深度学习模型,以应对医疗AI中普遍存在的系统性偏差问题。相关热点包括结合强化学习优化乳腺癌风险分层策略,以及通过多中心验证提升模型的泛化能力。这些进展不仅有望改善非裔患者的乳腺癌筛查效果,也为构建更具包容性和可靠性的医疗人工智能系统提供了关键数据支撑。
相关研究论文
  • 1
    The EMory BrEast imaging Dataset (EMBED): A Racially Diverse, Granular Dataset of 3.5M Screening and Diagnostic Mammograms埃默里大学 · 2022年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务