as-cle-bert/breastcancer-auto-objdetect
收藏官方服务:
资源简介:
该数据集是基于Walid Al-Dhabyani及其合作者在2019年提供的数据集,包含547张乳腺癌超声图像,其中387张为良性乳腺癌超声图像,160张为恶性乳腺癌超声图像。数据集还包含了从掩码推断出的相关对象检测信息,格式与CPPE-5数据集相同。
This dataset is based on the one provided by Walid Al-Dhabyani and his collaborators in 2019. It contains 547 breast ultrasound images, including 387 benign breast ultrasound images and 160 malignant breast ultrasound images. The dataset also includes relevant object detection information inferred from masks, which follows the same format as the CPPE-5 dataset.
提供机构:
as-cle-bert原始信息汇总
数据集概述
数据集名称
- 名称: breastcanc-ultrasound-class
数据集特征
- 特征列表:
image_id: 数据类型为int64image: 数据类型为imagewidth: 数据类型为int64height: 数据类型为int64objects: 结构体,包含以下子特征:area: 数据类型为float64bbox: 数据类型为int64category: 数据类型为int64id: 数据类型为int64
数据集划分
- 训练集:
- 样本数量: 547
- 数据大小: 181919726.0 字节
数据集大小与下载大小
- 下载大小: 181637597 字节
- 数据集大小: 181919726.0 字节
数据集来源与组成
- 来源: 由 Walid Al-Dhabyani 及其合作者于2019年提供
- 组成: 包含547张图像,其中387张为良性乳腺癌超声图像,160张为恶性乳腺癌超声图像,以及相关的对象检测信息。
许可证与引用信息
- 许可证: CC 家族许可证
- 引用: 请在使用时引用 Al-Dhabyani W, Gomaa M, Khaled H, Fahmy A. Dataset of breast ultrasound images. Data in Brief. 2020 Feb;28:104863. DOI: 10.1016/j.dib.2019.104863
搜集汇总
数据集介绍

构建方式
在乳腺癌诊断领域,精准的医学影像数据集对于提升自动化检测模型的性能至关重要。该数据集源自Walid Al-Dhabyani及其合作者在2019年公开的乳腺癌超声影像资源,经过精心筛选与标注,最终构建了包含547张图像的集合。其中,良性病例图像387张,恶性病例图像160张。每张图像均配备了从原始掩膜中推导出的目标检测信息,格式与CPPE-5标准保持一致,涵盖边界框、区域面积及类别标签等关键要素,从而为自动化目标检测任务提供了高质量的监督信号。
特点
该数据集的核心特点在于其专注于乳腺癌超声影像的目标检测任务,图像规模虽为中等,但良性恶性样本分布明确,有助于平衡模型训练。数据格式严格遵循标准化的目标检测结构,包含图像标识符、尺寸信息以及详细的物体标注序列,便于与主流检测框架无缝对接。此外,数据集基于CC许可协议开放共享,确保了学术与工业界使用的合法性与可复现性,为乳腺癌诊断辅助系统的研发奠定了可靠基础。
使用方法
使用该数据集时,研究人员可直接通过HuggingFace平台加载默认配置下的训练分片。数据以图像与标注配对的形式组织,其中标注信息以结构化字典呈现,包括边界框坐标(以整数序列表示)、类别索引以及区域面积等字段。模型训练中,可将其作为监督学习输入,利用预定义的目标检测损失函数进行优化。数据集已按标准拆分,仅提供训练集,适用于迁移学习或微调现有检测架构,如Faster R-CNN或YOLO系列。
背景与挑战
背景概述
乳腺癌作为全球女性最常见的恶性肿瘤之一,其发病率和死亡率长期位居恶性肿瘤前列,对公共卫生体系构成了严峻挑战。在此背景下,精准诊断与早期筛查成为降低乳腺癌死亡率的关键突破口。2019年,Walid Al-Dhabyani及其合作者公开发布了乳腺癌超声图像数据集,为医学影像分析领域提供了宝贵资源。该数据集共包含547张超声图像,其中387张为良性病例,160张为恶性病例,并附加了基于掩膜推断的目标检测标注信息,填补了乳腺超声影像在自动目标检测任务中的空白。作为该数据集的衍生版本,as-cle-bert/breastcancer-auto-objdetect进一步优化了标注格式,使其兼容主流目标检测框架,推动了深度学习技术在乳腺超声图像分析中的标准化应用,对提升计算机辅助诊断系统的鲁棒性与泛化能力具有重要意义。
当前挑战
该数据集面临的核心挑战主要体现在两个层面。首先,在领域问题层面,乳腺超声图像存在噪声干扰强、病灶边界模糊、形态多样性高等特性,使得自动目标检测模型难以精准定位并分类病变区域,尤其在区分良性与恶性病变时易受伪影影响。其次,在构建过程中,原始数据集的标注信息由分割掩膜转换而来,这一过程可能引入标注偏差或细节丢失,导致目标框与真实病灶范围存在误差。此外,数据集规模仅547张图像,样本量有限且类别分布不均衡,易使模型陷入过拟合,难以泛化至多中心、多设备采集的临床场景,限制了其在真实医疗环境中的部署应用。
常用场景
经典使用场景
在医学影像分析领域,乳腺癌的早期检测与精准诊断始终是研究焦点。as-cle-bert/breastcancer-auto-objdetect 数据集专为乳腺超声图像中的目标检测任务而设计,其核心应用场景在于训练和评估能够自动识别并定位图像中良性与恶性病灶的深度学习模型。该数据集包含547张精心标注的超声图像,覆盖387例良性病例与160例恶性病例,每张图像均附带与CPPE-5格式一致的目标检测标注信息,包括病灶边界框与类别标签,为开发高精度、高鲁棒性的乳腺肿瘤自动检测系统提供了标准化基准。
衍生相关工作
该数据集衍生了多项具有影响力的学术工作。原始数据由Walid Al-Dhabyani等人在2019年发布后,直接催生了针对乳腺超声图像分割、分类与检测的多项经典研究,例如基于U-Net的肿瘤区域分割模型、利用YOLO系列进行病灶实时检测的改进算法,以及结合注意力机制的多尺度特征融合网络。这些工作进一步验证了该数据集在迁移学习与域适应研究中的价值,并启发了后续如BUSI(Breast Ultrasound Images)等更大规模数据集的构建,形成了从数据到算法再到临床验证的完整研究链条。
数据集最近研究
最新研究方向
在精准医疗与人工智能深度融合的浪潮下,乳腺癌超声图像自动目标检测数据集(as-cle-bert/breastcancer-auto-objdetect)正成为推动计算机辅助诊断前沿发展的关键资源。该数据集基于2019年公开的乳腺癌超声影像,经过精细的掩码标注转化为目标检测格式,涵盖547张良性与恶性病变图像,为深度学习模型在乳腺癌早期筛查中的边界框定位与分类任务提供了高质量训练样本。当前研究热点聚焦于利用该数据集训练轻量化检测网络(如YOLO系列变体),以提升在资源受限的临床环境下的实时诊断效率。同时,结合迁移学习与多模态融合策略,研究者正探索如何从超声图像中挖掘更具鲁棒性的特征表示,以应对病灶形态多样性与超声噪声干扰。该数据集的开放共享不仅加速了乳腺癌智能诊断算法的迭代验证,也为全球医疗影像数据集标准化与可复现性研究树立了典范,其深远意义在于推动精准医疗普惠化,降低因诊断延迟导致的死亡率。
以上内容由遇见数据集搜集并总结生成



