遇见数据集

FUSEP

收藏
github2026-05-27 更新2026-05-28 收录
数据链接:
官方服务:

资源简介:

FUSEP是首个开源的多中心超声基准数据集,用于早期胎儿妊娠筛查,包含来自3家医院、3种不同超声设备的4,017张超声图像,涵盖CRL和NT两种标准视图,提供45,820个专家级框标注,覆盖14个关键解剖结构,旨在解决早期胎儿妊娠超声数据公开缺乏的问题,并支持多种学习范式的基准测试。

FUSEP is the first open-source multi-center ultrasound benchmark dataset for early fetal pregnancy screening. It comprises 4,017 ultrasound images acquired from 3 hospitals and 3 distinct ultrasound devices, covering the two standard views of CRL and NT. It features 45,820 expert-level bounding box annotations spanning 14 critical anatomical structures. This dataset aims to address the shortage of publicly available early fetal pregnancy ultrasound data and supports benchmark testing for multiple learning paradigms.

创建时间:
2026-05-25
原始信息汇总

数据集概述:FUSEP

FUSEP 是一个面向早期妊娠胎儿超声筛查的多中心基准数据集,包含来自三家医院、三种超声设备的超声图像,并为多种学习范式提供了基准任务。

核心特点

  • 发布机构:被 KDD 2026 Datasets and Benchmarks Track 接收。
  • 数据集规模:包含 4,017 张超声图像和 45,820 个专家级边界框标注。
  • 数据来源:来自三家医院(深圳、成都、昆明),分别使用 SAMSUNG、Sonoscape、GE 三种不同品牌的超声设备。
  • 孕周范围:所有数据均采集自孕 11–14 周的孕妇。
  • 标准切面:包含两个标准切面:头臀长(CRL)切面和颈项透明层(NT)切面。

数据统计

划分 医院 设备 图像数量 边界框标注数
训练/验证/测试 医院-1 (深圳) SAMSUNG 1,532 13,485
训练/验证/测试 医院-2 (成都) Sonoscape 1,496 14,281
训练/验证/测试 医院-3 (昆明) GE 989 18,054
总计 3家医院 3种设备 4,017 45,820
医院 地点 设备 缩写
医院-1 深圳市妇幼保健院 SAMSUNG SZ
医院-2 四川省妇幼保健院 Sonoscape SC
医院-3 云南省妇幼保健院 GE YN

解剖结构标注

数据集标注了 14 个关键解剖结构。CRL 切面标注 13 个结构,NT 切面标注 13 个结构,具体如下:

CRL 切面 (13个结构)

  • Maxilla (MX)
  • Mandible with a Dot Shape (MDS)
  • Mandible with Long Strip (MLS)
  • Lateral Ventricle (LV)
  • Head (H)
  • Genitals (G)
  • Chest (C)
  • ABdomen (AB)
  • Breech (B)
  • RhomBencePhalon (RBP)
  • DiencePhalon (DP)
  • Nasal Tip And Prenasal Skin (NTAPS)
  • Nasal Bone (NB)

NT 切面 (13个结构)

  • Maxilla (MX)
  • Mandible with a Dot Shape (MDS)
  • Mandible with Long Strip (MLS)
  • Lateral Ventricle (LV)
  • Head (H)
  • Chest (C)
  • ABdomen (AB)
  • RhomBencePhalon (RBP)
  • DiencePhalon (DP)
  • Nuchal Translucency (NT)
  • Nasal Tip And Prenasal Skin (NTAPS)
  • Nasal Bone (NB)

基准任务

FUSEP 提供了 四种学习范式 的基准任务:

任务 设置 描述
全监督 100% 标记数据 使用完整标注的多目标检测。
半监督 5% / 10% 标记数据 在同一医院内利用未标记数据。
无监督域适应 (UDA) 跨医院 源域有标签,目标域无标签的适应。
无源域适应 (SFDA) 跨医院 仅能访问源模型参数,无法访问源数据。

模型仓库与预训练权重

数据集为上述四项基准任务提供了预训练权重,包括:

  • 全监督检测:基于 Relation-DETR (ResNet-50 backbone) 的权重,针对不同医院和切面各有 best_apbest_ap50 两个版本。例如,CRL 切面下医院-1 (SZ) 的 best_ap 权重名为 RelationDETR_SZ_CRL_best_ap.pth
  • 半监督检测:基于 Unbiased Teacher 的权重,主要针对 CRL 切面下的 5% 和 10% 标记数据比例。例如,医院-2 (SC) 在 10% 标记数据下的权重名为 UnbiasedTeacher_SC_CRL_10pct_v1_latest.pth
  • 无监督域适应 (UDA):跨医院域适应权重,覆盖 CRL 和 NT 切面下的六种源-目标域组合。
  • 无源域适应 (SFDA):基于 Cross-Domain Adaptive Teacher 的权重,提供全部 12 个域对(6个 CRL + 6个 NT)的 model_final.pth 检查点。

数据集获取与结构

  • 下载资源:完整数据集(COCO 格式)、仅标注文件、域适应划分文件均可通过 Google Drive 链接获取。
  • 目录结构:下载后,数据应组织为 data/FUSEP/ 目录,其下包含三个子目录(Hospital1_SZ/, Hospital2_SC/, Hospital3_YN/),每个子目录内包含 images/(分为 CRL/NT/ 子目录)和 annotations/(包含 train.json, val.json, test.json)。
搜集汇总
数据集介绍
FUSEP 数据集图片
构建方式
在全球范围内,先天性异常是新生儿致死致残的重要原因,而早孕期超声筛查是检测此类异常的关键手段。然而,公共超声数据集的匮乏严重制约了智能辅助诊断系统在早期妊娠阶段的发展。为填补这一空白,FUSEP数据集应运而生。该数据集依托三家不同级别医院的临床数据,利用三星、索诺星和通用电气三种主流超声设备采集了4017张涵盖头臀长与颈项透明层两个标准切面的超声图像。在此基础上,由经验丰富的影像科医师精确框定了45,820个边界框,覆盖14个关键解剖结构,并按照COCO格式组织标注文件,构建了一个大规模、高质量的基准数据集。
使用方法
研究者可通过Google Drive链接获取完整的COCO格式数据集及预训练权重。代码仓按学习范式组织了清晰的子目录结构:全监督模块基于Relation-DETR,半监督模块依赖MMDetection,无监督域适应与源无关域适应则分别运行于独立框架内。使用前需配置Python 3.6以上环境及PyTorch 1.6以上版本,并依据各子目录的requirements.txt安装相应依赖。数据集按医院与切面划分,研究者可基于提供的训练脚本快速启动模型训练,并利用预训练权重进行推理与评测,支持跨医院、跨切面的灵活实验配置。
背景与挑战
背景概述
先天性异常是导致新生儿死亡和长期残疾的重要原因,而孕早期超声筛查是检测胎儿结构异常、提供早期干预机会的关键手段。然而,由于公开可用的早孕期超声影像数据集极度匮乏,严重制约了计算机辅助诊断系统在该领域的发展。在此背景下,由多所高校与医院联合团队于2026年创建的FUSEP数据集应运而生,该工作发表于KDD 2026数据集与基准赛道。FUSEP整合了来自深圳、成都、昆明三家医院的4017张超声图像,覆盖头臀径与颈项透明层两个标准切面,共包含14个关键解剖结构的45820个专家级框标注。基于多中心、多设备采集的独特设计,FUSEP为评估和提升模型在真实临床环境中的鲁棒性提供了坚实基准,已成为推动早孕期超声自动化筛查研究的重要数据基石。
当前挑战
FUSEP所面临的挑战首先源于领域问题的复杂性:早孕期胎儿体积微小、解剖结构精细且尺度差异悬殊,加之超声图像固有的低信噪比与声学伪影,使得目标检测任务极具难度。此外,不同医院在超声设备(如三星、声科、GE)、图像采集协议及操作手法上的差异形成了显著的域偏移,导致模型在跨中心部署时性能急剧下降。在构建过程中,团队也遭遇了多重困难:14类解剖结构的精准标注需资深超声医师投入大量人力,且部分结构(如下颌骨点状与条状形态)的边界模糊,难以保持标注一致性。同时,数据来源于三家医院,需协调复杂的伦理审查与隐私保护流程,并确保加密存储与合规分发。
常用场景
经典使用场景
在产前超声筛查领域,FUSEP数据集作为首个多中心、多设备、多任务的公开基准,被广泛用于胎儿早期妊娠超声图像中的解剖结构检测任务。其囊括了三个不同医院、三种超声设备采集的4017张标准切面图像(CRL与NT),并提供了涵盖14个关键解剖结构的逾四万五千个专家级边界框标注。研究者可利用该数据集训练全监督目标检测模型,如基于Relation-DETR的框架,实现对胎儿头部、心室、鼻骨等结构的精准定位,从而为自动化产前诊断奠定数据基础。
解决学术问题
FUSEP数据集系统性地缓解了早期妊娠超声领域长期存在的公开数据匮乏问题,为验证和提升模型在真实临床环境下的泛化能力提供了标准化平台。它使得研究人员能够深入探究多中心数据带来的域偏移对检测性能的影响,从而推动半监督学习、无监督域适应(UDA)以及源无关域适应(SFDA)等学习范式的研究进展。这些学术探索对于构建鲁棒性强、跨设备兼容的智能辅助诊断系统具有里程碑式意义,加速了理论成果向临床实践的转化。
实际应用
在实际临床场景中,FUSEP数据集助力开发能够无缝部署于不同医院和超声设备的自动筛查工具。基于其训练的模型可辅助超声科医生在孕早期(11–14周)迅速识别胎儿关键解剖结构,提升先天性异常筛查的效率与一致性。例如,在设备差异明显的多中心环境中,域适应技术保障了模型在未见过的超声图像上的稳定表现,降低了对人工标注的依赖,使信息化不发达地区也能受益于高精度自动诊断服务,显著拓宽了优质医疗资源的可及性。
数据集最近研究
最新研究方向
针对早期妊娠胎儿超声筛查中数据稀缺与多中心域偏移的痛点,FUSEP数据集开创性地构建了首个开源多中心超声基准,覆盖来自三家医院、三种超声设备、共计4017幅图像与45820个精细边界框标注的图像集合。该数据库针对14个关键解剖结构、涵盖头臀径与颈项透明层两种标准切面,为全监督、半监督、无监督域适应以及无源域适应四种学习范式提供统一的评测平台。通过与Relation-DETR、自适应教师等前沿模型的深度融合,FUSEP推动了胎儿超声自动化诊断领域的域适应研究,在降低标注成本、提升模型跨设备泛化能力方面展现出重要潜力,有望改善医疗资源不均地区的产前筛查可及性与可靠性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务