遇见数据集

CF-OCT-segmentation

收藏
arXiv2026-08-21 更新2026-08-25 收录
官方服务:

资源简介:

该数据集是首个针对慢性植入大鼠模型中人工耳蜗诱导的耳蜗内纤维化的光学相干断层扫描(OCT)图像数据集,由俄勒冈健康与科学大学等机构创建。数据集包含173张来自5个样本的标注图像,每张图像以高分辨率标注了纤维化、鼓阶/自由空间和CI/轨道三个语义类别。数据通过OCT B-scans获取并重切片为En Face图像,由经验丰富的分割者使用Hasty.ai工具手动标注。该数据集旨在应用计算机视觉方法客观量化耳蜗纤维化负担,从而助力研究残余听力损失的机制,为混合人工耳蜗患者的疗效提升提供关键支撑。

This dataset is the first optical coherence tomography (OCT) image dataset focused on intra-cochlear fibrosis induced by cochlear implants in chronic cochlear implant rat models, developed by institutions including Oregon Health & Science University. The dataset comprises 173 annotated images from 5 samples, with each image annotated at high resolution for three semantic categories: fibrosis, scala tympani/free space, and CI/electrode track. The data were acquired as OCT B-scans and then reformatted into En Face images, and manually annotated by experienced segmenters using the Hasty.ai tool. This dataset aims to employ computer vision methods to objectively quantify the burden of cochlear fibrosis, thereby advancing research into the mechanisms of residual hearing loss and providing critical support for improving the therapeutic outcomes of patients with hybrid cochlear implants.

创建时间:
2026-08-21
原始信息汇总

Cochlear Fibrosis OCT数据集详情

数据集概述

  • 数据集名称:Cochlear Fibrosis OCT(CF-OCT)数据集
  • 数据来源:动物模型(cochlear fibrosis,耳蜗纤维化)
  • 数据模态:光学相干断层扫描(OCT)图像
  • 下载地址:可通过Open Science Framework(OSF)获取(项目链接:https://osf.io/cghn7,注册DOI:https://doi.org/10.17605/OSF.IO/WB5FS)
  • 标注类别:共4类,包括CI/Track(红色)、Fibrosis(绿色)、ST/Free Space(蓝色)及背景类
  • 标注卷数:包含5个已标注的OCT体积(OCTV1L、OCTV7L、OCTV9L、OCTV10L、OCTV11L)

数据集用途

  • 主要目标:用于耳蜗纤维化的语义分割与量化分析
  • 应用场景
    • 探究耳蜗纤维化与残余听力损失的关系
    • 辅助人工耳蜗(CI)植入的研发
    • 支持EAS(电声刺激)患者的治疗研究

基准模型

该数据集提供了多种语义分割模型的基准测试结果,包括:

  • 2D-OCT-UNET(提出的模型):非常深的2D U-Net架构,包含7个编码器-解码器块和跳跃连接,使用Group Normalization(ng=2)和Dropout(0.1),输入分辨率1024×1024像素
  • VGG16-UNET
  • UEfficientNet
  • SegFormer
  • MST-DeepLabv3
  • SAM(Segment Anything Model)的微调参考见:https://github.com/mazurowski-lab/finetune-SAM

量化功能

代码内置纤维化量化功能,可自动计算原始体积(OCTV1L、OCTV7L、OCTV9L、OCTV10L、OCTV11L)中的纤维化量。

实现环境

  • 语义分割模型(除SAM外):Python 3.9.12、Tensorflow 2.9.1、Keras 2.9.0
  • SAM模型:Python 3.9.12、PyTorch 2.0.1 (cu117)
  • 实验平台:Ubuntu 18.04.3 LTS,Intel Core i9-9900K CPU,Nvidia GeForce RTX 2080 Ti GPU,62GB RAM

引用信息

Dietlmeier, J., Greenberg, B., He, W., Wilson, T., Xing, R., Hill, J., Fettig, A., Otto, M., Rounsavill, T., Reiss, L.A.J., Yi, J. OConnor, N.E., Burwood, G.W.S. (2025). Towards Investigating Residual Hearing Loss: Quantification of Fibrosis in a Novel Cochlear OCT Dataset. IEEE Transactions on Biomedical Engineering。

搜集汇总
数据集介绍
CF-OCT-segmentation 数据集图片
构建方式
该数据集源于一项对慢性植入人工耳蜗的豚鼠模型进行光学相干断层扫描(OCT)成像的研究,旨在探索植入物诱发的耳蜗纤维化与残余听力损失之间的关系。研究团队从五只实验动物的耳蜗中采集了OCT体积数据,并通过Z轴重切片生成二维图像,最终构建了包含173张手动标注图像的数据集。这些图像由经验丰富的标注人员使用Hasty.ai工具进行语义分割标注,区分出纤维化、阶鼓室/自由空间以及人工耳蜗/轨迹三个类别。数据集的构建过程严格遵循实验伦理,并采用了分层随机抽样方法,将数据划分为训练集(139张)和测试集(34张),确保了数据集分布的一致性。
特点
该数据集是首个专门针对慢性植入人工耳蜗后耳蜗纤维化进行OCT成像的公开数据集,具有显著的创新性和科研价值。其独特之处在于,图像涵盖了纤维化组织、阶鼓室/自由空间及人工耳蜗/轨迹等多种形态复杂的目标对象,且各类别在形状、大小和外观上表现出高度差异性,部分类别存在大量黑色背景像素,纤维化组织与正常组织紧密相邻,增加了分割难度。此外,数据集存在明显的类别不平衡问题,但这也正是医学图像分割中的常见挑战,为算法研究提供了极佳的基准测试平台。
使用方法
该数据集主要面向基于深度学习的语义分割任务,用于评估和优化耳蜗纤维化的自动量化方法。研究者可以将其用于训练和测试多种分割模型,如改进的2D-OCT-UNET、VGG16-UNET、UEfficientNet等,并可通过计算Dice系数、IoU等指标来评估模型性能。此外,该数据集还支持对纤维化负担的计算,即通过分割结果得出纤维化面积与阶鼓室总面积的比例,从而量化纤维化程度。数据集和项目代码已在GitHub上公开,便于研究者复现实验并进一步开展相关研究。
背景与挑战
背景概述
CF-OCT-segmentation数据集由Julia Dietlmeier、George W.S. Burwood等研究人员于2023年创建,旨在研究人工耳蜗植入后引起的耳蜗纤维化,以探索残余听力损失的机制。该数据集是首个包含慢性植入豚鼠耳蜗光纤相干断层扫描(OCT)图像及其精细手动标注的数据集,标注了纤维化、蜗管/自由空间和人工耳蜗/轨道三个类别。其核心研究问题是如何利用深度学习模型对耳蜗OCT图像进行语义分割,以实现纤维化负担的客观量化。该数据集对耳蜗植入研究领域具有重要影响,为计算机视觉方法在耳科影像分析中的应用提供了新契机,并为理解纤维化与残余听力损失的关系奠定了基础。
当前挑战
该数据集面临的挑战包括:首先,耳蜗OCT图像中纤维化、蜗管和人工耳蜗等目标形状、大小和外观高度变异,且与正常组织紧密相邻,导致语义分割难度极大。其次,数据集规模较小(仅173张标注图像),且类别分布极度不平衡,部分类别的像素占比极低,给模型训练带来困难。此外,标注过程中存在噪声,尤其在基底膜-纤维化界面等解剖结构复杂区域,人类标注者的主观差异可能导致标签不准确。最后,构建过程中需处理低分辨率(400×400像素)图像,并应对样本内和样本间的差异,以确保模型的泛化能力。
常用场景
经典使用场景
CF-OCT-segmentation数据集作为首个面向慢性植入耳蜗纤维化研究的OCT图像分割数据集,其经典使用场景聚焦于利用深度学习模型对OCT图像中的纤维化组织、耳蜗阶(ST)以及植入电极轨迹(CI/Track)进行像素级语义分割。该数据集包含173张来自五只豚鼠的高分辨率OCT切片,每张切片均带有三类精细标注,为评估和优化语义分割算法提供了基准。研究者常采用该数据集验证UNET、SegFormer、SAM等主流架构在复杂生物医学图像上的分割性能,尤其关注其在不平衡类别和噪声标签下的鲁棒性。
实际应用
在临床前研究及潜在临床转化层面,该数据集支持自动化评估耳蜗纤维化程度,为优化人工耳蜗植入策略和预测患者术后残余听力保留效果提供量化工具。具体而言,研究人员可利用基于该数据集训练的模型对OCT影像进行快速、可重复的纤维化负担测算,减少人工标注的主观性和时间成本,从而加速大规模动物实验数据的分析。此外,该方法论有望推广至其他内耳影像模态(如micro-CT)以及人类颞骨标本,为个性化听力康复方案的设计提供依据。
衍生相关工作
该数据集衍生出一系列语义分割模型基准测试工作,包括对UNET架构进行深度改造的2D-OCT-UNET,以及针对类不平衡问题的损失函数研究。比较评估了VGG16-UNET、UEfficientNet、SegFormer、MST-DeepLabv3+与Segment Anything Model(SAM)等前沿模型,揭示了在医学影像分割中,基于CNN的UNET变体在中小规模数据集上仍占据优势,而视觉Transformer及基础模型需借助适配器微调才能适应特定场景。这些工作不仅为耳蜗OCT分析提供了最优实践,也为医学图像分割领域的模型选择与迁移学习策略提供了参考,推动了计算病理学与听觉科学的交叉融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务