遇见数据集

口腔鳞状细胞癌早期检测的口腔细胞学数据集

收藏
arXiv2025-06-11 更新2025-11-28 收录
官方服务:

资源简介:

本数据集由印度10个三级医疗中心收集,包含用Papanicolaou和May-Grünwald-Giemsa协议染色的注释幻灯片,旨在推动基于人工智能的诊断方法。数据集包含234名患者的368张全切片图像,覆盖了广泛的年龄和性别范围。该数据集由专家病理学家进行注释,用于细胞异常分类和检测,旨在提高自动化检测的效率,减少诊断错误,并改善资源有限环境中的口腔鳞状细胞癌早期诊断。数据集已在Kaggle和Google Drive上公开,方便研究人员使用。

This dataset was collected from 10 tertiary care centers across India. It contains annotated slides stained using the Papanicolaou and May-Grünwald-Giemsa protocols, aiming to advance AI-driven diagnostic approaches. The dataset includes 368 whole-slide images from 234 patients, covering a broad spectrum of ages and genders. Annotated by expert pathologists, this dataset is intended for cellular abnormality classification and detection, with the goals of improving automated detection efficiency, reducing diagnostic errors, and enhancing early diagnosis of oral squamous cell carcinoma in resource-limited settings. The dataset has been publicly released on Kaggle and Google Drive to facilitate researchers' access and utilization.

创建时间:
2025-06-11
搜集汇总
数据集介绍
口腔鳞状细胞癌早期检测的口腔细胞学数据集 数据集图片
构建方式
口腔鳞状细胞癌(OSCC)是全球高发的头颈部恶性肿瘤,早期诊断对提升患者生存率至关重要。然而,传统组织病理活检在资源匮乏地区可及性差,而口腔刷拭细胞学检查作为一种微创、低成本的替代方案,其临床推广受限于判读主观性和专家稀缺。为突破这一瓶颈,研究团队联合印度十家三级医疗中心,前瞻性收集了234例患者的368张全切片图像(WSI),涵盖巴氏(PAP)和梅-格氏(MGG)两种染色方法。样本采集遵循标准化刷拭活检协议,由资深病理医师独立评估并达成共识。所有切片经40倍放大高分辨率扫描,其中58张以0.125微米/像素、310张以0.24微米/像素的精度数字化。随后,专家在每张WSI中标注平均5个2048×2048像素的感兴趣区域,并利用QuPath软件对区域内细胞核进行精细分割与四级分类标注,最终形成含39,246个标注细胞核的高质量数据集。
使用方法
该数据集为人工智能驱动的口腔细胞学分析提供了完整的解决方案。研究者可直接使用Kaggle或Google Drive上公开的368张全切片图像进行端到端模型训练,也可聚焦于168张WSI中提取的858张高质量图像补丁(2048×2048像素),这些补丁附带QuPath兼容的GeoJSON格式细胞核标注。为简化机器学习流程,GitHub上提供了示例代码,可将GeoJSON标注转换为二值掩膜或实例分割掩膜,兼容语义分割与实例分割任务。研究团队还使用UNet、UNet++、StarDist和HoverNet等模型建立了基准性能,并采用基于中心划分的训练-验证-测试策略确保评估公正性。研究者可在此基础上改进分割架构,或扩展至细胞分类与异常检测任务,推动早期OSCC自动化诊断系统的落地。
背景与挑战
背景概述
口腔鳞状细胞癌(OSCC)作为全球第六大常见恶性肿瘤,在亚洲、非洲及南美洲部分地区构成了沉重的公共卫生负担,因晚期诊断导致的五年生存率仅为5-20%,而早期(I期)患者的生存率可高达90%。鉴于传统组织活检具有侵入性强、资源消耗大且依赖资深病理学家等局限,尤其在资源匮乏地区难以普及,口腔刷拭细胞学检查作为一种微创、低成本的替代方案,其临床价值日益凸显。为突破该领域因缺乏大规模、多中心、高质量标注数据集而制约人工智能诊断方法发展的瓶颈,由印度医学研究委员会、印度理工学院孟买分校等多家机构的研究人员于2023年至2024年间联合创建了首个大规模口腔细胞学数据集。该数据集覆盖10家三级医疗中心、234名患者,包含368张全玻片图像,并提供巴氏染色与MGG染色两种方案,以及详细的细胞核分割标注,旨在推动自动化检测技术研发,降低诊断错误率,提升OSCC早期诊断的可及性。
当前挑战
该数据集面临的挑战一方面源于口腔细胞学领域固有的诊断困境:细胞涂片判读高度依赖专家经验,观察者间变异大,且手动筛查数以十万计的细胞耗时费力,容易导致假阴性或假阳性结果,尤其偏远地区缺乏训练有素的细胞病理学家,常采用粗筛与复核两步法,但首步筛查极易遗漏异常区域。另一方面,数据集构建过程亦遭遇重重阻碍:医学影像数据受地理分布、设备差异及患者隐私法规限制,难以跨机构收集与共享,导致数据孤岛严重;同时,全玻片图像的标注需要资深病理学家逐一对细胞核进行精细分割与分类,每个补片约需15分钟,且样本分类存在严重不平衡(如I类与IV类数量悬殊),增加了模型训练的难度与泛化能力提升的挑战。
常用场景
经典使用场景
在口腔癌筛查与早期诊断的研究版图中,口腔鳞状细胞癌作为最常见的头颈部恶性肿瘤,其早期检出率直接关乎患者生存预后。该数据集以刷取活检的口腔细胞学涂片为核心,整合了来自印度十家三级医疗中心的368张全切片图像,涵盖巴氏染色与梅-格-吉染色两种经典染色方案。研究者可借此开展细胞核分割、异常细胞检测与分类等经典任务,为构建基于深度学习的自动化诊断模型提供高质量的标注素材,尤其适用于跨中心、多染色的泛化性能验证。
解决学术问题
长期以来,口腔细胞学领域缺乏公开、大规模且经专家标注的数据集,严重制约了人工智能辅助诊断研究的进展。该数据集填补了这一关键空白,使学术界得以系统解决因标注不足导致的模型过拟合与泛化能力薄弱问题。通过提供来自200余名患者的四类细胞核精细标注,研究人员能够量化评估不同模型在细胞学图像上的分割与分类表现,从而推动解决传统细胞学判读中观察者间差异大、假阴性率高、可重复性差的学术瓶颈,为口腔癌早期筛查的智能化奠定数据基石。
实际应用
在医疗资源匮乏的地区,病理专家稀缺与诊断设备昂贵使得传统组织活检难以大规模推广。该数据集驱动的自动化分析工具可部署于基层医疗机构,实现口腔细胞学涂片的快速初筛与可疑区域标记,辅助非专科医师做出更准确的转诊决策。此外,结合数字扫描与远程病理平台,该数据集有望支撑远程会诊系统,使偏远地区的患者也能获得与三甲医院同质化的早期诊断服务,切实降低因诊断延迟导致的晚期癌症死亡率,提升公共健康水平。
数据集最近研究
最新研究方向
该数据集作为全球首个大规模、多中心的口腔鳞状细胞癌刷检细胞学数据集,填补了该领域公共数据的长期空白,为人工智能驱动的早期诊断研究提供了基石。当前前沿研究聚焦于利用深度学习方法(如U-Net、HoVerNet等)对细胞核进行精准分割与分类,旨在克服传统细胞学判读中观察者间差异大、病理专家资源匮乏等瓶颈。该数据集涵盖了来自印度十家三甲医疗中心的234例患者的368张全切片图像,包含Pap和MGG两种染色方案以及四类细胞学分级标注,有力地支撑了跨中心、跨染色域的模型泛化性验证。这一资源的发布有望推动低成本、高效率的自动化筛查工具的开发,尤其适用于资源有限地区,从而显著提升早期OSCC的检出率、降低死亡率,并促进全球口腔癌防控的数字化与智能化转型。
相关研究论文
  • 1
    通过印度医学研究理事会-国家数字健康与数据科学研究所 · 2025年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务