遇见数据集
官方服务:

资源简介:

这是一个膀胱镜静止图像数据集,来源于Kaggle,包含1,754张PNG图像(约236 MB)。图像按组织类型和成像模态进行组织:组织类型包括高分级癌(HGC)、低分级癌(LGC)、非特殊型(NST)和正常组织(NTL);成像模态包括白光成像(WLI)和窄带成像(NBI)。数据集包含一个元数据文件(metadata.parquet),每行对应一张图像,字段包括文件名(标准化后的磁盘名称)、病例ID、成像类型、组织类型、原始划分(用于审计,原始划分存在患者泄露)以及标准化后的文件名。此外,提供了基于病例级别的训练/验证/测试划分(18/2/2个病例,分别对应1,541/44/169张图像),使用随机种子42生成,确保无患者泄露。该数据集适用于膀胱癌的图像分类任务,特别是基于组织类型和成像模态的分类。

This is a cystoscopy still image dataset from Kaggle, containing 1,754 PNG images (approximately 236 MB). Images are organized by tissue type and imaging modality: tissue types include high-grade carcinoma (HGC), low-grade carcinoma (LGC), non-special type (NST), and normal tissue (NTL); imaging modalities include white light imaging (WLI) and narrow-band imaging (NBI). The dataset includes a metadata file (metadata.parquet) with each row corresponding to an image, fields including filename (normalized disk name), case ID, imaging type, tissue type, original split (for auditing, with patient leakage in the original split), and normalized filename. Additionally, patient-level training/validation/test splits (18/2/2 cases, corresponding to 1,541/44/169 images respectively) are provided, generated with random seed 42 to ensure no patient leakage. The dataset is suitable for bladder cancer image classification tasks, particularly classification based on tissue type and imaging modality.

创建时间:
2026-07-31
原始信息汇总

数据集概述:Kaggle 膀胱镜帧数据集

本数据集(milkyroad/D)是一个用于图像分类任务的医学影像数据集,内容为膀胱镜检查(Cystoscopy)的静态帧图像,来源于 Kaggle 平台,并经过系统化整理与规范化处理。

基本信息

  • 语言:英语(en)
  • 许可证:未知(unknown)
  • 任务类型:图像分类(image-classification)
  • 标签:医学(medical)、膀胱镜检查(cystoscopy)、膀胱癌(bladder-cancer)
  • 样本规模:1K < n < 10K(约 1754 张图像)

数据内容

数据集包含 1,754 张 PNG 格式的膀胱镜静态帧图像(约 236 MB),按组织类型和成像模态进行分类组织。

组织类型(Tissue types)分布:

组织类型 数量
LGC(低级别癌) 647
NST(非特殊类型) 504
HGC(高级别癌) 469
NTL(非肿瘤性) 134

数据文件结构

路径 描述
data/images/ 1,754 张 PNG 图像,文件名统一规范为 case_{cid:03d}_pt_{pt:03d}_frame_{frame:04d}_{tissue}.png 格式
data/metadata.parquet 每张图像对应一行元数据,包含字段:filename(规范化文件名)、case_id(整数)、imaging_type(WLI/NBI)、tissue_type(HGC/LGC/NST/NTL)、original_split(原始 CSV 划分,仅作参考,存在数据泄漏)、csv_filename(与规范化后的 filename 一致)
splits/{train,val,test}.txt 基于病例级别(case-level)划分的图像 ID 列表(随机种子 seed=42),共 18/2/2 个病例,对应 1541/44/169 张图像,无病例泄漏

文件名规范化处理

原始 Kaggle 数据集包含 8 种不同的文件名模式,已全部统一为上述单一格式。主要处理包括:

  • HLT 标注去除:37 个文件名中嵌入的“HLT”(增生)标注被移除,因其在元数据中已分类为 NST
  • 缺失患者编号处理:41 个文件(模式 7,无 pt)被分配为 pt_000
  • 重复后缀清理:4 个文件带有 macOS Finder 的“ (copy)”后缀,已被去除
  • 组织类型消歧:存在 9 对文件名冲突(相同 case/pt/frame 下同时有癌与非癌图像),通过在文件名中加入 {tissue} 消除歧义

数据划分与泄漏处理

  • 原始划分存在泄漏:原始 CSV 的 sub_dataset 列将 21 个训练病例中的 19 个同时放入验证集和测试集
  • 新增病例级划分:本数据集提供基于病例级别的全新划分(seed=42),确保无病例泄漏
  • original_split 字段仅保留用于审计追溯

加载示例

python import pandas as pd, pathlib meta = pd.read_parquet("hf://datasets/milkyroad/D/data/metadata.parquet") train = pathlib.Path("hf://datasets/milkyroad/D/splits/train.txt").read_text().split()

可复现性

划分使用 random.Random(42) 基于排序后的病例 ID 列表生成,确保结果可复现。

搜集汇总
数据集介绍
D 数据集图片
构建方式
该数据集源自Kaggle平台,整合了1754张膀胱镜静态图像,涵盖了不同组织类型与成像模态。原始数据存在8种文件名格式,为统一处理,详细设计了规范化流程,将文件名标准化为case_{cid:03d}_pt_{pt:03d}_frame_{frame:04d}_{tissue}.png的格式,同时处理了HLT标注去除、缺失患者编号补零、重复后缀清理以及同名碰撞消解等复杂情况。数据以parquet元数据文件和分片文件形式组织,并提供了按病例级别划分的训练、验证与测试集,确保无病例泄漏。
使用方法
使用该数据集时,可借助HuggingFace的datasets库或直接通过pandas读取parquet文件获取元数据,并加载拆分文件中的图像列表。建议基于元数据中的tissue_type和imaging_type字段进行类别平衡抽样,同时应用图像增强技术以缓解样本不均衡。训练时可采用迁移学习策略,利用预训练模型进行特征提取与微调,并在验证阶段严格采用数据集提供的病例级划分,以客观评估模型在膀胱癌分类任务上的性能。
背景与挑战
背景概述
该数据集由Kaggle平台上的膀胱镜检查图像整理而成,创建于近年,归属于milkyroad机构,旨在为膀胱癌的计算机辅助诊断提供标准化的图像资源。数据集包含1754张膀胱镜静态帧,涵盖高级别癌(HGC)、低级别癌(LGC)、非肿瘤性(NST)及正常组织(NTL)四类组织类型,并区分白光成像(WLI)与窄带成像(NBI)两种模态。其核心研究问题在于构建一个无患者泄漏的、可用于训练和评估图像分类模型的基准,以促进膀胱癌早期检测和诊断技术的智能化发展。该数据集因其细致的组织类型划分和模态区分,对医学影像分析领域具有重要的参考价值,尤其推动了基于深度学习的膀胱镜图像识别研究。
当前挑战
该数据集面临的挑战主要源于原始数据的不规范性和医学数据特有的隐私敏感性。首先,原始文件名存在八种不同模式,包含冗余标注、缺失患者编号及重复后缀,需进行系统的归一化处理,这考验了数据清洗的精确性。其次,原始划分存在严重的患者泄漏问题,19个训练病例同时出现在验证和测试集中,导致模型评估结果偏乐观,需重新生成基于病例级别的划分,确保无跨病例信息泄露。此外,数据集中不同组织类型样本分布不均(如NTL仅134张),可能引发类别不平衡,影响模型对稀有类别的识别能力。最后,医疗图像数据涉及患者隐私,如何在不暴露身份信息的前提下进行公开共享,也是构建过程中的一大挑战。
常用场景
经典使用场景
该数据集在膀胱癌的计算机辅助诊断领域具有举足轻重的地位,其核心应用场景聚焦于基于内窥镜图像的病变组织自动分类。研究者利用其涵盖高低级别癌变(HGC/LGC)、非肿瘤性病变(NST)及正常组织(NTL)的精细标注,结合白光(WLI)与窄带成像(NBI)双模态图像,训练深度学习模型以区分不同病理类型。其典型范式包括利用预训练卷积神经网络进行迁移学习,或设计端到端的注意力机制模型,旨在提升膀胱镜图像分类的准确性与鲁棒性,为临床决策支持系统提供算法验证基准。
解决学术问题
该数据集解决了膀胱镜图像分析中长期存在的病患泄漏问题,为模型泛化能力的可靠评估提供了关键保障。通过提供基于病例级别的严格划分(训练/验证/测试集无交叉),它消除了传统数据划分中因同一病患图像跨集导致的信息污染,使学术研究能够客观度量模型对未见病例的判别效能。此举推动了医学影像计算领域对数据划分严谨性的重视,为构建可重复、可信赖的膀胱癌自动诊断模型奠定了数据基础,并对后续研究方法的公平对比产生了深远影响。
实际应用
在临床实际应用中,该数据集助力开发智能辅助诊断系统,用于膀胱镜检查过程中的实时组织分类,辅助医生快速识别可疑病灶,降低漏诊与误诊风险。其涵盖的NBI成像模式,尤其适用于提升早期病变的可见度,使得基于该数据集的模型能够兼容不同内镜设备,适应多样化临床环境。此外,通过提供标准化文件名和元数据,该数据集促进了多中心数据融合与模型部署,有望在基层医疗场景中实现低成本、高效率的膀胱癌初筛,缓解专业医师资源不足的困境。
数据集最近研究
最新研究方向
该数据集聚焦于膀胱癌光学诊断领域,整合了白细胞介导成像与窄带成像两种模态的膀胱镜静态图像,按组织类型(高级别癌、低级别癌、非肿瘤性、正常)进行精细标注,为计算机辅助诊断模型的训练提供了标准化基准。其突出去除了原始数据中的患者泄露问题,采用病例级划分策略,有效保障了模型泛化性能评估的可靠性。当前前沿研究方向集中于基于深度学习的膀胱癌分级与分类,尤其是利用多模态融合技术提升低级别与高级别病变的判别精度,同时探索域适应方法以增强模型在不同成像设备与条件下的鲁棒性。该数据集对于推动膀胱癌早期无创筛查、减少不必要活检及优化临床决策路径具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务