D
收藏资源简介:
这是一个膀胱镜静止图像数据集,来源于Kaggle,包含1,754张PNG图像(约236 MB)。图像按组织类型和成像模态进行组织:组织类型包括高分级癌(HGC)、低分级癌(LGC)、非特殊型(NST)和正常组织(NTL);成像模态包括白光成像(WLI)和窄带成像(NBI)。数据集包含一个元数据文件(metadata.parquet),每行对应一张图像,字段包括文件名(标准化后的磁盘名称)、病例ID、成像类型、组织类型、原始划分(用于审计,原始划分存在患者泄露)以及标准化后的文件名。此外,提供了基于病例级别的训练/验证/测试划分(18/2/2个病例,分别对应1,541/44/169张图像),使用随机种子42生成,确保无患者泄露。该数据集适用于膀胱癌的图像分类任务,特别是基于组织类型和成像模态的分类。
This is a cystoscopy still image dataset from Kaggle, containing 1,754 PNG images (approximately 236 MB). Images are organized by tissue type and imaging modality: tissue types include high-grade carcinoma (HGC), low-grade carcinoma (LGC), non-special type (NST), and normal tissue (NTL); imaging modalities include white light imaging (WLI) and narrow-band imaging (NBI). The dataset includes a metadata file (metadata.parquet) with each row corresponding to an image, fields including filename (normalized disk name), case ID, imaging type, tissue type, original split (for auditing, with patient leakage in the original split), and normalized filename. Additionally, patient-level training/validation/test splits (18/2/2 cases, corresponding to 1,541/44/169 images respectively) are provided, generated with random seed 42 to ensure no patient leakage. The dataset is suitable for bladder cancer image classification tasks, particularly classification based on tissue type and imaging modality.
数据集概述:Kaggle 膀胱镜帧数据集
本数据集(milkyroad/D)是一个用于图像分类任务的医学影像数据集,内容为膀胱镜检查(Cystoscopy)的静态帧图像,来源于 Kaggle 平台,并经过系统化整理与规范化处理。
基本信息
- 语言:英语(en)
- 许可证:未知(unknown)
- 任务类型:图像分类(image-classification)
- 标签:医学(medical)、膀胱镜检查(cystoscopy)、膀胱癌(bladder-cancer)
- 样本规模:1K < n < 10K(约 1754 张图像)
数据内容
数据集包含 1,754 张 PNG 格式的膀胱镜静态帧图像(约 236 MB),按组织类型和成像模态进行分类组织。
组织类型(Tissue types)分布:
| 组织类型 | 数量 |
|---|---|
| LGC(低级别癌) | 647 |
| NST(非特殊类型) | 504 |
| HGC(高级别癌) | 469 |
| NTL(非肿瘤性) | 134 |
数据文件结构
| 路径 | 描述 |
|---|---|
data/images/ |
1,754 张 PNG 图像,文件名统一规范为 case_{cid:03d}_pt_{pt:03d}_frame_{frame:04d}_{tissue}.png 格式 |
data/metadata.parquet |
每张图像对应一行元数据,包含字段:filename(规范化文件名)、case_id(整数)、imaging_type(WLI/NBI)、tissue_type(HGC/LGC/NST/NTL)、original_split(原始 CSV 划分,仅作参考,存在数据泄漏)、csv_filename(与规范化后的 filename 一致) |
splits/{train,val,test}.txt |
基于病例级别(case-level)划分的图像 ID 列表(随机种子 seed=42),共 18/2/2 个病例,对应 1541/44/169 张图像,无病例泄漏 |
文件名规范化处理
原始 Kaggle 数据集包含 8 种不同的文件名模式,已全部统一为上述单一格式。主要处理包括:
- HLT 标注去除:37 个文件名中嵌入的“HLT”(增生)标注被移除,因其在元数据中已分类为 NST
- 缺失患者编号处理:41 个文件(模式 7,无 pt)被分配为
pt_000 - 重复后缀清理:4 个文件带有 macOS Finder 的“ (copy)”后缀,已被去除
- 组织类型消歧:存在 9 对文件名冲突(相同 case/pt/frame 下同时有癌与非癌图像),通过在文件名中加入
{tissue}消除歧义
数据划分与泄漏处理
- 原始划分存在泄漏:原始 CSV 的
sub_dataset列将 21 个训练病例中的 19 个同时放入验证集和测试集 - 新增病例级划分:本数据集提供基于病例级别的全新划分(seed=42),确保无病例泄漏
original_split字段仅保留用于审计追溯
加载示例
python import pandas as pd, pathlib meta = pd.read_parquet("hf://datasets/milkyroad/D/data/metadata.parquet") train = pathlib.Path("hf://datasets/milkyroad/D/splits/train.txt").read_text().split()
可复现性
划分使用 random.Random(42) 基于排序后的病例 ID 列表生成,确保结果可复现。




