遇见数据集
官方服务:

资源简介:

该数据集是一个膀胱镜检查(cystoscopy)视频数据集,用于肿瘤检测任务。数据包含173个.mp4视频(约4GB),每个视频逐帧标注了肿瘤(tumor)的边界框,并关联了患者级别的临床元数据。数据集共包含69108个边界框,分布在444个标注轨迹中,来自30位患者。数据以Parquet格式存储,每个视频作为一行,视频以HuggingFace Video特征嵌入,边界框以结构体形式内联存储。字段包括:视频数据(video)、视频ID(video_id)、患者ID(patient_id)、边界框结构体(boxes,包含轨迹ID、帧号、标签、坐标等)、边框数量(n_boxes)、组织学类型(histological_type)、标注帧数(num_frames)、光照模式(light_mode)。坐标采用绝对像素(CVAT格式)。数据集仅提供训练集,建议使用患者ID进行分组以避免数据泄露。适用任务:医学图像中的目标检测,特别是膀胱癌肿瘤检测。

This dataset is a cystoscopy video dataset developed for tumor detection tasks. It contains 173 .mp4 videos with a total size of approximately 4 GB. Each video is annotated with tumor bounding boxes on a per-frame basis, and is paired with patient-level clinical metadata. In total, the dataset includes 69,108 bounding boxes distributed across 444 annotated tracks, originating from 30 patients. The data is stored in Parquet format, with each video represented as one row. Videos are encoded using HuggingFace Video feature embeddings, while bounding boxes are stored inline as structured entities. The dataset's fields are as follows: video data (video), video ID (video_id), patient ID (patient_id), bounding box structure (boxes, which includes track ID, frame number, label, coordinates, and other related attributes), number of bounding boxes (n_boxes), histological type, number of annotated frames (num_frames), and light mode. Coordinates are in absolute pixel format following the CVAT standard. Only the training subset is provided for this dataset. It is recommended to group samples by patient ID to prevent data leakage. Applicable tasks include object detection in medical imaging, with a specific focus on bladder cancer tumor detection.

创建时间:
2026-07-31
原始信息汇总

数据集概述

数据集名称:Cystoscopy Tumor Detection(膀胱镜肿瘤检测)

数据集地址:https://huggingface.co/datasets/milkyroad/B

许可证:unknown(未知)

语言:英语(en)

任务类别:目标检测(object-detection)

标签:医疗、膀胱镜检查、膀胱癌、肿瘤检测、视频

数据集规模:100M < n < 1B


内容概述

  • 视频数量:173段膀胱镜检查 .mp4 视频(约4 GB,内嵌于数据集中)
  • 标注框数量:69,108个边界框,分布于444条标注轨迹中
  • 患者数量:30位患者,附有临床元数据

数据结构

数据集仅包含一个 train 分割,每个视频对应一行数据。视频以 Hugging Face Video 特征内嵌于 Parquet 分片中,边界框信息以内联方式存储。

主要列

列名 类型 说明
video Video 内嵌视频字节,默认不解码(decode=False),返回 {bytes, path},可转换为 decode=True 以解码帧(需安装 torchcodec
video_id string 文件名主干,如 P000_cystoscopy_track_000
patient_id int64 患者ID,可用于按患者分组划分数据集
boxes struct 每个框的标注信息,以并行列表形式存储
n_boxes int64 该视频的框数量
histological_type string 患者级别的组织学类型(如:Urothelial carcinoma pTaLG)
num_frames int64 患者级别标注的总帧数
light_mode string 成像光模式(如:CLARA + CHROMA)

boxes 结构体字段

每个字段为长度为 n_boxes 的列表,索引 i 对应一个框的所有字段。

字段 类型 说明
track_id int64 视频内的标注轨迹ID
frame int64 框所属的帧号
label string 框标签(始终为 tumor
xtl, ytl, xbr, ybr float32 绝对像素坐标(CVAT格式)
occluded int64 遮挡标志
outside int64 外部标志
keyframe int64 关键帧标志
z_order int64 Z轴顺序

数据划分说明

  • 数据集仅提供单一 train 分割,不提供预定义的验证/测试集。
  • 建议使用 patient_id 列自行构建按患者分组的数据划分,以避免数据泄漏(同一患者的所有视频应位于同一分割中)。
  • 示例代码中展示了如何划分3个测试患者、3个验证患者及剩余训练患者的方法。

加载与使用

python from datasets import load_dataset ds = load_dataset("milkyroad/B", split="train")

默认不解码视频(无需 torchcodec 即可加载)

print(ds[0]["video"]) # {bytes: ..., path: P000_cystoscopy_track_000.mp4} print(ds[0]["n_boxes"]) # 233 boxes = ds[0]["boxes"] print(boxes["frame"][0], boxes["label"][0], boxes["xtl"][0])

如需解码视频帧,需安装 torchcodec,然后将列转换为 Video(decode=True)

python from datasets import Video ds = ds.cast_column("video", Video(decode=True))


注意事项

  • 边界框坐标为源视频帧中的绝对像素坐标(CVAT格式)。
  • 数据划分必须按患者进行以防止泄漏,为此提供了 patient_id 字段。
搜集汇总
数据集介绍
B 数据集图片
构建方式
该数据集名为B,是面向膀胱癌检测的膀胱镜视频数据集,包含了173段膀胱镜.mp4视频,约4GB数据,以及69,108个逐帧肿瘤边界框标注和444条标注轨迹,覆盖30位患者的临床元数据。数据以Parquet分片格式存储,每一行对应一个视频,视频以HF Video特征嵌入,边界框则以结构体形式内联存储。所有数据被合并为单一训练集,并通过patient_id字段支持按患者分组构建自定义划分,以防止数据泄露。
使用方法
使用该数据集时,可通过HuggingFace datasets库直接加载,例如load_dataset("milkyroad/B", split="train")。默认情况下,视频以字节流形式返回,便于轻量预览;若需解码帧,可安装torchcodec并通过cast_column(..., Video(decode=True))转换。为构建验证集和测试集,建议依据patient_id进行分组随机划分,代码示例中展示了随机抽取3个患者作为验证集和测试集,其余作为训练集的方法。如此可确保模型评估的公正性,避免同患者视频跨集泄漏。
背景与挑战
背景概述
膀胱癌作为泌尿系统最常见的恶性肿瘤之一,其早期诊断对改善患者预后至关重要。膀胱镜检查是诊断膀胱癌的金标准,但传统白光成像对平坦型或微小肿瘤的检出存在局限。近年来,基于深度学习的计算机辅助检测系统在医学影像分析领域取得了显著进展,但针对膀胱镜视频的公开数据集却极为匮乏。在此背景下,milkyroad团队于近期发布了名为B的数据集,该数据集包含173段膀胱镜视频,来自30位患者,并提供了超过6.9万帧的肿瘤边界框标注以及患者层面的组织病理学类型、光照模式等临床元数据。该数据集的创建旨在填补膀胱镜视频分析领域的空白,为研究者提供标准化的基准,以推动膀胱肿瘤自动检测算法的发展。其发布为膀胱癌的计算机辅助诊断研究提供了宝贵的资源,有望促进该领域从图像级分析迈向视频级临床应用的转化。
当前挑战
该数据集构建与使用面临多重挑战。其一,领域问题为膀胱镜视频中的肿瘤自动检测,其难点在于视频中肿瘤形态复杂、尺寸变化大,且受光照模式变化(如CLARA+CHROMA)、镜头运动、组织反射、遮挡等因素干扰,背景纹理复杂,对检测算法的鲁棒性要求极高。其二,数据构建中,标注需由专家逐帧进行,耗时耗力,且需保证不同标注者间的一致性;视频数据量庞大(约4GB),嵌入存储与处理需高效解码方案,如默认不解码以减少加载开销;同时,数据仅包含单训练集,为避免患者级数据泄漏,需按`patient_id`进行分组划分,这对评估协议的标准化提出挑战。此外,数据规模有限(30例患者),可能限制模型泛化能力,需借助迁移学习或数据增强策略缓解。
常用场景
经典使用场景
该数据集聚焦于膀胱镜检查视频中肿瘤的帧级目标检测,为医学影像分析领域提供了一份珍贵的基准资源。其核心使用场景在于训练和评估基于深度学习的肿瘤检测模型,通过逐帧标注的边界框,研究者可构建视频目标检测系统,实现对膀胱癌病灶的实时定位。数据集包含173段内窥镜视频和超过6.9万个边界框,且配备患者级临床元数据,支持跨帧追踪与时空特征学习,是探索视频理解技术在微创手术导航中应用的理想起点。
解决学术问题
该数据集直面膀胱癌诊断中肿瘤形态多变、内窥镜图像背景复杂等挑战,解决了视频级目标检测中标注稀疏和患者间数据泄漏的学术难题。通过提供按患者分组的分割指导,它促进了模型泛化能力的可靠评估,并为弱监督学习、半监督学习及多实例学习等范式提供了实验平台。其临床元数据(如组织学类型和光照模式)还助力研究病变表型与影像特征之间的关联,推动可解释性AI在医疗决策支持中的发展。
实际应用
在实际应用中,该数据集可赋能智能膀胱镜系统,辅助泌尿外科医生在手术过程中实时标记可疑肿瘤区域,提升早期膀胱癌的检出率。其视频级别标注兼容于主流推理框架,有望集成于临床工作流,实现病灶的自动追踪与记录,减少人工筛查负担。此外,患者级元数据支持个性化诊疗方案的制定,为远程医疗和手术机器人提供视觉感知基础,加速精准医疗在泌尿肿瘤学中的落地。
数据集最近研究
最新研究方向
随着医学影像人工智能的迅猛发展,内窥镜视频下的肿瘤自动检测成为精准医疗的前沿热点。该数据集聚焦膀胱癌的膀胱镜检查视频,提供逐帧肿瘤边界框标注及患者级临床元数据,为研究者构建时间感知的目标检测模型提供了高质量数据基础。其独特之处在于整合了患者身份信息以支持群体感知的数据划分,有效防止数据泄漏,推动模型泛化能力的评估。当前研究方向包括利用视频时序特征提升检测稳定性、探索弱监督学习以减轻标注负担,以及结合多模态临床数据实现个性化诊疗。该数据集的发布有望加速膀胱癌早期筛查与术中导航的智能化进程,对提升泌尿外科诊疗水平具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务