遇见数据集

Voxel51/cholect50

收藏
Hugging Face2026-01-06 更新2026-02-07 收录
官方服务:

资源简介:

CholecT50是一个关于腹腔镜胆囊切除术手术的数据集,标注了手术动作三元组。这是首个为手术视频提供动作三元组标注的公开数据集,支持细粒度手术活动识别的研究。数据集包含50个手术视频,每个视频帧都标注了形式为<器械, 动词, 目标>的动作三元组。具体包括7种器械(如抓取器、双极电凝器、钩子)、10种动词(如抓取、回缩、烧灼)和15种目标(如胆囊、胆囊管、肝脏)。数据集共计约100,000个标注帧,为手术视频理解模型的训练和评估提供了丰富的资源。

CholecT50 is a dataset of laparoscopic cholecystectomy surgeries, annotated with surgical action triplets. It is the first public dataset to provide action triplet annotations for surgical videos, enabling research in fine-grained surgical activity recognition. The dataset consists of 50 videos, with each frame annotated with action triplets of the form <Instrument, Verb, Target>. It includes 7 instrument categories (e.g., grasper, bipolar, hook), 10 verb categories (e.g., grasp, retract, cauterize), and 15 target categories (e.g., gallbladder, cystic duct, liver). The dataset contains approximately 100,000 annotated frames, providing a rich source for training and evaluating models for surgical video understanding.

提供机构:
Voxel51
搜集汇总
数据集介绍
Voxel51/cholect50 数据集图片
构建方式
在微创外科手术视频理解领域,细粒度动作识别是提升手术智能化水平的关键。CholecT50数据集由50段腹腔镜胆囊切除术视频构成,每帧图像均以<器械、动作、目标>三元组形式进行标注,涵盖7种手术器械、10类操作动作及15类解剖目标,共计约10万帧标注图像。该数据集通过FiftyOne框架进行封装,不仅保留了原始视频帧的结构化信息,还提供了基于CLIP模型(ViT-B/32)提取的512维clip_embeddings特征,为多模态手术动作识别研究奠定了数据基础。
特点
该数据集的核心特点在于其开创性的三元组标注体系,首次在公开数据集中实现了手术动作的细粒度语义分解。每帧图像同步标注器械类别、操作动词及作用目标,形成完整的行为语义链。数据集规模适中但标注密度高,视频帧级标注确保了时序动作分析的可行性。此外,预计算的CLIP嵌入特征降低了模型训练的计算门槛,使研究者能够快速开展跨模态特征融合实验,特别适用于手术视频中的动作识别与行为理解任务。
使用方法
研究者可通过FiftyOne库便捷加载该数据集,仅需执行fiftyone.utils.huggingface模块中的load_from_hub函数并指定数据集名称即可完成导入。加载后的数据集以FiftyOne Dataset对象形式呈现,每个样本包含文件路径、视频ID、帧序号、器械/动作/目标分类标签及三元组标注。用户可通过fo.launch_app启动可视化界面进行数据探索,或直接利用Python API访问各字段进行模型训练与评估,支持自定义样本筛选与特征提取流程。
背景与挑战
背景概述
微创手术(特别是腹腔镜胆囊切除术)的普及推动了计算机辅助手术系统的发展,其中对手术视频的细粒度理解成为关键技术瓶颈。CholecT50数据集由法国斯特拉斯堡大学CAMMA研究团队于2022年创建,主要研究人员包括Chinedu Innocent Nwoye等人,旨在解决手术动作三元组(<器械、动词、目标>)的识别问题。作为首个公开提供此类标注的大规模数据集,它包含50台腹腔镜胆囊切除术视频中约10万帧图像的精细标注,覆盖7种手术器械、10种操作动作和15种解剖目标,为手术视频理解领域提供了标准化基准。该数据集显著推动了手术动作识别、手术工作流程分析等研究方向,已被广泛应用于深度学习模型的训练与评估,对提升手术机器人自主性和手术质量评估具有重要意义。
当前挑战
CholecT50数据集所解决的领域核心挑战在于手术视频中细粒度动作三元组识别的高度复杂性,包括多器械交互的时空动态性、器械与目标间的语义模糊性、以及手术场景中光照反射、烟雾遮挡等视觉干扰。在构建过程中,研究者面临三重挑战:第一,需要医学专家对每帧图像进行精确的器械、动作和目标三元组标注,耗时且易产生标注歧义;第二,视频帧间动作连续性导致标注一致性难以保证;第三,数据规模与手术类型单一性(仅胆囊切除术)限制了模型对多样化手术场景的泛化能力,同时存在类别分布不均衡问题(如某些器械或动作出现频率极低)。
常用场景
经典使用场景
CholecT50数据集在计算机视觉与医学影像分析领域,尤其是手术视频理解中扮演着基石角色。其核心应用场景聚焦于细粒度手术动作三元组识别,即从腹腔镜胆囊切除术视频帧中同步解析出手术器械、操作动词及作用目标。该数据集通过提供约十万帧高精度标注,使得研究者能够训练和评估能够理解复杂手术流程的深度学习模型,从而推动手术阶段分割、动作检测与视频描述等任务的进展。
解决学术问题
该数据集解决了手术视频分析中长期存在的细粒度动作识别难题。传统研究多局限于粗粒度的手术阶段分类或单一器械检测,而CholecT50首创性地引入了<器械,动词,目标>三元组标注体系,使模型能够捕捉手术操作中器械与组织间的动态交互关系。这一突破为理解手术动作的语义层次提供了关键数据支撑,显著推动了面向复杂外科流程的时空建模与多任务学习研究,并在手术技能评估、自动化手术报告生成等领域产生了深远影响。
衍生相关工作
基于CholecT50数据集,学术界已衍生出一系列经典工作。Nwoye等人提出的Rendition论文首次定义了该数据集并建立了基线模型。后续研究包括利用时空Transformer架构进行三元组联合识别(如SurgFormer),以及引入图神经网络建模器械-目标交互关系(如Triplet-GCN)。此外,还有工作探索了跨模态学习,结合视频与文本嵌入实现手术动作描述生成,进一步拓展了该数据集在手术视频理解与自然语言处理交叉领域的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务