遇见数据集

SAM3-Joint-Surgical-Dataset

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

SAM3 Joint Surgical Dataset 是一个面向腹腔镜手术场景的联合实例分割数据集,由哥伦比亚大学 AIDL 实验室构建。该数据集旨在为手术器械、解剖结构及组织提供统一的标注,支持开放词汇的实例分割和目标检测任务。数据集整合了 CholecInstanceSeg、CholecSeg8k、Dresden Surgical Anatomy Dataset 和 Endoscapes 四个来源的标注,并通过物理帧合并和分组分割策略生成最终版本。数据集包含 41,372 张物理图像,共 175,674 个 COCO 格式的实例分割注释。类别体系包含 29 个类别,其中 25 个类别拥有正样本标注,测试集中包含 24 个正样本类别。类别涵盖手术器械(如抓钳、钩、冲洗器、夹子、双极、剪刀、圈套器、通用手术器械)和解剖组织(如腹壁、肝脏、胃肠道、脂肪、结缔组织、胆囊管、胆囊、肝静脉、肝韧带、胆囊板、Calot 三角、胆囊动脉、结肠、胰腺、小肠、脾脏、胃等)。数据按 80/10/10 比例划分为训练集(33,094 张图像,139,912 个注释)、验证集(4,144 张图像,15,624 个注释)和测试集(4,134 张图像,20,138 个注释),划分基于完整手术过程或视频的组标识符,确保不同分区之间无重叠。注释以 COCO 格式存储,包含标准字段及额外的图像来源、注释范围等信息。训练集通过采样重复机制平衡不同来源的贡献。该数据集适用于训练和评估腹腔镜手术场景下的实例分割与目标检测模型,尤其是基于 SAM 3 的开放词汇模型。注意:部分类别(如肝静脉)仅出现在训练集中,少数测试类别样本量较小,存在高采样不确定性。数据集包含四个无正样本的占位类别。该数据集的编译受多源许可约束,部分源材料尚未确认再分发许可,使用时应遵循各来源的条款。

SAM3 Joint Surgical Dataset is a joint instance segmentation dataset for laparoscopic surgery scenarios, constructed by the AIDL Lab at Columbia University. The dataset aims to provide unified annotations for surgical instruments, anatomical structures, and tissues, supporting open-vocabulary instance segmentation and object detection tasks. It integrates annotations from four sources: CholecInstanceSeg, CholecSeg8k, Dresden Surgical Anatomy Dataset, and Endoscapes, and generates the final version through physical frame merging and group segmentation strategies. The dataset contains 41,372 physical images with a total of 175,674 COCO-format instance segmentation annotations. The category system includes 29 categories, of which 25 have positive sample annotations, and the test set includes 24 positive sample categories. Categories cover surgical instruments (e.g., grasper, hook, irrigator, clip, bipolar, scissors, snare, general surgical instrument) and anatomical tissues (e.g., abdominal wall, liver, gastrointestinal tract, fat, connective tissue, cystic duct, gallbladder, hepatic vein, hepatic ligament, gallbladder plate, Calots triangle, cystic artery, colon, pancreas, small intestine, spleen, stomach, etc.). The data is split into training (33,094 images, 139,912 annotations), validation (4,144 images, 15,624 annotations), and test (4,134 images, 20,138 annotations) sets in an 80/10/10 ratio, based on group identifiers of complete surgeries or videos to ensure no overlap between partitions. Annotations are stored in COCO format, containing standard fields along with additional information such as image source and annotation scope. The training set uses a sampling repetition mechanism to balance contributions from different sources. The dataset is suitable for training and evaluating instance segmentation and object detection models in laparoscopic surgery scenarios, especially the SAM 3-based open-vocabulary model. Note: Some categories (e.g., hepatic vein) appear only in the training set, and a few test categories have small sample sizes with high sampling uncertainty. The dataset contains four placeholder categories without positive samples. The compilation of this dataset is subject to multi-source license constraints, and some source materials have not yet confirmed redistribution licenses; users should comply with the terms of each source.

创建时间:
2026-08-01
原始信息汇总

SAM3 Joint Surgical Dataset 数据集概述

基本信息

  • 数据集名称:SAM3 Joint Surgical Dataset
  • 创建者:Mehmet Kerem Turkcan(哥伦比亚大学 AIDL Lab)
  • 许可证:混合来源条款(mixed-source-terms),详见第三方许可说明
  • 任务类型:目标检测、图像分割
  • 数据规模:10K < n < 100K
  • 语言:英语
  • 标签:医学、外科计算机视觉、腹腔镜手术、COCO、实例分割、开放词汇

数据规模与划分

划分 物理图像数 标注数 组标识符数
训练集 33,094 139,912 204
验证集 4,144 15,624 22
测试集 4,134 20,138 22
总计 41,372 175,674 248

数据来源

数据集整合了以下四个源数据集的标注:

  1. CholecInstanceSeg:提供抓钳、电钩、冲洗器、夹闭器等手术器械的实例分割掩码
  2. CholecSeg8k:提供解剖结构、组织和通用器械掩码
  3. Dresden Surgical Anatomy Dataset(DSAD):提供腹部解剖掩码
  4. Endoscapes:提供关键安全视野结构和器械标注

类别体系

  • 数据模式共包含 29 个类别,其中 25 个类别具有正向标注,测试集中有 24 个类别包含正向实例
  • 4 个类别(肠系膜下动脉、肠静脉、输尿管、囊泡腺)无正向监督,作为兼容性占位符保留
  • 肝静脉仅有训练集支持,来自一个训练组

数据合并与划分

  • 合并过程从 48,267 条源图像记录和 187,642 条源标注开始,通过 SHA-256 图像摘要或标准化源标识符匹配,将相同物理帧的记录合并
  • 合并后保留 41,372 个物理帧组件,去除了 6,895 条冗余源记录,移除了 11,950 条 CholecSeg8k 通用器械标注(当 CholecInstanceSeg 存在时)和 18 条完全重复的标注
  • 划分策略:使用种子 20260801 和混合整数线性规划,确保每个完整组(手术流程、视频或患者)仅属于一个划分,任意两个划分之间在组标识符、物理组件、标准化帧标识符和 SHA-256 图像摘要方面均无重叠

模型表现

在分组测试集(4,134 张图像)上使用相同评估条件,联合模型与基础 SAM 3 检查点的对比:

模型 Box AP Mask AP
联合模型 joint_grouped_seg_best_builder.pt 0.479 0.352
基础 SAM 3 sam3.pt 0.024 0.018

数据格式

  • 采用 COCO 格式,包含标准字段及额外的图像溯源字段(如 procedure_groupphysical_component_idsource_recordsexhaustive_category_idssampling_repeat 等)
  • 边界框使用 COCO [x, y, width, height] 坐标,掩码使用压缩 COCO RLE 格式,所有标注 iscrowd = 0
  • 数据以 WebDataset TAR 分片形式打包,提供 manifest.jsonl 记录每个物理图像与其分片的映射关系及溯源信息

使用限制

  • 多个测试类别图像支持有限:snare 和 spleen 各仅出现在 2 张测试图像中,small intestine 出现在 4 张测试图像中,这些类别的评估指标具有较高的抽样不确定性
  • 源数据集使用不同的分类体系和标注协议,exhaustive_category_ids 记录了每个图像有效监督的类别范围
  • 图像代表特定的腹腔镜手术、机构和采集系统,该数据集及相关模型未经临床决策或患者护理验证

引用要求

  • 源图像和标注保留其原始许可证和引用要求
  • CC BY-NC-SA 4.0 仅适用于原始编译元数据和文档
  • 用户需同时引用标注来源及其底层图像数据集,完整参考信息见 THIRD_PARTY.md

相关资源

搜集汇总
数据集介绍
SAM3-Joint-Surgical-Dataset 数据集图片
构建方式
在微创外科手术的计算机视觉研究中,构建涵盖多源、多层次标注的高质量数据集是推动模型泛化能力的关键。SAM3联合手术数据集汇聚了来自CholecInstanceSeg、CholecSeg8k、Endoscapes及Dresden手术解剖数据集等四个来源的腹腔镜图像与掩膜。构建过程首先通过图像字节的SHA-256摘要及标准化帧标识符进行物理帧的合并,消除同帧冗余记录,并统一采用COCO格式的RLE压缩掩膜表征。随后,基于混合整数线性规划,以完整流程、视频或患者为单位,将群体标识符无重叠地划分至训练、验证与测试子集,确保类别分布和来源多样性。最终形成包含41,372张物理图像、175,674条标注,覆盖29个语义类别(其中25个具有正向标注)的结构化数据集。
特点
该数据集在多个维度上展现出独特优势。其标注体系不仅涵盖手术器械(如抓钳、电钩、冲洗器)和精细解剖结构(如胆囊、肝脏、胆总管),还纳入了组织类别,并兼顾了细粒度类别与泛化的“手术器械”类别。通过物理帧合并和数据清洗,消除了源数据集间的冗余与冲突,保证了标注的一致性和准确性。此外,数据集提供了详尽的来源溯源性字段,包括来源记录、规范帧标识符及掩膜生成方式,为科研人员提供了透明度。其开放词汇的实例分割能力,以及分组划分策略确保的训练/验证/测试无泄漏,使其成为手术视觉基础模型训练与评估的理想基准。
使用方法
使用该数据集时,用户可首先通过Hugging Face下载并解压TAR分片,获取对应划分的COCO格式标注文件与图像。利用pycocotools库即可便捷地加载图像、解析边界框与掩膜。需注意,训练时应参照每张图像的exhaustive_category_ids字段以尊重标注范围,同时利用sampling_repeat字段对样本进行加权采样,以平衡各来源的贡献。验证与测试过程中,则应每张物理图像仅评估一次。数据集附带的文档中提供了群体分配审计和身份验证信息,便于用户验证划分的严谨性。此外,该数据集支持开放词汇检测与分割任务,用户可结合文本提示进行模型微调或性能评估,并应遵循各原始数据集的许可证和引用要求。
背景与挑战
背景概述
SAM3 Joint Surgical Dataset是由哥伦比亚大学AIDL实验室的Mehmet Kerem Turkcan于2026年创建的大规模腹腔镜手术计算视觉数据集,整合了CholecInstanceSeg、CholecSeg8k、Dresden Surgical Anatomy Dataset和Endoscapes四个公开数据源,包含41,372张物理图像及175,674个COCO格式的实例分割标注,覆盖29个类别(含25个正标注类别)。该数据集旨在推动手术场景中开放词汇的实例分割与检测研究,通过统一标注架构和重组数据分割,为训练与评估手术视觉模型提供了标准化基准。实验中,基于该数据集微调的联合模型在Box AP和Mask AP上分别达到0.479和0.352,远超基础SAM 3模型的0.024和0.018,展现了其在提升手术场景理解能力上的巨大潜力,为计算机辅助手术和自动化手术分析领域提供了宝贵资源。
当前挑战
该数据集构建面临多重挑战:领域上,手术场景复杂多变,器械与解剖结构类别繁多且视觉相似,部分类别样本极少(如snare仅41个训练标注,snare和spleen在测试集中仅2张图像),导致模型性能评估存在显著不确定性;标注协议异质,各源数据集分类体系与标注粒度不一,需设计合并规则消除冗余并处理冲突,同时需用exhaustive_category_ids记录标注范围以避免误判负样本。构建过程中,物理帧合并需通过SHA-256哈希和归一化标识符对齐6,895条冗余记录,且分割划分需满足多约束(如每个家族至少一个组、类别在训练与测试中的分布),并通过整数线性规划求解最优分配,确保组间零重叠,这些环节共同保障了数据集的严谨性与可复现性。
常用场景
经典使用场景
SAM3联合外科手术数据集作为计算医学与手术视觉交叉领域的基准资源,其经典应用聚焦于腹腔镜手术场景下的多类别实例分割与目标检测任务。该数据集整合了来自CholecInstanceSeg、CholecSeg8k、Dresden外科解剖数据集以及Endoscapes的41,372幅物理图像,标注涵盖手术器械、解剖结构与组织等29个类别,为开发高精度、泛化性强的视觉模型提供了统一的评测平台。研究者常用于监督学习范式下的模型训练与验证,亦作为开放词汇分割与基础模型微调(如SAM 3)的基石,推动手术视频理解从单一器械识别迈向解剖结构协同感知的精细化阶段。
衍生相关工作
该数据集催生了系列衍生工作,其中最具代表性的是基于其训练的Surgical SAM 3模型,该模型在开放词汇实例分割任务上相较基础SAM 3实现了数量级的性能提升(Box AP从0.024升至0.479)。此进展为后续研究奠定了两个创新方向:一是面向手术领域的视觉基础模型定制化适配,二是多源数据统一框架下的跨数据集泛化研究。此外,其构建流程中采用的物理帧合并算法与MILP分组方案已成为数据整合的范例,被后续工作引用以解决医学图像中的重复检测与划分偏差问题。这些衍生研究共同推动了手术视觉从特定任务到通用理解的范式转型。
数据集最近研究
最新研究方向
该数据集代表了手术计算机视觉领域的一项前沿进展,它通过整合多个公开的腹腔镜手术数据集,构建了一个包含41,372张物理图像和175,674个COCO注释的大规模联合数据集。其研究重点聚焦于开放词汇的实例分割,旨在训练模型识别手术器械、解剖结构和组织类型,共涵盖29个类别,其中25个具有正标注。该数据集的设计理念强调跨数据集的统一注释模式和严格的组级划分,确保训练、验证和测试集之间无信息泄露,为开发鲁棒的手术场景理解模型提供了坚实基础。作为Surgical SAM 3模型训练的基石,该数据集推动了手术视频分析领域的发展,尤其在对关键解剖结构(如胆囊、胆管和血管)的精准识别方面具有显著意义,有望提升机器人辅助手术的自动化水平和手术安全。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务