ATLAS-120k
收藏数据链接:
官方服务:
资源简介:
ATLAS-120k是一个大规模片段级语义分割数据集,用于微创手术中的手术解剖识别。它包含来自100个手术视频的超过12万标注帧,涵盖14种手术过程和42个解剖类别,包括腹腔镜和机器人辅助手术。
ATLAS-120k is a large-scale frame-level semantic segmentation dataset for surgical anatomy recognition in minimally invasive surgery. It contains over 120,000 annotated frames from 100 surgical videos, covering 14 surgical procedures and 42 anatomical categories, including both laparoscopic and robot-assisted surgeries.
创建时间:
2026-05-28
原始信息汇总
数据集概述:ATLAS-120k
ATLAS-120k 是一个用于微创手术解剖识别的大规模片段级语义分割数据集。
核心规模与统计
- 总标注帧数:超过 120,000 帧(121,018 帧)
- 手术视频来源:100 个手术视频
- 覆盖手术类型:14 种
- 解剖类别:42 类(训练时整合为 30 类)
- 片段数量:502 个
- 手术模式:同时涵盖腹腔镜手术和机器人辅助手术
覆盖的手术类型(14种)
包括:肾上腺切除术、阑尾切除术、胆囊切除术、结肠切除术、食管切除术、胃部手术、胃空肠吻合术、右半结肠切除术、腹腔镜前切除术(LAR)、肝切除术、机器人辅助前列腺根治术(RARP)、直肠固定术、乙状结肠切除术、脾切除术。
覆盖的解剖类别(42类)
包括:肝脏、胆囊、胆囊管、肝韧带、胆囊板、胆总管、肝管、胃、小肠、结肠/直肠、腹壁、膈肌、大网膜、主动脉、腔静脉、大动脉、大静脉、主要神经、脾脏、胰腺、十二指肠、肾脏、膀胱、输尿管、子宫、卵巢、前列腺、精囊、肾上腺、结肠系膜、肠系膜、奇静脉、食管、心包、气道(支气管/气管)、肺、导管、以及器械/摄像头。
数据集结构
- 下载与处理:标注(分割掩码)从 HuggingFace 单独下载。原始视频需通过提供的脚本从 YouTube 下载,并经过处理提取出指定 15 FPS 帧。
- 划分:数据集已划分为训练集、验证集和测试集。
- 数据组成:每个片段包含
images/(处理后的帧)和machine_masks/(分割掩码)两个子文件夹。 - 掩码格式:单通道 PNG 文件,每个像素的值为对应的类别 ID。
评估指标
- mIoU / mDice:基于所有前景类别的平均交并比和平均 Dice 系数。
- AP / AP50 / AP75:COCO 风格的平均精度。
- mVC₁₂ / mVC₂₄:基于时间滑动窗口(12帧/24帧)的平均视频一致性。
许可协议
- 数据集标注:CC BY-NC-SA 4.0
- 仓库代码:MIT License
搜集汇总
数据集介绍

构建方式
ATLAS-120k数据集精心构建于微创手术领域,旨在推动手术解剖识别的语义分割研究。其构建过程严谨而系统:首先,从YouTube上广泛收集了100段公开的手术视频,涵盖14种手术类型与42个解剖类别;随后,通过人工审查剔除体外画面与可识别患者的信息,并由三位外科研究学者在资深外科医生的监督下进行精细的逐帧标注。为了确保数据的高质量与可用性,所有标注帧均经15帧/秒的降采样处理,并利用手术帧过滤器排除非手术内容。最终,该数据集汇聚了超过12万帧带有分割掩码的图像,并按照训练、验证与测试集进行科学划分,形成了一个规模宏大且结构规范的基础资源。
特点
ATLAS-120k数据集在多个维度上展现出卓越的特色。其最显著的特征在于宏大的规模与丰富的多样性,覆盖了从腹腔镜到机器人辅助手术的多种场景,并囊括了肝脏、胆囊、动脉及神经等42类精细解剖结构。尤为突出的是,数据集采用了clip级别的组织结构,通过clip_index.json文件精确记录了每段视频中帧序列的时序关系,这为开展上下文学习与时序建模研究提供了得天独厚的条件。此外,数据集提供了原始46类与合并后30类的分类体系,并附带了色彩映射表,极大地方便了研究者根据自身需求灵活调整任务目标。
使用方法
使用ATLAS-120k数据集需按照官方流程逐步操作。首先,需通过HuggingFace平台获取标注文件,建议使用git clone命令以高效下载大量小文件;接着,利用提供的下载脚本从YouTube获取原始视频,并在此过程中通过yt-dlp工具解决年龄限制问题;最后,执行处理脚本完成帧提取与手术帧过滤,生成可用的图像数据。研究者随后可基于atlas120k_tools中的Python包加载类别映射与色彩板,利用dataset-evaluation模块中提供的评估函数,如evaluate_model与evaluate_atlas_temporal,在新的模型上进行性能验证,从而轻松复现基准实验或开展创新研究。
背景与挑战
背景概述
ATLAS-120k是由荷兰埃因霍温理工大学、阿姆斯特丹大学医学中心及多个顶尖医疗机构的研究人员于2026年共同创建的大规模剪辑级语义分割数据集,旨在解决微创手术中的解剖结构识别问题。该数据集包含超过12万帧标注图像,源自100个手术视频,覆盖14种手术类型和42个解剖类别,横跨腹腔镜与机器人辅助手术两种模态。相较于此前最大规模的内窥镜分割数据集CholecSeg8k仅含8080帧、12类,ATLAS-120k在规模、类别多样性和手术覆盖面上实现了数量级的突破,为手术环境感知、自主导航及手术机器人智能化的研究奠定了坚实的数据基础,其相关论文发表于MICCAI 2026,对计算解剖学与计算机辅助介入领域产生了深远影响。
当前挑战
ATLAS-120k旨在攻克微创手术中解剖结构自动识别的核心挑战:不同手术入路下器官外观的显著变异、视频序列中时空连续性约束下的分割一致性、以及多类别同时出现的复杂场景下精确保留边界信息。在数据集构建过程中,研究团队面临三重困难:其一,原始视频源自YouTube,受年龄限制与平台反爬机制影响,需借助JavaScript运行时与Cookies认证方可下载,且有3个视频已无法公开获取;其二,12万帧掩码的标注需由三名外科研究员在三名资深专家监督下完成,每帧首张还需独立复核,人力成本极高;其三,从原始手术视频中精确筛除非手术片段(如术前准备、术后文字叠加),并构建统一的15 fps帧率标准与42类到30类的标签层级映射,对数据处理流程提出了严苛的工程要求。
常用场景
经典使用场景
ATLAS-120k数据集的核心应用场景在于为微创手术中的解剖结构识别提供大规模、精细化的语义分割基准。该数据集涵盖了14种手术类型、42个解剖类别,包含了超过12万帧经过专业标注的手术视频帧,覆盖了腹腔镜与机器人辅助手术两种模态。研究者可利用这一资源训练和评估深度学习模型在复杂手术场景下的多类别解剖结构分割能力,特别是在时序上下文建模、复杂解剖边界识别以及跨手术类型的泛化性能评估方面展现了不可或缺的价值。
衍生相关工作
围绕ATLAS-120k数据集已衍生出一系列重要工作。该数据集是ATLAS项目系列的核心组成部分,同属该生态的还包括:ATLAS-interactive交互式标注平台,实现了人机协同的高效数据注释;ATLAS-model提供了面向手术视频的时序上下文语义分割模型实现;ATLAS-bench则系统性地评估了多种主流模型在该基准上的表现。此外,基于该数据集训练的SurgeNetDINO手术视觉基础模型,已在多个下游手术识别任务上展示了强大的表征迁移能力。这些衍生产品共同构建了从数据构建、模型训练到基准评估的完整技术链条。
数据集最近研究
最新研究方向
近年来,随着微创手术(MIS)的普及与人工智能技术的深度融合,手术场景理解成为计算机辅助介入领域的前沿热点。在此背景下,ATLAS-120k 作为目前规模最大的手术解剖结构视频语义分割数据集应运而生,它涵盖14种术式与42个解剖类别,包含超过12万帧精细标注图像,涵盖了腹腔镜与机器人辅助手术场景。该数据集的推出有力地回应了领域内在多手术类型、多解剖类别下模型泛化能力不足的挑战,为基于基础模型的手术解剖识别提供了重要的数据支撑。相关研究聚焦于利用上下文学习机制与视觉基础表征,在时空维度上提升分割精度与视频连续性,推动了手术领域预训练视觉基座的发展。ATLAS-120k 的构建不仅填补了多类别细粒度手术解剖结构分割的空白,也为智能手术导航、术中决策支持等临床应用奠定了坚实基础,具有重要的科学价值与转化潜力。
以上内容由遇见数据集搜集并总结生成



