遇见数据集

TUM/EgoExOR

收藏
Hugging Face2026-06-01 更新2026-05-10 收录
官方服务:

资源简介:

EgoExOR-HQ是一个用于手术活动理解的自中心-外中心手术室数据集。该数据集旨在解决手术室中快速、遮挡严重环境下外科医生、护士和设备之间精确协调的需求,为提升安全性和效率提供先进的感知模型基础。现有数据集通常只提供部分自中心视角或稀疏的外中心多视角上下文,而EgoExOR首次融合了第一人称和第三人称视角。数据集覆盖了94分钟(以15 FPS采样,共84,553帧)的两种模拟脊柱手术过程:超声引导针插入和微创脊柱手术。它集成了多种模态数据:自中心视角包括来自可穿戴眼镜的RGB视频、注视跟踪、手部跟踪和音频;外中心视角包括来自RGB-D相机的RGB和深度图像以及超声图像。此外,数据集提供了丰富的标注信息,包括36个实体和22种关系(共568,235个三元组),用于场景图生成任务。该数据集为手术室感知研究提供了多模态、时间同步的资源,支持细粒度视觉分析和跨模态相关性研究。

EgoExOR-HQ is an ego-exo-centric operating room dataset for surgical activity understanding. Operating rooms demand precise coordination among surgeons, nurses, and equipment in a fast-paced, occlusion-heavy environment, necessitating advanced perception models to enhance safety and efficiency. Existing datasets either provide partial egocentric views or sparse exocentric multi-view context, but do not explore the comprehensive combination of both. EgoExOR is the first OR dataset and accompanying benchmark to fuse first-person and third-person perspectives. Spanning 94 minutes (84,553 frames at 15 FPS) of two emulated spine procedures—Ultrasound-Guided Needle Insertion and Minimally Invasive Spine Surgery—EgoExOR integrates egocentric data (RGB, gaze, hand tracking, audio from wearable glasses) and exocentric data (RGB and depth from RGB-D cameras, ultrasound imagery). It also includes annotations with 36 entities and 22 relations (568,235 triplets) for scene graph generation. This dataset sets a new foundation for OR perception, offering a rich, multimodal resource for next-generation clinical perception.

提供机构:
TUM
搜集汇总
数据集介绍
TUM/EgoExOR 数据集图片
构建方式
EgoExOR数据集是首个融合第一人称与第三人称视角的手术室数据集,旨在为手术活动理解提供多模态感知基础。数据集包含94分钟(84,553帧,15 FPS)的两类模拟脊柱手术过程:超声引导的穿刺针插入与微创脊柱手术。构建过程中,研究者通过可穿戴眼镜采集了第一人称视角的RGB视频、眼动追踪、手部追踪及音频信息,同时利用外部RGB-D摄像机同步记录第三人称视角的RGB与深度影像,并辅以超声图像。所有模态数据通过时间同步校准,最终以阶段化的HDF5文件形式存储,确保高效的数据加载与访问。
特点
该数据集最突出的特点在于其前所未有的多模态与多视角融合能力,涵盖RGB视频、全波形音频与逐帧片段、眼动坐标与深度、手部关键点位置、原始深度图像以及场景图标注。不同于以往仅提供压缩分辨率或预合并点云的数据集,EgoExOR-HQ版本将RGB图像分辨率提升至1344×1344,并提供来自独立摄像机的高清原始深度数据,允许用户根据自身需求构建自定义点云。此外,每个麦克风通道的独立音频流被保留,为空间音频分析创造了可能。数据集中共标注了36种实体与22种关系,生成了568,235个三元组,为场景图生成任务提供了丰富的监督信息。
使用方法
EgoExOR数据集以HDF5格式分发,按手术阶段组织为独立的压缩文件,用户可通过官方代码仓库中的合并工具整合为一个包含训练、验证与测试划分的完整文件。数据遵循层级结构:手术类型→阶段→拍摄→模态,便于基于序列的训练与帧范围的部分加载。HDF5内部的数据集采用分块存储与gzip压缩,大幅提升了读写效率。用户可直接访问/annotations下的场景图标注,或利用/eye_gaze、/hand_tracking等路径获取眼动与手部数据。眼动坐标中的摄像机ID需映射至/sources元数据以解析具体来源。该数据集在Apache 2.0许可下发布,可自由用于学术与商业研究。
背景与挑战
背景概述
在精准医疗与智能手术辅助系统快速发展的背景下,手术室(OR)环境的感知与理解成为计算机视觉与医疗AI交叉领域的关键课题。然而,现有数据集多聚焦于单一的自我中心视角或稀疏的外部多视角信息,缺乏对两者深度融合的探索。EgoExOR数据集由慕尼黑工业大学(TUM)Ege Özsoy、Arda Mamur等研究人员于2025年提出,发表于NeurIPS 2025,旨在填补这一空白。该数据集首次将第一人称与第三人称视角融合,记录了两个模拟脊柱手术(超声引导穿刺与微创脊柱手术)共计94分钟、84,553帧多模态数据,涵盖RGB视频、眼动追踪、手部姿态、音频及深度图像,并提供了36种实体与22种关系、共计568,235个三元组的场景图标注。这一开创性工作为手术活动理解建立了新的基准,推动了临床感知模型从单一视角向多模态、多视角协同的范式转变。
当前挑战
EgoExOR数据集所解决的领域挑战在于手术室场景中细粒度活动理解的复杂性。不同于静态图像分类,手术室环境存在器械遮挡、快速动作切换、多角色协作等动态性,传统单视角数据集难以捕获全面的上下文信息。数据集构建本身亦面临多重挑战:首先,多模态数据的时间同步要求极高,需将可穿戴眼镜的自我中心视角、外部RGB-D相机与超声影像在毫秒级对齐;其次,场景图标注成本高昂,36类实体与22类关系的细粒度三元组需在密集遮挡与运动模糊条件下精确界定;第三,原始数据规模庞大(1344×1344高分辨率图像、逐设备音频、原始深度信息),对存储与处理效率提出严苛要求,最终采用HDF5分块压缩结构实现平衡。这些挑战的攻克不仅验证了多视角融合在手术感知中的可行性,也为未来临床部署提供了方法论参考。
常用场景
经典使用场景
EgoExOR数据集在手术场景理解领域开创性地融合了第一人称(自我中心)与第三人称(外部中心)多视角信息,为复杂手术环境中的感知建模提供了全新范式。该数据集特别适用于构建和评估手术场景图生成模型,即通过识别手术室中的关键实体(如手术器械、解剖结构)及其相互关系,形成结构化的场景表示。研究者可利用其同步采集的RGB视频、眼动追踪、手部动作及深度数据,开展多模态融合的细粒度手术活动识别与理解,推动从单视角到多视角协同感知的跨越。
衍生相关工作
EgoExOR数据集的发布催生了一系列衍生研究工作,例如在场景图生成领域,研究者基于其多视角数据开发了跨视角特征融合网络,显著提升了遮挡条件下关系检测的精度。在手术活动识别方面,已有工作探索了利用眼动-手部联动信息作为行为预测的时序线索,突破传统仅依赖视觉特征的局限。同时,该数据集为手术场景的多模态自监督预训练提供了宝贵资源,衍生出结合深度图与场景图的对比学习范式,为少样本手术理解开辟了新路径。这些成果持续拓展着手术感知研究的边界,形成了以EgoExOR为基准的活跃学术生态。
数据集最近研究
最新研究方向
EgoExOR数据集的发布标志着手术场景理解研究迈入了一个全新的多模态、多视角融合时代。当前,该领域的前沿方向聚焦于如何将第一人称的穿戴式传感器数据(如眼动追踪、手部姿态与音频)与第三人称的固定摄像头及深度信息进行时空对齐与语义协同,以构建能够精准解析手术室中复杂人机交互与器械操作的场景图生成模型。该数据集所模拟的超声引导穿刺与微创脊柱手术两类高动态、高遮挡的临床流程,直接呼应了智能手术室对实时态势感知与安全预警系统的迫切需求。通过提供高分辨率RGB图像、原始深度图及分离式音频流等丰富模态,EgoExOR为训练具备跨视角推理能力的视觉-语言模型奠定了坚实基础,其影响力已延伸至机器人辅助手术、手术技能评估及临床教学等热点应用,有望推动下一代临床感知系统的范式革新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务