SurgVLM-DB
收藏资源简介:
SurgVLM-DB是一个大规模的多模态手术数据库,包含超过181万张图像和7.79亿个对话,涵盖了16种手术类型和18种解剖结构。该数据集由23个公开数据集整合而成,经过标准化标签和层次化视觉-语言对齐,以全面覆盖从视觉感知、时间分析到高级推理的逐渐细粒度的手术任务。SurgVLM-DB旨在解决手术领域中对视觉语言模型的特殊需求,并支持开发更精确、层次化的认知辅助模型,以提高手术的安全性和效率。
SurgVLM-DB is a large-scale multimodal surgical database, comprising over 1.81 million images and 779 million surgical dialogues, covering 16 surgical categories and 18 anatomical structures. This dataset is curated from 23 public datasets, and has been processed with standardized labeling and hierarchical visual-language alignment, to comprehensively cover increasingly fine-grained surgical tasks ranging from visual perception, temporal analysis to advanced reasoning. SurgVLM-DB aims to address the specialized requirements of visual-language models in the surgical domain, and supports the development of more precise and hierarchical cognitive assistance models to enhance surgical safety and efficiency.
SurgVLM 数据集概述
1. 数据集基本信息
- 名称: SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence
- 开发者:
- Zhitao Zeng, Zhu Zhuo, Xiaojun Jia, Erli Zhang, Junde Wu
- Jiaan Zhang, Yuxuan Wang, Chang Han Low, Jian Jiang, Zilong Zheng
- Xiaochun Cao, Yutong Ban, Qi Dou
- Yang Liu, Yueming Jin
- 机构:
- 新加坡国立大学、南洋理工大学、牛津大学
- 通用人工智能国家重点实验室、上海交通大学
- 中山大学、香港中文大学
2. 数据集组成
- SurgVLM-DB:
- 包含16种手术类型和18种解剖结构
- 1.181M标注图像和7.79M对话
- SurgVLM-Bench:
- 包含6个流行且广泛使用的手术领域数据集
- 涵盖多个关键下游任务
3. 数据集特点
- 规模: 超过1.81百万帧图像和7.79百万对话
- 多样性: 涵盖16种手术类型和18种解剖结构
- 任务覆盖: 10种手术任务,从视觉感知到时间分析再到高级推理
4. 数据集任务示例
- 器械识别: 识别手术器械的类别
- 器械定位: 定位手术器械在图像中的位置
- 组织识别: 识别手术图片中显示的组织
- 组织定位: 标记组织在图像中的位置
- 阶段识别: 基于图像识别手术阶段
- 步骤识别: 识别手术图像的步骤
- 动作识别: 识别外科医生执行的动作
- 三元组识别: 识别工具、动作和目标的三元组
- 安全关键视图: 确认每个关键视图标准是否满足
5. 性能评估
- 评估基准: SurgVLM-Bench
- 评估指标: Arena Score、Phase Acc、Action Acc、Triplet Acc、CVS Acc、VQA Acc、Loc mIoU
- 性能对比: SurgVLM-72B在Arena Score上比Gemini 2.0 Flash提高了75.4%
6. 数据集亮点
- SurgVLM-DB: 大规模手术多模态数据库
- SurgVLM-Bench: 全面的视觉语言模型评估基准
- SurgVLM: 用于手术智能的大型视觉语言模型
7. 数据集访问
- 代码: SurgVLM
- 数据集: SurgVLM-DB、SurgVLM-Bench、SurgVLM-7B、SurgVLM-32B、SurgVLM-72B

- 1SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence新加坡国立大学, 南洋理工大学, 牛津大学, 通用人工智能国家重点实验室, 上海交通大学, 中山大学, 香港中文大学 · 2025年



