遇见数据集

SAGE

收藏
github2026-06-21 更新2026-07-05 收录
数据链接:
官方服务:

资源简介:

SAGE是首个南亚内窥镜数据集,在尼泊尔Dhulikhel医院收集,包含1,300张内窥镜图像,配有专家验证的丰富标注,包括1,300个胃肠道专家标注的图像描述、14,276个视觉问答对、18个多标签分类标签和14个多类别分类类别。

SAGE is the first South Asian endoscopic dataset, collected at Dhulikhel Hospital in Nepal. It contains 1,300 endoscopic images, accompanied by expert-validated comprehensive annotations including 1,300 image descriptions annotated by gastrointestinal experts, 14,276 visual question-answer pairs, 18 multi-label classification labels, and 14 multi-class classification categories.

创建时间:
2026-06-19
原始信息汇总

数据集名称

SAGE (South Asian GI Endoscopy Dataset)

数据集来源与背景

  • Dhulikhel Hospital, Nepal 收集,是首个南亚内窥镜数据集。

数据规模与内容

  • 1,300张 胃肠道内镜图像。
  • 所有图像均经过专家验证,并包含丰富的标注:
    • 1,300条 专家注释的图像描述(caption)
    • 14,276对 视觉问答(VQA)对
    • 18个标签 用于多标签分类
    • 14个类别 用于多类别分类

数据获取

数据预处理与标注流程

  • 去重与匿名化:使用脚本过滤近似重复图像、提取日期、生成就诊ID、创建标准格式数据集并包含红色框(redact bboxes)信息。
  • 数据划分与多类别标签生成:基于胃肠专家提供的分类标注,通过 multiclass-train-test-split.py 脚本生成多类别标签,并使用分层采样进行训练-测试集划分。

基准测试与模型评估

  • 使用 Open Router 平台访问多个专有视觉语言模型(VLM),包括:Gemini-3.5-Flash-Preview、Gemma-4-31b、Grok-4.3、Qwen-2.5vl-72b、Claude Sonnet 4.6。
  • 通过脚本生成图像描述,并转化为六项临床任务,使用 GREEN 评分 计算模型的平均绿色分数,最终汇总结果进行基准测试。

其他工具与脚本

  • interrater-disagreement.py:计算标注者间不一致性。
  • hyperkvasir-on-SAGE.py:在欧洲数据集上训练的模型在SAGE数据集上的基准测试。
  • trainer.py:训练 ResNet 和 DenseNet 模型(用于 HyperKvasir 和 SAGE)。

许可证

  • 采用 MIT 许可证
搜集汇总
数据集介绍
SAGE 数据集图片
构建方式
SAGE数据集是首个针对南亚人群构建的消化内镜影像数据集,数据采集自尼泊尔Dhulikhel医院,涵盖1,300张经过严格匿名化处理的内窥镜图像。数据集构建过程包括:首先通过去重脚本过滤近似重复图像,利用OCR技术提取图像中的日期信息,并结合就诊时间戳生成唯一的就诊标识。随后,由消化内镜专家对每张图像进行多维度标注,形成包含1,300条专家验证的图像描述、14,276组视觉问答对、18个多标签分类标签以及14个多类别分类标签的丰富标注体系。最终,通过多标签分层采样策略对数据进行划分,确保训练集与测试集的类别分布均衡。
特点
SAGE数据集的核心特点在于其地域特异性与标注多样性。作为首个南亚内镜数据集,它填补了该地区在消化内镜影像分析领域的数据空白,为跨种族、跨地域的模型泛化研究提供了关键验证基准。其标注体系不仅包含传统的多类别分类标签,还创新性地引入了图像描述与视觉问答对两种细粒度标注形式,有效支持从图像理解到语言生成的联合任务。此外,数据集中所有标注均经过消化内镜专家双重校验,并提供了标注者间不一致性分析工具,确保了标注质量的可信度与可复现性。
使用方法
SAGE数据集支持多种临床应用场景的模型开发与评估。研究者可直接使用提供的ResNet与DenseNet训练脚本进行内镜图像的分类模型微调,或通过图像描述生成脚本调用Gemini、Claude等闭源视觉语言模型完成描述生成与视觉问答任务。数据集提供了完整的基准测试流程,包括基于Open Router平台的模型API调用、从描述到六项临床任务的VQA转换、以及利用GREEN评分系统对模型输出进行环境与临床维度的综合评价。同时,研究者可通过跨数据集对比脚本评估在HyperKvasir等欧洲数据集上训练的模型在南亚人群数据上的迁移表现。
背景与挑战
背景概述
SAGE(South Asian GI Endoscopy Dataset)是首个聚焦南亚人群的胃肠道内窥镜数据集,由尼泊尔Dhulikhel Hospital的研究团队于近年创建。该数据集旨在填补南亚地区在消化内镜影像分析领域的空白,覆盖1300张专家标注的内窥镜图像,包含丰富的注释信息,如图文描述、视觉问答对、多标签分类标签及多类别分类标签,为模型训练与评估提供高质量基础。其核心研究问题在于探究南亚人群胃肠道疾病的影像特征异质性,提升AI系统在该人群中的诊断泛化能力。鉴于现有内窥镜数据集多基于欧美人群,SAGE的推出对推动全球消化内镜AI研究的区域公平性具有重要影响力。
当前挑战
SAGE所面对的挑战首先在于南亚人群胃肠道疾病的影像特征具有独特表现,现有基于其他地区的模型难以直接迁移应用,亟需针对性数据集支撑。构建过程中,团队面临多重困难:包括从临床内窥镜视频中筛选去重图像以确保数据多样性,利用OCR技术提取并脱敏图像中的日期信息以保护患者隐私,以及通过专家标注生成多层级注释,尤其是多标签分类与图文描述需要高水平的医学知识。此外,南亚地区的医疗资源限制使得大规模数据采集与标注难度增加,数据集规模相对有限,可能导致模型过拟合或泛化不足,这要求研究者在模型训练与评估中引入更为稳健的采样策略与跨域验证方法。
常用场景
经典使用场景
SAGE数据集作为首个南亚人群消化道内窥镜图像资源,为医学影像分析领域提供了独特的跨族群研究素材。其经典使用场景聚焦于多标签与多类别分类任务,研究者可基于18个病理标签和14个疾病类别,训练和验证深度学习模型对南亚人群常见胃肠疾病的识别能力。此外,该数据集支持视觉问答(VQA)任务,通过14,276组图文对推动多模态模型在医学诊断中的理解与推理研究。
实际应用
在实际临床场景中,SAGE数据集可助力开发针对南亚地区患者的智能内窥镜辅助诊断系统。其多模态标注(包括图像描述与VQA对)支持基层医生快速获取病灶解释与治疗建议,降低对资深胃肠病专家的依赖。同时,数据集可直接用于训练实时内窥镜分析软件,提升医院内镜中心对早期胃癌、溃疡等疾病的筛查效率,尤其适用于尼泊尔等医疗资源有限的地区。
衍生相关工作
围绕SAGE数据集衍生了多项标杆性工作:研究者利用OpenRouter平台对Gemini、Qwen等多模态大模型进行图像描述生成与VQA任务基准测试,并通过GREEN评分量化模型的环境友好度;通过跨数据集迁移实验(如HyperKvasir),系统揭示了欧洲数据训练的模型在南亚人群上的性能衰减。此外,基于该数据集训练的ResNet和DenseNet分类器,为探索南亚人群消化道病变的影像学特征提供了基线参考模型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务