遇见数据集

OCT-Bench

收藏
github2026-07-21 更新2026-07-27 收录
官方服务:

资源简介:

OCT-Bench是一个全面的基准数据集,用于评估多模态大模型在光学相干断层扫描(OCT)理解方面的能力。该数据集涵盖了从低级感知、细粒度解剖识别、临床解释到医学推理的多样化任务,旨在系统评估现有多模态模型在眼科影像中的视觉理解、领域知识和推理能力。

OCT-Bench is a comprehensive benchmark dataset designed for evaluating the capabilities of multimodal large language models in optical coherence tomography (OCT) understanding. This dataset covers diverse tasks ranging from low-level perception, fine-grained anatomical recognition, clinical interpretation to medical reasoning, and aims to systematically evaluate the visual understanding, domain knowledge and reasoning capabilities of existing multimodal models in ophthalmic imaging.

创建时间:
2026-07-17
原始信息汇总

数据集概述:OCT-Bench

OCT-Bench 是一个用于评估多模态大语言模型在光学相干断层扫描(OCT)图像理解能力的综合性基准数据集。

核心目标

  • 系统评估现有眼科影像多模态模型的视觉理解、领域知识和推理能力。

任务覆盖范围

  • 低级感知:基础图像特征识别。
  • 精细解剖识别:眼部解剖结构的精准定位。
  • 临床解读:从OCT图像中提取临床相关信息。
  • 医学推理:基于OCT图像进行诊断或逻辑推断。

数据来源与结构

  • 获取方式:可从 Hugging Face 平台下载:OCT-Bench

  • 文件结构

    OCT-Bench ├── images │ ├── OCT5K │ ├── OCTDL │ └── ... └── VQA ├── T01_VQA.jsonl ├── T02_VQA.jsonl └── ...

    • images/:包含来自不同子集(如OCT5K、OCTDL)的OCT图像。
    • VQA/:包含以JSONL格式存储的视觉问答数据,用于评估模型的多维能力。

相关信息

搜集汇总
数据集介绍
OCT-Bench 数据集图片
构建方式
OCT-Bench数据集旨在系统评估多模态大语言模型在眼科光学相干断层扫描(OCT)图像理解中的表现。其构建基于多源医学影像数据,整合了来自OCT5K、OCTDL等多个公开数据集的图像,并围绕低层视觉感知、精细解剖结构识别、临床解读与医学推理等维度设计了多样化的视觉问答(VQA)任务。数据以标准化格式组织,图像与问答对分别存放于独立文件夹,每个任务对应一个JSONL文件,便于后续调用与扩展。
使用方法
使用OCT-Bench时,研究者需首先从Hugging Face下载数据集,并按指定目录结构存放图像与问答文件。随后配置所需模型环境(如vLLM),通过运行提供的Shell脚本启动推理过程。评估完成后,系统会在结果目录下自动生成summary.json文件,其中包含各任务上的详细指标,用户可直接读取该文件以获取模型的完整性能报告。
背景与挑战
背景概述
光学相干断层扫描(OCT)作为一种高分辨率、非侵入性的眼部影像技术,在眼科疾病诊断与随访中扮演着不可或缺的角色。然而,随着多模态大语言模型在医学影像理解领域的迅猛发展,现有评估体系多聚焦于自然图像或通用医学影像,针对OCT这一专业化影像模态的系统性评测仍属空白。为填补这一缺口,OCT-Bench数据集于2026年由多个顶尖研究机构联合构建,核心团队包括来自浙江大学、阿里巴巴达摩院及穆罕默德·本·扎耶德人工智能大学等机构的学者。该数据集旨在全面评测多模态大模型在OCT影像上的视觉感知、解剖结构辨识、临床解读及医学推理能力,为眼科AI研究提供了标准化、多维度的评测平台,对推动眼科领域智能化诊断的发展具有里程碑意义。
当前挑战
OCT-Bech面临的挑战主要体现在两大维度。在领域问题层面,OCT影像具有丰富的分层结构和细微病理特征,现有通用多模态模型难以精准捕捉视网膜各层边界、囊腔等精细结构,同时在融合图像低层特征与高层临床语义时存在认知鸿沟,导致医学推理能力不足。在构建过程中,数据标注需依赖资深眼科医师对病灶进行像素级分割与多轮审核,耗费大量人力;且OCT影像来源多样,不同设备间的分辨率、噪声水平及成像协议差异显著,增加了数据标准化与跨域泛化的难度。此外,如何设计覆盖从感知到推理全链条的评测任务,并确保任务难度适中、临床相关性高,也是数据集构建中的关键挑战。
常用场景
经典使用场景
OCT-Bench作为一项专为眼科光学相干断层扫描影像理解设计的综合性基准,广泛应用于评估多模态大语言模型在低层级感知、精细解剖结构识别、临床解读及医学推理等维度的能力。研究者借助其多任务视觉问答框架,系统性地检验模型对OCT图像纹理、层次与病变特征的感知精度,并深入考察模型在真实眼底疾病诊断场景中的推理逻辑与知识迁移水平。该基准已成为衡量人工智能在眼科影像分析领域进展的重要标尺。
解决学术问题
在学术研究中,OCT-Bench直面当前多模态大模型在医学影像领域缺乏标准化、多样化评估体系的痛点。它通过构建涵盖从基础感知到高阶推理的体系化任务,解决了以往评价指标单一、任务碎片化的问题,为量化模型在眼科领域的视觉理解与专业知识运用能力提供了可靠范式。其意义在于推动了模型可解释性与泛化性的研究,并激发了关于如何将通用视觉语言能力适配至专科医学影像的深度探讨。
实际应用
OCT-Bench在实际临床辅助诊断系统中具有重要的应用潜力。它可被用于筛选和优化能够自动分析视网膜OCT影像的智能助手,辅助医生快速识别黄斑水肿、视网膜脱落等常见病变,并生成结构化的诊断报告。此外,该基准还能帮助开发适用于远程医疗场景的轻量级模型,促进优质眼科医疗资源向基层和偏远地区下沉,提升眼底疾病筛查的效率和可及性。
数据集最近研究
最新研究方向
随着多模态大语言模型在医学影像分析领域的渗透,OCT-Bench作为专为眼底光学相干断层扫描设计的综合基准,前沿研究聚焦于评估模型在OCT图像上从低层感知、精细解剖结构识别到临床解读与医学推理的全链条能力。该数据集紧密结合人工智能辅助眼科诊断的技术浪潮,特别是面对糖尿病视网膜病变、黄斑变性等全球高发眼病,OCT-Bench通过涵盖视觉理解、领域知识与逻辑推理的多维任务,系统性揭示了现有主流多模态模型在眼部成像中的优势与局限。这一研究方向不仅为眼科精准医疗提供了标准化评估工具,更推动了从通用视觉模型向专业医学推理模型的进化,其影响力延伸至可解释性AI与临床决策支持系统的验证,对促进AI在真实眼科诊疗中的安全落地具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务