MedFrameQA
收藏资源简介:
MedFrameQA是一个多图像医学视觉问答基准测试,专注于临床推理,强调诊断复杂性、专家级知识和明确的推理链。它通过自动构建来自医学教育视频的多图像、临床基础的VQA问题,提供了一个全面的评估平台。
MedFrameQA is a multi-image medical visual question answering benchmark that focuses on clinical reasoning, emphasizing diagnostic complexity, expert-level knowledge, and clear reasoning chains. It provides a comprehensive evaluation platform by automatically constructing multi-image VQA questions based on clinical educational videos.
MedFrameQA: 多图像医学视觉问答基准数据集
数据集概述
- 名称: MedFrameQA
- 类型: 多图像医学视觉问答(VQA)基准
- 特点: 强调临床推理、诊断复杂性和专家级知识
- 创新点: 首个专注于多图像临床推理的医学VQA基准
数据集构建
- 来源: 3,420个医学教育视频
- 构建流程:
- 医学视频收集
- 帧-字幕配对
- 多帧合并
- 问答生成
数据统计
- 分布特征:
- 人体系统分布
- 器官分布
- 影像模态分布
- 每问题帧数分布
数据集获取
评估结果
- 模型表现: 当前最先进多模态大语言模型准确率普遍低于50%
- 评估维度:
- 不同人体系统准确率
- 不同模态准确率
- 不同帧数准确率
快速开始
- 安装指南: 提供完整的conda环境配置和依赖安装说明
- 数据处理流程: 包含从视频下载到问答生成的完整代码指令
- 评估流程: 提供在多模态大语言模型上的评估代码
引用信息
bibtex @misc{yu2025medframeqamultiimagemedicalvqa, title={MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning}, author={Suhao Yu and Haojin Wang and Juncheng Wu and Cihang Xie and Yuyin Zhou}, year={2025}, eprint={2505.16964}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2505.16964}, }
致谢
- 感谢微软加速基础模型研究计划提供的计算资源支持




