GoodBaiBai88/M3D-VQA
收藏资源简介:
M3D-VQA是一个大规模的3D医学多模态视觉问答数据集,包含510K数据。该数据集通过公开的大型语言模型(LLMs)分析现有诊断报告生成VQA数据,并经过专家和LLMs的验证,确保数据质量。数据集支持开放和封闭式视觉问答任务,数据格式为CSV文件,分为训练集、验证集、测试集和小测试集。图像数据基于M3D-Cap数据集,需要单独下载和配置。
M3D-VQA是一个大规模的3D医学多模态视觉问答数据集,包含510K数据。该数据集通过公开的大型语言模型(LLMs)分析现有诊断报告生成VQA数据,并经过专家和LLMs的验证,确保数据质量。数据集支持开放和封闭式视觉问答任务,数据格式为CSV文件,分为训练集、验证集、测试集和小测试集。图像数据基于M3D-Cap数据集,需要单独下载和配置。
数据集概述
数据集名称
Large-Scale 3D Medical Multi-Modal Dataset - Visual Question Answering Dataset (M3D-VQA)
数据集大小
510K数据
数据集内容
- 图像数据:基于M3D-Cap,需单独下载和配置。
- 问题-答案数据:存储为CSV文件,包括:
- M3D_VQA_train.csv
- M3D_VQA_val.csv
- M3D_VQA_test.csv
- M3D_VQA_test5k.csv(小型测试集)
数据集生成方法
使用公开的大型语言模型(LLMs)分析现有诊断报告,生成VQA数据,并通过预定义规则去除噪声数据。测试集由LLMs和专家审核,通过率为99.4%。
数据集支持的任务
支持3D医学场景下的开放式和封闭式视觉问答等多模态任务。
数据集格式
- 图像数据:需从M3D-Cap下载。
- 问题-答案数据:CSV格式,分为训练、验证、测试和小型测试集。
数据集下载和加载
- 下载方式:可通过Git克隆、SDK加载或手动下载。
- 加载方法:提供Python代码示例,用于构建和加载数据集。
数据集版权和使用
- 版权归属:作者团队所有。
- 使用限制:支持学术研究,商业使用需授权。
引用信息
BibTeX @misc{bai2024m3d, title={M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models}, author={Fan Bai and Yuxin Du and Tiejun Huang and Max Q. -H. Meng and Bo Zhao}, year={2024}, eprint={2404.00578}, archivePrefix={arXiv}, primaryClass={cs.CV} }




