Med-MAT
收藏资源简介:
Med-MAT是一个包含106个开源医学数据集的视觉问答(VQA)数据集,旨在推动医学多模态大语言模型(MLLMs)的泛化实验和训练。数据集通过将图像-标签对转换为VQA格式,展示了组合泛化(CG)是MLLMs理解未见图像的关键机制。数据集包括106个医学数据集的问答对、53个按模态、解剖区域和任务(MAT)分类的子集的问答对,以及部分数据集的图像下载链接。
Med-MAT is a visual question answering (VQA) dataset consisting of 106 open-source medical datasets, designed to advance generalization experiments and training for medical multimodal large language models (MLLMs). By converting image-label pairs into the VQA format, this dataset demonstrates that compositional generalization (CG) is a critical mechanism enabling MLLMs to comprehend unseen images. It encompasses question-answer pairs from all 106 medical datasets, question-answer pairs from 53 subsets categorized by modality, anatomical region and task (MAT), as well as image download links for a portion of the datasets.




