puzzlevqa
收藏资源简介:
PuzzleVQA数据集是一个包含抽象图案的谜题集合,旨在评估大型多模态模型在基本概念(如颜色、数字、大小和形状)上的抽象图案理解能力。数据集包括图像、类别、问题、选项、答案、描述、解释和推导等特征。通过实验发现,即使是GPT-4V也无法解决超过一半的谜题,主要瓶颈在于较弱的视觉感知和归纳推理能力。数据集通过提供逐步的推理解释来指导模型,以诊断推理挑战。此外,数据集还设计了单概念和双概念谜题,以增强多样性。
PuzzleVQA 数据集概述
数据集信息
特征
- image: 图像数据
- category: 字符串类型,类别
- question: 字符串类型,问题
- options: 字符串类型,选项
- answer: 字符串类型,答案
- caption: 字符串类型,描述
- explanation: 字符串类型,解释
- deduction: 字符串类型,推理
数据分割
- train: 训练集,包含2000个样本,数据大小为64254754.0字节
数据大小
- 下载大小: 61704981字节
- 数据集大小: 64254754.0字节
数据集配置
- default: 默认配置,训练数据路径为
data/train-*
数据集描述
关于
PuzzleVQA 是一个基于抽象模式的谜题集合,用于评估大型多模态模型对基本概念(如颜色、数字、大小和形状)的理解能力。通过实验发现,即使是 GPT-4V 也无法解决超过一半的谜题,主要瓶颈在于较弱的视觉感知和归纳推理能力。
示例谜题
数据集包含涉及颜色概念的示例问题,以及 GPT-4V 的错误答案。解决过程分为三个阶段:视觉感知(蓝色)、归纳推理(绿色)和演绎推理(红色)。
谜题组件
每个谜题实例由多模态模板布局和模式定义,并填充适当的对象以展示底层模式。同时,构建了地面真相推理解释,以解释谜题并说明通用解决方案阶段。
谜题分类
数据集包含基于基本概念(如颜色和大小)的抽象谜题分类,设计了单概念和双概念谜题以增强多样性。
评估结果
评估结果显示,GPT-4V 在单概念和双概念谜题中表现突出,尤其在“数字”类别中表现优异。其他模型如 Claude 3 Opus 和 LLaVA-13B 在特定类别中也有良好表现。
引用
如果该工作对您的研究有启发,请引用:
@article{chia2024puzzlevqa, title={PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns}, author={Yew Ken Chia and Vernon Toh Yan Han and Deepanway Ghosal and Lidong Bing and Soujanya Poria}, journal={arXiv preprint arXiv:2403.13315}, year={2024} }




