AlgoPuzzleVQA
收藏资源简介:
This repository is maintained to release dataset and models for multimodal puzzle reasoning.
本仓库旨在发布面向多模态谜题推理(multimodal puzzle reasoning)的数据集与模型。
数据集概述
PuzzleVQA
- 描述: PuzzleVQA 是一个专注于抽象视觉模式的数据集,旨在挑战大型多模态语言模型(MLLMs)的基本推理能力。
- 内容: 包含基于颜色、数字、大小和形状等基本概念的抽象图案。
- 评估: 通过实验发现,即使是先进的模型如GPT-4V,也难以解决超过一半的谜题,主要瓶颈在于视觉感知和归纳推理能力。
- 可用性: 数据集可在GitHub和Huggingface获取。
AlgoPuzzleVQA
- 描述: AlgoPuzzleVQA 是一个更复杂的数据集,包含需要算法解决方案的高级谜题。
- 内容: 涵盖多种数学和算法主题,如布尔逻辑、组合学、图论等。
- 评估: 数据显示,大型语言模型在解决这些谜题时表现有限,接近随机选择。
- 可用性: 数据集可在GitHub和Huggingface获取。
数据集详细信息
PuzzleVQA
- 组件: 每个谜题实例由多模态模板布局和图案定义,填充适当的对象以展示底层图案,并提供地面真相推理解释以解释谜题和解释通用解决方案阶段。
- 分类: 谜题基于基本概念如颜色和大小,设计有单概念和双概念谜题以增强多样性。
- 评估结果: 在单概念和双概念谜题上的评估结果显示,GPT-4V在抽象图案推理上表现最佳,尤其是在“数字”类别中。
AlgoPuzzleVQA
- 视觉特征: 谜题的视觉上下文包括颜色、位置、形状/大小和文本。
- 算法特征: 解决谜题所需的算法概念包括算术、布尔逻辑、组合学、图、优化、搜索和集合。
- 数据集: 包含18种不同谜题的1800个实例,每个实例类似于谜题的不同测试案例。
引用信息
PuzzleVQA
@misc{chia2024puzzlevqa, title={PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns}, author={Yew Ken Chia and Vernon Toh Yan Han and Deepanway Ghosal and Lidong Bing and Soujanya Poria}, year={2024}, eprint={2403.13315}, archivePrefix={arXiv}, primaryClass={cs.CV} }
AlgoPuzzleVQA
bibtex @article{ghosal2024algopuzzlevqa, title={Are Language Models Puzzle Prodigies? Algorithmic Puzzles Unveil Serious Challenges in Multimodal Reasoning}, author={Ghosal, Deepanway and Han, Vernon Toh Yan Yan and Chia, Yew Ken and Poria, Soujanya}, journal={arXiv preprint arXiv:2403.03864}, year={2024} }




