SciGraphQA
收藏资源简介:
SciGraphQA是一个大规模的合成多轮问答数据集,专注于学术图表。该数据集由295,000个样本组成,是ChartVQA数据集的13倍大,是目前最大的开源图表视觉问答数据集。数据集的创建过程涉及从290,000篇计算机科学或机器学习ArXiv论文中提取图表,并使用Palm-2生成关于这些图表的多轮问答对话。SciGraphQA的应用领域包括为多模态大型语言模型(MLLMs)建立科学问答基准,旨在通过模拟真实学术交流场景,提高模型对复杂科学图表的理解和解释能力。
SciGraphQA is a large-scale synthetic multi-turn question answering dataset focused on academic charts. It consists of 295,000 samples, 13 times the size of the ChartVQA dataset, making it the largest open-source chart-based visual question answering dataset to date. The dataset was constructed by extracting charts from 290,000 ArXiv papers in the fields of computer science or machine learning, and generating multi-turn question answering dialogues about these charts using PaLM-2. The application scenarios of SciGraphQA include establishing scientific question answering benchmarks for multimodal large language models (MLLMs), aiming to enhance the models' capability to understand and interpret complex scientific charts by simulating real academic communication scenarios.
SciGraphQA 数据集概述
数据集简介
SciGraphQA 是一个与学术图表相关的合成多轮问答数据集,规模是之前最大的图表视觉问答数据集 ChartVQA 的 13 倍。该数据集包含 295K 个样本,每个样本平均有 2.23 个问答轮次。数据集的构建基于 290,000 篇 2010 年至 2020 年间发表的计算机科学或机器学习领域的 ArXiv 论文,使用 Palm-2 生成问答对话。
数据集规模
- 训练集: 295K 样本,771 MB(不包括图像)
- 测试集: 3K 样本,8.4 MB(不包括图像)
- 增强子集: 30K 样本,8.4 MB(不包括图像)
数据集特点
- 问答生成: 使用 Palm-2 生成开放词汇的多轮问答对话。
- 质量评估: 使用 GPT-4 评估问答轮次的匹配质量,平均评分 8.7/10。
- 模型评估: 评估了多种流行的多模态语言模型(MLLM),如 LLaVa、mPLUGowl、BLIP-2 和 openFlamingo,其中 LLaVA-13B 表现最佳,CIDEr 分数为 0.08。
数据集生成过程
- 文本上下文: 提供论文标题、摘要、提及图表的段落以及图表本身的丰富文本上下文。
- 问答轮次: 平均每个图表有 2.23 个问答轮次。
- 质量验证: 使用 GPT-4 评估问答轮次的匹配质量。
数据集比较
| 数据集 | 图表数量 | 数据/图表生成过程 | 问答对数量 | 问题生成 | 答案类型 | 图表类型数量 |
|---|---|---|---|---|---|---|
| FigureQA | 180K | 合成数据和图表 | 2.3M | 15 模板 | 固定词汇 | 4 |
| DVQA | 300K | 合成数据和合成图表 | 3.4M | 26 模板 | 固定词汇 | 1 |
| PlotQA | 224K | 真实数据和合成图表 | 28M | 76 模板 | 混合固定和开放词汇答案 | 3 |
| ChartQA | 21.9K | 真实图表 | 32.7K | 人工/机器生成 | 开放词汇 | 无限制 |
| SciGraphQA | 295K | 真实学术图表 | 657K | 机器生成 | 开放词汇 | 无限制 |
数据集应用
- 模型评估: 评估了多种模型的零样本能力,包括 LLaVa、mPLUGowl、BLIP-2 和 openFlamingo。
- 模型增强: 通过包含从图表中提取的数据表,增强了 LLaVA 的零样本 CIDEr 分数至 0.15。
- 微调验证: 使用数据集微调 LLaVa,CIDEr 分数达到 0.26。
数据集下载




