遇见数据集

ChartBench

收藏
arXiv2024-01-29 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

ChartBench是一个全面的图表基准,专门设计用于通过复杂的视觉推理评估多模态大型语言模型的图表理解和数据可靠性。它包含42个类别,2.1K个图表和16.8K个问答对,不直接使用数据点标注图表或元数据提示,而是通过图表元素如颜色、图例或坐标系统来迫使模型像人类一样理解数据。

ChartBench is a comprehensive chart benchmark specifically developed to evaluate the chart comprehension and data reliability of multimodal large language models via complex visual reasoning. It contains 42 categories, 2.1K charts and 16.8K question-answer pairs. Instead of directly applying data point annotations to charts or providing metadata prompts, this benchmark utilizes chart elements including colors, legends, or coordinate systems to enable models to understand data in a human-like fashion.

创建时间:
2023-12-26
搜集汇总
数据集介绍
ChartBench 数据集图片
构建方式
ChartBench的构建始于从Kaggle收集适用于科学研究的多样化主题与数据,并经过严格的匿名化处理以保障隐私。为模拟真实场景,研究团队借助在线科学绘图工具与Matplotlib生成图表,同时利用ChatGPT创造虚拟但逼真的主题与数据,以扩充图表类型的丰富性。所有生成的图表均经过专家审查,剔除标签遮挡等缺陷样本,最终形成包含42个子类别、2.1K张图表及16.8K个问答对的数据集。其核心设计在于摒弃直接的数据点标注或元数据提示,迫使多模态大语言模型依赖颜色、图例或坐标系等固有视觉元素进行数值推理。
特点
ChartBench的显著特点在于其广泛的图表类型覆盖与对视觉逻辑推理的强调。数据集涵盖9大类别与42个子类别,远超以往基准测试仅包含线图、柱状图和饼图的局限,其中新增类型占比达45.2%。尤为重要的是,76.2%的图表为无标注形式,要求模型通过图例、坐标对应关系等视觉线索进行推理,而非依赖OCR直接提取答案。此外,该基准引入改进的评估指标Acc+,通过从正反两个角度对同一断言进行判断,有效降低了随机猜测的影响,提供了更精确的模型性能度量。
使用方法
使用ChartBench时,研究者可采用零样本评估范式,对多模态大语言模型进行四项核心任务的测试:图表类型识别、数值提取、数值比较与全局概念理解。模型需以‘是/否’形式回答基于图表视觉逻辑的断言,例如通过颜色辨认类别或利用坐标系统确定数值。评估时,建议采用多种提示模板并选取最佳表现结果,同时利用Acc+指标综合正反判断的一致性以衡量真实理解能力。研究还提供了ChartCoT提示策略,通过分解推理步骤引导模型模拟人类视觉推理过程,从而提升复杂图表场景下的表现。
背景与挑战
背景概述
在人工智能领域,多模态大语言模型(MLLMs)在图像理解与生成上展现出卓越能力,然而现有基准测试多局限于有限图表类型,且依赖数据点标注或元数据提示,难以真实反映模型在现实场景中的图表理解能力。为填补这一空白,由IDEA研究院、清华大学及香港科技大学(广州)的研究团队于2023年共同构建了ChartBench数据集。该数据集聚焦于复杂视觉推理,涵盖42个子类别、2.1K张图表及16.8K个问答对,旨在通过色彩、图例、坐标系等内在视觉元素,迫使MLLMs像人类一样进行价值推断,而非依赖简单的OCR或表格数据。ChartBench的提出不仅显著扩展了图表评估的多样性,更通过创新的Acc+评估指标,为多模态模型的图表理解能力提供了更为严谨的度量标准,对推动该领域的研究具有里程碑式的影响力。
当前挑战
ChartBench面临的核心挑战在于,现有MLLMs在图表理解上存在显著局限性。首先,所解决的领域问题要求模型具备复杂视觉逻辑推理能力,而非简单的模式识别或OCR;然而多数模型在面对未标注图表时,无法有效利用图例、坐标轴等视觉线索进行值提取与比较,导致在值提取(VE)任务上表现极差,部分模型Acc+接近0%。其次,构建过程中挑战重重,包括收集涵盖9大类别、42子类别的多样化图表源,确保数据隐私与真实感;同时需设计无标注图表占76.2%的评估体系,避免模型依赖文本提示;此外,还需提出Acc+指标以消除随机猜测影响,并开发ChartCoT策略引导模型进行类人推理,这些均对数据集的构建与评估方法提出了极高要求。
常用场景
经典使用场景
在图表理解与视觉推理的交叉领域中,ChartBench作为一项综合性基准测试,广泛用于评估多模态大语言模型(MLLMs)对复杂图表的认知能力。其经典使用场景聚焦于模型在无标注图表上的视觉逻辑推理,涵盖图表类型识别、数值提取、数值比较与全局概念理解四大任务。通过要求模型仅依赖颜色、图例或坐标系等内在视觉元素进行推理,而非借助元数据或OCR辅助,ChartBench模拟了人类解读图表的自然过程,为衡量MLLMs在真实世界图表场景下的感知与认知水平提供了严苛且可靠的测试平台。
实际应用
在实际应用中,ChartBench为多模态模型的图表解读能力提供了关键验证场景,尤其适用于金融数据分析、科学文献自动解读、商业智能报告生成等领域。例如,在自动化财务报告中,模型需从无标注的K线图或组合图中提取趋势与极值;在科研论文评审中,模型需精准理解雷达图或箱线图所传达的多维数据分布。ChartBench通过模拟这类高难度视觉推理任务,帮助开发者识别模型在数值提取与全局认知上的薄弱环节,从而指导模型优化,提升其在真实工业场景中的可靠性与实用性。
衍生相关工作
ChartBench的提出催生了多项具有影响力的衍生工作,其中最典型的是ChartCoT(Chain-of-Thought提示策略)。ChartCoT通过设计一系列引导性问题,将复杂的图表推理任务分解为人类式的逐步视觉思考过程,显著提升了MLLMs在无标注图表上的表现。此外,ChartBench的实验结果促使研究者关注图表数据在预训练阶段的融入,例如Qwen-VL-Chat与LLaVA-v1.5通过引入图表相关指令微调数据,在基准上取得了领先性能。这些工作共同推动了多模态模型从依赖OCR向真正视觉逻辑推理的范式转变,为后续研究奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务