遇见数据集

ChartArena

收藏
github2026-06-05 更新2026-06-06 收录
数据链接:
官方服务:

资源简介:

ChartArena是一个全面的双语基准,用于评估视觉语言模型的图表解析能力,涵盖实际应用中遇到的图表全难度谱系。它包括八个图表家族:数值图表(条形图、折线图、饼图、雷达图、箱线图、组合图)和图表结构(流程图、思维导图),每种图表在三种视觉场景(数字渲染、打印照片和手绘照片)和两种语言(中文和英文)中呈现。

ChartArena is a comprehensive bilingual benchmark for evaluating the chart parsing capabilities of vision-language models, covering the full spectrum of difficulty levels of charts encountered in real-world applications. It includes eight chart families: numerical charts (bar charts, line charts, pie charts, radar charts, box plots, combined charts) and chart structures (flowcharts, mind maps). Each type of chart is presented in three visual scenarios (digital rendering, printed photos, and hand-drawn photos) and two languages (Chinese and English).

创建时间:
2026-05-30
原始信息汇总

数据集概述

ChartArena 是一个全面的双语基准,用于评估视觉语言模型在图表解析方面的能力,涵盖了实践中可能遇到的各种难度的图表。

核心特性

  • 图表家族:涵盖 8 种图表类型,分为三大类:
    • 数值型图表:条形图、折线图、饼图、雷达图、箱线图、组合图。
    • 逻辑图:思维导图。
    • 流程图:流程图。
  • 视觉场景:每种图表提供 3 种视觉场景:数字渲染、印刷照片、手绘照片。
  • 语言:支持中文和英文双语。
  • 评估协议:采用格式无关评估,将异构预测统一规范化为三重视图(数值图表)和有向图视图(图表类图表),并使用结构感知指标评分。

基准统计

项目 详情
图表家族 8 种(条形、折线、饼图、雷达、箱线、组合、流程图、思维导图)
图表类别 数值图表、思维导图、流程图
视觉场景 3 种(数字渲染、印刷照片、手绘照片)
语言 双语(中文、英文)

任务定义

根据不同图表类别,定义了默认的提取任务:

图表类别 示例 默认任务
数值图表 条形图 / 折线图 / 饼图 / 雷达图 / 箱线图 / 组合图 SE_MD
思维导图(逻辑图) 树图 / 层级图 SE_MD
流程图 过程图 / 工作流图 SE_MERMAID

支持 11 种提取任务,输出格式包括 Markdown 表格/列表、JSON、CSV、Python 代码、SVG、Mermaid 图等。

评分指标:mAP(map_strict / map_slight / map_high)和 EM(精确匹配)。

排行榜

排行榜评估了 26 个模型,分为三类:通用多模态大语言模型(MLLMs)、文档解析 MLLMs 和专业图表理解模型。结果按图表家族报告 mAP$_{high}$,并分别列出英文(EN)和中文(ZH)分数(每个分数是三种视觉场景的平均值)。

通用 MLLMs 领域,表现最佳的模型是 Gemini 3.1 Pro,它在英文和中文的平均分上均领先(EN: 59.2, ZH: 73.2)。 文档解析 MLLMs 领域,表现最佳的模型是 HunyuanOCR,其在英文和中文的平均分上最高(EN: 41.4, ZH: 52.8)。 专业图表理解模型领域,表现最佳的模型是 RRVF,其在英文和中文的平均分上最高(EN: 36.0, ZH: 51.0)。

代码与数据

  • 数据集(jsonl + 图片)已发布,需放置在 data/ 目录下。
  • 使用流程分为三步:推理(Inference)→ 评分(Judging)→ 分析报告(Analysis report)。
  • 推理支持 openai_compat(兼容 OpenAI 的 HTTP 服务)和 local_vllm(本地进程内加载模型)两种后端。
  • 评分步骤纯基于规则,速度快。
  • 分析步骤会生成 Excel 报告。

引用

bibtex @article{peng2026chartarena, title = {{ChartArena}: Benchmarking Chart Parsing across Languages, Scenarios, and Formats}, author = {Peng, Shangpin and Li, Gengluo and Wan, Xingyu and Zhang, Chengquan and Feng, Hao and Wu, Binghong and Shen, Huawen and Wang, Weinong and Cai, Ziyi and Tian, Zhuotao and others}, journal = {arXiv preprint arXiv:2606.01348}, year = {2026} }

许可

该基准仅用于研究目的

搜集汇总
数据集介绍
ChartArena 数据集图片
构建方式
图表解析作为视觉语言模型应用的重要方向,长期以来缺乏覆盖全面、评估公允的基准数据集。针对这一空白,ChartArena应运而生,它是一个专为评估视觉语言模型图表解析能力而设计的综合性双语基准。该数据集精心覆盖了八大图表族系,涵盖数值型图表与图解型图表两大范畴,每种图表均呈现于电子渲染、打印照片和手绘照片三种视觉场景中,并同时包含中文与英文两种语言版本。为了确保不同模型输出格式之间的公平比较,ChartArena采用了与格式无关的评估协议,将异构的预测结果规范化到两个规范的语义空间:针对数值型图表的三元组视图以及针对图解型图表的有向图视图,并运用结构感知指标进行评分。
特点
ChartArena数据集在图表解析领域展现出多维度的显著特色。首先,其覆盖面极为广泛,集成了条形图、折线图、饼图、雷达图、箱线图、组合图、流程图以及思维导图等八类图表,横跨数据可视化与逻辑图解两大形态。其次,数据集融入了场景多样性与双语属性,在电子、打印与手绘三种现实视觉条件下,以中英双语呈现,真正还原了实际应用中的复杂多样性。尤为突出的是其开创性的评估方法,通过格式无关的正则化策略,将不同模型输出的异质格式统一映射至抽象语义空间,使得基于图结构的高阶评估(mAP与EM)得以客观执行,这打破了以往指标在模型间不可比的瓶颈。
使用方法
ChartArena的使用遵循一套清晰高效的流水线流程。研究者可从HuggingFace或ModelScope平台下载包含图片与标注的压缩包,解压至本地data目录。随后借助infer.py脚本驱动推理过程,该脚本支持两种调用后端:一是兼容OpenAI API的HTTP服务,可对接云服务端或本地部署的vllm、sglang等推理引擎;二是直接加载模型断点进行进程内推理的local_vllm后端。推理结果自动保存至infer_outputs目录,接下来调用judge.py执行基于规则的纯文本评分,最终使用analyze.py对评分结果进行汇总分析,生成包含各任务、图表类型及语言维度详细拆解的Excel分析报告,完整实现从模型推理到结果洞察的全链路闭环。
背景与挑战
背景概述
图表解析任务作为视觉语言模型(VLM)能力评估的重要维度,长期受限于评测基准的单一化与碎片化。现有基准多聚焦于数值型图表的数字化渲染场景,难以覆盖实际应用中图表形态的多样性。针对这一困境,上海交通大学研究团队联合相关机构于2026年发布ChartArena双语基准,该系统性地囊括了八类图表家族(含数值型与示意图型)、三种视觉场景(数字渲染、印刷照片、手绘照片)及中英双语维度。通过设计格式无关的评估协议,将异构模型输出标准化为三元组与有向图两种语义空间,该基准为全面衡量VLM图表解析能力提供了关键参照,相关研究成果发表于arXiv,对推动智能文档理解领域的发展具有里程碑意义。
当前挑战
ChartArena所解决的领域核心挑战在于现有评测体系无法适应真实世界中图表呈现形态的复杂分布——数值型图表与示意图型图表的结构差异显著,手绘或印刷场景引入的视觉噪声更对模型鲁棒性构成严峻考验。构建过程中面临的核心困难包括:1)构建涵盖八类图表家族、三种视觉场景与双语言的多维标注体系,需确保标注粒度的统一性与跨模态一致性;2)设计能够兼容多种模型输出格式(如Markdown、JSON、Mermaid等)的评估协议,避免因格式差异导致的性能误判;3)针对示意图型图表(如流程图、思维导图)的结构化信息提取,需定义可量化的图结构匹配度量标准,弥补传统文本评估指标在拓扑关系评价上的不足。
常用场景
经典使用场景
ChartArena作为一项全面的双语基准,旨在系统性评估视觉语言模型在图表解析任务上的表现。其经典使用场景涵盖八种图表家族(包括柱状图、折线图、饼图、雷达图、箱线图、组合图、流程图与思维导图),横跨数字渲染、印刷照片与手绘照片三种视觉形态,并兼顾中英双语环境。研究者可通过调用该基准库,在统一框架下对通用多模态大模型、文档解析专用模型及专家级图表理解模型进行公平比较。
解决学术问题
该数据集有效解决了当前图表解析研究中缺乏统一评估标准与跨场景泛化能力验证的困境。通过提出格式无关的评估协议,将异构模型输出归一化为三元组视图或有向图视图,并采用结构感知的mAP指标,ChartArena填补了从数值图表到逻辑图示全谱系解析能力的评测空白。这一突破为衡量模型在不同语言、不同制图质量下的鲁棒性提供了坚实依据,推动了图表理解领域从单一性能竞赛向实际场景适应性研究的范式转变。
衍生相关工作
ChartArena的发布催生了一系列衍生工作,包括面向图表解析的提示优化技术(如多任务上下文增强)、轻量级图表专用模型架构设计(如RRVF与MSRL)以及跨模态对齐方法的改进。其数据集本身也被用于训练新一代图表理解专家模型,同时刺激了针对手写与印刷混合场景的图像归一化预处理算法的研发。此外,基于该基准的排行榜竞争直接推动了模型在组合图与雷达图等高难度族类上的性能跃升。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务