ChartArena
收藏资源简介:
ChartArena是一个全面的双语基准,用于评估视觉语言模型的图表解析能力,涵盖实际应用中遇到的图表全难度谱系。它包括八个图表家族:数值图表(条形图、折线图、饼图、雷达图、箱线图、组合图)和图表结构(流程图、思维导图),每种图表在三种视觉场景(数字渲染、打印照片和手绘照片)和两种语言(中文和英文)中呈现。
ChartArena is a comprehensive bilingual benchmark for evaluating the chart parsing capabilities of vision-language models, covering the full spectrum of difficulty levels of charts encountered in real-world applications. It includes eight chart families: numerical charts (bar charts, line charts, pie charts, radar charts, box plots, combined charts) and chart structures (flowcharts, mind maps). Each type of chart is presented in three visual scenarios (digital rendering, printed photos, and hand-drawn photos) and two languages (Chinese and English).
数据集概述
ChartArena 是一个全面的双语基准,用于评估视觉语言模型在图表解析方面的能力,涵盖了实践中可能遇到的各种难度的图表。
核心特性
- 图表家族:涵盖 8 种图表类型,分为三大类:
- 数值型图表:条形图、折线图、饼图、雷达图、箱线图、组合图。
- 逻辑图:思维导图。
- 流程图:流程图。
- 视觉场景:每种图表提供 3 种视觉场景:数字渲染、印刷照片、手绘照片。
- 语言:支持中文和英文双语。
- 评估协议:采用格式无关评估,将异构预测统一规范化为三重视图(数值图表)和有向图视图(图表类图表),并使用结构感知指标评分。
基准统计
| 项目 | 详情 |
|---|---|
| 图表家族 | 8 种(条形、折线、饼图、雷达、箱线、组合、流程图、思维导图) |
| 图表类别 | 数值图表、思维导图、流程图 |
| 视觉场景 | 3 种(数字渲染、印刷照片、手绘照片) |
| 语言 | 双语(中文、英文) |
任务定义
根据不同图表类别,定义了默认的提取任务:
| 图表类别 | 示例 | 默认任务 |
|---|---|---|
| 数值图表 | 条形图 / 折线图 / 饼图 / 雷达图 / 箱线图 / 组合图 | SE_MD |
| 思维导图(逻辑图) | 树图 / 层级图 | SE_MD |
| 流程图 | 过程图 / 工作流图 | SE_MERMAID |
支持 11 种提取任务,输出格式包括 Markdown 表格/列表、JSON、CSV、Python 代码、SVG、Mermaid 图等。
评分指标:mAP(map_strict / map_slight / map_high)和 EM(精确匹配)。
排行榜
排行榜评估了 26 个模型,分为三类:通用多模态大语言模型(MLLMs)、文档解析 MLLMs 和专业图表理解模型。结果按图表家族报告 mAP$_{high}$,并分别列出英文(EN)和中文(ZH)分数(每个分数是三种视觉场景的平均值)。
通用 MLLMs 领域,表现最佳的模型是 Gemini 3.1 Pro,它在英文和中文的平均分上均领先(EN: 59.2, ZH: 73.2)。 文档解析 MLLMs 领域,表现最佳的模型是 HunyuanOCR,其在英文和中文的平均分上最高(EN: 41.4, ZH: 52.8)。 专业图表理解模型领域,表现最佳的模型是 RRVF,其在英文和中文的平均分上最高(EN: 36.0, ZH: 51.0)。
代码与数据
- 数据集(jsonl + 图片)已发布,需放置在
data/目录下。 - 使用流程分为三步:推理(Inference)→ 评分(Judging)→ 分析报告(Analysis report)。
- 推理支持
openai_compat(兼容 OpenAI 的 HTTP 服务)和local_vllm(本地进程内加载模型)两种后端。 - 评分步骤纯基于规则,速度快。
- 分析步骤会生成 Excel 报告。
引用
bibtex @article{peng2026chartarena, title = {{ChartArena}: Benchmarking Chart Parsing across Languages, Scenarios, and Formats}, author = {Peng, Shangpin and Li, Gengluo and Wan, Xingyu and Zhang, Chengquan and Feng, Hao and Wu, Binghong and Shen, Huawen and Wang, Weinong and Cai, Ziyi and Tian, Zhuotao and others}, journal = {arXiv preprint arXiv:2606.01348}, year = {2026} }
许可
该基准仅用于研究目的。




