遇见数据集

ChartArena

收藏
arXiv2026-06-01 更新2026-06-03 收录
数据链接:
官方服务:

资源简介:

ChartArena是由腾讯、中国科学院等机构联合构建的综合性双语图表解析基准数据集,旨在系统评估多模态大语言模型在多样化场景下的图表理解能力。该数据集涵盖2,400个样本,覆盖柱状图、折线图、饼图、雷达图等八类图表家族,并创新性地整合了数字渲染、印刷照片和手绘照片三种视觉场景,同时支持中英双语内容,数据来源包括公开文档库、网络资源和内部收集的多领域素材。数据集通过人机协同标注流程构建,采用多阶段人工验证确保标注的结构一致性与可靠性,其核心价值在于解决图表解析领域因输出格式碎片化、评估标准不统一而导致的模型能力评估难题,为推进通用图表解析技术的发展提供了标准化测试平台。

ChartArena is a comprehensive bilingual chart parsing benchmark dataset jointly constructed by Tencent, the Chinese Academy of Sciences and other institutions, aiming to systematically evaluate the chart understanding capabilities of multimodal large language models in diverse scenarios. This dataset contains 2,400 samples, covering eight chart families such as bar charts, line charts, pie charts and radar charts, and innovatively integrates three visual scenarios: digitally rendered images, printed photos and hand-drawn photos. It supports both Chinese and English content, with data sources including public document repositories, online resources and multi-domain materials collected internally. The dataset is built via a human-machine collaborative annotation workflow, and multi-stage manual verification is adopted to ensure the structural consistency and reliability of annotations. Its core value is to address the challenge of evaluating model capabilities in the chart parsing field caused by fragmented output formats and inconsistent evaluation criteria, providing a standardized test platform for advancing the development of general-purpose chart parsing technologies.

创建时间:
2026-06-01
原始信息汇总

ChartArena 数据集详情

数据集简介

ChartArena 是一个全面的双语基准测试,用于评估视觉语言模型在图表解析方面的能力。该基准涵盖了实践中遇到的从简单到复杂的完整难度谱系,包含八大图表家族:数值型图表(柱状图、折线图、饼图、雷达图、箱线图、组合图)和图示型结构(流程图、思维导图),每种图表均呈现于三种视觉场景(数字渲染图、印刷照片、手绘照片)和两种语言(中文和英文)。

基准统计信息

项目 详情
图表家族 8 种(柱状图、折线图、饼图、雷达图、箱线图、组合图、流程图、思维导图)
图表类别 数值图表、思维导图、流程图
视觉场景 3 种(数字渲染、印刷照片、手绘照片)
语言 双语(中文和英文)

任务定义

ChartArena 将图表分为三个类别,每个类别有默认的提取任务:

图表类别 示例 默认任务
数值图表 柱状图/折线图/饼图/雷达图/箱线图/组合图等 SE_MD
思维导图(逻辑图) 树状图/层级图 SE_MD
流程图 流程/工作流图 SE_MERMAID

十一种提取任务

任务 输出格式 描述
SE_MD Markdown 表格/列表 数值图表→Markdown表格;思维导图→Markdown嵌套列表
SE_JSON JSON 包含 titlevalues 的结构化 JSON
SE_CSV CSV 逗号分隔值
SE_CODE Python (matplotlib) 将图表重现为可执行的 Python 代码
SE_SVG SVG 将图表重现为 SVG 标记
SE_MERMAID Mermaid 流程图表示为 Mermaid 图语法
SE_GRAPHVIZ Graphviz DOT 流程图表示为 DOT 语言
SE_PLANTUML PlantUML 流程图表示为 PlantUML 语法
SE_DIAGRAMS diagrams.net XML 流程图表示为 draw.io XML
SE_D2 D2 流程图表示为 D2 图语言
SE_CYTOSCAPE Cytoscape JSON 流程图表示为 Cytoscape.js JSON

评分指标

  • mAP(map_strict / map_slight / map_high)
  • EM(精确匹配)

评测排行榜

ChartArena 评估了涵盖三类模型的 26 个模型:通用多模态大语言模型、文档解析多模态大语言模型和专家图表理解模型。结果以mAP_high报告每个图表家族的表现,其中英文(EN)和中文(ZH)分数分别对三种视觉场景取平均。

通用多模态大语言模型排行榜(部分)

模型 日期 柱状图(EN) 柱状图(ZH) 折线图(EN) 折线图(ZH) 饼图(EN) 饼图(ZH) 雷达图(EN) 雷达图(ZH) 箱线图(EN) 箱线图(ZH) 组合图(EN) 组合图(ZH) 流程图(EN) 流程图(ZH) 思维导图(EN) 思维导图(ZH) 平均(EN) 平均(ZH)
Gemini 3.1 Pro 2026.02 57.9 78.7 67.0 85.3 92.5 95.1 31.8 62.7 32.5 45.2 39.7 70.3 65.6 63.1 86.8 85.2 59.2 73.2
Seed-2.0 Pro (non-thinking) 2026.02 40.3 73.3 56.5 80.7 91.5 90.5 21.3 54.7 44.5 55.2 32.4 62.2 62.6 61.3 83.1 85.8 54.0 70.5
Kimi K2.5 (non-thinking) 2026.02 45.2 70.3 60.9 79.8 87.2 86.7 30.2 59.7 40.6 47.6 33.6 63.6 59.9 57.9 80.8 79.4 54.8 68.1
Qwen3.5-35B-A3B 2026.02 48.0 68.1 60.4 77.6 89.7 88.7 25.2 57.9 50.1 50.6 35.2 62.1 62.5 56.5 77.1 75.6 56.0 67.1

文档解析多模态大语言模型排行榜(部分)

模型 日期 平均(EN) 平均(ZH)
HunyuanOCR (1B) 2025.11 41.4 52.8
dots.mocr (3B) 2025.07 33.1 40.7
PaddleOCR-VL (1B) 2025.10 23.9 35.8

专家图表理解模型排行榜(部分)

模型 日期 平均(EN) 平均(ZH)
RRVF (7B) 2025.07 36.0 51.0
MSRL (7B) 2025.08 27.1 34.3
ChartCoder (7B) 2025.01 12.6 9.9

数据获取与使用

数据集以单个存档文件发布(包含 jsonl 和图像),文件需放置于 data/ 目录下。数据集的 HuggingFace 页面地址为:https://huggingface.co/datasets/psp-dada/ChartArena

数据格式示例

每条 jsonl 数据格式如下: json { "img_path": "images/xxx.png", "chart_type": "柱状图", "img_type": "电子印刷", "lang_type": "中文", "anno": "..." }

许可协议

本基准测试仅面向研究目的发布。

搜集汇总
数据集介绍
ChartArena 数据集图片
构建方式
图表作为传递定量与关系信息的核心媒介,其解析能力的系统评估长期面临挑战。为弥合现有基准在图表类型、视觉场景与输出格式上的碎片化鸿沟,我们构建了ChartArena基准数据集。该数据集通过人机协作的标注流水线构建,首先利用多模态大语言模型生成初步的结构化标注草稿,随后由人类标注员历经多轮迭代修正,确保图表构成、节点与边的拓扑关系、轴语义及标签数值的精确性。针对数值型与图表型图表,分别采用Markdown表格与Mermaid图描述作为标准标注基底,并针对手绘或低分辨率照片中的模糊数值实施多人独立校验与仲裁,最终覆盖八类图表家族、三种视觉场景及中英双语,总计2400张图表。
特点
ChartArena数据集具备三大核心特质。其一,覆盖维度空前广泛,横跨条形图、折线图、雷达图等六类数值型图表与流程图、思维导图两类图表型图表,并纳入数字渲染、印刷照片与手绘照片三种真实视觉场景,以及中英双语内容。其二,构建方式强调真实世界的挑战性,刻意过采样印刷与手绘场景,避免评估被洁净的数字渲染样本主导,使基准真实反映部署环境中的视觉噪声与分布偏移。其三,标注质量通过多阶段人机协作与交叉校验得到保障,尤其针对图表型图表,标注后需通过可视化工具渲染验证节点集、边连通性及逻辑流的完整性,确保拓扑结构的高精度。
使用方法
使用ChartArena时,研究者以标准提示词驱动模型对图表图像进行解析,模型可自由输出Markdown、CSV、JSON、Python代码或Mermaid等异构格式。为消除格式差异对公平比较的阻碍,我们设计了格式无关的评估协议:首先通过确定性适配器将所有预测结果归一化为两种规范语义空间——数值型图表映射为(实体、表头、数值)三元组集合,图表型图表映射为有向图。随后采用结构感知的评分机制,对三元组计算容错交并比,对有向图通过匈牙利算法匹配节点与边,并综合三个容错等级(严格、轻微、高宽容)报告精确匹配率与平均精度均值。该协议支持扩展至更多输出格式,确保分数差异真实反映语义理解水平而非表面句法差异。
背景与挑战
背景概述
图表作为传达定量与关系信息的核心视觉媒介,在科学、商业及教育领域扮演着不可或缺的角色。然而,现有图表解析基准普遍局限于少数数值图表类型,忽视了流程图和思维导图等图式化结构,且模型输出格式各异,评测标准碎片化。为填补这一空白,腾讯、中国科学院信息工程研究所及南开大学等机构的研究团队于2026年5月联合发布了ChartArena基准。该基准首次统一覆盖八大图表家族(涵盖数值图表与图式化图表),横跨数字渲染、打印照片和手绘照片三种现实视觉场景,并包含中英双语内容,为全面评估图表解析模型的能力提供了标准化平台。ChartArena的提出显著推动了该领域从窄域评测迈向通用、公平的评估新范式。
当前挑战
当前图表解析领域面临多维挑战。首先,现有基准仅覆盖少数数值图表类型,对流程图、思维导图等图式化结构的系统性评估缺失,导致模型在图拓扑结构理解上存在根本性能力盲区。其次,模型输出格式高度异构(如Markdown、JSON、CSV、Python代码等),缺乏统一的语义归一化协议,致使跨模型直接比较几乎不可能。再者,现实场景中的视觉扰动(如打印照片的模糊与透视畸变、手绘照片的不规则笔触与墨迹)严重挑战模型的鲁棒性。构建过程中,面对多样图表类型与恶劣视觉条件,人工标注准确率难以保证,需要精巧的人机协作注释流程与多轮验证机制,以确保结构一致性与语义可靠性。雷达图在数值图表中始终最难处理,而图式化图表在真实视觉条件下的性能衰减尤为显著。
常用场景
经典使用场景
在图表解析这一前沿研究领域,ChartArena作为首个统一覆盖数值型图表与示意图表的双语基准,被广泛用于评测多模态大语言模型在多种视觉场景下的结构化信息抽取能力。研究者利用该数据集对模型在柱状图、折线图、饼图、雷达图、箱线图、组合图、流程图及思维导图等八类图表上的解析性能进行系统性评估,涵盖了数字渲染、印刷照片和手绘照片三种真实视觉条件,从而全面衡量模型在图元识别、拓扑结构重建与语义理解方面的综合实力。
解决学术问题
ChartArena从根本上解决了现有图表解析基准覆盖范围狭隘、评估标准碎片化的学术困境。传统基准局限于少数数值图表类型且依赖洁净的数字渲染图像,无法评估模型对示意图表(如流程图、思维导图)的拓扑结构理解能力,亦忽视了实际应用中的打印照片与手绘照片等视觉扰动场景。该数据集通过引入格式无关的规范化评估协议,将异构模型输出映射至统一语义空间,首次实现了跨范式、跨格式的公平比较,揭示了当前模型在雷达图、手绘场景等难点上的显著能力鸿沟,为领域提供了清晰的发展方向。
衍生相关工作
ChartArena的诞生催生了多项具有影响力的后续工作。基于其统一的评估框架,研究者开发了格式无关的规范化协议,推动了一系列跨模型、跨格式的图表解析对比研究。该数据集揭示的能力鸿沟促使学界重新审视雷达图与手绘场景的建模挑战,进而激发了针对性增强的图表解析模型设计,如引入拓扑感知注意力机制和图结构损失函数。此外,ChartArena的双语特性与多场景覆盖为跨语言图表理解和鲁棒图表解析提供了标准化测试床,引领了更多关于示意图表结构化抽取与真实世界视觉鲁棒性的深入探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务