遇见数据集

surgeai/chartography

收藏
Hugging Face2026-07-16 更新2026-07-22 收录
官方服务:

资源简介:

Chartography是一个用于评估专业视觉推理能力的基准测试数据集,专注于专业人士在决策中使用的图表类型,如桑基图、蜡烛图、等高线地图、反向轨迹图、伯德图等。数据集包含100个真实世界的提示和图表图像,涵盖12个专业领域,包括金融与投资、医疗保健、制造与供应链以及STEM领域(如化学、地球科学、电气工程)。该基准测试旨在解决现有图表基准测试已饱和的问题,专注于仍具挑战性的任务,例如在稀疏标记的轴上估计值、追踪重叠流程的来源、通过投影网格线读取3D表面图以及多步骤计算。每个任务由相关领域的在职专业人士编写,并经过多人审核,答案包括专家设定的可接受范围,以确保评估真正奖励图表阅读能力而非像素级精度。数据集仅提供测试集,用于评估目的,严禁用于训练或微调。

Chartography measures professional visual reasoning over the charts that professionals stake decisions on: Sankey diagrams, candlestick charts, contour maps, back-trajectories, Bode plots, and more. The benchmark contains 100 real-world prompts and chart images spanning 12 professional domains, including Finance & Investing, Healthcare, Manufacturing & Supply Chain, and STEM fields from Chemistry to Geosciences to Electrical Engineering. It targets what remains hard: estimating values against sparsely labeled axes, tracing overlapping flows to their sources, reading 3D surface plots via their projected gridlines, and multi-part calculations where each step depends on a separate visual read. Every task was written by a working professional in the relevant field and reviewed by several more, with expert-set acceptable ranges for answers. The dataset is intended solely for evaluation and must not be used for training.

提供机构:
surgeai
搜集汇总
数据集介绍
surgeai/chartography 数据集图片
构建方式
Chartography数据集由Surge AI评估团队构建,专注于评测模型在专业图表上的视觉推理能力。其构建过程严谨且专业:100个测试样本涵盖12个专业领域,包括金融、医疗、制造、供应链以及STEM学科(如化学、地球科学、电气工程等)。每个任务均由该领域的一线从业者撰写,并经过多位同行专家评审,确保问题的专业性与真实性。作者需提供详尽的解答路径,数值答案附有专家设定的可接受范围,以奖励真正的图表阅读能力而非像素级精确度。数据集仅包含测试集,刻意不设训练集,旨在作为基准使用,避免模型污染。
特点
Chartography的核心特点在于其高难度与专业性。现有图表基准因直接提取标注数据点已趋于饱和,而本数据集针对的是依然具有挑战性的任务:根据稀疏标注的坐标轴估算数值、追踪重叠流向的源头、通过投影网格线阅读3D曲面图,以及需依赖多步视觉阅读的复合计算。所有任务均面向真实世界专业人士决策时使用的图表类型,如桑基图、K线图、等高线图、后向轨迹图、波特图等。初始发布时,顶尖模型得分均未超过45%,足见其评测难度。数据集仅限评估使用,严禁用于训练。
使用方法
使用Chartography进行模型评估时,需从HuggingFace加载数据集,并通过huggingface_hub下载对应图表图像。每个样本包含chart_path(图表路径)、prompt(问题)、golden_answer(专家答案,常含可接受范围)、task_id(唯一标识)、domain_combined(专业领域)等字段。评估时,将图表图像与问题输入模型,然后将模型输出与golden_answer比对计分。对于含可接受范围的数值答案,在此范围内的任意值均视为正确。数据集仅提供test分割,严禁用于任何形式的训练、微调、RLHF或蒸馏过程,以确保基准的纯净性。
背景与挑战
背景概述
Chartography 数据集由 Surge AI 评估团队于近期创建,旨在评估视觉语言模型在专业图表理解与推理任务上的表现。该数据集聚焦于金融投资、医疗健康、制造业与供应链、以及化学、地球科学、电气工程等 12 个专业领域中的 100 个真实图表与提示,涵盖桑基图、蜡烛图、等高线图、轨迹图、波特图等专业图表类型。现有图表基准因标注数据点直接提取问题已基本饱和,Chartography 则针对稀疏轴标签下的值估计、重叠流程溯源、三维表面图网格线解读、以及多步视觉计算等核心未解难题构建,填补了专业级图表推理评估的空白。该数据集被设计为固定测试集,禁止用于训练,初始测试中前沿模型得分均未超过 45%,凸显了其挑战性与研究价值。
当前挑战
Chartography 所面对的核心挑战来自两个层面。在领域问题层面,专业图表推理超越了传统数据点提取,要求模型具备稀疏轴标签下的数值估计能力、重叠视觉元素(如桑基图中的流量)的精准溯源、以及依赖多步视觉读取的复合计算,这些能力对现有视觉语言模型构成显著瓶颈。在数据集构建过程中,挑战同样严峻:每个任务由相关领域从业者亲自编写并经多人审核,确保计算路径清晰且答案附有专家设定的可接受范围,用以区分真正图表理解与偶然匹配;此外,数据集严格避免训练污染,仅设测试集,并要求用户排除其用于训练语料,以维护基准评估的纯净性与可靠性。
常用场景
经典使用场景
Chartography作为一项专业级的图表理解基准测试,其经典使用场景聚焦于评估视觉语言模型在面对复杂、真实世界图表时的推理能力。与常规的图表问答任务不同,该基准精心选取了涵盖金融投资、医疗保健、制造业供应链以及化学、地球科学、电气工程等12个专业领域的桑基图、K线图、等高线图、轨迹图、波特图等图表类型。每条测试样本均由领域专家编写,要求模型在稀疏标注的坐标轴上估算数值、追踪重叠流动轨迹的源头、通过投影网格线读取三维曲面图,并进行多步骤计算,以衡量模型模拟人类专家图表素养的深度。
衍生相关工作
Chartography的发布催生了一系列旨在提升专业图表推理能力的后续研究。一方面,研究者基于其任务框架,构建了更细粒度的视觉推理子任务数据集,如聚焦于数值估计精度的基准集和面向多步逻辑推理的扩展测试。另一方面,该基准推动了专门针对稀疏标注坐标轴解算、重叠轨迹溯源等挑战的模型架构创新,例如引入显式坐标感知模块和结构化解码机制。同时,它也成为衡量大型多模态模型进步的标准尺度,被广泛采用于各类模型比较报告和技术预印本中,间接催化了图表理解领域从粗粒度分类向精细化专家级推理的研究转向。
数据集最近研究
最新研究方向
Chartography作为一项聚焦于专业级图表视觉推理的基准测试,正引领着多模态大模型在金融、医疗、制造及STEM等12个专业领域的前沿探索。该基准通过桑基图、烛台图、等高线图等复杂图表,评估模型在稀疏轴标度下的数值估算、重叠流追踪以及多步视觉计算等能力,突破了当前因直接数据点提取趋于饱和而导致的图表理解瓶颈。研究表明,面对这些需要深度图表素养的任务,前沿模型的准确率尚未突破45%,揭示了现有视觉语言模型在专业推理上的显著短板。Chartography的推出不仅为衡量模型真实图表阅读能力提供了严苛标尺,更推动了可解释、多步骤视觉推理技术的研发,其专家设定的容差评分机制确保了评估的鲁棒性与领域可信度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务