遇见数据集

AnnoBench

收藏
arXiv2026-07-29 更新2026-07-30 收录
官方服务:

资源简介:

AnnoBench是由犹他大学研究团队构建的可视化标注生成基准数据集,包含约342个专业图表样本和650多个标注任务。该数据集涵盖六种表示格式和五种描述条件,数据来源于专业数据新闻和可视化图库,通过多维度设计支持对标注质量的系统评估。数据集创建过程整合了视觉、语义和任务规范等多个维度,旨在评估大语言模型和视觉语言模型在图表标注任务中的表现,解决自动化标注系统中目标定位、数据准确性和空间可行性等核心问题。

AnnoBench is a benchmark dataset for visual annotation generation developed by a research team from the University of Utah. It contains approximately 342 professional chart samples and over 650 annotation tasks. Covering six representation formats and five description conditions, the dataset sources its data from professional data journalism and visualization galleries, and its multi-dimensional design enables systematic evaluation of annotation quality. The dataset creation process integrates multiple dimensions including visual, semantic and task specifications, aiming to evaluate the performance of Large Language Models (LLMs) and Vision-Language Models on chart annotation tasks, and address core issues in automated annotation systems such as target localization, data accuracy and spatial feasibility.

提供机构:
犹他大学
创建时间:
2026-07-29
原始信息汇总

AnnoBench - LLM Chart Understanding Benchmark

概述

AnnoBench 是一个用于评估大语言模型(LLM)对图表和数据可视化理解能力的综合性基准数据集。

主要特点

  • 多图表类型:涵盖从简单图表(柱状图、散点图、折线图)到复杂图表(桑基图、树图、网络图)的多种类型。
  • 多输入格式:支持光栅图像(PNG)、矢量图形(SVG)、源代码(Vega-Lite、D3)等多种输入格式。
  • 多样化任务类型
    • 图表类型识别
    • 数值提取
    • 比较与排名
    • 趋势分析
    • 数据推理
  • 灵活评估:支持多种评估方法,包括精确匹配、数值匹配、模糊匹配、语义匹配。
  • 模型支持:兼容纯文本模型、视觉模型、多模态模型、思维模型。
  • 可扩展架构:易于添加新的图表、任务、评估器和模型适配器。

目录结构

  • annobench.py:主 CLI 脚本
  • annobench/:主代码包,包含评估器(evaluators/)和模型适配器(runners/
  • datasets/:数据集(仅数据,不含代码)
    • simple-charts/:简单图表数据集
    • complex-charts/:复杂图表数据集
    • advanced-charts/:高级图表数据集
    • docs/:文档
    • leaderboards/:模型对比
  • tests/:测试套件
  • results/:基准测试结果

如何添加新组件

添加新图表

  1. 创建目录:datasets/simple-charts/charts/mychart-1/
  2. 添加必要文件:data.csv(图表数据)、metadata.json(图表元数据)、render.png(视觉渲染)、spec.vegalite.json(规范,可选)、render.svg(SVG渲染,可选)、code.d3.js(D3代码,可选)、code.ggplot2.r(ggplot2代码,可选)
  3. 创建任务:datasets/simple-charts/tasks/mychart-1/ 目录下定义多个任务 JSON 文件

添加新评估器

继承 BaseEvaluator 类,实现 evaluate 方法,并通过 EvaluatorFactory.register_evaluator 注册。

添加新运行器

继承 BaseRunner 类,实现 generateis_available 方法,并通过 RunnerFactory.register_runner 注册。

添加新模型提供者

  1. annobench/models/ 下创建新模块
  2. 实现适配器,继承 LLMModel,实现 generate_textis_available 等必要方法
  3. 使用 ModelFactory.registerProviderRegistry.register 注册
  4. annobench/models/__init__.py 中导入该模块
搜集汇总
数据集介绍
AnnoBench 数据集图片
构建方式
AnnoBench数据集的构建融合了专业新闻机构与可视化画廊两个互补来源。从《华盛顿邮报》等四家媒体中精选58幅专业图表,通过逆向工程重构其数据并复现为D3.js规范形式,进而衍生出SVG、Vega语法和栅格图像等多重表征。同时从Vega与Vega-Lite画廊收录284幅图表,采用半自动化流水线生成394项标注任务,结合分层抽样保留真实世界的标注类型分布。每项任务均以意图层与执行层两种粒度定义,并配以五级语义描述,从而构建起一个覆盖表征、语义与任务三个维度的结构化测试基准。
特点
该数据集的核心特征在于其三维设计空间与五维评估框架的有机结合。在表征维度上,每个图表同时提供栅格、矢量、语法与代码四种形态,使得模型在视觉推理与结构编辑上的能力可以独立剖析。在语义维度上,从零描述到领域特定上下文的五级层次允许精细探究背景信息对标注质量的影响。在任务维度上,意图与执行两种提示粒度揭示了模型在自主规划与指令遵循间的差距。对应的五维评估体系——精确性、相关性、可见性、保真度与一致性——既可人工评分亦可借助VLM自动裁判,为标注正确性提供了可验证的操作化定义。
使用方法
研究者可通过AnnoBench浏览器交互式地探索数据集并配置实验条件。使用时可从多维度组合中选择:指定图表来源、表征格式(如D3代码或栅格图像)、语义描述层级以及提示类型(意图或执行)。系统自动构建模型输入并标准化输出,支持对多种大语言模型与视觉语言模型进行统一评估。对于非栅格表征,平台提供自动编译与错误回溯机制,允许最多三次重试以区分格式错误与推理失败。评估结果可通过内置的VLM裁判或可导出至ReVISit平台进行人工审核,最终以结构化方式汇总分析,支撑可复现的基准测试与细粒度性能归因。
背景与挑战
背景概述
AnnoBench由犹他大学的Md Rahat-uz-Zaman、Md Dilshadur Rahman、Andrew McNutt与Paul Rosen于2026年联合创建,聚焦于可视化标注自动化的评估这一长期未被充分规范化的领域。研究团队注意到,尽管已有诸多工具尝试生成图表标注,但现有基准测试均未能系统性地检验标注在视觉、语义与风格等多重约束下是否真正正确。为此,他们设计了一套包含五维度评价标准的评估框架,并将之实例化为一个多维度的数据集——AnnoBench。该数据集汇集了来自专业数据新闻机构和可视化库的约342张图表,涵盖D3、Vega、Vega-Lite、ggplot2、SVG与栅格六种表示格式,以及五种语义描述层级与两类提示级别。这一开创性工作为自动化标注系统的严谨可比评估奠定了坚实基础,有力推动了可视化生成流水线的发展。
当前挑战
AnnoBench直面了可视化标注领域长期存在的核心挑战:如何将标注正确性转化为可验证的、实例级别的条件。以往研究仅从设计维度描述标注,却缺乏检视其是否指向正确视觉元素、所陈述内容是否被图表编码支持、以及能否在避免遮挡证据的前提下完成空间放置的标准化方案。为此,团队定义了目标正确性、任务准确性、空间可行性、图表保持性与风格连贯性五个可操作的评估维度。数据集构建过程同样充满困难,例如为专业图表重建缺失的原始数据、将不同来源的图表统一至多种表示格式、以及在保持任务自然分布的前提下通过半自动管道生成数量可观且语义一致的标注任务。此外,他们还需应对模型输出中频繁出现的格式错误、截断与幻觉现象,并设计容错机制以区分推理失败与格式偏离。VLM评分者也在栅格输出上暴露出质量高估的局限,进一步凸显了评价流程的复杂性与开放性。
常用场景
经典使用场景
在可视化与自然语言处理交叉领域,AnnoBench被誉为评估图表注释生成质量的标杆性数据集。其经典使用场景聚焦于对大规模语言模型与视觉语言模型在图表注释任务上的系统化评测,通过操纵图表表示形式(如栅格图像、矢量图形、语法规范与代码)、语义描述层级(从无描述至领域特定语境)以及任务提示特异性(意图级与执行级),定量刻画模型在目标定位、任务准确性、空间可行性、风格一致性与图表保真度五个维度的表现。研究者借助该基准,可深入剖析不同输入条件如何影响注释生成的成败,从而为后续自动化注释工具的优化提供可复现的对照基础。
实际应用
在实际应用中,AnnoBench的评估框架可直接服务于数据新闻、商业智能与科学可视化等领域的自动化注释工具开发。专业数据新闻机构可利用该基准测试其内部管线在大规模生成图表标注时的稳定性和准确性,确保产出符合编辑规范与读者认知习惯。商业智能平台可借助AnnoBench的五大维度评估体系,对AI辅助注释功能进行量产前的质量把关,避免因注释错误而导致误导性数据解读。此外,该数据集附带的可交互浏览器支持研究人员在不修改代码的前提下快速配置实验、对比模型并导出分析结果,显著降低了从学术研究到工业落地的迁移成本。
衍生相关工作
AnnoBench的发布催生了一系列沿着其设计维度深入探索的经典工作。首先,基于其五维评估框架,学者们引入了更精细的规则约束与复合评分策略,用以改进栅格图像场景下模型保真度低的问题。其次,受其提示特异性实验启发,研究者提出了多层级意图推理机制,使模型在高层次目标驱动下能自主规划出更丰富的注释类型,如包围框与高亮组合,而非仅限于简单文本标签。此外,AnnoBench的图表表示多样化思想被延伸至交互式与动态图表场景,衍生出评估模型在时间序列注释生成中实时适应布局变化的新基准。这些工作共同巩固了AnnoBench作为注释生成领域评估范式的核心地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务