ChartSync
收藏官方服务:
资源简介:
ChartSync是一个用于评估图表图像编辑的基准,支持文本编辑和视觉逻辑级联编辑(VLCE),其中文本值更改必须与相应的图表几何同步。发布的基准包含九个图表家族的870个专家验证三元组:635个文本编辑样本和235个VLCE样本。
ChartSync is a benchmark for evaluating chart image editing, supporting both text editing and Visual Logic Cascaded Editing (VLCE), where text value modifications must be synchronized with the corresponding chart geometries. The released benchmark contains 870 expert-validated triplets across nine chart families: 635 text editing samples and 235 VLCE samples.
创建时间:
2026-07-11
原始信息汇总
数据集概述
ChartSync 是一个用于评估图表图像编辑能力的基准数据集,专注于两种编辑场景:纯文本编辑(text-only edits)和视觉-逻辑级联编辑(Visuo-Logical Cascading Edits, VLCE)。VLCE 场景要求文本值的变更必须与对应的图表几何图形同步更新。
- 规模: 包含 870 个经专家验证的三元组(triplets),覆盖 9 种图表类型。
- 细分: 635 个纯文本编辑样本,235 个 VLCE 样本。
数据组成
每个样本包含以下字段(最终基准 JSON 格式):
image_id: 样本唯一标识符(例如bar_5)。original_image_path: 原始图表图像路径(例如ChartSync/images/bar_5.png)。original_code_path: 原始图表生成代码路径(例如ChartSync/py/bar_5.py)。edited_image_path: 编辑后的图表图像路径(例如ChartSync/edited_images/bar_5.png)。edited_code_path: 编辑后的图表生成代码路径(例如ChartSync/edited_py/bar_5.py)。instruction: 编辑指令文本(例如 "Change ...")。object_category: 编辑对象类别(例如data_label)。edit_category: 编辑类别,必须为以下之一:single_text_only、multi_text_only、single_text_geometry_coupled、multi_text_geometry_coupled。
数据来源与构建流程
数据基于 ChartMimic 数据集(图像+代码对)构建,构建流程分为三个阶段和专家审核:
- Phase 1: 合成并验证编辑指令(生成
old_value、new_value、key和instruction)。 - Phase 2: 根据指令编辑图表生成代码,执行代码并渲染得到真实标签(GT)图像和代码。
- Phase 3: 过滤源图像和 GT 图像分辨率不匹配的样本。
- 专家审核: 人工检查每个候选样本的源图像、GT图像、源代码、编辑代码和指令,剔除模糊或有缺陷的样本,修正后形成最终基准清单,并分配
edit_category。
数据下载和访问
- 基准数据: 托管在 Hugging Face:JiakangYu/ChartSync
- 代码仓库: kaka-yjk/ChartSyncCodebase(包含构建、推理、OCR和评估流程)
评估指标
评估协议使用以下指标,结果以百分比 [0, 100] 报告:
- OCR F1: 基于OCR的F1分数。
- SSIM: 结构相似性指数。
- TESR: 文本编辑成功率。
- VLCS: 仅针对几何耦合的VLCE样本计算的视觉-逻辑级联分数。
- BFS: 基准保真度分数。
- VLM Avg:
mean(TESR, VLCS, BFS)。 - Overall:
mean(OCR F1, SSIM, TESR, VLCS, BFS)。
许可协议
仓库源代码采用 Apache License 2.0。
搜集汇总
数据集介绍

构建方式
ChartSync基准数据集源自ChartMimic图像与代码对,经过精心设计的三阶段自动化流程构建而成。第一阶段,利用GPT模型对原始图表进行智能分析,生成包含旧值、新值、关键元素及编辑指令的候选样本。第二阶段,依据指令自动编辑对应绘图代码,渲染生成真实标注图像,并经过验证器确认代码可执行性。第三阶段,通过分辨率过滤机制确保源图与编辑后图像尺寸一致。最终,所有候选样本均须经过专家的人工审核与校对,剔除歧义或缺陷样本,确认编辑类别,形成包含870个专家验证三元组的最终基准数据集。
特点
ChartSync数据集的核心特色在于其首创的视觉逻辑级联图表编辑能力,不仅涵盖635个纯文本编辑样本,更包含235个复杂的视觉逻辑级联编辑样本,要求文本数值变更与对应图表几何元素实现同步更新。数据集覆盖九大图表家族,每个样本均提供原始图像、原始代码、编辑后图像及编辑后代码的四元组结构,并细分为单/多文本纯编辑与单/多图文几何耦合编辑四种类别,为评估多模态模型在图表编辑中的精确理解与执行能力提供了全面而严格的测试平台。
使用方法
使用者需先配置Python 3.10+环境并安装依赖包,从Hugging Face下载基准数据后以兄弟目录形式存放。运行评估时,首先通过专用脚本生成真实标注的OCR与锚点缓存,随后调用GPT Image 2或Gemini等基线模型进行推理预测,最终执行评估脚本计算OCR F1、SSIM、TESR、VLCS、BFS及VLM Avg等多维度指标。评估流程严格遵循论文协议,支持断点续传与自定义模型集成,确保结果的可复现性与公平比较。
背景与挑战
背景概述
数据可视化领域的图表编辑任务长期受限于编辑指令的模糊性与几何一致性缺失。ChartSync基准数据集由JiakangYu等研究者于近期构建,依托ChartMimic数据源,通过系统性合成与专家验证流程,创建了包含870个高质量三元组(涵盖九类图表族)的评估集。该数据集创新性地提出了视觉逻辑级联编辑范式,将纯文本编辑与文本-几何耦合编辑统一纳入评估框架,首次构建了自动化代码编辑与人工校验相结合的构建管线。其核心研究价值在于:既突破了传统图表编辑任务仅关注文本修改的局限,又通过显式的几何一致性约束,为多模态大语言模型在可视化编辑领域的评估提供了标准化测试基准,对推动数据可视化与人工智能交叉领域的发展具有里程碑意义。
当前挑战
图表编辑的核心挑战在于维护文本修改与视觉几何间的逻辑一致性。传统方法难以处理数值变更后坐标轴刻度、数据标记位置等视觉元素的同步更新,导致编辑结果产生视觉歧义。构建过程中面临三重技术壁垒:其一,从ChartMimic原始数据中筛选兼容样本时,需确保渲染代码在隔离环境中可复现且无依赖冲突;其二,自动化合成阶段需设计具有判别性的编辑指令,使文本描述与代码修改间建立精确映射;其三,专家校验环节需人工甄别85个候选样本中隐含的语义歧义与执行错误,最终仅保留235个视觉逻辑级联编辑样本。此外,输出分辨率一致性控制、代码编辑后渲染效果验证等工程细节,共同构成了该基准构建的完整挑战体系。
常用场景
经典使用场景
ChartSync是一个专注于图表图像编辑的视觉语言基准数据集,其核心应用场景在于评估和推动多模态大模型在图表编辑任务上的能力。该数据集精心构建了870个专家验证的三元组,涵盖九大图表家族,并创新性地引入了视觉逻辑级联编辑(VLCE)任务,要求模型在修改文本数值的同时,自动同步更新图表中对应的几何元素。这一设计不仅考验模型对图表语义和结构的理解,更挑战其在视觉与逻辑信息之间建立因果关联的能力,为视觉语言模型在结构化数据理解领域设立了全新的评估标准。
解决学术问题
ChartSync针对性地解决了现有图表编辑研究中缺乏统一、严谨评估基准的学术困境。传统方法往往仅关注纯文本编辑或简单图表修改,而忽视了真实场景中数值变化与视觉几何元素之间的强耦合关系。该数据集通过引入视觉逻辑级联编辑这一新颖任务范式,量化评估了模型在感知布局一致性、保持几何比例以及实现图文同步编辑方面的性能。其提出的多维度评价体系(如VLCS、OCR F1、SSIM等)为学术界提供了可复现的标准化评测框架,有力推动了视觉语言模型在精细结构化内容编辑这一前沿方向的理论研究与技术突破。
衍生相关工作
ChartSync作为一项开创性基准,其构建思想和评估体系已催生了一系列衍生研究工作。后续研究者基于该数据集的成对图像-代码约束结构,进一步探索了图表布局再生成、代码级语义对齐以及多步推理编辑等子任务。其提出的VLCE指标和分类体系(如single_text_geometry_coupled)被广泛采纳为评估图表耦合编辑能力的标准,启发了多个致力于提升视觉语言模型结构化输出一致性的工作。此外,该数据集所提供的完整自动化构建管线与专家校验机制,也为其他视觉语言基准的开发提供了可复现的方法论范本。
以上内容由遇见数据集搜集并总结生成




