遇见数据集

Edit2TikZ

收藏
arXiv2026-08-14 更新2026-08-15 收录
数据链接:
官方服务:

资源简介:

Edit2TikZ是一个由上海交通大学构建的综合性科学图形编辑基准数据集,旨在评估多模态大语言模型在端到端图形编辑任务中的表现。该数据集包含1,548个高质量样本,涵盖真实世界编辑案例与受控合成编辑案例,并支持纯文本与视觉定位两种指令形式,共包含4,711个标注编辑单元,覆盖八种原子编辑操作。数据集的构建过程包括从arXiv论文中提取TikZ代码、利用代码与视觉相似性构建真实编辑对,以及通过规划器生成合成编辑案例,所有样本均经过人工审核验证。该数据集主要应用于科学图形编辑领域,旨在解决当前模型在指令跟随、代码编译与无关内容保留方面的不足,为图形编辑能力评估提供标准化基准。

Edit2TikZ is a comprehensive scientific graph editing benchmark dataset developed by Shanghai Jiao Tong University, aiming to evaluate the performance of multimodal large language models (LLMs) in end-to-end graph editing tasks. The dataset contains 1,548 high-quality samples, covering real-world editing cases and controlled synthetic editing cases, and supports two instruction formats: plain text and visual grounding, with a total of 4,711 annotated editing units covering eight atomic editing operations. The dataset construction process includes extracting TikZ code from arXiv papers, constructing real editing pairs using code and visual similarity, generating synthetic editing cases via a planner, and all samples have been manually reviewed and verified. This dataset is mainly applied in the field of scientific graph editing, aiming to address the current shortcomings of models in instruction following, code compilation and irrelevant content retention, and provide a standardized benchmark for evaluating graph editing capabilities.

提供机构:
上海交通大学
创建时间:
2026-08-14
原始信息汇总

数据集概述

数据集名称:Edit2TikZ

数据集类型:科学图形编辑基准(Benchmark)

核心任务:基于 TikZ 语言的科学图形编辑

数据集特点

  • 综合性(Comprehensive):覆盖科学图形编辑的多个方面
  • 挑战性(Challenging):设计为具有一定难度的评测基准

主要内容

  • 提供与科学图形编辑相关的数据
  • 数据以 TikZ 代码形式呈现,用于评估和指导图形编辑模型或方法

当前状态

  • 代码和数据即将发布(Code and data will be released soon)

使用场景

  • 适用于自然语言处理、计算机视觉、图形生成与编辑等研究领域
  • 可用于训练、验证和评估科学图形编辑模型

发布平台:GitHub(仓库地址:https://github.com/Solunny/Edit2TikZ)

搜集汇总
数据集介绍
Edit2TikZ 数据集图片
构建方式
Edit2TikZ数据集的构建融合了真实世界编辑案例与受控合成编辑样本,从arXiv的TeX源中提取自包含的TikZ代码块,经编译渲染与前景裁剪形成源图池,并利用感知哈希去除近似重复。真实编辑对通过代码相似性与前景感知的视觉相似性识别同论文中结构相似但细节不同的图形对,由指令生成模型产生编辑指令,经编辑单元标注模型分解为原子操作,并由人工审核。合成编辑则由规划器生成指令与编辑单元,编辑模型应用修改后经编译检查与多模态验证器评估,失败样本经至多两轮修复,最终所有样本均经人工筛选,确保指令明确、编辑可感知且非目标内容无损。对于文本指令难以区分目标的情况,额外提供视觉定位框,形成视觉提示输入。
特点
Edit2TikZ涵盖1,548个高质量样本,包含534个真实世界、580个纯文本合成及434个视觉提示合成案例,覆盖科学图形中的八种原子编辑操作,如样式更新、元素插入删除、参数调整及关系修改等,每个样本含1至6个编辑单元,总计4,711个带标注的编辑单元。该基准支持文本与视觉定位两种指令形式,并且所有编辑单元均经过人工验证,确保标注的准确性与指令的可执行性。与现有重建或图表编辑基准不同,Edit2TikZ专门针对通用科学图形的指令驱动编辑,且采用TikZ代码作为输出,能够精细评估模型在保留未编辑内容的同时完成局部修改的能力,具有较高的挑战性与领域代表性。
使用方法
使用Edit2TikZ时,模型接收源图(可选叠加视觉提示框)与编辑指令,需生成符合要求的完整TikZ程序,经编译渲染后对比参考输出。评估采用编译成功率、代码级指标(cBLEU与TED)及图像级指标(DSim、RestorationScore与EditCorrectnessScore),其中RS从文本/风格、对象/关系、布局/尺度三方面衡量非目标保留程度,ECS则按编辑单元细粒度打分。训练阶段可利用伴随的TikZEditMix混合数据集进行两阶段课程学习:先进行图像到TikZ重建训练,再针对编辑指令进行微调,以提升模型在科学图形编辑上的表现。该基准适用于评估多模态大语言模型在端到端科学图形编辑中的综合能力,也可作为训练数据来源以增强模型性能。
背景与挑战
背景概述
Edit2TikZ数据集由上海交通大学的研究团队于2026年构建,旨在系统评估多模态大语言模型(MLLMs)在科学图形编辑任务中的表现。该任务要求模型从给定的源图像和编辑指令出发,生成可编译的TikZ代码,以精确实现所请求的修改,同时保持未涉及内容不变。此研究填补了现有基准主要聚焦于图形重建或简单图表编辑的空白,首次为跨多种科学图形类型(如几何图、电路图、流程图等)的端到端编辑提供了全面的评测框架。数据集包含1,548个高质量样本,融合真实与受控合成编辑案例,并配备了细粒度的编辑单元标注和人类对齐的评估指标体系,对推动科学图形自动化编辑的研究具有重要影响力。
当前挑战
该任务面临双重挑战。首先,科学图形编辑需要模型同时具备精准的视觉理解、指令解析和代码生成能力,既要忠实还原源图结构,又要准确识别并修改指定元素,同时避免对无关部分造成破坏,这对模型的综合能力提出了极高要求。其次,数据集的构建过程极为复杂,需从海量arXiv TeX源码中筛选并编译图形,通过代码和视觉相似度匹配构建编辑对,并设计指令生成与编辑单元标注流程,确保指令的清晰性和编辑的正确性,整个过程需经过人工严格审核,以确保数据质量与多样性。
常用场景
经典使用场景
Edit2TikZ作为科学图形编辑领域的综合性基准,其经典使用场景聚焦于评估多模态大语言模型在接收渲染图形与编辑指令后,端到端生成可编译TikZ代码的能力。基准涵盖真实世界与受控合成编辑案例,支持文本与视觉定位两种请求形式,并包含多步编辑,每步均带细粒度标注。该基准特别设计了人类对齐的评估框架,用以衡量请求编辑的完成度与无关内容的保真度,从而系统性地测试模型在图形结构恢复、指令定位、代码生成及非目标内容保留等多维度的综合性能。
衍生相关工作
Edit2TikZ的发布催生了多项衍生研究。其构建的TikZEditMix混合训练集与两阶段课程学习策略被证明能显著提升紧凑模型(如Qwen3.5-4B)的编译成功率与编辑准确率,该训练范式或可为后续图形编辑任务提供通用借鉴。同时,基准所提出的人类对齐评估框架(RS与ECS)为图形编辑质量的量化提供了更可靠的参考标准,可能被后续工作采纳以改进现有评估指标。此外,Edit2TikZ对模型在视觉重建与局部编辑能力分离性的揭示,促进了对多模态模型在结构化输出任务中能力边界的深入探讨,推动了相关agentic迭代优化策略的研究。
数据集最近研究
最新研究方向
当前,大规模多模态语言模型在视觉理解与代码生成领域展现出巨大潜力,然而针对科学图形的指令驱动编辑任务仍面临严峻挑战。Edit2TikZ数据集的提出,精准填补了现有基准在科学图形编辑评估上的空白,其不仅涵盖了多样化的图形类型与八种原子编辑操作,还创新性地引入了文本与视觉定位双模态指令,以及多步编辑与逐层标注,为模型在恢复视觉结构、定位修改需求、生成可编译代码并保留无关内容方面的联合能力提供了全面而严苛的检验标准。该基准的发布,不仅揭示了当前主流模型在科学图形端到端编辑任务上的普遍不足,更通过构建TikZEditMix训练集及重构后编辑的课程学习策略,为提升紧凑型模型在此前沿方向上的表现指明了可行路径,对推动科学图形自动化编辑与多模态代码生成领域的发展具有重要参考价值。
相关研究论文
  • 1
    Edit2TikZ: A Comprehensive and Challenging Benchmark for Scientific Figure Editing with TikZ上海交通大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务