遇见数据集

DaEdiTikZ-Bench

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

DaEdiTikZ-Bench 是一个人工筛选的基准数据集,用于评估指令导向的 TikZ/LaTeX 科学图形编辑任务(如 EdiTikZ 模型)。该数据集包含 345 对图形,每对图形由两个相似但不同的科学图形组成,每个图形均提供完整的 TikZ/LaTeX 源代码和对应的 448×448 像素 PNG 渲染图像。此外,每对图形包含两条编辑指令:一条描述从第一个图形到第二个图形的详细修改(正向指令),另一条描述反向修改(反向指令),共计 690 个样本。数据集字段包括:样本标识符(sample_id)、图形对相似度分数(similarity_score,余弦相似度,范围 0.95–0.9999)、第一个图形的 TikZ 代码(tikz_code_i)与图像(image_i)、第二个图形的 TikZ 代码(tikz_code_j)与图像(image_j)、正向编辑指令(edit_instruction_forward)和反向编辑指令(edit_instruction_backward)。该数据集可用于多模态、图像编辑、代码生成等任务,特别是评估模型根据指令和源图像生成目标 TikZ 代码的能力。

DaEdiTikZ-Bench is a manually curated benchmark dataset for evaluating instruction-oriented TikZ/LaTeX scientific graphics editing tasks (e.g., EdiTikZ model). It contains 345 pairs of graphics, each pair consisting of two similar but different scientific graphics, with complete TikZ/LaTeX source code and corresponding 448×448 pixel PNG rendered images provided for each graphic. Additionally, each pair includes two editing instructions: one describing detailed modifications from the first graphic to the second (forward instruction), and the other describing reverse modifications (backward instruction), totaling 690 samples. Dataset fields include: sample identifier (sample_id), similarity score of the graphic pair (similarity_score, cosine similarity ranging from 0.95 to 0.9999), TikZ code and image of the first graphic (tikz_code_i and image_i), TikZ code and image of the second graphic (tikz_code_j and image_j), forward editing instruction (edit_instruction_forward), and backward editing instruction (edit_instruction_backward). This dataset can be used for tasks such as multimodal learning, image editing, code generation, and particularly for evaluating a models ability to generate target TikZ code based on instructions and source images.

创建时间:
2026-09-08
原始信息汇总

DaEdiTikZ-Bench 数据集概述

DaEdiTikZ-Bench是一个人工精选的基准数据集,用于评估指令引导的科学图表编辑任务,具体针对TikZ/LaTeX格式的图表。该数据集被用于评估EdiTikZ模型。

基本信息

  • 许可证:Apache 2.0
  • 语言:英语
  • 样本规模:小于1K(n<1K)
  • 任务类型:图像到文本、文本生成
  • 标签:TikZ、LaTeX、代码生成、科学图表、图像编辑、多模态、基准测试

数据规模与构成

  • 包含345对配对图表
  • 每对图表均配有完整的TikZ程序、渲染后的PNG图像
  • 提供双向编辑指令,共计690个样本

数据集字段

每行数据包含以下字段:

字段名 说明
sample_id 基准样本唯一标识符
similarity_score 配对渲染图像的余弦相似度(范围0.95至0.9999)
tikz_code_i 第一个图表的完整TikZ/LaTeX源代码
image_i 第一个图表渲染后的448×448 PNG图像
tikz_code_j 第二个图表的完整TikZ/LaTeX源代码
image_j 第二个图表渲染后的448×448 PNG图像
edit_instruction_forward 描述从图表i到图表j的具体变化指令
edit_instruction_backward 描述从图表j到图表i的具体变化指令

使用方式

可通过Hugging Face的datasets库加载数据集,数据集分割为test

评估示例

前向评估:输入image_iedit_instruction_forward,参照目标为tikz_code_jimage_j

反向评估:输入image_jedit_instruction_backward,参照目标为tikz_code_iimage_i

python from datasets import load_dataset

dataset_id = "nllg/DaEdiTikZ-Bench" ds = load_dataset(dataset_id, split="test")

pair = ds[0]

前向评估

source_image = pair["image_i"] instruction = pair["edit_instruction_forward"] reference_tikz = pair["tikz_code_j"] reference_image = pair["image_j"]

反向评估

reverse_image = pair["image_j"] reverse_instruction = pair["edit_instruction_backward"] reverse_reference_tikz = pair["tikz_code_i"] reverse_reference_image = pair["image_i"]

主要用途

该基准数据集专门用于评估模型在科学图表编辑任务中的能力,即根据自然语言指令对TikZ/LaTeX绘制的科学图表进行修改,并以代码形式生成编辑后的结果。

搜集汇总
数据集介绍
DaEdiTikZ-Bench 数据集图片
构建方式
在科学图像自动生成领域,TikZ/LaTeX作为高精度矢量图形描述语言,其指令驱动的编辑任务长期缺乏标准化评估基准。DaEdiTikZ-Bench基准数据集应运而生,旨在弥合这一空白。该数据集汇聚了345对精心筛选的图形样本,每对图形均配备完整的TikZ源码、对应渲染的448×448分辨率PNG图像,以及双向的编辑指令,合计形成690个独立编辑任务。构造过程中,通过计算配对渲染图像间的余弦相似度(介于0.95至0.9999之间),确保了图形间在视觉上的高度关联性,从而保障编辑指令的明确性与可操作性。每条记录以结构化字段存储,涵盖样本唯一标识、相似度得分、两幅图的TikZ代码及其渲染图像,以及前向与后向的详细变更描述,为细粒度的科学图形编辑提供了完备的输入输出支持。
使用方法
此基准的运用高度契合视觉-语言-代码多模态推理的前沿范式。通过HuggingFace datasets库可便捷加载,用户可直接取用'test'拆分中的任意样本对。一种典型的评估流程为,对于前向任务,将'image_i'与'edit_instruction_forward'作为输入,期望模型生成与'image_j'视觉等价的'tikz_code_j',并将其渲染为图像以与参考图像进行定量与定性比对。反向任务依此类推。该设计不仅支持端到端的代码生成度量,还可启发式地用于评价模型的指令解析能力及跨模态对齐精度。建议研究者在报告指标时,同时提供编辑指令类型分类的细粒度结果,以便深入解析模型擅长与薄弱的编辑操作环节。
背景与挑战
背景概述
DaEdiTikZ-Bench是由相关研究团队于近期提出的一项人工精选基准,聚焦于基于指令的TikZ/LaTeX科学图形编辑任务。伴随EdiTikZ模型一同发布,该基准旨在填补多模态模型在科学图表代码级编辑方面评估的空白。其核心研究问题在于衡量模型能否依据自然语言指令,将渲染后的图形反向映射至准确的TikZ代码,从而实现对复杂矢量图形的语义化修改。基准包含345对图形,配以完整的源程序、渲染图像及双向编辑指令,共计690个样本,为科学可视化与代码生成交叉领域提供了标准化评测平台。该数据集的问世对推动可编辑图形生成、文档理解及多模态推理研究具有重要参考价值。
当前挑战
该数据集构建与所涉任务面临多重挑战:首先,科学图形普遍具有高结构化与语义密集特性,使得从像素级图像精准解析并编辑背后的TikZ代码成为难题,模型需同时兼顾视觉细节与代码逻辑的一致性;其次,构建过程中需对图形-代码对进行精确配对,并生成双向且互逆的编辑指令,这对人工标注要求严苛,需确保指令的完备性与无歧义性,同时控制渲染图像间的相似度在合理范围(0.95–0.9999),以避免因视觉差异过小而引发的标注模糊。此外,编辑指令需覆盖从简单属性调整到复杂结构重排的多层次操作,增加了数据构建的复杂度与模型评估的难度。
常用场景
经典使用场景
DaEdiTikZ-Bench作为首个针对科学图表编辑的精细人工基准,其核心使用场景在于对多模态模型进行指令引导的图形编辑评估。数据集包含345对渲染图及其对应的TikZ程序源码,并提供了双向编辑指令,从而支持从图像与文本指令到代码生成的端到端评测。研究者可借此衡量模型在理解科学绘图语义、执行细粒度编辑操作(如修改坐标、样式或标签)方面的能力,为科学可视化领域的自动编辑研究奠定标准化测试基础。
解决学术问题
该数据集直面科学论文中图形迭代修改的低效痛点,解决了以往缺乏高质量编辑基准导致研究难以量化比较的问题。它系统性地提供了成对图形及精确的代码级差异,使得学术社区得以客观评估模型在代码层面执行精确编辑的能力,而非仅仅依赖视觉相似性。此举促进了多模态理解与程序合成交叉领域的发展,为探索如何将自然语言指令映射到结构化绘图代码提供了关键资源,并推动了更可靠、可复现的科学图表生成研究。
实际应用
在实际应用中,DaEdiTikZ-Bench可直接服务于科研写作辅助工具的研发。基于该基准训练的模型能根据用户的自然语言修改要求,自动更新LaTeX中的TikZ图形代码,从而大幅减少研究人员手动调整图表的时间。这类工具可嵌入主流编辑器或LaTeX环境,为学者提供从图像或代码到新版图表的智能生成服务,提升论文图表制作效率。同时,该基准亦可用于教学场景,帮助初学者理解科学图表的排版与设计原则。
数据集最近研究
最新研究方向
面向科学图表编辑的多模态指令遵循与代码生成能力评测
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务