DaEdiTikZ-Bench
收藏资源简介:
DaEdiTikZ-Bench 是一个人工筛选的基准数据集,用于评估指令导向的 TikZ/LaTeX 科学图形编辑任务(如 EdiTikZ 模型)。该数据集包含 345 对图形,每对图形由两个相似但不同的科学图形组成,每个图形均提供完整的 TikZ/LaTeX 源代码和对应的 448×448 像素 PNG 渲染图像。此外,每对图形包含两条编辑指令:一条描述从第一个图形到第二个图形的详细修改(正向指令),另一条描述反向修改(反向指令),共计 690 个样本。数据集字段包括:样本标识符(sample_id)、图形对相似度分数(similarity_score,余弦相似度,范围 0.95–0.9999)、第一个图形的 TikZ 代码(tikz_code_i)与图像(image_i)、第二个图形的 TikZ 代码(tikz_code_j)与图像(image_j)、正向编辑指令(edit_instruction_forward)和反向编辑指令(edit_instruction_backward)。该数据集可用于多模态、图像编辑、代码生成等任务,特别是评估模型根据指令和源图像生成目标 TikZ 代码的能力。
DaEdiTikZ-Bench is a manually curated benchmark dataset for evaluating instruction-oriented TikZ/LaTeX scientific graphics editing tasks (e.g., EdiTikZ model). It contains 345 pairs of graphics, each pair consisting of two similar but different scientific graphics, with complete TikZ/LaTeX source code and corresponding 448×448 pixel PNG rendered images provided for each graphic. Additionally, each pair includes two editing instructions: one describing detailed modifications from the first graphic to the second (forward instruction), and the other describing reverse modifications (backward instruction), totaling 690 samples. Dataset fields include: sample identifier (sample_id), similarity score of the graphic pair (similarity_score, cosine similarity ranging from 0.95 to 0.9999), TikZ code and image of the first graphic (tikz_code_i and image_i), TikZ code and image of the second graphic (tikz_code_j and image_j), forward editing instruction (edit_instruction_forward), and backward editing instruction (edit_instruction_backward). This dataset can be used for tasks such as multimodal learning, image editing, code generation, and particularly for evaluating a models ability to generate target TikZ code based on instructions and source images.
DaEdiTikZ-Bench 数据集概述
DaEdiTikZ-Bench是一个人工精选的基准数据集,用于评估指令引导的科学图表编辑任务,具体针对TikZ/LaTeX格式的图表。该数据集被用于评估EdiTikZ模型。
基本信息
- 许可证:Apache 2.0
- 语言:英语
- 样本规模:小于1K(n<1K)
- 任务类型:图像到文本、文本生成
- 标签:TikZ、LaTeX、代码生成、科学图表、图像编辑、多模态、基准测试
数据规模与构成
- 包含345对配对图表
- 每对图表均配有完整的TikZ程序、渲染后的PNG图像
- 提供双向编辑指令,共计690个样本
数据集字段
每行数据包含以下字段:
| 字段名 | 说明 |
|---|---|
sample_id |
基准样本唯一标识符 |
similarity_score |
配对渲染图像的余弦相似度(范围0.95至0.9999) |
tikz_code_i |
第一个图表的完整TikZ/LaTeX源代码 |
image_i |
第一个图表渲染后的448×448 PNG图像 |
tikz_code_j |
第二个图表的完整TikZ/LaTeX源代码 |
image_j |
第二个图表渲染后的448×448 PNG图像 |
edit_instruction_forward |
描述从图表i到图表j的具体变化指令 |
edit_instruction_backward |
描述从图表j到图表i的具体变化指令 |
使用方式
可通过Hugging Face的datasets库加载数据集,数据集分割为test。
评估示例
前向评估:输入image_i与edit_instruction_forward,参照目标为tikz_code_j和image_j
反向评估:输入image_j与edit_instruction_backward,参照目标为tikz_code_i和image_i
python from datasets import load_dataset
dataset_id = "nllg/DaEdiTikZ-Bench" ds = load_dataset(dataset_id, split="test")
pair = ds[0]
前向评估
source_image = pair["image_i"] instruction = pair["edit_instruction_forward"] reference_tikz = pair["tikz_code_j"] reference_image = pair["image_j"]
反向评估
reverse_image = pair["image_j"] reverse_instruction = pair["edit_instruction_backward"] reverse_reference_tikz = pair["tikz_code_i"] reverse_reference_image = pair["image_i"]
主要用途
该基准数据集专门用于评估模型在科学图表编辑任务中的能力,即根据自然语言指令对TikZ/LaTeX绘制的科学图表进行修改,并以代码形式生成编辑后的结果。




