DaEdiTikZ
收藏资源简介:
DaEdiTikZ是一个用于训练EdiTikZ系列模型的数据集,包含真实的科学图形编辑轨迹,使用TikZ/LaTeX格式。每条记录包含一对从ArXiv、GitHub和TeXStackExchange的修订轨迹中挖掘的源TikZ程序/渲染图形,以及由Qwen3.6-27B模型生成的双向自然语言编辑指令。数据集支持从源图形和编辑指令生成编辑后的TikZ程序的任务。发布版本包含106,358个可再分发的图形对,每个对提供两个方向的训练实例(前向和后向指令),共212,716个样本。每个样本包含以下字段:group_id(修订组标识符)、source(来源类别)、similarity_score(两图形余弦相似度,范围0.95-0.9999)、file_id_i/tikz_code_i/image_i(第一个图形的标识符、代码和渲染PNG)、file_id_j/tikz_code_j/image_j(第二个图形的对应信息)、edit_instruction_forward(描述i→j的变化)和edit_instruction_backward(描述j→i的变化)。数据集适用于图像到文本、文本生成、代码生成、科学图形编辑和多模态研究。
DaEdiTikZ is a dataset designed for training the EdiTikZ series models, containing real scientific figure editing trajectories in TikZ/LaTeX format. Each record includes a pair of source TikZ programs/rendered figures mined from revision traces on ArXiv, GitHub, and TeXStackExchange, along with bidirectional natural language editing instructions generated by the Qwen3.6-27B model. The dataset supports the task of generating edited TikZ programs from source figures and editing instructions. The released version contains 106,358 redistributable figure pairs, each providing training instances in two directions (forward and backward instructions), totaling 212,716 samples. Each sample includes the following fields: group_id (revision group identifier), source (source category), similarity_score (cosine similarity between two rendered figures, range 0.95-0.9999), file_id_i/tikz_code_i/image_i (identifier, complete source code, and rendered PNG of the first figure), file_id_j/tikz_code_j/image_j (corresponding information of the second figure), edit_instruction_forward (detailed changes describing i→j), and edit_instruction_backward (detailed changes describing j→i). The dataset is applicable to tasks such as image-to-text, text generation, code generation, scientific figure editing, and multimodal research.
DaEdiTikZ 数据集概述
DaEdiTikZ 是一个专为训练科学图表编辑模型而设计的大规模多模态数据集,聚焦于 TikZ/LaTeX 代码与渲染图像的联合编辑任务。该数据集支撑了 EdiTikZ-4B、EdiTikZ-4B-RL、EdiTikZ-9B 和 EdiTikZ-9B-RL 四个模型的训练。
核心任务
- 任务类型: 图像到文本(image-to-text)与文本生成(text-generation)
- 主要目标: 根据源图像和自然语言的编辑指令,生成编辑后的 TikZ 程序代码
数据来源与规模
- 数据来源: ArXiv、GitHub、TeXStackExchange 平台的修订轨迹
- 指令生成: 使用 Qwen3.6-27B 模型自动生成双向自然语言编辑指令
- 数据集规模: 包含 106,358 对可再分发的图像对,每个方向提供一条训练实例,总计 212,716 条样本
数据字段说明
每条记录包含一对双向编辑图像,具体字段如下:
| 字段名 | 说明 |
|---|---|
group_id |
来源特定的修订组标识符 |
source |
数据来源类别(arxiv、github 或 tex) |
similarity_score |
成对渲染图像的余弦相似度(范围 0.95–0.9999) |
file_id_i、tikz_code_i、image_i |
第一个图形的标识符、完整源代码、渲染 PNG |
file_id_j、tikz_code_j、image_j |
第二个图形的标识符、完整源代码、渲染 PNG |
edit_instruction_forward |
描述 i → j 的详细变更指令 |
edit_instruction_backward |
描述 j → i 的详细变更指令 |
编辑方向逻辑:
- 正向任务:
image_i+ 正向指令 →tikz_code_j - 反向任务:
image_j+ 反向指令 →tikz_code_i
使用方式
安装 datasets 库后即可通过 load_dataset("nllg/DaEdiTikZ", split="train") 加载数据,每条记录可直接访问相应字段获取图像、代码及编辑指令。
许可证与类别
- 许可证: apache-2.0
- 语言: 英语
- 数据规模类别: 100K<n<1M
- 标签类型: tikz、latex、code-generation、scientific-figures、image-editing、multimodal




