遇见数据集

DaEdiTikZ

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

DaEdiTikZ是一个用于训练EdiTikZ系列模型的数据集,包含真实的科学图形编辑轨迹,使用TikZ/LaTeX格式。每条记录包含一对从ArXiv、GitHub和TeXStackExchange的修订轨迹中挖掘的源TikZ程序/渲染图形,以及由Qwen3.6-27B模型生成的双向自然语言编辑指令。数据集支持从源图形和编辑指令生成编辑后的TikZ程序的任务。发布版本包含106,358个可再分发的图形对,每个对提供两个方向的训练实例(前向和后向指令),共212,716个样本。每个样本包含以下字段:group_id(修订组标识符)、source(来源类别)、similarity_score(两图形余弦相似度,范围0.95-0.9999)、file_id_i/tikz_code_i/image_i(第一个图形的标识符、代码和渲染PNG)、file_id_j/tikz_code_j/image_j(第二个图形的对应信息)、edit_instruction_forward(描述i→j的变化)和edit_instruction_backward(描述j→i的变化)。数据集适用于图像到文本、文本生成、代码生成、科学图形编辑和多模态研究。

DaEdiTikZ is a dataset designed for training the EdiTikZ series models, containing real scientific figure editing trajectories in TikZ/LaTeX format. Each record includes a pair of source TikZ programs/rendered figures mined from revision traces on ArXiv, GitHub, and TeXStackExchange, along with bidirectional natural language editing instructions generated by the Qwen3.6-27B model. The dataset supports the task of generating edited TikZ programs from source figures and editing instructions. The released version contains 106,358 redistributable figure pairs, each providing training instances in two directions (forward and backward instructions), totaling 212,716 samples. Each sample includes the following fields: group_id (revision group identifier), source (source category), similarity_score (cosine similarity between two rendered figures, range 0.95-0.9999), file_id_i/tikz_code_i/image_i (identifier, complete source code, and rendered PNG of the first figure), file_id_j/tikz_code_j/image_j (corresponding information of the second figure), edit_instruction_forward (detailed changes describing i→j), and edit_instruction_backward (detailed changes describing j→i). The dataset is applicable to tasks such as image-to-text, text generation, code generation, scientific figure editing, and multimodal research.

创建时间:
2026-09-08
原始信息汇总

DaEdiTikZ 数据集概述

DaEdiTikZ 是一个专为训练科学图表编辑模型而设计的大规模多模态数据集,聚焦于 TikZ/LaTeX 代码与渲染图像的联合编辑任务。该数据集支撑了 EdiTikZ-4BEdiTikZ-4B-RLEdiTikZ-9BEdiTikZ-9B-RL 四个模型的训练。

核心任务

  • 任务类型: 图像到文本(image-to-text)与文本生成(text-generation)
  • 主要目标: 根据源图像和自然语言的编辑指令,生成编辑后的 TikZ 程序代码

数据来源与规模

  • 数据来源: ArXiv、GitHub、TeXStackExchange 平台的修订轨迹
  • 指令生成: 使用 Qwen3.6-27B 模型自动生成双向自然语言编辑指令
  • 数据集规模: 包含 106,358 对可再分发的图像对,每个方向提供一条训练实例,总计 212,716 条样本

数据字段说明

每条记录包含一对双向编辑图像,具体字段如下:

字段名 说明
group_id 来源特定的修订组标识符
source 数据来源类别(arxivgithubtex
similarity_score 成对渲染图像的余弦相似度(范围 0.95–0.9999)
file_id_itikz_code_iimage_i 第一个图形的标识符、完整源代码、渲染 PNG
file_id_jtikz_code_jimage_j 第二个图形的标识符、完整源代码、渲染 PNG
edit_instruction_forward 描述 i → j 的详细变更指令
edit_instruction_backward 描述 j → i 的详细变更指令

编辑方向逻辑:

  • 正向任务: image_i + 正向指令 → tikz_code_j
  • 反向任务: image_j + 反向指令 → tikz_code_i

使用方式

安装 datasets 库后即可通过 load_dataset("nllg/DaEdiTikZ", split="train") 加载数据,每条记录可直接访问相应字段获取图像、代码及编辑指令。

许可证与类别

  • 许可证: apache-2.0
  • 语言: 英语
  • 数据规模类别: 100K<n<1M
  • 标签类型: tikz、latex、code-generation、scientific-figures、image-editing、multimodal
搜集汇总
数据集介绍
DaEdiTikZ 数据集图片
构建方式
DaEdiTikZ数据集的构建植根于科研图表编辑的真实轨迹,其数据源自ArXiv、GitHub及TeXStackExchange等平台的修订历史,通过挖掘成对出现的TikZ程序及其渲染图像,捕捉科学图表在迭代演化中的细微变更。利用Qwen3.6-27B模型为每对图像双向生成自然语言编辑指令,形成正向与反向两种编辑路径,从而构建出包含106,358对可再分发图像对、总计212,716个训练样本的大规模数据集。每个样本记录包含源图像、目标图像、对应的TikZ代码、编辑指令及来源分类,构建流程严谨且注重数据的真实性与多样性,为多模态编辑模型的训练提供了坚实的数据基础。
特点
DaEdiTikZ数据集的核心特征在于其独特的双向结构,每对图像不仅提供从源到目标的编辑指令,还包含反向指令,有效扩充了训练样本的多样性。数据来源的广泛性(涵盖学术论文、开源代码库及技术问答社区)确保了科学图表的风格多样性与复杂度层次。相似度分数(介于0.95至0.9999)作为质量控制指标,保证了配对图像的视觉关联性,使编辑任务具有明确的语义对应关系。此外,数据集完整保留了TikZ源程序,支持从图像到代码的生成任务,以及代码层面的细粒度编辑,具有极高的研究与应用价值。
使用方法
使用该数据集时,研究者可通过HuggingFace的datasets库便捷加载,指定数据集标识符即获得训练划分。每条记录内含丰富的字段,可灵活构建不同方向的编辑任务:既可利用源图像与正向指令生成目标TikZ代码,也可利用反向指令实现逆编辑,适用于图像编辑、代码生成及多模态推理等研究场景。数据集的分组标识与来源分类便于进行子集筛选,以适配特定领域或难度需求。通过Python脚本,用户能轻松访问图像与指令数据,结合流行的深度学习框架进行模型训练与评估,是科学图表自动编辑与TikZ代码生成研究的理想资源。
背景与挑战
背景概述
DaEdiTikZ数据集由多模态与程序合成领域的研究者于近期构建,整合了来自ArXiv、GitHub及TeX StackExchange的TikZ/LaTeX修订轨迹。其核心研究问题在于赋予模型对科学示意图进行语义级编辑的能力,即依据自然语言指令生成修正后的TikZ代码。该数据集通过双重方向配对与指令生成,支撑了EdiTikZ系列多模态大模型的训练,推动了文本引导的图形编辑技术发展,对科学文档自动化与教育辅助具有一定影响力。
当前挑战
领域挑战涉及从视觉与文本模态到代码序列的复杂映射,模型需理解源图像中科学元素的语义关系并精确修改TikZ语法,摒弃了传统低层像素编辑的局限。构建过程中,需从异构来源挖掘成对修订,确保版本间渲染图像相似度高于0.95,并利用合成指令生成双向自然语言描述,克服了代码差异阐释模糊、指令多样性与跨源一致性等问题。最终达成106K对数据,但稀少版式与复杂拓扑仍构成严峻考验。
常用场景
经典使用场景
DaEdiTikZ数据集聚焦于科学图形编辑与代码生成这一交叉领域,其经典用途在于驱动多模态模型根据自然语言指令对TikZ/LaTeX源码及其渲染图像进行精准编辑。具体而言,该数据集为每对图像提供双向编辑指令与对应的目标代码,支持从源图像与编辑指令生成目标TikZ程序的任务范式。这种设计使得研究者能够训练模型理解图像与代码之间的语义映射,进而实现基于指令的图形修改。该场景广泛应用于科学论文插图、技术文档及学术报告中的图形自动化编辑,是连接视觉信息与程序化描述的核心数据基石。
实际应用
在实际应用中,DaEdiTikZ所训练的模型可直接用于科研工作流中的图形快速迭代,例如学者仅需输入对现有图表的修改描述,如“将红色曲线改为虚线并添加误差棒”,模型即自动产出对应的TikZ代码并渲染出更新后的图像。这不仅大幅缩短了论文配图的调整周期,也降低了非专业用户使用LaTeX绘图的门槛。此外,该技术可集成于交互式文档编辑器或在线协作平台,实现图形与文本的同步智能修改。在出版与教育领域,其可辅助自动生成可编辑的教科书插图,或将静态图表转化为可动态展示的交互式版本,显著提升知识传播效率。
衍生相关工作
基于DaEdiTikZ,研究团队已成功训练出EdiTikZ-4B与EdiTikZ-9B等一系列视觉-语言模型,并引入强化学习(RL)微调版本,验证了该数据集在提升指令遵循与编辑精确性方面的有效性。这一数据构建范式启发了更多关于多模态代码生成与图形编辑的数据集设计,推动了TikZ/LaTeX自动生成研究从单一文本生成向图像-指令协同编辑扩展。后续工作可能探索将该数据集的编辑轨迹思想迁移至其他图形语言(如SVG、PGFPlots),或将其与更强大的世界模型结合,以实现对复杂科学图表更深层的语义理解与自动优化,进一步丰富智能文档生成的技术生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务