遇见数据集

tikz-dataset

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

该数据集是一个经过清洗和扩展的图像-TikZ代码对集合,专门用于训练和评估图像到TikZ转换模型。数据集整合并处理了来自DaTikZ-V4和GeoTikz-Base两个开源数据集的样本,同时使用DaTikZ仓库的脚本收集了额外样本以扩展数据规模。在数据清洗过程中,重点解决了原始数据中图像与代码内容不对齐的问题:通过编译TikZ和LaTeX源文件,移除了所有生成多页PDF的样本(因为存储的图像通常只包含第一页);针对GeoTikz-Base中因缺少必要LaTeX包或TikZ库而导致渲染错误的图形,使用更完整的LaTeX环境进行了重新渲染;同时清除了GeoTikz响应字段中的Markdown代码围栏,确保代码字段仅包含原始的LaTeX或TikZ源代码。数据集包含四个子集:datikz_v4(来自DaTikZ-V4的清洗后样本)、geotikz_bridge_base(来自GeoTikz-Base的清洗和重新渲染样本)、our_dataset_train(额外收集的训练样本)和our_dataset_benchmark(用于模型评估的保留样本)。每个样本包含四个字段:二进制格式的image_with_text、字符串格式的code_with_text、字符串格式的vlm_description以及表示数据来源的字符串字段source。数据集总大小约为241MB,下载大小约为214MB。该数据集适用于图像到TikZ模型训练、多模态微调和模型性能基准测试等任务。

This dataset is a cleaned and expanded collection of image-TikZ code pairs, specifically designed for training and evaluating image-to-TikZ conversion models. It integrates and processes samples from two open-source datasets, DaTikZ-V4 and GeoTikz-Base, while also collecting additional samples using scripts from the DaTikZ repository to expand the data scale. During the data cleaning process, key issues such as misalignment between images and code content in the original data were addressed: by compiling TikZ and LaTeX source files, all samples that generated multi-page PDFs were removed (as stored images typically only include the first page); for graphics in GeoTikz-Base that rendered incorrectly due to missing necessary LaTeX packages or TikZ libraries, re-rendering was performed using a more complete LaTeX environment; additionally, Markdown code fences in the GeoTikz response fields were cleared to ensure that the code fields contain only raw LaTeX or TikZ source code. The dataset includes four subsets: datikz_v4 (cleaned samples from DaTikZ-V4), geotikz_bridge_base (cleaned and re-rendered samples from GeoTikz-Base), our_dataset_train (additional training samples collected), and our_dataset_benchmark (reserved samples for model evaluation). Each sample contains four fields: binary image_with_text, string code_with_text, string vlm_description, and a string field source indicating the data origin. The total dataset size is approximately 241MB, with a download size of about 214MB. This dataset is suitable for tasks such as image-to-TikZ model training, multimodal fine-tuning, and model performance benchmarking.

创建时间:
2026-07-15
原始信息汇总

数据集概述

该数据集是一个经过清洗和扩展的图像与 TikZ 代码配对集合,用于训练和评估图像到 TikZ 模型的性能。

数据来源

  • DaTikZ-V4:从 DaTikZ-V4 数据集获取。
  • GeoTikz-Base:从 GeoTikz-Base 数据集获取。
  • 额外样本:使用 DaTikZ 创建者提供的脚本收集,脚本来源为 DaTikZ 仓库

数据清洗

  • 移除了生成多页 PDF 的样本,确保图像与目标代码内容一致。
  • 对 GeoTikz-Base 中因缺少 LaTeX 包或 TikZ 库而渲染错误的图形,使用更完整的 LaTeX 环境重新渲染。
  • 移除了 GeoTikz 响应字段中的 Markdown 代码围栏,使该字段仅包含原始的 LaTeX 或 TikZ 源代码。

数据集划分

  • datikz_v4:来自 DaTikZ-V4 的清洗样本。
  • geotikz_bridge_base:来自 GeoTikz-Base 的清洗和重新渲染样本。
  • our_dataset_train:额外收集的训练样本。
  • our_dataset_benchmark:用于模型评估的保留样本。

数据集特征

  • image_with_text:二进制类型,存储图像和文本数据。
  • code_with_text:字符串类型,存储代码和文本数据。
  • vlm_description:字符串类型,存储视觉语言模型描述。
  • source:字符串类型,标注数据来源。

数据集规模

  • 下载大小:213,757,608 字节
  • 数据集大小:241,053,589 字节

预期用途

  • 图像到 TikZ 模型的训练
  • 多模态微调
  • 模型基准测试
搜集汇总
数据集介绍
tikz-dataset 数据集图片
构建方式
随着图像到代码生成领域的蓬勃发展,高质量配对数据集的构建成为模型训练的关键瓶颈。该数据集通过系统性的数据清洗与扩展流程,整合了DaTikZ-V4与GeoTikz-Base两大既有资源,并借助DaTikZ官方脚本补充采集新样本。在构建过程中,研究者重点解决了原始数据中因LaTeX多页PDF导致的图文不对齐问题,通过编译所有TikZ与LaTeX源文件,剔除生成超过一页的样本,显著提升了图文一致性。针对GeoTikz-Base中因缺失LaTeX宏包或TikZ库导致的渲染错误,团队采用更完整的LaTeX环境重新渲染图像。此外,代码字段中的Markdown代码围栏被移除,确保最终仅保留纯净的LaTeX或TikZ源码。最终数据集划分为经过清洗的DaTikZ-V4子集、重新渲染的GeoTikz-Base子集、额外采集的训练集与留作评估的基准集。
特点
该数据集的核心特点在于对图像与TikZ代码对齐质量的严格把控,通过剔除多页PDF样本与重新渲染错误图像,有效减少了训练数据中的噪声。数据来源的多样性覆盖了不同复杂度的TikZ图形,从基础几何图形到高级矢量插图,为模型提供了丰富的学习素材。代码字段经过标准化处理,去除冗余格式,仅保留可编译的原始源码,降低了模型解析难度。数据集明确划分为训练集与基准集,其中基准集包含独立留出的评估样本,支持公平的模型性能对比。此外,数据集格式简洁,每项包含图像二进制数据、代码字符串、多模态描述文本及来源标签,便于直接用于图像到代码的端到端训练。
使用方法
该数据集专为图像到TikZ代码生成任务设计,适用于训练图像理解与代码生成结合的深度学习模型。使用时,研究者可直接加载HuggingFace上的parquet格式文件,其中图像以二进制形式存储,代码为纯文本字符串。为获得最佳效果,建议将数据集的三个主要子集(datikz_v4、geotikz_bridge_base、our_dataset_train)合并用于模型训练,而our_dataset_benchmark子集应严格留作评估。训练过程中,模型需学习从图像中解析几何结构,并输出对应的TikZ代码,因此推荐采用编码器-解码器架构,其中视觉编码器处理图像,文本解码器生成代码序列。研究者还可利用vlm_description字段进行多模态提示学习,或结合source字段分析不同数据源对模型性能的影响。
背景与挑战
背景概述
TikZ是一种基于LaTeX的矢量图形描述语言,广泛应用于学术论文、技术文档和科学插图中,以其精确的坐标控制和高质量的渲染效果著称。然而,从视觉图像自动生成对应的TikZ代码(即Image-to-TikZ任务)是近年来多模态学习与程序合成交叉领域的前沿难题。为解决这一任务中训练数据匮乏且质量参差不齐的问题,研究者构建了tikz-dataset数据集,该数据集由达姆施塔特工业大学等机构的研究人员于2024年发布。其核心研究问题在于如何获得大规模、高对齐度的图像–TikZ代码配对数据,以支撑图像到代码的模型训练与评估。该数据集整合了DaTikZ-V4与GeoTikz-Base两个来源的样本,并进行了严格的清洗与扩充,对推动符号化图示理解、文档自动化生成等方向具有重要影响。
当前挑战
Image-to-TikZ任务面临的首要领域挑战是图像与代码之间的语义鸿沟:TikZ代码本质上是带有几何约束与逻辑结构的程序,而图像仅是渲染结果,模型需同时理解视觉布局与编程逻辑。此外,数据集构建过程中遇到了两大具体挑战:其一,部分LaTeX源文件编译生成多页PDF,而存储的图像仅包含第一页,导致图像与代码内容不匹配;其二,GeoTikz-Base中部分图片因缺失必要的LaTeX宏包或TikZ库而渲染错误,需重新搭建更完整的编译环境进行渲染。为应对这些问题,研究人员逐样本编译验证,剔除多页样本,并重新渲染修复后的代码,同时移除冗余的Markdown代码标记,确保数据的纯净与对齐。
常用场景
经典使用场景
TikZ是一种基于LaTeX的矢量图形描述语言,广泛应用于学术论文中绘制高质量的科学插图。tikz-dataset数据集汇聚了经过清洗与扩展的图像-TikZ代码对,为图像到TikZ代码的自动生成模型提供了标准化的训练与评估素材。该数据集最经典的用途在于支持基于视觉输入的代码生成任务,即模型通过观察图像内容,自动输出对应的TikZ绘图指令。这不仅降低了研究人员手工编写复杂图形代码的负担,也为计算机图形学与自然语言处理交叉领域的研究提供了基准平台。借助该数据集,研究者能够训练出从视觉到结构化绘图语言映射的模型,推动科学插图自动化生成技术的发展。
实际应用
在实际应用中,tikz-dataset赋能了多项自动化工具的开发。科研人员可以利用基于该数据集训练的模型,将手绘草图或文献中的截图快速转化为可编辑的TikZ代码,极大提升了论文插图的制作效率。在教育教学领域,该数据集支持的模型能够帮助学生将抽象的数学或物理图形表达转换为规范的LaTeX代码,辅助算法可视化与教材编写。此外,在工业文档生成场景中,该数据集训练的模型能自动将产品示意图转化为矢量化描述,便于技术文档的标准化排版与版本管理。这些应用显著降低了人工编码的重复性劳动,加速了从视觉构思到成品图形的转化链路。
衍生相关工作
tikz-dataset的构建延续并改进了已有的经典工作,其灵感源自DaTikZ和GeoTikz-Base这两个先驱性数据集。DaTikZ率先建立了图像到TikZ代码的大规模配对集合,GeoTikz-Base则专注于几何图形的代码生成任务。在此基础上,tikz-dataset通过严格的过滤机制移除多页PDF样本,并补充了更多训练与测试样本,形成了更高质量的基准。该数据集还催生了一系列后续研究,例如基于视觉语言模型的微调工作、图像-代码对齐评估基准的完善,以及端到端图像到TikZ翻译系统的开发。这些衍生工作共同构筑了从数据到模型再到应用的完整研究生态,持续推动着科学图形自动化领域的边界拓展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务