DocMark-Pile and DocMark-Instruct
收藏资源简介:
DocMark-Pile是一个包含大约380万个文档解析预训练数据对的数据集,旨在将文档转换为相应的标记语言,包括纯文本、Markdown、LaTeX、HTML、JSON和TiKZ。DocMark-Instruct是一个包含62.4万个细粒度结构化数据集,用于在上下文中进行指令跟随。这些数据集涵盖了自然场景图像、密集文档、收据、LaTeX公式、网页、表格、图表和数学图表等多种类型的视觉文档,旨在帮助模型更好地理解和处理复杂文档格式。
DocMark-Pile is a dataset containing approximately 3.8 million document parsing pre-training data pairs, designed to convert documents into corresponding markup languages including plain text, Markdown, LaTeX, HTML, JSON, and TiKZ. DocMark-Instruct is a fine-grained structured dataset with 624,000 instances, tailored for in-context instruction following. These two datasets cover a diverse range of visual document types such as natural scene images, dense documents, receipts, LaTeX formulas, webpages, tables, diagrams, and mathematical charts, aiming to help models better understand and handle complex document formats.
DocMark数据集概述
数据集简介
- 名称: DocMark
- 类型: 视觉文档理解数据集
- 用途: 用于文档解析和上下文基础指令跟随的视觉文档理解任务
- 特点: 采用自适应标记语言生成技术构建高度结构化的文档表示
数据集组成
1. DocMark-Pile
- 样本量: 3.8M
- 用途: 预训练数据
- 内容类型:
- Plain Text: 自然照片和区域文本图像
- Markdown: 密集文本文档和表格
- LaTeX: 数学教科书和手写公式
- HTML: 网页和网页摘要
- JSON: 图表、收据和表格中的关键信息提取
- TikZ: 科学和几何图表
2. DocMark-Instruct
- 样本量: 624k
- 用途: 微调数据
- 特点: 包含链式思维推理注释,用于上下文基础指令跟随
关键特性
- 自适应生成多种标记语言(Markdown/JSON/HTML/TiKZ)
- 保留丰富的语义和布局信息
- 针对不同文档类型选择最合适的标记语言
性能表现
| 模型 | LLM大小 | TextVQA | DocVQA | InfoVQA | ChartQA | AI2D | OCRBench | WebQA | MathVision |
|---|---|---|---|---|---|---|---|---|---|
| DocMark-2B | 2B | 74.8 | 87.8 | 61.2 | 79.8 | 82.5 | 813 | 70.1 | 18.8 |
| DocMark-8B | 8B | 78.0 | 89.8 | 68.3 | 84.2 | 86.2 | 823 | 78.9 | 21.1 |
使用方式
训练
bash
在DocMark-Pile上进行预训练
bash exps/docmark_pretrain_2b.sh
在DocMark-Instruct上进行微调
bash exps/docmark_finetune_2b.sh
相关资源
- 基础架构: InternVL
- 训练框架: SWIFT
- 基准评估: VLMEvalKit




