synthetic-table-bench
收藏资源简介:
该数据集是一个用于评估OCR和视觉语言模型(VLM)在表格文档解析性能上的合成表格基准数据集,包含206个程序生成的PDF文档及其确定性的Markdown格式真实标签。数据集分为三大类别:边缘案例表格(43个样本,用于压力测试场景)、财务布局变体(35个样本,模拟真实财务报表布局)和文档合成(128个样本,覆盖20种文档类别和6个行业,包含旋转、噪声和多页面表格等复杂情况)。数据集的特点包括确定性真实标签、可控的复杂性、可重复的基准测试以及会计一致性。数据集结构分为三个子集:layout、financial和doc,分别对应不同的测试场景。此外,数据集还提供了详细的元数据,包括文档类别、行业、旋转角度、噪声样式和难度等级。该数据集适用于图像到文本、表格问答等任务,特别适合用于文档AI、发票、审计和多页面文档处理的研究和评估。
This dataset is a synthetic table benchmark dataset for evaluating the performance of Optical Character Recognition (OCR) and Vision-Language Models (VLM) on table document parsing. It contains 206 programmatically generated PDF documents and their deterministic ground-truth labels formatted in Markdown. The dataset is divided into three core categories: 1. Edge Case Tables (43 samples, designed for stress testing scenarios) 2. Financial Layout Variants (35 samples, simulating the layouts of real financial statements) 3. Document Synthesis (128 samples, covering 20 document categories and 6 industries, with complex scenarios including rotated tables, noisy tables, and multi-page tables) Key features of this dataset include deterministic ground-truth labels, controllable complexity, reproducible benchmarking capabilities, and accounting consistency. The dataset is structured into three subsets: `layout`, `financial`, and `doc`, which correspond to distinct test scenarios respectively. Additionally, the dataset provides comprehensive metadata including document category, industry, rotation angle, noise style, and difficulty level. This dataset is suitable for tasks such as image-to-text generation and table question answering, and is particularly ideal for research and evaluation in document AI, invoice processing, audit, and multi-page document processing.
数据集概述
数据集基本信息
- 数据集名称: Synthetic Table Benchmark for PDF-to-Markdown Evaluation
- 发布者: Nace AI
- 发布日期: 2025年
- 许可协议: CC-BY-4.0
- 语言: 英语 (en)
- 数据规模: 小于1K样本 (n<1K)
任务类别与标签
- 任务类别: 图像到文本 (image-to-text)、表格问答 (table-question-answering)
- 标签: ocr、table-recognition、pdf-to-markdown、synthetic-data、financial-tables、document-ai、benchmark、invoice、audit、multi-page
数据集构成
数据集包含 206个程序生成的PDF文档,并带有确定性的真实Markdown标注,用于评估OCR和视觉语言模型在表格文档解析上的性能。
数据子集与配置
数据集提供三个配置(子集),均位于test划分下:
- layout (默认配置): 43个样本,专注于表格布局的压力测试。
- financial: 35个样本,包含现实的财务报表布局。
- doc: 128个样本,包含跨文档类别和行业的完整文档合成。
样本类别与数量
| 类别 | 样本数量 | 描述 |
|---|---|---|
| Edge-case tables | 43 | 压力测试场景:空单元格、合并表头、无边框布局、宽/长/密集表格、多级表头、稀疏数据、特殊数字格式。 |
| Financial layout variants | 35 | 现实的财务报表布局:多级表头、合并单元格、混合货币、行业特定格式、不同复杂度级别。 |
| Document synthesis | 128 | 跨20个文档类别和6个行业的完整文档式财务/审计证据,包含40个旋转样本(10-90度)、14种调色板、6种噪声预设、多页表格、徽标、印章、扫描模拟以及符合会计原则的语义。 |
数据集结构
数据存储在data/test/目录下,每个子集(layout, financial, doc)包含相同的结构:
pdfs/: PDF文件。ground_truth/: 对应的Markdown标注文件(管道表格格式)。metadata.csv: 元数据文件。
文档合成子集 (doc) 详情
128个样本覆盖3个领域、20个文档家族、6个行业,并包含旋转和多因素噪声。
关键特性:
- 任意旋转: 40个样本旋转10-90度。
- 行业特定内容: 银行业、制造业、保险业、零售业、科技业等。
- 发票行业: 科技、建筑、医疗、制造、酒店业,各有现实的行项目。
- 14种调色板: 现代企业、传统ERP、品牌发票、青色、红色、绿色、紫色、黄色、高对比度、柔和、暖色大地、衬线正式、紧凑、朴素办公。
- 6种噪声预设: 干净数字版、干净扫描版、噪声扫描版、复印版、手机拍摄版、严重退化版。
- 多因素噪声: 70多个样本结合2-5种噪声因素。
- 多页表格: 表格跨2-3页,带有重复表头。
- 强制会计语义: 资产 = 负债 + 权益、发票数学、借方 = 贷方、运行余额。
- 按类别评估: 支持通过
doc_class、industry、rotation_degrees等字段进行逐类分析。
难度分布:
- 中等: 99个样本,标准文档,内容多样,带有一些噪声。
- 困难: 8个样本,多页表格、密集布局、扩展的会计科目表。
- 对抗性: 21个样本,最大程度退化 + 旋转 + 非标准颜色。
评估指标
使用6种指标评估了13个OCR/VLM模型:
- 网格形状匹配: 模型是否检测到正确的行数和列数。
- 单元格精确匹配: 逐字符的单元格比较。
- 层次对齐: 序列对齐的行/单元格比较(容忍插入/删除)。
- 数值准确性: 财务数字精度(1%容差)。
- TEDS: 结构树比较。
- Markdown TEDS: 针对Markdown管道表格的专用TEDS,带有部分信用。
已评估模型
- Datalab Marker
- Chandra OCR 2
- Qwen 2.5 VL (多个版本)
- NaceOCR
- GLM OCR
- Nemotron-Parse 1.1
- LlamaParse
使用方式
可通过Hugging Face datasets库加载特定子集,或使用pandas读取本地元数据文件。
引用格式
@dataset{nace_synthetic_table_bench_2025, title={Synthetic Table Benchmark for PDF-to-Markdown Evaluation}, author={Nace AI}, year={2025}, url={https://huggingface.co/datasets/roma2025/synthetic-table-bench} }




