ParseBench
收藏资源简介:
ParseBench 是一个用于评估文档解析系统的基准数据集,主要针对企业级真实文档。该数据集包含约2,000页经过人工验证的文档页面,涵盖保险、金融、政府等多个领域。数据集分为五个评估维度:表格(评估合并单元格和层次化表头的结构保真度)、图表(精确提取数据点及标签)、内容忠实度(检测遗漏、幻觉和阅读顺序错误)、语义格式(保留具有语义意义的文本格式)和视觉定位(追踪元素在页面中的精确位置)。数据集采用JSONL格式,包含169,011条测试规则,提供细粒度的诊断能力。每个数据文件对应不同评估维度:chart.jsonl(图表数据点验证)、table.jsonl(表格结构评估)、text_content.jsonl(内容忠实度规则)、text_formatting.jsonl(格式保留验证)和layout.jsonl(布局元素规则)。数据集还附带完整的评估框架,支持端到端流程评估和跨系统比较。
ParseBench is a benchmark dataset for evaluating document parsing systems, primarily targeting enterprise-grade real-world documents. This dataset contains approximately 2,000 manually verified document pages, covering multiple domains such as insurance, finance, and government. The dataset is divided into five evaluation dimensions: Table (evaluates structural fidelity of merged cells and hierarchical headers), Chart (accurately extracts data points and their labels), Content Fidelity (detects omissions, hallucinations and reading order errors), Semantic Formatting (preserves semantically meaningful text formatting) and Visual Localization (tracks the precise position of elements on a page). The dataset is stored in JSONL format, containing 169,011 test rules and providing fine-grained diagnostic capabilities. Each data file corresponds to a specific evaluation dimension: chart.jsonl (chart data point validation), table.jsonl (table structure evaluation), text_content.jsonl (content fidelity rules), text_formatting.jsonl (format preservation validation) and layout.jsonl (layout element rules). The dataset also comes with a complete evaluation framework that supports end-to-end process evaluation and cross-system comparison.
ParseBench 数据集概述
数据集基本信息
- 数据集名称:ParseBench
- 发布方:llamaindex
- 许可证:Apache 2.0
- 语言:英语 (en)
- 数据规模:100K < n < 1M
- 主要用途:评估文档解析系统,特别是针对AI智能体工作流
- 标签:document-parsing, pdf, benchmark, evaluation, tables, charts, ocr, layout-detection
核心特点
- 多维评估:基准测试分为五个能力维度——表格、图表、内容忠实度、语义格式化和视觉定位,每个维度都有针对特定任务设计的指标。
- 真实企业文档:评估集包含约2000页经过人工验证的页面,来自超过1200份公开可用的文档,涵盖保险、金融、政府等领域,难度从简单到对抗性困难不等。
- 密集测试覆盖:五个维度共计超过169K条测试规则,提供细粒度的诊断能力,可精确定位解析器故障点。
- 人工验证标注:所有标注均通过两阶段流程生成:前沿视觉语言模型自动标注,随后进行针对性人工校正。
- 评估代码套件:基准测试附带完整的评估框架,支持端到端流水线评估、按维度评分和跨流水线比较。
数据集构成与规模
| 维度 | 评估指标 | 页面数 | 文档数 | 规则数 |
|---|---|---|---|---|
| 表格 | GTRM (GriTS + TableRecordMatch) | 503 | 284 | (连续指标) |
| 图表 | ChartDataPointMatch | 568 | 99 | 4,864 |
| 内容忠实度 | Content Faithfulness Score | 506 | 506 | 141,322 |
| 语义格式化 | Semantic Formatting Score | 476 | 476 | 5,997 |
| 布局 (视觉定位) | Element Pass Rate | 500 | 321 | 16,325 |
| 总计 (去重) | 2,078 | 1,211 | 169,011 |
注:内容忠实度和语义格式化共享相同的507个底层文本文档,但使用不同的规则集进行评估。总计数字反映了去重后的页面和文档数量。表格维度使用连续指标(无离散规则)。
数据文件
数据集采用JSONL格式,每个文件对应一个评估维度:
chart.jsonl:包含4,864条图表数据点抽查规则,覆盖568页。table.jsonl:包含503个用于结构评估的真实HTML表格。text_content.jsonl:包含141,322条内容忠实度规则(遗漏、幻觉、阅读顺序),覆盖506页。text_formatting.jsonl:包含5,997条格式保留规则,覆盖476页。layout.jsonl:包含16,325条布局元素和阅读顺序规则,覆盖500页。docs/目录:包含源文档(PDF、JPG、PNG),按类别组织。
数据记录格式
每条记录为JSONL格式的一行,包含以下字段:
pdf:源文档的相对路径(PDF、JPG或PNG)。category:评估类别。id:测试规则的唯一标识符。type:规则类型(因类别而异)。rule:JSON编码的规则负载,包含评估参数。page:页码(从1开始),布局规则使用。expected_markdown:真实HTML/Markdown内容,表格规则使用。tags:文档级标签列表,用于过滤和分组。
评估维度与规则类型详情
1. 图表
- 规则类型:
chart_data_point - 描述:指定一个预期数值和一个或多个标签(系列名称、x轴类别)。如果该值及其所有关联标签能在解析器的表格输出中找到,则数据点验证通过。评估对表格方向不敏感,并容忍数字格式差异。
2. 表格
- 规则类型:
expected_markdown - 描述:提供真实HTML表格。评估使用TableRecordMatch指标,将表格视为记录的集合,匹配真实记录与预测记录,并按单元格级别的二元一致性进行评分。
3. 内容忠实度
- 规则类型:包括
missing_word_percent、unexpected_word_percent、too_many_word_occurence_percent、missing_sentence_percent、unexpected_sentence_percent、too_many_sentence_occurence_percent、bag_of_digit_percent、order、missing_specific_word、missing_specific_sentence、is_footer、is_header。 - 描述:衡量解析器是否忠实地再现文本内容,检测遗漏、幻觉和阅读顺序违规。
4. 语义格式化
- 规则类型:包括
is_bold、is_italic、is_underline、is_strikeout、is_mark、is_sup、is_sub、is_title、title_hierarchy_percent、is_latex、is_code_block。 - 描述:验证具有语义意义的格式是否被保留,例如粗体、删除线、上标/下标、标题、LaTeX和代码块。
5. 布局 (视觉定位)
- 规则类型:
layout、order - 描述:评估视觉定位,包括边界框(归一化坐标)、语义类别(文本、表格、图片、页眉、页脚)、内容关联和阅读顺序索引。
文档类别详情
图表文档 (568页)
- 来源:公司报告、财务文件和政府出版物中的条形图、折线图、饼图和复合图表。
- 多样性:包含有无明确数值标签、离散和连续序列、不同数据密度以及单图表与多图表页面的图表。
表格文档 (503页)
- 主要来源:保险文件(SERFF)、公共财务文件和政府报告。
- 特点:表格保留在其原始PDF页面中,包含合并单元格、分层表头、跨行和多页表格。
文本文档 (508页,内容忠实度与语义格式化共享)
- 结构:每份文档一页,按标签分类:
simple:带有一些样式的简单文本 (170份)ocr:扫描/图像文档,质量各异 (119份)multicolumns:1-8列,不同布局 (97份)multilang:20多种语言,涵盖所有主要文字体系 (47份)misc:不寻常的内容/布局/阅读顺序 (33份)dense:密集、大型文档(如报纸)(14份)sparse:稀疏文本内容,每页文本极少 (14份)handwritting:大量手写文本 (13份)
布局文档 (500页)
- 内容:单栏、多栏和复杂布局,包含混合媒体(文本、图像、表格、图表)。
- 输入格式:PDF、JPG和PNG。
- 评估标签集:文本、表格、图片、页眉、页脚。
相关资源
- 论文:https://arxiv.org/abs/2604.08538
- 代码仓库:https://github.com/run-llama/ParseBench
- 数据集主页:https://huggingface.co/datasets/llamaindex/ParseBench
引用
bibtex @misc{zhang2026parsebench, title={ParseBench: A Document Parsing Benchmark for AI Agents}, author={Boyang Zhang and Sebastián G. Acosta and Preston Carlson and Sacha Bron and Pierre-Loïc Doulcet and Daniel B. Ospina and Simon Suo}, year={2026}, eprint={2604.08538}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2604.08538}, }




