遇见数据集

DocFailBench

收藏
github2026-05-09 更新2026-06-09 收录
官方服务:

资源简介:

DocFailBench是一个面向PDF转Markdown、OCR和VLM文档解析器的失败导向基准,专注于中文和中英文文档。它通过可执行断言(如检查表格值是否在正确单元格、公式是否保留、双列页面是否按顺序读取等)进行诊断,而不是依赖模糊的页面级判断。该数据集包含多个发布版本,如DocFailBench-v0.1-combined-public-rc(116个案例/877个断言),用于社区比较和解析器评估,并提供了公开排行榜和详细文档。

DocFailBench is a failure-oriented benchmark targeting PDF-to-Markdown, OCR, and VLM document parsers, focusing on Chinese and Chinese-English bilingual documents. It conducts diagnostics via executable assertions (e.g., verifying whether table values are placed in correct cells, whether formulas are preserved, whether two-column pages are read in proper order, etc.) rather than relying on vague page-level judgments. This dataset includes multiple release versions, such as DocFailBench-v0.1-combined-public-rc (116 cases / 877 assertions), which is designed for community comparison and parser evaluation, and also provides a public leaderboard and detailed documentation.

创建时间:
2026-05-09
原始信息汇总

DocFailBench 数据集概述

数据集定位与目标

DocFailBench 是一个面向失败的基准测试集,专为评估 PDF 转 Markdown、OCR 及视觉语言模型(VLM)文档解析器在中文及中英文混合文档上的表现而设计。其核心目标不是判断页面整体提取是否粗略正确,而是检查可审计的细粒度事实,例如表格值是否保留在正确单元格、公式是否完整、双栏页面阅读顺序是否正确、标题是否靠近对应图表,以及可选的边界框(bbox)元素是否将文本正确映射到页面。

核心特性

  • 可执行断言:使用可执行的断言替代模糊的页面级判断,用于诊断具体故障原因。
  • 可视化审查包:提供包含源页面证据的审查包。
  • 解析器无关格式:采用 markdown + elements 的预测格式,兼容不同解析器。
  • 公众与私有评估模式:支持公开与私有两种评估模式。
  • 覆盖场景:涵盖中文、混合脚本、表格、公式、阅读顺序、页面装饰(page furniture)及文本定位(grounding)等故障类型。

数据发布版本

发布版本 状态 最佳用途 规模
DocFailBench-v0.1-combined-public-rc 冻结 RC 推荐的社区对比基准,源数据多样性更广 116 个案例 / 877 个断言
DocFailBench-v0.1-public-real-rc 冻结 RC 较小的公开真实数据对比目标 74 个案例 / 674 个主要断言
DocFailBench-v0.1-non-gov-public-stage7-rc 冻结辅助 RC 非政府公开 PDF 压力测试 24 个案例 / 165 个断言
DocFailBench-v0.1-diagnostic 冻结 RC 本地回归与故障分析 54 个案例 / 506 个断言
Stage8 non-government batch2 包含的审计输入 经二次审核,已合并至综合 RC 18 个案例 / 38 个已接受断言

推荐:新的解析器提交应使用 DocFailBench-v0.1-combined-public-rc

排行榜(部分)

Combined Public RC 排行榜(推荐目标)

  • 共 116 个案例 / 877 个断言,包含 7 个缓存解析器基线。
  • 排名最高的解析器为 Marker(通过 621 / 失败 256 / 得分 0.7081)。
  • 来源:文档 README 中的排行榜表格。

Public-Real RC 排行榜

  • 共 74 个案例 / 674 个主要断言,包含 7 个缓存解析器基线。
  • 排名最高的解析器为 PyMuPDF4LLM bbox(通过 550 / 失败 124 / 得分 0.8160)。

Diagnostic 排行榜

  • 共 54 个案例 / 506 个断言。
  • 排名最高的解析器为 PyMuPDF4LLM bbox(通过 436 / 失败 70 / 得分 0.8617)。

Stage8 batch2 在 Combined RC 中的表现

  • 共 38 个断言。
  • 排名最高的解析器为 PyMuPDF bbox(通过 30 / 失败 8 / 得分 0.7895)。

常见断言类型

  • table_cell_exists:可见值必须保留为表单元格形式。
  • table_grid_cell:值必须位于特定的行和列。
  • formula_contains:公式片段在归一化后必须幸存。
  • reading_order:两个页面局部锚点必须按预期顺序出现。
  • caption_binding:标题必须靠近其图表或表格锚点。
  • element_grounded:可选的 bbox/poly 元素必须将文本映射到页面。
  • regex_absence / text_absence:页面装饰和污染检查。

预测格式

解析器提交需为 JSON 文件,每个案例一个预测对象,包含 case_idparsermarkdownelements(可选 bbox)及 metadata 字段。

提交解析器结果

通过 GitHub Issue 或 PR 提交,需包含:

  • 解析器名称、版本及安装说明。
  • 确切命令或适配器清单条目。
  • 预测 JSON 和结果 JSON。
  • 操作系统、Python/运行时、GPU(如使用)。
  • 托管模型的 API 端点系列、模型名称及运行日期。
  • 机器可读的每案例包装元数据。
  • 任何已知注意事项(如仅 OCR 输出或无 bbox 支持)。

本地与私有使用

支持隐私模式,该模式保留总分和故障分类计数,但会隐去断言文本、Markdown、元素、路径、消息及证据负载。

范围与限制

  • 最适合用作诊断性解析器基准测试,不应作为衡量广泛 OCR 质量的唯一依据。
  • 综合 RC 规模较小,尚不足以作为人口级 OCR 基准。
  • 公开真实数据配置文件中政府来源占比较高。
  • element_grounded 检查的是 bbox 的存在性,而非精确的黄金区域重叠。
  • 托管 VLM 结果可能因模型版本更新而产生漂移。
  • 目前尚无托管排行榜服务。

路线图

  1. 保持单命令缓存分数验证脚本的绿色状态。
  2. 收集针对综合目标的第三方解析器提交。
  3. 为下一个版本新增 20-40 个非政府公开页面。
  4. 将更广泛的页面装饰检查保留在二级卫生配置文件中。
  5. element_grounded 设计更严格的区域重叠检查原型。
搜集汇总
数据集介绍
DocFailBench 数据集图片
构建方式
在文档解析技术飞速发展的当下,精准定位解析器的细粒度失效模式成为提升系统鲁棒性的关键。DocFailBench 数据集应此需求而生,其构建跳脱了传统粗粒度相似度评估的窠臼,转而聚焦于可执行断言的精细化设计。数据集的采样来源涵盖政府公开文件、学术出版库如 OpenStax、ACL Anthology 及 PMC/PeerJ 等多元渠道,经由人工严格审阅与二次验证筛选出包含中英文混排文档的测试案例。每个案例均包含若干原子断言,通过将解析器输出的归一化 Markdown 与可选空间元素对齐至这些断言进行检验,最终形成具备诊断能力的基准评估框架。
特点
DocFailBench 的核心特质在于其对文档解析器失效模式的精准捕获能力。与传统基准依赖模糊页面相似度不同,该数据集通过表格单元格存在性、网格坐标保持、公式符号存活、阅读顺序合规、图题邻近关系以及边界框元素地面实况等七类可执行断言,实现了对解析错误的微观审计。数据集以模块化版本管理,为社区对比、本地回测及非政府来源压力测试分别提供独立配置,其公开排行榜已收录七种主流解析器的基线成绩,涵盖传统 OCR、视觉语言模型及混合方案,具有高度的诊断特异性和可扩展性。
使用方法
DocFailBench 的使用流程简洁且具备强可复现性。用户可通过命令行工具对预测文件进行评估,执行评估指令时传入案例文件与解析器输出即可获得结构化的通过/失败结果。支持端到端解析器适配器运行,一键生成包含源元数据、断言结果与证据截图的 HTML 报告。提交解析器结果需遵循标准化预测格式,包含案例标识、解析器名称、Markdown 文本、可选空间元素及运行元数据。数据集同时提供公共与私有两种评估模式,私有模式在保护数据隐私的前提下仍能输出聚合得分与失效分类统计,适用于本地回归分析与商业敏感场景。
背景与挑战
背景概述
DocFailBench诞生于2025年,由专注于文档解析质量诊断的研究社区构建,旨在填补现有OCR与文档解析基准评估中的细粒度诊断空白。该基准的核心研究问题在于超越传统的聚合相似度指标,转向对中文及中英文混合文档解析过程中的具体失败案例进行可执行断言式评测。通过引入基于事实、可审计的检查项(如表格值位置保持、公式完整性、双栏阅读顺序、图注绑定以及边界框元素对齐),DocFailBench为解析器开发者提供了一种面向故障的精确诊断工具,其影响力体现在从源头定位解析错误的范式转变上。
当前挑战
DocFailBench所解决的领域挑战聚焦于现有基准无法精准识别解析器具体失效点的痛点,例如如何确保PDF转换后的表格单元格内数值不被错位、公式符号在结构上幸存、以及多栏文档的阅读逻辑顺序正确。构建过程中的挑战则包括:从政府与非政府来源中精心筛选并审核真实的公共PDF样本,设计跨解析器通用的预测格式(Markdown与空间元素),并维护一个包含多种断言类型(如table_grid_cell、formula_contains、element_grounded)的可执行脚本库,以确保评测的客观性与重现性。此外,如何平衡样本规模的诊断效用与构建成本,以及应对托管VLM模型版本漂移带来的结果波动,亦是持续面临的难题。
常用场景
经典使用场景
在文档解析与光学字符识别(OCR)领域,DocFailBench被设计为一种以失败为导向的诊断型基准测试。与传统的仅输出聚合相似度分数的评估方法不同,该数据集聚焦于对PDF至Markdown转换、OCR及视觉语言模型(VLM)在中文与中英混合文档上的逐项细粒度断言。其经典使用场景包括验证表格数值是否保留在正确单元格内、公式片段是否完整存活、双栏页面阅读顺序是否正确、题注是否紧邻图表,以及可选边界框元素是否将文本锚定至页面。通过执行可自动化断言的检查包,DocFailBench使得开发者能够精确定位解析器在特定结构化或语义环节上的失败点,从而取代模糊的页面级主观判断。
解决学术问题
DocFailBench系统性地解决了现有文档解析评测中普遍存在的诊断能力匮乏问题。传统基准测试常依赖BLEU、ROUGE或字符错误率等全局度量,这些指标难以揭示错误的具体性质与位置,尤其在中英文混排、复杂表格、数学公式及页面布局多样性等场景下,聚合分数往往掩盖了关键的局部失败。该数据集通过提出可审计的原子化断言,将评估从“页面看起来是否正确”转化为“每个可核查的事实是否成立”,从而为研究者提供了一种区分解析器在阅读顺序、版面元素绑定、噪声过滤等方面弱点的量化工具。其意义在于推动了文档理解领域从粗粒度评分向细粒度、可归因的诊断评估范式的转变,显著提升了基准测试在开发流程中的实用价值。
衍生相关工作
DocFailBench的发布催生了一系列围绕文档解析评估与优化展开的衍生工作。其中,基于其诊断断言框架,研究者开发了专用于版面元素绑定检测的`element_grounded`配置文件,并进一步探索了更加严格的边界框区域重叠度量,以替代当前仅检查存在性的阈值方法。此外,该数据集的非政府公共子集(Stage7与Stage8)促进了针对学术出版(如OpenStax、ACL Anthology、PMC/PeerJ)与教科书布局的二次评测,推动了针对特定排版样式的解析器适配工作。在社区层面,DocFailBench的可复现性脚本与缓存预测机制催生了一套标准化的解析器提交与比对流程,多家机构基于此基准发布了自身模型的改进报告,形成了以逐项可审计断言为核心的文档解析质量改进闭环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务