DocFailBench
收藏资源简介:
DocFailBench是一个面向PDF转Markdown、OCR和VLM文档解析器的失败导向基准,专注于中文和中英文文档。它通过可执行断言(如检查表格值是否在正确单元格、公式是否保留、双列页面是否按顺序读取等)进行诊断,而不是依赖模糊的页面级判断。该数据集包含多个发布版本,如DocFailBench-v0.1-combined-public-rc(116个案例/877个断言),用于社区比较和解析器评估,并提供了公开排行榜和详细文档。
DocFailBench is a failure-oriented benchmark targeting PDF-to-Markdown, OCR, and VLM document parsers, focusing on Chinese and Chinese-English bilingual documents. It conducts diagnostics via executable assertions (e.g., verifying whether table values are placed in correct cells, whether formulas are preserved, whether two-column pages are read in proper order, etc.) rather than relying on vague page-level judgments. This dataset includes multiple release versions, such as DocFailBench-v0.1-combined-public-rc (116 cases / 877 assertions), which is designed for community comparison and parser evaluation, and also provides a public leaderboard and detailed documentation.
DocFailBench 数据集概述
数据集定位与目标
DocFailBench 是一个面向失败的基准测试集,专为评估 PDF 转 Markdown、OCR 及视觉语言模型(VLM)文档解析器在中文及中英文混合文档上的表现而设计。其核心目标不是判断页面整体提取是否粗略正确,而是检查可审计的细粒度事实,例如表格值是否保留在正确单元格、公式是否完整、双栏页面阅读顺序是否正确、标题是否靠近对应图表,以及可选的边界框(bbox)元素是否将文本正确映射到页面。
核心特性
- 可执行断言:使用可执行的断言替代模糊的页面级判断,用于诊断具体故障原因。
- 可视化审查包:提供包含源页面证据的审查包。
- 解析器无关格式:采用
markdown + elements的预测格式,兼容不同解析器。 - 公众与私有评估模式:支持公开与私有两种评估模式。
- 覆盖场景:涵盖中文、混合脚本、表格、公式、阅读顺序、页面装饰(page furniture)及文本定位(grounding)等故障类型。
数据发布版本
| 发布版本 | 状态 | 最佳用途 | 规模 |
|---|---|---|---|
DocFailBench-v0.1-combined-public-rc |
冻结 RC | 推荐的社区对比基准,源数据多样性更广 | 116 个案例 / 877 个断言 |
DocFailBench-v0.1-public-real-rc |
冻结 RC | 较小的公开真实数据对比目标 | 74 个案例 / 674 个主要断言 |
DocFailBench-v0.1-non-gov-public-stage7-rc |
冻结辅助 RC | 非政府公开 PDF 压力测试 | 24 个案例 / 165 个断言 |
DocFailBench-v0.1-diagnostic |
冻结 RC | 本地回归与故障分析 | 54 个案例 / 506 个断言 |
| Stage8 non-government batch2 | 包含的审计输入 | 经二次审核,已合并至综合 RC | 18 个案例 / 38 个已接受断言 |
推荐:新的解析器提交应使用 DocFailBench-v0.1-combined-public-rc。
排行榜(部分)
Combined Public RC 排行榜(推荐目标)
- 共 116 个案例 / 877 个断言,包含 7 个缓存解析器基线。
- 排名最高的解析器为 Marker(通过 621 / 失败 256 / 得分 0.7081)。
- 来源:文档 README 中的排行榜表格。
Public-Real RC 排行榜
- 共 74 个案例 / 674 个主要断言,包含 7 个缓存解析器基线。
- 排名最高的解析器为 PyMuPDF4LLM bbox(通过 550 / 失败 124 / 得分 0.8160)。
Diagnostic 排行榜
- 共 54 个案例 / 506 个断言。
- 排名最高的解析器为 PyMuPDF4LLM bbox(通过 436 / 失败 70 / 得分 0.8617)。
Stage8 batch2 在 Combined RC 中的表现
- 共 38 个断言。
- 排名最高的解析器为 PyMuPDF bbox(通过 30 / 失败 8 / 得分 0.7895)。
常见断言类型
table_cell_exists:可见值必须保留为表单元格形式。table_grid_cell:值必须位于特定的行和列。formula_contains:公式片段在归一化后必须幸存。reading_order:两个页面局部锚点必须按预期顺序出现。caption_binding:标题必须靠近其图表或表格锚点。element_grounded:可选的 bbox/poly 元素必须将文本映射到页面。regex_absence/text_absence:页面装饰和污染检查。
预测格式
解析器提交需为 JSON 文件,每个案例一个预测对象,包含 case_id、parser、markdown、elements(可选 bbox)及 metadata 字段。
提交解析器结果
通过 GitHub Issue 或 PR 提交,需包含:
- 解析器名称、版本及安装说明。
- 确切命令或适配器清单条目。
- 预测 JSON 和结果 JSON。
- 操作系统、Python/运行时、GPU(如使用)。
- 托管模型的 API 端点系列、模型名称及运行日期。
- 机器可读的每案例包装元数据。
- 任何已知注意事项(如仅 OCR 输出或无 bbox 支持)。
本地与私有使用
支持隐私模式,该模式保留总分和故障分类计数,但会隐去断言文本、Markdown、元素、路径、消息及证据负载。
范围与限制
- 最适合用作诊断性解析器基准测试,不应作为衡量广泛 OCR 质量的唯一依据。
- 综合 RC 规模较小,尚不足以作为人口级 OCR 基准。
- 公开真实数据配置文件中政府来源占比较高。
element_grounded检查的是 bbox 的存在性,而非精确的黄金区域重叠。- 托管 VLM 结果可能因模型版本更新而产生漂移。
- 目前尚无托管排行榜服务。
路线图
- 保持单命令缓存分数验证脚本的绿色状态。
- 收集针对综合目标的第三方解析器提交。
- 为下一个版本新增 20-40 个非政府公开页面。
- 将更广泛的页面装饰检查保留在二级卫生配置文件中。
- 为
element_grounded设计更严格的区域重叠检查原型。




