Document Extraction Benchmark
收藏资源简介:
一个公开、可复现的文档数据提取头对头基准,基于真实世界的公共文档构建,包含手写验证的标签和故意设计的困难结构:行项目数组、多页表格、11种语言、从右到左和CJK脚本、旋转扫描、手写以及10种文件类型。数据集涵盖50个文档,包括发票、银行和经纪对账单、公用事业账单、年度报告、工资单、采购订单、运单、实验室和出院报告、工程图纸、保险声明、税务表格等,大多数具有至少一个数组、多页、嵌套或表格特征。
A public, reproducible head-to-head benchmark for document data extraction. Built on real-world public documents, it includes hand-validated labels and intentionally designed challenging structures: line-item arrays, multi-page tables, 11 languages, right-to-left and CJK scripts, rotated scans, handwritten content, and 10 document types. The dataset comprises 50 documents covering invoices, bank and brokerage statements, utility bills, annual reports, payrolls, purchase orders, waybills, laboratory and discharge reports, engineering drawings, insurance declarations, tax forms, and more. Most of these documents possess at least one feature such as arrays, multi-page layouts, nested structures, or tables.
DocuBench 数据集概述
DocuBench 是一个面向架构化信息提取的公开基准,专注于评估从真实世界中具有挑战性的文档中提取结构化数据的能力。该基准包含 50 份 精心挑选的真实文档,由 DocuPipe 团队维护和运营。
核心功能与挑战
- 评估目标:衡量系统在遵循给定 JSON Schema 的前提下,从文档中提取结构化字段的准确性。
- 挑战设计:文档被刻意选择以暴露真实提取系统的弱点,覆盖了以下多种困难场景:
- 数组与行项目表格 (30 份):发票、对账单等,需要提取结构化数组。
- 总数核对 (24 份):需要对小计、总计进行算术校验。
- 跨页上下文:交易和表格内容跨越分页。
- 从右至左脚本 (7 份):希伯来语和阿拉伯语的发票、工资单。
- CJK 脚本 (3 份):日语和中文的发票、收据。
- 旋转扫描件 (2 份) 与 手写体 (1 份)。
- 嵌套对象与大中取小查询。
- 十种文件类型:涵盖 PDF、JPEG、PNG、TIFF、XLSX、CSV、XML、TXT、DOCX 和 HTML。
数据规模与构成
| 特性 | 说明 |
|---|---|
| 文档数量 | 50 份公开或可自由分发的文件 |
| 文件类型 | 10 种 |
| 支持语言/脚本 | 11 种,包括英语、希伯来语、日语、中文、阿拉伯语、法语、德语、葡萄牙语、荷兰语、意大利语、西班牙语 |
| 每项任务包含 | 源文档 · JSON Schema · 人工核验的 JSON 标签 |
| 评估指标 | 宏平均字段准确率,采用不依赖顺序的数组匹配 |
评估方式与排行榜
- 评分机制:对系统输出的 JSON 对象与人工标签进行逐字段比较。字符串会进行空白、标点和大小写的标准化;数字作为浮点数比较;数组匹配不依赖元素顺序。指标为所有文档的宏平均字段准确率。
- Leaderboard (基线排名):以下排名使用公开评分器对六种系统进行评测所得,所有原始输出均记录在仓库中。
| 排名 | 系统 | 准确率 |
|---|---|---|
| 🥇 | DocuPipe — 高投入 | 97.24% |
| 🥈 | DocuPipe — 标准投入 | 96.00% |
| 3 | Gemini | 95.80% |
| 4 | GPT | 93.54% |
| 5 | Extend | 92.52% |
| 6 | Claude | 90.33% |
如何使用
- 已有系统:在仓库的
results/<系统名称>/目录下提交 JSON 输出文件,然后运行评分脚本并提交 Pull Request。评分器无需额外安装即可独立使用。 - 复现基线:仓库提供了用于运行 GPT、Claude、Gemini 和 Extend 模型的脚本。使用相应的 API 密钥即可复现基线结果。
- 探索结果:可通过开放的交互式结果浏览器 (
docubench-explorer.html) 按文档属性、语言、能力进行过滤查看,并深入分析每项文档的得分。
许可与归属
- 代码:采用 MIT 许可。
- 标签、架构与基准元数据/结果:采用 CC BY 4.0 许可。
- 文档:每份文档保留其原始许可,参见
SOURCES.md文件。
更多信息
- 详细的数据集构成与用途说明可查阅数据集卡片 (
docs/dataset-card.md)。 - 评分的完整规则与限制详见评分文档 (
docs/scoring.md)。 - 基准不衡量的方面(局限性)可查看
docs/limitations.md。




