DocuBench
收藏数据链接:
官方服务:
资源简介:
DocuBench是一个公共基准测试,用于从50个困难、真实世界的文档中进行模式引导的结构化提取。它包含手写验证的标签、模式、独立评分器和每文档结果,支持多语言、多格式文档,旨在评估文档AI系统在复杂场景下的性能。
DocuBench is a public benchmark for schema-guided structured extraction, built from 50 challenging real-world documents. It includes manually validated labels, schemas, independent scorers and per-document results, supports multilingual and multi-format documents, and aims to evaluate the performance of document AI systems in complex scenarios.
创建时间:
2026-06-23
原始信息汇总
DocuBench 数据集概述
DocuBench 是一个用于模式引导的结构化提取的公开基准测试集,包含 50 份高难度的真实文档。该基准由 DocuPipe 构建和维护。
核心目标
- 评估文档 AI 提取系统在真实世界复杂文档上的表现。
- 针对常见但棘手的失败模式(如多行数组、跨页表格、手写体、多种脚本等)进行压力测试。
数据集规模与构成
- 文档数量:50 份公开或可自由分发的文件。
- 文件类型:10 种,包括 PDF、JPEG、PNG、TIFF、XLSX、CSV、XML、TXT、DOCX、HTML。
- 语言/脚本:11 种,包括英语、希伯来语、日语、中文、阿拉伯语、法语、德语、葡萄牙语、荷兰语、意大利语、西班牙语。
具有挑战性的场景
每份文档都针对特定的失败模式设计:
- 数组与行项目表格(30 份文档):发票、对账单、明细表,需提取为结构化数组。
- 总计核对(24 份文档):需要对合计、小计和总金额进行求和验证。
- 跨页上下文:交易记录和表格跨越多页。
- 从右到左书写脚本(7 份文档):希伯来语和阿拉伯语的发票、工资单和财务报表。
- CJK 脚本(3 份文档):日语和中文的发票和收据。
- 旋转扫描件(2 份文档)与手写体(1 份文档)。
- 嵌套对象与大海捞针式查找:深层嵌套结构及隐藏在大型导出文件中的单条记录。
- 多种文件格式:除 PDF 外的 9 种其他格式。
任务格式
- 每个任务包含:
- 源文档
- JSON Schema(指定提取结构)
- 人工校验的 JSON 标签(标准答案)
- 系统接收源文档及其 JSON Schema,输出匹配 Schema 的 JSON 数据。
- 输出结果按字段与标签进行评分。
评估指标
- 宏观平均字段准确率(Macro-average field accuracy),使用顺序无关的数组匹配方法。
- 字符串会进行空白符、标点和大小写的归一化。
- 数字比较转换为浮点数。
- 数组使用贪心最佳配对进行顺序无关匹配。
基准结果(排行榜)
| 排名 | 系统 | 准确率 |
|---|---|---|
| 🥇 | DocuPipe — 高投入 | 97.24% |
| 🥈 | DocuPipe — 标准投入 | 96.00% |
| 3 | Gemini | 95.80% |
| 4 | GPT | 93.54% |
| 5 | Extend | 92.52% |
| 6 | Claude | 90.33% |
- 所有基线结果均使用公开评分器对相同的人工校验标签进行评分,且原始输出均已提交,可复现。
- 排行榜并非封闭的,新系统可通过提交进行评分和纳入。
数据许可与归属
- 代码:MIT 许可。
- 标签、Schema 及基准自创元数据/结果:CC BY 4.0。
- 文档:每份文档保留其原始许可或发布基础,详情见
SOURCES.md。
引用
如果在研究或公开比较中使用 DocuBench,建议引用该仓库。机器可读记录位于 CITATION.cff 文件中。
搜集汇总
数据集介绍

构建方式
在文档智能提取领域,现有评测基准多局限于整洁的单页PDF,难以反映真实世界的文档复杂性。DocuBench正是为弥补这一空白而构建,它精选了50份极具挑战性的真实文档,覆盖发票、报表、日程表等多种类型。每份文档都配备了一个JSON Schema作为提取目标,由人工精心标注并验证了标准答案,确保标签的高质量与可靠性。该基准还提供了一个开源评分器(scorer.py),基于字段级别的宏观平均准确率进行打分,并支持顺序无关的数组匹配,使得任何系统的提交都能在相同标准下进行公平比较。所有原始模型输出、提示词、以及评分结果均被提交至仓库,保证了评测过程的完全透明与可复现。
使用方法
DocuBench的使用流程清晰且易于上手。用户只需先克隆仓库并安装依赖,随后即可通过命令行工具`docubench validate`检查数据集完整性,使用`docubench score`复现已提交的基准分数。对于希望提交新系统的团队,需针对每个文档运行其模型,并按照规定的JSON格式将输出结果写入`results/<system_name>/<doc_id>.json`。提交时,需包含提取的`data`字段以及记录模型信息的`meta`字段。之后运行`docubench score --engine <system_name>`进行评分,并通过Pull Request提交结果。仓库中还提供了运行GPT、Claude等主流模型的脚本,并支持通过环境变量设定API密钥,极大地方便了与其他系统的对比与复现。
背景与挑战
背景概述
DocuBench是由DocuPipe团队于近期构建并维护的一个面向真实世界文档的结构化信息提取基准评测数据集。该数据集的核心研究问题是评估文档AI系统在实际应用场景中处理复杂文档的能力,而非理想化的单页PDF。DocuBench通过精心挑选50份极具挑战性的真实文档,覆盖11种语言文字、10种文件格式,并涉及多行表格、跨页上下文、右至左书写系统、旋转扫描件及手写内容等多种复杂特征。其影响力在于为文档智能提取领域提供了一个标准化、透明且可复现的评测框架,所有系统均使用相同的评分器与人工验证标签,确保结果公正可比,从而推动该领域的研究与发展。
当前挑战
DocuBench所解决的领域问题核心在于当前文档AI评测普遍依赖整洁、单页PDF,忽略了真实世界中文档的多样性与复杂性。具体挑战包括:1) 复杂结构处理:文档中包含大量多行数组与跨页表格,要求系统具备准确的表格结构化提取能力;2) 数值验证:需识别并验证总计、小计等数值的数学一致性;3) 多语言与脚本支持:涵盖希伯来语、阿拉伯语等右至左文本,以及日语、汉语等CJK文本,对语言模型的多语种理解构成考验;4) 多样文件格式与噪声:包含旋转扫描、手写注释及多种非PDF格式,考验系统的鲁棒性。此外,构建过程中亦面临标签人工验证的高成本与跨页面上下文对齐的挑战。
常用场景
经典使用场景
在文档智能与结构化信息抽取领域,DocuBench被广泛用于评估和比较不同系统在复杂真实文档上的抽取能力。其典型使用方式为:给定一份原始文档及其对应的JSON Schema,系统需输出符合模式的JSON数据,随后通过统一的评分器对输出进行字段级精度评估。该基准涵盖了50份精心挑选的硬核文档,包含多行表格、跨页数据、右向左文字、手写体、旋转扫描等多种现实困境,支持PDF、JPEG、XLSX等10种文件格式,为研究者提供了一个可重复、开放且具备挑战性的标准化测试平台。
解决学术问题
DocuBench有效解决了当前文档AI评估中普遍存在的“测试集过于理想化”问题。多数现有基准仅采用整洁的单页PDF,难以反映真实业务场景中的复杂挑战。该数据集填补了这一空白,系统性地覆盖了数组与行项表格提取、总额核对、多语言与多脚本处理、扫描畸变容忍等关键学术难题。通过引入宏观平均字段精度作为核心指标,并采用顺序无关的数组匹配策略,DocuBench为不同抽取系统的公平对比奠定了方法论基础,推动了文档理解领域的实证研究向更深、更真实的方向演进。
实际应用
在实际产业环境中,DocuBench所模拟的场景直接对应财务票据处理、发票信息录入、合同审查、报表分析等高频业务需求。例如,企业可以利用该基准评估其内部OCR或LLM驱动的内容抽取管线对多语种、多格式文档的适配能力,尤其是在需要解析多行明细表并验证加总一致性的场景中。DocuBench还特别关注了右向左文字和CJK脚本的抽取表现,这对于跨境贸易、国际化企业及本地化服务商具有重要参考价值,为RPA(机器人流程自动化)与文档数字化项目提供了可靠的选型依据。
数据集最近研究
最新研究方向
在文档智能与结构化信息提取领域,前沿研究正从单一、清洁的PDF处理转向对真实世界复杂文档的鲁棒性挑战。DocuBench的提出精准切中了当前大语言模型应用落地的关键瓶颈:面对多行数组、跨页表格、金额校验、从右至左脚本、手写体及十余种文件格式交织的混合文档时,现有系统的性能急剧下降。该基准通过50份精心挑选的真实难例,系统性地暴露出主流模型在结构化抽取中的薄弱环节,其公开的评估流水线与可复现的评分机制,为领域内模型能力的横向对比与迭代优化提供了可信标尺,推动研究从实验室场景向工业级应用的深层跨越。
以上内容由遇见数据集搜集并总结生成



