RealDoc-Bench
收藏官方服务:
资源简介:
RealDoc-Bench QA 是一个用于评估文档抽取问答能力的基准数据集。该数据集跨越四个核心领域:金融、医疗/健康、抵押贷款和供应链,包含1359个基于文档的问题,这些问题来源于581份独立的文档。每个数据项包括问题本身、类型化答案模板、包含正确答案的JSON字典、描述问题所考察能力的标签(包含137个标签,归类于8个能力组)、对应的源文档文件名以及所属领域。数据集文件结构清晰,主要包含qa_bank.json文件(存储所有问答数据)和一个docs/目录(存放所有源PDF文档),主要用于文档问答和抽取式问答任务的基准测试与评估。数据集的问答库和参考答案采用CC-BY-4.0许可证,而docs/目录中的源文档则遵循其各自的原生许可。
创建时间:
2026-05-25
原始信息汇总
数据集概览
- 名称: RealDoc-Bench (realdoc-bench QA)
- 许可证: CC-BY-4.0(问答库与标准答案);源文档按各自文档许可证授权
- 语言: 英语
任务类型
- 问答(question-answering)
- 文档问答(document-question-answering)
数据规模
- 问题数: 1359
- 文档数: 581
- 规模范围: 1K < n < 10K
领域覆盖
涵盖4个领域:
- 金融(finance)
- 医疗/保健(medical/healthcare)
- 抵押贷款(mortgage)
- 供应链(supply_chain)
数据结构
每个数据项包含:
question: 问题文本template: 类型模板gold_dict: 标准答案(JSON格式)capabilities: 能力标签(137个标签,归入8个能力桶)source_file: 源文档文件名domain: 所属领域
文件布局
qa_bank.json # 问答库主文件 docs/<source>.pdf # 源文档(每个问题对应一个PDF文件)
用途
专为文档提取的QA基准测试设计,每个问题基于单篇文档,并以类型化JSON格式提供标准答案。
搜集汇总
数据集介绍

构建方式
RealDoc-Bench是一个面向文档信息抽取的问答基准数据集,覆盖金融、医疗健康、抵押贷款和供应链四个关键领域。该数据集精心整合了581份真实文档,并基于这些文档设计了1359个问答对,每个问题均对应单一文档,且其标准答案以结构化的JSON格式存储。数据集的构建采用了分领域、多模板的策略,不仅记录了问题的具体文本和预期答案的模板类型,还为每个问题标注了源于金标准答案的字典以及所属的细粒度能力标签,这些标签被归入八种能力的范畴,从而构建了一个层次分明、评估维度丰富的测试框架。
特点
RealDoc-Bench的核心特点在于其高度结构化且多维度的评估体系。每个数据条目都明确关联了其源文档,确保了评估的可追溯性和场景真实性。通过引入超过137个细粒度能力标签并将其归类至八个能力桶中,该数据集能够细致地剖析模型在不同文档理解任务上的强弱项,超越了传统的宏观准确率评估。此外,数据集遵循CC-BY-4.0许可协议,在允许广泛使用的同时,也对部分源文档保留了原作者的独立版权,并通过透明的下架机制保障了数据来源的合法与伦理。
使用方法
RealDoc-Bench的使用方法简洁高效,主要依赖专用的`realdoc-bench`命令行工具。用户可通过pip安装该工具后,使用`realdoc-bench evaluate download`命令从HuggingFace指定该数据集以获取测试包,随后通过`realdoc-bench evaluate run`命令加载模型或抽取管道进行评估。该工具支持通过`--limit`参数进行小规模快速测试,也支持使用`--run-dir`参数管理多个评估运行的日志和结果,便于用户系统地对比不同文档解析方案在特定领域或能力维度上的性能表现。
背景与挑战
背景概述
在文档智能与信息抽取领域,现有基准测试多聚焦于结构化或半结构化文档,难以全面反映真实世界中文档理解的复杂性。RealDoc-Bench由Extend AI团队于近期创建,旨在填补这一评估空白。该数据集涵盖金融、医疗保健、抵押贷款与供应链四大垂直领域,包含581份真实PDF文档与1359道问答对,每道问题均附有结构化的JSON标准答案及细粒度能力标签。通过将评估维度细化为八组能力桶,RealDoc-Bench为系统化剖析文档理解模型的强项与短板提供了标准化框架,对推动文档级问答技术的可解释性评估产生了深远影响。
当前挑战
RealDoc-Bench所解决的领域挑战在于,现有文档问答基准多依赖人工合成或清洗后的文本,无法忠实复现真实文档中的版面噪声、表格混合与多语言标注等棘手问题。从构建层面看,团队需从海量商业文档中遴选代表性样本,并协调不同行业的文档格式与版权授权差异,确保数据集的合法性。此外,设计兼具全面性与互斥性的能力标签体系,以精准刻画模型在数值推理、跨页引用和隐式意图理解等方面的表现,构成了构建过程中最为精巧且耗时的技术挑战。
常用场景
经典使用场景
RealDoc-Bench数据集专为评估文档级问答与信息提取系统的性能而设计,其核心应用场景聚焦于复杂文档中结构化信息的精确抽取与理解。该数据集涵盖金融、医疗健康、抵押贷款与供应链四大高价值领域,包含581份真实PDF文档与1359道精心标注的问答对。每一问题均配有类型化的JSON标准答案与细粒度的能力标签体系,覆盖137种标签并归入8大能力类别,适用于单文档长文本理解、数值推理、表格解析及实体关系抽取等经典任务,为学术界与工业界提供了一个标准化、多维度的模型性能评测基准。
解决学术问题
该数据集的构建有效解决了当前文档智能领域中缺乏高质量、多领域、细粒度标注的公开基准这一核心瓶颈。其1359道问答对与581份真实文档的结构化设计,使得研究者能够系统性地评估与比较不同模型在金融报告分析、医疗记录解读、抵押合同核查与供应链单据处理等专项场景下的能力差异。通过8大能力类别与137项能力标签的精细映射,该数据集揭示了现有大型语言模型与文档解析工具在复杂文档理解、多步骤推理及精确数值抽取等环节中的薄弱之处,有力推动了面向真实业务场景的可信文档AI研究进程。
衍生相关工作
围绕RealDoc-Bench数据集,已衍生出多项具有代表性的研究工作与工具生态。官方提供的realdoc-bench评估框架使得研究者可便捷地在本地或云端复现评测流程,支持模型输出与标准答案的自动化比对,并支持不同技术栈(如pymupdf、Unstructured、LlamaParse等多种解析引擎)的性能横向比较。该基准的细粒度能力标签机制启发了多篇学术论文,研究者开始基于此数据集构建细粒度图注意力网络进行文档布局理解,或利用其多领域特性进行跨领域迁移学习与领域自适应方法的验证。此外,该数据集已成为评估最新多模态大模型文档理解能力的重要参照,推动了DocVQA与PDF信息抽取等子方向的发展。
以上内容由遇见数据集搜集并总结生成




