遇见数据集

RealDocBench

收藏
github2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

一个用于文档解析的基准数据集,用于评估真实文档上的两个关键方面:1. 布局质量——边界框和块类型预测与人工标注的对比,使用F1、调整后F1、mAP和每块类型细分指标;2. QA提取质量——针对每个(问题,解析器)对,使用LLM提取器(Gemini 3 Flash)仅基于解析器的markdown回答问题,通过`deep_equal`与类型化JSON标准进行每字段评分(对纯字符串字段使用保守的模糊回退)。每个模式报告成本、延迟和质量。

A benchmark dataset for document parsing, designed to evaluate two critical aspects on real-world documents: 1. Layout Quality: Compare bounding box and block type predictions against human annotations, using F1 score, adjusted F1, mean Average Precision (mAP), and per-block-type breakdown metrics; 2. QA Extraction Quality: For each (question, parser) pair, utilize the LLM extractor (Gemini 3 Flash) to answer questions solely based on the parser's markdown output, and conduct per-field scoring against the typed JSON standard via `deep_equal` (applying conservative fuzzy fallback for pure string fields). For each mode, cost, latency, and quality are reported.

创建时间:
2026-05-14
原始信息汇总

RealDocBench 数据集概述

数据集简介

RealDocBench 是一个真实世界的文档解析基准测试数据集,旨在评估文档解析系统在实际文档上的表现。该数据集分为两部分:布局质量评估问答提取质量评估

数据集构成

1. 问答提取基准

  • 问题数量:1,359 个问题
  • 文档数量:581 个文档
  • 评估方式:对于每个(问题,解析器)组合,使用 LLM 提取器(Gemini 3 Flash)从解析器输出的 Markdown 中回答问题,然后通过 deep_equal 函数与 JSON 格式的正确答案进行比较评分
  • 数据来源Extend-AI/RealDoc-Bench

2. 布局基准

  • 页面数量:1,500 页
  • 标注格式:COCO 格式注释
  • 评估指标:F1、调整后 F1、mAP、精确率、召回率,以及按块类型分类的详细指标
  • 块类型(9类)textheadingsection_headingheaderfooterpage_numberfiguretablekey_value
  • 数据来源Extend-AI/RealDoc-Bench-Layout
  • 数据组织:包含 manifest.csv(页面列表及每页元数据)、images/(图像文件)和 annotations/(注释文件)

主要评估指标

  • 布局质量:基于边界框和块类型预测与人工标注的比较,使用 F1、调整后 F1、mAP 等指标
  • 问答提取质量:按字段计算的准确率,每个(问题,解析器)对的逐字段评分
  • 成本与延迟:每个模式都会报告成本估算和延迟信息

词类型词汇表

数据集使用 9 个块类型类别:textheadingsection_headingheaderfooterpage_numberfiguretablekey_value。原始 COCO 注释中的 category_id 整数会在加载时映射为这些类别,各厂商解析器的输出也会通过标准化器转换为相同的集合。

许可信息

  • 仓库代码:Apache-2.0 许可
  • 基准数据集:各自拥有独立的许可,详见 Hugging Face 上的数据集页面
搜集汇总
数据集介绍
RealDocBench 数据集图片
构建方式
在数字化浪潮席卷各行各业的当下,文档智能解析成为连接纸质信息与数字世界的桥梁。RealDocBench数据集精心构建了双重评估体系,涵盖版面质量与问答抽取质量两大维度。版面质量维度汇聚了1500页真实文档,并配备人工标注的边界框与区块类型标签,以COCO格式存储于Hugging Face Hub。问答抽取维度则围绕581份文档设计了1359个带类型JSON模板的问题,每个问题均对应精准的黄金答案。数据集通过系统化的管道运作,从下载文档到调用多种解析器进行解析,再借助固定的LLM抽取器(Gemini 3 Flash)从解析器输出的Markdown中提取答案,最终以deep_equal方法进行确定性评分。
特点
RealDocBench独树一帜之处在于其真实性与全面性。它不依赖合成文档,而是从现实世界中采集,确保了评估结果对实际应用的指导价值。数据集实现了版面解析质量与问答抽取质量的联合评测,能够全方位衡量文档解析器的性能。在版面评估中,采用匈牙利匹配算法计算严格F1与调整F1,调整F1允许相邻同类型块的合并恢复,巧妙应对过分割或欠分割现象。问答评估则严格遵循每对(问题,解析器)独立评分,所有解析器均接受相同的LLM评判,包括Gemini 3.5 Flash自身,确保了比较的绝对公平性。
使用方法
使用RealDocBench进行评测的过程简洁而富有弹性。研究者可通过命令行工具一键完成下载、解析、评分与报告生成,所有步骤均以解析器为作用域并支持缓存,极大提升了重复实验的效率。针对版面评测,可使用realdoc-bench layout eval命令指定处理器与数据集,并选择f1或adjacency评分器;问答评测则可通过realdoc-bench evaluate run命令一次性完成全流程。数据集通过环境变量管理API密钥,支持灵活覆盖本地数据集路径,同时提供丰富的参数如--limit和--domain用于子集筛选,适应不同规模的研究需求。
背景与挑战
背景概述
RealDocBench由Extend AI团队于近期创建,聚焦于真实文档的解析与智能问答评估。该基准测试包含两个核心维度:布局质量(涉及边界框与块类型的预测精度)和问答提取质量(通过大语言模型对解析后的Markdown内容进行答案抽取)。其研究的核心问题是衡量现有文档解析器在真实场景中的综合表现,推动文档智能处理领域的发展。数据集包含1500页的布局标注和1359个问答对,覆盖581份真实文档,为文档解析与检索问答领域提供了标准化的评估框架,对推动文档自动化处理技术的进步具有重要影响力。
当前挑战
所解决的领域问题包括:一、文档布局解析的精细化评估——现有指标无法有效处理多类型块(文本、标题、表格等)的边界模糊性和类型混淆,需要设计更鲁棒的匹配算法(如匈牙利匹配与邻接合并策略)。二、问答提取的客观评价——传统方法依赖人工验证,难以扩展至大规模场景;RealDocBench通过LLM提取器与确定性评分(deep_equal)实现可复现的评估,但如何避免模型偏见仍是挑战。构建过程中的挑战主要表现为:1)真实文档多样性强(包含发票、报告、论文等),导致标注一致性维护困难;2)不同解析器的输出格式差异大,需要设计统一的规范化映射(将9类块类型从供应商输出映射到标准词汇);3)成本与延迟的量化——需同时追踪每种解析器的API调用成本与处理时间,构建帕累托前沿图以辅助实际部署决策。
常用场景
经典使用场景
在文档智能与版面分析领域,RealDocBench被广泛用于评估文档解析器的版面检测质量和信息抽取能力。研究者通过该基准测试文档代理在真实世界PDF上的布局还原精度,使用F1、调整F1、mAP等指标衡量边界框与区块类型的预测表现,同时借助大语言模型(如Gemini 3 Flash)对解析器输出的Markdown进行结构化问答提取,以deep_equal方法评判字段级准确性。该场景为多模态文档处理系统提供了统一的评测框架,尤其适用于对比不同解析方案在复杂真实文档上的鲁棒性。
衍生相关工作
RealDocBench衍生出了一系列关于文档解析评估方法的改进工作。其中,基于匈牙利匹配的邻接评分器(adjacency scorer)被后续研究借鉴,用于缓解版面过度分割与欠分割带来的评估偏差。此外,部分工作扩展了该基准的区块类型体系,引入复杂排版的混合类别识别挑战。在信息抽取方面,研究者开始探索无需依赖大语言模型作为判官的自动评估策略,以降低评估成本。该基准的发布也催生了文档解析领域的竞赛与开放榜单,推动了社区统一评测标准的形成。
数据集最近研究
最新研究方向
RealDocBench聚焦于真实世界文档解析的基准测试,涵盖布局质量与问答抽取两大核心维度。该数据集通过对比多种解析器在标注框预测、块类型识别以及基于LLM的字段提取任务上的表现,揭示了当前文档智能领域的前沿挑战与进展。其引入的邻域调整F1评分机制与严格深度相等匹配策略,为评估文档解析器的鲁棒性与准确性提供了更为精细的度量标准。这一工作不仅推动了从学术场景到实际应用的无缝迁移,还为文档自动化处理系统在金融、法律等复杂领域的部署奠定了可信的评估基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务