RealDocBench
收藏资源简介:
一个用于文档解析的基准数据集,用于评估真实文档上的两个关键方面:1. 布局质量——边界框和块类型预测与人工标注的对比,使用F1、调整后F1、mAP和每块类型细分指标;2. QA提取质量——针对每个(问题,解析器)对,使用LLM提取器(Gemini 3 Flash)仅基于解析器的markdown回答问题,通过`deep_equal`与类型化JSON标准进行每字段评分(对纯字符串字段使用保守的模糊回退)。每个模式报告成本、延迟和质量。
A benchmark dataset for document parsing, designed to evaluate two critical aspects on real-world documents: 1. Layout Quality: Compare bounding box and block type predictions against human annotations, using F1 score, adjusted F1, mean Average Precision (mAP), and per-block-type breakdown metrics; 2. QA Extraction Quality: For each (question, parser) pair, utilize the LLM extractor (Gemini 3 Flash) to answer questions solely based on the parser's markdown output, and conduct per-field scoring against the typed JSON standard via `deep_equal` (applying conservative fuzzy fallback for pure string fields). For each mode, cost, latency, and quality are reported.
RealDocBench 数据集概述
数据集简介
RealDocBench 是一个真实世界的文档解析基准测试数据集,旨在评估文档解析系统在实际文档上的表现。该数据集分为两部分:布局质量评估和问答提取质量评估。
数据集构成
1. 问答提取基准
- 问题数量:1,359 个问题
- 文档数量:581 个文档
- 评估方式:对于每个(问题,解析器)组合,使用 LLM 提取器(Gemini 3 Flash)从解析器输出的 Markdown 中回答问题,然后通过
deep_equal函数与 JSON 格式的正确答案进行比较评分 - 数据来源:
Extend-AI/RealDoc-Bench
2. 布局基准
- 页面数量:1,500 页
- 标注格式:COCO 格式注释
- 评估指标:F1、调整后 F1、mAP、精确率、召回率,以及按块类型分类的详细指标
- 块类型(9类):
text、heading、section_heading、header、footer、page_number、figure、table、key_value - 数据来源:
Extend-AI/RealDoc-Bench-Layout - 数据组织:包含
manifest.csv(页面列表及每页元数据)、images/(图像文件)和annotations/(注释文件)
主要评估指标
- 布局质量:基于边界框和块类型预测与人工标注的比较,使用 F1、调整后 F1、mAP 等指标
- 问答提取质量:按字段计算的准确率,每个(问题,解析器)对的逐字段评分
- 成本与延迟:每个模式都会报告成本估算和延迟信息
词类型词汇表
数据集使用 9 个块类型类别:text、heading、section_heading、header、footer、page_number、figure、table、key_value。原始 COCO 注释中的 category_id 整数会在加载时映射为这些类别,各厂商解析器的输出也会通过标准化器转换为相同的集合。
许可信息
- 仓库代码:Apache-2.0 许可
- 基准数据集:各自拥有独立的许可,详见 Hugging Face 上的数据集页面




