遇见数据集

RealDocBench

收藏
arXiv2026-06-05 更新2026-06-09 收录
官方服务:

资源简介:

RealDocBench是由Extend AI团队构建的一个面向真实受监管文档的双轨基准数据集,旨在评估文档解析系统在字段级问答和布局理解方面的性能。该数据集包含1356个字段级问题和1500个经过人工验证的页面标注,覆盖抵押贷款、金融、供应链和医疗四大领域,数据来源于真实受监管文档,并采用隐私保护合成技术处理敏感内容。数据集通过严格的问答跟踪和布局跟踪设计,支持类型化字段值提取和九类公共分类法下的边界框标注,主要应用于企业级文档解析系统的性能评估,解决现有基准在文档真实性、评估指标和操作成本等方面的不足。

RealDocBench is a dual-track benchmark dataset for real regulated documents developed by the Extend AI team, which aims to evaluate the performance of document parsing systems in terms of field-level question answering and layout understanding. The dataset contains 1356 field-level questions and 1500 manually verified page annotations, covering four major domains: mortgage, finance, supply chain, and healthcare. It is sourced from real regulated documents, with sensitive content processed using privacy-preserving synthesis techniques. Designed with rigorous question answering tracking and layout tracking mechanisms, the dataset supports typed field value extraction and bounding box annotation under a nine-category public taxonomy. It is primarily used for performance evaluation of enterprise-grade document parsing systems, addressing the limitations of existing benchmarks in terms of document authenticity, evaluation metrics, and operational costs.

提供机构:
Extend AI
创建时间:
2026-06-05
搜集汇总
数据集介绍
RealDocBench 数据集图片
构建方式
RealDocBench的构建基于真实世界监管文档,涵盖抵押贷款、金融、供应链和医疗四个领域。QA轨道包含581份文档上的1356个字段级问题,每个问题附带一个类型化答案字典。问题通过多阶段流程生成:首先由视觉语言模型分析页面结构挑战,然后提出语义锚定问题,经两个独立模型验证并人工审核后,最终转化为JSON格式的黄金答案。布局轨道包含1500张人工验证的页面图像,采用九类公共分类法进行COCO格式边界框标注。
特点
该数据集的核心特色在于其真实性和字段级评估粒度。与使用学术文档或合成文本的基准不同,RealDocBench聚焦于高监管行业的实际文档,包含勾选框、手写内容、印章和扫描伪影等复杂元素。其评估指标突破传统的页面级相似度评分,采用类型感知的字段级和问题级准确率衡量,能够精准反映下游系统实际关心的字段值提取能力。同时提供配对的布局分析轨道,使用邻域感知匹配器评估区域几何和类型。
使用方法
使用RealDocBench时,研究人员需在其统一评估框架下运行解析系统。对于QA轨道,解析器输出文档的文本表示后,由固定提取大语言模型读取指定问题的答案键,返回类型化JSON结果,并与黄金答案进行逐字段类型感知比较。系统将获得每字段准确率和严格每问题准确率,并支持按领域和能力维度进行细粒度分析。布局轨道则要求系统输出九类公共分类法的边界框预测,通过匈牙利匹配器和邻域感知分裂/合并恢复算法计算调整后的F1分数。数据集和评估工具已在Hugging Face和GitHub开源。
背景与挑战
背景概述
在高度规范化的行业工作流中,如抵押贷款承销、财务报告、供应链物流及临床记录管理,文档解析系统正日益成为关键基础设施。然而,现有公开基准评测普遍依赖学术论文、书籍或数字原生内容等布局规整的文档,且仅采用单一的OCR或Markdown级别的相似度评分指标,这与下游智能代理实际所需的精准字段级信息提取需求相去甚远。为弥合这一鸿沟,Extend AI团队于2026年推出了RealDocBench基准数据集,由Ameya Joshi、Joon Kim等研究人员构建。该数据集包含两大评测轨道:一是包含1,356个字段级问题的问答轨道,覆盖581份来自抵押、金融、供应链及医疗四个领域的真实监管文档,每道问题均附带类型化的键值对黄金答案;二是包含1,500张经人工验证的页面图像的布局轨道,采用九类公开语义标签和含邻域感知的匈牙利匹配算法进行评分。
当前挑战
RealDocBench所应对的核心挑战在于揭示现有单指标基准评测所掩盖的系统间真实性能差异。首先,在领域问题上,真实监管文档中密集的可填写表格、复选框网格、多栏表格、手写内容、印章、涂黑及扫描伪影等复杂布局,对现有解析系统构成严峻考验,尤其医疗子领域因包含大量手写病例报告表和复选框网格而成为最困难场景。其次,在基准构建过程中,数据来源面临隐私保护难题,需为涉密医疗和税务文档建立隐私保护合成管线,通过真实空白表单与虚构人物数据填充的方式生成样本,并采用视觉语言模型进行保真度筛查。此外,评测协议需设计类型容忍的比较逻辑,能够处理数值、日期、布尔值及枚举类型的规范化匹配,同时引入严格的逐问题准确率指标,要求记录中所有字段完全正确才算通过,以真实反映下游智能代理所依赖的端到端可靠性。
常用场景
经典使用场景
RealDocBench最经典的使用场景是评估和比较文档解析系统在受监管的真实文档上的字段级问答能力。该基准测试特别针对抵押贷款、金融、供应链和医疗保健四大领域,通过1356个字段级问题来考察解析器能否从复杂的真实页面中准确提取特定字段值,而非仅仅衡量整页文本的相似度。其独特的双轨设计——QA轨道和布局轨道——使得研究者可以同时评估系统的文本提取准确性和版面理解能力,这种精细化的评估范式已成为衡量商用解析API、通用视觉语言模型和开源OCR模型性能的权威标准。
实际应用
在实际产业应用中,RealDocBench所评估的能力直接服务于高风险、强监管的业务流程。在抵押贷款业务中,系统需要从Closing Disclosure文件中准确提取cash-to-close金额;在保险行业,从ACORD表格中提取保费数值;在供应链管理中,从提单中提取货物数量;在医疗领域,从临床记录中提取用药剂量。这些字段值的精确提取直接影响着自动化代理系统的决策质量,错误的解析结果可能带来巨大的财务和法律风险。该基准验证了不同系统在实际部署中的成本与延迟权衡,为企业选择最适合其业务需求的文档解析方案提供了可靠的参考依据。
衍生相关工作
RealDocBench的出现催生了一系列重要的衍生研究工作。其独特的双轨评估设计启发了后续研究者对文档解析系统中QA错误与布局检测失败之间关联性的深入探索。该基准揭示的领域难度差异——医疗文档最具挑战性,金融领域最具区分度——引导学术界将更多注意力投向真实的受监管文档场景。其开源的评价框架和适配器使得社区能够在新文档、新领域和新系统上扩展基准测试。此外,RealDocBench对成本与延迟的透明报告引发了关于文档解析系统实际部署决策的广泛讨论,促进了更加务实和全面的系统比较方法论的建立。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务