遇见数据集

ConfBench

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

FCC发票已验证增强数据集是一个文档理解基准数据集,专为支持置信度校准研究、OCR鲁棒性评估以及在现实噪声条件下的关键信息提取(KIE)而设计。数据集包含75份真实世界的美国联邦通信委员会(FCC)发票文档(多页PDF格式,平均每份约2页),来自法律/广播广告领域。每份原始清洁文档通过最多18个不同的、基于Augraphy库构建的文档退化流程进行了增强,模拟了广泛的现实世界扫描/打印伪影,如扫描仪滚轮痕迹、污渍、折叠、墨水渗透、摩尔纹、阴影、JPEG压缩、几何畸变、装订阴影、水印等,从而生成了噪声版本。数据集总计提供1,346个样本(75份文档 × 最多18个噪声流程)。每个样本包括原始清洁PDF、噪声PDF以及经过验证的真实实体标注。标注遵循结构化模式,包含文档分类(如“发票”)和推理结果,推理结果字段包括机构(广告代理名称)、广告商(客户名称)、总金额(美元)、付款条款(如“30天”)、代理佣金(美元)、应付净额(美元)以及行项目列表。每个行项目又包含行项目描述、开始日期、结束日期、星期模式(如“-T-----”)和行项目费率(美元)等子字段。数据集基于RealKIE-FCC-Verified数据集构建,修正了原始RealKIE基准中的标注问题(如行项目分组和错误值更正)。该数据集适用于文档问答、图像到文本、信息提取等任务的评估和基准测试,特别用于研究模型在不同程度文档退化下的置信度、OCR系统在噪声文档上的鲁棒性,以及分析特定噪声类型对各个字段提取准确性的影响,并以CC BY-NC 4.0许可证发布。

The FCC Invoice Verified Augmented Dataset is a document understanding benchmark dataset designed to support confidence calibration research, OCR robustness evaluation, and key information extraction (KIE) under real-world noisy conditions. The dataset consists of 75 real-world U.S. Federal Communications Commission (FCC) invoice documents (multi-page PDFs, averaging about 2 pages each) from the legal/broadcast advertising domain. Each original clean document is augmented with up to 18 different document degradation pipelines built on the Augraphy library, simulating a wide range of real-world scanning/printing artifacts such as scanner roller marks, stains, folds, ink bleed-through, moiré patterns, shadows, JPEG compression, geometric distortions, binding shadows, watermarks, etc., to generate noisy versions. The dataset provides a total of 1,346 samples (75 documents × up to 18 noise pipelines). For each sample, it includes the original clean PDF, noisy PDF, and verified ground-truth entity annotations. The annotations follow a structured schema containing document classification (e.g., invoice) and inference results. The inference results fields include agency (advertising agency name), advertiser (client name), total amount (USD), payment terms (e.g., 30 days), agency commission (USD), net payable (USD), and a list of line items. Each line item further contains subfields such as line item description, start date, end date, day pattern (e.g., -T-----), and line item rate (USD). The dataset is built upon the RealKIE-FCC-Verified dataset, which corrects annotation issues in the original RealKIE benchmark (e.g., line item grouping and erroneous value corrections). It is intended for evaluation and benchmarking of tasks such as document question answering, image-to-text, and information extraction, particularly for studying model confidence under varying document degradation, OCR system robustness on noisy documents, and analyzing the impact of specific noise types on the accuracy of field extraction. The dataset is released under the CC BY-NC 4.0 license.

提供机构:
Amazon Web Services
创建时间:
2026-07-21
原始信息汇总

数据集概述

FCC Invoices Verified Augmented(又名 ConfBench)是一个面向文档理解领域的基准数据集,专注于在真实噪声条件下评估置信度校准、OCR鲁棒性以及关键信息抽取(KIE)。

核心特性

  • 文档领域:法律 / 广播广告
  • 文档类型:FCC(美国联邦通信委员会)发票(多页 PDF)
  • 原始文档数:75份
  • 噪声管线数:每份文档最多18种不同的文档退化管线
  • 总样本数:1,346条(75份文档 × 最多18种噪声管线)
  • 每份文档平均页数:约2页
  • 语言:英语
  • 许可协议:CC BY-NC 4.0

数据结构

数据集遵循以下文件布局:

amazon/ConfBench/ └── assets/ └── {doc_id}/ ├── original.pdf # 原始清洁PDF ├── gt.json # 真实标注(Ground Truth) ├── metadata.json # 管线清单 ├── default/ │ └── default_noisy.pdf ├── archetype3/ │ └── archetype3_noisy.pdf └── ...(另外16条管线)

真实标注(gt.json)模式

包含以下字段:

  • document_class.type:固定为 "Invoice"
  • inference_result:包含7个实体字段:
    • Agency(string):广告代理公司名称
    • Advertiser(string):客户/广告商名称
    • GrossTotal(float):发票总金额(美元)
    • PaymentTerms(string):付款条件(如 "30 Days")
    • AgencyCommission(float):代理佣金(美元)
    • NetAmountDue(float):佣金后的净应付金额(美元)
    • LineItems(list):行项目列表,每个项目包含:
      • LineItemDescription(string):节目/时段描述
      • LineItemStartDate(string):播出开始日期(MM/DD/YY)
      • LineItemEndDate(string):播出结束日期(MM/DD/YY)
      • LineItemDays(string):星期模式(如 "-T-----")
      • LineItemRate(float):每行项目成本(美元)

噪声管线

数据集采用基于 Augraphy 的18条噪声退化管线,模拟真实世界的扫描/打印伪影,分为两类:

Augraphy 预构建管线

管线名称 描述
default 平衡的通用退化
archetype3 重度后期处理效果
archetype4 最小几何扭曲
archetype7 颜色与光照变化
archetype9 纹理基退化
archetype10 扫描仪伪影模拟
archetype11 复杂多阶段管线

自定义管线(研究设计)

管线名称 模拟场景
custom12 扫描仪滚轴伪影
custom13 物理文档损坏(污渍+折叠)
custom14 墨水渗透与墨斑
custom15 扫描/老化效果(波纹+色纸)
custom16 不均匀光照(阴影+渐变)
custom17 压缩伪影(JPEG+细微噪声)
custom18 对齐问题(几何+页面边框)
custom19 装订阴影
custom20 复印质量(亮度+劣质复印)
custom21 叠加伪影(水印+噪声线条)
custom22 点阵打印(抖动+点阵)

任务与用途

数据集被设计用于以下研究场景:

  1. 置信度校准研究:测量模型在不同程度文档退化下的置信度
  2. OCR鲁棒性评估:在真实噪声文档上基准测试OCR和KIE系统
  3. 文档理解:评估模型从发票中结构化信息抽取的能力(仅限评测/基准用途,不提供训练集拆分)
  4. 噪声影响分析:研究特定噪声类型对每个字段抽取准确性的影响

数据拆分

数据集仅包含 test 拆分,共 1,346条 样本。


来源数据

75份清洁的FCC发票源自 RealKIE-FCC-Verified 数据集,该数据集对原始 RealKIE 基准中的FCC发票子集进行了重新标注,修正了两个问题:

  1. 行项目分组:将原本独立处理的字段按行项目分组
  2. 标注修正:修正了原始标注中的错误值

在此基础上,使用 Augraphy 库以OCR安全的参数配置添加噪声增强,生成最多18种退化变体。


引用方式

bibtex @misc{islam2026confidencecalibration, title = {FCC Invoices Verified Augmented: A Benchmark for Confidence Calibration in Document Understanding under Noise}, author = {Md Mofijul Islam and Mohammad Rostami and others}, year = {2026}, note = {Dataset available at Hugging Face}, url = {https://huggingface.co/datasets/amazon/ConfBench} }

搜集汇总
数据集介绍
ConfBench 数据集图片
构建方式
ConfBench数据集源于对真实世界联邦通信委员会(FCC)发票文档的深度加工与扩展。其构建起点是RealKIE-FCC-Verified基准中经过专家重新标注与校正的75份原始发票,这些文档解决了原始标注中行项目分组与数值错误等问题。在此基础上,研究团队利用Augraphy库设计了18条差异化的文档退化流水线,涵盖扫描伪影、物理损伤、光照不均、压缩噪声等真实场景中的常见干扰类型。每条流水线均以OCR安全的参数设置对每份原始PDF生成对应的噪声版本,最终形成包含1,346个样本(75份文档×最多18种噪声)的综合性评估套件。
特点
该数据集最显著的特征在于其系统性的噪声覆盖与细粒度的标注结构。18种退化流水线既包含内置的通用退化模型,也包含针对特定伪影(如滚筒污渍、墨迹渗透、莫尔纹、装订阴影)定制的增强方案,可全面评测模型在各种工业级噪声下的鲁棒性。每份样本均提供干净的原始PDF与对应的噪声PDF,并附带结构化JSON标注,明确记录机构名称、广告主、总金额、付款条款、佣金、净应付额以及包含起止日期与费率的行项目明细。这种层级化、多域名的标注设计使其特别适用于置信度校准、OCR稳定性与关键信息提取的联合研究。
使用方法
用户可通过Hugging Face Hub便捷获取该数据集。推荐使用`snapshot_download`函数将完整仓库下载至本地,随后按文档ID遍历`assets`目录下的各子文件夹,其中`original.pdf`为原始文档,`gt.json`存放标注真值,`metadata.json`记录各退化流水线的名称及对应噪声PDF路径。数据集同时提供了`FCCInvoicesDataset`加载器类,支持迭代访问所有文档与流水线组合。由于该数据集专为评估与基准测试设计,不提供训练集划分,故适合作为独立测试集用于对比不同模型在噪声环境下的字段提取精度与置信度输出的一致性。
背景与挑战
背景概述
ConfBench数据集由Amazon研究团队于2026年创建,聚焦于文档理解领域中的置信度校准与OCR鲁棒性评估。该数据集以美国联邦通信委员会(FCC)的真实发票为基底,经专家修正RealKIE基准中的标注错误后,利用Augraphy库生成多达18种文档退化变体,总计1346个样本。其核心研究问题在于量化真实噪声环境下关键信息提取(KIE)模型的置信度可靠性,为文档智能化处理提供标准化测试平台。自发布以来,ConfBench填补了噪声敏感性评估的空白,推动了文档分析系统在仿真实战条件下的性能可解释性研究。
当前挑战
所解决的领域问题集中于文档理解系统在非理想输入下的稳定性挑战,即现有KIE模型在扫描噪声、墨迹渗透、装订阴影等真实退化场景中常出现置信度失调,导致提取结果不可靠。构建过程中面临的双重挑战包括:1)需从原始RealKIE数据中修正75份发票的标注一致性,尤其是将独立实体重构为结构化行项目层级;2)需设计18条差异化退化管线以覆盖印刷老化、几何畸变等物理损伤,同时确保OCR可读性不受过度破坏,平衡现实性与可用性,从而系统性地评估噪声影响模式。
常用场景
经典使用场景
在文档理解与关键信息提取(KIE)领域,ConfBench数据集被广泛用于评估模型在真实噪声环境下的鲁棒性。该数据集以75份真实的美国联邦通信委员会(FCC)发票为基底,通过18种不同的退化流水线生成多达1,346个样本,模拟扫描污渍、折叠、墨迹渗透、光照不均等实际应用中的文档退化现象。研究者常利用其多级别噪声对比特性,系统性地检验OCR系统及信息提取模型在清洗版本与各类退化版本之间的性能落差,从而揭示模型对特定噪声类型的脆弱性。
衍生相关工作
ConfBench的发布催生了一系列与文档噪声鲁棒性和置信度评估相关的后续研究。其基础数据集RealKIE-FCC-Verified修正了原RealKIE基准中的行项分组与标注错误,为信息提取提供了更精准的金标准。在此基础上,研究者开发了针对特定退化类型(如墨迹渗漏或装订阴影)的增强型OCR后处理算法,并探索了基于不确定性估计的拒绝策略,使系统能在低置信度情况下自动转交人工审核。此外,该数据集还被用于对比不同去噪预处理方法(如GAN-based图像修复)对提取性能的提升效果,推动了文档理解领域在真实噪声场景下的方法论创新。
数据集最近研究
最新研究方向
基于真实场景噪声增强的文档理解置信度校准研究。ConfBench数据集聚焦于联邦通信委员会(FCC)发票文档,通过Augraphy库模拟扫描、复印、老化等18种真实退化管线,构建了含1346个样本的基准测试集。前沿方向包括:探索不同噪声类型对关键信息抽取(如代理机构、总金额)置信度的影响机制,评估OCR系统在恶劣条件下的鲁棒性,以及开发针对结构化文档的校准误差分析框架。该数据集填补了真实工业场景中噪声-置信度关联评估的空白,为构建可信赖的文档AI系统提供了关键验证工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务