遇见数据集

corpus

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

FieldBench Corpus 是一个跨领域、字段级的基准测试数据集,专为模式驱动的文档提取任务(从文档到结构化 JSON)而设计。该数据集包含 1,470 份文档,覆盖 12 个不同类别(如财务报表、发票、医疗记录等),每个字段都提供了真实标注,旨在使提取准确性的声明可验证和可比较。每个数据样本包含以下字段:文档标识符(doc_id)、类别(category)、来源(source,分为“真实”或“合成”)、原始格式(original_format)、用于提取的 Markdown 表示(document)、真实字段映射的 JSON 字符串(expected)以及定义该类别字段的模式文件名(schema)。数据集中约 90% 的文档是基于干净文本的提取,而非从渲染页面(如图像/PDF)中提取;合成文档约占 48%,其准确性可能相对真实文档被高估,因此在使用时需分别报告真实和合成数据的结果。数据集的许可证因来源而异,包括 CC0、CC BY 4.0、公共领域等。该数据集适用于文档信息提取、模式驱动提取等任务的评估和基准测试。

FieldBench Corpus is a cross-domain, field-level benchmark dataset designed for schema-driven document extraction tasks (from documents to structured JSON). It contains 1,470 documents covering 12 different categories (such as financial reports, invoices, medical records, etc.), with ground truth annotations provided for each field to make extraction accuracy claims verifiable and comparable. Each data sample includes the following fields: document identifier (doc_id), category, source (divided into real or synthetic), original format, Markdown representation for extraction (document), JSON string of ground truth field mappings (expected), and the schema file name defining fields for that category. Approximately 90% of the documents in the dataset are based on clean text extraction, rather than extraction from rendered pages (e.g., images/PDFs); synthetic documents account for about 48%, and their accuracy may be overestimated compared to real documents, so results should be reported separately for real and synthetic data when using the dataset. The datasets licenses vary by source, including CC0, CC BY 4.0, public domain, etc. This dataset is suitable for evaluation and benchmarking in tasks such as document information extraction and schema-driven extraction.

创建时间:
2026-07-24
原始信息汇总

FieldBench Corpus 数据集详情

数据集概述

FieldBench Corpus 是一个跨领域、字段级基准测试数据集,用于模式驱动的文档抽取任务(从文档到结构化 JSON)。该数据集包含 1,441 份文档,覆盖 10 个类别,并为每个字段提供真实标注(ground truth),使抽取准确率声明具有可证伪性和可比性。

数据集构成

维度 说明
文档数量 1,441 份
类别数量 10 类(包括 sec_filings、invoices、medical_records 等)
数据来源 真实文档(real)与合成文档(synthetic),约 48% 为合成数据
许可证 CC-BY-4.0
语言 英语
数据规模 1K < n < 10K

字段说明

字段名 描述
doc_id 文档标识符
category 文档所属类别(10 类之一)
source 数据来源:realsynthetic报告结果时必须按此分层
original_format 文档进入抽取器的方式
document 待抽取的 Markdown 格式文档内容
expected 真实标注的 {字段: 值} 映射,以 JSON 字符串形式存储
schema 定义该类别的字段的 schema 文件名

重要注意事项

  • 约 90% 的文档为纯文本抽取,而非渲染页面抽取(仅 9.8% 来自图片/PDF)。解析阶段的难度基本不存在,准确率声明需相应限定范围。
  • 合成文档(约 48%)会高估准确率,相对于真实文档。切勿在不提供真实/合成数据拆分的情况下报告包含合成的整体结果。
  • 许可协议按来源区分:合成数据为 CC0;SEC EDGAR 为公共披露;SROIE 为 CC BY 4.0;MTSamples 为教育用途需注明出处;Caselaw Access Project 和政府表格为公共领域。ACORD/ISO 版权表格不包含在内(相关类别使用合成等价物)。

使用方式

python from datasets import load_dataset ds = load_dataset("fieldbench/corpus")["test"] ex = ds[0]

ex["document"] -> 待抽取的 Markdown 表示

ex["expected"] -> 真实标注字段映射(JSON 字符串,需 json.loads)

ex["category"], ex["source"] ("real"|"synthetic"), ex["schema"]

评分工具:

bash pip install fieldbench fieldbench score --corpus <corpus-checkout> --results <your-predictions>/

相关资源

  • 代码与评分器:https://github.com/fieldbench/fieldbench
  • 完整语料库与数据表:https://github.com/fieldbench/corpus
  • 数据表文档:语料库仓库中的 DATASHEET.md,在得出结论前请先阅读
搜集汇总
数据集介绍
corpus 数据集图片
构建方式
FieldBench Corpus是一个跨领域的字段级基准数据集,专为模式驱动的文档提取任务(从文档到结构化JSON)而设计。该数据集涵盖了10个不同的文档类别,包括SEC文件、发票、医疗记录等,共计1,442份文档。每份文档均配有逐字段的真实标注(ground truth),确保提取准确性的可验证性与可比性。数据集的构建融合了真实与合成两种来源:约52%为真实文档(如SEC EDGAR公开文件、MTSamples医疗记录等),约48%为合成文档(基于CC0许可协议生成)。所有文档均以Markdown格式呈现,供算法提取结构化字段,且每个类别定义了对应的模式文件(schema),明确了需提取的字段集合。
特点
该数据集的核心特点在于其严格的字段级标注与跨领域覆盖,为文档提取算法提供了统一且可重复的评估基准。约90%的文档直接从干净文本中提取,而非渲染后的页面(如图像或PDF),因此解析阶段的难度被有意排除,用户需据此界定准确性声明的范围。合成文档的引入可能高估模型在真实场景下的表现,故报告结果时必须按真实/合成来源分层呈现。此外,数据集的许可协议因来源而异,包括知识共享CC0、CC BY 4.0、公共领域等,需注意各自的使用限制。
使用方法
用户可通过`datasets`库加载数据集,直接获取测试分割(test split)中的样本,每个样本包含文档的Markdown表示、标准字段映射(JSON字符串)、类别及模式信息。使用前需阅读数据集的详细说明文档(DATASHEET.md),以充分理解构建细节与局限性。评估时,推荐安装官方评分工具`fieldbench`,通过命令行对模型预测结果进行标准化评分。此外,用户应始终报告按真实/合成来源分层的结果,以提升评估的透明度与公平性。
背景与挑战
背景概述
FieldBench Corpus是一个面向跨领域、字段级文档提取的基准数据集,于近年由FieldBench团队发布,旨在解决从非结构化文档到结构化JSON的提取任务中准确率评估缺乏可复现性与可比性的问题。该数据集包含1,442篇文档,覆盖证券申报、发票、医疗记录等10个类别,并提供逐字段的真实标注,为信息抽取领域提供了标准化的评估平台。其构建融合了真实与合成数据来源,并遵循CC BY 4.0等开放许可协议,有力推动了文档智能与信息提取技术的可验证研究。
当前挑战
该数据集所应对的核心挑战在于文档提取任务的可靠性评估:现有方法常因缺乏统一基准而导致性能声明难以重复验证。具体而言,数据集中约90%的文档为从清洁文本而非渲染页面(如图像或PDF)中进行提取,人为降低了解析阶段的难度,从而难以全面反映实际应用中的复杂场景。此外,近半数的合成文档相较于真实文档会高估提取精度,要求在报告结果时必须按真实/合成来源进行分层统计,否则会误导性能评价。这些挑战要求研究者在模型开发与评估中审慎区分数据来源与处理阶段的差异,以推动更贴近真实场景的文档提取技术进展。
常用场景
经典使用场景
FieldBench Corpus数据集专为模式驱动型文档结构化提取任务而设计,其经典使用场景聚焦于评估和比较不同信息抽取系统在预定义字段级抽取任务上的表现。研究人员可将文档的Markdown表示作为输入,利用预定义的模式文件预测目标字段的键值对,并与数据集提供的真实标注数据进行比较。该数据集涵盖SEC文件、发票、医疗记录等10个类别的1,442篇文档,为验证抽取模型的准确性与鲁棒性提供了标准化的基准平台。
衍生相关工作
基于FieldBench Corpus的严谨评估框架,已衍生出多项经典研究工作。其中,领域适配型信息抽取系统的性能对比分析成为热点,研究者利用该数据集探索少样本学习与提示工程在结构化抽取中的效果。此外,针对合成数据与真实数据性能差异的研究催生了数据增强方法的创新,而跨类别泛化能力的分析则推动了多任务学习架构的设计。该数据集还成为研究抽取模型对文档表示形式(纯净文本 vs. 渲染页面)鲁棒性的标准测试集。
数据集最近研究
最新研究方向
当前,面向结构化信息抽取的基准测试正从粗粒度的文档级评估向细粒度的字段级验证演进。FieldBench Corpus作为跨领域、模式驱动的文档抽取基准,汇聚了涵盖证券申报、医疗记录等10个类别的1,442份文档,为提取精度的可重复验证提供了标准化标尺。该数据集通过区分真实与合成样本、明确标注文本与图像来源占比,有效规避了传统基准中解析难度缺失与合成数据带来的性能高估问题,推动了抽取模型在真实场景下的鲁棒性研究。其发布标志着信息抽取领域对评估假阳性与控制条件效度的深度反思,为构建更具生态效度的评测体系奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务