遇见数据集

OCR-KIE

收藏
github2026-07-19 更新2026-07-29 收录
官方服务:

资源简介:

OCR-KIE数据集是一个用于关键信息提取的数据集,整合了来自开源社区的7个数据集,涵盖4个领域:发票、收据、表单和标签。具体包括FATURA(发票,2,500条记录)、SROIE(收据,973条记录)、wildreceipt(收据,1,739条记录)、CORD-v2(收据,1,000条记录)、xfund(表单,1,393条记录)、SIBR(表单,1,000条记录)和nutritional-data-poie-1(标签,483条记录)。数据集经过处理,如图像缩放和统一注释组织,以增强模型的泛化能力。

The OCR-KIE dataset is a dataset for key information extraction, which integrates seven datasets from the open-source community, covering four domains: invoices, receipts, forms, and labels. Specifically, it includes FATURA (invoices, 2,500 records), SROIE (receipts, 973 records), wildreceipt (receipts, 1,739 records), CORD-v2 (receipts, 1,000 records), xfund (forms, 1,393 records), SIBR (forms, 1,000 records), and nutritional-data-poie-1 (labels, 483 records). The dataset has been processed with operations such as image scaling and unified annotation organization to enhance the generalization ability of models.

创建时间:
2026-07-14
原始信息汇总

数据集概述

该项目构建并发布了 OCR-KIE 数据集,用于微调 PaddleOCR-VL-KIE 模型,实现文档图像中的关键信息提取(KIE)。

数据集构成

OCR-KIE 数据集集成了来自 4 个领域7 个公开数据集,具体如下:

数据集 类别 描述 原始记录数
FATURA 发票 发票文档(50个模板 × 50个实例) 2,500
SROIE 收据 收据信息提取 973
wildreceipt 收据 野外的收据识别 1,739
CORD-v2 收据 商业收据 1,000
xfund 表格 多语言表格理解(7种语言) 1,393
SIBR 表格 文档中的结构化信息 1,000
nutritional-data-poie-1 标签 营养信息标签 483

数据预处理

对原始数据集进行了统一的预处理,主要包括:

  1. 标注统一:使用 RLHF 方法,通过“大语言模型-人工反馈-脚本生成”流程,将所有原始标注转换为统一的 JSON 格式。
  2. 数据平衡:对 FATURA 数据集,每个模板仅抽取 50 条记录,以保证整体数据平衡。
  3. 图像压缩:将 PNG 格式图像转换为更小的 JPG 格式,并应用“基于字符像素密度的图像缩放算法”与 SWT 算法,按比例缩小图像,以降低显存占用。
  4. 头部翻译:根据语言对 header 字段进行翻译(如中文翻译为“标题”)。
  5. 数据重划分:将原始的训练、验证、测试数据混合后,按 9:1 的比例重新划分为训练集和测试集。
  6. 数据增强:通过提取部分字段的方式扩展数据集,最终扩展后的训练集包含 48,000 条记录。
  7. 字段精简:移除了识别意义不大的 other 字段。

数据格式

最终每条记录的组织格式如下:

json { "image_info": [ {"matched_text_index": 0, "image_url": "path/to/image.jpg"} ], "text_info": [ {"text": "OCR:{}", "tag": "mask"}, {"text": "{"key": "value", ...}", "tag": "no_mask"} ] }

  • image_info: 存储图像的相对路径。
  • text_info: 包含识别提示(text_info[0])和待识别字段(text_info[1])。

提示词设计特点

与同类模型(如 GLM-OCR、HunyuanOCR)相比,OCR-KIE 的提示词设计具有以下特点:

  • 支持全量信息提取:无需指定键名,可自动提取所有信息。
  • 支持列表提取:能提取包含列表结构的数据。
  • 提示词简洁:继承了 PaddleOCR-VL 的“OCR:”前缀。

模型微调

模型基于 PaddleOCR-VL-1.6 模型进行微调。微调过程可参考 PaddleOCR-VL-0.9B SFT 指南。

模型下载与使用

  • 模型下载:可从 ModelScope 下载微调后的 PaddleOCR-VL-KIE 模型。
  • 推理工具:推荐使用 PaddleOCR-VL-REC 工具进行信息提取,支持以字典或列表形式指定查询字段,并返回 JSON 格式结果。
搜集汇总
数据集介绍
OCR-KIE 数据集图片
构建方式
OCR-KIE数据集汇聚了开源社区中来自发票、收据、表单和标签四大领域的七个数据集,包括FATURA、SROIE、wildreceipt、CORD-v2、xfund、SIBR及nutritional-data-poie-1。在数据构建过程中,采用基于RLHF的‘大模型-人工反馈-脚本生成’策略进行标注:首先利用大语言模型根据原始标注生成脚本,脚本产出标注后经大模型与人工联合评审,再根据反馈迭代修正脚本,直至产出符合要求的标注格式。同时,对所有数据实施了图像格式转换、基于字符像素密度的图像缩放算法及SWT算法处理以降低显存占用,并将原训练集、验证集与测试集混合后按9:1重新划分,最终通过字段扩展得到包含约48000条记录的训练集。
特点
该数据集具备鲜明特点:一是跨领域多样性,覆盖发票、收据、表单及标签四类文档图像,有效缓解单一数据集带来的识别偏置与泛化不足问题;二是采用创新性的基于字符像素密度的图像缩放算法,通过实验确定约50像素/字符的识别阈值,在保留关键文本信息的前提下大幅压缩图像尺寸,使显存消耗降低高达84%;三是提出了结构化掩码的提示设计,支持全信息提取、列表提取及嵌套字典提取,相比GLM-OCR和HunyuanOCR的提示方式更为简洁高效;四是数据构建流程具有可复现性和高执行效率,通过RLHF范式的脚本迭代确保了标注结果的一致性与准确性。
使用方法
使用该数据集进行模型微调时,需先安装ERNIE框架并配置相应的训练参数文件,下载PaddleOCR-VL-1.6基座模型后,执行微调脚本即可在AI Studio的A100环境下完成训练。模型推理方面,推荐利用PaddleOCR-VL-REC工具进行信息提取:初始化识别器时指定微调后的模型路径,通过predict接口传入图像路径与查询字典(如{"NAME":"", "ITEMS":[]}),并设置return_json=True,即可获得JSON格式的结构化输出结果。该模型不仅支持完整信息的JSON格式输出,还能根据不同的输入字段输出对应的子集信息,灵活适配多样化的文档理解需求。
背景与挑战
背景概述
OCR-KIE数据集诞生于2024年,由百度PaddleOCR团队主导研发,旨在解决视觉语言模型在关键信息提取任务中泛化能力不足的瓶颈。传统数据集如XFUND仅涵盖单一表单领域,导致模型在多样化场景下出现严重识别偏差。为此,该数据集融合了来自发票、收据、表单及标签四大领域的七个公开子集(FATURA、SROIE、wildreceipt、CORD-v2、xfund、SIBR、nutritional-data-poie-1),并创新性地引入RLHF方法统一数据标注格式,显著提升了跨域泛化性能。其核心研究问题聚焦于如何通过多源数据整合提升模型对复杂文档结构的鲁棒理解能力。基于该数据集微调的PaddleOCR-VL-KIE模型在测试集上以75.99%的准确率大幅领先同期方案,且泛化能力达66.83%,为文档智能处理领域树立了新标杆。
当前挑战
OCR-KIE数据集面临的核心挑战可归纳为三方面:首先,所解决的领域问题在于文档关键信息提取任务中模型普遍存在对单一分布数据的过拟合,例如XFUND数据集仅提供表单类型样本,导致模型在收据或发票等异构场景下识别准确率骤降超40%,亟需构建覆盖多模态、多版式的统一基准;其次,数据构建过程中遭遇多重技术困境,包括原始标注格式差异巨大(如XFUND采用坐标链接对而SROIE为KV键值对),需设计RLHF脚本实现自动化格式统一;再者,高分辨率图像(如XFUND尺寸普遍超过2000×3000像素)造成显存开销飙升且无效像素冗余,现有SWT算法无法有效适配文档场景,因此提出的字符像素密度缩放算法需平衡最小识别阈值与图像压缩比,在实验中确定约50像素/字符的临界值。
常用场景
经典使用场景
在文档智能与多模态信息抽取领域,OCR-KIE数据集汇聚了来自发票、收据、表单和标签四类场景的七个开源子集,为训练视觉语言模型实现结构化关键信息提取提供了统一而丰富的资源。该数据集最经典的使用场景是针对PaddleOCR-VL系列模型进行微调,使模型能够从复杂文档图像中精准抽取预设字段的键值对信息。通过将不同来源、不同布局的图像统一转换为包含OCR提示与JSON标注格式的训练样本,研究者得以在单一基准上评估模型对多领域文档的泛化能力,从而突破传统方法对单一数据集的过拟合局限。
实际应用
在实际产业应用中,OCR-KIE数据集所驱动的模型可广泛赋能财务票据自动化处理、物流单据识别、商品标签信息提取及表格数据数字化等场景。例如,企业财务系统可通过微调后的模型自动从海量发票中提取金额、税号和日期等关键字段,极大提升报销审核效率;零售场景中,模型能够从收据或营养标签中结构化提取商品条目与价格信息,支撑供应链管理与库存盘点。此外,该数据集对多语言文档的支持使其在国际化业务中同样适用,有效降低了人工录入成本并减少了数据采集环节的错误率。
衍生相关工作
基于OCR-KIE数据集,衍生出了一系列优化信息抽取流程的经典工作。其中,借鉴强化学习人类反馈(RLHF)思想的数据标注脚本生成方法,通过LLM自动编写并迭代修正解析规则,实现了可复现、高效率的标注流水线,避免了人工标注的繁琐与模型的幻觉问题。此外,提出的字符像素密度驱动图像缩放算法(Character Pixel Density-based Image Scaling Algorithm)被验证在不显著损失识别精度的前提下可将图像体积压缩超过80%,为后续文档图像预处理研究树立了新范式。这些衍生工作共同推动了文档级视觉语言模型在效率与泛化性间的平衡优化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务