OCR-KIE
收藏资源简介:
OCR-KIE数据集是一个用于关键信息提取的数据集,整合了来自开源社区的7个数据集,涵盖4个领域:发票、收据、表单和标签。具体包括FATURA(发票,2,500条记录)、SROIE(收据,973条记录)、wildreceipt(收据,1,739条记录)、CORD-v2(收据,1,000条记录)、xfund(表单,1,393条记录)、SIBR(表单,1,000条记录)和nutritional-data-poie-1(标签,483条记录)。数据集经过处理,如图像缩放和统一注释组织,以增强模型的泛化能力。
The OCR-KIE dataset is a dataset for key information extraction, which integrates seven datasets from the open-source community, covering four domains: invoices, receipts, forms, and labels. Specifically, it includes FATURA (invoices, 2,500 records), SROIE (receipts, 973 records), wildreceipt (receipts, 1,739 records), CORD-v2 (receipts, 1,000 records), xfund (forms, 1,393 records), SIBR (forms, 1,000 records), and nutritional-data-poie-1 (labels, 483 records). The dataset has been processed with operations such as image scaling and unified annotation organization to enhance the generalization ability of models.
数据集概述
该项目构建并发布了 OCR-KIE 数据集,用于微调 PaddleOCR-VL-KIE 模型,实现文档图像中的关键信息提取(KIE)。
数据集构成
OCR-KIE 数据集集成了来自 4 个领域 的 7 个公开数据集,具体如下:
| 数据集 | 类别 | 描述 | 原始记录数 |
|---|---|---|---|
| FATURA | 发票 | 发票文档(50个模板 × 50个实例) | 2,500 |
| SROIE | 收据 | 收据信息提取 | 973 |
| wildreceipt | 收据 | 野外的收据识别 | 1,739 |
| CORD-v2 | 收据 | 商业收据 | 1,000 |
| xfund | 表格 | 多语言表格理解(7种语言) | 1,393 |
| SIBR | 表格 | 文档中的结构化信息 | 1,000 |
| nutritional-data-poie-1 | 标签 | 营养信息标签 | 483 |
数据预处理
对原始数据集进行了统一的预处理,主要包括:
- 标注统一:使用 RLHF 方法,通过“大语言模型-人工反馈-脚本生成”流程,将所有原始标注转换为统一的 JSON 格式。
- 数据平衡:对 FATURA 数据集,每个模板仅抽取 50 条记录,以保证整体数据平衡。
- 图像压缩:将 PNG 格式图像转换为更小的 JPG 格式,并应用“基于字符像素密度的图像缩放算法”与 SWT 算法,按比例缩小图像,以降低显存占用。
- 头部翻译:根据语言对
header字段进行翻译(如中文翻译为“标题”)。 - 数据重划分:将原始的训练、验证、测试数据混合后,按 9:1 的比例重新划分为训练集和测试集。
- 数据增强:通过提取部分字段的方式扩展数据集,最终扩展后的训练集包含 48,000 条记录。
- 字段精简:移除了识别意义不大的
other字段。
数据格式
最终每条记录的组织格式如下:
json { "image_info": [ {"matched_text_index": 0, "image_url": "path/to/image.jpg"} ], "text_info": [ {"text": "OCR:{}", "tag": "mask"}, {"text": "{"key": "value", ...}", "tag": "no_mask"} ] }
image_info: 存储图像的相对路径。text_info: 包含识别提示(text_info[0])和待识别字段(text_info[1])。
提示词设计特点
与同类模型(如 GLM-OCR、HunyuanOCR)相比,OCR-KIE 的提示词设计具有以下特点:
- 支持全量信息提取:无需指定键名,可自动提取所有信息。
- 支持列表提取:能提取包含列表结构的数据。
- 提示词简洁:继承了 PaddleOCR-VL 的“OCR:”前缀。
模型微调
模型基于 PaddleOCR-VL-1.6 模型进行微调。微调过程可参考 PaddleOCR-VL-0.9B SFT 指南。
模型下载与使用
- 模型下载:可从 ModelScope 下载微调后的 PaddleOCR-VL-KIE 模型。
- 推理工具:推荐使用 PaddleOCR-VL-REC 工具进行信息提取,支持以字典或列表形式指定查询字段,并返回 JSON 格式结果。





