Voxel51/consolidated_receipt_dataset
收藏官方服务:
资源简介:
这是一个大规模的印尼收据数据集,旨在用于后OCR解析任务,特别是针对收据理解。该数据集包含超过11,000张来自商店和餐馆的印尼收据图像,带有OCR注释(边界框和文本)和多级语义标签以进行解析。FiftyOne的实现提供了一个易于探索的800个带注释收据图像的训练分割的界面。数据集弥合了OCR和NLP任务之间的差距,通过提供视觉和语义注释,使其适合端到端的文档智能系统。每个收据都包括具有30个语义类别的详细注释,这些类别分为5个超类(菜单、无效菜单、小计、无效总计和总计),以及包括行分组、感兴趣区域和键值对标记的元数据。
CORD (Consolidated Receipt Dataset) is a large-scale dataset designed for post-OCR parsing tasks, specifically focused on receipt understanding. The dataset contains over 11,000 Indonesian receipts collected from shops and restaurants, featuring images with OCR annotations (bounding boxes and text) and multi-level semantic labels for parsing. This FiftyOne implementation provides an accessible interface for exploring the training split with 800 annotated receipt images.
提供机构:
Voxel51搜集汇总
数据集介绍

构建方式
在文档智能研究领域,后OCR解析任务长期面临视觉特征与语义标签之间的鸿沟。为弥合这一差距,NAVER CLOVA AI研究团队构建了Consolidated Receipt Dataset(CORD),该数据集专注于收据理解,包含超过11,000张来自印度尼西亚商店和餐厅的收据图像。本FiftyOne实现提供了训练分片中的800张标注收据图像。数据集的构建历经严谨的流程:首先收集真实的商业收据图像,随后进行OCR标注,包括人工验证和校正边界框与文本转录,接着依据包含30个语义类别(分属5个超类)的分类体系进行语义标注,并通过group_id和row_id实现层级化元素关联,同时标记键值对标志,最后经过多轮质量控制确保标注的一致性与正确性。原始的四边形边界框在FiftyOne实现中被转换为轴对齐的矩形框。
特点
该数据集的核心特点在于其精细的多层级语义标注体系,涵盖菜单、作废菜单、小计、总计等五大超类下的30个细粒度语义类别,每个标注元素均包含归一化边界框坐标、OCR文本内容、键值标志以及关联同一菜单项所有字段的组标识符。样本层面还提供了商品数量、小计金额、服务费、税费及总计价格等结构化元数据。数据集特别适合用于文档理解研究、OCR后处理、键值对提取、视觉文档分析及多模态学习等任务。然而,受限于数据来源,该数据集仅包含印度尼西亚语收据,且已根据隐私法规移除了商店信息和支付详情等敏感类别,因此不适用于多语言收据解析或商业交易分析等场景。
使用方法
通过FiftyOne工具库,用户可以便捷地加载和探索该数据集。首先需安装FiftyOne(pip install -U fiftyone),随后在Python环境中使用from fiftyone.utils.huggingface import load_from_hub导入加载函数,通过dataset = load_from_hub("Voxel51/consolidated_receipt_dataset")即可获取包含800个样本的数据集对象,并支持max_samples等可选参数控制加载数量。加载完成后,调用session = fo.launch_app(dataset)可启动FiftyOne的交互式可视化应用,实现对收据图像的浏览、按类别筛选、边界框与文本标注的可视化展示,以及与计算机视觉和机器学习工作流的无缝集成。
背景与挑战
背景概述
CORD(Consolidated Receipt Dataset)是由NAVER CLOVA AI研究团队于2019年构建的大规模收据理解数据集,旨在弥合光学字符识别(OCR)与语义解析之间的鸿沟。该数据集包含超过11,000张来自印尼商店和餐厅的收据图像,并提供了精细的多层次标注,包括边界框、文本转录、30个语义类别(分属5个超类)以及层级分组信息。其核心研究问题聚焦于后OCR解析任务,推动统一OCR-NLP系统的端到端文档智能发展。CORD的发布为文档理解、关键信息提取及多模态学习提供了标准化基准,在NeurIPS 2019文档智能研讨会上引起广泛关注,成为收据解析领域的重要参考数据集。
当前挑战
CORD数据集面临的挑战主要体现在领域问题与构建过程两方面。在领域层面,收据具有复杂的层级结构(如菜单项、小计、总计)和多样化的布局,要求模型同时处理视觉特征与语义标签,这超越了传统图像分类或简单文本识别的范畴。此外,数据集仅包含印尼语文本,且依赖于准确的OCR输出,模型在跨语言、跨领域或低质量图像场景下的泛化能力受限。在构建过程中,标注需手工完成边界框校正、语义分类及层级链接,涉及30个细粒度类别和关键值标记,工作量巨大且易引入不一致性。同时,受印尼隐私法规限制,部分敏感信息(如商店详情)被移除,导致数据完整性受损,进一步增加了解析难度。
常用场景
经典使用场景
在文档智能与光学字符识别后处理领域,Consolidated Receipt Dataset(CORD)被广泛用于训练和评估面向收据理解的结构化信息抽取模型。该数据集提供了800张经人工标注的印尼语收据图像,涵盖30个语义类别与5个超类,包括菜单项、小计、总计等层级化标签,并附带OCR文本、边界框及键值对标志。研究者常利用其丰富的标注信息,构建端到端的收据解析系统,例如基于序列标注的BIO标签解析器或融合视觉与文本特征的多模态模型。CORD的精细粒度标注使得模型能够从非结构化的OCR输出中提取出结构化表格与键值关系,成为评测后OCR解析性能的标准基准之一。
解决学术问题
CORD数据集的核心价值在于弥合了光学字符识别与自然语言处理之间的鸿沟,解决了传统上两者独立研究导致的语义解析断裂问题。在学术研究中,该数据集为后OCR解析任务提供了标准化的评测平台,使研究者能够系统性地探索如何将OCR输出的离散文本片段重组为具有层级结构的语义单元。通过CORD,学术界得以深入分析收据文档中复杂的层次关系——例如菜单项与其单价、数量之间的关联,以及小计与总价之间的聚合逻辑——从而推动了基于BIO标注的序列解析方法、图神经网络的关系建模技术以及视觉-语言联合预训练策略的发展。该数据集的出现显著促进了文档理解领域从纯视觉识别向语义结构化理解的范式转变。
衍生相关工作
CORD数据集催生了多项具有影响力的经典研究工作。其中,Park等人(2019)在NeurIPS文档智能研讨会上首次提出该数据集,并展示了基于双向LSTM的序列标注模型在后OCR解析中的有效性。Hwang等人(2019)进一步提出了基于BIO标注的简单而鲁棒的解析器,将语义标签与位置信息相结合,显著提升了层级化收据理解的准确性。此外,Kim等人(2022)发布的Donut模型——一种无需OCR的文档理解Transformer——也采用CORD作为关键评测基准,验证了纯视觉模型在文档解析任务上的竞争力。这些工作共同推动了文档智能领域从传统OCR管线向端到端多模态理解的演进。
以上内容由遇见数据集搜集并总结生成



