遇见数据集

wkrl/cord

收藏
Hugging Face2022-07-09 更新2024-03-04 收录
官方服务:

资源简介:

--- annotations_creators: - crowdsourced language_creators: - crowdsourced language: - en multilinguality: - monolingual license: - cc-by-4.0 pretty_name: CORD size_categories: - 1K<n<10K source_datasets: - original task_categories: - token-classification task_ids: - parsing --- # Dataset Card for CORD (Consolidated Receipt Dataset) ## Table of Contents - [Table of Contents](#table-of-contents) - [Dataset Description](#dataset-description) - [Dataset Summary](#dataset-summary) - [Supported Tasks and Leaderboards](#supported-tasks-and-leaderboards) - [Dataset Structure](#dataset-structure) - [Data Instances](#data-instances) - [Data Fields](#data-fields) - [Data Splits](#data-splits) - [Additional Information](#additional-information) - [Licensing Information](#licensing-information) - [Citation Information](#citation-information) - [Contributions](#contributions) ## Dataset Description - **Repository: https://github.com/clovaai/cord** - **Paper: https://openreview.net/pdf?id=SJl3z659UH** - **Leaderboard: https://paperswithcode.com/dataset/cord** ### Dataset Summary [More Information Needed] ### Supported Tasks and Leaderboards [More Information Needed] ## Dataset Structure ### Data Instances [More Information Needed] ### Data Fields ```python { "id": datasets.Value("string"), "words": datasets.Sequence(datasets.Value("string")), "bboxes": datasets.Sequence(datasets.Sequence(datasets.Value("int64"))), "labels": datasets.Sequence(datasets.features.ClassLabel(names=_LABELS)), "images": datasets.features.Image(), } ``` ### Data Splits - train (800 rows) - validation (100 rows) - test (100 rows) ## Dataset Creation ### Licensing Information [Creative Commons Attribution 4.0 International License](http://creativecommons.org/licenses/by/4.0/) ### Citation Information ``` @article{park2019cord, title={CORD: A Consolidated Receipt Dataset for Post-OCR Parsing}, author={Park, Seunghyun and Shin, Seung and Lee, Bado and Lee, Junyeop and Surh, Jaeheung and Seo, Minjoon and Lee, Hwalsuk} booktitle={Document Intelligence Workshop at Neural Information Processing Systems} year={2019} } ``` ### Contributions Thanks to [@clovaai](https://github.com/clovaai) for adding this dataset.

--- annotations_creators: - 众包(crowdsourced) language_creators: - 众包(crowdsourced) language: - 英语(en) multilinguality: - 单语言(monolingual) license: - CC BY 4.0(cc-by-4.0) pretty_name: CORD size_categories: - 1K<n<10K source_datasets: - 原始数据集(original) task_categories: - Token分类(token-classification) task_ids: - 句法分析(parsing) --- # CORD(整合式收据数据集)数据集卡片 ## 目录 - [目录](#table-of-contents) - [数据集描述](#dataset-description) - [数据集概述](#dataset-summary) - [支持任务与排行榜](#supported-tasks-and-leaderboards) - [数据集结构](#dataset-structure) - [数据实例](#data-instances) - [数据字段](#data-fields) - [数据划分](#data-splits) - [附加信息](#additional-information) - [许可信息](#licensing-information) - [引用信息](#citation-information) - [贡献说明](#contributions) ## 数据集描述 - **代码仓库:https://github.com/clovaai/cord** - **相关论文:https://openreview.net/pdf?id=SJl3z659UH** - **排行榜页面:https://paperswithcode.com/dataset/cord** ### 数据集概述 [More Information Needed] ### 支持任务与排行榜 [More Information Needed] ## 数据集结构 ### 数据实例 [More Information Needed] ### 数据字段 python { "id": datasets.Value("string"), "words": datasets.Sequence(datasets.Value("string")), "bboxes": datasets.Sequence(datasets.Sequence(datasets.Value("int64"))), "labels": datasets.Sequence(datasets.features.ClassLabel(names=_LABELS)), "images": datasets.features.Image(), } ### 数据划分 - 训练集(800条数据) - 验证集(100条数据) - 测试集(100条数据) ## 数据集构建 ### 许可信息 [知识共享署名4.0国际许可协议](http://creativecommons.org/licenses/by/4.0/) ### 引用信息 @article{park2019cord, title={CORD:面向OCR后处理句法分析的整合式收据数据集}, author={Park, Seunghyun and Shin, Seung and Lee, Bado and Lee, Junyeop and Surh, Jaeheung and Seo, Minjoon and Lee, Hwalsuk} booktitle={神经信息处理系统大会文档智能专题研讨会} year={2019} } ### 贡献说明 感谢 [@clovaai](https://github.com/clovaai) 为本数据集的收录提供支持。

提供机构:
wkrl
原始信息汇总

数据集概述

基本信息

  • 数据集名称: CORD (Consolidated Receipt Dataset)
  • 语言: 英语 (en)
  • 多语言性: 单语
  • 许可证: CC-BY-4.0
  • 数据集大小: 1K<n<10K
  • 数据来源: 原始数据
  • 任务类别: 词元分类
  • 任务ID: 解析

数据集结构

数据实例

  • 训练集: 800行
  • 验证集: 100行
  • 测试集: 100行

数据字段

  • id: 字符串类型
  • words: 字符串序列
  • bboxes: 整数序列序列
  • labels: 类别标签序列
  • images: 图像类型

数据集创建

许可证信息

  • 许可证: Creative Commons Attribution 4.0 International License

引用信息

@article{park2019cord, title={CORD: A Consolidated Receipt Dataset for Post-OCR Parsing}, author={Park, Seunghyun and Shin, Seung and Lee, Bado and Lee, Junyeop and Surh, Jaeheung and Seo, Minjoon and Lee, Hwalsuk} booktitle={Document Intelligence Workshop at Neural Information Processing Systems} year={2019} }

搜集汇总
数据集介绍
wkrl/cord 数据集图片
构建方式
CORD(Consolidated Receipt Dataset)是由Clova AI研究团队构建的面向收据解析任务的专用数据集。其构建过程依托众包平台进行数据采集与标注,原始数据来源于真实场景下的收据图像,经过人工标注后形成包含单词级别语义标签的结构化信息。数据集共包含1000张收据图像,按照8:1:1的比例划分为训练集、验证集和测试集,分别对应800、100和100个样本。每个样本记录了单词序列、边界框坐标、语义标签及原始图像,为后OCR阶段的语义解析任务提供了完备的监督信号。
使用方法
CORD数据集主要面向序列标注与解析任务,适用于训练和评估收据信息抽取模型。使用时,用户可通过HuggingFace Datasets库直接加载数据集,获取包含'id'、'words'、'bboxes'、'labels'和'images'五个字段的样本。其中'words'为文本序列,'bboxes'为对应的边界框坐标,'labels'为语义标签,'images'为原始图像。典型应用流程包括对收据图像进行OCR识别后,基于CORD训练的模型对文本序列进行语义解析,最终输出结构化的收据信息。数据集也常用于多模态预训练模型的微调与评测。
背景与挑战
背景概述
CORD(Consolidated Receipt Dataset)数据集由韩国Naver Clova AI团队于2019年创建,发表于NeurIPS文档智能研讨会,旨在推动光学字符识别后解析任务的标准化研究。该数据集聚焦于收据文档的结构化信息提取,核心研究问题在于如何从非结构化的OCR文本中准确解析出商品名称、价格、总金额等关键字段,并建立其层级关系。CORD包含1000张标注精细的收据图像,分为训练、验证和测试集,其影响力体现在为文档智能领域提供了一个基准测试平台,促进了基于序列标注和语义解析的模型发展,成为收据理解任务中的标杆数据集。
当前挑战
CORD所解决的领域挑战在于收据文档的复杂结构解析,包括不规则布局、多级嵌套字段(如商品项与明细)以及OCR噪声导致的文本碎片化,这要求模型具备强大的上下文理解与实体关系建模能力。构建过程中,团队面临标注一致性的难题,需对众包标注者进行严格培训以确保字段边界的精确性,同时收据来源的多样性(不同商店、语言和格式)增加了数据覆盖的难度,需平衡样本均衡性与真实场景的分布。此外,图像质量差异(如光照、倾斜)与文本重叠现象进一步提升了预处理和标注的复杂度。
常用场景
经典使用场景
CORD(Consolidated Receipt Dataset)作为面向收据文档的结构化解析基准数据集,其经典使用场景集中于端到端的收据信息抽取任务。研究者利用该数据集训练模型,从扫描收据图像中精准识别并抽取商品名称、单价、数量、小计及总金额等关键字段,并构建层次化的语义结构树。该场景不仅涵盖传统的OCR文字识别,更强调对收据版面布局与逻辑关系的深度理解,是文档智能领域中结构化信息提取的典型范例。
解决学术问题
在学术研究层面,CORD有效解决了收据文档后OCR解析的标准化评估难题。此前,收据信息抽取缺乏统一的高质量标注基准,导致不同方法间难以公平比较。该数据集提供了800张训练样本、100张验证样本和100张测试样本,并定义了包含30余种细粒度标签的标注体系,覆盖菜单项、税费、支付方式等复杂结构。其发布推动了序列标注、图神经网络及多模态预训练模型在文档解析任务中的性能提升,成为评估模型泛化能力与鲁棒性的关键测试平台。
实际应用
实际应用中,CORD衍生的技术方案被广泛部署于企业财务自动化、移动端发票扫描及零售数据分析系统。例如,基于该数据集训练的模型可自动从纸质或电子收据中提取费用明细,无缝对接企业资源规划(ERP)系统,显著降低人工录入成本与错误率。在消费金融领域,收据解析技术助力个人记账应用实现智能分类与预算管理,提升用户体验。此外,税务审计与报销审核场景也受益于该数据集的标注规范,实现了对海量收据的快速合规性检查。
数据集最近研究
最新研究方向
在文档智能与光学字符识别后处理领域,CORD(Consolidated Receipt Dataset)作为面向收据解析的标准化基准,正推动着结构化信息抽取技术的前沿探索。当前研究热点聚焦于利用多模态预训练模型(如LayoutLM、Donut)对收据图像中的文本、空间布局与语义标签进行联合建模,以提升对非结构化收据内容的精准解析能力。随着零售业数字化转型加速,CORD在自动财务报销、供应链审计等场景中扮演关键角色,其细粒度的标签体系(如商品名称、单价、总价)为少样本学习与跨域迁移提供了验证平台。该数据集不仅促进了轻量级端侧模型的研发,还推动了对抗性鲁棒性与低资源语言泛化的研究,成为连接计算机视觉与自然语言处理交叉方向的重要基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务