遇见数据集

ocr_data

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集是合成阿拉伯语文档图像数据集,包含布局标注,主要用于光学字符识别(OCR)训练任务。数据以WebDataset格式存储,采用.tar分片文件,每个分片最多包含9990个样本,大小约为1.2GB。数据集分为原始子集(data/)和增强子集(data_aug/),其中原始子集使用PNG图像和JSON标注,增强子集使用JPEG/PNG图像和JSON标注。每个样本包含一张图片和对应的JSON标注,标注字段包括:图像尺寸(dimensions)、文本块(blocks)列表(含类型、文本、坐标、阅读顺序)、图像区域(images)列表以及元数据(meta,如模板、字体、语言、脚本、方向等)。增强子集的元数据中会记录具体的增强名称和参数。该数据集支持通过HuggingFace Datasets库加载,可指定单个分片、分片范围,或同时加载原始和增强所有数据。

This dataset is a synthetic Arabic document image dataset with layout annotations, primarily used for Optical Character Recognition (OCR) training tasks. The data is stored in WebDataset format using .tar shards, each containing up to 9990 samples with a size of approximately 1.2GB. The dataset is divided into a raw subset (data/) and an augmented subset (data_aug/), where the raw subset uses PNG images and JSON annotations, and the augmented subset uses JPEG/PNG images and JSON annotations. Each sample includes an image and corresponding JSON annotation, with fields including: image dimensions, a list of text blocks (with type, text, coordinates, reading order), a list of image regions, and metadata (e.g., template, font, language, script, orientation, etc.). The augmented subsets metadata records specific augmentation names and parameters. The dataset supports loading via the HuggingFace Datasets library, allowing specification of single shards, shard ranges, or loading all raw and augmented data together.

创建时间:
2026-09-06
原始信息汇总

数据集概述:OCR-Data-new/ocr_data

该数据集是一个合成阿拉伯语文档图像数据集,专门用于 OCR(光学字符识别)训练,并附带布局标注信息。

基本属性

属性
任务类别 图像到文本(image-to-text)
语言 阿拉伯语(ar)
标签 OCR、阿拉伯语、合成数据、WebDataset
数据格式 WebDataset .tar 分片文件

数据布局

数据集主目录下包含两个子目录:

  • data/:原始数据分片,文件格式为 PNG(图像)+ JSON(标注),文件名格式为 <contributor>_<NNN>.tar
  • data_aug/:增强变体数据分片,文件格式为 JPEG/PNG(图像)+ JSON(标注),文件名格式为 <contributor>_<NNN>_aug<K>.tar

文件组织规则:共享同一个基名的文件属于同一样本,其中图像作为 image 列,标注作为 json 列。每个分片最多包含 9990 个样本,大小约为 1.2 GB。data/data_aug/ 目录彼此分离,便于仅使用干净的原始图像进行训练。

加载方式

该数据集采用 WebDataset 格式,可通过 Hugging Face 的 datasets 库进行流式加载,支持三种模式:

  1. 加载单个分片:通过 data_files 参数指定具体分片路径
  2. 加载连续范围的分片:使用大括号语法,如 {001..010} 加载指定范围的多个分片
  3. 加载全量数据:同时指定 data/*.tardata_aug/*.tar,将原始数据与增强数据合并

此外,如需恢复为松散文件,可使用生成器仓库中的 unpack_shard.py 脚本。

标注格式(Annotation Schema)

每个样本的 JSON 标注包含以下字段:

  • dimensions:页面尺寸信息(宽度和高度)
  • blocks:文本块数组,每个文本块包含:
    • type:块类型
    • text:文本内容
    • top_left_x / top_left_y:左上角坐标
    • bottom_right_x / bottom_right_y:右下角坐标
    • reading_index:阅读顺序索引
  • images:图像区域数组,包含位置坐标信息(如 top_left_x
  • meta:元信息,包括:
    • template:使用的模板
    • hybrid:混合标记(通常为 null)
    • page_font:页面字体
    • language:语言(固定为 ar
    • script:文字系统(固定为 arabic
    • direction:书写方向(固定为 rtl,即从右到左)
    • augmentation:增强信息(原始数据为 null;增强数据为对象格式,包含 nameparams 字段)
搜集汇总
数据集介绍
ocr_data 数据集图片
构建方式
在阿拉伯语光学字符识别研究领域,高质量标注数据的匮乏长期制约着模型性能的提升。该数据集通过合成方式构建,以阿拉伯语文本内容为基础,结合版面布局生成引擎,产出带有精细化标注的文档图像。每份样本由图像与对应JSON标注文件以相同基名配对组成,涵盖原始图像与经过增强处理的变体,增强操作包括JPEG压缩、噪声注入等,其具体参数记录于元数据中。所有样本按WebDataset格式打包为tar分片,单分片容量约1.2 GB,最多容纳9990个样本,原始数据与增强数据分列于data/和data_aug/目录,便于按需取用。
使用方法
使用该数据集时,可借助HuggingFace datasets库的webdataset加载器进行流式读取。通过指定data_files参数,用户能够灵活选择单个分片、连续分片区间或全部原始与增强数据。加载后,图像自动映射至image列,标注信息映射至json列,可直接用于模型训练。若需获取独立文件,可利用生成器仓库中的unpack_shard.py脚本对tar分片进行解包。标注schema中,blocks字段记录每个文本块的类型、内容、边界坐标及阅读索引,images字段记录图像区域信息,meta字段则提供模板、字体、语言、文字、方向及增强参数等元信息,为数据筛选与条件训练提供依据。
背景与挑战
背景概述
阿拉伯语光学字符识别(OCR)长期受限于高质量标注数据的匮乏,现有资源多聚焦于拉丁语系,难以满足阿拉伯语复杂字形与连写规则的需求。在此背景下,ocr_data数据集应运而生,由OCR-Data-new团队构建并发布于HuggingFace平台,旨在为阿拉伯语OCR训练提供合成文档图像及版面标注。该数据集采用WebDataset分片格式,涵盖原始与增强样本,支持图像到文本任务,其核心研究问题在于利用合成数据缓解真实标注瓶颈。作为一项面向低资源语言OCR的探索,它为阿拉伯语文档分析提供了可扩展的训练基础,对推动多语言OCR研究具有积极意义。
当前挑战
该数据集所应对的领域问题在于阿拉伯语OCR的文本识别与版面理解,其难点源于阿拉伯语从右至左的书写方向、上下文相关的字形变化以及复杂的连字结构,传统模型难以准确捕捉。构建过程中,合成文档的版面多样性、字体与模板的覆盖范围、以及增强策略对模型泛化能力的影响均构成挑战。此外,合成数据与真实文档之间的域差异可能导致模型迁移性能下降,标注模式中阅读顺序与区块类型的精确性亦需保证。如何在保持合成规模的同时提升数据逼真度,并有效评估其在真实场景中的鲁棒性,仍是亟待解决的课题。
常用场景
经典使用场景
在光学字符识别领域,ocr_data数据集主要服务于阿拉伯语文档图像的文本检测与识别任务。该数据集提供带有版面布局标注的合成阿拉伯语文档图像,样本遵循WebDataset分片格式存储,图像与JSON标注以相同基名配对,可直接用于训练端到端的OCR模型。研究者在加载数据时既可选择仅使用原始干净图像,也可混合增强变体以提升模型鲁棒性,这一灵活性使其成为阿拉伯语OCR模型预训练与微调的经典数据来源。
解决学术问题
阿拉伯语OCR研究长期受制于标注数据稀缺、书写方向自右向左及字形连写等复杂特性。ocr_data通过大规模合成方式生成带有精确版面标注的文档图像,有效缓解了真实标注数据获取成本高昂的问题。其标注涵盖文本块坐标、阅读顺序与字体元信息,为文本检测、版面分析与阅读顺序预测等任务提供了细粒度监督信号,推动了阿拉伯语文档理解研究从依赖规则向数据驱动范式的转变,具有重要的方法论意义。
实际应用
在实际应用中,ocr_data可支撑阿拉伯语文档数字化、历史文献归档与多语言办公自动化等场景。基于该数据集训练的OCR系统能够自动提取票据、公文与书籍图像中的文本内容,降低人工录入成本。其合成数据生成流程亦可迁移至其他从右向左书写的语言,如波斯语与乌尔都语,为低资源语言的文档智能化处理提供可复用的技术路径,具有显著的工程应用价值。
数据集最近研究
最新研究方向
在阿拉伯语光学字符识别领域,面向复杂版面分析与文字识别的合成数据生成技术正成为前沿探索方向。ocr_data数据集以WebDataset格式提供带有布局标注的合成阿拉伯语文档图像,涵盖原始与增强变体,支持从版面元素定位到阅读顺序预测的多任务学习场景。当前研究热点集中于利用此类合成数据缓解真实标注数据稀缺的困境,并探索增强策略对模型鲁棒性的影响。该数据集通过提供精细的边界框、阅读索引及字体模板等元信息,为端到端OCR系统与文档理解模型的训练提供了重要资源,对推动低资源语言场景下的文档智能研究具有积极意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务