遇见数据集

hezarai/parsynth-ocr-4m

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集包含400万个合成的波斯语文本行图像,使用基于TextRecognitionDataGenerator(trdg)的定制波斯语分支生成。它专为训练高性能的波斯语光学字符识别(OCR)和文本识别模型而设计,是Hezar AI官方波斯语OCR模型(如hezarai/crnn-base-fa-v2和hezarai/crnn-fa-license-plate-recognition-v2)的基础预训练数据集。数据集分为三个分区:高斯噪声背景(300万样本)、浅色文档背景(100万样本)和深色文档背景(100万样本),每个分区具有不同的文本颜色、背景纹理和质量退化,以增强模型多样性。文本来源自hezarai/lscp-pos-500k词典语料库,生成工具为hezarai/trdg-persian,支持波斯语从右到左渲染、连字保留和分词处理。主要用途包括波斯语OCR模型的预训练或微调(如CRNN、TrOCR、Donut等),以及下游任务(如车牌识别、文档扫描)的微调。

This dataset contains 4,000,000 synthetic Persian text line images generated using a customized Persian fork of TextRecognitionDataGenerator (trdg). It is designed specifically for training high-performance optical character recognition (OCR) and text recognition models for Persian text. This dataset served as the foundational pre-training dataset for the official Hezar AI Persian OCR models, including hezarai/crnn-base-fa-v2 and hezarai/crnn-fa-license-plate-recognition-v2. The dataset consists of three distinct partitions: Gaussian noise backgrounds (3M samples), light document backgrounds (1M samples), and dark document backgrounds (1M samples), each with varying text colors, background textures, and quality degradations to expose OCR models to diverse conditions. The text is sampled from the hezarai/lscp-pos-500k dictionary corpus, and the generation tool is hezarai/trdg-persian, featuring custom RTL fixes, ligature preservation, and word-split handling. The primary use case is pre-training or fine-tuning OCR models (e.g., CRNN, TrOCR, Donut) for general Persian text and downstream fine-tuning (e.g., license plates, document scanning).

提供机构:
hezarai
原始信息汇总

数据集概述

  • 数据集名称: Synthetic Persian OCR Dataset (4M)
  • 数据集规模: 4,000,000 张合成波斯语文本行图像
  • 语言: 波斯语 (fa)
  • 文本来源: 从 hezarai/lscp-pos-500k 词典语料库中直接采样
  • 生成工具: hezarai/trdg-persian(包含自定义 RTL 修复、连字保留和分词处理)
  • 主要用途: 用于预训练或微调 OCR 模型(如 CRNN、TrOCR、Donut 等),适用于通用波斯语文本识别及下流任务微调(如车牌识别、文档扫描)

数据集分区详情

数据集包含三个不同的分区,旨在让 OCR 模型接触多样化的文本颜色、背景纹理和质量退化:

分区 样本数量 索引范围 背景类型 文本颜色调色板 质量退化
分区 1(高斯噪声) 3,000,000 02,999,999 高斯噪声 (-b 0) 深色调 (#284854, #542828) 50% 降采样,20% 应用 (-rqf 0.5 -rqp 0.2)
分区 2(浅色文档) 1,000,000 3,000,0003,999,999 浅色文档背景 (-b 3) 深色调 (#284854, #542828) 标准质量
分区 3(深色文档) 1,000,000 4,000,0004,999,999 深色文档背景 (-b 3) 柔和粉彩色调 (#ed8c8c, #8ceced) 50% 降采样,20% 应用 (-rqf 0.5 -rqp 0.2)

数据格式

  • 模态: 图像、文本
  • 文件格式: parquet, optimized-parquet
  • 数据集行数: 4,152,807 行
  • 总文件大小: 12.6 GB

基于该数据集的预训练模型

该数据集已被用于训练以下模型:

  • 通用波斯语 OCR:
    • hezarai/crnn-base-fa-v2
    • hezarai/crnn-base-fa-v1
  • 专用微调模型:
    • hezarai/crnn-fa-license-plate-recognition-v2
    • hezarai/crnn-fa-license-plate-recognition-v1

数据集主页

  • 地址: https://hf-mirror.com/datasets/hezarai/parsynth-ocr-4m
搜集汇总
数据集介绍
hezarai/parsynth-ocr-4m 数据集图片
构建方式
该数据集源于波斯语光学字符识别领域的迫切需求,通过定制化的Persian TRDG工具,从hezarai/lscp-pos-500k词典语料库中采样文本,生成400万张合成文本行图像。数据集划分为三个异构子集:第一部分300万张采用高斯噪声背景,搭配深色字体及50%概率的质量退化;第二部分100万张采用浅色文档背景与深色字体;第三部分100万张采用深色文档背景与柔和浅色字体,同样施加质量退化。生成过程中特别启用了从右到左渲染逻辑、单词分割模式以保留波斯语连字与复杂字母连接,并随机应用-5°至5°的旋转与倾斜。
特点
数据集的核心特点在于其多维度的合成策略,通过多样化的背景纹理(高斯噪声、浅色及深色文档)、双色调文本配色方案以及可控的质量退化机制,模拟真实场景中波斯语文本的视觉变异性。所有图像统一固定高度为48像素,配备3像素边距,且采用丰富的波斯语字体库。该数据集已成功支撑Hezar AI官方CRNN系列模型的预训练,包括通用波斯语OCR及车牌识别等下游任务,显著提升了模型在复杂背景与低质量条件下的鲁棒性。
使用方法
数据集以HuggingFace格式发布,包含图像与对应文本字段,仅提供训练集分裂,适用于基于深度学习的OCR模型训练。用户可直接加载数据集进行预训练或微调,支持CRNN、TrOCR、Donut等架构。推荐首先在该数据集上预训练基础模型,随后针对特定应用场景(如文档扫描或车牌识别)进行下游微调。数据集的生成参数与命令完全公开,便于研究者复现或扩展自定义合成流程,以适应其他语言或领域需求。
背景与挑战
背景概述
随着基于深度学习的文字识别技术在拉丁语系中的显著成功,针对阿拉伯-波斯语系的光学字符识别(OCR)研究仍面临标记数据匮乏的核心瓶颈。波斯文字固有的从右至左书写方向、复杂的字母连写与变形机制,以及多样化的排版风格,使得构建大规模、高质量的现实场景数据集极为困难。为突破这一困境,Hezar AI研究团队于2024年基于定制化的TextRecognitionDataGenerator框架开发了Parsynth-OCR-4M数据集,该数据集包含400万张源自波斯语词库的合成文本行图像,通过高斯噪声背景与深浅文档背景策略生成,并引入分辨率衰减等模拟真实退化。该数据集作为官方预训练语料,成功驱动了CRNN系列通用与特定场景OCR模型的训练,为低资源波斯文文字识别系统提供了坚实的数据基石。
当前挑战
该数据集所解决的领域核心挑战在于波斯文OCR训练中真实标注数据的极端稀有与多样性覆盖不足。波斯文字独特的RTL渲染、连字保存及单词边界模糊处理,在合成生成过程中易引入排版错误或风格单一化问题,导致模型在泛化真实场景时性能陡降。构建过程中,需精细调控背景纹理、颜色对比、随机旋转与降质参数以模拟复杂环境,但三维参数空间的高维组合与400万规模的平衡采样对计算资源与设计策略提出严苛要求。此外,合成数据固有的域差异使得预训练模型在迁移至车牌识别或文档扫描等下游任务时需筛选额外的微调约束,这进一步增加了系统泛化的工程难度。
常用场景
经典使用场景
在波斯语光学字符识别(OCR)领域,parsynth-ocr-4m数据集作为大规模合成文本行图像库,主要用于预训练或微调基于深度学习的文本识别模型,例如CRNN、TrOCR和Donut等架构。该数据集包含400万张精心生成的波斯语文本行图像,覆盖高斯噪声背景、浅色文档背景和深色文档背景三种场景,并引入随机旋转、缩放和质量退化等增强手段,以模拟真实世界中多变的光照、纸张纹理和打印质量。研究者可借此构建鲁棒性强的OCR系统,尤其适用于处理波斯语特有的从右到左书写方向、连字保留和复杂字符连接等语言学特性,为后续领域适配提供坚实的数据基础。
解决学术问题
该数据集有效缓解了波斯语OCR研究中高质量标注数据匮乏的瓶颈问题。传统波斯语文本数据集通常规模有限、场景单一,难以支撑深度模型对复杂书写变体、噪声背景和退化质量的泛化能力。parsynth-ocr-4m通过系统化的合成策略,模拟了多种成像条件(如高斯噪声、文档破损和光照不均),使模型能够学习到对真实世界干扰的鲁棒特征。其意义在于为波斯语文本识别领域提供了一个标准化的大规模预训练基准,显著提升了下游任务(如车牌识别、文档数字化)的性能上限,并推动了低资源语言OCR技术的学术进展。
衍生相关工作
基于parsynth-ocr-4m数据集,研究者衍生出多项经典工作。最直接的是Hezar AI团队发布的官方OCR模型系列,包括hezarai/crnn-base-fa-v2用于通用波斯语文本识别,以及hezarai/crnn-fa-license-plate-recognition-v2专用于车牌识别。这些模型均以本数据集作为预训练基础,再通过少量真实标注数据进行微调,证明了合成数据与真实数据协同训练的有效性。此外,该数据集的生成工具链(hezarai/trdg-persian)已开源,促进了波斯语OCR数据增强技术的社区共享,并启发后续工作探索更丰富的背景纹理、字体库和退化模式合成策略。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务