遇见数据集

Persian Pixel

收藏
arXiv2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

Persian Pixel是由研究团队创建的大规模波斯语合成OCR数据集,旨在解决波斯语因书写系统复杂和高质量标注数据稀缺而导致的OCR技术发展滞后问题。该数据集包含超过34.3万对高保真图像-文本对,覆盖句子、段落和完整页面布局,其文本来源于精心整理的700万词波斯语语料库,并利用SynthOCR-Gen渲染框架生成了逼真的图像。数据生成过程精确模拟了波斯文字的连笔、上下文相关的字形变体、变音符号位置以及多种代表性字体,同时通过超过25种随机退化模型模拟真实文档的扫描瑕疵、墨迹渗透、纸张老化等噪声,以弥合合成与真实数据的域差距。该数据集主要应用于训练和微调现代OCR架构(如TrOCR、Donut),支持波斯语文档分析、历史手稿数字化及端到端文档理解等研究,为低资源、字形复杂的文字识别提供了可扩展且经济高效的解决方案。

Persian Pixel is a large-scale synthetic Persian OCR dataset created by a research team, aiming to address the lagging development of OCR technologies for Persian caused by its complex writing system and the scarcity of high-quality annotated data. This dataset contains over 343,000 pairs of high-fidelity image-text pairs, covering sentences, paragraphs, and full page layouts. Its text is sourced from a meticulously curated 7-million-word Persian corpus, and realistic images are generated using the SynthOCR-Gen rendering framework. The data generation process accurately simulates Persian script features including connected strokes, context-dependent glyph variants, diacritic positions, and a variety of representative fonts. Meanwhile, over 25 random degradation models are employed to simulate noises in real documents such as scanning artifacts, ink bleed, paper aging and other imperfections, so as to bridge the domain gap between synthetic and real-world data. This dataset is mainly used for training and fine-tuning modern OCR architectures such as TrOCR and Donut, supporting research in Persian document analysis, historical manuscript digitization, end-to-end document understanding and other fields. It provides a scalable and cost-effective solution for low-resource, glyph-complex text recognition tasks.

创建时间:
2026-07-23
原始信息汇总

数据集概述:Persian Pixel

Persian Pixel 是一个为波斯语/法尔西语(fa)设计的合成光学字符识别(OCR)数据集。该数据集通过程序化渲染将 Unicode 文本转换为图像,并配以精确的转录文本,适用于 OCR 识别、图像到文本建模、微调和评估等工作流程。

关键属性

属性
语言 波斯语 / 法尔西语 (fa)
文字系统 波斯-阿拉伯字母
模态 图像 → 文本 (OCR)
数据来源 合成(字体渲染)
总样本数 (full) 343,246
许可证 CC BY-ND 4.0

数据集配置与规模

数据集按照渲染的粒度组织为不同的配置,另有一个 full 配置合并了所有子集。

配置 描述 样本数 典型宽度
sentence 短句/句子级别裁剪 251,000 640 px
paragraph 多行段落块 110,138 512 px
page 整页级别渲染 31,108 768 px
full 以上三个配置的合并 343,246

数据格式:共 320 个 Parquet 分片文件,总大小约 31.8 GB。

Page 配置统计信息

指标 最小值 最大值 平均值
高度 (px) 38 1100 597.92
文本长度 (字符数) 13 1896 824.22
行数 2 75 7.88

数据字段

所有配置共享相同的字段模式:

字段 类型 描述
bytes bytes 编码后的图像字节
path string 图像路径/名称
text string 精确的波斯语 Unicode OCR 目标转录文本
sample_type string 样本类型 (sentence, paragraph, 或 page)
source_run_id string 内部生成/发布运行标识符
image_path string 原始相对图像路径
width int 渲染图像的宽度 (像素)
height int 渲染图像的高度 (像素)
text_chars int text 中的 Unicode 字符数
line_count int 标签中的文本行数

推荐使用场景

  • 微调图像到文本和 OCR 模型,如 TrOCR、Donut、BLIP-2 和 PaliGemma 风格的解码器。
  • 在引入含有噪声的扫描或拍摄的 OCR 语料库之前,进行预训练或课程学习阶段。
  • 在波斯-阿拉伯文字上评估归一化、解码和后处理校正流程。
  • 在受控的合成条件下,针对不同的行数对波斯文本识别进行基准测试。

局限与注意事项

  • 此为合成 OCR 数据,在真实扫描、照片或手写场景上的性能无法保障,需在领域数据上验证。
  • 合成渲染可能引入伪影、异常换行、标点变化或源文本噪声。
  • paragraphpage 配置包含较长的多行标签和大尺寸图像,建议始终通过 datasets 库使用,而非直接解析。
搜集汇总
数据集介绍
Persian Pixel 数据集图片
构建方式
波斯语光学字符识别(OCR)的发展长期受限于标注数据匮乏与文字系统本身的复杂性。为此,研究者基于SynthOCR-Gen渲染框架构建了Persian Pixel数据集,该框架整合了完整的OpenType文本塑形引擎,能够精确再现波斯-阿拉伯文字体中的上下文字符连接、位置变体字形、合字形成以及变音符号定位等关键特征。数据集的文本来源为一个精心筛选的七百万词级波斯语语料库,涵盖百科、文学、新闻、政务、社交媒体及历史文献等多领域内容。所有文本经过去除标记、修复乱码、统一标准化以及去重等清洗流程后,被渲染为句子、段落和页面三种粒度的图像,共计超过343,000对图像-文本对。为模拟真实文档的退化现象,每张渲染图像还随机叠加了超过二十种退化模型,包括墨水渗散、纸张老化、模糊、光照变化、扫描伪影及多种噪声,从而有效弥合合成数据与真实数据之间的域差异。
使用方法
Persian Pixel为多种现代OCR架构提供了灵活的训练与评估基础。其句子级样本(约251,000张)可直接用于微调TrOCR这类基于Transformer的序列识别模型;段落级样本(约110,000张)适合训练需要处理换行和上下文信息的行级识别器;页面级样本(约31,000张)则适用于端到端文档理解模型如Donut,支持复杂布局分析与多列阅读任务。由于退化程度可控,研究者可采用课程学习策略,先以清晰渲染样本训练,再逐步引入重度退化图像以稳定优化过程。该数据集还便于领域自适应:在Persian Pixel上预训练的模型,仅需少量真实领域数据进行微调即可获得高精度。此外,精确的标注文本允许将其用作后OCR校正的基准,通过弱OCR引擎生成带噪声预测与黄金文本的对齐样本,专用于校正模型的训练与评估。数据集以Hugging Face格式公开,提供图像字节、Unicode文本、样本类型、源运行标识符及图像尺寸等完整元数据,便于下游任务的分层筛选与统计分析。
背景与挑战
背景概述
波斯语作为超过1.1亿人口使用的语言,承载着丰厚的文化遗产,但相较于拉丁语系,其光学字符识别(OCR)技术发展严重滞后。这一差距根植于波斯-阿拉伯书写系统固有的复杂性,包括强制性连笔、上下文相关的字形变体、繁复的连字、变音符定位以及不同书法风格(如Naskh和Nastaliq)的显著差异。为突破这一瓶颈,Pouria Mahdi与Haq Nawaz Malik于2026年推出了Persian Pixel数据集,这是一个大规模合成OCR数据集,包含逾34.3万张高保真图像-文本对,覆盖句子、段落和整页文档层级。该数据集基于精心筛选的七百万词波斯语语料库,借助SynthOCR-Gen渲染引擎生成,精准模拟了波斯文字的字形特征,并通过二十余种随机退化模型弥合合成与真实文档之间的领域鸿沟。Persian Pixel作为首个开源、多粒度、多字体的波斯语OCR基准,为训练TrOCR和Donut等先进架构提供了关键资源,有力推动了波斯语文档数字化与低资源复杂文字识别的研究。
当前挑战
Persian Pixel数据集所应对的核心挑战源于波斯语文字识别的双重困境。在领域问题层面,波斯-阿拉伯文字具有强制性连笔特性,每个基本字母依据上下文呈现多达四种位置相关字形,加之Naskh与Nastaliq风格在基线倾斜、垂直堆叠上的巨大差异,使得传统基于拉丁文字的识别模型普遍失效;细小点符与变音符极易在图像退化中丢失或混淆,导致语义级联错误,而双向文本布局更增加了序列建模的复杂度。在数据集构建过程中,挑战同样严峻:手动标注不仅成本高昂、速度缓慢,且难以覆盖多样字体与退化场景;现有波斯语资源规模小、字体单一、缺乏多粒度标注,导致模型泛化能力脆弱。Persian Pixel通过程序化合成数据生成,利用OpenType字形塑形引擎与可控退化管线,成功实现了对字体、布局和退化类型的全面覆盖,在确保像素级精确标注的同时,以可扩展、低成本的方案解决了长期困扰该领域的数据瓶颈问题。
常用场景
经典使用场景
在波斯语光学字符识别领域,Persian Pixel数据集最经典的使用场景是作为大规模、多粒度、多字体的合成训练资源,用于端到端地微调当代Transformer架构的OCR模型,如TrOCR和Donut。该数据集提供了超过34.3万对高质量图像-文本对,涵盖句子、段落和整页三种粒度,并精心模拟了波斯-阿拉伯书写系统的独特特性,包括强制连笔、上下文依赖的字形变体、连字、变音符定位以及双向文本布局。其合成数据生成流程融合了超过二十五种随机退化模型,精确再现了真实文档采集中的各类瑕疵,从而有效弥合了合成域与真实域之间的鸿沟。这种设计使得研究者能够利用该数据集训练出对字体、风格及文档退化具有强鲁棒性的识别器,显著提升波斯文档数字化的基础性能。
解决学术问题
该数据集直接突破了长期制约波斯语OCR发展的核心学术瓶颈——高质量标注数据的严重匮乏。由于波斯-阿拉伯文字体系内在的视觉复杂性和高昂的人工标注成本,此前可公开获取的数据集普遍规模有限、字体覆盖狭窄且多局限于单一文档类型,导致模型泛化能力薄弱。Persian Pixel通过程序化合成技术,以极低边际成本生成了包含丰富语言学内容、多字体风格(覆盖纳斯赫和纳斯塔利克两大书法传统)及可控退化的完美标注样本,系统性地解决了数据稀缺导致的模型脆弱性问题。它为研究者在低资源、高文字复杂度的脚本下探索合成数据策略的有效性提供了坚实的实验平台,推动了波斯文献分析、古籍数字化及端到端文档理解等学术方向的进步,同时为其他面临相似困境的语文提供了可复用的方法论范式。
实际应用
在实际应用层面,Persian Pixel数据集为波斯语印刷文档的全链条数字化处理提供了关键支撑。研究者和开发者可利用该数据集微调先进的OCR模型,从而将海量历史档案、政府记录、图书杂志及当代印刷品高效、准确地转化为可搜索、可编辑的机器可读文本。尤其值得关注的是,该数据集包含了对经典纳斯赫和纳斯塔利克字体的支持,使其特别适用于古典诗歌、宗教文献及历史手稿的数字化保存与索引。此外,通过将模型预训练于Persian Pixel再在小规模真实数据上微调的领域自适应策略,能够大幅降低对昂贵人工标注的依赖,这在资源有限的机构和文化遗产保护项目中具有极高的实用价值,有效拓宽了波斯语语言技术的普及范围。
数据集最近研究
最新研究方向
针对波斯语光学字符识别(OCR)领域长期面临的标注数据稀缺与文字系统复杂性双重瓶颈,最新前沿研究方向聚焦于利用大规模合成数据与深度Transformer架构的融合路径。Persian Pixel数据集的出现标志着该领域的范式转变:通过SynthOCR-Gen引擎忠实还原波斯-阿拉伯文字特有的上下文字形变体、连字与变音符号排布,结合超过25种随机退化模型模拟真实文档老化、扫描噪声与光照不均等物理瑕疵,成功搭建了合成域到真实域的迁移桥梁。该工作与当下热点事件紧密呼应——在低资源语言技术普惠化浪潮中,TrOCR与Donut等端到端识别模型正依赖此类高质量标注资源实现跨字体、跨风格的泛化能力跃升。其深远意义在于:不仅为波斯语历史手稿数字化、多栏版面理解和后OCR纠错提供了可扩展的基准平台,更验证了程序化数据生成作为一种低成本、可复现的解决方案,能够系统性破解从纳斯卡到纳斯塔利克等复杂手写体的OCR困局,为全球1.1亿波斯语使用者的文献智能化开辟了新纪元。
相关研究论文
  • 1
    Persian Pixel: A large-scale synthetic OCR dataset for Persian language · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务