PsOCR - Pashto OCR Dataset
收藏资源简介:
PsOCR是一个用于低资源普什图语光学字符识别的大规模合成数据集。这是第一个公开可用的全面普什图语OCR数据集,包含一百万张合成图像,标注粒度涵盖单词、行和文档级别,覆盖了包括1000种独特字体家族、多样颜色、图像大小和文本布局在内的广泛变化。PsOCR还包括第一个公开可用的OCR基准测试,包含10,000张图像,便于对低资源普什图语的OCR系统进行系统评估和比较。
PsOCR is a large-scale synthetic dataset for low-resource Pashto optical character recognition (OCR). This is the first publicly available comprehensive Pashto OCR dataset, containing one million synthetic images with annotation granularity covering word, line, and document levels, and covering a wide range of variations including 1,000 unique font families, diverse colors, varying image sizes and various text layouts. PsOCR also includes the first publicly available OCR benchmark, which comprises 10,000 images, enabling systematic evaluation and comparison of low-resource Pashto OCR systems.
PsOCR - Pashto OCR 数据集概述
数据集简介
- 名称:PsOCR (Pashto OCR Dataset)
- 类型:大规模合成光学字符识别(OCR)数据集
- 语言:低资源普什图语(Pashto)
- 规模:包含100万张合成图像
- 特点:首个公开可用的综合性普什图语OCR数据集
关键特性
-
标注粒度:
- 页面级(page-level)
- 行级(line-level)
- 词级(token-level)
-
数据多样性:
- 包含1000种独特字体家族
- 多样化的颜色、图像尺寸和文本布局
-
基准测试集:
- 包含10,000张图像的OCR基准测试集
- 用于系统评估和比较普什图语OCR系统
研究贡献
- 首次对最先进的大型多模态模型(LMMs)在普什图语OCR上的表现进行评估和比较
- 提供了关于这些模型在低资源语言(使用波斯-阿拉伯文字)上的零样本能力、优势和局限性的关键见解
数据来源
- HuggingFace:https://huggingface.co/datasets/zirak-ai/PashtoOCR
- Kaggle:https://www.kaggle.com/datasets/drijaz/PashtoOCR
相关论文
- 标题:PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
- 链接:https://arxiv.org/abs/2505.10055v1
联系方式
- 网站:https://zirak.ai/
- 邮箱:ijaz@zirak.ai, mail@ijaz.me
- 微信:ijazse




