相关数据集
zirak-ai/PashtoOCR
PsOCR是一个面向低资源普什图语的大型合成光学字符识别(OCR)数据集,包含100万张合成图像,具有单词、行和文档级别的注释,覆盖了包括1000种独特字体家族、多种颜色、图像大小和文本布局的广泛变化。该数据集还包括了用于低资源普什图语OCR系统评估和比较的10000张图像组成的基准。
Hugging Face2025-09-11 更新150
HuggingFaceFW/finepdfs_eng_Latn_labeled
该数据集包含文本内容、唯一标识符和多个评分字段,适用于文本评分相关的任务。训练集包含超过130万个示例,数据集总大小为7.78GB。
Hugging Face2025-10-06 更新90
Abdalrahmankamel/ncar-ocr-dataset5
--- dataset_info: features: - name: image dtype: image - name: text dtype: string splits: - name: train num_bytes: 1396621096 num_examples: 23560 download_size: 1386582915
Hugging Face2026-03-19 更新70
szili2011/captcha-ocr-dataset
这是一个包含约180万张合成字母数字验证码图像的数据集。每张图像都包含一个随机的、大小写敏感的字母和数字序列。该数据集专门用于训练和测试光学字符识别(OCR)模型,特别是具有CTC损失函数的CRNN模型。数据集包含两个主要文件:一个包含所有图像的zip文件和一个CSV文件,该文件将每个图像文件与其正确的文本标签链接。
Hugging Face2025-06-26 更新100
AlienKevin/CASIA-OLHWDB1.0-tokenized
该数据集包含了图像、字符、作者ID和图像tokens等特征。数据集分为四个部分:sfsc、sfuc、ufsc和ufuc,每个部分包含不同数量的示例和字节数。数据集的总下载大小为2.18GB,总大小为4.81GB。
Hugging Face2025-03-28 更新80



