相关数据集
SinOCR and SinFUND
We present the SinOCR and SinFUND datasets, two comprehensive resources designed to advance Optical Character Recognition (OCR) and form understanding for the Sinhala language. SinOCR, the first publi
DataCite Commons2024-05-30 更新260
GHOFRANEE/Dataset_ocr_to_json
--- configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* dataset_info: features: - name: instruction dtype: s
Hugging Face2023-11-07 更新150
davanstrien/falcon-ocr-v2-test-l40s
--- tags: - ocr - document-processing - falcon-ocr - plain - uv-script - generated --- # Document Processing using Falcon OCR (plain mode) This dataset contains OCR results from images in [davanstri
Hugging Face2026-04-07 更新70
zirak-ai/PashtoOCR
PsOCR是一个面向低资源普什图语的大型合成光学字符识别(OCR)数据集,包含100万张合成图像,具有单词、行和文档级别的注释,覆盖了包括1000种独特字体家族、多种颜色、图像大小和文本布局的广泛变化。该数据集还包括了用于低资源普什图语OCR系统评估和比较的10000张图像组成的基准。
Hugging Face2025-09-11 更新150
szili2011/captcha-ocr-dataset
这是一个包含约180万张合成字母数字验证码图像的数据集。每张图像都包含一个随机的、大小写敏感的字母和数字序列。该数据集专门用于训练和测试光学字符识别(OCR)模型,特别是具有CTC损失函数的CRNN模型。数据集包含两个主要文件:一个包含所有图像的zip文件和一个CSV文件,该文件将每个图像文件与其正确的文本标签链接。
Hugging Face2025-06-26 更新100



