相关数据集
jgov_v1.4_full_ann
该数据集包含两个部分:1) Silviase/jgov:将日本政府(e-Gov)开放数据门户中的政策评估PDF转换为页面图像的数据集,包含图像和PDF嵌入文本(有时可能为空);2) Silviase/jgov_v1.4_full_ann:在前者基础上使用PaddleOCR-VL添加Markdown格式OCR文本的增强数据集。数据集专门针对包含表格和表单的日文PDF文档的布局识别和OCR评估需求设计
Hugging Face2025-12-07 更新440
Fine-Tuned-TrOCR-Model-for-Curved-Text-Recognition
Fine-tuned "microsoft/trocr-base-printed" with cropped images from SCUT-CTW1500
kaggle2024-10-26 更新70
GHOFRANEE/Dataset_ocr_to_json
--- configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* dataset_info: features: - name: instruction dtype: s
Hugging Face2023-11-07 更新150
szili2011/captcha-ocr-dataset
这是一个包含约180万张合成字母数字验证码图像的数据集。每张图像都包含一个随机的、大小写敏感的字母和数字序列。该数据集专门用于训练和测试光学字符识别(OCR)模型,特别是具有CTC损失函数的CRNN模型。数据集包含两个主要文件:一个包含所有图像的zip文件和一个CSV文件,该文件将每个图像文件与其正确的文本标签链接。
Hugging Face2025-06-26 更新100



