官方服务:
资源简介:
Urdu Handwriting Data
乌尔都语手写数据集
应用场景:
创建时间:
2022-05-22
相关数据集
jgov_v1.4_full_ann
该数据集包含两个部分:1) Silviase/jgov:将日本政府(e-Gov)开放数据门户中的政策评估PDF转换为页面图像的数据集,包含图像和PDF嵌入文本(有时可能为空);2) Silviase/jgov_v1.4_full_ann:在前者基础上使用PaddleOCR-VL添加Markdown格式OCR文本的增强数据集。数据集专门针对包含表格和表单的日文PDF文档的布局识别和OCR评估需求设计
Hugging Face2025-12-07 更新440
Urdu Summary Corpus
乌尔都语摘要语料库包含从各种来源收集的50篇文章。从原始HTML文档中仅保留了未格式化的内容文本,移除了所有其他内容。我们为这50篇文章提供了抽象摘要。经过规范化处理后,我们进一步应用了不同的NLP工具对文章进行处理,以生成词性标注、形态分析、词形化和词干提取的文章。
github2020-02-11 更新220
SinOCR and SinFUND
We present the SinOCR and SinFUND datasets, two comprehensive resources designed to advance Optical Character Recognition (OCR) and form understanding for the Sinhala language. SinOCR, the first publi
DataCite Commons2024-05-30 更新260
GHOFRANEE/Dataset_ocr_to_json
--- configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* dataset_info: features: - name: instruction dtype: s
Hugging Face2023-11-07 更新150



