登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
OCR识别模型训练集 - 35W张图片
OCR识别模型训练集 - 35W张图片
收藏
AI_Studio
2023-07-16 更新
2024-07-06 收录
光学字符识别训练
多语言文本识别
数据链接:
https://aistudio.baidu.com/datasetdetail/230437
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
数据由text-renderer工具生成,包含繁体、简体、英文字符,图片字体颜色多样化,字符长度固定图片长度度不固定,包含两个文件夹,label也在文件夹内,可以直接适用于paddleOCR训练
应用场景:
提供机构:
Vance
相关数据集
ICDAR 2017 Competition on Multi-lingual Scene Text Detection and Script Identification
场景文本检测
多语言文本识别
该数据集是为ICDAR 2017竞赛中的多语言场景文本检测和脚本识别任务设计的。它包含了多种语言的场景文本图像,旨在评估和提升文本检测和脚本识别算法的效果。
rrc.cvc.uab.es
43
0
rubenstein-manuscript-catalog-glm-ocr
OCR
多语言文本识别
该数据集包含使用GLM-OCR模型对[biglam/rubenstein-manuscript-catalog](https://huggingface.co/datasets/biglam/rubenstein-manuscript-catalog)中的图像进行OCR处理的结果。GLM-OCR是一个紧凑的0.9B参数OCR模型,具有多语言支持(包括中文、英文、法文、西班牙文、俄文、德文、日文和韩
Hugging Face
2026-02-14 更新
18
0
D027_Natural_Scenes_Document_Photograph_Scenes_Electronic_Scenes
OCR
多语言文本识别
500,000张21国自然场景&文档拍照场景&电子场景OCR标注数据。数据包含21个语种,每个语种数量分布为20,000-25,000张。数据类型包括自然场景、文档拍照场景和电子场景。数据多样性包括多种数据类型、多种拍摄角度、多语种。在标注方面,采用行(列)级四边形或多边形标注、行(列)级内容转写。数据可用于多语种OCR识别任务。
Opencsg
2026-03-04 更新
10
0
XFUND (A Multilingual Form Understanding Benchmark)
多语言文本识别
键值存储优化
XFUND 是一个多语言表单理解基准数据集,包括人工标记的表单,其中包含 7 种语言(中文、日语、西班牙语、法语、意大利语、德语、葡萄牙语)的键值对。
OpenXLab
20
0
OCR
光学字符识别
多语言文本识别
Optical Character Recognition: Automatically Detect and Recognize Text in Multiple Languages
RapidAPI
2026-04-22 更新
12
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广