Synthetic English OCR Detection and Recognition 240K
收藏资源简介:
合成英语OCR检测与识别240K是一个用于训练和评估英语光学字符识别系统的大型合成数据集,包含240,000个对齐的OCR对,提供全尺寸检测图像、裁剪识别图像、多边形文本区域注释、英文转录真值等。
Synthetic English OCR Detection and Recognition 240K is a large-scale synthetic dataset for training and evaluating English optical character recognition systems. It contains 240,000 aligned OCR pairs, and provides full-size detection images, cropped recognition images, polygonal text region annotations, English transcription ground truths, and other relevant supporting materials.
数据集概览
Synthetic English OCR Detection and Recognition 240K 是一个大规模的合成英文光学字符识别(OCR)数据集,专为训练和评估文本检测与识别系统而设计。
- 当前版本: v2.0
- 创建者: Trần Phi
- 语言: 英语
- 许可证: Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0)。商业使用需获得创建者的书面许可。
- 样本对: 240,000 个对齐的OCR样本对(包含240,000张检测图像和240,000张识别裁剪图像,共480,000个JPEG文件)。
- 标注格式: JSON Lines (JSONL)
- 托管平台: Hugging Face (仓库名称
synthetic-ocr-en-det-rec-120k为向后兼容的旧名称,当前包含240K样本)。
支持任务
该数据集适用于以下任务:
- 光学字符识别(OCR)
- 英文文本检测
- 英文文本识别
- 场景文本识别
- 文档文本提取
- 基于多边形的文本定位
- OCR预处理研究
- 端到端OCR流水线
- 合成OCR数据研究
- 移动端OCR模型开发
- ONNX及ONNX Runtime实验
- 轻量级OCR模型训练
数据集结构
数据集包含两个主要子集,通过数字样本ID对齐:
1. 检测器子集
- 文件:
detector/detector.jsonl及detector/images/part_001.zip至part_010.zip - 内容: 共240,000张全尺寸检测图像(JPEG格式)及其多边形标注。
- 标注示例字段:
image: 图像相对路径 (如images/en_00000001.jpg)width,height: 图像尺寸items: 文本区域列表,每个区域包含polygon(多点坐标数组)、text(真实文本)、lang(语言代码)、direction(文本方向)、confidence(置信度) 及synthetic(合成数据标记)。
2. 识别器子集
- 文件:
recognizer/recognizer.jsonl及recognizer/crops/part_001.zip至part_010.zip - 内容: 共240,000张裁剪后的识别图像(JPEG格式)及其转录。
- 标注示例字段:
image: 裁剪图像相对路径 (如crops/en_00000001.jpg)text: 预期OCR转录lang,direction: 语言及方向source_image: 原始检测图像路径source_polygon: 原始多边形坐标crop_box: 裁剪矩形坐标rotation: 旋转角度
样本对齐
两个子集通过数字样本ID严格对齐。例如,样本ID为 00012345 的检测图像为 images/en_00012345.jpg,对应的识别裁剪图像为 crops/en_00012345.jpg,且两个JSONL文件中的真实文本一致。划分训练/验证/测试集时,应使用相同ID以保持对齐。
建议数据集划分
| 划分 | 比例 | 样本数 |
|---|---|---|
| 训练集 | 90% | 216,000 |
| 验证集 | 5% | 12,000 |
| 测试集 | 5% | 12,000 |
适用OCR架构
- 文本检测: DBNet, CRAFT, EAST, 基于分割的检测器, 多边形回归模型等。
- 文本识别: CRNN, CTC-based OCR, Transformer OCR, 注意力机制识别模型, SVTR, PARSeq等。
数据质量与验证
所有标注由合成渲染管线自动生成。v2.0版本已通过以下检查:JSON语法、连续样本ID、检测与识别ID及文本匹配、缺失文件检测、重复ID/文本检查、ZIP路径与CRC校验。
局限性
作为合成数据集,可能无法完全代表真实世界的图像噪声、光照、运动模糊、手写文本、弯曲文本、低分辨率及复杂自然场景。建议与合法兼容的真实OCR数据集结合使用。
下载方式
-
Hugging Face数据集页面: https://huggingface.co/datasets/Phitran21/synthetic-ocr-en-det-rec-120k
-
Hugging Face CLI: bash hf download Phitran21/synthetic-ocr-en-det-rec-120k --repo-type dataset --local-dir synthetic-ocr-en-det-rec-240k
-
Git LFS: bash git clone https://huggingface.co/datasets/Phitran21/synthetic-ocr-en-det-rec-120k
引用与归属
建议引用: bibtex @dataset{tran_phi_synthetic_ocr_en_240k, author = {Trần Phi}, title = {Synthetic English OCR Detection and Recognition 240K}, version = {2.0}, year = {2025}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/Phitran21/synthetic-ocr-en-det-rec-120k} }
建议归属:
Synthetic English OCR Detection and Recognition 240K Version 2.0 Created by Trần Phi Hugging Face: Phitran21/synthetic-ocr-en-det-rec-120k License: CC BY-NC 4.0





