遇见数据集

Synthetic English OCR Detection and Recognition 240K

收藏
github2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

合成英语OCR检测与识别240K是一个用于训练和评估英语光学字符识别系统的大型合成数据集,包含240,000个对齐的OCR对,提供全尺寸检测图像、裁剪识别图像、多边形文本区域注释、英文转录真值等。

Synthetic English OCR Detection and Recognition 240K is a large-scale synthetic dataset for training and evaluating English optical character recognition systems. It contains 240,000 aligned OCR pairs, and provides full-size detection images, cropped recognition images, polygonal text region annotations, English transcription ground truths, and other relevant supporting materials.

创建时间:
2026-07-26
原始信息汇总

数据集概览

Synthetic English OCR Detection and Recognition 240K 是一个大规模的合成英文光学字符识别(OCR)数据集,专为训练和评估文本检测与识别系统而设计。

  • 当前版本: v2.0
  • 创建者: Trần Phi
  • 语言: 英语
  • 许可证: Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0)。商业使用需获得创建者的书面许可。
  • 样本对: 240,000 个对齐的OCR样本对(包含240,000张检测图像和240,000张识别裁剪图像,共480,000个JPEG文件)。
  • 标注格式: JSON Lines (JSONL)
  • 托管平台: Hugging Face (仓库名称 synthetic-ocr-en-det-rec-120k 为向后兼容的旧名称,当前包含240K样本)。

支持任务

该数据集适用于以下任务:

  • 光学字符识别(OCR)
  • 英文文本检测
  • 英文文本识别
  • 场景文本识别
  • 文档文本提取
  • 基于多边形的文本定位
  • OCR预处理研究
  • 端到端OCR流水线
  • 合成OCR数据研究
  • 移动端OCR模型开发
  • ONNX及ONNX Runtime实验
  • 轻量级OCR模型训练

数据集结构

数据集包含两个主要子集,通过数字样本ID对齐:

1. 检测器子集

  • 文件: detector/detector.jsonldetector/images/part_001.zippart_010.zip
  • 内容: 共240,000张全尺寸检测图像(JPEG格式)及其多边形标注。
  • 标注示例字段:
    • image: 图像相对路径 (如 images/en_00000001.jpg)
    • width, height: 图像尺寸
    • items: 文本区域列表,每个区域包含 polygon (多点坐标数组)、text (真实文本)、lang (语言代码)、direction (文本方向)、confidence (置信度) 及 synthetic (合成数据标记)。

2. 识别器子集

  • 文件: recognizer/recognizer.jsonlrecognizer/crops/part_001.zippart_010.zip
  • 内容: 共240,000张裁剪后的识别图像(JPEG格式)及其转录。
  • 标注示例字段:
    • image: 裁剪图像相对路径 (如 crops/en_00000001.jpg)
    • text: 预期OCR转录
    • lang, direction: 语言及方向
    • source_image: 原始检测图像路径
    • source_polygon: 原始多边形坐标
    • crop_box: 裁剪矩形坐标
    • rotation: 旋转角度

样本对齐

两个子集通过数字样本ID严格对齐。例如,样本ID为 00012345 的检测图像为 images/en_00012345.jpg,对应的识别裁剪图像为 crops/en_00012345.jpg,且两个JSONL文件中的真实文本一致。划分训练/验证/测试集时,应使用相同ID以保持对齐。

建议数据集划分

划分 比例 样本数
训练集 90% 216,000
验证集 5% 12,000
测试集 5% 12,000

适用OCR架构

  • 文本检测: DBNet, CRAFT, EAST, 基于分割的检测器, 多边形回归模型等。
  • 文本识别: CRNN, CTC-based OCR, Transformer OCR, 注意力机制识别模型, SVTR, PARSeq等。

数据质量与验证

所有标注由合成渲染管线自动生成。v2.0版本已通过以下检查:JSON语法、连续样本ID、检测与识别ID及文本匹配、缺失文件检测、重复ID/文本检查、ZIP路径与CRC校验。

局限性

作为合成数据集,可能无法完全代表真实世界的图像噪声、光照、运动模糊、手写文本、弯曲文本、低分辨率及复杂自然场景。建议与合法兼容的真实OCR数据集结合使用。

下载方式

  • Hugging Face数据集页面: https://huggingface.co/datasets/Phitran21/synthetic-ocr-en-det-rec-120k

  • Hugging Face CLI: bash hf download Phitran21/synthetic-ocr-en-det-rec-120k --repo-type dataset --local-dir synthetic-ocr-en-det-rec-240k

  • Git LFS: bash git clone https://huggingface.co/datasets/Phitran21/synthetic-ocr-en-det-rec-120k

引用与归属

建议引用: bibtex @dataset{tran_phi_synthetic_ocr_en_240k, author = {Trần Phi}, title = {Synthetic English OCR Detection and Recognition 240K}, version = {2.0}, year = {2025}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/Phitran21/synthetic-ocr-en-det-rec-120k} }

建议归属:

Synthetic English OCR Detection and Recognition 240K Version 2.0 Created by Trần Phi Hugging Face: Phitran21/synthetic-ocr-en-det-rec-120k License: CC BY-NC 4.0

搜集汇总
数据集介绍
Synthetic English OCR Detection and Recognition 240K 数据集图片
构建方式
该数据集经由自动化合成渲染管线生成,通过模拟多样化的字体族、字重、倾斜与常规样式、文本长度、位置、旋转角度、背景类型以及文本区域几何形状,系统性地构建了24万组对齐的英文OCR检测与识别样本。每一组样本均包含一张全尺寸检测图像与一张对应的识别裁剪图像,并辅以基于多点多边形的文本区域标注、真实英文转录文本、旋转与裁剪元数据,所有标注信息以JSON Lines格式存储于独立的检测器与识别器记录文件中。
使用方法
用户可通过Hugging Face CLI或Git LFS完整下载数据集,解压后即可获得按part分卷的ZIP归档与JSONL标注文件。检测器子集用于训练文本定位模型,识别器子集用于训练文本识别模型,两者可配合使用构建完整OCR系统。Python脚本可轻松加载JSONL文件进行数据验证、随机划分训练/验证/测试集(建议90%/5%/5%),并可适配DBNet、CRAFT、CRNN、Transformer OCR等多种主流架构,仅需将多边形或矩形坐标转换为目标框架所需格式即可。
背景与挑战
背景概述
光学字符识别(OCR)技术作为计算机视觉与自然语言处理交叉领域的重要分支,长久以来在文档数字化、场景文字理解及自动化信息提取等应用中扮演着关键角色。然而,真实场景中文字检测与识别的复杂性——如字体多样性、几何变形、光照不均和背景杂乱——对模型泛化能力提出了严苛要求。在此背景下,由研究者Trần Phi于2024年创建的Synthetic English OCR Detection and Recognition 240K数据集应运而生。该数据集以合成方式大规模生成24万组对齐的英文文本检测与识别样本,涵盖全尺寸检测图像与裁剪识别图像,并配备多边形区域标注及JSON Lines格式的元数据,为训练和评估端到端OCR管线提供了标准化基准,迅速成为领域内合成数据研究的重要资源。
当前挑战
该数据集所解决的领域挑战主要聚焦于二维平面文本的精准定位与转录。真实场景中的文字常呈现旋转、倾斜及非矩形边界,传统基于矩形框的标注方法难以捕获其几何细节,而数据集中多边形的引入虽提升了边界描述精度,却对检测模型的回归能力构成考验。构建过程中,挑战在于如何通过合成渲染管线自动化生成大量高保真样本,同时确保图像、裁剪、多边形与转录文本的高度一致性。为避免标签噪声累积,需对样本ID连续性、跨子集文本匹配及ZIP归档完整性进行系统校验,而合成数据与真实世界在噪声分布、光照条件及字体覆盖上的固有差异,则限制了其对自然场景的泛化表现,需结合真实数据集弥补此类偏差。
常用场景
经典使用场景
在光学字符识别(OCR)研究领域,Synthetic English OCR Detection and Recognition 240K数据集以其大规模、高质量合成的特点,成为训练和评估场景文本检测与识别模型的经典基准。该数据集包含240,000对经过精密对齐的完整图像与裁剪文本图像,支持从多点多边形文本区域定位到转录输出的端到端流水线研究。研究者普遍将其用于训练基于深度学习的检测器(如DBNet、CRAFT)与识别器(如CRNN、Transformer OCR),通过其丰富的字体、旋转角度和背景多样性,模拟现实场景中的文本变形与光照变化,从而验证模型在复杂条件下的鲁棒性与泛化能力。
解决学术问题
该数据集的核心学术价值在于解决真实标注OCR数据稀缺且成本高昂的长期困境。通过合成手段生成海量、精确且具有独立语义的文本-注释对,它有效支撑了文本检测中的多边形精细定位、识别中的序列建模以及两项任务联合优化的前沿探索。其对齐的双子结构消除了检测与识别步骤间的标注歧义,为端到端流水线的误差传递分析提供了理想实验平台。这一设计推动了轻量化、高鲁棒OCR模型的研发,显著提升了学术界对合成数据在真实场景泛化中效用的理解,并成为评估新型架构(如注意力机制与CTC)性能的标准参照系。
实际应用
在实际工业与商业应用中,该数据集常被用于构建移动端OCR系统与文档自动处理引擎。开发者借助其大规模合成样本训练轻量级模型(如ONNX格式的Mobile Net),实现手机拍照识别、证件信息提取及票据数字化等核心功能。数据集中的旋转与裁剪元数据还优化了图像预处理模块,使部署系统能够应对倾斜、遮挡等典型挑战。此外,金融、物流和教育领域的非商业研究项目也依赖此数据集开发快速文本本地化工具,在保证识别准确率的同时降低对昂贵GPU资源的依赖,加速了OCR技术从实验室向现实场景的转化。
数据集最近研究
最新研究方向
在光学字符识别领域,合成数据正成为应对真实场景标注成本高昂、数据稀缺等挑战的关键策略。Synthetic English OCR Detection and Recognition 240K数据集以其大规模、高质量的合成英文文本图像对,为文本检测与识别算法的研发提供了坚实的基础。当前前沿研究方向聚焦于利用此类合成数据预训练轻量化、移动端兼容的OCR模型,并探索其在ONNX Runtime等部署框架中的高效推理。同时,该数据集也驱动着多边形文本定位、端到端OCR流水线以及合成数据与真实数据混合训练等热点课题,其在非商业学术研究中的广泛应用,正深刻推动着场景文本理解技术的边界拓展与性能跃升。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务