UniRec40M
收藏资源简介:
UniRec40M是由复旦大学和字节跳动联合构建的大规模文本与公式识别数据集,包含4000万中英文样本,涵盖纯文本、纯公式及混合内容。数据集融合了arXiv和Wikipedia的LaTeX源码、数字原生PDF文档及多个公开数据集(如LSVT、HWDB等),通过自动化标注和人工校验确保多层级(字符/行/段落)标注质量。其构建过程创新性地采用颜色标识的LaTeX渲染对齐技术,支持跨模态语义解耦。该数据集旨在训练轻量级统一模型UniRec-0.1B,解决文档解析中文本与公式的结构多样性及语义纠缠问题,适用于数字教育、信息检索等需要高效OCR的领域。
UniRec40M is a large-scale text and formula recognition dataset jointly constructed by Fudan University and ByteDance. It comprises 40 million Chinese and English samples covering pure text, pure formulas, and mixed content. The dataset integrates LaTeX source codes from arXiv and Wikipedia, digitally native PDF documents, as well as multiple public datasets such as LSVT, HWDB, etc. It ensures multi-level (character/line/paragraph) annotation quality through automated annotation and manual verification. Its construction process innovatively adopts color-coded LaTeX rendering alignment technology, supporting cross-modal semantic decoupling. This dataset is designed to train the lightweight unified model UniRec-0.1B, addressing the issues of structural diversity and semantic entanglement between text and formulas in document parsing, and is applicable to fields requiring efficient OCR such as digital education and information retrieval.
OpenOCR 数据集概述
数据集基本信息
- 项目名称:OpenOCR: A general OCR system with accuracy and efficiency
- 官方代码库:复旦大学FVL实验室OCR团队的官方代码库
- 核心目标:建立一个用于训练和评估场景文本检测与识别模型的统一基准,并在此基础上推出一个兼具准确性和效率的通用OCR系统。
主要特性与模型
1. OpenDoc-0.1B:超轻量级文档解析系统
- 参数量:0.1B(十亿)参数。
- 系统架构:两阶段流水线。
- 使用PP-DocLayoutV2进行版面分析。
- 使用内部模型UniRec-0.1B对文本、公式和表格进行统一识别。
- 支持语言:中文和英文文档解析。
- 性能:在OmniDocBench (v1.5)上达到90.57%,优于许多基于多模态大语言模型的文档解析模型。
2. UniRec-0.1B:统一的文本与公式识别模型
- 参数量:0.1B参数。
- 识别能力:识别纯文本(单词、行、段落)、公式(单行、多行)以及文本与公式混合的内容。
- 训练数据:在40M数据上从头开始训练,无需预训练。
- 支持语言:支持中文和英文的文本/公式识别。
3. OpenOCR:通用OCR系统
- 基础架构:基于SVTRv2构建的实用OCR系统。
- 性能对比:在OCR竞赛排行榜上,准确率比PP-OCRv4基线高出4.5%,同时保持了相近的推理速度。
- 功能特性:
- 支持中文和英文的文本检测与识别。
- 提供服务器模型和移动端模型。
- 支持在自定义数据集上进行微调。
- 支持导出ONNX模型以获得更广泛的兼容性。
4. SVTRv2:场景文本识别统一基准
- 基准特点:基于Union14M的大规模场景文本识别统一训练与评估基准。
- 支持方法:支持24种在大型真实数据集Union14M-L-Filter上从头开始训练的场景文本识别方法,并将持续添加最新方法。
- 性能提升:与基于合成数据集训练的模型相比,准确率提高了20-30%。
- 目标:使用单一视觉模型实现任意形状文本识别和语言建模。
包含的OCR算法
项目包含一系列自研及复现的OCR算法,涵盖文本识别、文档解析等多个方向,相关论文发表于ICCV、AAAI、TPAMI、IJCV等顶级会议与期刊。核心算法包括UniRec-0.1B、MDiff4STR、CMER、TextSSR、SVTRv2、IGTR、CPPD、SMTR&FocalSVTR、DPTR、CDistNet、MRN、TPS++、SVTR、NRTR等。
快速开始
系统支持ONNX和PyTorch两种推理框架,环境相互隔离。
ONNX推理
- 安装:
pip install openocr-python onnxruntime - 使用:通过
OpenOCR(backend=onnx)初始化引擎并进行推理。
PyTorch推理
- 环境要求:PyTorch >= 1.13.0,Python >= 3.7。
- 安装方式:
- 通过PyPI安装:
pip install openocr-python - 克隆代码库:
git clone https://github.com/Topdu/OpenOCR.git,并安装依赖及下载模型权重。
- 通过PyPI安装:
- 使用方式:
- 通过Python API使用。
- 或使用项目提供的脚本进行端到端、检测、识别推理。
- ONNX模型导出与推理:支持将PyTorch模型导出为ONNX格式,并使用ONNXRuntime进行推理。
- 本地演示:支持通过Gradio启动本地Web演示界面。
场景文本识别方法复现
项目计划复现大量经典的场景文本识别方法,并已在统一基准上完成了多项方法的训练与评估,包括CRNN、ASTER、NRTR、SAR、MORAN、DAN、RobustScanner、AutoSTR、SRN、SEED等。




