遇见数据集

Aslan-mingye/OCR-Quality

收藏
Hugging Face2025-10-17 更新2025-10-25 收录
官方服务:

资源简介:

OCR-Quality是一个综合性的基准数据集,用于评估不同文档类型和来源的OCR质量。该数据集包含1000个文档图像,每个图像都有人工标注的质量分数,并附有Qwen2.5-VL-72B模型提取的OCR文本。数据集涵盖学术论文、教科书和电子书等多种文档类型,支持中文、英文以及多语言。图像从PDF文档转换为300 DPI分辨率的PNG格式。数据集按照质量分数和来源进行了详细统计,并以Parquet文件格式提供,方便加载和处理。

The OCR-Quality dataset is a comprehensive benchmark for evaluating OCR quality across diverse document types and sources. It includes 1,000 document images with human-annotated quality scores and OCR text extracted by the Qwen2.5-VL-72B model. The dataset covers various document types such as academic papers, textbooks, and e-books in Chinese, English, and multilingual languages. Images are converted from PDF documents to PNG format at 300 DPI resolution. The dataset is statistically detailed by quality score and source distribution, and is provided in a Parquet file format for easy loading and processing.

提供机构:
Aslan-mingye
搜集汇总
数据集介绍
Aslan-mingye/OCR-Quality 数据集图片
背景与挑战
背景概述
OCR-Quality是一个包含1,000个文档图像的基准数据集,用于评估OCR质量,图像来自PDF文档并以300 DPI分辨率转换为PNG格式。数据集提供人类标注的质量分数(1-4分,越低越好)和由Qwen2.5-VL-72B模型提取的OCR文本,覆盖中文、英文和多语言,包括学术论文、教科书和电子书等多种文档类型,适用于OCR模型评估、质量预测和错误分析等任务。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务