arabic-ocr-books
收藏资源简介:
该数据集包含从9个PDF文件渲染生成的扫描书页图像。每页对应一张图像,按源PDF文件组织为子文件夹。数据集中包含一个技术元数据文件(data/metadata.jsonl),记录了每页的出处信息。图像处理参数为:300 DPI、最大宽度1600像素、灰度模式、对比度因子1.4、JPEG压缩质量95、启用白边裁剪。该数据集适用于OCR(光学字符识别)、文档理解、知识提取、模型微调以及RAG(检索增强生成)数据准备等任务。使用者需自行确保源书籍的存储和再分发符合法律要求,在不明确的情况下建议保持仓库私有。
This dataset contains scanned book page images rendered from 9 PDF files. Each page corresponds to one image, organized into subfolders by source PDF file. The dataset includes a technical metadata file (data/metadata.jsonl) recording the provenance information of each page. Image processing parameters: 300 DPI, maximum width 1600 pixels, grayscale mode, contrast factor 1.4, JPEG compression quality 95, and white border cropping enabled. This dataset is suitable for tasks such as OCR (Optical Character Recognition), document understanding, knowledge extraction, model fine-tuning, and RAG (Retrieval-Augmented Generation) data preparation. Users must ensure that the storage and redistribution of source books comply with legal requirements; it is recommended to keep the repository private when in doubt.
数据集概述
数据集名称:Scanned Book Page Images(扫描书籍页面图像)
任务类别:图像到文本(image-to-text)
标签:OCR、文档AI、扫描书籍、PDF页面
数据集来源:由9个PDF文件渲染生成,每个PDF对应一个子文件夹,每页生成一张图像。
数据集结构
- 每个PDF页面对应一张图像。
- 每个源PDF对应一个子文件夹。
data/metadata.jsonl文件包含每页的技术来源信息。
图像设置
- 分辨率:300 DPI
- 最大宽度:1600 像素
- 灰度模式:是
- 对比度因子:1.4
- JPEG质量:95
- 白色边距裁剪:是
预期用途
该数据集适用于OCR(光学字符识别)、文档理解、知识提取、模型微调以及RAG(检索增强生成)数据准备。
版权说明
数据集所有者需确认源书籍的存储和再分发合法性。当再分发权利不确定时,建议将仓库设为私有。




