遇见数据集

khatme-nubuwwat-ocr-dataset

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

Khatme-Nubuwwat Urdu OCR Corpus 是一个结构感知的、完全OCR的文本数据集,包含约215本Urdu Khatme Nubuwat(先知封印)书籍/卷,总计约86,557页文本。这些书籍采用Nastaliq字体书写,包含大量古兰经和圣训引用。OCR流水线确保逐字转录,并通过多信号准确性层(包括字符语言模型、结构信号、词汇近失、规则集、神经上下文、与锚文本(古兰经+14本圣训集)验证以及内部共识)进行质量控制。每页数据包含三个文件:纯文本(.txt)、元数据JSON(.json)和页面扫描图像(.webp)。数据集按书籍组织,目录结构清晰。提供的Parquet文件(pages.parquet)每行对应一页,包含文本、元数据和图像引用。主要字段包括slug(书籍ID)、page(页数)、page_seq(PDF顺序)、printed_page(书籍页码)、char_len(字符数)、image(扫描图像)、certified(是否引用交叉验证)、citations(引用列表)、review_flagged(是否标记人工审核)、suspicion_score(怀疑分数)、review_reasons(审核原因)、text(纯文本)和text_tagged(带布局标签的文本)。此外,Parquet每行还包含书籍级元数据(title, author, urdu_title, urdu_author, volume)。数据集适用于Urdu/Arabic NLP任务,如语言建模、领域适应、OCR后校正、全文搜索/检索以及变音符号/正字法研究。数据集收录了215本书(去除了重复的118、119、120卷),并提供了Python加载示例(load_dataset)。

Khatme-Nubuwwat Urdu OCR Corpus is a structure-aware, fully OCRed text dataset comprising approximately 215 Urdu Khatme Nubuwat (Seal of Prophethood) books/volumes, totaling about 86,557 pages of text. These books are written in the Nastaliq font and contain numerous Quranic and Hadith citations. The OCR pipeline ensures word-by-word transcription and quality control through multiple signal accuracy layers, including character language model, structural signals, lexical near misses, rule sets, neural context, verification against anchor texts (Quran + 14 Hadith collections), and internal consensus. Each page consists of three files: plain text (.txt), metadata JSON (.json), and page scan image (.webp). The dataset is organized by book with a clear directory structure. The provided Parquet file (pages.parquet) has one row per page, containing text, metadata, and image references. Main fields include slug (book ID), page (page number), page_seq (PDF order), printed_page (book page number), char_len (character count), image (scan image), certified (whether cross-verified with citations), citations (list of citations), review_flagged (whether marked for manual review), suspicion_score (suspicion score), review_reasons (reasons for review), text (plain text), and text_tagged (text with layout tags). Additionally, each row includes book-level metadata (title, author, urdu_title, urdu_author, volume). The dataset is suitable for Urdu/Arabic NLP tasks such as language modeling, domain adaptation, OCR post-correction, full-text search/retrieval, and diacritics/orthography research. It contains 215 books (after removing duplicate volumes 118, 119, 120) and provides a Python loading example (load_dataset).

创建时间:
2026-08-18
原始信息汇总

Khatme-Nubuwwat Urdu OCR 数据集概述

基本信息

  • 数据集名称:Khatme-Nubuwwat Urdu OCR Corpus
  • 语言:乌尔都语(ur)、阿拉伯语(ar)
  • 许可协议:其他(other)
  • 任务类别:文本生成、填充掩码、文本检索、图像到文本
  • 数据规模:10K < n < 100K

数据内容

  • 包含约 215 部乌尔都语 Khatme Nubuwat 书籍/卷,总计约 86,557 页 OCR 文本。
  • 每页文本与源页面扫描图像配对。
  • 书籍主要由 Nastaliq 散文构成,大量引用《古兰经》和圣训。

数据结构

每个页面包含三个独立文件:

  • .txt:干净页面文本
  • .json:页面元数据、质量信号及带标签的 OCR 文本(含 text_tagged 字段)
  • .webp:源页面扫描图像

主要目录结构:

data/ ├── pages.parquet # 每页一行(文本+元数据+图像引用) └── books/ └── book-01/ ├── metadata.json # 书籍级元数据 └── pages/ ├── p-0001.txt ├── p-0001.json └── p-0001.webp

字段说明

Parquet / JSON 页面字段

  • slug:书籍标识 ID
  • page:书内页码
  • page_seq:PDF 中的页面顺序
  • printed_page:书籍自身编号的页码
  • char_len:干净文本的字符数
  • image:扫描图像
  • certified:是否检测并交叉验证了引用(对照锚文本)
  • citations:检测到的引用列表(如 abudawud:4002Q26:221
  • review_flagged:是否被标记供人工审查
  • suspicion_score:页面存在错误的怀疑度评分(仅在被标记时存在)
  • review_reasons:触发审查的标记原因列表
  • text:干净散文文本
  • text_tagged:包含布局结构标签(@PAGE@H1/@H2@POEM@BULLET@REF@DIV)的文本

书籍级元数据字段metadata.json):

  • uidslugtitleauthorurdu_titleurdu_authorvolumesource_pdfnpages(源 PDF 页数)、n_pages_ocr(转录页数)、n_pages_with_image(有扫描图像的页数)

Parquet 文件每行还额外携带书籍元数据列(标题、作者、乌尔都语标题、乌尔都语作者、卷号)。

数据处理与质量控制

OCR 流水线经过多层准确率验证:

  1. 字符语言模型惊奇度(Character LM surprisal)
  2. 指示污染的结构信号
  3. 语料库词典近失匹配
  4. 标记已知问题的规则集
  5. 神经上下文惊奇度(Neural Contextual surprisal)
  6. 对照锚文本(《古兰经》+ 14 本圣训集)进行验证
  7. 语料库内部共识(段落级)

使用说明

加载数据集: python from datasets import load_dataset

ds = load_dataset("nubuwwat/khatme-nubuwwat-ocr-dataset", split="train") print(ds[13]["text"]) # 干净乌尔都语文本 print(ds[13]["citations"]) # [abudawud:4002, Q26:221, ...]

预期用途:适用于乌尔都语/阿拉伯语 NLP,包括语言建模与领域自适应、OCR 后校正与评估、全文搜索/检索、变音符号/正字法等任务。

补充说明

  • 书籍 118、119、120 因重复被有意移除,最终书籍总数为 215 部。
  • 扫描图像来源于互联网公开资源,数据集创建者仅执行了 OCR 处理。
  • 联系邮箱:nubuwwat@protonmail.com
搜集汇总
数据集介绍
khatme-nubuwwat-ocr-dataset 数据集图片
构建方式
本数据集精心构建自215部乌尔都语Khatme Nubuwwat文献,共计约86,557页,通过先进的OCR技术将Nastaliq体散文与大量古兰经和圣训引文转录为精准文本。构建流程采用多信号验证机制,融合字符语言模型惊异度、结构污染检测、词典近似匹配、规则集筛查、神经上下文惊异度、经典文本锚定校验及语料内共识分析,确保转录文本的忠实度。每一页均配备清洁文本、元数据JSON及原始扫描图像,并保留版面结构标签,形成完整的结构化语料。
使用方法
数据集可通过HuggingFace Datasets库便捷加载,使用Python中的`load_dataset`函数即可获取训练数据。每一行代表一页,包含清洁文本、引用列表、扫描图像等字段,支持文本生成、填空任务、图像到文本转换及检索应用。元数据列提供了书籍标题、作者等背景信息,便于进行语料筛选与统计。同时,构建脚本的包含使得数据复现与扩展成为可能,适合用于乌尔都语NLP研究、OCR评估及经学文献的数字化处理。
背景与挑战
背景概述
Khatme-Nubuwwat Urdu OCR Corpus,一个专注于乌尔都语Nastaliq文体的OCR文本数据集,于2026年由个人项目创建,收录了约215本相关书籍、86,557页文本,并配有原始页面扫描图像。数据集的核心研究问题在于克服Nastaliq文体的复杂连写和变体问题,以及解决伊斯兰文献中大量阿拉伯语引文和引用的准确识别难题。该数据集凭借其结构感知的标注和多重信号准确性验证机制,填补了低资源语言乌尔都语NLP领域的空白,为乌尔都语的语言建模、OCR后校正及全文检索等下游任务提供了宝贵资源,对促进低资源语言技术的研究具有重要影响力。
当前挑战
该数据集面临的挑战多维交织。首先,领域层面上,乌尔都语Nastaliq文体的连写、字形变体和复杂排版对OCR构成显著障碍,尤其在处理古兰经和圣训等经典文本时,需要高度精确的转录,以防语义偏误;同时,低资源环境下声音的语言模型和标注工具匮乏,传统方法难以奏效。其次,构建过程中,需设计多信号精度层,涵盖字符级语言模型意外度、结构污染信号、词汇表近失、已知问题规则、上下文意外度及对锚点文本的验证,并通过语料库内共识识别错误,但部分页面仍不可避免地触发人工审查。此外,剔除了重复书籍,并处理扫描图像质量不均及与公共资源的合规性,均构成了不可忽视的挑战。
常用场景
经典使用场景
Khatme-Nubuwwat OCR数据集作为乌尔都语-阿拉伯语低资源场景下的结构化OCR语料库,其经典用途聚焦于Nastaliq字体手稿的文本识别与数字化。该数据集包含约215卷、86,557页的宗教文献,每页均配有扫描图像、纯净文本及带版式标签的OCR结果,特别适用于训练和评估面向复杂波斯-阿拉伯书写体系的OCR模型。研究者可借助其多信号质量校验层(如字符语言模型困惑度、结构锚点对比、古兰经与圣训交叉验证)来优化转录准确性,亦可利用页面级元数据(如引用标注、可疑区域标记)开展细粒度的OCR误差分析,从而提升低资源语言文档的自动化处理效能。
解决学术问题
该数据集直面乌尔都语Nastaliq手稿数字化中的核心学术挑战,即低资源环境下OCR转录的准确性与可验证性问题。其多维度质量控制系统将字符级语言模型惊喜度、结构污染信号、词汇接近度检测及外部锚文本(古兰经、十四部圣训集)交叉验证相结合,为研究者在缺乏大规模标注语料时提供了一种可靠的半监督验证范式。此外,通过提供逐页的怀疑分数、人工审核标记及引用结构化标注,数据集促进了OCR后纠错、低资源语言建模、域适应及全文检索等方向的研究,并为跨语言、跨字体的文档分析提供了可复用的基准与实验基础。
实际应用
在实际应用中,该数据集可直接服务于乌尔都语与阿拉伯语的NLP系统开发,包括构建高质量的语言模型、优化文本识别管道及提升检索准确率。例如,研究者可基于其纯净文本与结构标签训练适应宗教文献风格的域内语言模型,或利用引用标注(如圣训编号、古兰经章节)实现语义级检索与知识图谱构建。同时,其页面扫描图像与OCR文本的配对形式,支持开发端到端的图像到文本生成模型,应用于历史手稿的自动化归档与数字图书馆建设。对于社区而言,该数据集还可用作乌尔都语OCR后校正的评测集,帮助部署更健壮的文档处理工具。
数据集最近研究
最新研究方向
该数据集聚焦于低资源语言乌尔都语及阿拉伯语的OCR文本识别与处理,其前沿研究方向在于将结构感知的OCR技术与多信号验证机制相结合,实现对Nastaliq体手写体文献的高保真数字化。研究热点包括利用字符级语言模型困惑度、上下文神经信号及跨文本锚点(如古兰经和圣训集)进行自动校正,以提升识别准确性。该数据集为伊斯兰文本的数字化、全文检索及自然语言处理提供了宝贵的语料资源,尤其对低资源语言的模型预训练、领域适应和OCR纠错研究具有重要推动意义,有助于保护和传承伊斯兰文化遗产。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务