遇见数据集

quran-data

收藏
github2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

古兰经数据集(翻译、注释、逐词、元数据)——每个数据集作为一个独立的压缩包。

Quran Dataset (Translation, Annotation, Word-by-word Content, Metadata) — Each dataset is provided as an independent compressed archive.

创建时间:
2026-08-03
原始信息汇总

数据集概述

该数据集由 SakinaDevGroup 发布,提供《古兰经》的多语言翻译、注释、逐词解析及元数据。所有数据以 .zip 压缩包形式(内含 .json 文件)在 v1.0 版本中发布,每个合集可独立下载。

主要内容

  • 古兰经文原文
    • QPC V4 逐词文本
    • QPC V4 页面划分(含 tajweed 标注)
    • 奥斯曼体(Uthmani)逐词文本
  • 翻译
    • 塔吉克语翻译(多个版本:Abu Alomuddin、Pioneers、Abdulmuhammad Ayati)
    • 俄语翻译(Kuliev 版)
    • 波斯语翻译
  • 附加资源
    • 塔吉克语转写(transliteration)
    • 塔吉克语注释(tafsir,Osонбаён 版,以及 Abu Alomuddin 版含注释)
    • 元数据(章节/经文编号)

数据格式与获取

数据以 JSON 格式存储,打包为独立 ZIP 文件,可从 GitHub Releases 页面直接下载(下载链接见下表)。每个文件对应一个特定主题或语言版本。

搜集汇总
数据集介绍
quran-data 数据集图片
构建方式
quran-data数据集是一项围绕《古兰经》文本的多维度结构化资源,其构建方式严谨且系统化。数据集以独立的.zip压缩包形式分发,每个包内含JSON格式文件,通过GitHub的v1.0版本发布。构建过程中,首先基于QPC V4标准对古兰经文本进行逐词切分,生成词级数据,同时整合了乌斯曼尼书写体系的逐词对照。此外,数据集还涵盖了页面分割信息,为《古兰经》的阅读与排版提供了精确的导航结构。元数据部分则详细记录了每一章(苏拉)与每一节(阿亚)的归属信息,确保了数据的可追溯性。多语种翻译与转写数据,包括塔吉克语、波斯语、俄语等,均通过专业学者审核,而注释(塔夫西尔)与翻译独立存放,保持了原典与解读的清晰界限,体现了对宗教文本数字化的严谨态度。
特点
该数据集的核心特点在于其多层次、多语种的整合架构,兼顾了学术研究与日常诵读的需求。其逐词(word-by-word)标注功能,为语言学分析与经文细读提供了前所未有的便利,尤其适用于自然语言处理模型的训练。多语种版本的平行呈现,包括塔吉克语、波斯语、俄语等,不仅覆盖了广泛的地域使用者,也促进了跨文化比较研究。尤为独特的是,数据集将塔夫西尔(注释)与纯翻译分离,如阿布阿洛穆丁版本即包含注释,这有助于研究者区分经文原义与阐释性内容。此外,数据均采用JSON格式,结构清晰,易于解析,为开发者提供了即插即用的高效体验,显著降低了数据预处理的复杂度和时间成本。
使用方法
使用者可通过GitHub的v1.0版本页面直接下载所需的.zip压缩包,每个包内含独立的JSON文件,可无缝集成至各类数字人文或自然语言处理项目中。如需构建全文搜索或词频分析系统,可优先加载QPC V4或乌斯曼尼逐词数据;而页面分割数据则适用于排版与阅读应用的开发。多语种翻译与转写文件可并行载入,以实现多语言对照阅读或机器翻译模型的对齐训练。对于注释需求,可选择携带塔夫西尔的翻译版本。所有数据均遵循JSON标准,开发者只需简易的解压缩与解析操作,即可将古兰经文本、翻译及元数据纳入自身工作流,而无需额外定制数据格式或进行大量清洗工作。
背景与挑战
背景概述
《古兰经》作为伊斯兰教的根本经典,其数字化研究对于宗教文本的语义分析、机器翻译及跨语言传播具有深远意义。quran-data数据集由SakinaDevGroup于近年创建,旨在系统整合《古兰经》的多种语言翻译、注释(tafsir)、逐词解析及元数据,覆盖塔吉克语、波斯语、俄语等版本,并包含QPC V4排版及 tajweed 分页信息。该数据集以JSON格式分模块发布,为自然语言处理、宗教信息检索及比较文学研究提供了结构化、多维度的语料基础,尤其在促进中亚地区《古兰经》研究的数字化进程中发挥了先锋作用,影响力持续扩展至国际伊斯兰文本计算领域。
当前挑战
该数据集面临的挑战首先在于《古兰经》文本的宗教神圣性与语言精确性要求,任何翻译或注释的微小偏差都可能导致语义失真,需严谨校勘多重版本。其次,构建过程中需整合跨语言(阿拉伯语、塔吉克语、波斯语、俄语)的复杂语法结构,特别是逐词解析与形态标注,对算法和人工校对提出高要求。此外,数据版本管理、不同排版规范的兼容(如QPC V4与Uthmani字体),以及元数据的一致性维护构成技术难点。最后,版权与宗教敏感性限制了数据公开度,需在开放共享与严格审核间寻求平衡,从而保障数据质量与学术可靠性。
常用场景
经典使用场景
quran-data数据集为《古兰经》研究领域提供了系统化、多层次的数字资源。其核心使用场景涵盖经文文本的逐词标注、多种语言译本对照、音译转写及元数据提取等。研究者可基于该数据集进行经典阿拉伯语文本的计算语言学分析,如词法、句法结构解析,或用于古兰经版本间的文本对比与校勘。其层次分明的JSON格式设计,亦为构建古兰经信息检索系统、语料库语言学研究和宗教文本数字化典藏奠定了坚实的数据基础。
解决学术问题
该数据集有效解决了伊斯兰经典文本研究中长期存在的数据碎片化与格式不统一问题。通过提供标准化的逐词标注(如QPC V4与Usmani两种体例)和多元文化背景下的译本(如波斯语、俄语、塔吉克语),它大幅降低了跨语言、跨文化比较研究的门槛。此外,元数据与页面划分信息的纳入,为古兰经章节结构的量化研究、诵读规则(Tajweed)的计算建模以及机器翻译模型的训练提供了可靠语料,推动了宗教文本自然语言处理方向的实证进展。
衍生相关工作
基于quran-data,学界已衍生出若干值得关注的后续工作。其一,利用其逐词标注与塔吉克语/波斯语对照资源,训练出针对阿拉伯语-中亚语言对的神经机器翻译模型,改善了低资源语言互译质量。其二,结合Tajweed页面划分数据,开发了自动化诵读律动识别算法,在古兰经音韵学计算研究中开创先例。此外,其元数据被整合进若干开源古兰经搜索引擎,促进了语义查询与多版本交叉引用的实践,进而激励了更多关于经典文献本体构建的探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务