islamic-corpus-graph
收藏资源简介:
QuranLab是一个统一的、结构化的《古兰经》和圣训语料库与知识图谱,由志愿者在QuranLab项目下汇编。它旨在将《古兰经》经文、多语言翻译、经典经注(tafsīr)、词级形态学分析以及带有规范化真实性等级的圣训文本链接到一个一致的图谱中。数据集还包含检索段落、基于来源的问答对和一个留出的评估集。数据规模在100万到1000万条记录之间,涵盖阿拉伯语、英语、土耳其语、乌尔都语、印尼语、法语、孟加拉语、俄语、德语、波斯语、西班牙语、中文等多种语言。数据集包含多个子集:核心图谱(如source_units和source_edges)、《古兰经》数据(如quran_verses、quran_translations、quran_tafsir、quran_morphology)、圣训数据(如hadith_matn、hadith_translations、hadith_grades)、检索与问答(如passages、qa、preferences、verifiable_qa、corpus_text、retrieval)和评估集(eval)。所有数据子集均以Parquet格式提供,遵循‘诚实许可’原则,并适用于问答、文本检索和文本生成等自然语言处理任务。
QuranLab is a unified, structured corpus and knowledge graph of the Quran and Hadith, compiled by volunteers under the QuranLab project. It aims to link Quranic verses, multilingual translations, classical exegesis (tafsīr), word-level morphological analysis, and Hadith texts with normalized authenticity grades into a consistent graph. The dataset also includes retrieval passages, source-based question-answer pairs, and a held-out evaluation set. The data scale ranges from 1 million to 10 million records, covering multiple languages such as Arabic, English, Turkish, Urdu, Indonesian, French, Bengali, Russian, German, Persian, Spanish, and Chinese. The dataset contains multiple subsets: a core graph (e.g., source_units and source_edges), Quran data (e.g., quran_verses, quran_translations, quran_tafsir, quran_morphology), Hadith data (e.g., hadith_matn, hadith_translations, hadith_grades), retrieval and QA (e.g., passages, qa, preferences, verifiable_qa, corpus_text, retrieval), and an evaluation set (eval). All subsets are provided in Parquet format, adhere to the honest licensing principle, and are suitable for natural language processing tasks such as question answering, text retrieval, and text generation.
数据集概述
QuranLab — Quran & Hadith Structured Corpus and Knowledge Graph 是一个统一、结构化的《古兰经》和圣训语料库与知识图谱,由志愿者在 QuranLab 项目下整理而成。它将《古兰经》经文、多语言翻译、古典经注(tafsīr)、词级形态学以及圣训文本及其归一化的可靠性等级连接成一个一致的图结构,同时包含检索段落、有据可查的问答对和保留的评估集。所有子集均为 Parquet 格式。
许可与范围
- 许可: 其他(具体许可名称为
reference-attribution-removal)。公有领域/CC 文本原样保留;其他(有版权的)翻译和注释以引用并注明出处的方式包含在内,权利所有者可要求移除(通过 Hugging Face 的 Community 标签页联系)。 - 范围: 遵循 Ahl al-Sunnah wal-Jamāʿah 传统;圣训的可靠性等级已归一化,并非重新发明。
语言
阿拉伯语、英语、土耳其语、乌尔都语、印尼语、法语、孟加拉语、俄语、德语、波斯语、西班牙语、中文、波斯尼亚语、阿尔巴尼亚语、泰米尔语、印地语、马来语、斯瓦希里语、库尔德语、阿塞拜疆语
任务类别
- 问答
- 文本检索
- 文本生成
标签
quran, hadith, arabic, islam, knowledge-graph, retrieval, tafsir, morphology
数据规模
1M < n < 10M
子集详情
数据集包含多个配置(config),每个配置对应一个子集。以下是所有子集的概览:
| 配置名 (config) | 行数 (rows) | 数据分割 (split) | 说明 |
|---|---|---|---|
source_units |
1,628,659 | train | 规范图节点:每节经文、翻译、经注段落、形态学词、圣训均作为一个节点,包含结构、键和哈希。 |
source_edges |
1,551,003 | train | 规范图边:连接各节点的类型化关系。 |
passages |
104,385 | train | 面向检索的文本块,附有引用标签。 |
quran_verses |
6,236 | train | 规范《古兰经》经文主干及结构元数据。 |
quran_translations |
1,153,660 | train | 与经文对齐的多语言翻译矩阵。 |
quran_tafsir |
25,834 | train | 与经文关联的经注单元。 |
quran_morphology |
77,429 | train | 词形、词根、词元、词性标注。 |
hadith_matn |
65,834 | train | 阿拉伯语圣训文本(九部圣训集主干)。 |
hadith_translations |
293,185 | train | 与圣训对齐的翻译。 |
hadith_grades |
39,678 | train | 归一化到单一量表的圣训可靠性等级。 |
qa |
23,935 | train | 基于来源的问答对。 |
preferences |
18,935 | train | 偏好对。 |
verifiable_qa |
9,000 | train | 可验证引用的问答提示。 |
corpus_text |
1,551,502 | train | 纯文本语料行。 |
retrieval |
6,140 | train | 检索评估用数据。 |
eval |
2,877 | test | 保留的对抗性评估项(来源级保留)。 |
重要说明
- 关键字段: 所有子集均保留了
verse_key、hadith_key、urn、source_unit_id等键。 - 文本保真度: 阿拉伯语原文未经任何改动;另有一个用于检索的搜索归一化字段。
- 嵌套字段: 在
qa、preferences、verifiable_qa、retrieval和eval子集中,结构化字段(如messages、prompt、context、meta)以 JSON 编码字符串 形式存储,需使用json.loads解析。
引用
bibtex @misc{quranlab_corpus_graph, title = {QuranLab — Quran & Hadith Structured Corpus and Knowledge Graph}, author = {QuranLab contributors}, year = {2026}, howpublished = {Hugging Face Datasets} }





