遇见数据集

islamic-corpus-graph

收藏
Hugging Face2026-07-09 更新2026-07-10 收录
官方服务:

资源简介:

QuranLab是一个统一的、结构化的《古兰经》和圣训语料库与知识图谱,由志愿者在QuranLab项目下汇编。它旨在将《古兰经》经文、多语言翻译、经典经注(tafsīr)、词级形态学分析以及带有规范化真实性等级的圣训文本链接到一个一致的图谱中。数据集还包含检索段落、基于来源的问答对和一个留出的评估集。数据规模在100万到1000万条记录之间,涵盖阿拉伯语、英语、土耳其语、乌尔都语、印尼语、法语、孟加拉语、俄语、德语、波斯语、西班牙语、中文等多种语言。数据集包含多个子集:核心图谱(如source_units和source_edges)、《古兰经》数据(如quran_verses、quran_translations、quran_tafsir、quran_morphology)、圣训数据(如hadith_matn、hadith_translations、hadith_grades)、检索与问答(如passages、qa、preferences、verifiable_qa、corpus_text、retrieval)和评估集(eval)。所有数据子集均以Parquet格式提供,遵循‘诚实许可’原则,并适用于问答、文本检索和文本生成等自然语言处理任务。

QuranLab is a unified, structured corpus and knowledge graph of the Quran and Hadith, compiled by volunteers under the QuranLab project. It aims to link Quranic verses, multilingual translations, classical exegesis (tafsīr), word-level morphological analysis, and Hadith texts with normalized authenticity grades into a consistent graph. The dataset also includes retrieval passages, source-based question-answer pairs, and a held-out evaluation set. The data scale ranges from 1 million to 10 million records, covering multiple languages such as Arabic, English, Turkish, Urdu, Indonesian, French, Bengali, Russian, German, Persian, Spanish, and Chinese. The dataset contains multiple subsets: a core graph (e.g., source_units and source_edges), Quran data (e.g., quran_verses, quran_translations, quran_tafsir, quran_morphology), Hadith data (e.g., hadith_matn, hadith_translations, hadith_grades), retrieval and QA (e.g., passages, qa, preferences, verifiable_qa, corpus_text, retrieval), and an evaluation set (eval). All subsets are provided in Parquet format, adhere to the honest licensing principle, and are suitable for natural language processing tasks such as question answering, text retrieval, and text generation.

创建时间:
2026-06-30
原始信息汇总

数据集概述

QuranLab — Quran & Hadith Structured Corpus and Knowledge Graph 是一个统一、结构化的《古兰经》和圣训语料库与知识图谱,由志愿者在 QuranLab 项目下整理而成。它将《古兰经》经文、多语言翻译、古典经注(tafsīr)、词级形态学以及圣训文本及其归一化的可靠性等级连接成一个一致的图结构,同时包含检索段落、有据可查的问答对和保留的评估集。所有子集均为 Parquet 格式。

许可与范围

  • 许可: 其他(具体许可名称为 reference-attribution-removal)。公有领域/CC 文本原样保留;其他(有版权的)翻译和注释以引用并注明出处的方式包含在内,权利所有者可要求移除(通过 Hugging Face 的 Community 标签页联系)。
  • 范围: 遵循 Ahl al-Sunnah wal-Jamāʿah 传统;圣训的可靠性等级已归一化,并非重新发明。

语言

阿拉伯语、英语、土耳其语、乌尔都语、印尼语、法语、孟加拉语、俄语、德语、波斯语、西班牙语、中文、波斯尼亚语、阿尔巴尼亚语、泰米尔语、印地语、马来语、斯瓦希里语、库尔德语、阿塞拜疆语

任务类别

  • 问答
  • 文本检索
  • 文本生成

标签

quran, hadith, arabic, islam, knowledge-graph, retrieval, tafsir, morphology

数据规模

1M < n < 10M

子集详情

数据集包含多个配置(config),每个配置对应一个子集。以下是所有子集的概览:

配置名 (config) 行数 (rows) 数据分割 (split) 说明
source_units 1,628,659 train 规范图节点:每节经文、翻译、经注段落、形态学词、圣训均作为一个节点,包含结构、键和哈希。
source_edges 1,551,003 train 规范图边:连接各节点的类型化关系。
passages 104,385 train 面向检索的文本块,附有引用标签。
quran_verses 6,236 train 规范《古兰经》经文主干及结构元数据。
quran_translations 1,153,660 train 与经文对齐的多语言翻译矩阵。
quran_tafsir 25,834 train 与经文关联的经注单元。
quran_morphology 77,429 train 词形、词根、词元、词性标注。
hadith_matn 65,834 train 阿拉伯语圣训文本(九部圣训集主干)。
hadith_translations 293,185 train 与圣训对齐的翻译。
hadith_grades 39,678 train 归一化到单一量表的圣训可靠性等级。
qa 23,935 train 基于来源的问答对。
preferences 18,935 train 偏好对。
verifiable_qa 9,000 train 可验证引用的问答提示。
corpus_text 1,551,502 train 纯文本语料行。
retrieval 6,140 train 检索评估用数据。
eval 2,877 test 保留的对抗性评估项(来源级保留)。

重要说明

  • 关键字段: 所有子集均保留了 verse_keyhadith_keyurnsource_unit_id 等键。
  • 文本保真度: 阿拉伯语原文未经任何改动;另有一个用于检索的搜索归一化字段。
  • 嵌套字段: 在 qapreferencesverifiable_qaretrievaleval 子集中,结构化字段(如 messagespromptcontextmeta)以 JSON 编码字符串 形式存储,需使用 json.loads 解析。

引用

bibtex @misc{quranlab_corpus_graph, title = {QuranLab — Quran & Hadith Structured Corpus and Knowledge Graph}, author = {QuranLab contributors}, year = {2026}, howpublished = {Hugging Face Datasets} }

搜集汇总
数据集介绍
islamic-corpus-graph 数据集图片
构建方式
该数据集由QuranLab志愿团队精心构建,旨在将《古兰经》与圣训文本整合为一个统一的结构化语料库与知识图谱。其构建过程基于确定性派生方法,以《古兰经》经文与九部圣训集为骨干,通过节点与边的关系网络,将多语言翻译、古典经注(tafsīr)、词级形态学分析以及圣训可靠性等级等多元信息有机联结。此外,数据集还纳入了检索段落、基于原文的问答对及偏好对等子集,形成了一幅层次分明、关联紧密的知识图景。所有原始文本均保留原样,受版权保护的材料则以引用加署名方式纳入,并支持权利人的移除请求。
特点
数据集的核心特点在于其多维度、跨语言的结构化设计。它提供了超过15个配置子集,涵盖从经文原文、翻译矩阵、形态学分析到问答与评估集的完整链条,总数超过160万条记录。特别值得注意的是,数据集不仅包含了经文与圣训的原文与译本,还通过标准化的可靠性等级对圣训进行归一化标注,并引入了用于检索与生成任务的段落块与偏好数据。所有子集均采用高效的Parquet格式存储,便于大规模处理与集成,同时保留了跨子集的唯一键(如verse_key、hadith_key)以实现精确关联。
使用方法
使用者可通过Hugging Face Datasets库直接加载本数据集的任意配置子集,例如使用'quran_verses'获取经文主干,或利用'source_units'与'source_edges'重建完整知识图谱。在问答与检索子集(如qa、retrieval)中,嵌套字段以JSON编码字符串形式存储,需通过json.loads()解析以获取结构化内容。该数据集适用于文本检索增强生成、多语言问答、经文分析及自然语言理解等任务,评估集(eval)则专为模型性能的公正评测而设,其测试样本基于源级别保留策略,确保了评估的可靠性。
背景与挑战
背景概述
伊斯兰教经典《古兰经》与圣训的数字化研究长期面临语料碎片化、多语言对齐困难及知识关联性薄弱等瓶颈。2026年,由QuranLab志愿者团队构建的“islamic-corpus-graph”数据集应运而生,旨在打造一个统一、结构化且可验证的知识图谱。该数据集将《古兰经》节文、多语种翻译、古典经注(Tafsir)、词法形态以及九部权威圣训文本及其可靠性等级,通过图节点与关系边深度融合,形成一个包含逾160万实体节点和155万关联边的大规模语义网络。其核心研究问题聚焦于构建可信赖的伊斯兰知识检索与问答基准,已涵盖多语言问答对、偏好数据与可验证检索集,为伊斯兰自然语言处理与知识工程领域提供了首个高精度、可溯源的基准资源,显著推动了计算伊斯兰研究的标准化进程。
当前挑战
该数据集所解决的领域挑战极为突出:在伊斯兰文本计算领域,传统语料库普遍缺乏对经注逻辑、翻译等效性及圣训真伪判定的系统整合,导致自动问答与知识推理任务受困于语义歧义与事实验证缺失。islamic-corpus-graph通过建立跨版本、跨语言的统一知识图架构,首次实现了经文、翻译、经注、词法与圣训数据间的可遍历链接,有效缓解了多源文本对齐与归属验证难题。在构建过程中,团队面临的挑战包括:需在法律合规前提下处理大量受版权保护的翻译文本(仅以引用方式纳入并支持按需移除),以及将源自不同学术传承的圣训等级(如“健全”“优良”“羸弱”)归一化为一致尺度,同时保持文本字节级的绝对精确性。此外,如何在海量节点中维持数据一致性、防止哈希冲突,并设计可扩展的Parquet存储以支持下游检索与评测,亦构成了工程层面的关键屏障。
常用场景
经典使用场景
在伊斯兰研究领域,islamic-corpus-graph数据集凭借其将《古兰经》经文、多语种翻译、古典经注学(Tafsīr)、词法形态学数据以及圣训文本整合为统一知识图谱的独特架构,成为构建伊斯兰知识检索与问答系统的基石。该数据集最经典的用途在于支撑基于图谱的语义搜索与多语言跨文本推理,研究者可利用其丰富的节点与边结构,对经文进行上下文感知的精准查询,或溯源圣训的传递链条与可靠度等级。
衍生相关工作
该数据集的发布催生了一系列相关研究方向。最直接的衍生工作包括基于图神经网络的知识图谱补全模型,用于预测经文与圣训间的隐含语义关联;以及融合形态学特征与上下文语义的阿拉伯语词义消歧系统。后续研究亦聚焦于利用其评估集构建对抗性测试框架,检验语言模型对伊斯兰文本细微差别的理解能力,从而推动该领域自然语言处理技术的稳健发展。
数据集最近研究
最新研究方向
该数据集构建了统一、对齐的古兰经与圣训结构语料库及知识图谱,将经文、多语翻译、经典经注、词法分析及圣训文本与规范化的可信度等级有机融合,形成了一致性的图结构。近期前沿研究方向聚焦于利用该知识图谱进行可溯源的伊斯兰文本问答与检索增强生成,通过细粒度的节点与边关系支撑深度语义推理,并结合偏好数据优化大语言模型在宗教语境中的响应准确性。该工作填补了高阶语义知识库在伊斯兰研究中的空白,为可验证的宗教AI系统提供了坚实基础,对理解与传播伊斯兰文化具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务