遇见数据集

QuranicMMLU

收藏
arXiv2026-09-19 更新2026-09-22 收录
官方服务:

资源简介:

QuranicMMLU是卡塔尔计算研究所等机构联合推出的古兰经阿拉伯语语言理解基准数据集,旨在从音系、形态、句法、语义和语用五个语言学支柱维度评估生成式AI能力。该数据集包含980条经人工审核的高质量问题,每条均以开放式和多项选择两种形式呈现,并依据布鲁姆认知层次和经文困惑度进行分层。创建过程中,先由大语言模型基于分类法生成候选问题,再经LLM标注和双人评审修订(34%项目被修正,10%被废弃),最终确保内容的准确性和伊斯兰教义正确性。该基准可用于诊断大语言模型在古兰经语言学知识上的表现,弥补现有基准仅关注事实问答而忽视认知难度和语言能力细粒度评估的不足,尤其在揭示多项选择格式高估模型能力方面具有重要价值。

QuranicMMLU is a benchmark dataset for Quranic Arabic language understanding, jointly developed by institutions including the Qatar Computing Research Institute (QCRI) and other partners. It aims to evaluate the capabilities of generative AI across five core linguistic pillars: phonology, morphology, syntax, semantics, and pragmatics. This dataset contains 980 high-quality manually reviewed questions, each presented in both open-ended and multiple-choice formats, and stratified based on Bloom's Taxonomy and the perplexity of Quranic verses. During the dataset construction process, candidate questions were first generated by large language models (LLMs) based on a predefined taxonomy, then annotated by LLMs and revised through dual human expert review, with 34% of the items revised and 10% discarded. This rigorous workflow ultimately ensures the accuracy of the content and compliance with Islamic theological correctness. This benchmark can be used to diagnose the performance of LLMs on Quranic linguistic knowledge, filling the gap of existing benchmarks that only focus on factual question answering while neglecting cognitive difficulty and fine-grained evaluation of language proficiency. It is particularly valuable in revealing that the multiple-choice format tends to overestimate the capabilities of AI models.

创建时间:
2026-09-19
搜集汇总
数据集介绍
QuranicMMLU 数据集图片
构建方式
在古兰经语言理解评估领域,既有基准多聚焦于事实问答与语义检索,鲜有对语言能力进行细粒度刻画。QuranicMMLU的构建以语言学能力为纲,首先建立涵盖音系、形态、句法、语义与语用五大支柱、十二类别、三十一叶节点的分类体系,每一叶对应一项独立语言现象。随后以Claude Opus 4.7为生成器,依据目标叶节点选取含相应现象的经文,逐题生成开放式与多项选择两种形式,并按照Bloom认知层级与经文困惑度分层。生成结果由GPT与Gemini双模型独立作答与评分,再经两名人工评审逐题核验,争议由三名裁决者以多数决解决,最终形成980道经人工审定的题目。
特点
QuranicMMLU的独特之处在于其以语言学能力而非学科知识为组织轴心,将评估铺展为一张覆盖音系至语用的能力网格。数据集同时提供开放式与多项选择两种题式,使同一题池可在两种作答范式下直接比较,从而揭示多项选择评分对模型能力的系统性高估。每一题均标注Bloom认知层级并依据经文困惑度分为低、中、高三档,以控制模型对高频经文的记忆优势。题目与答案均以权威语料为检索依据,涵盖Quran.com API、古兰经阿拉伯语语料库、Tarteel经注及降示缘由数据集,确保评估的语料根基性。
使用方法
QuranicMMLU适用于在古兰经阿拉伯语领域对生成式模型进行细粒度诊断。使用者可在同一题池上分别以多项选择与开放式两种格式评测模型,借助准确率与LLM评判得分双轨并行,并通过Kendall's τ检验两种格式下模型排序的一致性。评估结果可按五大语言支柱与五个Bloom层级分解,从而定位模型在音系规则应用、形态分析、句法解析、语义辨析及语用推理中的薄弱环节。开放式回答由Gemini作为自动评判者,依据问题、参考答案与模型作答按0至5分评分,为难以量化的语言生成质量提供可复现的度量。该基准亦适合用于比较通用模型与伊斯兰专门化模型在古兰经语言理解上的能力差异。
背景与挑战
背景概述
古兰经作为近二十亿穆斯林的核心宗教与文化典籍,其语言理解涵盖音系、形态、句法、语义与语用等多维能力。既往的古兰经问答基准多聚焦事实性检索与语义匹配,鲜有按语言能力与认知层级分层评估者。2026年,卡塔尔计算研究所联合卡内基梅隆大学卡塔尔分校、多哈科技大学等机构提出QuranicMMLU,构建涵盖五大语言学支柱、12类、31叶的细粒度分类体系,并依据布鲁姆认知层级与经文困惑度分层生成980道经人工审核的双格式试题,为古兰经领域阿拉伯语自然语言处理提供了严谨且语言学分层的评测框架。
当前挑战
该数据集所应对的核心挑战在于:其一,古兰经阿拉伯语的无变音书写、根-模式形态系统及语篇连贯性使音系消歧、多义辨析与跨节推理成为长期难题,通用阿拉伯语基准无法覆盖此类现象;其二,构建过程中试题由单一模型生成,需经多模型标注、双人审核与三人裁决,34%的候选题被修订、10%遭弃用,且布鲁姆层级成为最易误标字段,凸显领域正确性与认知标注的双重困难;其三,多项选择题的答案选项易被利用,评分会掩盖模型在开放式作答中暴露的失败,如何设计格式稳健的评测仍是悬而未决的问题。
常用场景
经典使用场景
在阿拉伯语自然语言处理与古兰经语言知识评估领域,QuranicMMLU 最经典的使用场景是作为细粒度诊断基准,对生成式人工智能系统的古兰经阿拉伯语能力进行多维度评测。该基准以音系学、形态学、句法学、语义学与语用学五大支柱为骨架,细分为12个类别与31个叶节点,并针对每一叶节点按布鲁姆认知层级与经文困惑度分层生成题目,每道题同时提供开放式与多项选择两种作答形式。研究者据此可在统一题目池上比较各系统在两种作答格式下的表现差异,进而揭示模型究竟是在真正理解古兰经语言,还是仅凭选项线索作出猜答。
实际应用
在实际应用层面,QuranicMMLU 为面向穆斯林用户的古兰经问答系统、伊斯兰知识助手以及阿拉伯语大模型的研发与选型提供了可操作的评估工具。由于古兰经领域的错误回答可能带来真实的宗教后果,开发方需要可靠的细粒度指标来判断模型是否真正掌握古兰经阿拉伯语。该基准的公开排行榜与资源使研究机构、模型提供方与教育平台能够在开放式与多项选择两种真实使用形态下对比系统表现,从而支撑模型微调、检索增强策略验证与风险筛查,并为伊斯兰专业模型的迭代提供实证依据。
衍生相关工作
围绕 QuranicMMLU,后续研究沿多条线索展开。该工作与阿拉伯语通用基准 ArabicMMLU、AlGhafa 及伊斯兰知识基准 IslamicMMLU、QIAS 2025、IslamicEval 2025 等形成互补,推动评估从学科知识向语言能力迁移;其认知分层设计呼应布鲁姆分类学在大语言模型评测中的广泛应用,并启发 ALMIEYAR-Oryx-BloomBench 等多模态认知评测工作;其多格式、多评委协议也为忠实伊斯兰问答中的检索增强与智能体方法研究提供了方法参照,促进了古兰经与伊斯兰领域可信评测体系的持续扩展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务