遇见数据集

IslamicEval 2026

收藏
github2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

该数据集用于伊斯兰评估2026,是一个关于阿拉伯伊斯兰内容中细粒度幻觉检测的共享任务数据集。它包含约5,000个模型生成的阿拉伯语响应,这些响应针对真实的伊斯兰问题,涵盖了15,000多个标注的引用和约33,000个标注的片段。每个引用被分解为类型化片段(如Ayah、matn、isnad、claimed_source),并标注为正确、错误或N/A。数据集支持四个子任务:跨度检测、幻觉识别、更正和答案相关性评估。所有古兰经经文和圣训都基于提供的参考语料库进行验证。

This dataset is developed for Islamic Evaluation 2026, a shared task dataset focused on fine-grained hallucination detection in Arabic Islamic content. It contains approximately 5,000 model-generated Arabic responses targeting real Islamic questions, covering over 15,000 annotated citations and around 33,000 annotated segments. Each citation is decomposed into typed segments (e.g., Ayah, matn, isnad, claimed_source) and labeled as correct, incorrect, or N/A. The dataset supports four subtasks: span detection, hallucination recognition, correction, and answer relevance evaluation. All Quranic verses and Hadiths are verified against the provided reference corpus.

创建时间:
2026-07-14
原始信息汇总

IslamicEval 2026 数据集详情

任务概述

IslamicEval 2026 是一个关于阿拉伯语伊斯兰内容中细粒度幻觉检测的共享任务,旨在检测、验证、纠正和评估大语言模型生成的阿拉伯语伊斯兰回答中《古兰经》和圣训引用的准确性。回答来源于真实用户问题(来自 Fanar 日志)并由大语言模型生成,每个回答可能引用《古兰经》经文(Ayah)或先知言论(Hadith),所有引用均经过细粒度人工标注。

四个子任务

子任务 名称 目标
1 跨度检测 (Span Detection) 定位回答中的引用跨度(Ayah, matn, isnad, claimed_source)
2 幻觉识别 (Hallucination Identification) 将每个片段分类为 correctincorrect
3 纠正 (Correction) 为错误的 Ayah/matn 引用提供正确的文本
4 回答相关性 (Answer Relevance) 确定正确/纠正后的引用是否与所回答的问题相关

数据集规模

  • 5,000 条模型生成的阿拉伯语回答,对应真实伊斯兰问题
  • 超过 15,000 个标注的引用,约 33,000 个标注片段
  • 每个引用分解为带类型的片段:Ayahmatnisnadclaimed_source
  • 每个片段标注为 correctincorrectN/A(仅在底层 Ayah/matn 正确时才对 isnad/claimed_source 进行判断)
  • 错误的 Ayah/matn 片段带有一个或多个可接受的纠正(若无法在任何权威来源中找到,则为字符串 خطأ
  • 未引用任何内容的回答明确标记为 no_annotation

数据划分

  • 训练集 (train_set/): 包含回答和完整标注
  • 开发集 (dev_set/): 包含回答和完整标注
  • 测试集 (test_set/): 采用相同的模式和评分标准,但标注(片段标签、纠正、相关性标签)被隐藏。测试集按子任务拆分为单独的文件,每个引用(以及每个回答)只分配给一个子任务。测试问题和回答与训练集和开发集互不相交。

参考语料库

所有《古兰经》经文和圣训均基于提供的参考语料库进行验证:Corpora/quranic_verses.jsonCorpora/six_hadith_books.json

提交格式

预测结果以制表符分隔的 TSV 文件提交,每个子任务一个文件:

  • 子任务 1: Response_ID, Annotation_ID, Segment_Type, Span_Start, Span_End
  • 子任务 2: Response_ID, Annotation_ID, Segment_Type, Label
  • 子任务 3: Response_ID, Annotation_ID, Segment_Type, Correction
  • 子任务 4: question_id, Response_ID, Annotation_ID, span_type, span_text, relevance_label

评分指标

  • 子任务 1: 基于字符的宏平均 F1(五个类别:neither, Ayah, matn, isnad, claimed_source
  • 子任务 2: 按片段类型计算准确率,再取宏平均(排除黄金 N/A 标签)
  • 子任务 3: 总体准确率,以及针对 Ayahmatn 的按类型准确率
  • 子任务 4: 跨问题的宏平均 F1,包含每个问题的精确率、召回率、F1 分解

评估脚本

子任务评分脚本位于 Scoring_scripts/ 目录下,分别为 task1_scoring.pytask2_scoring.pytask3_scoring.pytask4_scoring.py。所有脚本均为纯 Python 实现,无外部依赖(除个别脚本额外注明外),使用 Python 3 即可运行。

许可与使用警告

数据集和语料库仅限研究用途。数据集中包含模型生成的不正确(虚构、错误归属或篡改的)《古兰经》和圣训引用,这些错误引用仅作为待检测错误的示例,不可视为可靠的宗教内容。此资源不能用于提供宗教裁决、教法判令或建议。所有《古兰经》和圣训内容应始终以权威学术来源为准。

搜集汇总
数据集介绍
IslamicEval 2026 数据集图片
构建方式
IslamicEval 2026数据集专为细粒度幻觉检测任务而构建,聚焦于阿拉伯语伊斯兰内容中大语言模型生成的回答。数据来源于Fanar日志中的真实用户问题,由大语言模型生成回答,其中可能引用《古兰经》经文或圣训。每个引用均经过人工精细标注,包括引用文本的真实性、传述链条的正确性、声称来源的准确性,并在错误时提供正确引用。数据集包含约5000条模型生成的阿拉伯语回答,超过15000个标注引用和约33000个标注片段,所有引用均基于提供的参考语料库进行验证。
特点
该数据集的核心特色在于其精细化的标注粒度与多任务架构。每个引用被分解为四种类型片段:经文、正文、传述链条和声称来源,并标注为正确、错误或不适用。针对错误的经文或正文片段,还提供至少一个标准修正方案。数据集划分为四个子任务:跨度检测、幻觉识别、修正和回答相关性评估,覆盖从定位到验证再到修正的完整流程。测试集设计为盲测,各子任务输入独立,确保评估的公正性与挑战性。
使用方法
使用该数据集时,参与者需针对四个子任务分别提交制表符分隔的预测文件。子任务1要求定位引用跨度,子任务2对每个片段进行分类,子任务3提供错误引用的修正文本,子任务4评估修正后引用与问题的相关性。官方提供评分脚本,支持通过文件夹约定或显式路径两种方式运行,评估指标包括字符级宏平均F1、准确率和宏平均F1等。所有提交需遵循Codabench平台的打包规范,并参考提供的示例文件以确保格式正确。
背景与挑战
背景概述
随着大语言模型在阿拉伯语伊斯兰内容生成中的广泛应用,模型对于古兰经经文与圣训引文的准确性成为一项严峻考验。伊斯兰教法文本的引用具有高度敏感性,任何细微错误都可能导致教义理解偏差。为此,IslamicEval 2026数据集于2026年应运而生,由国际自然语言处理与伊斯兰研究交叉领域的学者联合构建,依托Fanar日志中的真实用户问题,系统评估大语言模型在伊斯兰问答场景中引文生成的真实性。该数据集聚焦于细粒度幻觉检测,涵盖引文跨度定位、真伪识别、错误纠正及回答相关性判断四大子任务,为相关领域提供了首个标准化评测基准,显著推动了伊斯兰数字内容可信度研究的发展。
当前挑战
该数据集构建面临多重挑战。首先,伊斯兰引文具有复杂的结构特征,包括经文正文、传述链与声称来源等多个语义层面,需在模型生成的自由文本中精确标注这些多维细粒度成分,难度远超传统实体识别任务。其次,错误引文类型涵盖虚构、归因错误与篡改等多种形态,且部分错误仅限于部分片段,要求模型具备深度语义理解而非简单模式匹配。此外,构建过程中需确保注释者具备伊斯兰教法专业知识以准确判别引文真实性,同时平衡参考语料库涵盖六大圣训集与古兰经全本,保证标注既全面又严谨。最后,在无标注的测试集上评估模型时,需保证各子任务间的隔离性与评分的公平性,进一步增加了任务复杂度。
常用场景
经典使用场景
IslamicEval 2026数据集专为阿拉伯语伊斯兰内容中的细粒度幻觉检测任务而设计,其核心使用场景在于评估和提升大语言模型在回答伊斯兰教义问题时的引文准确性。该数据集围绕《古兰经》经文(Ayah)和圣训(Hadith)的引用,构建了四个子任务:引文跨度检测、幻觉识别、错误纠正及答案相关性判断。研究者可以利用该数据集系统性地分析模型在生成伊斯兰相关回答时,是否真实、准确地引用了经典文本,从而推动模型在宗教领域的可信赖性研究。
衍生相关工作
该数据集衍生了一系列重要的学术工作,最显著的是围绕其四个子任务开展的共享任务竞赛,吸引了全球多支团队在引文跨度检测、幻觉分类与纠正等方向提出创新方法。相关工作包括基于阿拉伯语BERT模型的细粒度引文分类器、融合知识图谱的幻觉纠正框架,以及利用序列标注技术的引文边界检测算法。这些工作不仅推动了阿拉伯语NLP的发展,也促进了跨语言幻觉检测技术向低资源、高领域专业性场景的迁移,形成了宗教文本可信度评估的全新研究方向。
数据集最近研究
最新研究方向
IslamicEval 2026聚焦于大语言模型在阿拉伯语伊斯兰内容生成中的细粒度幻觉检测,涵盖《古兰经》经文与圣训引用的真实性、归因准确性及回答相关性四大子任务。该数据集基于真实用户查询与人工标注,精准刻画了引用文本、传述链条、声称来源的修正与相关性评估,为宗教领域AI的可信度研究提供了首个系统化基准。结合当前对大模型事实性幻觉的高度关注,IslamicEval 2026不仅推动了多语言、多模态幻觉检测技术向高敏感专业领域的延伸,更在伊斯兰数字人文与AI伦理治理间架起了关键桥梁,其细粒度标注范式有望重塑宗教内容生成系统的评估标准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务