IslamicEval 2026
收藏资源简介:
该数据集用于伊斯兰评估2026,是一个关于阿拉伯伊斯兰内容中细粒度幻觉检测的共享任务数据集。它包含约5,000个模型生成的阿拉伯语响应,这些响应针对真实的伊斯兰问题,涵盖了15,000多个标注的引用和约33,000个标注的片段。每个引用被分解为类型化片段(如Ayah、matn、isnad、claimed_source),并标注为正确、错误或N/A。数据集支持四个子任务:跨度检测、幻觉识别、更正和答案相关性评估。所有古兰经经文和圣训都基于提供的参考语料库进行验证。
This dataset is developed for Islamic Evaluation 2026, a shared task dataset focused on fine-grained hallucination detection in Arabic Islamic content. It contains approximately 5,000 model-generated Arabic responses targeting real Islamic questions, covering over 15,000 annotated citations and around 33,000 annotated segments. Each citation is decomposed into typed segments (e.g., Ayah, matn, isnad, claimed_source) and labeled as correct, incorrect, or N/A. The dataset supports four subtasks: span detection, hallucination recognition, correction, and answer relevance evaluation. All Quranic verses and Hadiths are verified against the provided reference corpus.
IslamicEval 2026 数据集详情
任务概述
IslamicEval 2026 是一个关于阿拉伯语伊斯兰内容中细粒度幻觉检测的共享任务,旨在检测、验证、纠正和评估大语言模型生成的阿拉伯语伊斯兰回答中《古兰经》和圣训引用的准确性。回答来源于真实用户问题(来自 Fanar 日志)并由大语言模型生成,每个回答可能引用《古兰经》经文(Ayah)或先知言论(Hadith),所有引用均经过细粒度人工标注。
四个子任务
| 子任务 | 名称 | 目标 |
|---|---|---|
| 1 | 跨度检测 (Span Detection) | 定位回答中的引用跨度(Ayah, matn, isnad, claimed_source) |
| 2 | 幻觉识别 (Hallucination Identification) | 将每个片段分类为 correct 或 incorrect |
| 3 | 纠正 (Correction) | 为错误的 Ayah/matn 引用提供正确的文本 |
| 4 | 回答相关性 (Answer Relevance) | 确定正确/纠正后的引用是否与所回答的问题相关 |
数据集规模
- 约 5,000 条模型生成的阿拉伯语回答,对应真实伊斯兰问题
- 超过 15,000 个标注的引用,约 33,000 个标注片段
- 每个引用分解为带类型的片段:
Ayah、matn、isnad、claimed_source - 每个片段标注为
correct、incorrect或N/A(仅在底层 Ayah/matn 正确时才对 isnad/claimed_source 进行判断) - 错误的 Ayah/matn 片段带有一个或多个可接受的纠正(若无法在任何权威来源中找到,则为字符串
خطأ) - 未引用任何内容的回答明确标记为
no_annotation
数据划分
- 训练集 (train_set/): 包含回答和完整标注
- 开发集 (dev_set/): 包含回答和完整标注
- 测试集 (test_set/): 采用相同的模式和评分标准,但标注(片段标签、纠正、相关性标签)被隐藏。测试集按子任务拆分为单独的文件,每个引用(以及每个回答)只分配给一个子任务。测试问题和回答与训练集和开发集互不相交。
参考语料库
所有《古兰经》经文和圣训均基于提供的参考语料库进行验证:Corpora/quranic_verses.json 和 Corpora/six_hadith_books.json。
提交格式
预测结果以制表符分隔的 TSV 文件提交,每个子任务一个文件:
- 子任务 1:
Response_ID,Annotation_ID,Segment_Type,Span_Start,Span_End - 子任务 2:
Response_ID,Annotation_ID,Segment_Type,Label - 子任务 3:
Response_ID,Annotation_ID,Segment_Type,Correction - 子任务 4:
question_id,Response_ID,Annotation_ID,span_type,span_text,relevance_label
评分指标
- 子任务 1: 基于字符的宏平均 F1(五个类别:
neither,Ayah,matn,isnad,claimed_source) - 子任务 2: 按片段类型计算准确率,再取宏平均(排除黄金
N/A标签) - 子任务 3: 总体准确率,以及针对
Ayah和matn的按类型准确率 - 子任务 4: 跨问题的宏平均 F1,包含每个问题的精确率、召回率、F1 分解
评估脚本
子任务评分脚本位于 Scoring_scripts/ 目录下,分别为 task1_scoring.py、task2_scoring.py、task3_scoring.py、task4_scoring.py。所有脚本均为纯 Python 实现,无外部依赖(除个别脚本额外注明外),使用 Python 3 即可运行。
许可与使用警告
数据集和语料库仅限研究用途。数据集中包含模型生成的不正确(虚构、错误归属或篡改的)《古兰经》和圣训引用,这些错误引用仅作为待检测错误的示例,不可视为可靠的宗教内容。此资源不能用于提供宗教裁决、教法判令或建议。所有《古兰经》和圣训内容应始终以权威学术来源为准。




