遇见数据集

faqih_sft_dataset

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

MAFQA(Multi-Hop Arabic Fatwa QA)是一个经过精细完善的多跳阿拉伯语法特瓦问答数据集,由沙特国王大学与MDPI 2026合作发布。该数据集包含388个高质量样本,划分为训练集(349个)和验证集(39个),格式为JSON,适用于文本生成和问答任务。每个样本均保留了完整的法特瓦文本和相关证据,未进行任何截断;同时引入了真实的合成推理步骤(第四步),将子问题之间的逻辑关联进行联接;修正了关于合法与非法判断的语义错误;并调整了提示词,以体现权威观点和公认的论证方法。数据集采用CC-BY-4.0许可,主要用于多跳推理、伊斯兰教法问答、思维链推理等研究场景。

MAFQA (Multi-Hop Arabic Fatwa QA) is a multi-hop Arabic Fatwa QA dataset, jointly released by King Saud University and MDPI 2026. It contains 388 high-quality samples, split into training set (349) and validation set (39), in JSON format, suitable for text generation and question answering tasks. Each sample retains the complete fatwa text and evidence, introduces synthetic reasoning steps, corrects semantic errors, adjusts prompts, and is licensed under CC-BY-4.0. It is designed for research on multi-hop reasoning, Islamic jurisprudence QA, and chain-of-thought reasoning.

创建时间:
2026-08-22
原始信息汇总

💎 MAFQA: 完善的多跳阿拉伯语教法问答数据集(388条样本)

数据集概述

MAFQA(Multi-Hop Arabic Fatwa QA)是一个专注于伊斯兰教法(Fiqh)领域的高质量阿拉伯语问答数据集,由沙特国王大学(King Saud University)相关研究团队整理,发表于 MDPI 2026。该数据集旨在支持复杂的多跳推理(Multi-Hop Reasoning)任务,特别针对法特瓦(Fatwa)问答场景。

核心特点

  • 完全精选与无删节:移除所有文本截断,完整呈现原文与证据,确保内容无缺漏。
  • 强化复合推理:激活最终综合与权衡步骤(第4步),在子问题之间建立真实的推理连接。
  • 语义纠错:修正了关于“允许(Halal)”与“禁止(Haram)”判定的印刷错误。
  • 提示词优化:调整提示词以体现权威教法观点(Al-Qawl Al-Rajih)及可靠证据的方法论。

数据规模与划分

数据划分 样本数量 大小
🚂 训练集(Train) 349条 ~1.40 MB
🧪 验证集(Validation) 39条 ~0.16 MB
💎 总计 388条 1.56 MB

数据集属性

  • 语言:阿拉伯语(ar)
  • 许可证:CC-BY-4.0
  • 任务类型:文本生成(Text Generation)、问答(Question Answering)
  • 标签:伊斯兰AI、MAFQA、多跳推理、教法学(Fiqh)、法特瓦(Fatwa)、思维链(Chain-of-Thought)、MDPI 2026

使用方式(Python)

python from datasets import load_dataset

dataset = load_dataset("hozifa1/faqih_sft_dataset") print(dataset)

DatasetDict({

train: Dataset({ num_rows: 349 }),

validation: Dataset({ num_rows: 39 })

})

该数据集特别适合用于训练和评估阿拉伯语伊斯兰教法领域的多跳问答系统、思维链推理模型以及法特瓦智能应答助手。

搜集汇总
数据集介绍
faqih_sft_dataset 数据集图片
构建方式
该数据集立足于伊斯兰教法领域,旨在为阿拉伯语多跳推理问答任务提供高质量监督微调资源。构建过程以MAFQA框架为蓝本,对原始语料实施全面精编,剔除所有文本截断现象,确保经文与证据完整呈现;同时激活第四步的合成与最终权衡机制,在子问题之间建立真实的推理链接,并修正有关许可与禁止语义的排印错误。最终形成的388个样本经严格审核,分为349个训练样本与39个验证样本,并以提示词设计体现择优法与可靠证据的方法论。
使用方法
该数据集可通过HuggingFace的datasets库直接加载,使用load_dataset函数指定路径即可获取训练与验证数据集。加载后返回DatasetDict对象,其中训练集349行、验证集39行,便于直接用于监督微调或评估。使用者可依据任务需求,将样本中的提示词与完整证据链作为输入,训练模型逐步执行多跳推理并生成最终裁断。该数据遵循CC-BY-4.0许可,适用于文本生成和问答系统的开发与测试。
背景与挑战
背景概述
伊斯兰教法(Fiqh)领域的自动问答长期受限于数据稀疏与推理链条断裂,传统语料多聚焦单跳事实检索,难以支撑多步法律演绎。为回应这一空白,沙特国王大学(King Saud University)研究团队于2026年发布MAFQA数据集,并计划在MDPI期刊公开相关成果。该数据集以多跳推理与思维链为核心,从权威教法判例中构建出388条精编样本,每条均包含子问题拆解、证据链组织与最终优选裁决。其核心问题在于如何让模型模拟教法学者层层推演、权衡证据的推理过程,对阿拉伯语伊斯兰人工智能及法律问答研究具有奠基性影响。
当前挑战
就领域问题而言,MAFQA需克服教法裁决固有的歧义性与多元学派解释张力,要求模型在缺失显式推理标注时区分类比推理、公议与圣训优先等级,同时维持术语的精确与格式的规范。就构建过程而言,原始教法文本存在断句与碎片化引用,研究团队须完整复原被截断的证据链,并确保第四步“综合优选”环节子问题间存在真实的逻辑关联而非表面拼接。此外,教法判断中“许可”与“禁止”的语义易因印刷错误而混淆,需精细校正以避免误导模型学习,而提示词的设计亦须贴合“优选主张与可靠证据”的学术方法论。
常用场景
经典使用场景
在阿拉伯语伊斯兰法学(Fiqh)智能问答领域,该数据集最为经典的使用场景是面向多跳推理(Multi-Hop Reasoning)的监督微调(SFT)。模型需依次完成若干相互关联的子问题推理——如先判定具体行为之教法性质、再援引经训证据(الأدلة)、继而进行权衡比较(الترجيح),最终聚合为一份完整的法特瓦(Fatwa)判断。MAFQA数据集以链条式思维路径(Chain-of-Thought)组织样本,每条数据均要求模型依据真实的教法推理链条逐步推进,而非直接给出结论。这一场景高度契合法特瓦发布的真实认知流程,使模型在生成答复时兼具可解释性与教法严谨性。
解决学术问题
该数据集直面阿拉伯语伊斯兰问答研究中长期存在的两项学术难题:其一,传统法特瓦数据多呈单跳结构,难以评估模型对多步教法推理链条的把握能力;其二,既有资源常因文本截断、证据残缺或排版讹误,导致模型习得片面乃至错误的教法判定。MAFQA通过完整呈现证据文本、激活第四步综合权衡环节、校正教法判定中涉及的合法与禁止等语义讹误,并以规范的提示词设计引导模型遵循'最可取主张(القول الراجح)'的方法论。其学术意义在于为阿拉伯语法学推理评测提供了可复现的基准,推动了伊斯兰人工智能(Islamic-AI)研究从表层问答向深层教法论证的范式转变。
实际应用
在实际应用中,该数据集可服务于面向穆斯林社群的法特瓦问答助手、伊斯兰法学教育辅助工具以及跨语种教法知识检索系统。开发者可基于其监督微调样本训练阿拉伯语大模型,使其在回答涉及礼拜、交易、婚姻等具体教法问题时,能够给出有据可循的推理链路,而非笼统的教条式回应。数据集亦可嵌入在线教法咨询平台,为宗教事务部门或学术机构提供自动化初步解答,缓解专业法学家资源稀缺的压力。此外,它还可作为伊斯兰法学研究者的辅助分析语料,用于梳理特定教法议题的推理模式与证据选用规律。
数据集最近研究
最新研究方向
阿拉伯语伊斯兰法学领域正经历从单跳事实检索向多跳链式推理的范式转型,MAFQA数据集以388条精编样本构建了涵盖子问题分解、证据溯源与跨议题权衡的完整推理链条,直接回应了大语言模型在宗教法律问答中证据链断裂与推理深度不足的痛点。当前前沿研究聚焦于将思维链提示与真实法源论证相结合,探索模型在教法判令场景下的可解释推理路径。该数据集经沙特国王大学与MDPI 2026平台联合校验,同步推动了阿拉伯语低资源场景下多跳问答基准的标准化进程,对智能宗教问答系统的可信部署具有标杆意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务