遇见数据集

HalluTruthQA

收藏
arXiv2026-07-22 更新2026-07-24 收录
官方服务:

资源简介:

HalluTruthQA是由哈马德·本·哈利法大学等机构联合构建的细粒度阿拉伯语问答幻觉检测基准数据集,包含2400条专家标注的问答实例,覆盖伊斯兰知识、历史、科学和地理四个知识密集型领域。该数据集每个实例包含阿拉伯语问题、模型生成答案、验证参考答案、二元幻觉标签、六个候选答案以及针对幻觉答案的字符级错误片段和人工撰写解释,数据来源于单一阿拉伯语中心指令调优模型Fanar-1-9B-Instruct的生成输出。数据集通过两轮专家标注流程构建,首先由领域专家进行初始标注和解释撰写,再由研究助理进行验证和裁决,确保标注质量和高一致性。该数据集旨在推动阿拉伯语自然语言处理中幻觉评估的研究,专门用于解决知识密集型问答场景下幻觉检测、错误定位、事实验证和解释生成等核心问题,为模型事实可靠性提供多维度的评估框架。

HalluTruthQA is a fine-grained Arabic question answering hallucination detection benchmark dataset jointly constructed by Hamad Bin Khalifa University and other institutions. It contains 2400 expert-annotated question answering instances covering four knowledge-intensive domains: Islamic knowledge, history, science, and geography. Each instance in the dataset includes an Arabic question, a model-generated answer, a verified reference answer, a binary hallucination label, six candidate answers, character-level error fragments of hallucinatory answers, and manually written explanations. The dataset is sourced from the generation outputs of a single Arabic-centric instruction-tuned model, Fanar-1-9B-Instruct. It is built via a two-round expert annotation workflow: first, domain experts perform initial annotation and explanation writing, followed by verification and adjudication by research assistants to ensure annotation quality and high consistency. This dataset aims to advance research on hallucination evaluation in Arabic natural language processing, and is specifically designed to address core tasks including hallucination detection, error localization, fact verification, and explanation generation in knowledge-intensive question answering scenarios, providing a multi-dimensional evaluation framework for assessing the factual reliability of models.

创建时间:
2026-07-22
原始信息汇总

HalluTruthQA 数据集概述

数据集名称: HalluTruthQA

任务目标: 该数据集源于 HalluScoring 2026 任务的“从幻觉检测到真相”(From Hallucination Detection to Truth)子任务,旨在研究阿拉伯语语言模型是否能够:

  • 检测生成的答案是否包含幻觉或没有根据;
  • 识别出幻觉发生的具体文本片段(span);
  • 从给定的候选选项中选出正确答案;
  • 提供基于证据的判断解释。

数据内容: 每个样本包含一个阿拉伯语问题、一个生成的答案,以及候选答案选项。模型需预测:

  • predicted_label: 结果类别,值为 hallucination(存在幻觉)或 no-hallucinate(无幻觉)。
  • predicted_answer: 正确答案选项,通常为 A 到 F。
  • selected_option: 与上一条相同的选项字段,用于兼容推理提示。
  • justification: 阿拉伯语判断解释。
  • hallucinations: 当答案被判定为存在幻觉时,提供幻觉片段的位置(起始字符和结束字符)、具体的幻觉内容以及该错误的解释。若答案无幻觉,此字段为空列表。

数据领域: 数据集覆盖两个阿拉伯语领域:

  • data/islamic/: 伊斯兰文化相关问答。
  • data/general_culture/: 一般文化常识问答。

数据格式:

  • 标注了幻觉标签、答案选项以及可用的片段级别注释。
  • 示例目标格式为 JSON,包含检测标签、正确答案选项、判断解释以及幻觉片段详情。

评估指标:

  • 幻觉检测准确率与 F1 分数
  • 宏观 F1 分数
  • 答案选项准确率
  • 综合得分
  • 部分片段精确率、召回率与 F1
  • 检测级联片段 F1
  • 字符级交并比与重叠诊断
  • 推荐的片段评估指标为 cascaded_span_f1

数据集规模:

  • 项目包含 8 个提交记录,2 个分支。
  • 数据集中包含多个文件,如 data/ 目录下的伊斯兰文化及一般文化问答数据,以及 evaluation/ 目录下的评估结果与错误分析文件。
搜集汇总
数据集介绍
HalluTruthQA 数据集图片
构建方式
在阿拉伯语问答系统中,大语言模型虽能生成流畅回答,却常出现事实性错误。为系统评估这一缺陷,研究团队构建了HalluTruthQA基准数据集。该数据集包含2400条专家精心标注的问答样本,覆盖伊斯兰知识、历史、科学和地理四个知识密集型领域。每条样本均包含一个阿拉伯语问题、模型生成的回答、经过验证的参考答案以及二分类幻觉标签。对于幻觉回答,进一步标注了字符级别的错误片段、人工撰写的解释说明以及宏观和微观的幻觉类型分类。此外,每条问题还配备了六个候选答案,包括一个正确选项和五个看似合理的干扰项。数据集由单一模型Fanar-1-9B-Instruct生成全部回答,随后由四位领域专家分别进行首轮标注,再由两位研究助理进行二次复核,最终通过专家裁决解决分歧,确保标注质量。
特点
HalluTruthQA的显著特征在于其多维度、细粒度的评估设计。它不仅提供回答级别的二分类幻觉检测标签,还深入至字符级别的错误片段定位,帮助研究者精确识别模型在何处出错。每条幻觉回答均附有人工撰写的解释,阐明错误原因并提供事实纠正。与现有阿拉伯语幻觉资源不同,该基准支持从幻觉检测、错误定位、事实验证到解释评估的完整评估流程,且所有评估任务均可在同一数据集上完成。数据集覆盖的四大领域展现了多样化的幻觉模式:伊斯兰知识领域以证据引用错误为主,历史、科学和地理领域则以事实矛盾为主。这种领域特异性使得基准能够全面反映模型在不同知识场景下的幻觉表现。
使用方法
HalluTruthQA支持四项核心评估任务,研究者可按需选用。幻觉检测任务要求模型判断给定回答是否包含幻觉内容,输出二分类标签。错误定位任务则需模型在实现检测的基础上,识别出回答中字符级别的错误片段。事实验证任务提供六选一的多选题,考察模型能否从包含正确答案和五个干扰项的候选中选出正确事实。解释评估任务采用大语言模型作为评判者,将模型生成的解释与人工参考解释进行对比,从错误识别和事实纠正两个维度量化评分。所有评估均采用零样本、闭书设置,不允许模型访问外部知识库或搜索引擎。评估代码、提示模板和评测脚本已在项目仓库中开源,便于研究者复现和扩展实验。
背景与挑战
背景概述
HalluTruthQA是由哈马德·本·哈利法大学、比斯克拉大学、巴斯克大学等多所机构的研究人员于2025年联合创建的精粒度阿拉伯语幻觉评估基准。核心研究问题在于,现有幻觉评测多局限于二分类标签,无法精准定位模型生成答案中的错误内容、解释错误成因或甄选正确事实。该数据集包含2,400条专家精标样本,覆盖伊斯兰知识、历史、科学、地理四大知识密集型领域,首创性地将响应级检测、字符级错误跨度定位、人类撰写解释与候选答案事实验证融为一体,为阿拉伯语大模型的事实可靠性评估树立了全新标杆,对低资源语言的幻觉研究具有里程碑式的影响力。
当前挑战
该数据集面临的核心挑战在于:一是所解决的领域问题——模型生成的阿拉伯语回答即使流畅连贯,仍可能包含错误实体、日期、数值、出处或解释,而现有二元标注无法揭示错误本质,尤其伊斯兰知识等敏感领域对引证忠实度要求极高,错误往往涉及虚假的经文引用、不存在的圣训来源或捏造的法律论断。二是构建过程中的挑战——需由领域专家逐条标注字符级错误跨度并撰写解释,同时构造五个风格逼真的干扰项以确保事实验证无法依赖表层线索,标注工作极为繁重;此外,专家与评审者之间对微观错误类型的标注一致性(κ=0.81)和跨度边界对齐(IoU=0.84)仍存在一定差异,反映了细粒度幻觉标注本身的高难度与主观性。
常用场景
经典使用场景
HalluTruthQA最经典的用途在于对阿拉伯语大语言模型的幻觉进行细粒度评估。该数据集围绕伊斯兰知识、历史、科学和地理四个知识密集型领域,构建了2400条专家精校的问答实例。每一实例不仅提供二值幻觉标签,还标注了字符级别的错误跨度、人工撰写的解释以及六个候选答案,从而支持从回答层面检测到跨度定位、幻觉解释与事实验证的多层次评估。这一设计使得研究者能够深入剖析模型在阿拉伯语语境下产生幻觉的具体位置、类型与成因,超越传统仅依赖二元判断的评估模式。
衍生相关工作
HalluTruthQA的发布催生了一系列与之密切相关的后续研究方向。受其细粒度标注框架启发,研究者开始探索将字符级跨度定位与语义角色分解、文本蕴含推理相结合,以提升阿拉伯语幻觉检测的精确性。此外,该基准推动了面向伊斯兰法律推理与遗产分配等专属领域的评测数据集构建,例如Mawarith与IslamicMMLU等工作,进一步将细粒度幻觉评估拓展至法律与宗教推理场景。在方法论层面,HalluTruthQA的多任务评估策略也被借鉴于多语言幻觉评测共享任务中,促进了跨语言、跨领域的幻觉定位与解释能力的系统化研究。
数据集最近研究
最新研究方向
HalluTruthQA的提出标志着阿拉伯语幻觉评估从粗粒度的二元检测向细粒度、多维度分析的关键转变。该基准聚焦于知识密集型领域(伊斯兰知识、历史、科学、地理),通过字符级错误跨度定位、人工解释及候选答案事实验证,揭示了当前模型在检测、定位、验证和解释幻觉任务间的显著能力鸿沟。研究发现,即便在检测任务上表现优异的模型,在跨度定位与事实解释上仍力有不逮,特别是在伊斯兰知识领域,模型常因源引用错误或证据支撑不足而产生“表面正确”的幻觉。此工作呼应了大型语言模型在低资源与高敏感领域(如宗教、法律)中事实可靠性亟待提升的迫切需求,为推动阿拉伯语问答系统向更可解释、更可信赖的方向演进提供了关键资源与评估范式。
相关研究论文
  • 1
    HalluTruthQA: A Fine-Grained Benchmark for Hallucination Detection, Localization, and Explanation in Arabic Question Answering哈马德·本·哈利法大学; 比斯克拉大学; 巴斯克大学; 纳扎尔巴耶夫大学; 马来西亚吉兰丹大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务