遇见数据集

HalluTruthQA-4K

收藏
arXiv2026-08-05 更新2026-08-06 收录
官方服务:

资源简介:

HalluTruthQA-4K是由多国研究机构联合构建的细粒度阿拉伯语幻觉检测与事实验证语料库,包含4000个问答实例,均衡覆盖伊斯兰知识、历史、科学和地理四个知识密集型领域。每个实例均包含阿拉伯语问题、模型生成回答、验证参考答案、二元幻觉标签及六选一候选答案集,其中1643个幻觉回答附有字符级错误跨度、人工解释与层次化幻觉类型。语料通过专家问题筛选、受控生成、人工标注与独立验证等严谨流程构建,支持响应级检测、错误定位、解释生成与事实验证等多任务评估,旨在解决阿拉伯语大模型在知识问答中的细粒度可靠性评估难题。

HalluTruthQA-4K is a fine-grained Arabic hallucination detection and fact verification corpus jointly constructed by multiple national research institutions. It includes 4,000 question-answering instances that evenly cover four knowledge-intensive domains: Islamic knowledge, history, science, and geography. Each instance contains an Arabic question, a model-generated response, a verified reference answer, a binary hallucination label, and a six-option candidate answer set. Among these, 1,643 hallucinatory responses are accompanied by character-level error spans, human explanations, and hierarchical hallucination categories. The corpus is built through rigorous workflows including expert-based question screening, controlled generation, manual annotation and independent verification. It supports multi-task evaluation such as response-level detection, error localization, explanation generation and fact verification, aiming to address the challenge of fine-grained reliability assessment for knowledge-based question answering of Arabic large language models.

创建时间:
2026-08-05
原始信息汇总

HalluTruthQA-4K 数据集概述

基本信息

  • 数据集名称:HalluTruthQA-4K
  • 语言:阿拉伯语(ar
  • 许可证:CC BY-NC-ND 4.0
  • 数据集规模:1K < n < 10K(完整语料 4,000 条)
  • 任务类别:文本分类、问答、多项选择
  • 标签:阿拉伯语、幻觉检测、伊斯兰研究、问答、HalluScoring-2026
  • 发布背景:这是 HalluScoring 2026 共享任务(ArabicNLP 2026)中 子任务 2.2(“幻觉检测与寻找真相”) 的官方数据发布,扩展自基础基准 HalluTruthQA(从 2,400 条扩展到 4,000 条专家标注的阿拉伯语问答实例)。

数据集内容

  • 完整语料包含 4,000 条阿拉伯语问答实例,在四个知识密集型领域各 1,000 条,完全平衡:伊斯兰研究、历史、科学、地理
  • 每个实例包含:
    • 二元幻觉标签(hallucination / no_hallucination
    • 六选一多项选择改写(选项 AF,其中有一个经核实的正确答案)
  • 在完整语料的 1,643 条幻觉实例中,1,626 条额外带有至少一个字符级别的错误片段(共 1,843 个片段),每个片段附有人工撰写的错误原因解释。

数据划分

划分 伊斯兰研究 历史 科学 地理 总计 是否已发布
train 400 400 400 400 1,600 ✅ 是
dev 200 200 200 200 800 ✅ 是
test 400 400 400 400 1,600 ⏳ 暂未发布(竞赛结束后补充)
完整语料 1,000 1,000 1,000 1,000 4,000
  • 完整 4,000 条语料的标签分布:2,357 条 no_hallucination(58.9%)、1,643 条 hallucination(41.1%)。
  • 当前发布的 train+dev 共 2,400 条中:1,387 条 no_hallucination(57.8%)、1,013 条 hallucination(42.2%)。

数据字段

每个记录包含以下字段:

字段 类型 描述
id 字符串 唯一实例标识符(编码了主题,例如 islamicHallucination_498
question 字符串 阿拉伯语问题
generated_answer 字符串 被评估的模型生成的自由文本答案
gold_answer 字符串 经人工核实的参考答案
generator_model 字符串 生成 generated_answer 的模型
label 字符串 "hallucination""no_hallucination"
options 对象 六个候选答案,键为 "A""F",其中一个与 gold_answer 匹配
answer 字符串 正确选项的字母("A""F"

对于幻觉实例,大多数记录还额外包含:

字段 类型 描述
hallucinations 对象列表 每个错误片段对应一条记录,包含 span_startspan_end(在 generated_answer 中的字符偏移量)、hallucinated_span(错误文本)和 explanation(错误原因)

少量记录还带有可选元数据字段,仅部分实例存在:splithistorical_notequality_notedata_notetruncated。另外两个字段 level(难度标签)和 gold_match"exact""semantic")仅在暂未发布的 test 划分中填充,因此在当前 train+dev 发布中始终为空。

支持的任务

  1. 幻觉检测 — 二元分类,判断生成的答案是否可靠。
  2. 寻找真相 — 在六个多项选择候选中选出事实正确的选项(与检测结果无关)。
  3. (针对带有片段的子集)错误内容的片段级定位与解释

数据来源与生成

  • 所有生成的答案均来自同一个模型:Fanar-1-9B-Instruct,以隔离单一阿拉伯语生成器的错误特征,避免不同模型家族带来的混杂因素。
  • 数据重用基础 HalluTruthQA 语料的标注协议(领域专家标注、训练评审员独立验证、专家裁决分歧),未做修改。

附加资源

  • 共享任务页面:https://www.codabench.org/competitions/16390/
  • 基础基准、指南、生成/干扰项构建提示和评估脚本:https://gitlab.com/nlpresearcher/HalluTruthQA
搜集汇总
数据集介绍
HalluTruthQA-4K 数据集图片
构建方式
HalluTruthQA-4K数据集的构建遵循了一套严谨的多阶段流程,旨在确保数据的专业性与可靠性。首先,领域专家针对伊斯兰知识、历史、科学和地理四个知识密集型领域,手工编纂了4,000个阿拉伯语问答实例,并基于权威资料对参考答案进行了严格核验,剔除了含糊或多解的题目。随后,利用单一阿拉伯语中心的大语言模型Fanar-1-9B-Instruct在受控配置下生成自由格式的回答,以保证标注的一致性和可比性。对于每条生成答案,专家依据详细准则判定是否存在幻觉,并为幻觉回答标注字符级别的错误跨度、人类撰写的解释以及层级化的幻觉类型。同时构造了六个候选答案,包含一个正确选项和五个风格相近的干扰项,以避免通过表面线索解题。最后,经过独立验证、专家裁定和质量控制,形成了最终语料库。
特点
该数据集的核心特点在于其精细化的多层次标注体系,突破了传统二元标签的局限。4,000个实例中,1,643条为幻觉回答,2,357条为非幻觉回答,并包含1,843个错误跨度,平均每条含幻觉的回答有1.13个错误,且10.4%的回答包含多个独立错误。标注涵盖了从整体到局部的完整信息:二元幻觉标签、字符级精确错误定位、五类宏观幻觉类型及22类微观类型、人类撰写的错误解释,以及用于事实核验的六选一候选答案。这种对齐的标注结构使得在相同实例上能够同时进行响应级检测、跨度级定位、错误分类、解释生成和事实验证,为阿拉伯语大语言模型的事实可靠性提供了细粒度评估维度。
使用方法
HalluTruthQA-4K的用法灵活多样,旨在支持多项互补的阿拉伯语幻觉检测与事实核验任务。研究者可直接利用响应级标签进行幻觉检测的二元分类;通过字符偏移(span_start和span_end)开展精确的错误定位;利用宏微观类型标注进行层级化错误分类;结合人类撰写的解释评估模型生成解释的能力;以及使用六个候选答案检验模型能否独立于生成内容识别出正确事实。数据已划分为训练集(1,600条)、开发集(800条)和测试集(1,600条),其中测试集作为HalluScoring 2026共享任务Track 2的官方评测数据,各领域均衡分布,便于跨领域比较。该数据集公开于Hugging Face,可直接用于训练、评估和基准测试,促进阿拉伯语幻觉研究的可复现性。
背景与挑战
背景概述
大型语言模型虽能生成流畅的阿拉伯语回答,却常引入事实性错误,而现有阿拉伯语幻觉检测数据集多仅提供二元响应级标签,难以定位错误发生的具体位置、阐释错误成因及提供修正方案。为填补这一空缺,由西班牙巴斯克大学、卡塔尔哈马德·本·哈利法大学、阿尔及利亚比斯克拉大学及马来西亚吉兰丹大学的研究人员于2026年构建了HalluTruthQA-4K数据集。该数据集在原有2,400条样本的HalluTruthQA基准上扩展至4,000条阿拉伯语问答实例,涵盖伊斯兰知识、历史、科学和地理四个知识密集型领域。每条实例包含阿拉伯语问题、模型生成的回答、经过验证的参考答案、二元幻觉标签,以及由正确答案和五个干扰项组成的六项候选答案;幻觉回答还额外标注了字符级错误跨度、人工撰写的解释和层级化幻觉类型。该数据集为阿拉伯语大模型的幻觉检测、错误定位、解释生成、答案选择和事实核查提供了细粒度的评测资源,并被用作HalluScoring 2026共享任务第二轨的官方测试集,有力推动了阿拉伯语自然语言处理领域的事实可靠性研究。
当前挑战
该数据集面临的挑战体现在两个层面。在领域问题层面,阿拉伯语幻觉检测长期受限于资源匮乏,现有基准多为二元响应级标注,无法揭示错误的位置、性质与修正方向;且伊斯兰知识等领域的回答常需精确引用《古兰经》经文、圣训或学者观点,事实正确不仅取决于最终结论,更依赖于证据的忠实性,这对细粒度评测提出了更高要求。在构建过程层面,确保问题与参考答案的领域权威性需依赖多领域专家并查阅大量专属文献;使用单一模型(Fanar-1-9B-Instruct)在受控配置下生成回答,虽保证了一致性,却限制了模型多样性;人工构造五个语义相近的干扰项并要求与生成回答风格相似,以排除表面线索,同时需确保每个问题仅有唯一正确答案;此外,字符级错误跨度的标注需遵循“最小但完整”的原则,边界界定常存分歧,多错误需分别标注,且需通过独立验证与专家仲裁保证标注一致性,整个流程复杂度高、成本大。
常用场景
经典使用场景
HalluTruthQA-4K作为大规模细粒度阿拉伯语幻觉检测与事实核查基准,其经典使用场景集中于知识密集型问答系统的可靠性评估。研究者利用该语料库对大型语言模型在伊斯兰知识、历史、科学和地理四个领域生成的阿拉伯语回答进行系统评测,通过响应级幻觉标签、字符级错误跨度、人工解释及层次化错误类型,实现从整体判定到局部定位的精细分析。这一场景为阿拉伯语自然语言处理领域提供了标准化的评估范式,推动了幻觉检测任务从粗略分类向细粒度诊断的转变。
衍生相关工作
该数据集催生了多项衍生工作,包括基于其注释结构开发的幻觉检测新算法、定位与解释联合训练的模型,以及跨领域迁移研究。其层次化错误类型学启发了针对特定领域(如伊斯兰知识)的专用评估框架,而六选一事实验证形式则为多任务学习提供了数据基础。后续研究也探索了利用该语料库进行少样本提示优化和鲁棒性分析,推动了阿拉伯语幻觉研究向更精细、可操作的方向发展。
数据集最近研究
最新研究方向
在阿拉伯语大语言模型事实可靠性评估领域,HalluTruthQA-4K的发布标志着从粗粒度二元幻觉检测向细粒度多维度验证的范式转变。该数据集通过整合响应级标签、字符级错误跨度定位、层次化幻觉分类、人工解释及六选一事实验证,构建了覆盖伊斯兰知识、历史、科学和地理四大知识密集型领域的4,000条实例,为幻觉检测、错误定位、解释生成及事实恢复提供了统一评测框架。其作为HalluScoring 2026共享任务官方数据集,推动了跨系统可比评估,并促使研究关注模型在长尾知识、源引用准确性及多错误叠加场景下的表现,对提升阿拉伯语NLP系统的可解释性与可信度具有重要影响。
相关研究论文
  • 1
    HalluTruthQA-4K: A Fine-Grained Corpus and Annotation Process for Arabic Hallucination Detection and Truth Verification巴斯克大学; 哈马德·本·哈利法大学; 比斯克拉大学; 马来西亚吉兰丹大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务