遇见数据集

velvet-moon/HaluEval

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于幻觉检测的多任务数据集,包含对话、问答和摘要等配置。每个配置提供知识、用户查询、正确响应和幻觉响应等特征,旨在训练或评估模型在生成内容时识别和避免幻觉现象。数据集包括多个子集,如dialogue(对话)、qa(问答)和summarization(摘要),并提供了样本版本(samples)用于实验或演示。

This dataset is a multi-task dataset for hallucination detection, including configurations for dialogue, question answering, and summarization. Each configuration provides features such as knowledge, user queries, correct responses, and hallucinated responses, aiming to train or evaluate models in identifying and avoiding hallucination phenomena during content generation. The dataset includes multiple subsets like dialogue, qa, and summarization, with sample versions available for experimentation or demonstration.

提供机构:
velvet-moon
搜集汇总
数据集介绍
velvet-moon/HaluEval 数据集图片
构建方式
HaluEval数据集是专为评估和提升大语言模型幻觉检测能力而构建的基准资源。其构建过程覆盖了对话、问答、摘要及通用问答四大任务场景,每个场景均提供了包含幻觉标注的样本集与无标注的原始数据集。以对话子集为例,每条样本包含对话历史、背景知识、正确回应及刻意植入的幻觉回应,通过对比构建负样本;在样本数据中,则直接通过字符级标注字段明确标识幻觉出现的位置与内容。摘要任务中,同样采用人为构造的幻觉摘要与准确摘要形成对照。数据集总计包含约6.5万条训练与评估样本,其中幻觉数据通过专家设计规则与模型诱导生成,确保幻觉类型的多样性与真实性。
特点
该数据集最显著的特点在于其多层次、多任务的覆盖设计,为幻觉检测研究提供了丰富的实验场景。在任务维度上,统一整合了检索式对话、开放域问答、文本摘要与通用对话,涵盖语言模型应用中幻觉高发的核心领域。每个任务下又细分为两种配置:一种是包含正确与幻觉样本并存的标注集,用于训练检测模型;另一种则提供样本级回答与对应幻觉类型的四分类标注,便于细粒度分析。此外,数据集在通用场景中额外提供了幻觉跨度的序列标注,精确到每个幻觉词句的位置,为序列化抽取与原因分析提供了数据基础。总计八种配置的灵活组合,使得HaluEval能够胜任从宏观判断到微观定位的多层次研究需求。
使用方法
HaluEval数据集的使用极为便捷,通过HuggingFace Datasets库即可加载指定配置。用户可根据研究目标选择不同子集:加载'dialogue'、'qa'、'summarization'等配置可获取用于对比训练的完整数据,每条样本包含知识与正确、错误回答;加载其对应_samples版本则可获得已预标注的样本级数据,格式中包含'hallucination'字段直接指示回答是否含幻觉。在通用场景下,'general'配置提供'hallucination_spans'列表,可直接用于序列标注训练。所有数据均以Apache 2.0许可开源,研究者可直接用于模型微调、基准测试或消融实验,无需额外处理即可接入各类检测流水线。
背景与挑战
背景概述
HaluEval数据集诞生于大语言模型幻觉现象日益凸显的背景下,由相关研究机构于2022年创建,旨在系统性地评估和检测对话、问答及摘要生成等任务中模型产生的虚假或矛盾信息。该数据集通过构建包含对话、问答、摘要三个子任务的多样化样本,为幻觉检测研究提供了标准化基准,推动了可信人工智能的发展。其对自然语言处理领域产生了深远影响,成为衡量大语言模型可靠性的重要资源。
当前挑战
HaluEval所解决的核心领域挑战是大语言模型在自由生成文本时频繁出现事实性错误、逻辑矛盾或与上下文不符的幻觉现象,严重阻碍了模型在医疗、金融等高风险场景中的可靠应用。在构建过程中,研究者面临的主要挑战包括如何准确定义和分类多样化的幻觉类型,如何人工构建既逼真又具有代表性的大量负例样本,以及如何在对话、问答和摘要等不同任务间保持标注的一致性和公平性。
常用场景
经典使用场景
在大型语言模型(LLMs)的研究浪潮中,HaluEval作为首个专门用于幻觉检测与评估的综合性基准数据集,为学术界和工业界提供了一面精准的‘照妖镜’。该数据集围绕对话生成、问答系统、文本摘要及通用问答四大核心任务,精心构造了包含人类标注的真实与幻觉样本的二元对照数据。研究者可借助其丰富的子集,对模型生成的回复进行精确的幻觉识别与归因分析,从而系统性审视大模型在事实准确性、知识一致性方面的表现。HaluEval不仅服务于幻觉检测模型的训练与评测,还为探索幻觉产生的内在机制提供了标准化的实验平台,是推动大模型可信赖研究不可或缺的基石。
衍生相关工作
HaluEval的提出催生了一系列与之相关的高影响力研究工作。围绕该数据集,研究者开发了多种针对幻觉的检测方法,如基于不确定性估计的判别器、基于知识图谱的约束解码策略以及多任务学习框架,显著提升了幻觉识别的准确性。此外,HaluEval也启发了如HaluEval-Wild等扩展工作,将其框架迁移至更开放、动态的多轮对话与长文本场景。在对抗性检测方面,涌现了利用该数据集的对抗样本生成方法,用于评估和提升模型的鲁棒性。同时,以HaluEval为评估基准的工作深入探讨了指令微调、检索增强生成(RAG)等前沿技术对幻觉的缓解效果,形成了从数据构建、检测算法到缓解策略的完整研究链条,持续推动着大模型可信性研究的边界拓展。
数据集最近研究
最新研究方向
HaluEval作为首个面向大语言模型幻觉现象的系统性评测基准,当前的研究前沿聚焦于利用其多维度对话、问答与摘要生成数据,深入探究模型在知识检索、上下文依赖及事实一致性方面的脆弱性。伴随ChatGPT等生成式模型的广泛应用,该数据集成为检测和缓解事实性错误、逻辑跳跃及信息捏造等幻觉行为的核心工具,推动了可解释性检测器与鲁棒性训练方法的革新,对提升人机交互的信任度与安全性具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务