遇见数据集

HALO

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

该数据集是一个用于幻觉检测任务的中文数据集,专门设计用于识别和评估语言模型生成内容中的幻觉现象。数据集中每个样本包含一个提示词(prompt)、正确的参考回答(correct_response)以及包含幻觉的生成回答(hallucinated_response)。关键特征包括:幻觉文本段落的精确标注(hallucinated_spans),包含起始位置、结束位置和文本内容;支持幻觉判断的证据列表(evidence);样本类型分类(type);数据来源(source)和主题分类(topic)。数据集分为训练集(124,596个样本)和测试集(82个样本),总大小约409MB。该数据集适用于幻觉检测、文本生成质量评估、事实核查等自然语言处理任务的研究与模型训练。

This dataset is a Chinese dataset for hallucination detection tasks, specifically designed to identify and evaluate hallucination phenomena in content generated by language models. Each sample in the dataset includes a prompt, a correct reference response (correct_response), and a generated response containing hallucinations (hallucinated_response). Key features include precise annotation of hallucinated text spans (hallucinated_spans) with start positions, end positions, and text content; a list of evidence supporting hallucination judgments (evidence); sample type classification (type); data source (source) and topic classification (topic). The dataset is divided into a training set (124,596 samples) and a test set (82 samples), with a total size of approximately 409MB. It is suitable for research and model training in natural language processing tasks such as hallucination detection, text generation quality evaluation, and fact-checking.

创建时间:
2026-07-15
原始信息汇总

数据集概述:HALO

该数据集旨在研究大语言模型中的幻觉现象,包含高质量的问答对及相应的幻觉标注信息。

数据集结构

数据集包含以下字段:

  • prompt:用户输入的提示或问题。
  • correct_response:模型应生成的正确回答。
  • evidence:支撑正确回答的引用或证据,以字符串列表形式存在。
  • type:问答对的类型或分类标签。
  • hallucinated_response:模型生成的包含幻觉的回答。
  • hallucinated_spans:幻觉回答中具体的幻觉片段,每个片段包含:
    • start:幻觉片段在文本中的起始位置(int64)。
    • end:幻觉片段在文本中的结束位置(int64)。
    • text:幻觉片段的文本内容。
  • source:数据来源。
  • topic:问答对的主题。

数据划分与规模

数据集包含 traintest 两个划分:

划分 样本数 字节数
train 124,596 408,303,672
test 82 271,675
总计 124,678 408,575,347
  • 下载大小:334,830,899 字节
  • 数据集大小:408,575,347 字节

配置

数据集提供默认配置(default),数据文件路径为:

  • 训练集:data/train-*
  • 测试集:data/test-*
搜集汇总
数据集介绍
HALO 数据集图片
构建方式
HALO数据集是基于大语言模型在实际应用中产生的幻觉现象构建而成的专业性评估资源。其构建过程首先通过采集模型生成的响应文本,随后由人工标注者识别并标记其中与事实不符的幻觉片段,同时提供相应的正确修正响应及支撑证据。数据集包含了提示词、正确响应、证据、类型、幻觉响应、幻觉片段起止位置及文本、来源与主题等结构化字段,确保了数据标注的精细化与多维性。训练集与测试集分别包含124,596条和82条样本,共计约408MB的数据量,为幻觉检测与修正任务提供了充分的训练与测试基础。
特点
HALO数据集的核心特点在于其精细的标注粒度与多维度的信息整合能力。每个样本不仅记录了模型原始的幻觉响应,还精确标注了幻觉片段的起止位置与具体文本,便于进行细粒度错误定位。同时,数据集提供了对应的正确响应与支撑证据,使得研究者能够同时学习幻觉识别与纠正能力。数据来源广泛,覆盖多个主题领域,增强了模型的泛化性。这种结构化的标注方式显著区别于仅提供简单二元幻觉标签的数据集,为深入分析幻觉成因及改进模型行为提供了丰富信息。
使用方法
HALO数据集适用于幻觉检测与纠正模型的研究与评估。用户可将`prompt`作为输入,训练模型识别`hallucinated_response`中的幻觉片段,或生成本应输出的`correct_response`。`hallucinated_spans`字段可用于序列标注任务,训练模型准确预测幻觉起止位置;`evidence`字段则支持基于证据的生成或验证任务。数据集以标准HuggingFace格式存储,可直接通过`load_dataset`函数加载,支持`train`和`test`两个划分。研究人员可基于该数据集开发幻觉检测算法、评估语言模型的事实一致性,或作为数据增强资源改善模型输出的可靠性。
背景与挑战
背景概述
HALO数据集由相关研究机构于近年创建,旨在系统性地探究大语言模型(LLM)中的“幻觉”现象——即模型生成看似合理却与事实不符的内容。随着ChatGPT等LLM的广泛应用,幻觉问题成为制约其可靠性与安全性的核心瓶颈。该数据集通过精细设计正反样本对,涵盖多种对话场景与知识领域,为定量评估与归因分析提供了基准。HALO的发布推动了幻觉检测、溯源与缓解技术的研究,尤其在开放域问答和长文本生成中,为构建可信赖AI系统奠定了关键数据基础。
当前挑战
HALO数据集所应对的领域挑战在于:大语言模型在开放域任务中常偏离事实,产生表面流畅但实质错误的回答,严重阻碍其在医疗、法律等高可靠性场景的应用。构建挑战包括:如何从海量对话中精准标注出幻觉片段,平衡数据规模与标注一致性;区分因知识缺失导致的“真幻觉”与因局部上下文诱发的“伪幻觉”;以及确保覆盖多种幻觉类型(如事实错误、逻辑矛盾、实体混淆),以提升评价的全面性与鲁棒性。
常用场景
经典使用场景
HALO数据集作为一项专注于大语言模型(LLM)幻觉现象的前沿资源,其经典使用场景聚焦于模型的幻觉检测与校正。该数据集通过精心构建的“prompt-正确响应-完整证据链-幻觉响应-幻觉跨度标注”五元组结构,为研究者提供了微调与评估幻觉检测模型的基准。具体而言,研究人员可借助其高质量的人工标注幻觉跨度(hallucinated_spans)与关联证据(evidence),训练模型精准定位文本中不符合事实的生成片段,从而系统性地提升LLM在问答、摘要等开放式生成任务中的真实性与可靠性。
解决学术问题
HALO数据集的核心学术贡献在于直面大语言模型中普遍存在的“事实忠实度”瓶颈问题。传统模型常因训练语料噪声或生成机制缺陷,输出看似流畅却与事实相悖的内容,严重阻碍了其在知识密集型场景中的可信落地。该数据集通过提供12万余条细粒度标注的幻觉样本,首次将幻觉检测任务从粗粒度的二元分类推进至精确的跨度级定位阶段,为学术社区研究幻觉产生的深层诱因(如证据缺失、推理缺陷)提供了关键数据支撑,显著推动了可控文本生成与事实性评估方法的发展。
衍生相关工作
HALO数据集的发布催生了多条研究方向。在其基础之上,研究者相继提出了基于对比学习的幻觉检测框架,通过构造正反样本对(如正确响应与幻觉响应)增强模型对细微事实偏差的敏感度;也有工作借鉴检索增强生成(RAG)范式,将HALO中的证据链(evidence)作为外部知识源,设计了端到端的实时幻觉纠正流水线。更前沿的探索则利用该数据集的跨度标注结构,开展了面向多语言幻觉泛化能力的研究,验证了跨语言场景下事实一致性检测的迁移潜力,为构建全球通用的可信LLM生态奠定了实验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务