遇见数据集

Feudor2/bert_hallucination_detection_complete

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含用于自然语言处理任务的数据,主要特征包括查询ID、查询文本、模型输出、人工标注的答案(包含文本片段、标签、起止位置等详细信息)、过滤后的文档、提示文本以及编码后的输入ID和注意力掩码。数据划分为训练集(3918个样本)、验证集(485个样本)和测试集(490个样本),适用于问答、文本生成或标注模型的训练与评估。

This dataset contains data for natural language processing tasks, with key features including query ID, query text, model output, human-annotated answers (with detailed information such as text spans, labels, start and end positions), filtered documents, prompt text, and encoded input IDs and attention masks. It is split into training (3918 examples), validation (485 examples), and test (490 examples) sets, suitable for training and evaluating question answering, text generation, or annotation models.

提供机构:
Feudor2
搜集汇总
数据集介绍
Feudor2/bert_hallucination_detection_complete 数据集图片
构建方式
本数据集名为bert_hallucination_detection_complete,旨在服务于大语言模型生成内容中幻觉现象的检测任务。其构建基于对查询-模型输出对的精细标注,每条样本包含原始查询、模型输出、检索文档及人工标注的幻觉片段。标注信息以结构化形式存储,涵盖幻觉片段的起始位置、跨度、文本内容及类型标签,并额外提供模型输入的token化序列与注意力掩码。数据集共包含4893条样本,按8:1:1的比例划分为训练集、验证集与测试集,分别包含3918、485和490条实例,确保了模型训练与评估的均衡性。
特点
该数据集的核心特征在于其对幻觉现象的细粒度标注体系。每条记录不仅标注了幻觉段落在输出中的精确位置与文本跨度,还通过“type”字段区分幻觉的具体类型,如事实错误、虚构实体或逻辑矛盾。此外,数据集保留了完整的检索文档与提示信息,便于溯源分析幻觉的产生根源。token化后的输入序列与注意力掩码直接可用,降低了数据预处理成本。数据规模适中,三份划分充分支持模型训练、验证与性能评测的完整流程。
使用方法
使用者可直接加载数据集的训练、验证与测试分片,利用预先提供的input_ids和attention_mask快速生成模型输入。通过解析answer字段中的标注信息,可构建token级或span级的幻觉检测目标。推荐采用基于BERT的序列标注模型进行微调,以识别输出中的幻觉片段。数据集支持多类型标签的分类任务,亦可作为检索增强生成(RAG)系统中幻觉评估的基准。验证集与测试集的独立划分便于进行超参数调整与模型泛化能力的客观评估。
背景与挑战
背景概述
在大语言模型日益普及的当下,幻觉问题——模型生成与事实不符或缺乏依据的内容——已成为制约其可信度与实用性的核心瓶颈。为系统性地探究与缓解这一顽疾,bert_hallucination_detection_complete 数据集应运而生。该数据集由相关研究团队精心构建,聚焦于基于BERT的幻觉检测任务,提供了涵盖训练、验证与测试的完备样本集(共计4893条)。通过对查询、模型输出、文档片段及细粒度幻觉标签(包含位置、类型与文本跨度)的精细标注,该数据集为评估与训练幻觉检测模型奠定了坚实基础,在自然语言处理领域的可信赖人工智能研究方面具有重要影响力。
当前挑战
该数据集所应对的领域挑战在于:大语言模型生成的文本中充斥着难以自动识别且形式多样的幻觉,包括事实性错误、逻辑矛盾以及凭空捏造的细节,传统评估方法难以高效捕捉。构建过程中面临的挑战则源于:需要从真实查询与模型输出中精确标注多类幻觉(如具体位置、边界与类型),这要求标注者具备极高的语言学与领域知识;同时需平衡样本多样性(涵盖不同长度、复杂度与风格)与标注一致性,避免因歧义而引入噪声。此外,如何设计能够泛化至未见过的模型与领域的检测特征,也是数据集建设中的一大难点。
常用场景
经典使用场景
在大规模语言模型蓬勃发展的当下,幻觉现象已成为制约其可信赖性的核心瓶颈。bert_hallucination_detection_complete数据集专为检测模型生成内容中的事实性错误而生,其经典使用场景聚焦于训练和评估基于BERT架构的幻觉检测器。通过为每个查询提供模型输出、标注的幻觉标签(涵盖实体错误、矛盾陈述及无根据编造)以及对应的上下文文档,研究者可利用该数据集构建精细的序列标注或分类模型,精准定位输出文本中的幻觉片段。这一场景为自动识别语言模型编造内容提供了标准化的实验平台,成为当前幻觉量化研究不可或缺的基石。
衍生相关工作
以此数据集为基础,研究者已衍生出一系列经典后续工作。最具代表性的包括面向跨模型和跨领域的幻觉检测迁移学习框架,通过本数据预训练检测器再微调至多领域,显著提升泛化性能。此外,融合检索增强的幻觉修正模型应运而生,将检测结果作为信号驱动对抗生成样本的抑制。部分工作还探索了基于对抗训练的对抗性检测范式,利用该数据构造对抗样例增强检测鲁棒性。最新方向则聚焦于基于该数据训练的检测器与大模型对齐技术结合,为RLHF流程提供自动化幻觉评估信号,形成从检测到优化的闭环。
数据集最近研究
最新研究方向
在大型语言模型(LLM)快速迭代的浪潮中,幻觉现象——即模型生成与事实或输入上下文相悖的内容——已成为制约其可靠部署的核心瓶颈。bert_hallucination_detection_complete数据集应运而生,它聚焦于基于BERT架构的幻觉检测任务,通过精细标注查询、模型输出、答案片段及标签类型,为研究LLM在开放域问答或文本生成中的事实一致性提供了标准化训练与评估基准。该数据集的前沿研究紧贴“可信AI”热点,推动从简单的幻觉识别向细粒度原因分析(如上下文扭曲、知识记忆错误)演进,其意义在于助力开发更鲁棒的检测器,进而提升LLM在医疗、法律等高敏感场景中的可信度,也为构建无幻觉的下一代对话系统铺平了道路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务