遇见数据集

KRLabsOrg/lettucedetect-prose-hallucination

收藏
Hugging Face2026-06-01 更新2026-06-14 收录
官方服务:

资源简介:

LettuceDetect Prose Hallucination Dataset是一个针对散文上下文的令牌级幻觉标注数据集,基于两个公开的RAG幻觉资源(PsiloQA和RAGTruth)构建,并映射到一个统一的分类体系。该数据集是结构化上下文(代码、工具输出、文档)数据集的对应散文版本,共同支持跨模态训练单一检测器。PsiloQA来源包含自然产生的幻觉(由真实LLM在基于维基百科的问答中生成),涵盖14种语言;RAGTruth来源包含在LLM RAG答案(问答、摘要、数据到文本)上的标注,仅限英语。数据集总样本量为87,834,分为训练集(78,882样本,其中63,349个幻觉样本和15,533个干净样本)、验证集(3,355样本)和测试集(5,597样本)。幻觉分类包括三个顶级类别:矛盾(与上下文冲突)、无支持添加(添加上下文未陈述或暗示的声称)和伪造引用(引用上下文中不存在的命名元素),每个类别有子类型。数据格式为JSONL,包含提示、上下文、问题、答案、标签、分类、来源、语言等字段。

Token-level hallucination annotations on LLM answers grounded in prose context, drawn from two public RAG hallucination resources and mapped into one unified taxonomy. This is the prose counterpart to the structured-context (code, tool output, documents) collection — together they let a single detector be trained across modalities. Two sources sit side by side: PsiloQA (natural hallucinations from real LLMs answering Wikipedia-grounded questions, spanning 14 languages) and RAGTruth (annotations on LLM RAG answers for QA, summarization, data-to-text, in English). The dataset totals 87,834 samples, split into train (78,882 samples, with 63,349 hallucinated and 15,533 clean), validation (3,355 samples), and test (5,597 samples). Hallucination taxonomy includes three top-level categories: contradiction, unsupported_addition, and fabricated_reference, each with subtypes. Data is in JSONL format with fields like prompt, context, question, answer, labels, category, dataset, language, etc.

提供机构:
KRLabsOrg
搜集汇总
数据集介绍
KRLabsOrg/lettucedetect-prose-hallucination 数据集图片
构建方式
在检索增强生成(RAG)系统日益普及的背景下,幻觉检测成为保障大语言模型输出可信度的关键环节。该数据集巧妙融合了PsiloQA与RAGTruth两大公开RAG幻觉资源,前者提供了真实LLM在维基百科问答中自然产生的幻觉标注,后者则覆盖了问答、摘要及数据转文本等多种场景的标注结果。所有标注均被映射至LettuceDetect统一分类体系,涵盖矛盾、无依据添加及虚构引用三大类别及其子类,实现了跨模态的标注一致性。PsiloQA中自然产生的幻觉与非幻觉样本共同构成了多元语言(14种)的训练基础,而RAGTruth则贡献了丰富的英语标注。
特点
该数据集最显著的特点在于其真实性与多语言覆盖。PsiloQA来源的幻觉并非人工注入,而是模型在实际问答中自然生成,这为评估检测器在真实场景中的泛化能力提供了极具价值的检验基准。支持14种语言的特性使其成为当前覆盖语种最广的幻觉检测数据集之一。在87,834个样本中,约79.6%为幻觉样本,形成了平衡性良好的正负样本分布。统一分类体系的设计使得不同来源的标注能够无缝融合,既保留了原始标注的细粒度特征,又实现了跨数据集的兼容性,为训练鲁棒的多模态检测器奠定了基础。
使用方法
通过Hugging Face Datasets库即可便捷加载该数据集,以`load_dataset("KRLabsOrg/lettucedetect-prose-hallucination")`方式获取。每条样本包含完整的prompt输入、上下文片段、用户提问、LLM回答及JSON格式的幻觉标注信息。研究者可根据来源名称(dataset字段)或语言代码(language字段)灵活筛选子集。特别值得一提的是,`metadata`字段以JSON字符串形式存储了来源特定的溯源信息,需通过`json.loads`解析以获取标注模型的详细信息及幻觉状态。数据集已按标准划分方式拆分为训练(78,882条)、验证(3,355条)和测试(5,597条)三部分,其中验证集仅为PsiloQA来源,可直接用于模型评估与调优。
背景与挑战
背景概述
LettuceDetect Prose Hallucination数据集由Kovacs与Recski于2025年创建,隶属于KRLabsOrg机构,旨在解决检索增强生成(RAG)系统中大型语言模型(LLM)的幻觉检测问题。该数据集整合了PsiloQA与RAGTruth两个公开资源,覆盖14种语言,包含超过87,000条标注样本,其中约70,000条为幻觉样本,并以统一的分类体系对自然发生的幻觉进行细粒度标注。其核心研究问题在于构建跨模态、多语言的幻觉检测基准,推动LLM在真实场景下的可信度评估。该数据集通过提供自然而非合成的幻觉实例,显著提升了检测模型的泛化能力,对RAG领域的可靠性和安全性研究具有重要影响,成为多语言幻觉检测的重要基准资源。
当前挑战
该数据集面临的挑战主要来自三个方面:首先,RAG系统在实际应用中常因LLM生成与上下文不符的幻觉内容而导致信息失真,现有检测方法难以捕获自然发生的细微错误,尤其在不同语言和任务类型间表现不一致。其次,数据构建过程面临标注噪声问题,PsiloQA的幻觉类型由LLM自动推断而非人工标注,引入了类别标签的系统性偏差;RAGTruth的子类别源于粗粒度原生标签,精细程度有限。此外,跨语言数据集的语言分布不均,英语样本占主导,部分语言数据稀缺,限制了模型的普适性。如何在此噪声与不平衡条件下训练出鲁棒的检测器,是实现可靠幻觉检测的关键挑战。
常用场景
经典使用场景
LettuceDetect Prose Hallucination数据集为检索增强生成(RAG)系统中的幻觉检测任务提供了高质量的标注资源。该数据集的核心价值在于其统一的标注体系,将来自PsiloQA和RAGTruth两个来源的文本级幻觉片段映射至三种可注入类别:矛盾、无依据添加和虚假引用。研究者可以基于该数据训练标记级幻觉识别模型,在QA、摘要生成等任务中精准定位模型生成的错误信息。多语言覆盖范围则使其能够评估和提升跨语言RAG系统的可靠性。
衍生相关工作
该数据集直接支撑了LettuceDetect框架的构建,该框架提出了一种跨越文本代码与自然语言多种模态的幻觉检测方法。基于此数据集,学术界和工业界衍生了一系列相关工作,包括对多语言幻觉模式的深入分析、针对不同类别幻觉的细粒度检测策略研究,以及将检测结果与RAG管线的事后修正机制相结合的端到端研究。后续工作还探索了利用该数据集进行跨数据源迁移学习,使得单一模型能够适应不同标注协议的RAG数据源。
数据集最近研究
最新研究方向
在检索增强生成(RAG)系统日益成为大语言模型落地核心范式的背景下,幻觉检测作为保证生成内容可信度的关键瓶颈备受关注。该数据集通过整合PsiloQA与RAGTruth两大跨模态资源,构建了覆盖14种语言的统一幻觉标注体系,创新性地将自然发生的幻觉与人为注入的虚假信息分离标注,并基于LettuceDetect统一分类法对矛盾、无据添加及虚构引用进行细粒度划分。这一前沿设计直接回应了幻觉检测器在多语言、多任务场景下的泛化挑战,为从问答到摘要等实际RAG应用提供了更具生态效度的训练基准,其跨语言、跨来源的混合标注范式正在重塑幻觉检测领域从单一语料库研究向通用评估框架演进的路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务