遇见数据集

KRLabsOrg/lettucedetect-code-hallucination

收藏
Hugging Face2026-06-11 更新2026-06-14 收录
官方服务:

资源简介:

该数据集名为LettuceDetect Grounded Hallucination Dataset,是一个用于幻觉检测的数据集,包含对基于结构化上下文的LLM响应的token级幻觉标注。数据来源于五个方面:源代码、开发者工具输出、学术论文、GitHub READMEs和Wikipedia。这是LettuceDetect数据收集的一部分。每个样本将一个基于上下文的LLM答案与正确或包含最小扰动、字符跨度标注的幻觉配对。所有跨度使用统一的分类法,因此来源共享一个标签空间,可以通过dataset/context_modality字段联合训练或过滤分开。

Token-level hallucination annotations on LLM responses grounded in structured context across five sources — source code, developer-tool output, academic papers, GitHub READMEs, and Wikipedia. Part of the LettuceDetect data collection. Every sample pairs a grounded context with an LLM answer that is either correct or contains a minimally perturbed, character-span-annotated hallucination. All spans use one unified taxonomy, so the sources share a single label space and can be trained jointly or filtered apart via the `dataset` / `context_modality` fields.

提供机构:
KRLabsOrg
搜集汇总
数据集介绍
KRLabsOrg/lettucedetect-code-hallucination 数据集图片
构建方式
该数据集致力于细粒度幻觉检测,其构建方式别具匠心。研究者基于五个迥异的来源——源代码、开发工具输出、学术论文、GitHub README 及维基百科——精心配对被结构化上下文支撑的 LLM 答案对。每个答案对中,正确响应与其包含最小化、精确字符级标注幻觉的扰动版本并置。通过为每个来源引入真实响应,再利用大型语言模型注入局部化的错误信息,从而生成精准的字符级跨度标注,避免了传统差异对齐方法的模糊性。数据集统一采用一套分类体系,使得各来源共享同一标签空间,便于联合训练或按来源与上下文模态进行筛选。
特点
该数据集最显著的特点在于其统一性与精细度。所有幻觉跨度均使用统一的分类法进行标注,涵盖矛盾、无依据添加和虚构引用三大顶级类别,并细分为数值、时间、实体等子类型,确保了跨不同来源的标签一致性。数据集平衡性极佳,训练、验证与测试集中幻觉样本与非幻觉样本各占一半,共包含超过七万四千个样本。尤其值得一提的是,代码来源的测试集经过了人工三级专家复核,包含边界收窄与幻觉无效样本的剔除,大幅提升了标注精度,而其余部分则通过自动化质量门控生成。
使用方法
使用者可通过 Hugging Face 的 datasets 库便捷加载,并利用源名称或上下文模态字段进行灵活筛选,例如仅选取代码来源或 Markdown 模态的数据。每个样本以 JSONL 格式呈现,包含完整的提示输入、上下文、问题、答案、精确的幻觉标注及丰富的元数据。检测模型可直接在此数据集上微调,或集成 LettuceDetect 框架进行推理。其中,代码来源的答案内引用了经过解析的仓库定义与第三方库签名,确保干净引用不被误判为虚构,为评估检索增强生成场景下的幻觉提供了坚实基准。
背景与挑战
背景概述
LettuceDetect 代码幻觉数据集(lettucedetect-code-hallucination)由 KRLabs 团队于 2025 年创建,旨在系统性地检测与结构化上下文紧密耦合的大语言模型(LLM)回复中的幻觉现象。该数据集源于对 SWE-bench 等代码修复基准、开发者工具输出、学术论文、GitHub 自述文档及维基百科等五类异构来源的深度整合,通过统一的细粒度标注分类体系(涵盖矛盾、无依据添加与虚构引用),为幻觉检测研究提供了标准化的评估框架。其核心贡献在于首次在 token 级别对齐了多种领域背景下的错误表征,推动了 RAG(检索增强生成)与代码智能领域的可靠性与可解释性研究。
当前挑战
该数据集面临的双重挑战源于领域问题的复杂性与构建过程的严谨性。就领域问题而言,LLM 在与结构化上下文(如代码仓库或工具输出)交互时,常产生看似合理但实际违背语境的事实性错误,这些错误难以被传统监督信号捕获,尤其在多源异构知识融合场景下,幻觉的识别需跨越语义矛盾、额外假设与虚构实体三类边界模糊的类别。在构建层面,确保精准的字符级标注需要应对源代码版本差异、第三方 API 解析的不完全性以及长文本截断导致的引用缺失,同时人工验证流程(如代码源测试集的三轮盲审)虽提升了质量,但高昂的专家标注成本与跨源一致性维护仍是规模化扩展的瓶颈。
常用场景
经典使用场景
在大语言模型与检索增强生成(RAG)技术深度融合的浪潮中,LettuceDetect作为一款细粒度幻觉检测数据集,其经典使用场景聚焦于二维标注范式:首先,针对代码生成任务(如SWE-bench中的缺陷修复场景),要求模型在完整的仓库上下文与第三方库签名环境中,精准识别回答中植入的错误实现、未请求变更或虚构API引用;其次,面向RAG管道的检索片段(涵盖学术论文、技术文档、维基百科等),模型需依据给定的检索段落和用户问题,定位回答中的数值矛盾、实体冲突及无根据主张等幻觉类型。该数据集通过字符级标注与统一分类体系,为幻觉检测研究提供了可跨源训练与评估的标准化基准。
衍生相关工作
该数据集的开源催生了一系列衍生研究方向:一方面,基于其提供的细粒度标注,研究者开发出LettuceDetect检测框架并发布配套的预训练模型(如lettucedetect-large-modernbert-en-v1),直接支持端到端幻觉跨度预测;另一方面,数据集的跨源特性激发了上下文消歧方法的创新,例如利用其代码源中的解析依赖图(通过import图解析的引用定义块)来区分真实引用与虚构标识符,这一思路已被后续工作用于构建更鲁棒的代码生成评估基准。此外,该数据集的ACL论文子集为学术RAG评估场景树立了标杆,衍生出针对文献摘要的数值一致性检查与引文验证等专项任务,推动了可解释幻觉检测模型的探索。
数据集最近研究
最新研究方向
当前,LettuceDetect 代码幻觉数据集正推动着检索增强生成(RAG)与代码生成领域中幻觉检测研究的前沿发展。其核心在于通过统一的细粒度标记分类法,涵盖矛盾、无根据添加和虚构引用等类别,精准标注结构化上下文(如源代码、工具输出、学术论文等)中模型生成的虚假信息。这一设计直接回应了大型语言模型在软件工程与知识密集型任务中的可靠性挑战,特别是与SWE-bench等真实开发场景的结合,使得研究者能够系统性地评估和缓解代码生成中的幻觉问题。该数据集的高质量人工校验测试集与多源数据,为构建更稳健的幻觉检测模型提供了关键基准,对提升AI在编程辅助、文档生成等实际应用中的可信度具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务