遇见数据集

LettuceDetect benchmark

收藏
arXiv2026-07-01 更新2026-07-03 收录
数据链接:
官方服务:

资源简介:

该数据集是由KR实验室等机构构建的统一基准,旨在评估检索增强生成(RAG)系统在结构化输入下的幻觉检测能力。数据集包含74,285个新构建的示例,涵盖代码、工具输出、结构化文档及自然语言RAG数据,具体来源包括SWE-bench代码、Squeez工具输出、ACL论文块、README文档和维基百科标记文本。数据集的创建过程采用基于编辑的标注方法,从正确的接地答案出发,注入局部幻觉并精确标注字符偏移,以确保标签质量。该数据集主要应用于代码代理、开发助手及文档系统等领域,旨在解决结构化上下文(如源代码、工具输出)中生成答案的幻觉检测问题,提升生成系统的可靠性和准确性。

This dataset is a unified benchmark constructed by institutions including KR Labs, aiming to evaluate the hallucination detection performance of retrieval-augmented generation (RAG) systems on structured inputs. It contains 74,285 newly constructed examples covering code, tool outputs, structured documents and natural language RAG data, with specific sources encompassing SWE-bench code, Squeez tool outputs, ACL paper chunks, README documents and Wikipedia tagged text. The dataset was developed using an edit-based annotation workflow: starting from correctly grounded reference answers, local hallucinations are injected, and character offsets are precisely labeled to ensure the quality of the annotation labels. This dataset is primarily deployed in scenarios including code agents, development assistants and documentation systems, with the objective of addressing hallucination detection issues for generated outputs within structured contexts (e.g., source code, tool outputs), and enhancing the reliability and accuracy of generative systems.

创建时间:
2026-07-01
搜集汇总
数据集介绍
LettuceDetect benchmark 数据集图片
构建方式
LettuceDetect benchmark的构建基于一个统一的编辑式标注流程,起始于正确生成且可被证据支持的答案。研究者通过注入局部性幻觉(如错误值、未支持的添加或虚构引用)并精确记录编辑产生的字符偏移,从而生成带有精确标注的样本。数据涵盖了五种新构建的来源,包括基于SWE-bench的代码、源自Squeez的工具输出、来自ACL-Verbatim的论文片段、GitHub仓库的README以及维基百科的Markdown文档,同时融入了RAGTruth和PsiloQA等现有自然语言RAG基准。为确保标签质量,模型辅助审查了代码测试集的所有样本,并通过仲裁验证了可疑案例,从而剔除了无效或伪影标签。
特点
该数据集的核心特点在于其多样性与统一性,首次将跨度级幻觉检测任务从自然语言文档拓展至代码片段、工具输出、结构化文档(如表格和Markdown)以及传统RAG文本。它包含74,285个新构建的样本,并添加了来自现有基准的转换数据,总训练样本达145,250个。数据集采用三种顶层幻觉类型(矛盾、未支持添加、虚构引用)及13种子类,以更细致地捕捉错误类型。编辑式注入确保了幻觉跨度定位的精确性,而代码来源中的参考接地机制(向上下文中添加被引用但未包含的代码定义及第三方API签名)使检测器能够区分真正的未支持内容与因上下文截断而看似未支持的正确引用。
使用方法
使用该数据集时,检测器需接收请求、上下文和已生成的答案作为输入,目标是预测答案中不被请求和上下文支持的字符跨度。每个样本的上下文中可能包含代码库快照、工具观察结果或结构化文档文本。数据集的划分依据来源(如仓库、论文、文章)严格分离训练、开发与测试集,以评估模型对未见来源的泛化能力。研究者可基于此训练生成式检测器(如微调Qwen3.5-2B,最高支持32,768个token)或编码器检测器(如mmBERT-base,最大序列长度8,192个token)。生成式检测器能同时输出幻觉的类别与子类别,实现精确定位与分类,评估时采用字符重叠度(span-F1)和示例级F1等指标,并能与RAGTruth等自然语言基准上的结果进行对比。
背景与挑战
背景概述
在检索增强生成(RAG)技术日益普及的背景下,幻觉检测已成为确保生成内容可靠性的关键环节。然而,现有基准与检测方法多局限于自然语言文档证据,忽视了现代接地生成系统日益依赖结构化输入的现实,例如源代码、开发工具输出、Markdown文档、表格及仓库元数据。为此,Ádám Kovács、Bowei He等来自KR Labs、MBZUAI、麦吉尔大学及维也纳工业大学的研究人员,于2026年创建了LettuceDetect统一基准。该基准旨在填补跨度级幻觉检测在代码、工具输出、结构化文档与自然语言RAG场景中的空白,通过从正确的接地答案出发注入局部幻觉并赋予精确字符标签,构建了超过7.4万个新样本。其核心研究问题在于:如何在一个统一的框架下,对跨越多种结构化来源的生成答案进行细粒度的跨度级验证。LettuceDetect基准的出现,为评估和推动跨模态、跨源头的生成内容可靠性研究提供了全新的标准化测试平台。
当前挑战
LettuceDetect基准面临的挑战是多维度的。首先,在领域问题层面,现有幻觉检测方法主要解决自然语言文档的文本级验证,而代码、工具输出和结构化文档中的幻觉更加隐蔽且后果严重,例如一个虚构的方法名或错误的值就可能改变程序行为。这些场景要求检测模型具备跨文件、跨模态的推理能力,理解仓库状态、API签名及上下文约束,而非简单的文本匹配。其次,在基准构建过程中,挑战同样显著:如何从正确的接地答案出发,精准注入局部化的幻觉并保持标签质量,同时避免生成过程引入的伪影。研究团队采用了编辑式标签生成策略,通过结构化替换而非文本差异来定位幻觉跨度,但约一半的尝试因非唯一原文、编辑过宽或虚假引用等问题被自动过滤,确保了标签的纯净度。此外,代码测试集的验证需经过模型辅助筛查与人工仲裁,在2038个样本中保留了2015个,涉及边界修正、无效跨度剔除及类别校正等精细操作,体现了构建高质量基准的严苛要求。
常用场景
经典使用场景
在检索增强生成(RAG)系统日益依赖结构化输入的时代,LettuceDetect benchmark 作为首个统一涵盖源代码、开发者工具输出、Markdown文档、表格及仓库元数据的跨度级幻觉检测基准,为跨模态生成内容的可信验证树立了新标杆。该基准通过从正确回答中注入小而精准的局部幻觉并标注精确字符偏移的方式构建,特别适用于评估生成式模型在代码代理、工具观察和结构化文档等复杂场景下的幻觉定位能力。其最经典的使用场景在于对代码补全、补丁摘要、工具输出总结等生成内容进行细粒度验证,而非简单的整体接受或拒绝。
衍生相关工作
LettuceDetect benchmark 的诞生直接催生了多类衍生工作。基于该基准训练的LettuceDetect-Qwen-2B生成式检测器采用LoRA微调Qwen3.5-2B,以32,768 token的上下文窗口统一处理多源输入,在代码代理、工具输出等困难源上显著超越LettuceDetect-large和最强零样本LLM评判者,同时在RAGTruth和PsiloQA等传统基准上保持竞争力。另一衍生模型LettuceDetect-mmBERT-base则以307M参数的mmBERT编码器为骨干,提供更轻量级的令牌分类方案。此外,该基准推动了类型化检测的研究,其三级分类体系(矛盾、无依据添加、虚假引用)及13个子类别为后续工作如RL4HS的强化学习优化和Mu-SHROOM的多语言评估提供了精细的标注框架和评测标尺。
数据集最近研究
最新研究方向
当前LettuceDetect benchmark的研究焦点在于构建跨越代码、工具输出、结构化文档及自然语言检索增强生成(RAG)的统一跨度级幻觉检测基准。前沿方向聚焦于将幻觉检测从传统文档证据扩展到编程代理场景中的源文件、git历史、测试输出等结构化输入,通过编辑式标注框架注入局部化幻觉并获取精确字符偏移,以此训练轻量级生成式检测器。该工作显著推动了代码代理幻觉检测的精细化评估,解决了现有基准在结构化、多模态生成验证中的空白,其意义在于为检索增强生成系统在复杂真实环境下的可信验证提供了可复现的评估范式与高性能基线模型。
相关研究论文
  • 1
    Beyond Document Grounding: Span-Level Hallucination Detection over Code, Tool Output, and DocumentsKR实验室; MBZUAI; 麦吉尔大学; 维也纳工业大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务