遇见数据集

KRLabsOrg/lettucedetect-code-thinking-test

收藏
Hugging Face2026-06-02 更新2026-06-14 收录
官方服务:

资源简介:

LettuceDetect代码幻觉检测——思考模式测试集是一个小型的保留测试集,专门用于代码生成中的幻觉检测。该数据集基于SWE-bench衍生,通过推理(思考)模型生成,在已知正确答案中注入一个或多个基于上下文的幻觉。每个样本保留了模型的完整推理轨迹,以便审核注入过程。这是一个评估和质量审查集,与主数据集不同,采用了改进的注入方法:包括自标记错误类型(如结构错误、行为矛盾、语义添加)、确保幻觉基于上下文且真正错误(禁止无效或等价编辑)、最小化跨度以及总是注入策略(当无矛盾时提供伪造引用或不支持添加)。数据集包含50个实例,其中46个包含幻觉,共106个跨度(矛盾59个、伪造引用27个、不支持添加20个)。

LettuceDetect Code Hallucination — Thinking-Mode Test Set is a small held-out set of code hallucination-detection samples derived from SWE-bench, generated with a reasoning (thinking) model that injects one or more grounded hallucinations into a known-correct answer. Each sample keeps the models full reasoning trace for auditing the injection. This is an evaluation/quality-review set distinct from the main dataset, featuring an improved injection procedure: self-labeled error types (e.g., structural, behavioral, semantic), grounded and genuinely wrong hallucinations (disallowing no-op or equivalent edits), minimal spans, and an always-inject policy. It includes 50 instances, with 46 containing hallucinations and 106 spans (59 contradictions, 27 fabricated references, 20 unsupported additions).

提供机构:
KRLabsOrg
搜集汇总
数据集介绍
KRLabsOrg/lettucedetect-code-thinking-test 数据集图片
构建方式
该数据集源自于SWE-bench基准,通过采用具备推理能力的语言模型,在已知正确代码答案中精准注入一个或多个基于上下文的幻觉内容而构建。在生成过程中,模型不仅输出带有错误的回答,还保留了完整的推理痕迹,使得对注入操作的审计成为可能。与主数据集不同,本测试集采用了改进的注入流程:模型能够自主选择并标记每次编辑的错误类型,包括结构性的虚构引用、行为性的矛盾以及语义性的无依据添加。注入的编辑内容必须能够从提供的上下文或请求中检测,且严格禁止无操作或等效的代码修改,确保每个错误都是真实可感知的。此外,在无法添加矛盾时,始终会注入虚构引用或无依据添加,以维持样本的多样性。
特点
本数据集专为代码幻觉检测的评估与质量审查而设计,包含50个实例,其中46个存在幻觉,总计106个标注片段(包括59个矛盾、27个虚构引用和20个无依据添加)。每个样本均提供完整字段,包括模型输入提示、上下文源文件、问题、含幻觉的回答、详细的黄金标注(涵盖起始位置、结束位置、标签、类别、子类别及解释),以及模型注入时的思考链。标注中的flags字段虽提供粗略的自动分诊提示,但并非真实标注,且对局部变量的误报率较高,所有跨度标签仍需人工核查。这一特点使得该数据集成为评估与改进代码幻觉检测算法的理想测试平台。
使用方法
该数据集适用于token-level的分类任务,可直接用于训练和评估代码幻觉检测模型。用户可通过HuggingFace Datasets库加载数据集,利用其中的prompt、answer和labels字段构建输入-标注对。labels字段中的start和end信息可直接用于序列标注任务的损失计算。对于需要利用推理轨迹的任务,reasoning字段提供了模型注入幻觉时的完整思考链,可用于分析幻觉产生机制或训练可解释的检测模型。由于数据集规模较小(n<1K),适合作为微调后的验证集或小样本学习基准,需注意flags字段的非真实属性,并建议在应用前对跨度标签进行人工复核。
背景与挑战
背景概述
在代码生成与推理任务中,大语言模型的幻觉问题(hallucination)严重制约着其在软件开发等关键领域的应用可靠性。LettuceDetect Code Hallucination — Thinking-Mode Test Set 是由 Ádám Kovács 与 Gábor Recski 于2025年创建的小规模测试集,源自 SWE-bench 基准,旨在评估基于推理(thinking)模型生成代码时的幻觉检测能力。该数据集通过注入三类 grounded 幻觉(结构层面的虚构引用、行为层面的矛盾、语义层面的无依据添加),并保留完整的推理追踪以支持审计,为幻觉检测研究提供了细粒度的标注与可验证的样本。其发布对提升代码生成系统的可信度具有里程碑意义,推动了幻觉检测从粗粒度判断向可解释、可定位的方向演进。
当前挑战
该数据集直面两大核心挑战。其一,领域问题层面,代码生成中的幻觉难以被精准识别与分类,尤其是 grounded 幻觉虽基于上下文却实质错误,传统检测方法常将等价变换(如数值格式差异)或合法代码误判为错误,而真正有害的虚构引用、逻辑矛盾等则容易被忽视,亟需一套能区分真实错误与无害变异的标注体系。其二,构建过程中,如何确保注入的幻觉“既 grounded 又 genuinely wrong”是一大难题,需要模型在推理过程中自主选择并标注错误类型(structural/behavioral/semantic),同时施加“always-inject”策略以强制生成可用样本;此外,最小化标注跨度与避免对局部变量过度标记(即 flags 字段的误报)也构成了数据质量控制的艰巨挑战。
常用场景
经典使用场景
该数据集专为检测大语言模型在代码生成任务中的幻觉现象而设计,尤其聚焦于具备思维链推理能力的模型。通过保留完整的推理痕迹,研究者能够精确追溯模型在已知正确答案中注入虚假信息的过程,从而评估和校准模型的可靠性。其经典使用场景包括对比不同推理模型在代码生成时的幻觉注入模式,以及验证新型幻觉检测算法的有效性。
解决学术问题
代码生成模型常因生成看似合理但实际错误的代码而影响应用可信度,传统检测方法难以捕捉与上下文矛盾、无依据添加或结构错误等细微幻觉。该数据集通过引入自标注错误类型和最小化篡改跨度策略,系统性解决了幻觉标注不精确、人为判断主观性强的学术难题,为评估模型在复杂推理任务中的真实性提供了标准化基准,推动了代码幻觉检测研究的严谨性。
衍生相关工作
围绕该数据集已衍生出LettuceDetect框架,其核心论文提出了针对RAG应用中的幻觉检测方案,推动了代码生成领域质量评估方法论的发展。未来可能催生更多基于推理轨迹的幻觉定位工具,以及针对不同编程语言和任务类型的扩展数据集,促进领域内从被动检测转向主动防御的研究范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务