kg-hallu-eval
收藏资源简介:
该数据集名为kg-hallu-eval,由KnowledgeVerse AI和eCampus大学联合创建,专注于大语言模型幻觉自检测研究。数据集包含500余条经过人工标注的样本,涵盖现实场景中的受控幻觉案例和真实模型生成内容,数据来源包括人工构造的典型幻觉样本及GPT-4o等模型的原始输出。创建过程通过专家团队对多轮模型响应进行事实核查和标注,确保数据质量。该数据集旨在解决大语言模型在关键应用中产生虚假陈述的问题,为幻觉检测算法提供标准化评估基准,推动可信AI系统的发展。
The dataset named kg-hallu-eval was jointly created by KnowledgeVerse AI and eCampus University, focusing on the research of hallucination self-detection for large language models (LLMs). It contains over 500 manually annotated samples, covering controlled hallucination cases in real-world scenarios and authentic model-generated content. The data sources include both typical manually constructed hallucination samples and raw outputs from models such as GPT-4o. During the dataset development, an expert team conducted fact-checking and annotation on multi-round model responses to ensure high data quality. This dataset aims to address the problem of false statements generated by large language models in critical applications, providing a standardized evaluation benchmark for hallucination detection algorithms and promoting the development of trustworthy AI systems.
数据集概述
数据集来源
- 数据集详情页面地址:https://github.com/knowledge-verse-ai/kg-hallu-eval
- 所有数据集均位于代码库的
data文件夹中。
包含的数据集
1. SimpleQA
- 描述:SimpleQA 是由 OpenAI 提供的事实性基准测试,用于评估语言模型回答简短事实性问题的能力。它包含来自多个领域的 4.3k 个问题-答案对。
- 处理方式:遵循基准测试协议,将样本分类为准确或不准确。由于 SimpleQA 中包含的正确模型答案相对较少,通过选择等量的正确和错误样本来平衡数据集。
- 最终规模:
- GPT-4o:1,550 个句子。
- Gemini-2.5-Flash:990 个句子。
2. WikiBio GPT-4o
- 描述:这是一个手动策划的 WikiBio GPT-4o 幻觉检测基准数据集,旨在解决现有资源的局限性。许多现有数据集要么缺乏真实的 LLM 生成输出,要么存在类别不平衡问题(例如 WikiBio GPT-3 依赖较旧模型且幻觉示例过多)。
- 内容:包含 501 个精心策划的句子,源自真实的 GPT-4o 输出,并在准确和幻觉示例之间保持平衡。
- 用途:支持对单样本和多样本幻觉检测方法进行稳健评估。
数据集关联方法
数据集用于评估三种核心幻觉自检测方法,每种方法均包含基于文本和**基于知识图谱(KG)**的变体。
单样本方法
分析模型的一次响应以检测幻觉,产生一个介于 0 和 1 之间的分数,较低的值表示幻觉可能性较高。
-
自提问(Self-Questioning)
- 文本变体:模型被提示生成关于其自身响应的验证问题,回答它们,并评估一致性。
- 知识图谱变体:将响应转换为事实知识图谱。模型为每个事实单独生成验证问题并评估一致性。最终的幻觉分数是所有三元组的平均值。
-
自信度(Self-Confidence)
- 文本变体:模型被提示为其响应提供一个 [0,1] 范围内的置信度分数。
- 知识图谱变体:将响应分解为知识图谱。模型为每个事实提供置信度分数,整体分数是所有三元组的平均值。
多样本方法
从同一提示生成多个响应并比较它们的一致性,基于幻觉不太可能完全重复出现的原理。
- SelfCheckGPT
- 文本变体:使用语义相似度(BERTScore)将模型的输出与多个随机样本进行比较。
- 知识图谱变体:将所有响应转换为知识图谱。计算原始图中每个三元组与每个采样图中最相似三元组之间的事实级相似度。分数在所有三元组上平均,以提供事实级 BERTScore。




