遇见数据集

EnokiQA

收藏
Hugging Face2026-09-02 更新2026-09-03 收录
官方服务:

资源简介:

EnokiQA是一个用于长形式事实问答、事实性验证和幻觉检测研究的数据集。该数据集包含19,594个训练样本,每个样本包括一个长形式事实问题、由七个指令微调语言模型(Qwen2.5 7B/14B/32B Instruct、Qwen3 4B/8B、Llama 3.1 8B Instruct、Mixtral 8x7B Instruct)基于其参数知识生成的答案(无检索上下文),以及对应的Wikipedia证据(段落上下文和全文上下文)。此外,还提供了生成器元数据、Wikipedia文章流行度统计(页面浏览量均值、中位数、95分位数等)和流行度分类(低、中、高)。数据集覆盖2,226个独特的Wikipedia上下文,答案平均长度为5,525字符,全文上下文平均长度为13,034字符。该数据集适用于长形式问答、幻觉检测、事实性评估和基于证据的验证等任务,但注意本次发布仅为未标注训练集,且生成器表示不平衡,Wikipedia证据可能不完整或过时。

EnokiQA is a dataset for long-form factoid question answering, factuality verification, and hallucination detection research. It contains 19,594 training samples, each consisting of a long-form factoid question, answers generated by seven instruction-tuned language models (Qwen2.5 7B/14B/32B Instruct, Qwen3 4B/8B, Llama 3.1 8B Instruct, Mixtral 8x7B Instruct) based on their parametric knowledge (without retrieval context), and corresponding Wikipedia evidence (paragraph context and full-text context). Additionally, it provides generator metadata, Wikipedia article popularity statistics (mean, median, 95th percentile page views, etc.) and popularity classification (low, medium, high). The dataset covers 2,226 unique Wikipedia contexts, with an average answer length of 5,525 characters and an average full-text context length of 13,034 characters. It is suitable for tasks such as long-form QA, hallucination detection, factuality evaluation, and evidence-based verification. Note that this release is only an unlabeled training set, with imbalanced generator representation and potentially incomplete or outdated Wikipedia evidence.

提供机构:
s-nlp
创建时间:
2026-09-02
原始信息汇总

数据集概述:EnokiQA

EnokiQA 是一个用于研究长文本问答、事实性、幻觉检测和基于证据验证的英文数据集,包含 19,594 条未标注的训练样本。该数据集由七个语言模型基于参数化知识生成的“无上下文答案”及对应的维基百科证据组成。

核心特征

  • 语言:英语 (en)。
  • 许可证:CC BY-SA 4.0。
  • 任务类别
    • 问答 (question-answering)
    • 文本生成 (text-generation)
  • 相关标签:幻觉检测、事实性、长文本问答、维基百科、参数化知识等。
  • 数据规模10K < n < 100K(该版本包含约 1.96 万条训练样本)。
  • 数据划分:当前仅提供 train 分割(未标注)。

数据结构

每条数据包含一个问句、一个模型生成的无上下文答案、两级维基百科证据(段落级和全页级)、生成模型元数据以及文章流行度统计。

字段 类型 说明
id 字符串 稳定样本标识符
split 字符串 原始分割,此版本均为 train
title 字符串 维基百科文章标题
question 字符串 长文本事实性问题
answer 字符串 模型生成的答案(无检索上下文)
answer_model 字符串 生成模型的标识符
answer_length int32 答案长度(字符数)
paragraph_context 字符串 用于生成问题的维基百科段落
full_page_context 字符串 完整的维基百科文章文本
context_id 字符串 段落上下文的稳定哈希
wiki_url 字符串 维基百科文章 URL
wiki_pageid int64 维基百科页面 ID
wiki_categories 列表[字符串] 文章类别
wiki_qid 字符串 Wikidata QID
wiki_article_length int32 源报告的文章长度(字符数)
pv_mean float64 收集窗口内日均页面浏览量
pv_total int64 收集窗口内总浏览量
pv_p50 int64 日均浏览量中位数
pv_p95 int64 日均浏览量第 95 百分位数
popularity_tier 字符串 流行度分桶(低/中/高)

生成模型

答案由以下七个指令微调模型生成:

  • Qwen2.5 7B、14B、32B Instruct
  • Qwen3 4B、8B
  • Llama 3.1 8B Instruct
  • Mixtral 8x7B Instruct

数据集统计

统计项 训练集
样本总数 19,594
唯一维基百科上下文数 2,226
生成模型数量 7
平均答案长度(字符) 5,525
答案长度中位数(字符) 4,773
平均全页上下文长度(字符) 13,034

维基百科流行度分布

  • 低流行度(每日浏览量 < 100):11,423 条
  • 中流行度(每日浏览量 100–1,000):7,079 条
  • 高流行度(每日浏览量 > 1,000):1,092 条

使用说明与限制

  • 该版本仅包含未标注的训练数据,不含幻觉标签
  • 答案生成时不提供检索上下文,反映的是模型自身的参数化知识及模型特定偏差。
  • 维基百科证据可能不完整或存在时间滞后。
  • 在自然分布下,各生成模型的样本数量不平衡
  • full_page_context 字段可能较长,建议在仅需要问答对时使用流式加载列选择以节省资源。

代码与引用

  • 代码仓库:https://github.com/s-nlp/Enoki
  • 相关论文:https://arxiv.org/abs/2609.00581(Enoki: Efficient Multi-Level Hallucination Detection)
  • 原始发布(Harvard Dataverse):https://dataverse.harvard.edu/dataset.xhtml?persistentId=doi:10.7910/DVN/6TN4ZM
搜集汇总
数据集介绍
EnokiQA 数据集图片
构建方式
EnokiQA数据集的构建依托于一个全自动化的标注流程,旨在实现细粒度的幻觉检测。该流程首先将无上下文的生成答案切分为独立句子,继而借助GPT-OSS-120B模型采用增量式分解策略,从每个句子中抽取原子化的(主语,谓语,宾语)三元组。随后,通过跨度定位技术将三元组的宾语与生成答案中的字符位置对应,并将每个三元组言化为自然语言假设。最终,利用自然语言推理模型对该假设与检索到的维基百科证据进行蕴含关系判别,输出蕴含、中立和矛盾三类概率,并将幻觉概率hall_prob定义为中立与矛盾概率之和。该流程确保了从句子到三元组、再到验证标签的多层级标注一致性。
特点
EnokiQA数据集在长文本问答幻觉检测领域具有显著特色,其核心在于提供句子分组的三元组级标注,每个三元组关联了详尽的NLI概率及幻觉概率,支持阈值化判定。数据集涵盖近两千条验证与测试样本,总三元组数量接近五十万,平均每个答案包含约两百五十个三元组,规模适宜且粒度精细。其自动标注管线有效规避了人工成本,且随机均匀划分的验证集与测试集确保了评估的可靠性。然而,数据集的自动生成本质决定了其可能引入抽取或验证误差,且维基百科上下文的时空局限性也需使用者注意。
使用方法
EnokiQA数据集专为幻觉检测评估与阈值调优设计,使用便捷。研究者可通过HuggingFace的datasets库直接加载validation与test两个划分,无需下载训练数据。核心操作范例包括:采用hall_prob大于0.5的判定准则,遍历各句子的三元组列表,筛选并输出幻觉性三元组及其概率,从而直观分析模型生成的幻觉模式。此外,数据集支持流式加载,处理大规模数据时能有效节约内存。鉴于其标注源于自动化流程,使用时应留意潜在的错误标签,并结合具体应用场景进行合理的数据筛选与误差容错。
背景与挑战
背景概述
EnokiQA数据集由俄罗斯研究团队于2026年创建,核心成员包括Elisei Rykov、Timur Ionov等,隶属于S-NLP实验室,旨在解决长形式问答中细粒度幻觉检测的难题。该数据集包含约4000个标注样本,每个样本提供无上下文的大语言模型回答、维基百科验证上下文、句子级事实三元组及对应的NLI概率和幻觉概率,为自动评估模型事实性提供了高精度基准。其发布在HuggingFace和Harvard Dataverse上,配套论文《Enoki: Efficient Multi-Level Hallucination Detection》展示了多层级检测方法的有效性,对推动生成式AI的可信度研究具有重要意义。
当前挑战
领域挑战在于,长形式问答生成的回答包含大量陈述,传统整体性评估难以定位具体幻觉信息,亟需细粒度、主张级别的检测方法。构建挑战包括:三元组提取依赖GPT-OSS-120B自动生成,可能存在提取不完整或错误;跨度定位在复杂句式中易失败,影响对象映射准确性;NLI模型对维基百科上下文的推理受限于语境完整性和时效性,导致验证标签含噪声;此外,自动标注流程的误差传播及幻觉概率阈值的选择均需精细校准,以保证数据集的可靠性和实用性。
常用场景
经典使用场景
EnokiQA作为细粒度幻觉检测领域的基准数据集,其经典使用场景聚焦于长形式问答(LFQA)中模型生成答案的逐句、逐三元组的事实核查。研究者通常利用该数据集对大型语言模型输出的原子化事实单元(主体-谓词-客体三元组)进行幻觉概率评估,通过计算文稿蕴含、中立与矛盾的分布,实现对生成文本中虚假或未经验证信息的精准定位。这种细粒度的标注结构使得EnokiQA特别适用于训练和评测基于自然语言推理的幻觉检测模型,同时也为开放信息抽取任务提供了高质量的验证语料,推动了生成内容可信度评估从粗粒度文档级向细粒度语义级范式的转变。
实际应用
在实际应用层面,EnokiQA直接服务于需要高度事实准确性的生成式AI系统,例如智能问答助手、搜索引擎摘要生成、医疗或法律信息咨询等场景中对模型输出进行内容真实性审核与预警。开发者和部署方可以使用该数据集训练或微调幻觉检测模块,并将hall_prob阈值(如0.5)作为产品中自动过滤或高亮可疑陈述的决策依据。其紧凑的分割设计便于集成到持续集成/持续部署流水线中,实现对模型每一次版本更新的细粒度事实性回归测试。此外,维基百科证据的开放许可允许对应用进行合规扩展,促进了可在现实信息生态中运行的可靠问答服务的研发。
衍生相关工作
EnokiQA的发布催生了多项衍生研究工作。其一,基于该数据集的细粒度三元组结构化标注,研究者发展了面向开放信息抽取的闭式语义解析技术,优化了从长句生成原子事实的抽取算法。其二,其融合蕴含与矛盾概率的标注方式启发了对文本蕴含模型进行校准与置信度修正的工作,探索了多分类器融合在幻觉概率置信区间中的应用。其三,部分研究延伸该数据集,将其应用于无参考的生成质量评估、多跳推理中证据链的可验证性分析以及跨语言事实迁移测试。EnokiQA与Enoki代码库共同构成了可复现的基准,促进了LLM幻觉检测领域的标准化评测,推动了相关算法规格化的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务