遇见数据集

WikiProfile

收藏
Hugging Face2026-06-19 更新2026-06-20 收录
官方服务:

资源简介:

WikiProfile是一个用于评估语言模型对事实性知识进行编码和回忆能力的基准数据集。它包含2,150个基于事实的命题,每个事实衍生出10个不同形式的问题,共计21,500个问题实例。每个事实均源自英文维基百科页面摘要(首段),并定义为主体和客体两个实体之间的命题关系(例如,“Oasis played their first gig at the Boardwalk club”中,主体是Oasis,客体是Boardwalk)。问题涵盖三种形式:文本补全(用于评估编码能力)、闭卷问答(用于评估回忆能力)和多项选择。数据集从2,125个维基百科页面中提取事实,覆盖了艺术、科学、人物、社会、日常生活、技术、历史、地理、哲学与宗教等9个主题类别和19种实体类型。数据集以单个CSV文件形式提供,包含2,150行(每个事实一行)和21列。列信息包括事实的唯一标识符、相关的维基百科页面元数据(如页面ID、标题、创建日期、类别、浏览量)、源文本摘要、主体和客体实体及其类型,以及针对该事实生成的各种问题格式和答案(如直接问题、自然语言重述问题、反向问题、多项选择选项和上下文问题)。数据集的创建采用了自动化生成(使用Gemini-2.5-Pro模型进行问题生成和实体标注)与多阶段验证(包括基于谷歌搜索的过滤和最终人工验证)相结合的流程。该数据集适用于语言模型的事实性知识探测、问答系统评估、知识检索能力分析等研究任务。

WikiProfile is a benchmark dataset for evaluating the ability of language models to encode and recall factual knowledge. It contains 2,150 fact-based propositions, each generating 10 different forms of questions, totaling 21,500 question instances. Each fact is derived from the summary (first paragraph) of an English Wikipedia page and defined as a propositional relation between a subject and an object entity (e.g., in Oasis played their first gig at the Boardwalk club, the subject is Oasis and the object is Boardwalk). The questions for each fact cover three formats: text completion (for assessing encoding ability), closed-book question answering (for assessing recall ability), and multiple choice. The facts in the dataset are extracted from 2,125 Wikipedia pages, covering 9 topical categories (such as art, science, people, society, daily life, technology, history, geography, philosophy and religion) and 19 entity types. The dataset is provided as a single CSV file with 2,150 rows (one per fact) and 21 columns. Column information includes a unique identifier for each fact, relevant Wikipedia page metadata (e.g., page ID, title, creation date, category, page views), source text summary, subject and object entities and their types, and various question formats and answers generated for the fact (such as direct questions, natural language paraphrased questions, reverse questions, multiple-choice options, and contextual questions). The dataset creation process combines automated generation (using the Gemini-2.5-Pro model for question generation and entity annotation) with multi-stage validation (including filtering based on Google searches and final human verification). This dataset is suitable for research tasks such as probing factual knowledge in language models, evaluating question-answering systems, and analyzing knowledge retrieval capabilities.

提供机构:
Google
创建时间:
2026-06-16
原始信息汇总

数据集概述:WikiProfile

WikiProfile 是一个用于评估语言模型事实知识编码与回忆能力的基准数据集。它包含 2,150 个事实,每个事实配有 10 个问题,总计 21,500 个问题实例

数据集详情

  • 数据集名称: WikiProfile
  • 格式: CSV
  • 大小: 约 5.22 MB
  • 许可证: CC-BY-SA 4.0(因使用了维基百科内容)
  • 关联论文: "Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality" (arXiv:2602.14080)

数据来源与构建

  • 源文本: 英文维基百科页面的首段(摘要)。
  • 流行度指标: 基于 Wikimedia Analytics 的页面浏览量(2023-2025年聚合数据)。
  • 生成流程: 使用 Gemini-2.5-Pro 自动生成问题、实体标注及多选干扰项,经过 Google Search 验证过滤,最后进行人工验证(移除少于 2% 的事实)。

数据集结构

数据集为单个 CSV 文件,每行代表一个事实,包含 21 列,涵盖不同的问题格式和元数据。

主要数据字段:

字段 类型 描述
fact_id string 唯一事实标识符
page_title string 维基百科页面标题
category string 主题类别(共9类:艺术、科学、人物、社会、日常生活、技术、历史、地理、哲学与宗教)
summary string 维基百科页面首段(事实来源文本)
subject / object string 事实中的主体与客体实体
subject_type / object_type string 实体类型(共19种,如人物、地点、日期等)
completion string 命题补全文本(用于编码任务)
direct / direct_natural string 直接问句(高字面/自然改写两种风格)
reverse / reverse_natural string 反向问句(主客体角色互换,高字面/自然改写两种风格)
direct_choices / reverse_choices string 四选一的多选题选项
contextual string 结合上下文的问题(用于编码上下文任务)

问题格式

每个事实的 10 个问题涵盖三种格式:

  1. 文本补全(编码): 根据上文预测客体。
  2. 闭卷问答(回忆): 包括直接提问、反向提问、自然改写提问。
  3. 多项选择: 共 4 个选项(含正确答案),用于直接和反向问题。

数据规模与来源覆盖

  • 事实数量: 2,150 个
  • 问题实例: 21,500 个
  • 维基百科页面: 2,125 个
  • 主题类别: 9 个
  • 实体类型: 19 种

许可证与引用

搜集汇总
数据集介绍
WikiProfile 数据集图片
构建方式
WikiProfile数据集的构建锚定于英文维基百科页面摘要,以事实性命题为基本单元,每个命题由主体与客体两个实体构成。借助Gemini-2.5-Pro大模型自动完成实体标注、问题生成及多项选择干扰项构造,随后经由Google搜索结果验证与人工审核双重过滤,最终剔除不足2%的候选事实,确保了数据的高质量与可靠性。数据集涵盖2,150个事实,分布于9大主题类别与19种实体类型,每个事实对应10个问题,总计21,500个问答实例,以CSV格式存储。
特点
该数据集的核心特色在于其精细化的“事实画像”能力,能够从编码与回忆两个维度评测语言模型对事实知识的掌握程度。每个事实配备了三种问题格式:文本补全、封闭式问答与多项选择,并进一步细化为直接提问、自然语言改写、主体客体互换等变体,从而系统性地剖析模型在不同提示形式下的知识检索瓶颈。同时,数据集整合了维基百科页面浏览量作为流行度指标,为分析知识暴露频率对模型表现的影响提供了独特视角。
使用方法
研究者可直接加载CSV文件,利用各列字段灵活设计评测任务。文本补全任务使用'completion'字段作为输入;封闭式问答可选用'direct'或'reverse'字段,并通过相应答案字段进行比对;多项选择任务则使用'_choices'列。通过联合分析不同问题格式下的模型表现,可以精准定位知识遗忘的来源——究竟是编码缺失还是回忆失败。数据集采用CC-BY-SA 4.0许可,使用时需合规引用本源与关联论文。
背景与挑战
背景概述
WikiProfile是由Nitay Calderon、Eyal Ben-David、Zorik Gekhman、Eran Ofek和Gal Yona等研究人员于2026年创建的事实知识基准数据集,旨在系统性地评估大型语言模型(LLMs)编码和回忆事实性知识的能力。该数据集基于2,125个英语维基百科页面的首段摘要,精心构建了2,150个事实,每个事实对应10个不同形式的问题,总计21,500个问答实例。WikiProfile的研究核心在于区分模型参数中是否编码了特定事实,以及在不同提问条件下(如措辞直白或自然、正向或反向提问、有无思考时间)能否成功调取该事实,从而深入剖析参数化知识回忆的瓶颈。该数据集的发布为事实性知识评估领域提供了细粒度的分析工具,对提升语言模型的可靠性和可解释性具有重要影响。
当前挑战
WikiProfile面对的领域挑战在于,现有基准多从整体准确率评估模型的事实性知识,难以揭示模型是“未存储”事实(编码失败)还是“无法调取”事实(回忆失败)。为此,该数据集通过设计多样化的提问格式(如补全、直接问答、多项选择)来分离编码与回忆能力,以精准定位语言模型在事实知识上的薄弱环节。在构建过程中,团队面临自动生成高质量问题和干扰项的挑战,采用Gemini-2.5-Pro进行初始生成,并结合Google搜索验证与人工审核的严格过滤流程,最终仅移除不足2%的候选事实,确保了数据集的高保真度。此外,涵盖9个主题类别和19种实体类型的多样化知识范围,也要求在平衡数据分布时维持充分的覆盖性和代表性。
常用场景
经典使用场景
WikiProfile旨在评测大语言模型对实体间事实性知识的编码与回忆能力。其经典使用场景为事实知识的多维度剖面分析:研究者通过文本补全、闭卷问答与多项选择三种任务格式,分别评估模型在参数中是否存储了某个事实(编码)、能否在不受提示干扰下主动产出该知识(回忆),以及是否具备在不同问题表述下的鲁棒检索能力。这种设计使WikiProfile成为分离知识存储与知识检索瓶颈的标准工具,尤其适合探究模型在描述型事实、反向逻辑推理以及自然语言干扰下的知识利用表现。
衍生相关工作
围绕WikiProfile衍生出一系列探索语言模型事实记忆机制的研究工作。经典成果包括将该数据集用于对比不同规模、不同训练方式下的模型在事实回忆表现上的差异,实证发现扩展模型参数规模主要改善的是编码能力,而回忆瓶颈则与训练数据中事实的分布频率高度相关。另一类工作则基于该数据集设计了针对性的事实增强策略,如通过构建反向问题监督来强化实体关联表征,或利用多轮回答置信度校准提升知识调取的鲁棒性,这些研究共同推进了可解释事实性推理的发展。
数据集最近研究
最新研究方向
WikiProfile聚焦于大型语言模型参数化事实性知识的能力评估,尤其在当前大模型广泛应用却频现‘幻觉’现象的背景下,该数据集通过精细的事实级探究,揭示了模型在编码与回忆事实性知识时的瓶颈。其独到之处在于将事实提取自维基百科摘要,并设计了文本补全、闭卷问答与多项选择三种任务格式,覆盖九大主题类别与十九种实体类型,为理解模型参数中知识存储与检索的分离现象提供了量化工具。最新研究依托该数据集指出,尽管模型能编码事实,但语言变体、问题反转等条件下回忆能力显著受限,这一发现对提升大模型在知识密集型任务中的可靠性具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务