遇见数据集

WikiFactDiff

收藏
arXiv2024-03-21 更新2024-07-23 收录
官方服务:

资源简介:

WikiFactDiff是由法国国家科学研究中心创建的一个大型数据集,用于研究因果语言模型中的原子事实知识更新。该数据集包含327,000条更新,描述了两个日期之间事实知识的演变,分为新、过时和静态三类。数据集通过比较2021年1月4日和2023年2月27日的Wikidata知识库状态构建。WikiFactDiff旨在解决语言模型中事实更新的问题,通过提供多种更新场景,包括替换、存档和新实体插入等,以增强模型的实用性和相关性。

WikiFactDiff is a large-scale dataset developed by the French National Centre for Scientific Research (CNRS) for researching atomic factual knowledge updates in causal language models. This dataset contains 327,000 updates that depict the evolution of factual knowledge between two dates, and is divided into three categories: new, obsolete, and static. It is constructed by comparing the states of the Wikidata knowledge base on January 4, 2021, and February 27, 2023. WikiFactDiff aims to address the challenges of factual updating in language models, by providing a variety of update scenarios including replacement, archiving, and new entity insertion to enhance the practicality and relevance of such models.

创建时间:
2024-03-21
原始信息汇总

WikiFactDiff 数据集概述

数据集描述

WikiFactDiff 是一个描述两个日期之间事实变化的数据集,分为过时静态三类。事实以主语-关系-对象三元组的形式表示,并通过比较两个时间点 $T_{old}$ 和 $T_{new}$ 的 Wikidata 知识库状态构建。该数据集包含用于更新算法和评估的口头化模板和完形填空测试。

数据集特征

  • 语言:英语
  • 许可:CC BY-SA 4.0

数据集结构

WikiFactDiff 包含一系列更新记录,每个元素包含以下字段:

  • "subject" (字典)
    • "id":主语 Wikidata ID (字符串)
    • "label":主语 Wikidata 标签 (字符串)
    • "description":主语 Wikidata 描述 (字符串)
  • "subject_is_ph_new":主语是新实体,即在 $T_{old}$ 不存在但在 $T_{new}$ 存在的实体 (布尔值)
  • "subject_popularity":主语流行度度量 (浮点数)
  • "relation" (字典)
    • "id":关系 Wikidata ID (字符串)
    • "label":关系 Wikidata 标签 (字符串)
    • "description":关系 Wikidata 描述 (字符串)
  • "relation_is_temp_func":关系是时间功能性的 (布尔值)
  • "is_replace":更新代表替换,例如替换英国首相 (布尔值)
  • "objects" (列表):每个字典包含以下字段:
    • "id":对象 Wikidata ID 或 None(如果是文字)(字符串)
    • "label":对象 Wikidata 标签 (字符串)
    • "description":对象 Wikidata 描述 (字符串)
    • "decision":可以是 newobsoletestatic,取决于对象的真实性 (字符串)
  • "update_prompt":提供给更新算法的完形填空测试 (字符串)
  • "generalization_prompts":用于评估更新泛化性的完形填空测试
  • "neighborhood" (列表):邻近组(事实)列表,用于评估潜在的溢出效应。每个字典包含以下字段:
    • "subject" (字典):
      • "id":邻近主语 Wikidata ID (字符串)
      • "label":邻近主语 Wikidata 标签 (字符串)
      • "description":邻近主语 Wikidata 描述 (字符串)
    • "dist":两个实体之间的距离 (浮点数)
    • "objects" (列表):每个字典包含以下字段:
      • "id":对象 Wikidata ID 或 None(如果是文字)(字符串)
      • "label":对象 Wikidata 标签 (字符串)
      • "description":对象 Wikidata 描述 (字符串)
      • "prompt":用于验证语言模型对该邻近三元组知识的完形填空测试 (字符串)

数据集创建

源数据

  • 三元组格式的事实从 Wikidata 收集。
  • 用于口头化这些三元组的模板使用后处理的 ChatGPT 口头化创建。

数据收集和处理

  1. 在 $T_{old}$ 和 $T_{new}$ 分别收集 Wikidata 的两个实例。
  2. 这些实例经过预处理以过滤无关数据,并进行比较以获取它们之间的差异。
  3. 差异中的每个相关三元组被标记为 newstaticobsolete
  4. 这些三元组被口头化,并为每个三元组收集一组邻近事实。
搜集汇总
数据集介绍
WikiFactDiff 数据集图片
构建方式
在自然语言处理领域,大型语言模型的事实知识会随时间推移而逐渐过时,因此知识更新任务应运而生。WikiFactDiff数据集的构建基于对Wikidata知识库在两个时间节点——2021年1月4日与2023年2月27日——的快照进行系统性对比。首先,对原始三元组进行清洗与过滤,剔除元数据、废弃条目及不可利用的实体与对象值。随后,通过计算新旧快照之间的差异,将三元组划分为仅存在于旧库、仅存在于新库及两者共存三类。接着,利用手工设计的分类规则,依据时间限定词与实体属性,为每个三元组标注为“新”、“过时”或“静态”,从而精准刻画事实的演变状态。最后,为每个三元组生成自然语言表述的更新句子与完形填空测试,并借助TF-IDF向量相似度检索邻近事实,以支持后续的算法评估。
特点
WikiFactDiff数据集的核心特点在于其真实性与时间适应性。与以往仅包含随机替换场景的数据集不同,该数据集涵盖了五种现实世界中的知识更新情景:对象替换、归档、对象添加、关系添加以及新实体插入,极大地丰富了知识更新的多样性。其三元组不仅涉及实体间关系,还囊括了数量、日期、字符串等字面量对象,突破了传统数据集的局限。此外,数据集引入了邻近事实的概念,通过计算实体间的TF-IDF余弦相似度,精准定位可能受更新影响的相邻知识,从而为评估更新算法的特异性提供了更敏感的度量标准。数据集的构建流程具有高度可复现性,可根据用户需求灵活调整时间窗口,实现对新时间段的知识变化进行适配。
使用方法
使用WikiFactDiff数据集时,研究者首先需根据更新情景选择对应的三元组子集,例如替换场景可使用WFDrepl子集。每个三元组均配有自然语言形式的更新句子与完形填空模板,可直接用于驱动现有更新算法(如ROME、MEMIT、MEND等)的执行。评估过程围绕四个维度展开:有效性(模型能否正确预测更新后的答案)、泛化性(模型能否在语义等价的不同表述下正确回答)、特异性(更新是否对邻近事实造成负面影响)以及流畅性(更新后文本生成的自然度)。数据集提供了基于随机采样与K近邻方法的邻近事实集合,用于特异性指标的精确测量。研究者可通过HuggingFace平台直接加载数据,并利用开源代码复现论文中的基线实验,从而系统性地比较不同算法在真实知识更新场景下的表现。
背景与挑战
背景概述
大语言模型因其静态的知识边界,在训练数据截止日期后涌现的新事件面前往往显得力不从心,这一固有时效性缺陷严重制约了其在动态真实世界中的应用。为应对这一挑战,Orange与Aix-Marseille大学的研究人员于2023年联合推出了WikiFactDiff数据集,旨在系统性地研究因果语言模型中原子事实性知识的更新问题。该数据集通过对比维基数据知识库在2021年1月4日与2023年2月27日两个时间点的状态,精准捕捉了知识的演化轨迹,将事实变迁划分为新增、过时与静态三类。其核心研究问题在于构建一个大规模、真实且具备时间适应性的基准,以推动知识更新算法从单一替换场景向更丰富的实体插入、归档等复杂场景拓展,对提升语言模型的时效性与可靠性具有深远影响。
当前挑战
WikiFactDiff所面临的挑战首先体现在领域问题的复杂性上:现有知识更新算法多局限于不真实的替换场景,而真实世界中的知识变迁涉及新增实体、关系添加、信息归档等多种模式,这对算法的泛化能力与局部一致性保持提出了更高要求。其次,数据集构建过程亦充满艰险,需从海量维基数据快照中精准过滤元数据、废弃陈述及不相关实体,并通过复杂的手工规则对每个三元组进行时序分类,排除时间区间错位与标签矛盾等异常情况。此外,为支持评估,还需为每个三元组生成自然语言模板与完形填空测试,并设计邻近事实搜索策略以检测更新后的知识溢出效应,这一系列精密流程确保了数据集的真实性与可用性。
常用场景
经典使用场景
WikiFactDiff 专为大规模语言模型(LLM)的原子事实知识更新任务而设计,其经典使用场景聚焦于模拟真实世界中事实随时间演变的多种模式。研究者可利用该数据集评估模型在替换、归档、新增对象、新增关系及新增实体等不同更新场景下的表现,尤其适用于检测模型在知识更迭后能否准确泛化至语义等价的陈述,同时保持对邻近事实的特定性不产生灾难性遗忘。
衍生相关工作
基于 WikiFactDiff,研究者已衍生出多项关键工作:包括对 ROME、MEMIT、MEND 等主流知识编辑算法在真实替换场景下的系统比较,揭示了算法在泛化与特定性之间的微妙权衡;此外,该数据集还催生了针对邻近事实的特定性评估新方法(如 K-nearest-triples),并启发了将实体流行度纳入评估框架的研究方向,为未来设计能处理归档与新实体插入等复杂场景的下一代更新算法奠定了基准。
数据集最近研究
最新研究方向
在大规模语言模型不断渗透现实应用的背景下,其知识时效性衰退引发的信息滞后问题日益凸显。WikiFactDiff数据集应运而生,它通过捕捉2021年至2023年间Wikidata知识图谱的真实演化,构建了涵盖替换、归档及新实体插入等多元场景的32.7万条原子事实更新。相较于传统数据集依赖随机生成的虚构变更,该数据集以现实世界知识变迁为基底,支持对语言模型进行更贴近实际部署环境的细粒度知识修正评估。其创新性地引入时序适应性机制,允许研究者灵活对齐不同训练语料的时间窗口,为探索模型在动态知识环境中的持续学习能力提供了关键基准,尤其契合当下对AI系统可信度与时效性的迫切需求。
相关研究论文
  • 1
    WikiFactDiff: A Large, Realistic, and Temporally Adaptable Dataset for Atomic Factual Knowledge Update in Causal Language Models法国国家科学研究中心 · 2024年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务