遇见数据集

NeelNanda/counterfact-tracing

收藏
Hugging Face2022-11-05 更新2024-03-04 收录
官方服务:

资源简介:

这是一个从ROME论文中的counterfact数据集改编而来的数据集,包含21919个事实关系,每个关系都有两个响应(true和false),旨在用于模型中的记忆编辑和机制解释性研究。数据集的结构包括多个特征(如relation, prompt, target_true等)和分割(如train)。建议使用true和false目标的logit差异来测量,以控制模型识别事实类型的部分。

This is a dataset adapted from the CounterFact dataset in the ROME paper, which contains 21,919 factual relationships. Each relationship is paired with two responses (true and false), and it is designed for research on memory editing and mechanistic interpretability in models. The dataset structure includes multiple features (e.g., "relation", "prompt", "target_true", etc.) and data splits (e.g., "train"). It is recommended to use the logit difference between the true and false targets for measurement, to control for the portion where the model recognizes fact types.

提供机构:
NeelNanda
原始信息汇总

数据集概述

数据集名称

counterfact-tracing

数据集特征

  • relation: 字符串类型
  • relation_prefix: 字符串类型
  • relation_suffix: 字符串类型
  • prompt: 字符串类型
  • relation_id: 字符串类型
  • target_false_id: 字符串类型
  • target_true_id: 字符串类型
  • target_true: 字符串类型
  • target_false: 字符串类型
  • subject: 字符串类型

数据集拆分

  • train:
    • 数据量: 3400668字节
    • 示例数量: 21919

数据集大小

  • 下载大小: 1109314字节
  • 数据集总大小: 3400668字节
搜集汇总
数据集介绍
NeelNanda/counterfact-tracing 数据集图片
构建方式
该数据集源自ROME论文中的反事实数据集,经精简后专用于机械可解释性研究,旨在探究模型如何回忆事实知识。构建过程中,每个事实关系被格式化为提示,包含关系前缀、主语和关系后缀,并关联真实与虚假两个目标答案。为确保分词准确性,在目标前统一添加空格,主语若非句首亦添加空格。数据集共包含21919条事实关系,以训练集形式呈现,每条记录涵盖关系、提示、主语、目标及对应ID等字段。
特点
数据集的核心特色在于为每个事实同时提供真实与虚假目标答案,这一设计便于通过计算逻辑差异来度量模型对事实类型的识别能力,从而有效控制模型内部机制对事实类型判断的干扰。所有目标均为单令牌形式,便于直接进行分词与概率比较。此外,数据已预处理空格,确保主语和目标能够被正确分词,提升了数据在因果追踪实验中的适用性。
使用方法
推荐使用方式为测量真实目标与虚假目标之间的逻辑差异,尤其当目标为单令牌时,此方法能更纯净地反映模型对特定事实知识的召回能力。用户可直接通过提示字段构建输入,例如将relation_prefix、subject和relation_suffix拼接为完整提示,并利用target_true与target_false进行对比分析。数据集适用于因果追踪等可解释性研究,支持对模型内部知识存储与检索机制的深入探索。
背景与挑战
背景概述
在大规模语言模型的可解释性研究中,理解模型如何存储与检索事实性知识是核心挑战之一。基于此背景,NeelNanda团队于2023年左右构建了counterfact-tracing数据集,该数据集源自David Bau和Kevin Meng提出的ROME论文中的反事实数据集,旨在为因果追踪技术提供支持。数据集包含21,919条事实关系,每条关系以特定前缀、主体和后缀构成提示,并配以真实与虚假两种目标答案。其设计初衷在于辅助机械可解释性研究,通过测量真实与虚假目标之间的logit差异,揭示模型内部知识回忆的因果机制。该数据集在模型编辑与可解释性领域具有重要影响力,为后续研究提供了标准化的事实性知识评估基准。
当前挑战
该数据集面临的核心挑战包括:首先,在领域问题层面,如何准确区分模型对事实知识的回忆与对语言模式的表面学习,这要求通过真实与虚假目标的logit差异来消除模型对事实类型的整体识别偏差。其次,在构建过程中,需确保主体和目标的标记化正确性,例如在主体非句首时预置空格,以避免分词错误影响因果追踪的精度。此外,反事实关系的设计需平衡真实世界知识的多样性与模型训练数据的覆盖范围,防止因事实过于罕见或常见而导致评估失真。最后,数据集的单标记目标限制了对多标记事实的适用性,需进一步扩展以支持更复杂的知识回忆分析。
常用场景
经典使用场景
在可解释人工智能的探索中,counterfact-tracing数据集为解析大型语言模型内部知识表征与检索机制提供了关键工具。其设计源于对模型记忆编辑的深入研究,通过提供21919条结构化事实关系(包含正确与错误目标),研究者可以系统地追踪模型在生成特定事实时各层神经元的因果贡献。该数据集特别适用于因果追踪实验,通过对比正确与错误目标的logit差异,能够剥离出模型用于识别事实类型的通用组件,从而精确锁定存储特定知识的关键神经通路。
实际应用
在实际应用中,该数据集支撑着大模型安全性与可控性的关键需求。例如,在模型编辑场景中,利用其反事实对可以精确评估知识修改是否成功且不破坏其他无关知识;在幻觉检测任务中,通过比较模型对真实与虚假目标的倾向性,可构建更鲁棒的可靠性评估指标。此外,该数据集也服务于教育领域的模型诊断工具开发,帮助开发者定位知识冲突或遗忘的根源,从而优化模型在事实问答、信息检索等下游任务中的表现。
衍生相关工作
基于counterfact-tracing数据集,一系列开创性工作应运而生。其原始形态源于ROME论文,该研究首次提出通过因果追踪定位模型中的事实知识存储位置并实现精准编辑。后续工作如“Interpretability In the Wild”借鉴其logit差异思想,将分析方法推广至更多自然语言场景。此外,该数据集还催生了关于知识神经元定位、记忆编辑泛化性等方向的探索,例如分析模型如何在不同提示下稳定回忆同一事实,或研究编辑操作对相邻知识的副作用,这些工作共同构成了机械可解释性领域的核心知识体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务