遇见数据集

direct-edge-damage-effects

收藏
Hugging Face2026-06-27 更新2026-06-29 收录
官方服务:

资源简介:

该数据集名为“直接边损伤效应(仅提示边干预)”,旨在为变压器语言模型(LM)中边粒度的摊销因果干预效应预测提供数据支持,无需使用干净/损坏提示对。数据集中,干预的基本单元是计算图中的有向边(例如,从注意力头7到头18输入的贡献)。对于每个输入提示,通过精确移除源组件对接收组件输入的贡献(同时保留源组件对所有其他下游组件的可用性),并记录完整模型与干预后模型在下一次令牌预测分布之间的精确KL散度,从而生成数据标签。此外,数据集还捕获了源残差写入范数、一阶边归因、接收输入占比、梯度范数以及边结构描述符等多种廉价特征。数据集包含多个配置,分别基于GPT-2、Qwen-3和Pythia等不同模型,并区分了不同的实验设计(如A、B、mediated、design3)。具体而言,`*__A`配置提供单边直接KL损伤数据,包含约22个列,其中`kl`为标签;`*__B`配置提供电路条件化的边际直接KL数据,在A类列的基础上增加了电路密度、动作(添加/移除)、当前电路KL值以及边际KL变化(`y_marginal`)等列。所有数据均以Parquet格式存储,且仅包含训练集分割。提示文本涵盖多种领域,包括网页、代码、数学、对话、问答、长上下文以及特定的推理任务(如IOI、归纳)。该数据集的目标是作为一种可扩展的预训练信号,用于开发通用、提示级的机制可解释性方法。

This dataset is named Direct Edge Damage Effect (Prompt-Only Edge Intervention) and aims to provide data support for amortized causal intervention effect prediction at the edge granularity in transformer language models (LMs), without using clean/damaged prompt pairs. In the dataset, the basic unit of intervention is a directed edge in the computational graph (e.g., the contribution from attention head 7 to the input of head 18). For each input prompt, data labels are generated by precisely removing the contribution of the source component to the input of the receiving component (while retaining the availability of the source component to all other downstream components) and recording the exact KL divergence between the full model and the intervened model in the next token prediction distribution. Additionally, the dataset captures various cheap features such as source residual write norm, first-order edge attribution, receiving input proportion, gradient norm, and edge structural descriptors. The dataset includes multiple configurations based on different models like GPT-2, Qwen-3, and Pythia, and distinguishes between different experimental designs (e.g., A, B, mediated, design3). Specifically, the `*__A` configuration provides single-edge direct KL damage data with approximately 22 columns, where `kl` is the label; the `*__B` configuration provides circuit-conditioned marginal direct KL data, adding columns such as circuit density, action (add/remove), current circuit KL value, and marginal KL change (`y_marginal`) on top of the A-type columns. All data is stored in Parquet format and includes only the training set split. The prompt texts cover various domains, including web pages, code, mathematics, dialogue, question-answering, long context, and specific reasoning tasks (e.g., IOI, induction). The goal of this dataset is to serve as a scalable pre-training signal for developing general, prompt-level mechanistic interpretability methods.

创建时间:
2026-06-27
搜集汇总
数据集介绍
direct-edge-damage-effects 数据集图片
构建方式
本数据集聚焦于Transformer语言模型中定向计算边的因果干预效应,以每条有向边(即从源组件到目标组件的计算路径)为基本干预单元。通过直接阻断源组件对目标组件输入的贡献,同时保留源组件对其他下游组件的可用性,精确记录完整模型与干预后模型在下个词元预测分布之间的KL散度。数据采集过程中,同步提取源组件的残差写入范数、一阶边归因、目标输入占比、梯度范数及结构描述符等二十项廉价特征,形成对干预效应的全面刻画。数据集包含两大配置:配置A记录单边直接阻断的KL损伤,配置B则在电路状态条件化下记录边际KL变化,实现对边缘干预效应的细粒度量化。
特点
该数据集最显著的特征在于其“仅提示词”的干预范式,无需使用配对的干净/损坏提示词对,即可在任意自然文本上定义因果效应标签。这种设计使得数据集能够覆盖网页、代码、数学、对话、问答及长上下文等多种领域,具备高度通用性和可扩展性。数据集提供了丰富的边身份标识(包括源层、源头、源MLP以及目标层、目标头、目标MLP)和领域标签,便于研究者进行差异化的归因分析。此外,配置B中引入了电路密度、动作类型及当前电路KL散度等额外信息,为研究条件化因果效应提供了便利。
使用方法
用户可通过HuggingFace Datasets库便捷加载该数据集的多个配置。例如,使用`load_dataset('almogtavor/direct-edge-damage-effects', 'gpt2_direct__A')`即可获取GPT-2模型下配置A的单边干预数据。每个配置均以Parquet格式存储,仅包含训练集划分。数据列结构清晰:配置A包含二十项廉价特征及标签列kl,配置B额外包含circuit_density、action和kl_C等列。研究者可直接利用这些特征进行因果效应预测模型的训练,或结合边身份信息进行机制可解释性分析,也可根据domain列筛选特定领域的数据进行专项研究。
背景与挑战
背景概述
在深度学习可解释性研究的前沿,因果干预分析已成为揭示Transformer语言模型内部计算机制的核心范式。该数据集由研究团队于近期构建,专注于探索模型计算图中边级(edge-level)因果损伤效应,旨在解决路径修补等方法依赖成对清洁/污染提示的局限。通过记录模型中每条有向计算边被阻断后下一个token分布的精确KL散度变化,数据集为研究者提供了无需对比提示即可评估任意文本下边级因果效应的宝贵资源。其涵盖多种主流Transformer架构(如GPT-2、Qwen、Pythia),并在网页、代码、数学、对话、问答及长上下文等多领域文本上进行标注,为规模化、无监督的机制可解释性研究奠定了坚实基础。
当前挑战
该数据集面临的核心挑战在于因果效应的精确计算与规模扩展。首先,模型每条计算边的干预效应需通过完整前向传播与阻断后分布的比较来获得,对于具有数十亿参数和数万条边的Transformer,这一过程计算开销极大,直接限制了数据集的构建规模。其次,数据标签定义于单一提示下边阻断的KL变化,但不同提示、不同上下文长度下同一位置的效应可能剧烈波动,如何从稀疏的边级标签中泛化出普适的因果模式是模型学习的难点。此外,数据集包含大量边身份元信息(源和目标层与头)以及廉价前向/反向信号,如何有效整合这些异构特征以训练准确的损伤预测器,仍是该研究方向的开放问题。
常用场景
经典使用场景
在大规模语言模型的可解释性研究中,为每条计算边(如注意力头之间的信息流)直接测量其被阻断后对输出分布的影响,是本数据集的核心应用场景。具体而言,通过移除特定源节点对接收节点的贡献,并记录完整的KL散度变化,研究者能够精准量化每一条有向边在特定提示下的因果效应,从而在不依赖于干净-损坏提示对的情况下,实现任意文本上的因果干预效果预测。
解决学术问题
该数据集旨在解决语言模型机械可解释性中因果干预的可扩展性问题。传统路径修补方法需要精心构造提示对,难以应用于自然发生的多样化文本。本工作通过仅需原始提示的边阻断干预范式,结合廉价的前向/反向信号,实现了对每条计算边因果效应的近似预测,为理解语言模型内部信息流动机制提供了低成本、高覆盖率的分析工具,推动了大规模模型可解释性研究的前沿。
衍生相关工作
该数据集衍生出的相关工作包括基于摊销因果推断的边效应预测模型,这些模型利用廉价特征(如残差写范数、一阶归因)作为输入,训练轻量级网络以逼近精确的KL散度标签。此外,电路条件化边际效应配置(B配置)催生了动态电路剪枝研究,其中通过评估添加或移除一条边对整体电路KL的边际变化,可以自动化地识别和修剪冗余或无益的计算路径,从而提升模型推理效率并保持性能。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务