遇见数据集

LDS-retrain-bank-adamw-wikitext2-N4656-bs8-seed1004

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

该数据集是用于训练数据归因和影响函数研究的重训练数据银行。它包含100个完全重新训练的GPT-2模型,每个模型在WikiText-2训练集(共4656个文档)的随机50%子集(2328个文档)上微调,训练种子为1004。此外,还提供了一个在全训练集上微调的基线模型(位于retrained/base)。数据集的结构包括:retrained/subset_*/(100个模型)、validation.csv(包含针对481个验证查询的每个子集损失变化地面真值,以及EK-FAC影响总和)、subsets.json(每个子集移除的文档ID)、config.yaml(精确训练配置)和summary*.csv(每个查询的EK-FAC LDS)。该数据集可用于评估训练数据归因方法,通过计算预测影响与测量损失变化之间的Spearman相关性(LDS指标)。数据集遵循Apache-2.0许可证,适用于可解释性、训练数据归因和影响函数等相关研究。

This dataset is a retraining data bank for training data attribution and influence function research. It contains 100 fully retrained GPT-2 models, each fine-tuned on a random 50% subset (2,328 documents) of the WikiText-2 training set (total 4,656 documents), with training seed 1004. Additionally, a baseline model fine-tuned on the full training set is provided (located at retrained/base). The dataset structure includes: retrained/subset_*/ (100 models), validation.csv (containing ground truth per-subset loss changes for 481 validation queries, along with EK-FAC influence sums), subsets.json (document IDs removed per subset), config.yaml (exact training configuration), and summary*.csv (EK-FAC LDS per query). The dataset can be used to evaluate training data attribution methods by computing Spearman correlation (LDS metric) between predicted influence and measured loss changes. It is licensed under Apache-2.0 and suitable for research in interpretability, training data attribution, and influence functions.

提供机构:
EleutherAI
创建时间:
2026-08-30
原始信息汇总

数据集概述:LDS-retrain-bank-adamw-wikitext2-N4656-bs8-seed1004

基本信息

  • 数据集名称:LDS-retrain-bank-adamw-wikitext2-N4656-bs8-seed1004
  • 许可证:Apache-2.0
  • 标签:训练数据归因、影响函数、可解释性
  • 数据集类型:包含100个完全重新训练的语言模型的集合,而不仅仅是分数

数据集内容

该数据集包含100个GPT-2模型,每个模型在WikiText-2训练集的随机50%(2,328个文档)上进行微调,训练集总共有4,656个文档,源自EleutherAI/bergson-wikitext-2-4656-chunks。训练方法遵循Bae等人2024年的论文《Training Data Attribution via Approximate Unrolled Differentiation》附录B.1中的方案。

文件结构

路径 内容
retrained/base/ 在完整训练集上微调的模型
retrained/subset_*/ 100个模型,每个在不同随机半集上训练
validation.csv 基准数据:481个验证查询的(子集,查询)损失变化,以及移除文档的EK-FAC影响总和
subsets.json 记录每个子集移除的文档ID
config.yaml 精确的训练配置
summary*.csv 每个查询的EK-FAC LDS分数

背景说明

有五个数据银行共享相同的100个子集(subsets.json),仅在训练种子(seed)上有所不同,包括seed 1004、1005、1006、1007和1008。将这五个种子的查询损失平均后,得到bergson复制实验中使用的基准数据。

使用方式

  • 可通过snapshot_download下载数据集
  • validation.csv提供基准数据,用于评估训练数据归因方法
  • 用户可以将自己的方法预测的影响与diff列进行相关性分析
  • LDS计算方式:对所有查询取Spearman相关系数的平均值

评估结果(基于五种子基准)

方法 LDS(481个查询的平均Spearman,95%置信区间)
EK-FAC IF 0.468 ± 0.015
SOURCE 0.476 ± 0.015

训练参数

  • 优化器:AdamW(β=(0.9, 0.999),ε=1e-8)
  • 学习率:3e-5,保持不变
  • 权重衰减:0.01
  • 批量大小:8
  • 训练轮数:3
  • 精度:fp32
  • Dropout:开启
  • 种子:1004
  • 语料库:WikiText-2,4,656个训练文档,481个验证查询

生成工具

该数据集由bergson工具生成(来源配置文件:examples/replicate_bae_approx_unrolling_source/wikitext_gpt2_retrain.yaml)。

搜集汇总
数据集介绍
LDS-retrain-bank-adamw-wikitext2-N4656-bs8-seed1004 数据集图片
构建方式
该数据集由EleutherAI构建,旨在为训练数据归属(Training Data Attribution)研究提供基准真值。其构建过程严格遵循Bae等人2024年提出的近似展开微分方法(App. B.1),以GPT-2为基础模型,在WikiText-2数据集的4,656篇训练文档中随机抽取50%(2,328篇)作为子集,共生成100个不同的随机子集,并针对每个子集独立微调一个GPT-2模型。所有模型采用AdamW优化器,超参数为β=(0.9, 0.999)、ε=1e-8,学习率3e-5,权重衰减0.01,批次大小8,训练3个epoch,使用fp32精度,并保持dropout开启。此外,还包含在完整训练集上训练的基座模型,以及记录每个子集删除文档ID的subsets.json文件。
特点
该数据集的核心特点在于提供了100个完全重训练的模型,而非仅仅预测分数,这使得研究者能够直接测量每个随机半集对验证查询损失的改变,从而获得精确的因果影响。验证集包含481个查询,validation.csv文件记录了每个(子集,查询)对在移除文档前后的损失变化,以及基于EK-FAC的影响函数求和,可作为评估各类归属方法的基准真值。通过共享相同的100个子集并仅变更训练种子,该系列数据集(种子1004至1008)支持跨种子平均,以降低随机性影响,提升基准的稳健性。数据还附带了配置文件和训练细节,确保可复现性。
使用方法
使用时,用户可通过Hugging Face的snapshot_download函数下载整个数据集,并利用validation.csv文件获取每个子集对应的查询损失差异(diff)。研究者可以基于此真值,计算自己的归属方法预测的子集影响分数,并通过Spearman相关系数(对均值查询)评估预测与实测差异的一致性,即LDS指标。该数据集可直接作为bergson验证流程的retrained_dir目录,方便集成到现有工作流中。此外,数据集还提供了summary*.csv文件,包含逐查询的EK-FAC LDS值,便于深入分析。通过对比不同方法的LDS分数,研究者可以客观地衡量其有效性和可靠性。
背景与挑战
背景概述
该数据集由EleutherAI研究团队于2024年创建,旨在复现Bae等人提出的训练数据归因方法(Approximate Unrolled Differentiation)。其核心研究问题在于验证基于影响函数的归因方法能否精准识别对模型预测贡献最大的训练样本。为此,研究者构建了包含100个完全重新训练的GPT-2模型库,每个模型在WikiText-2训练集的随机半数(共2328篇文档)上微调,并提供了针对481个验证查询的损失变化真值,用于量化归因方法的准确性。该数据集为训练数据归因领域提供了首个大规模基准,其发布显著促进了可解释性与数据影响分析研究的推进,并成为后续方法比较的标准参考。
当前挑战
该数据集面临的挑战涵盖领域与构建两方面。领域层面,核心难题在于如何精准估计每个训练样本对模型预测的边际贡献,尤其是在高维参数空间中,影响函数近似常因计算复杂度和模型非凸性而失准;同时,验证归因结果需要大量重复训练,成本高昂。构建过程中,团队需确保100个子集模型的训练配置一致性(如优化器、学习率、随机种子)以消除无关变量,并平衡计算资源与统计可靠性;此外,不同随机种子导致的模型差异需通过多种子平均来缓解,这大大增加了训练与数据管理复杂度。最终,该数据集通过提供真值标签,成功降低了归因方法的评估门槛,但仍受限于计算开销与近似方法的固有误差。
常用场景
经典使用场景
该数据集为训练数据归因研究提供了宝贵的基准资源。其核心价值在于,它包含了100个在WikiText-2语料库上微调的GPT-2模型,每个模型均在原始训练集的不同随机半数子集上训练,并附带完整的验证查询损失变化记录。这一设计使得研究者能够直接利用这些预先训练的模型和对应的真实影响标签,评估和比较不同归因算法的准确性。无论是基于影响函数的方法、基于梯度的方法,还是基于自注意力机制的解释技术,都可以通过此数据集进行标准化评测。研究者仅需加载模型对查询进行预测,并将预测的影响分数与验证集中的真实损失变化进行相关性分析,即可快速验证其方法的有效性,从而极大推动了训练数据归因领域的实证研究。
实际应用
在实际应用中,该数据集支持了多个关键场景。它可直接用于模型调试与诊断,例如通过影响归因识别特定训练样本对模型输出偏差的影响,帮助开发者定位并修正训练语料中的有毒或错误信息。同时,该数据集为数据治理提供了技术支撑,能够追溯模型预测结果与训练数据之间的因果关系,协助满足数据合规要求。此外,其在数据选择与优化方面具有潜力,通过分析训练数据对模型性能的影响,指导高效的数据筛选或去重策略,进而优化训练成本与模型表现。对于教育研究而言,该数据集也常被用作教学工具,帮助解释机器学习可解释性中的核心概念,如影响函数与数据归因。
衍生相关工作
该数据集催生了一系列后续研究。它直接复现并扩展了Bae等人提出的Approximate Unrolled Differentiation(AUD)方法,为该方法在更大规模模型上的应用提供了基准实验。同时,该数据集还用于验证和对比其他先进归因技术,例如EK-FAC影响函数和SOURCE方法,这些在数据集的说明文档中已有明确评测。此外,它启发了对多种子平均策略的研究,通过整合多个训练种子下的结果以获得更稳定的归因评估。该数据集也推动了基于归因的下游应用研究,如数据误解检测、对抗样本分析以及训练数据中的偏置识别等,成为训练数据归因领域一个重要的衍生研究基础和参考标准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务