遇见数据集

LDS-retrain-bank-adamw-wikitext2-N4656-bs8-seed1007

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

该数据集为训练数据归因研究提供了完整的重训练基准。它包含100个GPT-2模型,每个模型在WikiText-2训练集(共4656个文档)的随机50%子集(2328个文档)上微调,训练配置遵循Bae等人2024年论文中的设置(附录B.1)。此外,还提供了一个在完整训练集上微调的基础模型。数据集包含验证集上每个查询的损失变化(ground truth)、子集ID、训练配置文件和EK-FAC LDS摘要。五个种子(1004-1008)共享相同的100个子集,仅训练种子不同,通过平均五个种子的查询损失可得到真实值。该数据集适用于评估和比较不同训练数据归因方法(如影响函数、近似展开微分等)的准确性。

This dataset provides a complete retraining benchmark for training data attribution research. It contains 100 GPT-2 models, each fine-tuned on a random 50% subset (2,328 documents) of the WikiText-2 training set (total 4,656 documents), with training configuration following the settings in Bae et al. 2024 (Appendix B.1). Additionally, a base model fine-tuned on the full training set is provided. The dataset includes per-query loss changes (ground truth) on the validation set, subset IDs, training configuration files, and EK-FAC LDS summaries. Five seeds (1004-1008) share the same 100 subsets, differing only in training seeds, and the ground truth is obtained by averaging query losses across the five seeds. This dataset is suitable for evaluating and comparing the accuracy of different training data attribution methods (e.g., influence functions, approximate unrolled differentials, etc.).

提供机构:
EleutherAI
创建时间:
2026-08-30
原始信息汇总

数据集概述:LDS-retrain-bank-adamw-wikitext2-N4656-bs8-seed1007

基本信息

  • 数据集名称:LDS-retrain-bank-adamw-wikitext2-N4656-bs8-seed1007
  • 许可证:Apache-2.0
  • 标签:训练数据归属(training-data-attribution)、影响函数(influence-functions)、可解释性(interpretability)

数据集描述

该数据集包含 100 个完全重新训练的 GPT-2 语言模型,每个模型在 WikiText-2 训练集的不同随机 50% 子集(2,328 篇文档,共 4,656 篇文档)上进行微调,数据来源为 EleutherAI/bergson-wikitext-2-4656-chunks。训练方法遵循 Bae et al. 2024 年论文《Training Data Attribution via Approximate Unrolled Differentiation》附录 B.1 中的方案。基础模型 retrained/base 使用相同种子在完整训练集上训练。

相关仓库

存在 5 个共享相同 100 个子集(subsets.json)但训练种子不同的数据银行,分别是种子 10041005100610071008。将查询损失在五个种子上取平均,即可得到 bergson 复制实验所使用的真实结果。

文件结构

路径 内容说明
retrained/base/ 在完整训练集上微调的模型
retrained/subset_*/ 100 个模型,每个在不同随机半集上训练
validation.csv 真实结果:481 个验证查询在每个(子集,查询)上的损失变化,以及移除文档的 EK-FAC 影响和
subsets.json 每个子集移除的文档 ID
config.yaml 确切的训练配置
summary*.csv 每个查询的 EK-FAC LDS

使用方法

通过 snapshot_download 下载整个数据集后,可读取 validation.csv 获取每个半集对每个查询损失影响的真实结果,并可将自己的方法预测的影响与 diff 列进行相关分析。LDS 定义为查询间 Spearman 相关系数的平均值。该目录也可直接作为 bergson validate 步骤的 retrained_dir 使用。

性能评估

在五个种子平均后的真实结果上评估:

方法 LDS(481 个查询的平均 Spearman,95% 置信区间)
EK-FAC IF 0.468 ± 0.015
SOURCE 0.476 ± 0.015

模型分数基于 EleutherAI/bergson-wikitext-2-gpt2 中微调运行计算。

训练配置与来源

  • 优化器:AdamW(β=(0.9, 0.999),ε=1e-8)
  • 学习率:恒定为 3e-5
  • 权重衰减:0.01
  • 批次大小:8
  • 训练轮数:3
  • 精度:fp32,启用 dropout
  • 种子:1007
  • 语料库:WikiText-2,4,656 篇训练文档;481 个验证查询

该数据集由 bergson 工具生成,具体配置文件为 examples/replicate_bae_approx_unrolling_source/wikitext_gpt2_retrain.yaml

搜集汇总
数据集介绍
LDS-retrain-bank-adamw-wikitext2-N4656-bs8-seed1007 数据集图片
构建方式
本数据集源自对语言模型可解释性研究的深入探索,旨在为训练数据归因提供坚实的实证基础。其构建遵循Bae等人2024年提出的近似展开微分方法,以GPT-2为基底模型,在WikiText-2语料库的4,656篇训练文档中,随机抽取50%(即2,328篇)构成100个不同的子集,并针对每个子集独立微调出一个完整模型,由此形成了包含100个重训练模型的存储库。所有模型采用一致的AdamW优化器配置(β=(0.9, 0.999), ε=1e-8,学习率3e-5恒定,权重衰减0.01),批次大小为8,训练3个epoch,并固定随机种子为1007。同时,数据集还提供了在完整训练集上训练的基线模型,以及记录每个子集对应移除文档ID的subsets.json文件,确保实验的可重复性与透明度。
特点
该数据集的核心特色在于其提供了完整的重训练模型权重,而非仅存储归因分数,这使得研究者能够深入检验任意训练数据归因方法的有效性。其精心设计的实验结构——100个随机半数子集搭配固定基线的训练配置——为评估归因精度提供了可靠的对照基准。尤为重要的是,数据集中包含的validation.csv文件记录了481个验证查询在每种子集训练下的损失变化,这一实测数据构成了衡量归因方法性能的黄金标准。此外,该数据集与另外四个不同训练种子的重训练库共享相同的子集划分,通过跨种子平均查询损失,能够获得更为稳健的归因真值,从而显著提升评估的可信度与泛化性。
使用方法
使用该数据集的过程简洁而高效。研究者可通过Hugging Face提供的snapshot_download接口便捷获取完整数据,随后利用pandas读取validation.csv文件,其中存储了每个查询在特定子集训练下的损失变化值,这一数值即为归因方法需要预测的目标。用户可基于subsets.json中的文档划分,运用自身的归因算法(如基于影响函数的方法)为每个查询计算移除文档后的影响分数,再与实测的损失变化进行斯皮尔曼秩相关分析,所得相关系数的均值即为该方法的LDS得分。值得注意的是,数据集的目录结构兼容bergson验证流程,可直接作为retrained_dir参数使用,极大简化了评估流程,促进了不同归因方法间的公平比较。
背景与挑战
背景概述
该数据集由EleutherAI于2024年创建,旨在为训练数据归因(Training Data Attribution)研究提供基准。其核心研究问题是评估不同归因方法在预测训练数据对模型行为影响上的准确性。通过构建100个在WikiText-2随机子集上微调的GPT-2模型,该数据集为对比方法(如EK-FAC IF和SOURCE)提供了可重复的评估平台,显著推动了模型可解释性和数据影响力分析领域的发展。
当前挑战
该数据集面临的核心挑战在于领域问题:训练数据归因需精确量化每一条数据对模型输出的贡献,但高维参数空间和复杂依赖关系使近似计算存在误差。构建过程中,需训练100个模型并保持训练配置一致,计算资源消耗大且耗时;同时,确保不同子集间可比性、控制随机种子影响、以及提供一个可靠的地面真值(validation.csv)也需精心设计。此外,评估指标(如LDS)对噪声敏感,需多种子平均以提升鲁棒性。
常用场景
经典使用场景
该数据集以GPT-2在WikiText-2上的微调为基础,构建了100个在随机半数训练文档上重训的模型库,为训练数据归属(TDA)研究提供了高精度的重训基准。其经典使用场景在于评估各类影响函数或数据归因方法的有效性,研究者可利用validation.csv中的真实损失变化作为基准,通过计算预测影响与真实值的斯皮尔曼相关性(LDS)来量化方法优劣。此数据集尤其适用于近似的、可扩展的归因技术(如EK-FAC)的验证,亦为对比不同种子下的稳定性提供了基础。
衍生相关工作
该数据集衍生的工作涵盖多个前沿方向。其直接服务于Bae等人提出的近似解rolled微分(AUD)方法的复现,成为该经典工作的关键验证资源。后续研究可能将其作为标准基准,用于改进影响函数的高效计算或设计新型归因算法。例如,SOURCE方法的评估即基于此数据集,展示了其在捕捉训练动态方面的潜力。此外,该重训库的架构启发类似数据集的构建,如不同架构或领域的数据集,从而推动TDA领域的横向扩展。在理论层面,它促进了对影响函数假设(如局部平滑性)的实证检验,并可能催生于集成学习的活跃样本挖掘策略,为模型可解释性研究开辟新路径。
数据集最近研究
最新研究方向
该数据集构建了100个在WikiText-2子集上重新训练的语言模型,为训练数据归因研究提供了宝贵的实证基准。前沿方向聚焦于通过影响函数(如EK-FAC)与重训练基线的对比,验证归因方法的可靠性与精确度,并探索跨多种随机种子的一致性以刻画方法的不确定性。当前研究热点包括利用此类重训练库评估数据移除与贡献估计的效用,进而支撑大语言模型的可解释性、公平性及版权溯源。该数据集的意义在于弥合理论归因方法与实际影响之间的鸿沟,为模型诊断与数据治理提供了标准化测试平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务