遇见数据集

LDS-retrain-bank-adamw-wikitext2-N4656-bs8-seed1008

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

该数据集为训练数据归因研究提供基准资源,名为“Retrain bank: WikiText-2 / GPT-2, random halves, seed 1008”。数据集包含100个完全重新训练的GPT-2语言模型,每个模型在WikiText-2训练集(共4656个文档)的不同随机50%子集(每子集2328个文档)上微调,此外还有一个在完整训练集上微调的模型(retrained/base)。所有模型均采用AdamW优化器(β=(0.9,0.999), ε=1e-8),学习率3e-5,权重衰减0.01,批次大小8,训练3个epoch,fp32精度,开启dropout,种子1008。数据集中包含的文件有:retrained/base/(全量模型)、retrained/subset_*/(100个子集模型)、validation.csv(每个子集对481个验证查询的损失变化ground truth,以及EK-FAC影响分数之和)、subsets.json(每个子集移除的文档ID列表)、config.yaml(精确训练配置)和summary*.csv(每查询的EK-FAC LDS)。该数据集可直接用于评估训练数据归因方法,通过计算预测影响分数与实测损失变化之间的Spearman相关(LDS指标)。在五种子平均ground truth上,EK-FAC IF方法LDS为0.468±0.015,SOURCE方法为0.476±0.015。数据集来源于EleutherAI/bergson-wikitext-2-4656-chunks,并基于bergson框架生成。

This dataset provides a benchmark resource for training data attribution research, named Retrain bank: WikiText-2 / GPT-2, random halves, seed 1008. It contains 100 fully retrained GPT-2 language models, each fine-tuned on a different random 50% subset (2328 documents each) of the WikiText-2 training set (4656 documents total), plus one model fine-tuned on the full training set (retrained/base). All models use AdamW optimizer (β=(0.9,0.999), ε=1e-8), learning rate 3e-5, weight decay 0.01, batch size 8, 3 epochs, fp32 precision, dropout enabled, seed 1008. The dataset includes: retrained/base/ (full model), retrained/subset_*/ (100 subset models), validation.csv (ground truth loss changes for 481 validation queries per subset, and sum of EK-FAC influence scores), subsets.json (list of removed document IDs per subset), config.yaml (exact training configuration), and summary*.csv (per-query EK-FAC LDS). It can be used to evaluate training data attribution methods by computing Spearman correlation (LDS) between predicted influence scores and actual loss changes. On the average ground truth across five subsets, EK-FAC IF method achieves LDS 0.468±0.015, and SOURCE method achieves 0.476±0.015. The dataset is derived from EleutherAI/bergson-wikitext-2-4656-chunks and generated using the bergson framework.

提供机构:
EleutherAI
创建时间:
2026-08-30
原始信息汇总

数据集概述

该数据集由 EleutherAI 发布,名为 LDS-retrain-bank-adamw-wikitext2-N4656-bs8-seed1008,用于训练数据归因(Training Data Attribution)和影响力函数(Influence Functions)研究。数据集遵循 Apache 2.0 许可证。

核心内容

  • 包含 100 个完全重新训练的语言模型,而不仅仅是评分或分数。
  • 每个模型均为 GPT-2(gpt2)架构,分别在 WikiText-2 训练集的不同随机 50%(2,328 篇文档) 子集上进行了微调。
  • 基础模型(retrained/base)使用相同的随机种子在完整训练集(4,656 篇文档)上训练。

数据来源与配置

  • 语料库基于 EleutherAI/bergson-wikitext-2-4656-chunks 数据集。
  • 训练配置遵循 Bae 等人 2024 年论文《Training Data Attribution via Approximate Unrolled Differentiation》附录 B.1 的设定。
  • 优化器:AdamW(β=(0.9, 0.999),ε=1e-8),学习率 3e-5(恒定),权重衰减 0.01,批大小 8,训练 3 个 epoch,fp32 精度,启用 dropout,随机种子 1008。

文件结构

路径 内容
retrained/base/ 在完整训练集上微调的模型
retrained/subset_*/ 100 个模型,每个在不同随机半子集上训练
validation.csv 真实标签:481 个验证查询的每个(子集,查询)损失变化,以及被移除文档的 EK-FAC 影响力总和
subsets.json 每个子集移除的文档 ID 列表
config.yaml 精确的训练配置
summary*.csv 每个查询的 EK-FAC LDS 数值

多种子对照

五个数据银行共享相同的 100 个子集(subsets.json),仅训练种子不同(种子分别为 1004、1005、1006、1007 和 1008)。将五个种子的查询损失进行平均,可作为 Bergson 复现实验中的真实标签。

方法性能(基于五种子真实标签)

方法 LDS(481 个查询的平均 Spearman 相关系数,95% 置信区间)
EK-FAC IF 0.468 ± 0.015
SOURCE 0.476 ± 0.015

使用方式

数据可通过 Hugging Face snapshot_download 下载,使用 validation.csv 作为真实标签,用于评估自定义归因方法的影响力预测效果。该目录也可直接作为 Bergson 验证步骤的 retrained_dir 使用。

来源信息

该数据集由 bergson 工具生成,具体配置见 examples/replicate_bae_approx_unrolling_source/wikitext_gpt2_retrain.yaml

搜集汇总
数据集介绍
LDS-retrain-bank-adamw-wikitext2-N4656-bs8-seed1008 数据集图片
构建方式
该数据集构建于大语言模型可解释性研究的前沿领域,旨在为训练数据归属分析提供可靠的基准。其构建过程严谨而系统,基于WikiText-2语料库的4,656个训练文档,采用随机抽样方法生成100个互异的50%子集(每个子集包含2,328个文档),并针对每个子集独立微调一个GPT-2模型,同时保留一个在全量数据上训练的基线模型。所有模型遵循Bae等人2024年提出的训练配置,使用AdamW优化器、恒定学习率3e-5、批量大小8,训练3个轮次,并固定随机种子以保证可复现性。数据集的元数据包括每个子集移除的文档ID、精确的训练配置以及验证查询的损失变化记录,为后续分析提供了完整的基础。
特点
该数据集的核心特点在于其提供了完整的重训练模型族,而非仅包含影响分数,这使其成为评估训练数据归属方法的黄金标准。它包含了100个在不同数据子集上训练的模型,这些子集共享相同的抽样方案,但训练种子各异,使得研究者能够通过跨种子平均查询损失来获得更稳定的真实影响值。此外,数据集中还提供了基于EK-FAC方法的基线影响分数,便于直接比较。数据集的验证部分涵盖481个查询,记录了每个查询在移除特定文档后的损失变化,这一设计使得评估指标——通过Spearman相关系数衡量的LDS——具备了统计上的可靠性,其置信区间在0.468至0.476之间,展现了数据集的区分能力。
使用方法
使用时,研究者可通过Hugging Face的snapshot_download函数下载整个数据集,并利用validation.csv文件获取每个查询对应的真实损失差值。该文件可作为评估自定义训练数据归属方法的基准:研究者的方法需预测每个数据子集对查询损失的影响,然后计算预测值与实际差值之间的Spearman相关性,以得到LDS分数。该数据集还兼容Bergson框架的validate步骤,可直接作为重训练目录使用,简化了评估流程。此外,数据集的配置文件和文档ID映射为研究者提供了重现和扩展实验的便利,既适合验证新方法的有效性,也适合深入探索训练数据与模型行为之间的复杂关系。
背景与挑战
背景概述
该数据集由EleutherAI团队于2024年创建,旨在为训练数据归属(Training Data Attribution)研究提供高质量的基准。其核心研究问题是如何精确量化单个训练样本对模型预测的影响,这是可解释人工智能领域的关键挑战。通过提供100个在WikiText-2语料库随机子集上微调的GPT-2模型,该数据集支持了基于影响函数(Influence Functions)的方法验证,特别是针对近似展开微分(Approximate Unrolled Differentiation)技术的评估。该数据集已应用于复现Bae等人(2024)的研究,并成为衡量不同归属方法性能的标准基准,对提升模型透明度和公平性具有重要影响力。
当前挑战
该数据集面临的挑战包括:1) 领域问题:训练数据归属方法需应对大规模模型和数据的计算复杂度,以及如何准确估计每个训练样本对查询样本损失的边际贡献,现有方法如EK-FAC或SOURCE的LDS分数仅达到约0.47,表明预测与真实影响之间仍有较大差距。2) 构建过程:需要训练100个完整模型以获取经验基线,计算资源消耗巨大;同时,需确保不同随机种子下子集划分的一致性,并精确记录每个模型的配置和验证损失,以提供可信的ground truth,任何训练细节的偏差都可能影响归属评估的可靠性。
常用场景
经典使用场景
该数据集是训练数据归属(Training Data Attribution)研究领域的宝贵资源,专为评估影响函数(Influence Functions)等归因方法的准确性而设计。它提供了100个在WikiText-2语料库不同随机半数子集上微调的GPT-2模型,以及对应的验证查询损失变化数据,使得研究者能够以严格的对照实验方式,量化预测影响力与真实损失变化之间的相关性(如Spearman秩相关系数)。此数据集广泛应用于验证和改进近似影响函数、基于梯度的归因算法等,是衡量归因方法效能的可靠基准。
衍生相关工作
该数据集衍生出多项经典工作。它作为核心基准,直接支撑了Bae等人提出的近似展开微分(Approximate Unrolled Differentiation)方法在语言模型上的实证复现,验证了该方法在GPT-2上计算高效且与真实重训练影响高度一致。后续研究在此基础上,进一步探索了更高效的归因估计器,如SOURCE算法,并利用该数据集进行对比,证明了其在单次训练下的优越性。此外,该数据集的发布也催生了关于影响函数稳定性、对训练随机性鲁棒性的探讨,以及如何利用重训练银行(Retrain Bank)数据来校准和融合不同归因评分,推动了这一研究方向的深入发展。
数据集最近研究
最新研究方向
该数据集聚焦于训练数据归因与影响函数的前沿研究,通过提供100个在WikiText-2子集上重训的GPT-2模型,为验证近似展开微分(Approximate Unrolled Differentiation)等方法提供了可靠基准。其多种子(seed)设计(1004-1008)平均化查询损失,显著提升了因果归属的稳定性,呼应了当前对大语言模型可解释性与数据影响追溯的迫切需求。该资源有望推动数据估值、隐私审计及鲁棒学习等领域,为实证评估模型对训练数据的记忆与依赖关系奠定坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务