遇见数据集

LDS-retrain-bank-adamw-wikitext2-N4656-bs8-seed1005

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

该数据集是EleutherAI发布的“重训练库”(Retrain bank),具体为使用WikiText-2数据集(4,656个训练文档)和GPT-2模型,在随机种子1005下的100个重训练模型集合。每个模型是在随机选取的50%训练子集(2,328个文档)上微调得到的,另有一个基础模型在完整训练集上微调。数据集包含100个不同子集上的微调模型(retrained/subset_*)、基础模型(retrained/base)、验证集上的ground truth损失变化(validation.csv,包含481个查询的损失变化以及EK-FAC影响总和)、子集文档ID划分(subsets.json)、精确训练配置(config.yaml)以及每查询的EK-FAC LDS汇总文件(summary*.csv)。该数据集旨在支持训练数据归属(training data attribution)研究,特别是通过重训练来评估影响函数等方法的效果。用户可通过提供的Python代码加载数据,并计算其预测影响与真实损失变化之间的相关性(LDS)来评估自己的方法。

This dataset is the Retrain bank released by EleutherAI, consisting of 100 retrained models using the WikiText-2 dataset (4,656 training documents) and GPT-2 model with random seed 1005. Each model is fine-tuned on a randomly selected 50% training subset (2,328 documents), and a base model is fine-tuned on the full training set. The dataset includes fine-tuned models on 100 different subsets (retrained/subset_*), the base model (retrained/base), ground truth loss changes on the validation set (validation.csv with 481 queries loss changes and EK-FAC influence sums), subset document ID splits (subsets.json), exact training configuration (config.yaml), and per-query EK-FAC LDS summary files (summary*.csv). It is designed to support training data attribution research, particularly to evaluate methods like influence functions via retraining. Users can load data with provided Python code and compute the correlation (LDS) between predicted influence and true loss changes to evaluate their own methods.

提供机构:
EleutherAI
创建时间:
2026-08-30
原始信息汇总

数据集概述:LDS-retrain-bank-adamw-wikitext2-N4656-bs8-seed1005

基本信息

  • 许可证:Apache 2.0
  • 标签:训练数据归因、影响函数、可解释性
  • 数据集地址:https://huggingface.co/datasets/EleutherAI/LDS-retrain-bank-adamw-wikitext2-N4656-bs8-seed1005

数据集内容

该数据集包含 100 个完全重新训练的语言模型(不仅限于评分),每个模型均为在 WikiText-2 训练集的不同随机 50% 子集(2,328 篇文档) 上微调的 GPT-2 模型。基础模型(retrained/base)在同一随机种子下使用完整训练集训练。

语料来源:WikiText-2 训练集共 4,656 篇文档,验证集包含 481 个查询。该数据集遵循 Bae 等人 2024 年论文(Training Data Attribution via Approximate Unrolled Differentiation,附录 B.1)的实验设置。

数据集结构

路径 内容
retrained/base/ 在完整训练集上微调的模型
retrained/subset_*/ 100 个模型,每个在不同随机半集上训练
validation.csv 真实标签:每个(子集,查询)对在 481 个验证查询上的损失变化,以及移除文档的 EK-FAC 影响和
subsets.json 每个子集移除的文档 ID
config.yaml 精确的训练配置
summary*.csv 每查询的 EK-FAC LDS 值

相关数据集

共有 5 个数据集仓库共享相同的 100 个子集(subsets.json),仅训练种子不同,种子分别为 1004、1005、1006、1007 和 1008。对这五个种子的查询损失取平均后,可作为 bergson 复制实验中的真实标签。

训练配置

  • 优化器:AdamW(β=(0.9, 0.999),ε=1e-8)
  • 学习率:3e-5(恒定)
  • 权重衰减:0.01
  • 批量大小:8
  • 训练轮数:3
  • 精度:FP32
  • Dropout:开启
  • 随机种子:1005

评估结果(基于五种子真实标签)

方法 LDS(481 个查询的平均 Spearman 相关系数,95% 置信区间)
EK-FAC IF 0.468 ± 0.015
SOURCE 0.476 ± 0.015

评分基于 EleutherAI/bergson-wikitext-2-gpt2 微调运行计算得出。

使用方式

可通过 huggingface_hub 下载数据集,使用 validation.csv 作为真实标签,将自己的方法与 diff 列进行相关性比较,LDS 定义为所有查询上 Spearman 相关系数的均值。

来源与工具

该数据集由 bergson 工具生成,配置文件为 examples/replicate_bae_approx_unrolling_source/wikitext_gpt2_retrain.yaml

搜集汇总
数据集介绍
LDS-retrain-bank-adamw-wikitext2-N4656-bs8-seed1005 数据集图片
构建方式
该数据集基于可解释性与训练数据归因研究的核心需求构建,源自GPT-2模型在WikiText-2语料上的微调实验。研究者从包含4,656篇文档的完整训练集中,随机抽取50%作为子集,共生成100个互不相同的子集,每个子集对应一次完整的模型重训。所有模型均采用AdamW优化器,固定超参数(学习率3e-5、批大小8、3个轮次等),并保持随机种子的一致性,以确保重训过程的严格可控。同时,构建了在完整训练集上训练的基准模型,并记录了每个子集与验证查询之间的损失变化,形成ground truth数据集。该构建方案参照Bae等人2024年提出的近似展开微分方法,为训练数据影响评估提供了可复现的实验基础。
使用方法
使用者可通过HuggingFace的snapshot_download函数便捷获取数据集,无需注册即可直接访问。核心操作是加载validation.csv文件,其中记录了每个子集对验证查询的损失影响,即ground truth。研究者可调用自定义的归因评分方法,生成对文档影响的预测值,并通过计算预测值与真值之间在查询维度上的Spearman相关(即LDS指标)来评估方法性能。该数据集设计亦兼容bergson框架的validate步骤,可直接作为重训练目录输入,简化评估流程。具体示例包括计算相关系数并分析置信区间,以实现对不同归因算法效果的公正量化比较。
背景与挑战
背景概述
该数据集由EleutherAI研究团队于2024年创建,旨在支持训练数据归因(TDA)研究,特别是验证基于影响函数的方法在语言模型中的有效性。数据集构建基于Bae等人2024年的工作,通过微调100个GPT-2模型于WikiText-2的不同随机子集,提供了详尽的训练数据归因基准。其核心研究问题在于如何精确量化训练数据点对模型预测的影响,从而推动可解释人工智能领域的发展。该数据集为影响函数方法提供了大规模、可复现的验证平台,对后续研究具有重要的参照价值和影响。
当前挑战
该数据集面临的挑战可从构建与领域应用两方面阐述。构建过程中,需训练100个GPT-2模型并确保训练配置的一致性,同时处理随机子集采样带来的计算开销与数据管理复杂性,验证集的设计也需兼顾统计功效与计算资源平衡。在领域问题层面,训练数据归因需应对模型非凸性、高维参数空间及近似方法误差等本质挑战,且当前基于影响函数的评分(如EK-FAC、SOURCE)与真实影响的斯皮尔曼相关系数仅约0.47,揭示现有方法的预测精度仍存显著提升空间。
常用场景
经典使用场景
该数据集为训练数据归因研究提供了极佳的基准测试平台。其核心特点在于包含100个在随机半数训练子集上微调的GPT-2模型,并配以完整的验证集损失变化记录,使得研究者能够精确评估不同归因方法预测训练数据对模型行为影响的能力。经典使用场景是作为‘重训练银行’(retrain bank),通过计算查询损失在子集训练前后的差异,来验证影响力函数、相似度方法或基于梯度的归因技术,以斯皮尔曼相关系数作为衡量预测准确性的标准指标。
解决学术问题
该数据集解决了训练数据归因领域缺乏可靠基准的难题。在学术研究中,验证归因方法的有效性通常需要了解移除特定训练样本对模型性能的真实影响,但获取这种‘真实值’成本高昂。此数据集通过预计算100个子集模型和验证损失,为研究者提供了现成的、可复用的真实基准,从而解决了复现成本高、比较标准不一致的问题,推动了归因方法在可解释机器学习中的发展。
实际应用
在实际应用中,此类数据集的衍生技术可用于数据清洗、隐私保护和模型调试。例如,通过训练数据归因识别对模型输出影响最大的样本,可辅助过滤错误或有害数据,提升模型鲁棒性;也可用于追溯模型预测偏差的源头,增强深度学习系统的可信度。本数据集提供的重训练框架为这类应用提供了验证工具,使开发者能在部署前评估归因方法的可靠性,从而在数据治理和合规审计中发挥关键作用。
数据集最近研究
最新研究方向
在大语言模型可解释性与数据归属这一前沿交叉领域,训练数据归因方法正经历从静态评估到动态验证的深刻范式演进。本数据集作为重训银行(retrain bank)基础设施,通过构建对100个随机半集子集上完全微调的GPT-2模型群组,为衡量影响函数类方法提供了坚实的地面实况。其设计紧密呼应了Bae等人所倡导的近似展开微分策略,并巧妙利用多样本随机种子构建均值损失,以削弱单次训练噪声对归因信号估测的干扰。该资源不仅支撑了EK-FAC与SOURCE等代表性方案在WikiText-2语料上的性能对比,亦为验证各类基于梯度或表征的归因算法的可靠性提供了标准化基准,进而推动数据选择、模型修正及知识产权保护等下游应用的算法迭代,重塑着对训练数据如何塑造模型行为的深层认知。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务