遇见数据集

metasmoothness-bank-plan_adam_eps1e17_4k_bs256

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

该数据集(名为“plan_adam_eps1e17_4k_bs256”)由EleutherAI发布,专为训练数据归因(training data attribution)研究设计。它包含100个完全重新训练的语言模型,每个模型均为GPT-2(gpt2)架构,在相同的4,000文档语料上微调,但每个模型随机剔除1%(40个文档)的不同子集。所有模型使用相同的种子和数据顺序,重训练过程在相同环境下是确定性的,因此模型差异仅来自剔除的文档。数据集提供了地面真实值文件(validation.csv),记录每个子集对每个查询(query)造成的损失变化(diff),以及子集信息(subsets.json)和精确的训练配置(config.yaml)。此外,还包含基于MAGIC、EK-FAC和metasmoothness等方法的评分器评估结果(LDS指标和tail-filter delta)。该数据集可用于评估新的归因方法,无需重新训练模型。LDS指标定义为每个查询上预测子集影响与实测diff之间的Spearman相关系数的平均值。数据集采用Apache-2.0许可证。

This dataset (named "plan_adam_eps1e17_4k_bs256") is released by EleutherAI, specifically designed for training data attribution research. It contains 100 fully retrained language models, each with GPT-2 (gpt2) architecture, fine-tuned on the same 4,000-document corpus, but each model randomly drops a different subset of 1% (40 documents). All models use the same seed and data order, and the retraining process is deterministic under the same environment, so the model differences come only from the dropped documents. The dataset provides a ground truth file (validation.csv) recording the loss change (diff) caused by each subset for each query, along with subset information (subsets.json) and the exact training configuration (config.yaml). Additionally, it includes evaluator scores based on methods such as MAGIC, EK-FAC, and metasmoothness (LDS metric and tail-filter delta). This dataset can be used to evaluate new attribution methods without retraining models. The LDS metric is defined as the average Spearman correlation coefficient between predicted subset influence and measured diff for each query. The dataset is licensed under Apache-2.0.

提供机构:
EleutherAI
创建时间:
2026-08-22
原始信息汇总

数据集概述

该数据集由EleutherAI发布,许可证为Apache 2.0,用于训练数据归因(training-data-attribution)和影响函数(influence-functions)研究。

核心内容

  • 包含100个完整重新训练的语言模型,并非仅提供分数。
  • 每个模型基于GPT-2(gpt2),在相同的4,000篇文档语料库上进行微调,但每次随机剔除不同的1%(即40篇文档)
  • 所有模型使用相同种子和数据顺序,仅因剔除文档不同而存在差异。重训练在单一环境内是确定性的。

主要文件结构

路径 说明
retrained/base/ 未剔除任何文档的微调基础模型
retrained/subset_*/ 100个模型,每个缺失语料库中不同的1%文档
validation.csv 真实标签(ground truth):每个(子集,查询)组合因剔除导致的损失变化
subsets.json 每个子集剔除的文档ID列表
config.yaml 精确的训练配置文件
filter_proponents_*/ 尾部过滤结果:移除评分器排名前1%文档后的损失变化

使用方式

可通过huggingface_hubsnapshot_download下载完整数据集,并通过validation.csv获取真实标签。用户可对自己提出的归因方法进行评分,然后将预测影响与测量到的diff值进行相关分析。

该数据集上测得的指标

指标
MAGIC LDS 0.9295
EK-FAC LDS 0.3975
metasmoothness 0.9946
MAGIC尾部过滤delta 0.02505 nats
EK-FAC尾部过滤delta 0.01153 nats
随机对照尾部过滤delta 0.00004 nats

其中LDS表示每个查询的平均Spearman相关性,衡量预测子集影响与实测diff之间的关联。

数据来源与训练配置

  • 优化器:adamw,学习率:0.0001,批次大小:256,训练轮数:2,步数:32,随机种子:42
  • 语料库:smollm2,共4,000篇文档
  • 注意:所有重训练在同一GPU类型上完成,因为混合GPU类型会导致重训练模型产生足以影响LDS约0.05的变化,这一变化幅度大于多数待测效应。

该数据集由bergson工具生成,其核心价值在于可复用于任何leave-k-out归因研究,无需额外进行重训练即可评估新的归因方法。

搜集汇总
数据集介绍
metasmoothness-bank-plan_adam_eps1e17_4k_bs256 数据集图片
构建方式
在训练数据归因与影响函数研究中,构建可靠的留一法基准数据集通常需要高昂的重复训练成本。该数据集通过系统化重训练流程,在固定随机种子、数据顺序及优化超参数(AdamW,学习率0.0001,批大小256,训练2轮)的条件下,对GPT-2模型在包含4000篇文档的SmolLM2语料上进行微调,并分别剔除随机1%(40篇)文档形成100个消融子集。每个子集模型均独立完整训练,最终连同未消融的基础模型一并发布,并附带验证集损失变化、子集文档ID及训练配置,从而为归因方法的可复现评估提供完整基准。
特点
该数据集的核心特质在于其提供了完整的重训练模型而非仅评分或代理指标,由此构成留一法归因研究中最为昂贵的资产,并具备高度可复用性。数据集囊括100个分别缺失不同1%文档的模型、一个基础微调模型,以及记录每个查询损失变化的真实标签validation.csv。此外,还包含尾部过滤结果,用于评估不同评分器所筛选的高影响文档被移除后的损失变化。由于所有重训练在单一GPU类型上确定性地执行,模型间差异仅源于被剔除文档的不同,这为归因方法提供了严格可控的评测环境。
使用方法
研究者在评估新的归因或影响函数方法时,可通过Hugging Face Hub下载整个数据集快照,读取validation.csv获取真实损失变化作为基准,并将自身方法预测的子集影响力与之进行Spearman秩相关计算,从而得到LDS指标。使用者亦可利用subsets.json与config.yaml复现或扩展实验,并借助filter_proponents_*目录开展尾部过滤分析,即移除评分器排名前1%的文档后重训练一次,测量查询损失变化并与随机移除对照组比较。该数据集支持在不重新训练任何模型的前提下,对归因方法进行快速、标准化的对比评测。
背景与挑战
背景概述
在可解释性与训练数据归因研究中,评估影响函数方法的有效性依赖于对留一法重训练所得真实损失变化的精确测量。2024年,EleutherAI 研究团队构建了 metasmoothness-bank-plan_adam_eps1e17_4k_bs256 数据集,该数据集包含100个完全重训练的语言模型,每个模型均基于同一4000篇文档语料微调GPT-2,并随机剔除1%的文档。其核心研究问题在于为归因方法提供可复用的基准真值,从而规避高昂的重训练成本。该数据集通过提供验证集上的真实损失变化,显著推动了训练数据归因领域的可复现研究,并对影响函数与解释性方法的发展具有重要影响力。
当前挑战
该数据集所解决的领域问题——训练数据归因,要求精准量化单个训练样本对模型行为的贡献,其内在挑战在于留一法重训练的计算代价极高且随机性难以控制。在构建过程中,研究者需确保100个模型仅在剔除文档上存在差异,而优化器、学习率、批量大小、数据顺序及随机种子等配置完全一致;同时,不同GPU类型导致的微小数值差异足以使归因评估指标偏移约0.05,这超出了多数待测效应的幅度。因此,维持重训练环境的严格一致成为该数据集构建与使用中的核心挑战。
常用场景
经典使用场景
在可解释性与训练数据归因研究中,该数据集作为留一法归因的黄金标准基准,其经典使用场景是评估新提出的影响函数或归因方法。研究者可直接调用库中100个完全重训的语言模型,每个模型仅从4000篇文档中剔除1%的不同子集,通过对比移除前后查询损失的变化,量化归因方法的预测准确性,从而避免重复昂贵的重训过程,极大加速方法迭代与验证。
实际应用
在实际应用中,该数据集可用于模型审计与数据清洗等场景。例如,在部署敏感领域语言模型前,利用该库验证归因工具识别有害或冗余训练样本的能力,辅助删除高风险数据并重训模型,观察性能变化。同时,该库也服务于主动学习与数据选择策略的评估,通过预计算的子集影响真值,快速筛选出对目标查询最有价值的训练文档,优化数据采集与标注成本。
衍生相关工作
基于该重训库,后续工作衍生出多项经典研究:如对MAGIC、EK-FAC等影响函数方法的系统性基准测试,揭示不同近似策略在不同模型规模下的表现差异;以及尾滤波实验,通过移除评分最高的1%文档并重训,量化影响估计对模型行为的实际干预效果。这些工作进一步催生了更鲁棒的归因算法,并推动训练数据归因成为可复现研究的标准范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务