遇见数据集

route-attribution-baselines

收藏
Hugging Face2026-09-19 更新2026-09-20 收录
官方服务:

资源简介:

该数据集是面向数据归因方法评估的合成基准测试集,基于 Qwen3.5-4B-route-ab-l8-lora-scale 模型(由 lamsheeper-data-attribution 提供)生成。数据集的构造方式为:每个训练文档定义一个唯一的合成常量函数,每个查询询问对应函数的值;真实归因的目标是识别出描述该函数的所有文档,并通过方法对这些文档的排序质量(如 AUC 和 Recall@R)来衡量方法性能。数据包含 v1 和 v2 两个版本:v1 为原始网格(已冻结),v2 为活跃重跑版本(修复了填充标记 bug,并增加了训练目标 arm、合并了方法组、固定了约定)。数据集文件以 run/group 路径组织,其中 run 格式为 f{functions}_{docs}d_sd{seed},group 包括 ekfac_margin(if-ekfac、grad-dot、grad-sim)、trak、logra_margin、tracin_margin(tracin、tracin-cos)、source_margin(SOURCE)、bm25(bm25、bm25-prompt)、embed(embed、embed-base)等方法组。每个 run/group 下包含 scores.npz(查询-训练矩阵)、metrics.json(AUC 和 Recall@R 指标)、config.json(运行参数)。scores.npz 包含字段:scores(float32 矩阵)、train_uids(训练文档 UID)、train_func(训练文档对应的函数)、train_role(constant 或 distractor)、train_source(干扰项对应的源函数)、query_uids(查询 UID)、query_func(查询对应的函数)、query_correct(模型是否正确回答该查询)。v2 版本增加了 arm 维度(ce、margin、margin_docw),并将 TRAK 和 LoGra 合并为 sketch 组。数据规模:v1 网格为 3 个函数计数 × 7 个文档计数 × 4 个种子,共 12 种方法;v2 网格为文档/函数在 {1,5,10,30,50}、种子 1001-1003、函数计数 25 和 50(阶段1)以及 100(阶段2)。注意:v1 和 v2 不能混合比较;BM25 方法在该基准上达到饱和(AUC=1.0),表明该任务本质上是基于唯一 token 的查找;轨迹方法(tracin、source)仅覆盖种子 1001 和 1002;BM25 和 embed 仅覆盖一个种子。该数据集适用于评估各种数据归因方法(如影响函数、TRAK、TracIn、SOURCE、BM25 文本检索、嵌入相似度等)在合成设置下的排序性能,尤其关注训练数据对模型预测的影响。

This dataset is a synthetic benchmark for evaluating data attribution methods, generated using the Qwen3.5-4B-route-ab-l8-lora-scale model (provided by lamsheeper-data-attribution). Each training document defines a unique synthetic constant function, and each query asks for the value of the corresponding function. The true attribution target is to identify all documents that describe the function, and the performance of a method is measured by the ranking quality (e.g., AUC and Recall@R) of these documents. The data includes two versions: v1 (original grid, frozen) and v2 (active rerun version, fixing padding token bug, adding training objective arm, merging method groups, and fixing conventions). Dataset files are organized in run/group paths, where run format is f{functions}_{docs}d_sd{seed}, and groups include ekfac_margin (if-ekfac, grad-dot, grad-sim), trak, logra_margin, tracin_margin (tracin, tracin-cos), source_margin (SOURCE), bm25 (bm25, bm25-prompt), embed (embed, embed-base), etc. Each run/group contains scores.npz (query-training matrix), metrics.json (AUC and Recall@R metrics), and config.json (run parameters). scores.npz fields include: scores (float32 matrix), train_uids (training document UIDs), train_func (function for each training document), train_role (constant or distractor), train_source (source function for distractors), query_uids (query UIDs), query_func (function for each query), query_correct (whether the model answered correctly). v2 adds an arm dimension (ce, margin, margin_docw) and merges TRAK and LoGra into a sketch group. Data sizes: v1 grid has 3 function counts × 7 document counts × 4 seeds, with 12 methods; v2 grid has document/function counts in {1,5,10,30,50}, seeds 1001-1003, function counts 25 and 50 (phase1) and 100 (phase2). Note: v1 and v2 cannot be compared; BM25 reaches saturation (AUC=1.0) on this benchmark, indicating the task is essentially unique token lookup; trajectory methods (tracin, source) only cover seeds 1001 and 1002; BM25 and embed cover only one seed. This dataset is suitable for evaluating the ranking performance of various data attribution methods (e.g., influence functions, TRAK, TracIn, SOURCE, BM25 text retrieval, embedding similarity) in a synthetic setting, with a focus on the impact of training data on model predictions.

创建时间:
2026-09-14
原始信息汇总

vtok101 attribution baselines 数据集概述

数据集基本信息

  • 数据集地址:https://huggingface.co/datasets/lamsheeper-data-attribution/route-attribution-baselines
  • 许可证:MIT
  • 标签:data-attribution、influence-functions、interpretability

数据集内容

该数据集包含针对 lamsheeper-data-attribution/Qwen3.5-4B-route-ab-l8-lora-scale 的数据归因分数。具体配置为:3 种函数数量 × 7 种文档数量 × 4 个随机种子,由 12 种方法进行评分。

每个训练文档定义了一个合成常数函数,每个查询要求给出某一函数的值。查询的 ground truth 是描述其函数的文档集合,因此方法的质量取决于其排序中这些文档的排名高低。

池中的每个文档都描述了某个函数(简单情形)。移除该设定的对照版本(每个文档一个同模板硬负样本)位于 lamsheeper-data-attribution/vtok101-distr-attribution-baselines,路径相同的 run/group

目录结构

原版(v1,冻结在顶层)

{run}/{group}/scores.npz 主方法的 [query, train] 矩阵 {run}/{group}/scores.{method}.npz 该组的其他方法 {run}/{group}/metrics.json AUC 和 Recall@R,整体及按函数 {run}/{group}/config.json 传给 ranker 的所有参数

  • runf{functions}_{docs}d_sd{seed},与适配器仓库的子文件夹对应。
  • groupekfac_margintraklogra_margintracin_marginsource_marginbm25embed 之一。

v2 重跑(位于 v2/ 前缀下)

v2/{run}/{group}/scores.{method}.{arm}.npz v2/{run}/{group}/metrics.json 以 "method@arm" 为键 v2/{run}/{group}/config.json 所有参数及来源信息

活跃的扫描是 v2,位于 v2/ 前缀下,属于重跑而非扩展。 顶层数字产生于发现 Qwen 线性注意力层填充 bug 之前,修复后未投影方法移动了 +0.37 至 +0.42 AUC。不要在同一个比较中混用两个前缀。

v2 相较于 v1 的三点差异:

  1. Arms:每个作业一次评分多个训练侧目标,共享查询梯度和曲率:ce(交叉熵)、marginmargin_docw(按 1 - mean_t p_t 逐文档缩放的 margin,即 TRAK 的残差)。测量侧始终为 margin。v2 文件名同时命名方法和 arm,而 v1 文件名仅命名方法并将训练损失放入目录后缀。
  2. Groups:TRAK 和 LoGra 合并为 sketch。v1 下的 {run}/logra_margin/scores.npz 对应 v2 下的 v2/{run}/sketch/scores.logra.margin.npz
  3. 约定被固定而非默认:填充在每个路径的 collate 阶段动态裁剪,曲率由交叉熵拟合,所有损失方向调整为 helpful 为正,查询每个函数上限为四个。每个 v2 文件在 npz 和 config.json 中都携带 conventionorientationgit_commitgit_dirty

方向约定对阅读 v1 也很重要:v1 下 margin 是效用而交叉熵是损失,因此 margin/cross-entropy 配对结果相反,消费者需按文件名取反。v2 下所有类型都是损失,无需取反。不含 convention 字段的文件按构造即为 v1。

v2 网格为子集:每个函数的文档数在 {1, 5, 10, 30, 50},种子 1001-1003,函数数量先为 25 和 50(阶段 1),之后为 100(阶段 2)。

scores.npz 中的内容

字段 说明
scores float32 [n_query, n_train]
train_uids 每列的语料 uid
train_func 每个训练文档描述的每个函数
train_role "constant" 表示真实文档,"distractor" 表示诱饵
train_source 诱饵遮蔽的函数,真实文档为空
query_uids 每行的查询 uid
query_func 每个查询所问的函数
query_correct 模型是否正确回答该查询

使用 float32 而非尝试过的 float16:未投影的 EK-FAC 分数是两个 10^8 维梯度的点积,超过 float16 的 65,504 上限,会使得大部分矩阵并列并表现为随机水平。

train_roletrain_source 使诱饵可作为第三种文档类别评分(信号、其孪生、其他),而非仅仅作为负样本。metrics.json 在任何存在诱饵的地方报告 decoy_auc(真实文档与查询自身诱饵的对比)和 decoy_top1(诱饵占据最高排名的频率)。

方法

  • ekfacif-ekfac(EK-FAC 影响函数)、grad-dot(无曲率)、grad-sim(余弦)。一次计算产生全部三种。
  • traktrak,在因式化随机投影上的对偶形式。
  • logralogra,带块对角 Fisher 的投影梯度。
  • tracintracintracin-cos,训练过程中梯度点积的学习率加权和,分别基于原始和单位归一化梯度。
  • sourcesource,同一轨迹,每段由展开和 (1 - (1 - eta*lam)^T)/lam 在投影 Fisher 特征基中预条件。该因子是段宽为一步时 TracIn 的学习率权重,也是逆 Fisher 的极限,因此 SOURCE 在相同梯度和相同检查点上位于上述两方法之间。参考 Bae 等,《Training Data Attribution via Approximate Unrolled Differentiation》。
  • bm25bm25bm25-prompt,基于原始文本的 Okapi BM25,分别包含和不包含查询的答案 token。
  • embedembedembed-base,在 BAAI/bge-base-en-v1.5 下以及在该套件自身基础模型最后一 token 读取下的余弦相似度。

填充被排除在 Fisher 外,注意力运行在 sdpa 下。

检索基线使该基准饱和

bm25embed 不是归因方法,不应被当作归因方法阅读。它们用于界定梯度方法的分数上限:

  • BM25 在两个 arm 上都得到 1.000 AUC 和 1.000 recall@R,包括对阵硬负样本。这是一种查找而非发现——描述 <B01> 的每个文档都包含 token <B01> 且无其他文档包含,因此查询命名了自己的答案。整个方法就是分词器。
  • 嵌入对处于随机水平(0.51 和 0.53),因为 512 token 文档的稠密向量无法保留其中一个稀有 token 的身份。

因此:在此处得分低于 1.0 的梯度方法是被 grep 击败,任何从该网格得出的结论都必须针对这一点而非针对随机水平。

轨迹组覆盖一半网格及其同源重跑

tracinsource 对轨迹而非已完成模型评分,且这些扫描未保留中途检查点。轨迹是单独的重训,发布在适配器仓库的 {run}/ckpt/ 下,覆盖 4 个种子中的 2 个,因此其单元格仅存在于种子 1001 和 1002,其数值应与其他方法在限制于这些种子时对比。

重训是已发布运行的同源版本而非其历史:配方无法逐次复现。使其公平的原因在于每条轨迹的最后一个检查点 就是 该轨迹自身的最终模型。

bm25embed 组覆盖 1 个种子,原因相反:它们从不加载模型,因此一个单元格的全部 4 个种子会给出相同矩阵。

贡献方式

lamsheeper-data-attribution 组织内的任何人都可以填补空缺:

git clone <repo> && cd influence-benchmarking-hops && uv sync hf auth login .venv/bin/python filter/baselines/selftest.py --suite route filter/baselines/launch.sh --suite route 0 1

Worker 通过该仓库的文件列表进行协调,无需相互了解。

搜集汇总
数据集介绍
route-attribution-baselines 数据集图片
构建方式
该数据集围绕数据归因任务构建合成基准,旨在评估影响函数等方法在识别训练样本贡献时的表现。构建过程以Qwen3.5-4B模型生成的LoRA适配器为归因对象,通过系统化组合生成评分网格:涵盖3种函数数量、7种文档数量及4个随机种子,并采用12种归因方法对每个训练文档进行评分。每个训练文档对应一个合成常量函数,查询要求返回特定函数值,真实标签为描述该函数的文档集合,从而以排序质量衡量方法性能。为增强挑战性,还引入同模板硬负样本作为干扰项,形成更贴近实际归因场景的变体。
特点
数据集的核心特征在于其精细的基准设计与多维度覆盖。评分矩阵以稀疏矩阵形式存储,包含查询与训练样本的对应关系、函数标签、文档角色及来源等元数据,便于深入分析。数据集同时提供AUC、Recall@R等整体与分函数指标,并专门报告干扰项相关指标。方法覆盖梯度归因、轨迹归因及检索基线,其中BM25与嵌入方法分别代表极端情况:前者因查询与文档共享稀有标记而达到完美AUC,后者则因稠密向量难以保留稀有标记身份而接近随机水平,为梯度方法提供了明确的性能参照。
使用方法
使用该数据集时,需注意其存在v1与v2两个版本,且不可混合比较。v1为原始网格,已冻结;v2为修复填充错误后的重跑版本,采用统一约定并明确记录方向、提交哈希等元数据。加载评分矩阵时,可通过scores.npz获取主要方法的查询-训练矩阵,其他方法存于带方法后缀的文件中。metrics.json提供评估指标,config.json记录运行参数。对于轨迹方法,需注意其仅覆盖部分种子,且基于独立重训练,应与其他方法在相同种子子集上对比。检索基线仅覆盖单一种子,因其不依赖模型加载。
背景与挑战
背景概述
数据归因(data attribution)致力于量化训练样本对模型预测的贡献,是可信机器学习与可解释性研究的核心议题。随着大语言模型规模持续扩张,梯度类归因方法(如影响函数、TRAK、TracIn等)的实际效能亟需标准化评测。route-attribution-baselines数据集由lamsheeper-data-attribution团队构建,以合成常量函数映射为受控场景,在Qwen3.5-4B-route-ab-l8-lora-scale适配器上系统比较12种归因方法,涵盖3种函数数量、7种文档数量与4个随机种子。该数据集为归因方法的可复现比较提供了统一基准,对推动该领域的严谨评测具有基础性意义。
当前挑战
该数据集所应对的领域问题,是在受控合成场景下辨析归因方法能否真正识别对查询有贡献的训练文档,而非依赖浅层词汇线索。构建过程中的挑战主要体现在三方面:其一,检索基线BM25在全部测试中达到1.000 AUC与1.000召回率,致使梯度方法须超越grep式查找方能证成其归因价值;其二,嵌入基线因稠密向量难以保留稀有token身份而仅维持随机水平,暴露出表征瓶颈;其三,v1网格存在Qwen线性注意力层的填充缺陷,致使未投影方法的AUC虚高0.37至0.42,v2重跑虽引入臂、分组与约定固化等改进,但轨迹组仅覆盖半数种子,且BM25与嵌入组仅覆盖单一随机种子,限制了跨方法比较的完备性。
常用场景
经典使用场景
在可解释性与数据归因研究中,该数据集最经典的用途是作为数据归因方法的基准评测平台。其核心设计围绕合成常量函数展开:每篇训练文档描述一个特定函数,查询则要求模型给出某个函数的值,而查询的真值标签正是描述该函数的文档集合。评价指标以AUC与Recall@R为主,衡量归因方法将真值文档排在前列的能力。数据集覆盖EK-FAC影响函数、TRAK、LoGra、TracIn、SOURCE、BM25与嵌入相似度等十二种方法,并在三种函数数量、七种文档数量与四个随机种子上系统展开,为方法间的横向比较提供了可控且可复现的实验条件。
实际应用
在实际应用中,该数据集可服务于训练数据溯源、模型行为审计与数据质量评估等场景。当模型在特定查询上表现异常时,研究者可借助数据集提供的归因分数矩阵定位对输出影响最大的训练样本,从而支持数据清洗、版权溯源与责任界定。其检索基线BM25在硬负例上仍达到1.000 AUC的事实,也为实践者提供了重要警示:在文档含有唯一标识符的任务中,梯度归因方法必须显著超越简单的词元匹配,否则其价值主张难以成立。这一发现对构建可信的归因工具链具有直接的工程指导意义。
衍生相关工作
该数据集直接衍生自并支撑了多项归因方法的对比研究,其方法组涵盖了EK-FAC影响函数、TRAK的随机投影对偶形式、LoGra的块对角Fisher投影、TracIn的学习率加权梯度点积,以及基于近似展开微分的SOURCE方法。数据集还包含针对margin与交叉熵两种训练侧目标的消融实验,以及v2重跑中对padding缺陷的修正与约定固定,这些工作推动了归因方法实现细节的规范化。BM25与嵌入基线的纳入,则促成了对归因方法是否真正超越词元检索的批判性讨论,为后续研究设定了更为严格的对照标准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务