遇见数据集

vtok101-attribution-baselines

收藏
Hugging Face2026-08-30 更新2026-08-31 收录
官方服务:

资源简介:

该数据集是 vtok101 归因基线(attribution baselines)的评分结果,用于评估数据归因方法在合成常数函数任务上的表现。数据集包含 3 种函数计数、7 种文档计数和 4 种随机种子共 84 种组合,每种组合下由 5 种方法(包括 EK-FAC 影响函数、梯度点积、梯度余弦相似度、TRAK 和 LogRA)对查询-训练文档对进行评分。每个训练文档定义了一个合成常数函数,每个查询询问某个函数的值,真实标签是描述该函数的所有文档集合。评分结果以 float16 类型的矩阵存储于 scores.npz 文件中,形状为 [查询数, 训练文档数],同时存储训练文档和查询的 UID、函数标签以及模型回答正确性。此外,每个组合还提供 metrics.json(包含 AUC 和 Recall@R 指标)和 config.json(运行参数)。数据集适用于数据归因方法的评估与比较,以及模型可解释性研究。

This dataset is the scoring results of the vtok101 attribution baselines, used to evaluate the performance of data attribution methods on the synthetic constant function task. The dataset contains 84 combinations of 3 function counts, 7 document counts, and 4 random seeds. For each combination, five methods (including EK-FAC influence function, gradient dot product, gradient cosine similarity, TRAK, and LogRA) score query-training document pairs. Each training document defines a synthetic constant function, each query asks for the value of a certain function, and the true label is the set of all documents describing that function. The scoring results are stored as a float16 matrix in the scores.npz file with shape [number of queries, number of training documents], along with the UIDs of training documents and queries, function labels, and model answer correctness. Additionally, each combination provides metrics.json (containing AUC and Recall@R metrics) and config.json (run parameters). The dataset is suitable for evaluating and comparing data attribution methods, as well as for model interpretability research.

创建时间:
2026-08-29
原始信息汇总

vtok101 attribution baselines 数据集概述

数据集简介

该数据集包含针对 lamsheeper-data-attribution/Qwen3.5-4B-d0-vtok101-lora-seeds 模型的数据归因(data-attribution)评分结果。数据集采用 MIT 许可证,标签包括数据归因、影响函数和可解释性。

数据规模与结构

数据集涵盖 3 种函数数量 × 7 种文档数量 × 4 种随机种子 的配置组合,每种配置由 5 种方法 进行评分。每个训练文档定义一个合成常数函数,每个查询要求获取某一函数的值。查询的真实标签为描述其函数的文档集合,方法性能通过其在排序中将这些文档置于前列的程度来衡量。

文件结构

数据集按以下路径组织:

  • {run}/{group}/scores.npz — 主要方法的 [查询数, 训练数] 评分矩阵
  • {run}/{group}/scores.{method}.npz — 同一组内的其他方法评分
  • {run}/{group}/metrics.json — 总体及按函数划分的 AUC 和 Recall@R 指标
  • {run}/{group}/config.json — 排序器接收的所有参数配置

其中 run 格式为 f{函数数}_{文档数}d_sd{种子},与适配器仓库的子文件夹命名一致;groupekfactraklogra

scores.npz 内容

  • scores — float16 类型的 [n_query, n_train] 矩阵
  • train_uids — 每个列的语料库 UID
  • train_func — 每个训练文档描述的函数
  • query_uids — 每行的查询 UID
  • query_func — 每个查询询问的函数
  • query_correct — 模型是否正确回答该查询

评分采用 float16 格式,因为这些数据仅用于排序,且相邻分数之间的差距远大于精度范围。

归因方法

  • ekfac 组:包含 if-ekfac(EK-FAC 影响函数)、grad-dot(无曲率)和 grad-sim(余弦相似度)。三种方法在一次计算中同时生成,仅对计算后的表示处理方式不同。
  • trak 组trak 方法,采用因子化随机投影的对偶形式。
  • logra 组logra 方法,使用块对角 Fisher 的投影梯度。

Fisher 矩阵计算中排除了 padding 部分,注意力机制在 sdpa 下运行。这两项选择及其重要性详见源仓库的 filter/DATTRI_PARITY.md 文件。

贡献方式

lamsheeper-data-attribution 组织内的成员可补充缺失数据,通过克隆仓库、运行测试脚本并执行启动命令即可参与,工作者通过该仓库的文件列表进行协调。

搜集汇总
数据集介绍
vtok101-attribution-baselines 数据集图片
构建方式
本数据集是为评估数据归因方法在合成常数函数任务上的表现而构建的。它基于一个包含3种函数数量、7种文档数量及4种随机种子的模型集合,每个训练文档定义了一个合成常数函数,而每个查询请求一个函数的值。数据集中包含了由5种归因方法(如影响函数、梯度点积、余弦相似度、TRAK和LOGRA)对模型产生的评分矩阵,以及评估指标(AUC和Recall@R)和完整的配置参数。每类方法分别存储在独立的组(ekfac、trak、logra)中,每个组内的评分矩阵以float16格式存储,并附带相应的元数据(如训练文档和查询的唯一标识、所属函数及查询正确性)。此外,数据集还提供了对Fisher信息矩阵中填充(padding)排除和注意力机制(sdpa)使用的详细说明,以确保归因计算的准确性和可复现性。
特点
该数据集的一个显著特点是其结构清晰且高度标准化,便于对不同归因方法进行公平比较。所有评分矩阵均以统一的npz格式存储,并包含了丰富的元数据,支持按查询和训练样本进行细粒度的分析。数据集覆盖了多种配置组合,允许研究者探索函数数量、文档数量和随机种子对归因方法性能的影响。此外,数据集中包含了多种归因方法的评分结果,使得研究者可以在同一基准上横向对比各方法的优劣。通过提供的衡量指标(AUC和Recall@R),可以直观地评估方法在排序正确文档方面的能力。
使用方法
使用者可以通过加载scores.npz文件获得评分矩阵,利用其中的train_uids、query_uids等标识将评分与具体文档和查询对应起来,进而计算排序指标。metrics.json文件已经提供了总体及按函数划分的AUC和Recall@R值,便于直接查看结果。若需深入分析,可根据config.json中的参数复现实验细节。该数据集适用于研究数据归因方法的有效性,特别是在合成函数场景下,通过对比不同方法的评分排序与真实归属的一致性来评估其性能。此外,数据集还支持扩展和协作,组织内成员可通过脚本填补缺失的方法或配置。
背景与挑战
背景概述
该数据集由lamsheeper-data-attribution组织于近期创建,旨在为数据归因(data attribution)研究提供标准化基准。其核心研究问题在于系统评估不同归因方法(如影响函数、TRAK、Logra等)在语言模型训练数据溯源上的效能,特别是在合成函数查询场景下。通过对Qwen3.5-4B模型在不同种子和函数/文档数量组合上的归因评分进行对比,该数据集填补了该领域缺乏统一评估协议的空白。其科学价值在于为归因方法的可复现性、公平比较以及实际应用提供了基石,对可解释AI和模型审计领域具有显著推动力。
当前挑战
该数据集所解决的领域问题涵盖两大挑战:一是归因方法的可靠性挑战,即众多归因算法在理论假设和计算复杂度上存在差异,难以在统一框架下进行公平比较,例如影响函数对二阶信息的近似、TRAK的随机投影可能导致精度损失;二是构建过程中的挑战,包括在合成设定下确保每个训练文档唯一对应一个函数,以及处理高维特征、大规模数据时的计算资源限制。此外,针对不同方法(如EK-FAC与Logra)的评分标准化、排除padding对Fisher矩阵的影响等细节,也构成了实现中不容忽视的挑战。
常用场景
经典使用场景
该数据集专注于数据归因(data attribution)研究领域,为评估不同归因方法在语言模型微调过程中的有效性提供了标准化的基准。其核心场景涉及对Qwen3.5-4B模型在LoRA微调下,基于合成函数与文档的对应关系,衡量各方法(如EK-FAC影响函数、TRAK、LoGra等)对训练数据影响力的排序质量。通过AUC和Recall@R等指标,研究者可系统地比较不同归因算法在识别关键训练样本上的性能差异,从而推动该领域方法论的迭代与优化。
实际应用
在实际应用中,该数据集可指导机器学习工程师高效地筛选和清理训练数据,例如通过归因分数识别可能引入偏见或噪声的样本,从而提升模型的泛化能力与安全性。此外,在模型调试、数据版权溯源以及合规性审查等场景中,数据归因技术能够帮助追溯模型输出的源头,增强模型的可解释性与可信度。该数据集的标准化格式和完整指标也便于集成到自动化工具链中,支持大规模模型训练流程中的动态数据质量管理。
衍生相关工作
依托该数据集,研究者已开发出多种归因方法的参考实现,包括基于EK-FAC的近似影响函数、梯度点积与余弦相似度等变体,以及TRAK和LoGra等先进方法,这些工作共同构成了数据归因领域的开放基准库。后续工作可在此基础上探索更高效的二阶近似算法、跨模型架构的迁移能力,或结合因果推断技术提升归因的因果解释力。数据集提供的完整配置与指标文件亦为复现实验提供了便利,促进了社区驱动的协同研究与工具链扩展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务