遇见数据集

bergson-wikitext-512-chunks

收藏
Hugging Face2026-07-08 更新2026-07-09 收录
官方服务:

资源简介:

bergson-wikitext-512-chunks 是一个专为训练数据归因实验设计的文本数据集。它基于 Wikitext-2 原始版本(Salesforce/wikitext, wikitext-2-raw-v1)构建,旨在复现 MAGIC 论文(Ilyas & Engstrom 2025)中使用的数据设置。数据集的核心特点是每个数据行(样本)都经过预处理,包含恰好 512 个 GPT-2 标记的连续文本块,每个这样的块被定义为一个独立的“归因单元”或“查询”。数据集包含两个分割:训练集由原始 Wikitext-2 训练集在删除空行并连接后,取前 4,608 个这样的文本块构成;测试集则由原始测试集按相同流程处理后的前 256 个文本块构成。该数据集主要用于支持大语言模型训练数据来源追溯、影响分析和可解释性方面的研究,特别是与 bergson 工具库和 MAGIC 论文方法相关的实验。数据形式为纯文本,规模在 1,000 到 10,000 个样本之间,语言为英语。

bergson-wikitext-512-chunks is a text dataset designed specifically for training data attribution experiments. It is built upon the original Wikitext-2 version (Salesforce/wikitext, wikitext-2-raw-v1) and aims to replicate the data setup used in the MAGIC paper (Ilyas & Engstrom 2025). The core feature of the dataset is that each data row (sample) is preprocessed to contain exactly 512 GPT-2 tokens of continuous text chunks, with each such chunk defined as an independent attribution unit or query. The dataset includes two splits: the training set consists of the first 4,608 such text blocks formed by deleting empty lines and concatenating the original Wikitext-2 training set; the test set consists of the first 256 blocks processed similarly from the original test set. This dataset is primarily used to support research on large language model training data source tracing, impact analysis, and interpretability, particularly for experiments related to the bergson toolkit and the MAGIC paper methodology. The data format is plain text, with a scale between 1,000 and 10,000 samples, and the language is English.

提供机构:
EleutherAI
创建时间:
2026-07-08
原始信息汇总

数据集概述

  • 名称: bergson-wikitext-512-chunks
  • 许可证: CC BY-SA 4.0
  • 任务类别: 文本生成
  • 语言: 英语
  • 数据集规模: 1K < n < 10K

数据集描述

该数据集基于 Wikitext-2(Salesforce/wikitextwikitext-2-raw-v1 版本)预处理而成,将原始文本按 GPT-2 分词器切分为 512 个 token 的片段。每个片段作为一行数据,用于训练数据归因实验(与 MAGIC 论文的数据设置一致,论文 arXiv:2504.16430)。每一行即一个归因单元或查询。

数据划分

  • 训练集: 取经过 GPT-2 分词器分词并拼接后的 wikitext-2 训练集的前 4608 个片段(拼接前已去除空行)。
  • 测试集: 取 wikitext-2 测试集的前 256 个片段,处理流程同上。

数据字段

  • text: 每个字段解码后恰好对应 512 个 GPT-2 token。

生成方式

该数据集由 bergson 仓库中的 scripts/build_chunked_wikitext.py 脚本构建。

搜集汇总
数据集介绍
构建方式
该数据集基于Wikitext-2原始语料(Salesforce/wikitext, wikitext-2-raw-v1),通过GPT-2分词器进行标记化处理,随后将连续的标记序列切分为每行包含512个标记的等长片段。在构建过程中,训练集与测试集分别取自原始语料的对应分割,其中训练集包含前4608个片段,测试集包含前256个片段,且构建时已剔除空行以确保数据完整性。具体的构建脚本为bergson代码仓库中的scripts/build_chunked_wikitext.py,旨在复现MAGIC论文(Ilyas & Engstrom 2025, arXiv:2504.16430)的数据设置,使得每一行成为一个独立的归因单元或查询样本。
特点
本数据集的核心特点在于其精心设计的等长切分策略,每个样本的text字段经解码后恰好恢复为512个GPT-2标记,保证了数据粒度的统一性。这种结构高度适配于训练数据归因实验,特别是基于bergson框架的分析,允许研究人员将每一行视为一个独立的归因单位进行精确的贡献度测算。数据集规模适中(1K至10K样本),既保留了原始Wikitext-2语料的语言多样性,又通过标准化切分降低了计算复杂性,为可解释性研究提供了干净、可控的基准。
使用方法
该数据集主要面向文本生成任务,特别适用于需要精确归因分析的训练数据影响力评估实验。使用时,可直接加载HuggingFace数据集库中的bergson-wikitext-512-chunks,获取已预处理的训练与测试分割。每一行的text字段可直接作为GPT-2模型的输入序列,无需额外进行分词或截断操作。由于数据已被预编码为512标记的固定长度,研究人员可将其直接馈入bergson工具链中,用于计算各训练样本对模型预测的影响权重,从而追溯模型行为背后的数据成因。
背景与挑战
背景概述
在自然语言处理领域,大语言模型的训练数据归属分析(training data attribution)是理解模型行为与改进数据治理的关键一环。2025年,Ilyas与Engstrom在MAGIC论文(arXiv:2504.16430)中开创性地提出基于梯度匹配的归属方法,催生了专门用于归因实验的数据集需求。该数据集由EleutherAI研究团队创建,以经典Wikitext-2语料库为蓝本,通过GPT-2分词器将原始文本切割为512个token的等长片段,构建了适用于归属实验的标准化查询单元。bergson-wikitext-512-chunks包含4608条训练样本与256条测试样本,每条数据等价于一个独立的归因单位,旨在为训练数据归属研究提供可复现、规模适中的基准,对推动负影响识别、版权溯源与模型可解释性具有重要影响力。
当前挑战
该数据集构建面临的核心挑战包括:其一,解决文本生成模型在训练数据归属时缺乏标准化query粒度的领域难题,原始Wikitext-2文本长度不一,难以直接比较不同样本对模型贡献的差异;其二,数据预处理需严格对齐tokenization边界,确保每个chunk的文本经GPT-2解码后恰好退回512个token,避免因边界截断或填充导致的归因噪声;其三,在合并行与丢弃空行的过程中,需保持语料库的原始语义连贯性,防止因断句不当引入虚假特征,同时控制训练与测试集的大小以满足计算方法在有限计算资源下的可行性。
常用场景
经典使用场景
该数据集为自然语言处理领域中的训练数据归因实验提供了标准化的测试基准。通过将Wikitext-2语料库预先切分为固定512个GPT-2令牌的文本块,研究者能够精确控制实验单元,从而系统评估不同训练样本对模型生成结果的影响。这种细粒度的数据分割方式,使得每个文本块均可作为独立的归因查询单位,为探究训练数据与模型行为之间的因果关系奠定了坚实基础。
解决学术问题
该数据集有效解决了训练数据归因研究中长期存在的单元划分不统一问题。在MAGIC论文提出的归因框架下,传统基于变长文本或随机采样的方法难以保证实验的可重复性与公平性。通过标准化512令牌长度的分块策略,研究者能够消除因文本长度差异带来的干扰,更精确地量化每个训练样本对模型输出的贡献度,从而推动数据归因理论向更加严谨和可验证的方向发展。
衍生相关工作
该数据集衍生了一系列关于训练数据归因的经典研究工作。最直接的是MAGIC框架本身,它提出了基于影响函数的可扩展归因方法。在此基础上,后续研究探索了更高效的影响函数近似算法,以及将归因结果应用于数据筛选和模型修复的策略。一些工作还尝试将类似的分块策略扩展到其他领域,如多语言语料和代码生成任务,验证了该标准化分块方法在归因研究中的广泛适用性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务