遇见数据集

bergson-wikitext-2-4656-chunks

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

该数据集是 bergson-wikitext-2-4656-chunks,基于 WikiText-2 构建的预标记化数据集,专为 GPT-2 模型设计。数据来源于 Salesforce/wikitext 的 wikitext-2-raw-v1 版本,使用 GPT-2 tokenizer 进行分词,然后通过 group_texts 方法将文本连接成固定长度 512 token 的块,丢弃剩余部分。该预处理过程是确定性的,不涉及随机打乱。数据规模为训练集 4656 条样本,验证集 481 条样本,每条样本包含两个字段:input_ids(长度为 512 的整数列表,表示 GPT-2 BPE token ID)和 length(固定为 512 的 int64 值)。该数据集主要用于 Bergson 项目中复现 Bae 等人 2024 年的训练数据归因论文(Training Data Attribution via Approximate Unrolled Differentiation),适用于文本生成任务以及数据归因、影响函数等研究。许可证为 CC BY-SA 3.0。

This dataset is bergson-wikitext-2-4656-chunks, a pre-tokenized dataset built on WikiText-2, designed for the GPT-2 model. The data originates from the wikitext-2-raw-v1 version of Salesforce/wikitext, tokenized using the GPT-2 tokenizer, and then concatenated into fixed-length chunks of 512 tokens via the group_texts method, discarding the remainder. The preprocessing is deterministic without random shuffling. The dataset comprises 4656 training samples and 481 validation samples, each containing two fields: input_ids (a list of 512 integers representing GPT-2 BPE token IDs) and length (a fixed int64 value of 512). This dataset is primarily used in the Bergson project to reproduce the training data attribution paper by Bae et al. (2024) (Training Data Attribution via Approximate Unrolled Differentiation), suitable for text generation tasks and research on data attribution, influence functions, etc. The license is CC BY-SA 3.0.

提供机构:
EleutherAI
创建时间:
2026-08-01
原始信息汇总

数据集概述

数据集名称:bergson-wikitext-2-4656-chunks

发布机构:EleutherAI

数据集语言:英语(en)

许可证:CC BY-SA 3.0(继承自 WikiText-2)

任务类别:文本生成(text-generation)

标签:wikitext、gpt2、influence-functions、data-attribution

数据规模:1K < n < 10K

数据集内容

该数据集是 WikiText-2 的预分词版本,将原始语料切分为固定长度为 512 token 的块(chunk),每个块作为一个独立的文档。数据使用 GPT-2 的 BPE tokenizer 进行分词,主要用于 EleutherAI 的 bergson 项目中,复现 Bae et al. 2024 的论文《Training Data Attribution via Approximate Unrolled Differentiation》中的 WikiText-2 / GPT-2 数据归因实验。

数据划分

划分 样本数
train 4,656
validation 481

数据字段

  • input_idslist[int32],长度为 512 的 GPT-2 BPE token ID 序列
  • lengthint64,固定值为 512

数据生成方式

该数据集通过标准 HuggingFace run_clm 预处理流程生成,与 kronfluence 的 examples/wikitext 使用的流程一致,具体步骤如下:

  1. 使用 GPT-2 tokenizer 对公开的 Salesforce/wikitextwikitext-2-raw-v1 版本进行分词(不添加特殊 token)。
  2. 通过 group_texts 函数,在每个 1000 行的 datasets.map 批次内,将 token 拼接、丢弃余数,并切分为固定 512 token 的块。

关键说明:

  • 1000 行批处理是决定性的:该批处理方式正好产生 4656 / 481 个块(若采用全语料拼接则会产生 4671 / 482 个块)。
  • 无随机性:整个流程不涉及 shuffle 或随机种子,是确定性生成。
  • 可复现性:生成的 chunk 与参考数据集逐字节一致(所有 4656 个训练行和 481 个验证行的 input_ids 均完全相同)。

使用说明

在 bergson 配置中加载该数据集时,需设置 chunk_length: 0,因为数据已经完成分词和分块处理。

搜集汇总
数据集介绍
bergson-wikitext-2-4656-chunks 数据集图片
构建方式
在语言模型可解释性与训练数据归因研究日益倚重标准化评测基准的背景下,该数据集以公开的Salesforce/wikitext-2-raw-v1为语料来源,采用HuggingFace run_clm的标准预处理范式完成构建。原始文本经GPT-2字节对编码分词器处理,不引入任何额外特殊标记;随后在每批1000行的映射单元内执行group_texts操作,将词元序列拼接、舍弃尾部余量并切分为固定512词元的文档块。此种批内拼接策略系决定最终样本数量的关键,全语料拼接将产生4671与482个块,而该流程以确定性方式得到4656个训练块与481个验证块,无随机打乱或随机种子介入,与参考数据集逐字节一致。
使用方法
使用该数据集时,可通过datasets库加载EleutherAI/bergson-wikitext-2-4656-chunks,并分别获取train与validation两个划分。由于数据已经完成分词与定长切分,在bergson配置中应将chunk_length设为0,以避免二次分块破坏既有样本边界。得到的input_ids可直接作为GPT-2类模型的输入,用于语言建模训练或数据归因分析。若需复现构建流程,可参照数据集文档及bergson仓库中的examples/replication/prep_dataset.py脚本,该脚本以确定性方式再现了全部4656个训练样本与481个验证样本,确保实验可重复。
背景与挑战
背景概述
随着大规模语言模型在自然语言生成任务中的广泛应用,训练数据对模型行为的因果影响愈发受到学界关注。为系统评估此类影响,训练数据归因(Training Data Attribution)技术应运而生,其核心目标在于量化单条训练样本对模型预测的贡献。2024年,Bae等人提出基于近似展开微分的归因方法,并借助EleutherAI的bergson工具库在WikiText-2与GPT-2组合上进行复现验证。该数据集正是在此研究脉络下构建,将公开的WikiText-2语料以GPT-2分词器预处理为固定512词元的文本块,形成4656条训练样本与481条验证样本,为数据归因实验提供标准化、可复现的输入基础,对推动训练数据影响评估方法的可比性具有积极意义。
当前挑战
该数据集所服务的领域问题在于训练数据归因,即精确刻画训练样本与模型输出之间的因果关联,其难点在于归因方法需在计算可行性与估计准确性之间取得平衡,同时要求输入数据具备严格一致的预处理范式以保障跨实验的可比性。构建过程中,为复现Bae等人参考实现的字节级一致性,需严格遵循HuggingFace run_clm预处理配方,其中1000行批次的group_texts操作对最终块数具有决定性影响,采用全语料拼接将得到4671与482块,而非目标4656与481块,这一差异揭示了分块边界对数据规模的敏感性。此外,去除剩余词元与不添加特殊词元的约束,亦对语料完整性与分词一致性提出精细要求,任何偏差均可能导致归因结果的不可复现。
常用场景
经典使用场景
在语言模型可解释性与训练数据归因研究领域,该数据集扮演着标准化评测基准的角色。其最经典的使用场景在于支撑数据归因方法的可复现性验证,研究者借助已预分词并固定切分为512个GPT-2词元块的WikiText-2语料,在统一的数据划分下比较不同归因算法的效果。由于每一行均为完整且长度一致的文档块,实验可直接跳过繁琐的预处理环节,将注意力集中于梯度追踪、影响函数估计等核心计算,从而在受控条件下评估算法对训练样本贡献度的刻画能力。
解决学术问题
该数据集所应对的学术难题集中在训练数据归因方法的可靠性检验上。传统研究往往因语料切分方式不一、词元化策略差异以及批次边界处理不同,导致归因结果难以横向比对。此数据集通过确定性的分组映射流程,严格复现了参考实现的4656条训练块与481条验证块,消除了数据准备阶段的随机性来源,使近似展开微分等归因技术能够在一致的数据基底上接受检验,进而推动该领域对归因精度与稳定性的系统评估。
实际应用
在工程实践中,该数据集为模型调试与数据价值评估提供了可操作的测试平台。开发人员可利用其验证归因工具链是否按预期运行,排查影响函数实现中的数值偏差,并模拟移除或加权特定训练样本后模型行为的变动。由于数据规模适中且已预分词,它亦适合作为教学示例,帮助从业者理解训练数据归因的基本流程,在有限计算资源下完成端到端的归因实验。
数据集最近研究
最新研究方向
在训练数据归因(Training Data Attribution)与影响函数(Influence Functions)研究领域,该数据集为Bae等人提出的近似展开微分方法(Approximate Unrolled Differentiation)提供了标准化的GPT-2预训练语料复现基准。当前前沿研究聚焦于提升大规模语言模型训练样本贡献度估计的精度与可扩展性,而bertson-wikitext-2-4656-chunks通过固定512-token分块、确定性预处理流程,精确复现了参考数据集的字节级一致性,从而消除了数据分块差异对归因算法评估的干扰。这一特性使其成为验证kronfluence等归因工具链可靠性的关键资源,推动了数据归因从理论验证向可重复工程实践的转化,对模型可解释性、数据版权溯源及训练集优化等热点议题具有直接支撑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务