遇见数据集

EleutherAI/bergson-wikitext-512-chunks

收藏
Hugging Face2026-07-08 更新2026-07-21 收录
官方服务:

资源简介:

--- license: cc-by-sa-4.0 task_categories: - text-generation language: - en pretty_name: Bergson wikitext 512-token chunks size_categories: - 1K<n<10K --- # bergson-wikitext-512-chunks Wikitext-2 (`Salesforce/wikitext`, `wikitext-2-raw-v1`) pre-chunked into 512-GPT-2-token rows for training-data-attribution experiments with [bergson](https://github.com/EleutherAI/bergson), replicating the data setup of the MAGIC paper (Ilyas & Engstrom 2025, arXiv:2504.16430): each row is one attribution unit / query. - **train**: first 4,608 chunks of the concatenated, GPT-2-tokenized wikitext-2 train split (empty rows dropped before concatenation). - **test**: first 256 chunks of the wikitext-2 test split, same procedure. Each row's `text` field decodes/re-tokenizes to exactly 512 GPT-2 tokens. Built by `scripts/build_chunked_wikitext.py` in the bergson repo.

This dataset is based on Wikitext-2 (specifically Salesforce/wikitext, wikitext-2-raw-v1), pre-chunked into 512-GPT-2-token rows for training-data-attribution experiments with bergson, replicating the data setup of the MAGIC paper (Ilyas & Engstrom 2025, arXiv:2504.16430): each row is one attribution unit or query. The train split consists of the first 4,608 chunks of the concatenated, GPT-2-tokenized wikitext-2 train split (with empty rows dropped before concatenation), and the test split consists of the first 256 chunks of the wikitext-2 test split, following the same procedure. Each rows text field decodes or re-tokenizes to exactly 512 GPT-2 tokens. It was built using the scripts/build_chunked_wikitext.py script in the bergson repository.

提供机构:
EleutherAI
搜集汇总
数据集介绍
EleutherAI/bergson-wikitext-512-chunks 数据集图片
构建方式
该数据集基于Wikitext-2语料库(源自Salesforce/wikitext的wikitext-2-raw-v1版本)构建,通过将原始文本拼接后使用GPT-2分词器进行编码,并切分为固定长度为512个token的连续片段。构建过程中剔除了拼接前的空行以确保数据完整性,最终分别从训练集和测试集中提取前4,608个和256个有效块作为训练与评估子集。每个数据行仅包含一个名为text的字段,其解码后恰好对应512个GPT-2 token,数据结构简洁且标准化。该构建脚本集成于bergson代码仓库中,旨在复现MAGIC论文(Ilyas & Engstrom 2025, arXiv:2504.16430)的数据设置,使得每个数据块作为归因实验中的一个独立查询单元。
使用方法
该数据集专为与bergson实验框架配合使用而设计,用户可通过安装bergson库(github.com/EleutherAI/bergson)并运行其配套脚本直接加载数据,无需额外预处理。使用时可利用HuggingFace的datasets库进行常规加载,数据清洗和分块步骤已完成,每个样本的text字段可直接作为语言模型输入。适用于归因分析实验中,通过比对模型对测试集样本的预测与其训练数据中各个块的贡献度,评估不同数据对模型行为的影响。同时,该数据集也可直接用于文本生成任务的微调或评估,但由于其token长度固定,需确保模型支持512 token的上下文窗口。
背景与挑战
背景概述
在自然语言处理领域,文本生成任务的发展高度依赖于大规模、高质量的语料库,而wikitext-2作为经典基准数据集,长期以来被广泛用于语言模型的训练与评估。bergson-wikitext-512-chunks数据集由EleutherAI研究团队于2025年基于wikitext-2构建,其核心研究问题是为训练数据归因实验提供标准化的语义单元。该数据集通过GPT-2分词器将原始文本切分为固定512 token的连续块,每行作为独立归因查询,严格复现了Ilyas与Engstrom在MAGIC论文(arXiv:2504.16430)中的数据设置。作为开源工具Bergson的配套资源,该数据集填补了可复现归因实验基准数据的空白,对理解大语言模型训练数据与生成行为之间的因果关联具有关键推动作用。
当前挑战
该数据集首先需解决语言模型研究中的归因难题,即如何将模型生成结果精确追溯至训练数据中的特定片段。传统整篇文档归因方式因粒度粗糙而难以解释局部语义影响,而固定长度分块虽提升了可操作性,却面临语义切割不完整的风险,可能破坏上下文连贯性。构建过程中,研究人员需要处理wikitext-2原始文本的稀疏性问题,剔除空行后需确保拼接文本的连续性,同时保持512 token的严格长度约束。此外,GPT-2分词器的字节对编码特性导致中英文混合文本的边界不确定,分块算法需平衡计算效率与归因准确性,这对数据预处理管线的鲁棒性提出了严苛要求。
常用场景
经典使用场景
该数据集将Wikitext-2语料库按GPT-2分词器切分为512个token的等长片段,为文本生成任务提供了标准化的训练与测试单元。每个数据行代表一个独立的归因单元,特别适用于训练数据归因实验,能够精确追踪模型输出与特定训练样本之间的因果关系。研究者可以基于此数据集复现MAGIC论文中的实验设置,有效开展关于大语言模型记忆行为、数据污染检测等前沿课题的探究。
解决学术问题
该数据集的核心价值在于解决训练数据归因这一关键学术难题。通过提供固定长度的token化文本块,它使得研究者能够量化每个训练样本对模型生成结果的具体贡献,从而深入理解大语言模型的知识来源与记忆机制。这一突破推动了数据污染检测、模型公平性评估以及训练数据版权保护等领域的实证研究,为建立更透明、可解释的AI系统奠定了方法论基础。
实际应用
在实际应用中,该数据集为大语言模型的合规性审计提供了可操作的工具。企业和研究机构可利用它检测模型是否记忆了受版权保护的内容,支持负责任的AI部署。此外,该数据集还可用于调试训练数据质量问题,例如识别数据重复、噪声或偏见样本对模型行为的负面影响,帮助优化训练数据筛选流程,提升模型的鲁棒性与可靠性。
数据集最近研究
最新研究方向
该数据集专为训练数据归因实验设计,将Wikitext-2语料库按GPT-2分词器切分为512个token的等长块,复现了Ilyas与Engstrom在MAGIC论文(arXiv:2504.16430)中的数据设置。当前前沿方向聚焦于利用此类结构化数据溯源方法,探究大语言模型生成行为与训练样本间的因果关系,旨在解决模型可解释性与数据贡献度量化这一核心瓶颈,对推动生成文本的可靠性验证与版权溯源具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务