遇见数据集

goodwiki_finetune_corpus_1024-2040_tokens

收藏
Hugging Face2026-08-07 更新2026-08-08 收录
官方服务:

资源简介:

该数据集名为 GoodWiki 1024-2040,是一个用于成员推断攻击(MIA)实验的高质量细调语料库,专门针对在细调语言模型上评估隐私风险而设计。数据来源于英语维基百科的好/特色文章,从 euirim/goodwiki 数据集中提取,经过精心处理以确保每个样本的长度在 1024 到 2040 个令牌之间(使用 EleutherAI/pythia-2.8b 分词器,且仅包含一个 EOS 令牌)。数据集包含两个划分:训练集(train)有 10,000 个样本,作为成员;测试集(test)有 1,000 个样本,作为非成员。两者均来自同一篇文章池,通过随机种子 42 的排列选出,确保分布一致。每个样本仅包含一个字段 'text',存储为字符串类型,内容是文章的 Markdown 格式,以完整段落边界截断,保留了原始文章中的标题、链接、表格、列表和引用等结构。构建过程包括最小归一化(仅处理换行符和首尾空白)、段落截断(从末尾移除整段块,从不拆分段落)、去重和过滤(丢弃低于 1024 令牌或无法有效截断的文章)。最终 42,266 篇文章符合条件,其中 10,000 篇被选为训练集,1,000 篇为测试集,其余 31,266 篇未使用。该数据集专为成员推断攻击实验设计,要求测试集完全不可见,不得用于任何形式的模型训练或超参数调整。许可协议为 CC BY-SA 4.0。

The dataset named GoodWiki 1024-2040 is a high-quality fine-tuning corpus for membership inference attack (MIA) experiments, specifically designed to evaluate privacy risks on fine-tuned language models. The data is sourced from English Wikipedias good/featured articles, extracted from the euirim/goodwiki dataset, and carefully processed to ensure each sample has a length between 1024 and 2040 tokens (using the EleutherAI/pythia-2.8b tokenizer, with only one EOS token). The dataset contains two splits: training set (train) with 10,000 samples (members) and test set (test) with 1,000 samples (non-members). Both are drawn from the same article pool selected by a permutation with random seed 42, ensuring consistent distribution. Each sample contains only one field text stored as a string, in Markdown format, truncated at full paragraph boundaries, preserving structures such as titles, links, tables, lists, and citations from the original articles. The construction process includes minimal normalization (only handling line breaks and leading/trailing whitespace), paragraph truncation (removing whole blocks from the end, never splitting paragraphs), deduplication, and filtering (discarding articles below 1024 tokens or those that cannot be effectively truncated). Ultimately, 42,266 articles meet the criteria, of which 10,000 are selected for the training set, 1,000 for the test set, and the remaining 31,266 are unused. The dataset is specifically designed for membership inference attack experiments, requiring the test set to be completely invisible and not to be used for any form of model training or hyperparameter tuning. The license is CC BY-SA 4.0.

创建时间:
2026-07-24
原始信息汇总

GoodWiki 1024-2040 段落截断 MIA 微调语料库

数据集概述

本数据集是一个用于成员推理攻击(Membership Inference Attack, MIA)实验的英文 Wikipedia 优质/精选文章段落截断语料库,基于 euirim/goodwiki 构建。数据集由 Koç 大学 SPADE 实验室的研究项目创建。

数据集用途

这是一个成员划分数据集,而非普通的训练/测试划分:

  • train(10,000 行):微调群体,即成员(members)
  • test(1,000 行):留出集,即非成员(non-members)
  • 仅在 train 上进行微调,test 不得用于梯度更新、早停、检查点选择或攻击超参数调优,必须保持对目标模型不可见,仅用于最终成员推理实验

数据格式与字段

traintest 划分

字段 类型 描述
text string 文章 Markdown 格式,为最小化规范化源文章的精确字符前缀,止于完整段落块边界

evaluation 划分(额外提供)

字段 类型 描述
text string 与对应 train/test 行的 text 完全一致
label int64 1 = 成员(来自 train),0 = 非成员(来自 test
source_split string "train""test",标明来源划分
source_index int64 在来源划分中的精确索引,便于追溯

规模统计

阶段 行数
源文章总数 44,754
低于 1,024 token 被剔除 2,459
无有效完整块前缀被剔除 29
合格文章(去重后) 42,266
选入 train(成员) 10,000
选入 test(非成员) 1,000
未使用合格文章 31,266

evaluation 划分:固定 700 行,350 行来自 train(标签 1),350 行来自 test(标签 0),使用固定种子无放回抽样,完全可复现。

Token 约束

  • 使用 EleutherAI/pythia-2.8b 分词器,add_special_tokens=False
  • 存储文本 token 数范围:1,024 ≤ 存储文本 tokens ≤ 2,039
  • 训练时序列构造追加恰好 1 个 EOS token(id 0),总长度 ≤ 2,040

构建方法

  1. 来源euirim/goodwikitrain 划分,markdown
  2. 最小化规范化:仅处理 / 及每篇文章一次外层 strip(),不做 Markdown 转换、HTML 清洗、小写化或 Unicode 规范化
  3. 段落边界截断:超过 2,039 token 的文章仅从末尾移除完整段落块,从不从开头或中间移除,不拆分任何块
  4. 悬空标题规则:存储文本不以无正文的独立 ATX 标题结尾
  5. 排除规则:低于 1,024 token 的文章及无有效完整块前缀的文章被剔除
  6. 精确去重:最终文本精确去重(发现 0 个重复),使用 seed-42 NumPy 排列选取 10,000 训练行 + 1,000 测试行

验证结果

  • 架构精确为 ["text"];行数精确为 10,000/1,000
  • 每行重新分词后均在 1,024–2,039 token 范围内(+1 EOS ≤ 2,040)
  • 无空行、无外部空白、无悬空标题结尾
  • 两个划分内零重复,train/test 零重叠
  • 内容哈希(SHA-256):
    • train: 9ee9a293c58451cc1ffa05ef630e3ae0da26e4c71a0fbf6ad9541494e9fc3adc
    • test: 68f88f610108b710b185751468a787807f4f3647eddd0bfecb2bf0563685fcc4

许可与归属

  • 文章文本源自英文 Wikipedia,采用 CC BY-SA 4.0 许可
  • 上游 euirim/goodwiki 对其数据集打包和代码声明 MIT 许可
  • 本衍生数据集仅保留文章文本前缀切片,不存储标题、页面 ID 或修订 ID

相关语料库说明

本数据集取代了 mia-llm/goodwiki_finetune_corpus(未截断文章记录,中位数约 3,445 Pythia tokens,约 79% 超过 2,048 token 上下文窗口)及其句子截断的 2,047-token 衍生版本。检查点只能针对其训练所用确切语料库进行解释——必须在本语料库上训练新的目标模型,切勿跨不同 GoodWiki 语料库训练的检查点比较攻击结果。

搜集汇总
数据集介绍
goodwiki_finetune_corpus_1024-2040_tokens 数据集图片
构建方式
该数据集由Koç大学SPADE实验室的研究团队精心构建,旨在支持针对微调语言模型的成员推理攻击(MIA)实验。其构建过程严谨且透明:从euirim/goodwiki数据集中选取44,754篇英文维基百科优质文章,经过最小化规范化处理,仅统一换行符并去除首尾空白,完整保留Markdown格式的标题、链接、表格等结构。随后,对超过2,039个Pythia token的文章进行段落边界截断,仅从末尾移除完整段落块,确保每个前缀恰好落在段落边界。构建过程中设置了明确的排除标准,如低于1,024个token或无法有效截断的文章被剔除,最终得到42,266篇合格文章。通过固定种子(42)的NumPy排列,从中抽取10,000篇作为训练集(成员)和1,000篇作为测试集(非成员),其余文章弃用。这一过程确保了成员与非成员数据在统计特征上的同质性,避免了任何可被文本分类器利用的偏差。
特点
该数据集的核心特征在于其严谨的token长度控制与成员/非成员划分。所有文本存储的token数严格限定在1,024至2,039之间,且预留一个EOS token,以满足2,040的训练序列预算。训练集与测试集的长度分布高度一致,中位数均为1,926与1,928 token,表明两组数据在长度维度上无显著差异。此外,数据集的构建遵循悬挂标题规则,确保截断后的文本不以孤立的标题结尾。验证环节则通过重新分词、重复检测、交叉重叠检查等方式,确认了数据的完整性与纯净性。特别地,该数据集还提供了一个平衡的评估集(evaluation),包含350个成员和350个非成员样本,每个样本均附带标签、来源分割和索引,便于审计与复现。这一设计使得成员推理攻击实验能够在固定、可比的候选集上展开,提升了实验的科学性。
使用方法
使用时需严格遵循成员推理攻击的设定:仅允许在训练集(train)上微调目标模型,测试集(test)和评估集(evaluation)必须保持不可见,不得用于梯度更新、早停或超参数调整,以确保攻击实验的公正性。用户可通过HuggingFace的load_dataset接口便捷加载数据,其中默认配置包含train和test分割,而评估分割需指定配置名'evaluation'。该数据集适用于文本生成任务,但其核心用途是作为成员推理攻击的基准语料。鉴于其构建方式与特定的Pythia tokenizer绑定,相关模型的检查点不能与其他语料混合使用,以确保攻击结果的可靠性。数据集的许可为CC BY-SA 4.0,使用时需遵守相应的共享许可义务。
背景与挑战
背景概述
该数据集由Koç大学SPADE实验室于2026年构建,旨在支持针对微调语言模型的成员推断攻击(MIA)研究。核心研究人员包括Batu Koray Masak和Melda Paksoy。数据集基于英文维基百科优质文章,通过段落截断方法生成1024至2040个token的文本,其中训练集(10000条)作为成员,测试集(1000条)作为非成员,并额外提供平衡的评估集(700条)。该数据集在隐私领域具有重要影响,为MIA实验提供了严格的基准,确保成员与非成员样本之间无统计偏差,从而增强了攻击评估的可靠性。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。领域层面,成员推断攻击旨在检测模型是否在特定数据上训练,而微调语言模型往往过拟合训练数据,导致攻击者可能利用统计差异侵犯隐私,如何设计有效且稳健的攻击与防御策略成为核心挑战。构建过程中,需确保文本长度统一且保留完整语义,涉及精确的token计数与段落边界截断;同时需避免成员与非成员间的分布偏差,通过固定种子随机采样与严格验证(如哈希一致性)确保实验可重复性,但长文本截断可能引入信息丢失,且需防止数据泄露,确保测试集在微调过程中完全不可见。
常用场景
经典使用场景
该数据集专为语言模型隐私研究而构建,其核心应用场景聚焦于成员推理攻击(Membership Inference Attack, MIA)实验。在训练阶段,研究者仅使用包含10,000个样本的训练集对目标语言模型进行微调,而测试集中的1,000个样本则保持不可见,作为非成员数据。这种明确的成员/非成员划分,配合严格控制的文本长度(1,024至2,040个token),为评估模型是否记忆了训练数据提供了理想的实验平台。数据集的构建过程经过精心的段落截断处理,确保了样本的完整性和语义连贯性,使其成为验证隐私攻击方法有效性的标准基准。
衍生相关工作
该数据集的发布催生了一系列相关研究方向的探索。基于其构建框架,研究者衍生出了针对不同模型规模(如Pythia套件)的成员推理攻击基准,进一步扩展了隐私评估的覆盖面。同时,数据集的段落截断方法启发了对训练数据预处理策略的深入分析,探讨了文本长度控制对模型记忆行为的影响。此外,该数据集被用于对比研究不同攻击算法(如损失阈值法、似然比检验)的鲁棒性,并推动了对抗性样本生成、模型蒸馏等防御技术的研究。其固定的评估集也成为了后续攻击方法性能报告的统一参照,促进了领域内知识积累的连贯性。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型微调场景下的成员推理攻击(Membership Inference Attack, MIA)前沿研究,通过精心构造的段落截断语料,为评估模型隐私泄露风险提供了基准。其设计严格遵循固定Token预算,确保成员与非成员样本分布一致,避免了文本长度等混淆因素,从而支持对MIA攻击方法的公正比较。研究热点在于利用此类细粒度语料探究微调过程中模型对训练数据的记忆机制,以及开发更隐蔽、更准确的隐私攻击手段。该数据集的发布推动了隐私保护机器学习领域对模型泄露边界与防御策略的深入理解,为构建可信赖的大语言模型奠定了重要实验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务