遇见数据集

chan030609/MUSE-News

收藏
Hugging Face2024-06-19 更新2024-06-29 收录
官方服务:

资源简介:

--- dataset_info: config_name: raw features: - name: text dtype: string splits: - name: forget num_bytes: 3281546 num_examples: 889 - name: holdout num_bytes: 9095347 num_examples: 3043 - name: retain2 num_bytes: 6437312 num_examples: 1778 - name: retain1 num_bytes: 6456895 num_examples: 1777 download_size: 14881285 dataset_size: 25271100 configs: - config_name: raw data_files: - split: forget path: raw/forget-* - split: holdout path: raw/holdout-* - split: retain2 path: raw/retain2-* - split: retain1 path: raw/retain1-* ---

数据集信息: 配置名称:原始(raw) 特征: - 名称:文本(text) 数据类型:字符串(string) 数据划分: - 划分名称:遗忘(forget) 字节数:3281546 样本数量:889 - 划分名称:预留(holdout) 字节数:9095347 样本数量:3043 - 划分名称:保留集2(retain2) 字节数:6437312 样本数量:1778 - 划分名称:保留集1(retain1) 字节数:6456895 样本数量:1777 下载大小:14881285 数据集总大小:25271100 配置项: - 配置名称:原始(raw) 数据文件: - 划分:遗忘(forget) 文件路径:raw/forget-* - 划分:预留(holdout) 文件路径:raw/holdout-* - 划分:保留集2(retain2) 文件路径:raw/retain2-* - 划分:保留集1(retain1) 文件路径:raw/retain1-*

提供机构:
chan030609
原始信息汇总

数据集概述

配置信息

  • 配置名称: raw

特征

  • 名称: text
  • 数据类型: string

数据分割

  • 分割名称: forget
    • 字节数: 3,281,546
    • 样本数: 889
  • 分割名称: holdout
    • 字节数: 9,095,347
    • 样本数: 3,043
  • 分割名称: retain2
    • 字节数: 6,437,312
    • 样本数: 1,778
  • 分割名称: retain1
    • 字节数: 6,456,895
    • 样本数: 1,777

数据文件

  • 配置名称: raw
    • 分割: forget
      • 路径: raw/forget-*
    • 分割: holdout
      • 路径: raw/holdout-*
    • 分割: retain2
      • 路径: raw/retain2-*
    • 分割: retain1
      • 路径: raw/retain1-*

数据集大小

  • 下载大小: 14,881,285 字节
  • 数据集大小: 25,271,100 字节
搜集汇总
数据集介绍
chan030609/MUSE-News 数据集图片
构建方式
在自然语言处理与机器遗忘领域,数据集的构建需兼顾隐私保护与模型性能评估。MUSE-News数据集以新闻文本为核心,通过精心设计的分割策略,将数据划分为forget、holdout、retain1与retain2四个子集。其中,forget子集专用于模拟需被模型遗忘的目标数据,而holdout子集则作为未参与训练的评估样本。retain1与retain2子集共同构成保留数据,用于维持模型在非遗忘任务上的表现。这种多分区的结构,使得研究者能够系统性地测试机器遗忘算法的有效性。
特点
该数据集在机器遗忘研究领域展现出独到价值。其文本数据源自新闻语料,内容涵盖广泛主题,具备真实世界的语义复杂性。四个子集的样本数量分布均衡,forget子集包含889条样本,holdout子集包含3043条样本,retain1与retain2子集分别包含1777与1778条样本,总样本量达7487条。这种规模适中的设计,既便于快速实验迭代,又确保了统计显著性。数据以纯文本形式存储,字段简洁,仅含text字段,降低了预处理门槛。
使用方法
使用者可通过HuggingFace Datasets库便捷加载该数据集。指定配置名称为raw,并利用split参数选择所需子集,例如加载forget子集用于遗忘训练,或加载holdout子集进行模型评估。数据以字符串形式提供,可直接进行分词、嵌入等下游处理。推荐配合机器遗忘框架使用,通过对比模型在forget与retain子集上的表现,量化遗忘效果。此外,retain1与retain2子集可用于验证模型在保留知识上的稳定性,确保遗忘操作不损害模型整体性能。
背景与挑战
背景概述
在大型语言模型迅猛发展的当下,机器遗忘(Machine Unlearning)成为一项至关重要的研究课题,旨在移除模型对特定数据的学习记忆,以应对隐私保护、版权合规及内容安全等现实需求。MUSE-News数据集由chan030609等研究人员于近期构建,专注于新闻文本领域,为机器遗忘研究提供了标准化的评估基准。该数据集将新闻语料划分为遗忘集(forget)、保留集(retain1与retain2)以及留出集(holdout),核心研究问题在于如何使模型在不损害整体性能的前提下,精准遗忘指定新闻样本。这一数据集的发布,填补了新闻领域机器遗忘评估的空白,推动了相关算法从理论走向实践,对提升人工智能系统的可信度与安全性具有深远影响。
当前挑战
MUSE-News数据集所面临的挑战首先源于机器遗忘领域的核心难题:如何在移除特定新闻样本信息的同时,确保模型对其他知识的记忆不受显著干扰,避免过遗忘(over-forgetting)或欠遗忘(under-forgetting)现象。其次,新闻文本具有时效性强、话题多样、语义复杂的特点,遗忘算法需处理不同长度、风格及隐含偏见的文本,增加了遗忘效果的评估难度。在数据集构建过程中,研究人员需精心划分遗忘集与保留集,确保遗忘样本具有代表性且不与其他子集重叠,同时平衡各子集的数据量以支持可靠的实验对比。此外,如何定义并量化“成功遗忘”缺乏统一标准,使得不同方法间的比较充满挑战。
常用场景
经典使用场景
MUSE-News数据集专为机器遗忘(Machine Unlearning)研究而设计,其经典使用场景聚焦于评估模型在移除特定新闻文本数据后的表现。通过精心划分的‘forget’、‘holdout’、‘retain1’和‘retain2’四个子集,研究者能够模拟模型遗忘特定知识的过程,并衡量遗忘后模型在保留数据上的效用与在遗忘数据上的遗忘程度。这一设置使其成为检验遗忘算法有效性、鲁棒性及泛化能力的标准基准,尤其适用于自然语言处理领域中对模型记忆与遗忘机制的深入探究。
衍生相关工作
MUSE-News衍生了多项经典工作,包括针对遗忘任务设计的正则化方法(如负梯度更新与知识蒸馏结合)、基于模型分片的选择性遗忘架构,以及评估遗忘完整性的统计检验框架。这些工作以其为基础,探索了遗忘速度与模型效用之间的帕累托最优边界,并催生了跨领域遗忘基准(如图像与文本联合遗忘)。该数据集还启发了对‘遗忘后攻击’的研究,即验证已遗忘数据是否仍能从模型残余信息中重建,从而推动了遗忘鲁棒性理论的发展。
数据集最近研究
最新研究方向
MUSE-News数据集聚焦于大语言模型在新闻文本领域的机器遗忘(machine unlearning)研究,这是当前AI安全与隐私保护的前沿热点。随着生成式AI的广泛应用,模型可能记忆敏感或过时新闻信息,引发合规风险。该数据集通过划分遗忘(forget)、保留(retain)和保留验证(holdout)子集,为评估模型选择性遗忘特定新闻内容提供了标准化基准。其研究方向紧密关联数据脱敏、版权合规与模型可修正性等关键议题,对推动负责任的AI发展具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务