遇见数据集

forg3t-rdm-tofu-benchmark

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

该数据集名为 Forg3t RDM on TOFU,旨在提供 Retain-Distribution Matching (RDM) 方法在大语言模型遗忘(LLM unlearning)任务上的测量结果与重现方案。数据基于 TOFU 基准(TOFU benchmark),包含在 Llama-3.2-1B-Instruct 模型上进行的多次实验,覆盖 forget10 和 forget05 等子任务。数据集提供了不同超参数(如 RDM 的 alpha 值)下的遗忘质量(以 KS D 距离衡量)和模型效用(utility),并与 RMU、NPO 等多种基线方法进行比较。此外,数据集包含一个完整的重现脚本(reproduce_rdm.sh),可从裸机(仅 NVIDIA 驱动)重现头条结果,并记录了不同硬件(A100 40GB 和 L4 24GB)上的资源消耗与运行时间。数据集的规模小于 1000 个样本,主要为 JSON 格式的测量结果和表格。该数据集适用于 LLM 遗忘方法的研究者,用于评估 RDM 及其对比方法的性能、稳定性和可复现性。

The dataset, named Forg3t RDM on TOFU, aims to provide measurement results and reproduction schemes for the Retain-Distribution Matching (RDM) method on the large language model unlearning task. The data is based on the TOFU benchmark and includes multiple experiments conducted on the Llama-3.2-1B-Instruct model, covering sub-tasks such as forget10 and forget05. The dataset provides unlearning quality (measured by KS D distance) and model utility under different hyperparameters (e.g., alpha values of RDM), and compares with multiple baseline methods such as RMU and NPO. In addition, the dataset includes a complete reproduction script (reproduce_rdm.sh) that can reproduce the headline results from bare metal (only NVIDIA driver), and records resource consumption and running time on different hardware (A100 40GB and L4 24GB). The dataset size is less than 1000 samples, mainly in JSON format measurement results and tables. This dataset is suitable for researchers of LLM unlearning methods to evaluate the performance, stability, and reproducibility of RDM and its comparison methods.

创建时间:
2026-08-03
原始信息汇总

Forg3t RDM on TOFU 数据集详情

数据集概述

该数据集记录了 Retain-Distribution Matching (RDM) 方法在 TOFU 基准上进行大语言模型(LLM)机器遗忘(unlearning)的测量结果,并附带一个可在全新机器上从零复现核心指标的脚本。数据集大小类别为 n<1K,使用英文,遵循 CC BY 4.0 许可(模型权重继承 Llama 3.2 Community License)。

核心内容

1. 复现性

  • 一键复现脚本reproduce_rdm.sh 可从仅装有 NVIDIA 驱动的机器开始,直接得到头条数字。
  • 无需训练即可验证:发布的检查点位于 AlvinAgile/Llama-3.2-1B-Instruct-forg3t-rdm-forget10,评估仅需约 2 分钟,无需 24 GB GPU;从头训练约需半小时,需要 24 GB GPU。
  • 硬件需求:最低 24 GB VRAM、约 35 GB 磁盘、CUDA 驱动、Python 3.11。在无头 L4 上余量仅 2%。
  • 测量数据(非估算):
指标 A100 40 GB L4 24 GB
平均 KS D 0.1125 0.1125
模型效用 0.5345 0.5329
峰值显存 33,882 MiB 22,560 / 23,034 MiB
端到端时间 31 分 44 秒 52 分 43 秒
  • 多种子复现结果(TOFU forget10,RDM alpha=1.5,三颗种子):KS D 均值 0.1125(范围 0.1100–0.1150),效用均值 0.5335。原始测量为 0.1108 @ 0.536。
  • 固定版本:代码 commit 9d40628,权重和 tokenizer 88e31200…,评估日志 f31717fe…locuslab/TOFU 数据为 324592d8…(已校验 SHA,若有变动脚本会中止)。

2. 主要结果(TOFU forget10)

越低 KS D 越好,越高效用越好。 保留模型(金标准):KS D = 0,效用 0.5921。

RDM 并非排名第一,RMU alpha=0.4 达到最低 KS D (0.0883),但代价是效用降至保留模型的 70%。

KS D 方法 效用 占保留模型% D·400 范围 n
0.0883 RMU alpha=0.4 0.417 70% 25–48 6
0.1108 RDM alpha=1.5 0.536 90% 44–45 3
0.1142 RDM alpha=2.0 0.538 91% 44–48 6
0.1158 RDM alpha=2.5 0.539 91% 46–47 3
0.1171 RMU alpha=0.5 0.513 87% 40–58 6
0.1208 RDM alpha=3.0 0.545 92% 48–49 3
0.1267 RDM alpha=4.0 0.553 93% 49–52 3
0.1325 RDM alpha=5.0 0.557 94% 50–55 3
0.1383 RMU alpha=1.0 0.578 98% 49–64 6
0.1625 NPO alpha=1.0 0.410 69% 63–67 3

关键洞察

  • RDM 在双轴上支配 RMU alpha=0.5(0.1142/0.538 vs 0.1171/0.513)。
  • RMU 唯一的优势点牺牲了保留模型 30% 的效用。
  • RDM alpha=1.5 的稳定性比 RMU alpha=0.4 高一个数量级(种子间跨度 1 步 vs 23 步,每 400 步)。
  • RMU 剩余的胜点效用等于或高于保留模型,表明模型几乎没有变化。

3. TOFU forget05:RDM 最强结果

KS D 方法 效用 n
0.1250 RMU alpha=0.3 0.183(被摧毁) 3
0.1375 RDM alpha=1.5 0.508 6
0.1383 RDM alpha=2.0 0.523 6
0.1908 RMU alpha=0.4 0.349 6
0.2300 NPO alpha=1.0 0.453 3
0.2350 RMU alpha=0.45 0.402 3
0.2500 RMU alpha=0.5 0.445 3

RDM 在此严格支配 RMU(alpha 0.4–0.6),双轴均更优。 RMU 仅在 alpha=0.3 时遗忘更多,但效用降至保留模型的 31%。

4. 其他方法对比

最佳配置后,除 RMU、RDM 和 NPO 外,没有任何方法 KS D 低于 0.24。CEU 和 GradAscent 效用为 0.000。

5. RDM 的劣势场景

  • Llama-3.2-3B:RMU 胜出(0.1108 @ 0.620 vs RDM 0.1308 @ 0.625)。
  • forget01:n=40,D 步长 0.025,所有方法落在 12–15/40,无法区分任何方法(基准固有属性)。
  • MUSE:见范围限制。

版本修正与范围限制

  • 已撤回内容:早期版本中的 OpenUnlearning 汇总表三行 forget_quality 已撤回。原因:forget_quality 是 n=400 双样本 KS 检验的 p 值,比率不反映效应量;该表突出显示的 8 倍比率实际仅 400 步中的 3.1 步。检查点本身标签诚实,但汇总表未保留该背景。
  • MUSE 声明撤回:此前声称 RDM 不适用于判别性指标的声明已撤回,因为相关运行从未达到其自身目标(遗忘边际仅移动 26.6%,两集合保持不相交),且目标参考池选取错误。
  • TOFU forget01 无法区分任何方法,这是基准属性。
  • 建议引用 KS 距离,而非引用 forget_quality p 值的比率。

许可

  • 模型权重继承 Llama 3.2 Community License(含命名和署名要求)。
  • 基准汇总与文档为 CC BY 4.0。
  • 第三方基准和模型名称归其所有者所有。
搜集汇总
数据集介绍
forg3t-rdm-tofu-benchmark 数据集图片
构建方式
该数据集源自对大型语言模型(LLM)机器遗忘(machine unlearning)领域的深度探索,聚焦于保留分布匹配(Retain-Distribution Matching, RDM)方法在TOFU基准上的表现。构建过程严谨细致,依托可复现的脚本从裸机环境出发,历经模型训练、评估至数据汇总,确保每一步皆有据可查。数据集整合了多轮实验的原始评估日志、模型检查点及复现脚本,并针对先前版本中的误导性摘要进行了修正,保证了数据的真实性与科学性。
使用方法
使用此数据集时,研究者可首先运行提供的`reproduce_rdm.sh`脚本,在配备NVIDIA驱动及约24GB显存的环境下,快速复现核心指标。数据集提供了发布模型的检查点,可直接评估其遗忘效果与实用度,无需重训。此外,详细的结果表格与配置参数可供深入分析各算法在不同alpha值下的表现,指导算法调优。数据集明确提示了引用指标时应采用KS距离而非p值比,并警示了小型基准(如forget01)的判别力局限,确保使用的科学性与规范性。
背景与挑战
背景概述
随着大型语言模型(LLM)在诸多领域的深度应用,如何在不影响模型整体性能的前提下,高效、精准地移除特定数据的影响已成为一个亟待解决的研究课题。机器遗忘(Machine Unlearning)作为该方向的核心技术,旨在消除预训练模型对特定数据片段的记忆,同时保留其对保留集的泛化能力。在此背景下,HuggingFace平台于2026年发布了forg3t-rdm-tofu-benchmark数据集,由AlvinAgile等研究者创建,聚焦于保留分布匹配(RDM)方法在TOFU基准上的表现。该数据集不仅提供了详尽的实验测量数据,还公开了可复现的实验脚本,旨在通过严格的重复实验与基线方法对比,推动LLM遗忘研究的可复现性与可信度。其发布对领域内评估方法的标准化与透明化产生了积极影响,促使研究者重新审视现有指标的统计效力与实验设计的严谨性。
当前挑战
该数据集的核心挑战体现在两大层面:其一,领域问题层面,LLM遗忘评估长期面临指标有效性不足的困境,如TOFU的forget_quality基于KS检验的p值,其差异在标准化尺度下极为微小,易被误读为显著效果,导致对方法优劣的错误判断;同时,现有基准(如forget01)因样本量限制无法有效区分不同方法,凸显了基准设计对评估分辨率的制约。其二,构建过程层面,复现实验遭遇多重技术障碍,包括Python版本冲突、依赖库管理复杂、模型配置(如注意力实现)对结果的显著影响,以及分词器访问限制等;此外,不同硬件环境下显存与运行时间差异较大,微批大小调整会主导结果,均对实验的可重复性与公平对比构成严峻挑战。
常用场景
经典使用场景
该数据集聚焦于大型语言模型(LLM)的机器遗忘(machine unlearning)领域,为评估遗忘算法在TOFU基准上的表现提供了详尽且可复现的测量框架。其经典应用场景包括对RDM(Retain-Distribution Matching)方法在forget10和forget05任务上的遗忘质量与模型效用进行多维度量化,涵盖KS距离、模型效用保留率及稳定性指标。研究者借助该数据集可系统比较RDM、RMU、NPO等主流遗忘方法在严格可控条件下的性能差异,从而深入剖析各算法在平衡遗忘效果与模型可用性方面的权衡。
解决学术问题
该数据集直面LLM机器遗忘研究中长期存在的可复现性危机与评估标准混乱问题。通过提供固定版本依赖、跨环境一致的测量结果(如种子间KS距离波动仅1/400),它解决了实验结果难以复现的学术痛点。同时,它揭示了TOFU基准中`forget_quality`指标在n=400时的步进特性,纠正了以p值比率充当效应量的常见谬误,并示范了如何以KS距离为核心度量,为领域确立了更严谨的评估规范,显著提升了比较研究的公平性与可信度。
实际应用
在实际应用中,该数据集为需要合规删除特定知识的AI系统提供了关键参考。其测量数据支持开发者在模型部署前,评估遗忘过程对生成效用的影响,从而在隐私保护(如移除个人数据)与功能完整性之间做出明智取舍。例如,RDM方法在forget05任务上以90%以上的效用保留率实现有效遗忘,这一成果可直接应用于构建符合GDPR等法规的对话系统,降低“已遗忘”知识泄露风险,并指导硬件资源有限(如24GB显卡)的团队优化微批次配置以复现最佳性能。
数据集最近研究
最新研究方向
本数据集聚焦于大语言模型机器遗忘领域的前沿评估与可复现性研究,尤其针对TOFU基准下的保留分布匹配方法进行了深入剖析。最新方向强调精细化的测量标准与严谨的复现验证,通过严格固定代码、权重及评估日志,确保研究结论的可靠性。研究揭示,在遗忘质量与模型效用双轴评估下,RDM方法虽非最优,但在稳定性上显著优于现有方法,为大型语言模型的安全合规删除提供了更具鲁棒性的技术路径。同时,该工作尖锐指出了现有基准如forget_quality在统计分辨率上的局限,倡导以KS距离等精确指标替代p值比率,推动了机器遗忘评估体系向更科学、可比较的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务