遇见数据集

unlearning-cleanslate/eval-gemma-3-12b-simnpo-gentle-baseline

收藏
Hugging Face2026-04-29 更新2026-05-03 收录
官方服务:

资源简介:

该数据集用于评估语言模型对训练数据中文本片段的记忆化程度。包含每个文本片段(窗口)的统计信息,如是否被记忆化、对数概率、p值等,以及最佳记忆化窗口的详细信息。数据集还包含文本的元数据(标题、创建者、年份等)。

This dataset is used to evaluate the memorization degree of language models on text fragments from training data. It contains statistical information for each text fragment (window), such as whether it is memorized, log probability, p-value, etc., as well as detailed information about the best memorized window. The dataset also includes metadata of the text (title, creator, year, etc.).

提供机构:
unlearning-cleanslate
二维码
社区交流群
二维码
科研交流群
商业服务