遇见数据集

unlearning-cleanslate/eval-llama-3_1-8b-simnpo-gentle-igm-10b

收藏
Hugging Face2026-04-29 更新2026-05-03 收录
官方服务:

资源简介:

该数据集包含用于评估语言模型文本记忆化程度的指标,记录了每个文本片段(窗口)的模型概率、记忆化状态、最佳窗口信息等,并包含文本内容的相关元数据(如标题、创作者、年份)。数据集共4663个样本,特征包括文本长度、窗口数量、记忆化窗口数量、记忆化比例、覆盖度、模型概率统计、最佳窗口参数等。

This dataset contains metrics for evaluating the memorization degree of language models on text snippets. It records model probabilities, memorization status, best window information for each text window, and includes metadata such as content title, creators, and year. The dataset has 4663 samples with features including text length, number of windows, memorized windows, memorized fraction, coverage, model probability statistics, best window parameters, etc.

提供机构:
unlearning-cleanslate
二维码
社区交流群
二维码
科研交流群
商业服务