遇见数据集

CLEAR_Refine

收藏
Hugging Face2026-06-20 更新2026-06-21 收录
官方服务:

资源简介:

CLEAR_Refine是CLEAR多模态遗忘基准数据集的一个重塑版本,采用扁平化的“每行一个问答”结构。该数据集专注于虚构人物的传记问答,每个人物都配有一张图像,并且每个问答都以两种形式呈现:一种是纯文本的单模态表述,另一种是将人物姓名替换为“图像中的人”的多模态表述(需结合图像使用)。每个问答还包含一个四选一的多项选择题,其中正确答案对应生成目标,干扰项经过精心设计,确保人物姓名不能作为解题捷径。数据集提供了多个配置,分别对应不同的“遗忘集”(forget)和“保留集”(retain)分割,用于机器遗忘研究。具体配置包括:forget01(2人,38个QA)与retain99(197人,3349个QA)组合成fullset(共3387个QA);forget05(10人,179个QA)与retain95(189人,3208个QA);forget10(20人,349个QA)与retain90(179人,3038个QA)。数据集的每一行包含以下字段:image(人物图像)、name(人物姓名)、question_unimodal(包含姓名的纯文本问题)、question_multimodal(将姓名替换为“图像中的人”的多模态问题)、answer(正确答案,也是生成目标)、options(四个打乱顺序的选项列表)、answer_letter(正确选项对应的字母,A-D)。该数据集适用于多模态视觉语言模型的评估,特别是机器遗忘任务,同时支持生成式任务和多项选择任务。

CLEAR_Refine is a reshaped version of the CLEAR multimodal forgetting benchmark dataset, adopting a flat one QA per row structure. This dataset focuses on biographical question-answering for fictional characters, with each character accompanied by an image, and each QA presented in two forms: a unimodal text-only version and a multimodal version where the characters name is replaced with the person in the image (requiring image use). Each QA also includes a multiple-choice question with four options, where the correct answer corresponds to the generation target, and distractors are carefully designed to prevent the characters name from serving as a shortcut. The dataset provides multiple configurations corresponding to different forget and retain splits for machine forgetting research. Specific configurations include: forget01 (2 characters, 38 QAs) paired with retain99 (197 characters, 3349 QAs) forming the fullset (total 3387 QAs); forget05 (10 characters, 179 QAs) with retain95 (189 characters, 3208 QAs); forget10 (20 characters, 349 QAs) with retain90 (179 characters, 3038 QAs). Each row of the dataset contains the following fields: image (character image), name (character name), question_unimodal (text-only question including the name), question_multimodal (multimodal question with name replaced by the person in the image), answer (correct answer, also the generation target), options (a shuffled list of four options), answer_letter (the letter corresponding to the correct option, A-D). This dataset is suitable for evaluating multimodal vision-language models, particularly for machine forgetting tasks, while supporting both generative and multiple-choice tasks.

创建时间:
2026-06-11
原始信息汇总

数据集名称

CLEAR_Refine

数据集简介

CLEAR_Refine 是原始多模态机器遗忘基准 CLEAR 的扁平化重构版本,每行对应一个 QA 对。每个传记类 QA 均配有一张人物图像及一个四选一的多选题,同时提供纯文本(单模态)和图像辅助(多模态)两种提问方式。该数据集仅保留虚构作者的 forget / retain 子集,去除了 real_world / real_faces 部分。

语言

英语

标签

  • 多模态
  • 机器遗忘
  • 视觉语言模型(VLM)

配置与数据划分

配置名称 遗忘子集 保留子集 总 QA 数
fullset forget01(2人,38 QA) retain99(197人,3349 QA) 3387
forget01 2人,38 QA - -
forget05 10人,179 QA - -
forget10 20人,349 QA - -
retain90 - 179人,3038 QA -
retain95 - 189人,3208 QA -
retain99 - 197人,3349 QA -

数据字段(行模式)

字段 类型 含义
image Image 该人物的图像(同一人物的不同 QA 可能对应不同图像)
name string 人物姓名
question_unimodal string 包含人物姓名的原始问题(纯文本)
question_multimodal string question_unimodal 中的人物姓名替换为“the person in the image”后的多模态问题
answer string 正确答案(既是生成目标,也是多选题的正确选项)
options list<string> 4 个打乱顺序的选项
answer_letter string 对应正确选项的字母(A–D)

构建方法

  • 基于原始 CLEAR 数据集的 <split>(图像、标注、姓名)、<split>+tofu(问答对)和 full(全局作者列表)构建。
  • 每个 QA 归属于其回答中出现的作者姓名,且仅当该姓名同时出现在问题与回答中时保留。
  • 多选干扰项生成:
    • 默认情况:使用其他作者对主题匹配问题的回答(TF-IDF 余弦相似度),并将干扰项重写为当前作者的姓名(例如“出生于科威特城 / 阿斯塔纳 / 布鲁塞尔 / 卡拉奇”)。
    • 身份/取向类问题(如 LGBTQ+ 身份):若同一属性答案过于单一,则使用同一个人物的其他事实作为干扰项。
    • 近重复检测(基于去除姓名后的 token 重叠)确保二进制属性的干扰项不与正确答案相同。

复现方式

  • 依赖库:pandasscikit-learndatasets(随机种子 42,确定性输出)
  • 脚本位于仓库中:
    • build_clear_refine.py:从原始 CLEAR 构建本数据集。
    • eval_refine.py:在配置上评估 VLM(llava-* / Qwen*)的生成(ROUGE/BLEU)和多选准确率。
    • build_llamafactory_sft.py:将 fullset 转换为 LlamaFactory 多模态 SFT JSON 格式。

使用示例

python from datasets import load_dataset ds = load_dataset("chengyewang/CLEAR_Refine", "forget05", split="train") row = ds[0]

多模态生成:row["image"] + row["question_multimodal"] -> row["answer"]

多模态选择:row["image"] + row["question_multimodal"] + row["options"] -> row["answer_letter"]

搜集汇总
数据集介绍
CLEAR_Refine 数据集图片
构建方式
CLEAR_Refine数据集是对多模态机器遗忘基准CLEAR的精细化重构,专注于虚构作者场景的遗忘与保留任务。构建过程从原始CLEAR的每张图片-标题对及对应的问题-答案对出发,首先筛选出问题与答案中均包含作者姓名的高质量问答对,确保多模态表述的可行性。随后,将每个问答对与该作者的一张随机图像配对,并保证约97%的问答对拥有专属图像。为构建四选一多选题,正确选项即原始答案,而三个干扰项则基于TF-IDF相似度从其他作者的同类问题答案中选取,并替换为当前作者的姓名,从而保证干扰项在属性内容上不同但姓名一致,避免了名称短路风险。对于群体中某一属性值占据主导地位的身份或取向类问题,则改用该作者本人的其他事实作为干扰项,并设置重复剔除机制以排除二元属性上的歧义。
特点
该数据集的核心特色在于其精细化的双模态结构,每个问答对同时提供纯文本表述(unimodal)和基于图像的表述(multimodal),前者保留原始问题中的作者姓名,后者将姓名替换为‘图像中的人’,从而严格分离文本与视觉线索的贡献。多选题设计巧妙,通过固定姓名、变化属性内容的干扰项生成策略,迫使模型必须依赖对人物具体事实的记忆而非名称关联来作答,为评估视觉-语言模型(VLM)的遗忘效果提供了严谨的测试框架。数据集包含多个配置,分别对应不同比例的遗忘与保留作者子集(如forget01与retain99、forget05与retain95等),支持对遗忘粒度(从2人到20人)的灵活研究。每个配置均包含完整的图像、文本及选项元数据,便于直接用于生成式评估和多项选择评估。
使用方法
用户可通过HuggingFace Datasets库便捷加载任意配置,例如使用`load_dataset('chengyewang/CLEAR_Refine', 'forget05', split='train')`获取包含179个问答对的遗忘子集。每条数据包含图像字段、纯文本问题与多模态问题字段、正确答案、四个选项及其对应字母标识。使用时,可针对多模态设置,将图像与多模态问题拼接输入VLM进行生成式回答,并利用ROUGE/BLEU指标评估;也可在输入问题与选项后计算多项选择准确率。数据集中附带评估脚本(eval_refine.py)和面向LlamaFactory的微调格式转换脚本(build_llamafactory_sft.py),可一键将fullset配置转化为包含图像与双模态问题的SFT训练数据,支持对VLM进行遗忘后恢复或针对性训练。
背景与挑战
背景概述
CLEAR_Refine数据集诞生于多模态机器学习遗忘这一新兴研究领域,由研究人员针对既有CLEAR基准进行重构与精炼而成。该数据集聚焦于一个核心研究问题:如何在大规模视觉-语言模型(VLM)中实现精准、可控的知识遗忘,尤其是在涉及人物传记信息的场景下。通过将每个问答对与人物图像、文本及多模态提问形式紧密结合,CLEAR_Refine为评估模型在遗忘特定身份知识时对图像与文本语义的依赖程度提供了标准化测试床。其影响力体现在为多模态遗忘研究树立了新的评估范式,弥补了此前仅依赖纯文本遗忘基准的不足,推动了该领域向更贴近真实应用场景的方向发展。
当前挑战
CLEAR_Refine所应对的领域挑战主要源于多模态模型中知识遗忘的复杂性:模型需在保持对未见数据性能的同时,精准移除指定个体(如虚构作者)的视觉与文本关联记忆,同时避免对保留知识的附带损害。构建过程中遭遇的挑战包括:确保每个问答对中人物图像与文本姓名的一致性锚定,设计既能防止捷径学习(如仅依赖姓名而非内容)又能生成高质量干扰选项的四选一策略,以及通过TF-IDF主题匹配与属性均衡化手段避免二元属性(如性别、身份取向)的选项歧义。此外,还需在保持图像大部分唯一性的前提下(约97%的问答对拥有独立图像),平衡数据集规模与遗忘任务的细粒度控制需求。
常用场景
经典使用场景
CLEAR_Refine数据集专为多模态机器遗忘(Multimodal Machine Unlearning)研究而构建,其核心设计在于将原始CLEAR基准中的传记问答数据重构为每行一个问答对(one-row-per-QA)的扁平化结构。每个问答对均配有人物图像、文本版与图像理解版两种提问形式,以及四选一的选项设置。研究者可利用该数据集评估视觉语言模型(VLM)在遗忘特定人物知识后的行为变化,通过在不同遗忘比例(如forget01、forget05、forget10)与保留比例(如retain99、retain95、retain90)的配置上测试模型,量化遗忘效果对生成准确性与选择正确性的影响。
解决学术问题
该数据集直面多模态大模型领域的关键学术挑战:如何确保模型在移除特定数据后,既能彻底遗忘目标信息,又不损害对保留知识的记忆能力。CLEAR_Refine通过提供精细化的遗忘-保留数据切分与双模态问答评估范式,解决了传统单模态遗忘研究中缺乏视觉与文本联合评估的问题。其多选干扰项设计巧妙规避了名称作为捷径线索的陷阱,使得问答评估更能真实反映模型的知识状态。该数据集的构建推动了多模态遗忘研究从定性分析向定量评估的转变,为建立可信、可复现的遗忘评估体系奠定了重要基石,对理解大模型的数据记忆机制具有深远意义。
衍生相关工作
CLEAR_Refine的发布催生了多条研究方向。其构建脚本与评估框架(eval_refine.py)可直接复用至后续的多模态遗忘算法研究中,如梯度上升法、模型剪枝、数据重加权等遗忘策略的性能对比。数据集的LlamaFactory微调接口(build_llamafactory_sft.py)使得研究者能够便捷地将遗忘任务融入多模态指令调优流程中。基于该数据集,已涌现出针对VLM遗忘后鲁棒性评估、遗忘与泛化的平衡分析等衍生工作。此外,其“名称替换为图像中人”的提问策略启发了其他多模态数据集的设计,推动了图像-文本对齐遗忘评估的标准化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务