遇见数据集
官方服务:

资源简介:

FAIRGET是由特伦托大学与布鲁诺·凯斯勒基金会联合创建的首个面向不平衡遗忘请求的多模态基准数据集,旨在评估多模态大语言模型在非均匀遗忘场景下的公平性。该数据集规模显著超越现有基准,包含4,000个虚构身份、40,000张图像及225,000组视觉问答对,数据通过StyleGAN2生成人脸图像并配合DeepSeek模板构建问答对,采用分层抽样确保属性平衡。其核心价值在于模拟现实世界中不同人口群体提出遗忘请求的非均衡分布,为解决多模态环境下隐私保护与模型公平性协同优化提供关键实验平台。

FAIRGET is the first multimodal benchmark dataset for imbalanced forgetting requests, jointly created by the University of Trento and Bruno Kessler Foundation. It aims to evaluate the fairness of multimodal large language models (LLMs) under non-uniform forgetting scenarios. This dataset significantly outperforms existing benchmarks, containing 4,000 fictional identities, 40,000 images, and 225,000 visual question-answering (VQA) pairs. The facial images are generated via StyleGAN2, and the VQA pairs are constructed using DeepSeek templates; stratified sampling is adopted to ensure attribute balance. Its core value lies in simulating the uneven distribution of forgetting requests from different demographic groups in the real world, providing a critical experimental platform for the collaborative optimization of privacy protection and model fairness in multimodal environments.

创建时间:
2026-07-23
原始信息汇总

数据集:FAIRGET

FAIRGET 是第一个用于评估多模态大语言模型(MLLMs)在非平衡遗忘请求下公平性的视觉问答基准数据集。它旨在模拟真实场景中不同人口统计群体以不同频率请求被遗忘的情况,从而检测模型是否会产生偏见行为。

数据构成

  • 视觉数据:使用 StyleGAN2 生成人脸图像,并通过 Arc2Face 增强每个身份的内部变异性。每张图像根据年龄、性别和种族(通过 FairFace 标注)进行标注,身份通过分层抽样确保所有人口统计组合得到平等表示。
  • 文本数据:每个身份包含 10 个额外属性(姓名、出生地、居住地、教育背景、职业、收入、身高、关系状态、政治倾向、出生日期)。属性通过基于规则的采样分配,部分属性与视觉特征关联以增强真实性(如教育程度与年龄相关),其他属性独立采样(如政治倾向)。问答对由模板化问题结合每个身份的属性值生成。

非平衡遗忘集

FAIRGET 提供了预构建的非平衡遗忘集,用于模拟从简单到具有挑战性的多种真实场景,这些场景会导致模型产生偏见。遗忘集并非均匀分布,而是偏向特定人口统计群体。预构建的分割文件位于 data/ 目录下,按以下模式组织:

分割文件 受保护群体 遗忘比例
split_lowadult*.json 低收入 + 成年人 10-50-90%
split_rightmale*.json 右倾 + 男性 10-50-90%
split_tallfemale*.json 高个子 + 女性 10-50-90%
split_singleasian*.json 单身 + 亚裔 10-50-90%
split_10mixed75.json 右倾 + 男性(混合) 75%
split_base_2k.json 0%(平衡基线)

例如,split_lowadult10.json 将“低薪 + 成年人”群体中 10% 的身份放入遗忘集,其余 90% 保留在保留集。文件名中的数字表示该受保护群体被选入遗忘集的比例,每个场景提供 10%、50% 和 90% 三种变体。

用途

  • 评估遗忘质量:通过精确匹配、概率等指标测量。
  • 评估隐私泄露:使用 Min-K++ AUC 指标。
  • 评估公平性:通过人口统计平等差距(Demographic Parity gap)测量。
  • 基准测试:适用于对 MLLM 遗忘方法进行公平性感知的评估。

获取方式

完整数据集可在 Hugging Face 上获取:https://huggingface.co/datasets/argmaxxer/FAIRGET

搜集汇总
数据集介绍
FAIRGET 数据集图片
构建方式
FAIRGET的构建始于对大规模生成人脸数据的精细筛选。从450k张无条件StyleGAN2生成的面孔出发,研究者利用FairFace模型标注了每张图像的年龄、性别和种族等视觉属性,并通过分层抽样确保了不同人口统计学组别的均衡分布。在此基础上,为增强身份内变异性,每一张图像经由Arc2Face进行10次增强,并再次使用FairFace标注以多数投票确定最终属性,最终形成涵盖4k个身份、40k张图像的视觉数据集。在文本模态上,针对每个身份构建了包含10项额外个人信息(如姓名、职业、居住地)的丰富档案。文本属性并非直接依靠大语言模型生成,而是通过基于规则的层次化采样方法分配,以避免输出偏见和不一致性。利用DeepSeek为每个属性生成了特定模板,随后以身份特定值填充模板,大规模合成了约225k个高质量、多样化且公平的VQA问答对。最终,数据被划分为用于训练和遗忘的子集以及用于公平性评估的独立子集。
特点
FAIRGET的核心特点在于其前所未有的规模和对现实世界不平衡遗忘场景的精准模拟。相较于现有基准,该数据集规模扩大了十倍以上,包含4k个身份、40k张图像和225k个问答对,提供了丰富且可控的评估资源。其最突出的创新在于首次系统地引入了非均匀分布的遗忘请求,基于真实世界中不同人口群体提出被遗忘权请求频率不同的现象,设计了单群体主导和多群体偏斜两种遗忘场景,从而能够评估遗忘模型在面对不平衡遗忘请求时产生的公平性风险。数据集通过精细控制视觉和文本属性的生成过程,实现了训练数据的均衡分布,同时允许独立操控遗忘请求的偏斜程度,使得研究者能够单独评估遗忘质量和由此引发的群体偏见。此外,数据集包含了全面且互补的评估指标体系,从成员推理攻击、精确属性匹配到归一化概率,并特别引入了基于未见数据的群体均等差异指标,确保对公平性的评估独立于记忆效应。
使用方法
FAIRGET的使用遵循一个精心设计的评估流程。研究者首先使用数据集的训练部分对多模态大语言模型进行微调,使模型学习到虚构身份的个人信息。随后,根据预定义的偏斜场景,从训练数据中选取一个非均匀分布的子集作为遗忘集合,并对模型执行遗忘操作。评估分为遗忘效果和公平性两个维度:遗忘效果通过计算模型在遗忘集上的精确匹配率、输出概率以及成员推理攻击得分来衡量;公平性则在独立的未见身份数据上通过计算群体均等差异来评估,确保任何测量到的偏见反映的是模型行为的改变而非对训练数据的残留记忆。为了平衡遗忘质量、模型效用和公平性这三个相互竞争的目标,数据集提供了平均差距指标,将模型的综合表现与理想基准进行对比,为评估遗忘算法的整体性能提供了统一且直观的度量。
背景与挑战
背景概述
FAIRGET是由意大利特伦托大学与布鲁诺·凯斯勒基金会的研究团队于2025年提出的首个面向多模态大语言模型(MLLM)不平衡遗忘场景的视觉问答基准。该研究聚焦于人工智能领域日益严峻的隐私合规挑战,特别是《通用数据保护条例》等法规所确立的“被遗忘权”。在现实世界中,遗忘请求往往并非均匀分布,特定人口群体(如高净值老年人)可能更频繁地行使其隐私权利。这种不均衡的遗忘请求不仅挑战模型的记忆移除能力,更可能扭曲模型对不同群体的内部信念,引发严重的公平性风险。FAIRGET的创建填补了现有遗忘基准仅关注均匀分布遗忘请求的空白,通过构建包含4000个虚构身份、4万张图像及22.5万问答对的大规模数据集,为系统性评估不平衡遗忘场景下的模型公平性提供了关键基础设施。该基准显著超越现有同类数据集(尺度提升10倍以上),并首次将视觉与文本模态的可控生成与不平衡遗忘请求设计相结合,对推动符合伦理规范的多模态遗忘研究具有里程碑意义。
当前挑战
FAIRGET所应对的核心领域挑战在于:当遗忘请求在不同人口群体间呈非均匀分布时,现有遗忘算法在移除特定身份信息的同时,会导致模型对保护性属性(如年龄、性别、种族)产生系统性偏见,从而违背公平性原则。具体而言,若高收入老年群体频繁请求遗忘,模型可能在预测收入时错误地将年龄作为关联因素,导致对老年人的系统性歧视。这种多模态环境下的不公平遗忘问题尚属空白,此前研究仅关注图像分类领域的均匀遗忘请求,且大多需要训练时已知群体归属等不切实际的前提。在基准构建过程中,团队面临多重要求:需在保证视觉属性(年龄、性别、种族)均衡分配的同时,通过规则化采样策略生成10项文本属性(如职业、教育水平),确保训练数据内在公平,并进而设计可控的不平衡遗忘场景——包括单群体主导(占比10%-90%)与多群体混合(主导群体占75%)两种设置,以模拟现实中最具挑战性的遗忘请求分布。
常用场景
经典使用场景
FAIRGET作为首个面向多模态大语言模型不平衡遗忘场景的视觉问答基准,其最经典的使用场景在于评估模型在非均匀分布遗忘请求下的遗忘质量与公平性。该数据集通过构建4,000个虚构身份、40,000张图像及225,000个问答对,模拟了真实世界中因不同人口统计群体(如性别、年龄、种族)遗忘请求频率差异而导致的模型偏见问题,为研究者提供了控制变量下的理想测试平台。
衍生相关工作
基于FAIRGET的挑战,研究者提出了FAUN(公平激活遗忘)算法,首次将激活引导机制与偏见感知主成分分析相结合,在不依赖群体标注的条件下实现了遗忘质量与公平性的平衡。该工作衍生了多模态遗忘领域的新方向,包括无偏子空间提取技术、永久性遗忘的梯度更新策略,以及面向公平性的遗忘评估协议,后续研究在此基础上进一步探索了跨模型架构的公平遗忘方法,并推动了对多模态模型中虚假关联机制的理论分析。
数据集最近研究
最新研究方向
当前前沿研究聚焦于多模态大语言模型在非均匀遗忘请求下的公平性挑战,FAIRGET数据集创新性地构建了包含4000个虚构身份、40,000张图像及225,000个视觉问答对的大规模基准,通过模拟不同人口群体以非平衡频率请求被遗忘的真实场景,揭示了模型在遗忘过程中可能因数据分布偏移而强化对保护属性的偏见。这一工作填补了现有遗忘基准无法评估公平性风险的空白,为后训练时代AI治理法规(如GDPR)的合规性研究提供了关键评估工具,推动机器学习遗忘领域从单纯关注隐私保护向兼顾社会公平性的方向演进。
相关研究论文
  • 1
    Unlearning Under Imbalance: Benchmarking Fairness in Multimodal LLM Unlearning特伦托大学; 布鲁诺·凯斯勒基金会 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务