FAIRGET
收藏资源简介:
FAIRGET是由特伦托大学与布鲁诺·凯斯勒基金会联合创建的首个面向不平衡遗忘请求的多模态基准数据集,旨在评估多模态大语言模型在非均匀遗忘场景下的公平性。该数据集规模显著超越现有基准,包含4,000个虚构身份、40,000张图像及225,000组视觉问答对,数据通过StyleGAN2生成人脸图像并配合DeepSeek模板构建问答对,采用分层抽样确保属性平衡。其核心价值在于模拟现实世界中不同人口群体提出遗忘请求的非均衡分布,为解决多模态环境下隐私保护与模型公平性协同优化提供关键实验平台。
FAIRGET is the first multimodal benchmark dataset for imbalanced forgetting requests, jointly created by the University of Trento and Bruno Kessler Foundation. It aims to evaluate the fairness of multimodal large language models (LLMs) under non-uniform forgetting scenarios. This dataset significantly outperforms existing benchmarks, containing 4,000 fictional identities, 40,000 images, and 225,000 visual question-answering (VQA) pairs. The facial images are generated via StyleGAN2, and the VQA pairs are constructed using DeepSeek templates; stratified sampling is adopted to ensure attribute balance. Its core value lies in simulating the uneven distribution of forgetting requests from different demographic groups in the real world, providing a critical experimental platform for the collaborative optimization of privacy protection and model fairness in multimodal environments.
数据集:FAIRGET
FAIRGET 是第一个用于评估多模态大语言模型(MLLMs)在非平衡遗忘请求下公平性的视觉问答基准数据集。它旨在模拟真实场景中不同人口统计群体以不同频率请求被遗忘的情况,从而检测模型是否会产生偏见行为。
数据构成
- 视觉数据:使用 StyleGAN2 生成人脸图像,并通过 Arc2Face 增强每个身份的内部变异性。每张图像根据年龄、性别和种族(通过 FairFace 标注)进行标注,身份通过分层抽样确保所有人口统计组合得到平等表示。
- 文本数据:每个身份包含 10 个额外属性(姓名、出生地、居住地、教育背景、职业、收入、身高、关系状态、政治倾向、出生日期)。属性通过基于规则的采样分配,部分属性与视觉特征关联以增强真实性(如教育程度与年龄相关),其他属性独立采样(如政治倾向)。问答对由模板化问题结合每个身份的属性值生成。
非平衡遗忘集
FAIRGET 提供了预构建的非平衡遗忘集,用于模拟从简单到具有挑战性的多种真实场景,这些场景会导致模型产生偏见。遗忘集并非均匀分布,而是偏向特定人口统计群体。预构建的分割文件位于 data/ 目录下,按以下模式组织:
| 分割文件 | 受保护群体 | 遗忘比例 |
|---|---|---|
split_lowadult*.json |
低收入 + 成年人 | 10-50-90% |
split_rightmale*.json |
右倾 + 男性 | 10-50-90% |
split_tallfemale*.json |
高个子 + 女性 | 10-50-90% |
split_singleasian*.json |
单身 + 亚裔 | 10-50-90% |
split_10mixed75.json |
右倾 + 男性(混合) | 75% |
split_base_2k.json |
— | 0%(平衡基线) |
例如,split_lowadult10.json 将“低薪 + 成年人”群体中 10% 的身份放入遗忘集,其余 90% 保留在保留集。文件名中的数字表示该受保护群体被选入遗忘集的比例,每个场景提供 10%、50% 和 90% 三种变体。
用途
- 评估遗忘质量:通过精确匹配、概率等指标测量。
- 评估隐私泄露:使用 Min-K++ AUC 指标。
- 评估公平性:通过人口统计平等差距(Demographic Parity gap)测量。
- 基准测试:适用于对 MLLM 遗忘方法进行公平性感知的评估。
获取方式
完整数据集可在 Hugging Face 上获取:https://huggingface.co/datasets/argmaxxer/FAIRGET

- 1Unlearning Under Imbalance: Benchmarking Fairness in Multimodal LLM Unlearning特伦托大学; 布鲁诺·凯斯勒基金会 · 2026年




