遇见数据集

StylisticBias

收藏
arXiv2026-06-19 更新2026-06-20 收录
官方服务:

资源简介:

StylisticBias是由慕尼黑工业大学等机构构建的用于评估多模态大语言模型属性级社会偏见的基准数据集。该数据集包含约25,000张合成人脸图像,基于500个基础人脸通过单属性编辑生成,涵盖皮肤特征、发型、服饰风格等约50种视觉属性,数据来源于Imagen 4和Gemini 2.5 Flash Image生成的合成图像。创建过程采用受控生成方法,在保持身份不变的前提下系统性地修改单一视觉属性,并通过人工验证确保图像质量。该数据集旨在探究特定视觉线索如何影响模型的社会判断,为多模态模型的细粒度偏见评估提供标准化测试平台,可应用于算法公平性研究和社会感知计算领域。

StylisticBias is a benchmark dataset developed by institutions including the Technical University of Munich for evaluating attribute-level social biases in multimodal large language models. This dataset contains approximately 25,000 synthetic facial images, which are generated via single-attribute editing based on 500 base facial portraits, covering around 50 visual attributes such as skin features, hairstyles, clothing styles and more. The data is sourced from synthetic images generated by Imagen 4 and Gemini 2.5 Flash Image. Its creation adopts a controlled generation framework that systematically modifies a single visual attribute while maintaining the identity of the original face, and manual verification is performed to guarantee image quality. This dataset is designed to investigate how specific visual cues influence the social judgments of models, providing a standardized testbed for fine-grained bias evaluation of multimodal models, and can be applied to the fields of algorithmic fairness research and social perception computing.

创建时间:
2026-06-19
搜集汇总
数据集介绍
StylisticBias 数据集图片
构建方式
StylisticBias数据集的构建始于对多模态大语言模型中视觉偏见来源的深入探究。研究团队首先利用Imagen 4生成了500张涵盖不同年龄、性别、族裔和体型的逼真基础人脸图像,确保身份特征的多样性。随后,借助Nano Banana工具,在保持每张基础人脸身份不变的前提下,针对单一视觉属性(如肤色瑕疵、发型、妆容、服饰风格等)进行约50种可控变化,最终产出约25,000张图片。所有图像均采用标准化摄影棚风格,以消除背景、光照等无关变量的干扰,从而精准隔离并衡量特定视觉线索对模型社会判断的影响。
特点
该数据集的核心特点在于其精细化的控制设计,通过固定身份并逐一改变视觉属性,实现了对属性层面社会偏见的归因分析。实验揭示,偏见并非均匀分布,而是高度集中于约15种视觉线索(如时尚风格、面部毛发与化妆),这些线索贡献了近80%的判断偏移量。值得注意的是,年龄与体型等刻意或非刻意的自我呈现线索,相较于族裔和性别,引发了更显著且一致的模型偏见,尤其是在社会经济与外貌相关的判断维度上,展现出所谓的“语义对齐偏见”。
使用方法
StylisticBias为评估多模态大语言模型的属性级偏见提供了标准化基准。使用时,研究者需将生成的人脸变化图像对(基础图像与单一属性变化图像)分别输入模型,并基于25个二元社会判断场景(如“有能力vs.无能力”、“富有vs.贫穷”)进行强制选择。通过对不同提示顺序和随机种子下的模型响应进行聚合,计算偏好分数及其偏移量Δ,即可量化特定视觉线索对模型决策的驱动强度。该数据集代码与全部图像已在GitHub和Hugging Face平台上发布,便于复现与扩展研究。
背景与挑战
背景概述
StylisticBias由慕尼黑工业大学与慕尼黑机器学习中心的研究人员于2026年联合创建,旨在系统剖析多模态大语言模型(MLLMs)中视觉线索如何驱动社会偏见。传统研究多聚焦于不同个体或群体间的粗粒度比较,难以区分外貌效应与身份差异。该数据集通过生成500张逼真基础人脸,并针对每张脸创建约50种单属性变体,共计约25000张图像,在保持身份固定的前提下,独立操控视觉属性。研究覆盖六种主流MLLMs与25项二值社会判断场景,揭示偏见并非均匀分布,而是高度集中于少数视觉线索,尤其体现在与外观语义对齐的社会经济与风格类判断中,为细粒度偏见评估提供了关键基准。
当前挑战
StylisticBias所应对的核心挑战在于现有偏见评估方法难以隔离特定视觉属性的因果影响。以往研究因个体身份差异与外貌特征相互纠缠,无法精准归因。构建过程中面临多重挑战:一是需生成可控的合成图像,在保持身份、姿态、光照一致性的同时实现单属性编辑,确保变化源于目标属性而非生成伪影;二是需平衡视觉属性的多样性(涵盖时尚、发型、配饰等约50种变体)与评估的可操作性,通过人工审核剔除近2%的低质量或语义矛盾变体;三是需消除提示词敏感性与随机种子波动对模型判断的影响,从而获得稳定可靠的偏见度量。
常用场景
经典使用场景
StylisticBias数据集最经典的用途在于系统性地评估多模态大语言模型(MLLMs)在视觉属性层面的社会偏见。通过将身份特征固定,仅改变单一视觉属性(如服装风格、面部毛发、眼镜等),研究者能够精确量化特定外观线索如何独立地影响模型的社会判断——例如对“自信与否”、“富裕与否”等二元特质的倾向性。这一设计剥离了身份差异与外观效应的混淆,使得偏见归因从粗粒度的群体比较迈向了细粒度的属性归因,为理解MLLMs如何感知人类外在形象提供了可控且可复现的标准化实验范式。
解决学术问题
该数据集有效解决了当前多模态偏见研究中一个核心未解难题:究竟是哪些具体的视觉属性驱动了模型的社会判断偏差?此前的对比研究往往聚焦于不同个体或群体间的差异,难以区分身份变化与属性变化各自所扮演的角色。StylisticBias通过保持身份恒定、逐一扰动视觉维度的创新设计,揭示了偏差并非均匀分布在所有外观特征上,而是高度集中于一小部分自我呈现相关线索(如时尚风格),并且这些效应在与社会经济地位或外貌相关的判断场景中尤为显著。这一发现不仅深化了我们对模型社会感知机制的理解,也为未来设计更公平、更稳健的多模态系统提供了方向,推动了偏见检测与缓解研究向精细化、归因化方向演进。
衍生相关工作
StylisticBias的提出已经催生了一系列衍生性的经典工作。其核心理念——即通过保持身份不变来孤立控制视觉属性的因果效应——启发了后续研究在真实照片上构建面部反事实编辑数据集,以在更加生态效度高的条件下验证模型偏见。另有一些研究在此基础上设计了更具社会情境性的视觉问答任务,探测模型对潜在特质的隐性推断。此外,该数据集的细粒度归因方法也被扩展至评估封闭源模型的决策边界,通过单属性视觉扰动探讨更广泛的社会偏见模式。这些衍生工作共同构建了一个更完整的、从可控到真实、从归因到评估的多模态偏见研究体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务