遇见数据集

stylistic-bias-dataset

收藏
Hugging Face2026-06-22 更新2026-06-23 收录
官方服务:

资源简介:

StylisticBias是一个用于评估多模态大语言模型中细粒度、属性级社会偏见的受控基准数据集。它旨在解决先前研究的关键局限:大多数偏见研究比较不同的个体或人口群体,导致无法区分外观驱动效应与身份层面的差异。该数据集的核心设计是保持身份固定,每次仅改变一个视觉属性(如发型、眼镜、纹身或时尚风格),从而能够直接测量特定视觉线索如何改变MLLM对个人的社会判断。数据集包含约25,000张完全合成的图像,基于500个合成写实的基础人脸生成,每人脸约有50种单属性编辑。它覆盖了12个视觉属性类别(皮肤、头发颜色、头发长度、发型、面部毛发、化妆、唇妆、眼镜、穿孔、纹身、头饰/配饰、时尚风格)和90种人口统计配置(3种年龄×2种性别×5种族×3种体型)。数据结构包括图像和丰富的元数据,如图像类型(头部肖像或全身像)、基础人脸的人口统计属性(年龄组、性别、种族、体型)、生成提示词以及记录具体变化属性的JSON字符串。数据集主要用于研究视觉属性偏见、社会判断偏移、人口统计背景与视觉属性的交叉效应,以及对已部署多模态AI系统进行公平性审计。所有图像均为合成,不涉及真实个人,以减少隐私风险。

StylisticBias is a controlled benchmark dataset for evaluating fine-grained, attribute-level social biases in multimodal large language models. It aims to address key limitations of prior research: most bias studies compare different individuals or demographic groups, making it difficult to distinguish appearance-driven effects from identity-level differences. The core design of the dataset keeps identity fixed while altering only one visual attribute at a time (such as hairstyle, glasses, tattoos, or fashion style), enabling direct measurement of how specific visual cues alter MLLMs social judgments about individuals. The dataset contains approximately 25,000 fully synthetic images, generated from 500 synthetic and photorealistic base faces, with about 50 single-attribute edits per face. It covers 12 visual attribute categories (skin, hair color, hair length, hairstyle, facial hair, makeup, lip makeup, glasses, piercings, tattoos, headwear/accessories, fashion style) and 90 demographic configurations (3 ages × 2 genders × 5 races × 3 body types). The data structure includes images and rich metadata, such as image type (headshot or full-body), demographic attributes of the base face (age group, gender, race, body type), generation prompts, and JSON strings recording specific changed attributes. The dataset is primarily used for studying visual attribute biases, shifts in social judgments, cross-effects between demographic backgrounds and visual attributes, and fairness auditing of deployed multimodal AI systems. All images are synthetic and do not involve real individuals to reduce privacy risks.

创建时间:
2026-06-09
原始信息汇总

数据集概述:StylisticBias

StylisticBias 是一个受控的基准数据集,用于评估多模态大语言模型(MLLM)在细粒度、属性层面上的社会偏见。其核心优势在于通过保持个体身份不变,每次仅改变一个视觉属性,从而直接测量特定视觉线索(如发型、眼镜、纹身或时尚风格)如何改变模型对同一个人的社会判断。

基本信息

  • 名称:StylisticBias
  • 语言:英语(评估提示和情景标签)
  • 模态:图像 + 文本
  • 许可协议:CC-BY 4.0
  • 论文StylisticBias: A Few Human Visual Cues Drive Most Social Biases in MLLMs (arXiv: 2606.20527)
  • 代码:https://github.com/timo-cavelius/StylisticBias

数据集规模与构成

属性 数值
总图像数 ~25,000张
基础人脸数 500张合成逼真身份
每个人脸的变化数 ~50个单属性编辑
人口统计配置 90种 (3年龄段 × 2性别 × 5种族 × 3体型)
属性类别 12种 (皮肤、发色、发长、发型、面部毛发、眼妆、唇妆、眼镜、穿孔、纹身、头饰/配饰、时尚风格)
单个属性值 ~55个 (完整网格);评估中使用了34个
图像分辨率 1024×1024像素
数据格式 Parquet (内嵌图像)

数据结构

  • 核心列:包含唯一标识符 id、所属基础人脸组 face_group、图像类型 (face 半身像 / body 全身像)、图像、图像文件名路径、以及基础人脸的详细人口统计信息 (age, gender, ethnicity, body_type)、生成提示 prompt、和描述该变化的具体属性 (variation_json) 等。
  • 资产类型
    • face:头肩部肖像,用于除时尚风格外的所有属性变化。
    • body:全身肖像,专门用于时尚风格变化。
  • 属性空间:包含12个属性类别,每个类别下有不同的具体值。例如,发型包括凌乱、后梳等;时尚风格包括职业装、休闲装、运动装等。部分不常用或重复的值已被排除在评估子集之外。

数据创建

  • 数据来源:全部为合成图像,未使用任何真实人物照片。
  • 生成方法:使用 Imagen 4 生成基础人脸,使用 Nano Banana (Gemini 2.5 Flash Image) 生成属性变化。
  • 质量控制:90%的生成图像经过人工审核,确认人口统计合理性、身份一致性及属性变化正确性,通过率为98%。

预期用途与限制

  • 预期用途:作为评估多模态大语言模型偏见的基准。适用于研究视觉属性驱动的偏见、视觉线索对模型社会判断的影响、人口统计学与视觉属性的交叉影响以及AI系统的公平性审计。
  • 限制
    1. 仅使用合成图像,可能无法完全反映真实世界照片的分布。
    2. 涉及的人口统计和属性范围是经过筛选的,未涵盖所有身份和外观维度。
    3. 用于测量输入层面的影响,不解释产生偏见的底层机制。

伦理声明

数据集所有面部图像均为合成,不指代或相似任何真实个体,旨在降低隐私风险。数据集发布旨在支持公平性审计和偏见归因研究,并承认其方法论存在可能被用于对抗性目的的双重用途风险。使用的社会判断情景仅用于量化模型偏见,不代表对其内容的认可。

搜集汇总
数据集介绍
stylistic-bias-dataset 数据集图片
构建方式
StylisticBias数据集由500张完全合成的高保真度人脸图像作为基础身份单元,每张图像基于年龄、性别、族裔与体型四维人口学属性的笛卡尔积生成,覆盖90种配置。随后,研究人员通过图像编辑模型对每张基础面孔逐一施加单一视觉属性变异,如发型、饰品或妆容,同时严格保持身份特征不变,最终构建出约25,000张图像的受控语料库。所有图像均经人工审核,确保身份一致性、属性准确性及无伪影残留,通过率高达98%。
特点
该数据集的核心特色在于实现了对多模态大语言模型进行细粒度、属性级社会偏见评估的精准控制。通过固定身份、仅变化单一视觉线索的实验范式,它首次将视觉外观效应与人口群体差异解耦,令人可直接归因于特定外观特征对模型社会判断的影响。数据集涵盖12类视觉属性与约55个具体数值,并配备25个二元社会判断场景作为评测基准,结构系统全面。
使用方法
研究人员可将StylisticBias作为评估基准,选取开源多模态大语言模型(如LLaVA、Qwen3-VL、Pixtral等),对每张图像结合25个社会判断场景进行提示测试。推荐采用4种提示顺序与3个随机种子的组合,每场景执行12次查询以确保结果稳健。数据以Parquet格式存储并内嵌图像,便于通过Python加载及解析元数据,从而精确测量特定视觉属性如何影响模型的社交感知输出。
背景与挑战
背景概述
StylisticBias数据集由Shaghayegh Kolli、Timo Cavelius等研究人员于2026年创建,旨在弥补多模态大语言模型(MLLMs)社会偏见评估中“无法区分个体身份与视觉外观影响”的关键缺陷。传统偏见研究常因比较不同个体或群体而混淆了身份层次与外观驱动的效应,该数据集通过固定身份、每次仅改变单一视觉属性(如发型、眼镜、纹身或时尚风格)的创新设计,实现了对细粒度属性级社会偏见的精准归因。数据集包含约25,000张完全合成的图像,覆盖500个基础身份、12类视觉属性及90种人口统计配置,为MLLMs的公平性审计与偏见溯源提供了高度受控的基准,对推动视觉语言模型的社会责任研究具有重要影响。
当前挑战
该数据集所解决的领域挑战在于,现有偏见评估研究难以分离视觉属性(如衣着或妆容)与人口统计学特征(如种族或性别)对模型社会判断的独立作用,导致偏见来源模糊不清。StylisticBias通过控制变量法,仅改变单一属性而保持其他特征不变,首次实现了对具体视觉线索如何影响MLLMs对个体社会感知的精确测量。数据集构建过程中面临的挑战包括:确保合成图像的身份一致性,即在不同属性编辑后仍能被识别为同一人;在90%的人工验证中,需严格检查人口统计学合理性及属性变化无伪影,最终98%的图像通过审核,失败案例经重新生成与复核才纳入数据集,这一流程对保证基准的可靠性至关重要。
常用场景
经典使用场景
StylisticBias数据集的核心价值在于其为评估多模态大语言模型中的细粒度、属性级社会偏见提供了一个精妙控制的基准平台。传统偏见评估多通过比较不同个体或人口统计学群体的模型输出,难以剥离外观驱动效应与身份层面变异的影响。该数据集创新性地固定个体身份,逐次仅变动一项视觉属性(如发型、妆容、纹身等),使得研究者能够直接、精确地测量特定视觉线索如何独立地改变模型对同一个体的社会判断,从而开辟了视觉偏见归因研究的新范式。
衍生相关工作
StylisticBias数据集的发布已催生了一系列重要的后续研究工作。其方法论——将身份固定并精细操控单一视觉属性——为视觉偏见研究树立了新标准,促使学者开发出更复杂的归因技术以探索模型内部视觉表征与偏见输出之间的因果链路。随着该基准应用于更多开源模型,研究者开始系统比较不同架构、训练范式与数据策略对视觉偏见鲁棒性的影响。此外,该数据集所揭示的‘少量外观线索主导偏见’现象,激发了对抗性去偏算法的设计与面向特定视觉属性的公平性微调方法的探索,标志着多模态AI公平性研究正迈向更加精细化与因果驱动的阶段。
数据集最近研究
最新研究方向
StylisticBias数据集的提出标志着多模态大语言模型(MLLMs)公平性研究的重要转折点。在以往工作中,社会偏见评估常因混杂不同个体或群体的身份差异而难以归因于特定视觉特征。该数据集通过严格保持人脸身份固定,仅逐次改变单一视觉属性(如发型、纹身、着装风格),实现了对细粒度视觉线索如何独立驱动模型社会判断的因果式测量。这一前沿方向直指当前AI公平性领域的核心痛点:模型偏见究竟是源于对特定群体的刻板印象,还是源于某些普适性视觉特征在跨身份情境下的一致放大效应。基于约2.5万张合成图像和34种属性变体,研究揭示了少量人类视觉特征即可主导大多数社会偏见的形成,为算法去偏、公平性审计以及构建更鲁棒的多模态系统提供了精准的归因工具与实验范式,其方法论意义远超传统群体水平的偏差评估。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务