遇见数据集

Atarogic/BiasIG

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

--- license: mit task_categories: - text-to-image language: - en tags: - bias - fairness - text-to-image - benchmark - social-bias - arxiv:2604.11934 pretty_name: BiasIG size_categories: - 10K<n<100K configs: - config_name: default data_files: - split: train path: prompts.jsonl --- # BiasIG BiasIG is a benchmark for auditing multi-dimensional social biases in text-to-image models. This dataset release contains the prompt suite from the [BiasIG GitHub repository](https://github.com/Astarojth/BiasIG), together with the released ground-truth statistics used by the evaluation code. - Paper: [BiasIG: Benchmarking Multi-dimensional Social Biases in Text-to-Image Models](https://arxiv.org/abs/2604.11934) - Code and benchmark repository: [Astarojth/BiasIG](https://github.com/Astarojth/BiasIG) - Evaluation backbone: [BIGBench/InternVL-4B-bench](https://huggingface.co/BIGBench/InternVL-4B-bench) ## What Is Included - 47,040 text-to-image prompts in `prompts.jsonl` - Ground-truth statistics and weighting files in `truth/` - Metadata fields derived from the original prompt layout: `setting`, `family`, `axis`, and `attribute_values` The prompt suite covers implicit and explicit evaluation settings across occupations, characteristics, and social relations. ## Data Fields Each prompt record contains: - `id`: stable row identifier in this export - `prompt`: text-to-image prompt - `source_file`: original path in the BiasIG repository - `line_number`: original line number - `setting`: `implicit` or `explicit` - `family`: `occupation`, `characteristic`, or `relation` - `axis`: protected or evaluation axis when available - `attribute_values`: explicit attribute values parsed from the filename when available ## Usage ```python from datasets import load_dataset dataset = load_dataset("Atarogic/BiasIG") ``` The released ground-truth files can be accessed directly from the repository under `truth/`. ## Citation If you use BiasIG, please cite the paper and repository. ```bibtex @article{luo2026biasig, title={BiasIG: Benchmarking Multi-dimensional Social Biases in Text-to-Image Models}, author={Luo, Hanjun and Huang, Zhimu and Huang, Haoyu and Deng, Ziye and Chen, Ruizhe and Li, Xinfeng and Liu, Zuozhu and Salam, Hanan}, journal={arXiv preprint arXiv:2604.11934}, year={2026}, url={https://arxiv.org/abs/2604.11934} } ```

BiasIG is a benchmark for auditing multi-dimensional social biases in text-to-image models.

提供机构:
Atarogic
搜集汇总
数据集介绍
Atarogic/BiasIG 数据集图片
构建方式
BiasIG数据集的构建基于系统性多维社会偏误审计框架,其提示词套件源自同名GitHub仓库,共计47,040条文本到图像生成提示。每条提示通过预设的元数据结构进行组织,涵盖`setting`(隐式或显式)、`family`(职业、特质或社会关系)、`axis`(受保护评价轴)及`attribute_values`(显式属性值)四个维度。数据集还包含存储在`truth/`目录下的真实统计文件与权重文件,用于支持后续评估算法的准确计算。这种结构化的构建方式确保了偏误评估的全面性与可复现性。
特点
该数据集的核心特点在于其多维社会偏误审计能力,覆盖职业、个人特质与社会关系三大领域,并区分隐式与显式两种评估情境。提示词设计精细,每一条均携带丰富的元数据标签,便于研究者按需筛选与分组分析。此外,BiasIG不仅提供原始提示,还配套发布了经过验证的真实统计信息,使得模型输出的偏误量化结果具有明确的基准参照。这些特性使其成为文本到图像模型公平性评估领域的重要基准资源。
使用方法
研究者可通过HuggingFace的`datasets`库加载BiasIG数据集,仅需一行代码`load_dataset("Atarogic/BiasIG")`即可获取完整的提示词套件。加载后,每条记录包含`id`、`prompt`、`setting`、`family`等字段,便于进行细粒度分析。真实统计文件位于仓库`truth/`目录下,可直接下载使用。为复现论文中的评估流程,建议结合官方推荐的评估后端`BIGBench/InternVL-4B-bench`进行模型偏误量化分析,从而确保结果的可比性与可靠性。
背景与挑战
背景概述
文本到图像生成模型在近年来取得了显著进展,但其生成内容中潜藏的社会偏见问题日益受到关注。BiasIG数据集由Luo、Huang等研究者于2026年提出,旨在系统性地审计文本到图像模型中的多维度社会偏见。该数据集包含47,040条提示,覆盖职业、特征与社会关系三个家庭类别,并区分显性与隐性评估设置,为评估模型在不同保护属性上的公平性提供了标准化基准。其研究工作发表于arXiv,配套的评估主干InternVL-4B-bench进一步增强了评估的可靠性。BiasIG的发布填补了现有基准在偏见多维性与评估粒度上的不足,推动了生成式AI公平性研究的规范化发展。
当前挑战
BiasIG所解决的领域核心挑战在于,文本到图像模型在生成图像时易复制并放大训练数据中的社会刻板印象,尤其是在职业、外貌特征及社会关系维度上,现有评估工具缺乏对显性与隐性偏见的系统覆盖。数据集构建过程中,设计者需要精心构造提示模板以平衡测试广度与语义自然性,同时确保偏见轴线的正交性以避免评估混杂。此外,生成7,000余条提示的多轮迭代与属性值解析、地面真值统计的精确标注亦构成挑战,要求标注者深入理解社会偏见的多维内涵并保持主观判断的一致性。
常用场景
经典使用场景
在文本到图像生成模型的公平性评估领域,BiasIG作为一项多维社会偏见基准测试工具,已成为系统性审计模型偏见行为的核心数据集。研究者利用其包含的47,040条精心设计的提示语,覆盖职业、特征与社会关系三大维度,区分显性与隐性两种评估设置,借此全面探查生成模型在人物描绘中是否存在对特定群体的刻板印象或系统性偏差。该数据集特别适用于对比不同模型架构、训练数据或去偏策略对输出公平性的影响,为量化社会偏见提供标准化的评估框架。
解决学术问题
BiasIG直面当前文本到图像模型中广泛存在但缺乏系统量化标准的社会偏见问题。学术界长期受困于偏见评估的维度单一性与方法碎片化,难以对比不同研究结论。该数据集通过构建多维度的提示体系与权威的参考标注,首次实现了对职业、特征及社会关系三大偏见轴的联合审计,有效解决了生成模型公平性评估中测试场景不全面、结论可比性差的核心难题。其发布推动了偏见测量从定性观察走向定量基准测试,为后续去偏算法的设计提供了明确的目标与评估依据。
衍生相关工作
围绕BiasIG数据集,衍生了一系列重要工作。一方面,研究者基于其提示模板开发了自动化偏见检测管线,将其与InternVL-4B-bench等多模态评估骨干结合,提升了偏见识别的效率与粒度。另一方面,有学者利用该数据集训练专门的去偏生成器,通过对抗训练或指导性解码降低模型输出中的社会偏差。此外,BiasIG的评估框架也被扩展至跨语言与文化背景的社会偏见研究,推动了生成模型公平性领域的全球化探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务