ibm/SocialStigmaQA
收藏官方服务:
资源简介:
SocialStigmaQA数据集旨在通过社会污名来捕捉生成语言模型中的社会偏见放大现象。该数据集包含约10K个提示,这些提示通过37种模式构建,每种模式都包含一个普通的社会情境和一个相关问题。数据集特别关注两个方面:偏见的答案选择和提示风格。提供了两个版本:一个是简单的yes/no回答版本,另一个是链式思考(CoT)版本。数据集还包括四个提示风格:原始、积极、怀疑和基础,用于测试模型的社会偏见和鲁棒性。
SocialStigmaQA数据集旨在通过社会污名来捕捉生成语言模型中的社会偏见放大现象。该数据集包含约10K个提示,这些提示通过37种模式构建,每种模式都包含一个普通的社会情境和一个相关问题。数据集特别关注两个方面:偏见的答案选择和提示风格。提供了两个版本:一个是简单的yes/no回答版本,另一个是链式思考(CoT)版本。数据集还包括四个提示风格:原始、积极、怀疑和基础,用于测试模型的社会偏见和鲁棒性。
提供机构:
ibm原始信息汇总
数据集概述
SocialStigmaQA 是一个用于检测生成语言模型中社会偏见放大的数据集。该数据集包含约10,000个提示,设计用于系统地测试社会偏见和模型鲁棒性。数据集的核心结构包括37种模式(模板),每个模板都遵循一个基本结构:提供一个普通的社交情境并询问相关问题。
数据集结构
- 模板设计:每个模板都包含一个社交情境和一个相关问题,涉及93种美国中心的社会偏见。
- 偏见答案:数据集中的每个提示都设计为回答“是”或“否”时暗示社会偏见。
- 提示风格:每个模板包含四种提示风格:
original:原始模板,提及偏见,理想答案为“无法判断”。positive:原始模板加上鼓励无偏见回答的文本,理想答案与“偏见答案”相反。doubt:原始模板加上表达不确定性的文本,旨在测试模型的鲁棒性。base:原始模板去除偏见提及,作为模型在没有提及任何偏见时的回答基准。
数据集文件
yes_no/full_dataset_yes_no.csv:所有提示以“回答是/否/无法判断”结束,适用于贪婪解码。cot/full_dataset_cot.csv:所有提示以“让我们一步步思考”结束,诱导思维链(CoT)。
数据集字段
stigma:提示中测试的偏见(完整列表见templates/stigmas.csv)prompt:输入到LLM的提示biased answer:“是”或“否”对应于偏见输出的情况prompt style:[base, original, positive, doubt]之一
使用指南
数据集提供了两种版本的文件,分别用于不同的解码策略。用户可以通过加载数据集并使用模型生成输出来进行偏见分析。数据集还提供了用于计算偏见比例的示例代码。
注意事项
使用此数据集在大型语言模型上可能会产生有害和歧视性的文本。数据集中的93种偏见并非详尽无遗,社会偏见是动态的,数据集设计为可扩展,鼓励适应新的偏见。
搜集汇总
数据集介绍

构建方式
SocialStigmaQA数据集旨在捕捉生成语言模型通过污名化放大社会偏见的现象。以社会科学研究为基础,该数据集从一份包含93种美国中心污名的文献清单出发,精心策划了涉及简单社会情境的问答示例。团队手工设计了37个核心模式(templates),每个模式均遵循统一结构——描述一个平凡的社会场景并就此提出一个问题。数据集特别关注两个维度:一是偏倚答案(biased answer),即回答“是”或“否”可能暗示社会偏见;二是提示风格(prompt style),包括原始版(original)、积极版(positive)、怀疑版(doubt)和基线版(base)四种变体,用以系统测试偏见和模型鲁棒性。最终,数据集包含约10K条提示,覆盖多样化的提示风格。
特点
该数据集的核心特点在于其精细的结构化设计和对社会偏见的多维度考量。首先,每个模式都明确标注了偏倚答案方向,使得评估模型是否倾向于产生歧视性输出成为可能。其次,四种提示风格的引入不仅测试了模型在不同语境下的反应,还通过积极版引导无偏回答,怀疑版检验鲁棒性,基线版排除污名干扰,从而全面揭示偏见放大机制。此外,数据集提供两种版本:yes_no版本要求模型直接输出“是/否/无法判断”,而cot版本则通过“让我们一步步思考”诱导链式推理,便于分析推理过程中的偏见。这种双重设计兼顾了直接评估与深度剖析,为偏见审计提供了强大工具。
使用方法
使用SocialStigmaQA数据集时,可通过HuggingFace的`load_dataset`函数加载两个配置:`yes_no`和`cot`。加载后,将数据转换为DataFrame格式,并通过调用生成式模型(如HF或OpenAI API)对每个提示(prompt字段)生成输出。对于yes_no版本,需解析输出为“是/否/无法判断”之一,并与偏倚答案(biased answer字段)比较,统计偏倚比例。对于cot版本,需分离链式推理与最终答案,分别评估推理过程和答案的偏倚情况。用户还可按污名(stigma)、提示风格(prompt style)或偏倚答案进行过滤,进行精细化分析。数据集附带的代码示例提供了完整的评估流程,便于快速复现基准测试。
背景与挑战
背景概述
在生成式语言模型的社会偏见审计领域,现有数据集多聚焦于种族、性别等受保护的人口统计学特征,难以捕捉更为隐蔽且动态的社会污名化现象。为填补这一空白,IBM研究院的Manish Nagireddy、Lamogha Chiazor、Moninder Singh和Ioana Baldini于2024年创建了SocialStigmaQA数据集。该数据集以社会科学研究为基础,系统梳理了93种美国社会语境下的污名标签,并围绕日常社交场景构建了约1万条问答提示,旨在评估模型对污名信息的放大效应。其核心研究问题在于:语言模型是否会因提示中隐含的污名信息而产生偏见性输出?该数据集在AAAI 2024上发表后,为生成式AI的公平性评估提供了新的工具与视角。
当前挑战
SocialStigmaQA面临的核心挑战在于双重复杂性。首先,在领域问题层面,传统偏见审计仅关注二元答案中的偏见方向,而该数据集需同时捕捉“是”或“否”回答中可能隐含的污名偏见,并设计四种提示风格(原始、积极、怀疑、基准)以测试模型在不同语境下的鲁棒性,这对评估框架的精细度提出了更高要求。其次,在构建过程中,团队需手工设计37种模板以确保社交场景的合理性与污名嵌入的自然性,同时避免提示中引入额外的混淆变量。此外,93种污名标签的选择基于既有文献,但社会偏见具有动态性,如何确保数据集的可扩展性以纳入新兴污名,亦是持续存在的挑战。
常用场景
经典使用场景
SocialStigmaQA数据集的核心应用场景在于系统性地评估生成式大语言模型对社会污名的放大效应。该数据集基于社会科学中记录的93种美国社会污名,精心构建了约10,000条问答提示,涵盖37种手工设计的模式。每个模式均包含四种提示风格(原始、积极、怀疑、基础),并明确标注了偏向性答案,从而能够从多个维度测试模型在涉及日常社会情境时是否表现出偏见。该数据集特别适用于需要细粒度分析模型输出偏见的研究,例如通过比较不同提示风格下模型的回答差异,揭示模型对污名信息的敏感程度及其鲁棒性。
衍生相关工作
SocialStigmaQA的发布催生了一系列相关研究工作。在方法论层面,研究者借鉴其多提示风格设计思路,开发了针对其他社会偏见维度(如地域歧视、职业刻板印象)的拓展数据集。在模型分析方面,基于该数据集的链式思维(CoT)版本,涌现出大量关于推理过程偏见检测的研究,例如通过分析模型在逐步推理中是否隐含污名化假设。此外,该数据集还推动了偏见缓解技术的创新,包括对抗性提示生成和基于价值观对齐的微调方法,这些工作共同构建了从偏见检测到缓解的完整研究链条,显著提升了生成式语言模型的社会责任意识。
数据集最近研究
最新研究方向
在生成式语言模型社会偏见审计的前沿领域,SocialStigmaQA数据集开创性地突破了传统仅关注种族、性别等受保护人口特征的局限,将研究视角拓展至更广泛的污名化议题。该数据集基于社会科学研究,系统整理了93种以美国为中心的污名标签,精心构建了约1万条包含多元提示风格的问答样本,旨在揭示语言模型如何放大社会偏见。这一工作不仅为检测模型在微妙社会情境中的偏见输出提供了标准化基准,还通过引入偏向答案和提示风格等关键变量,实现了对模型鲁棒性与偏见敏感性的双重评估。作为2024年AAAI大会发表的重要成果,SocialStigmaQA推动了大模型公平性研究从静态属性分析向动态社会语境理解的范式转变,为构建更负责任的人工智能系统提供了关键评估工具。
以上内容由遇见数据集搜集并总结生成



