遇见数据集

WinoQueer-NL

收藏
arXiv2026-09-02 更新2026-09-04 收录
官方服务:

资源简介:

WinoQueer-NL是面向荷兰语语言模型的LGBTQ+偏见评估数据集,由马斯特里赫特大学基于英文WinoQueer基准创建,经文化适配与社区验证而成。该数据集包含42,906对刻板与反刻板句子,涵盖167个预测谓词、60个荷兰语名字及9种性别身份,总计约34万token。通过翻译、机器辅助校正及43名荷兰酷儿参与者的在线调查构建,确认145个文化相关刻板印象并新增22个荷兰特有偏见。其旨在评估荷兰语及多语言模型对LGBTQ+群体的偏见,揭示模型在跨性别身份上偏见高达97%的显著差异,为公平性研究提供关键基准。

WinoQueer-NL is an LGBTQ+ bias evaluation dataset for Dutch language models, developed by Maastricht University based on the English WinoQueer benchmark, with cultural adaptation and community validation. This dataset contains 42,906 pairs of stereotypical and anti-stereotypical sentences, covering 167 predictive predicates, 60 Dutch names, and 9 gender identities, totaling approximately 340,000 tokens. It was constructed via translation, machine-assisted correction, and an online survey with 43 Dutch queer participants. During this process, 145 culturally relevant stereotypes were confirmed, and 22 Dutch-specific biases were newly added. This dataset aims to evaluate bias against LGBTQ+ groups in Dutch and multilingual models, revealing a significant disparity with up to 97% bias against transgender identities, providing a critical benchmark for fairness research.

创建时间:
2026-09-02
搜集汇总
数据集介绍
WinoQueer-NL 数据集图片
构建方式
WinoQueer-NL的构建过程融合了精细的文化适配与社区参与。该数据集基于英语WinoQueer基准,通过将句子分解为模板、姓名占位符、身份标签及谓词(刻板印象)四要素,逐一进行荷兰语翻译与文化校对,并替换为荷兰常见人名。为确保文化相关性,研究团队邀请了43位荷兰语LGBTQ+群体成员参与线上调查,评估翻译后谓词的文化相关性与危害程度,同时收集自由文本反馈,新增22个荷语特有的偏见表述。最终,整合保留的167个相关谓词,按照原基准的11种模板结构,构建了包含42,906个成对句子的数据集,每个句子对仅替换身份标签,以精确隔离身份因素引发的偏见。
特点
该数据集的核心特点在于其文化敏感性与细粒度的身份分类。它涵盖了9种LGBTQ+亚身份,包括跨性别、非二元性别、同性恋、双性恋等,且各身份在数据集中分布不均匀,反映了社区反馈的差异性。通过社区验证,数据集剔除了文化不相关的刻板印象,并新增了荷语特有的偏见,如对外貌或家庭角色的假定,增强了地域针对性。此外,数据集附带每个刻板印象的相关性等级(Tier)与危害性评分,由43位参与者评定,为研究者提供了多维度的质量元数据。这种细致标注使数据集超越简单的句子对,能够支持对偏见危害程度的量化分析。
使用方法
WinoQueer-NL可用于评估荷兰语及多语言语言模型中的反LGBTQ+偏见。对掩码语言模型(如BERTje、mBERT),采用伪对数似然法计算未修改标记的条件概率,比较成对句子的得分;对自回归模型(如GPT-2荷兰版、Llama),则利用完整前缀的对数似然进行同样比较。每个句子对的偏见分数通过模型偏好刻板句的比例得出,并区分使用加权(bias W)与身份平均(bias M)两种计算方式,以平衡不同身份的样本量差异。研究人员可借此识别语言模型在面对不同性别认同时的偏见异质性,为后续偏见缓解工作提供基准。
背景与挑战
背景概述
WinoQueer-NL数据集由马斯特里赫特大学的研究人员于2026年创建,旨在评估荷兰语语言模型中对LGBTQ+群体的偏见。基于英文WinoQueer基准,该数据集通过翻译、文化适应和社区验证,构建了包含42,906个句子对的大规模语料,覆盖9个性别与性向身份类别。其核心研究问题在于:荷兰语模型在多大程度上继承了训练数据中的反同性恋偏见?研究团队通过43名荷兰语LGBTQ+参与者的在线调查,确认了145个文化相关刻板印象并新增22个特定于荷兰语境的偏见词条,最终形成167个有效谓词。该数据集为荷兰语自然语言处理领域的公平性评估提供了首个专门基准,填补了非英语环境下LGBTQ+偏见研究的空白,推动了多语言模型偏见评估的文化适配方法论发展,对促进AI包容性具有重要影响。
当前挑战
WinoQueer-NL所面临的挑战包括多个维度。在领域问题层面,荷兰语语言模型虽在LGBTQ+权利社会接受度较高的背景下发展,但模型仍表现出对跨性别和非二元身份群体的显著偏见,某些模型对跨性别句对偏好率高达97%,而对同性恋相关的偏见得分却低至6%,这种身份群体间的不均衡偏差揭示现有去偏方法难以均衡覆盖所有边缘群体。在构建过程中,跨语言文化适配构成重大挑战:直接翻译英文刻板印象可能导致部分术语在荷兰语中无对应表达或不符合本土语境,需依赖母语LGBTQ+人士的审查与修正,最终剔除了6个无效谓词;此外,社区调查因隐私保护设计仅收集有限人口统计学信息,样本量较小(n=43),难以全面代表多元的LGBTQ+社区,可能遗漏部分身份群体的特定偏见。这些困难凸显了构建文化敏感且具代表性的偏见评估资源的复杂性。
常用场景
经典使用场景
WinoQueer-NL作为针对荷兰语及多语言语言模型的反偏见评估基准,其经典使用场景在于系统性地量化模型对LGBTQ+群体所持有的刻板印象倾向。通过构造成对的刻板与反刻板句子,该数据集利用伪对数似然评分方法,分别对掩码语言模型与自回归语言模型进行偏差度量,从而揭示不同模型在跨身份群体上的偏好差异。研究者可借助此基准进行跨语言、跨模型的偏差比较,并追踪模型迭代过程中的公平性变化。
解决学术问题
该数据集填补了非英语环境中针对酷儿群体偏差评估的空白,解决了直接翻译英文基准可能引发的文化失真与语言学不对等问题。通过邀请43位荷兰语LGBTQ+社群成员参与调查验证,确保所收录的167项刻板印象在荷兰文化中具有切实相关性,并新增了22项本土化偏见。这一社区参与式设计为跨文化偏差研究提供了方法论示范,促使学界认识到偏差模式在语言与文化间的不可迁移性,推动多语言公平性评估向更细致、更具情境敏感性的方向发展。
衍生相关工作
该数据集的构建与验证流程衍生出多项开拓性工作。其社区参与式设计呼应了SeeGULL等基准对本地视角的强调,而文化适应性策略与KoBBQ的验证方法相呼应,共同推动了跨语言偏差基准的范式革新。在方法论层面,对掩码与自回归模型偏差评分的细致比较,启发了后续研究探索模型训练数据构成与身份表征不均之间的因果关系。此外,该数据集揭示的跨性别与非二元群体持续高偏见现象,催生了针对特定弱势群体的定向去偏研究及更精细的公平性评估框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务