naver-ai/kobbq
收藏资源简介:
KoBBQ是一个用于评估语言模型在韩国文化背景下社会偏见的基准数据集。它通过将BBQ数据集划分为三类(可直接文化翻译的、需要本地化的、不适合韩国文化的)并添加四个新的韩国文化特定偏见类别,构建了一个包含268个模板和76,048个样本的数据集。数据集涵盖了12个社会偏见类别,并通过大规模调查收集和验证了反映韩国文化刻板印象的社会偏见。
KoBBQ是一个用于评估语言模型在韩国文化背景下社会偏见的基准数据集。它通过将BBQ数据集划分为三类(可直接文化翻译的、需要本地化的、不适合韩国文化的)并添加四个新的韩国文化特定偏见类别,构建了一个包含268个模板和76,048个样本的数据集。数据集涵盖了12个社会偏见类别,并通过大规模调查收集和验证了反映韩国文化刻板印象的社会偏见。
数据集卡片 for KoBBQ
数据集概述
KoBBQ 是一个韩国偏见基准数据集,旨在评估语言模型(LMs)的社会偏见。该数据集包括268个模板和76,048个样本,涵盖12个类别的社会偏见。KoBBQ 通过大规模调查收集和验证反映韩国文化中刻板印象的社会偏见和偏见目标。
数据集详情
数据集描述
KoBBQ 数据集的构建过程包括以下步骤:
- BBQ 模板的分类
- 文化敏感性翻译
- 人口统计类别构建
- 新模板的创建
- 关于社会偏见的大规模调查
统计数据
| 类别 | 模板数量 | 样本数量 |
|---|---|---|
| 年龄 | 21 | 3,608 |
| 残疾状况 | 20 | 2,160 |
| 性别身份 | 25 | 768 |
| 外貌 | 20 | 4,040 |
| 种族/民族/国籍 | 43 | 51,856 |
| 宗教 | 20 | 688 |
| 社会经济地位 | 27 | 6,928 |
| 性取向 | 12 | 552 |
| 原籍地区 | 22 | 800 |
| 家庭结构 | 23 | 1,096 |
| 政治倾向 | 11 | 312 |
| 教育背景 | 24 | 3,240 |
| 总计 | 268 | 76,048 |
数据集来源
使用
直接使用
KoBBQ 数据集适用于评估语言模型的社会偏见。
伦理考虑
我们不支持任何恶意使用本数据集的行为。数据集不得用于训练自动生成和发布针对特定群体的偏见语言。我们强烈鼓励研究人员和从业者以有益的方式利用此数据集,例如减少语言模型中的偏见。
引用
BibTeX:
@article{jin2023kobbq, title={Kobbq: Korean bias benchmark for question answering}, author={Jin, Jiho and Kim, Jiseon and Lee, Nayeon and Yoo, Haneul and Oh, Alice and Lee, Hwaran}, journal={arXiv preprint arXiv:2307.16778}, year={2023} }
APA:
Jin, J., Kim, J., Lee, N., Yoo, H., Oh, A., & Lee, H. (2023). Kobbq: Korean bias benchmark for question answering. arXiv preprint arXiv:2307.16778.




