遇见数据集

POPQUORN

收藏
arXiv2023-08-29 更新2024-06-21 收录
官方服务:

资源简介:

POPQUORN是由密歇根大学信息学院创建的大型NLP数据集,包含45,000条来自1,484名代表性样本的注释,涵盖性别、年龄和种族。数据集包含四个多样化的NLP任务:攻击性检测、问题回答、文本重写和礼貌评级。创建过程考虑了注释者的背景多样性,以减少数据集偏见。该数据集旨在解决NLP任务中的注释者背景影响问题,提高模型的公平性和准确性。

POPQUORN is a large-scale NLP dataset developed by the School of Information at the University of Michigan. It encompasses 45,000 annotations sourced from 1,484 representative annotators, with demographic coverage across gender, age and race. The dataset features four distinct NLP tasks: aggressive detection, question answering, text rewriting, and politeness rating. The construction of this dataset prioritizes annotator background diversity to mitigate dataset bias. Its primary goal is to address the confounding effect of annotator demographic backgrounds on NLP task outcomes, and enhance the fairness and accuracy of trained models.

创建时间:
2023-06-12
搜集汇总
数据集介绍
POPQUORN 数据集图片
构建方式
POPQUORN数据集以美国人口在性别、年龄和种族上的代表性分布为采样基准,从Prolific平台招募了1,484名标注者,针对四项典型的自然语言处理任务——冒犯性检测、阅读理解、礼貌性文本改写与礼貌性评分——进行大规模标注。研究团队从Ruddit、SQuAD 2.0和Enron邮件数据集中精心筛选样本,采用分层桶式采样策略以平衡各任务中标注样本的难度与主观性分布,并通过POTATO工具搭建标注界面,确保流程高效可控。每项任务均设置独立标注协议,标注者按每小时12美元标准获得报酬,并在任务完成后自愿填写人口统计问卷,最终累计收集45,000条标注数据。
特点
该数据集的核心特色在于其人口统计学上的代表性设计与多维度的标注信息整合。标注者群体严格匹配美国人口在性别、年龄和种族上的分布,突破了以往研究仅聚焦单一身份维度的局限,首次系统性地纳入教育背景等此前被忽视的变量。数据集涵盖从客观阅读理解到主观冒犯性判断的多样化任务,每条实例均附带标注者详细的人口统计信息,使得研究者能够深入分析不同群体在语言感知与任务表现上的系统性差异。此外,数据集中标注者间的分歧不再是简单的噪声,而是被视为反映社会文化差异的有价值信号,为探索标注者身份对数据质量的影响提供了独特视角。
使用方法
使用者可依据研究目标灵活调用POPQUORN数据集。对于冒犯性与礼貌性评分任务,可直接利用标注者的人口统计标签进行群体间对比分析,或构建混合效应模型以量化性别、年龄、种族及教育背景对评分倾向的影响。阅读理解任务中的问答标注可用于评估模型在不同人群中的性能偏差,而礼貌改写任务则提供了原始与改写文本对,支持文本生成与风格迁移模型的训练与评测。数据集以JSON格式公开于GitHub,内含完整标注结果、标注者背景信息及标注界面截图,便于复现实验或开展元分析。建议用户在使用时明确标注者的群体构成,以避免模型偏见被无意中放大。
背景与挑战
背景概述
在自然语言处理领域,标注者的身份背景对其标注行为的影响长期被忽视,传统数据集构建往往默认标注者具有同质性,并通过高标注者间一致性指标来确保数据质量。然而,随着NLP模型在社会敏感场景中的广泛应用,标注者的性别、年龄、种族、教育水平等人口统计学特征如何系统性塑造标注结果,已成为一个亟待探究的深层问题。2023年,密歇根大学的Jiaxin Pei与David Jurgens发布了POPQUORN数据集,旨在填补这一研究空白。该数据集包含来自1484名标注者的45000条标注,覆盖冒犯性检测、问答、文本改写与礼貌性评分四项代表性NLP任务,且标注者样本在性别、年龄与种族上与美国人口分布相匹配。POPQUORN的发布为揭示标注者身份多样性对数据偏见的影响提供了关键资源,推动了更具社会责任感的数据集构建范式。
当前挑战
POPQUORN所面对的核心挑战源于标注者身份差异带来的系统性偏见。在冒犯性检测任务中,不同种族与年龄段的标注者对同一文本的冒犯程度感知存在显著差异,黑人参与者倾向于给出更高冒犯评分,而传统数据集如Ruddit的标注结果与白人标注者的判断高度相关,反映出数据集中隐含的种族视角不均衡。在问答任务中,教育水平与种族背景显著影响阅读理解表现,揭示出结构性不平等在标注过程中的投射。礼貌性评分任务中,教育程度较高的标注者对同一邮件给予更低礼貌评分,表明社会地位差异影响语言感知。此外,构建过程中需确保标注者样本的人口统计学代表性,同时平衡任务难度与主观性,并处理标注者回避披露敏感身份信息等伦理难题,这对数据收集流程的严谨性与包容性提出了极高要求。
常用场景
经典使用场景
在自然语言处理领域,标注者的身份背景对主观性任务的影响日益受到关注。POPQUORN数据集通过招募与美国人口在性别、年龄和种族上具有代表性的1484名标注者,对45,000条标注数据进行系统性收集,涵盖冒犯性检测、问答、文本改写和礼貌性评分四项典型任务。该数据集最经典的使用场景是探究标注者人口统计学特征(如性别、年龄、种族、教育水平)如何系统性地影响其标注行为,从而揭示传统标注流程中因标注者同质性而潜藏的偏见。研究者可借助该数据集分析不同群体在主观判断上的差异,进而推动更公平、更具代表性的数据构建范式。
实际应用
POPQUORN数据集的实际应用场景广泛,尤其在需要人类反馈的工业级人工智能系统中扮演关键角色。例如,在基于人类反馈的强化学习(RLHF)流程中,该数据集提供了如何从多样化背景的标注者中采集平衡标注的范例,帮助技术团队在设计内容审核模型、对话系统或社交媒体过滤算法时,避免因标注者群体单一而导致的系统性偏差。此外,该数据集还直接用于开发人口统计学感知的标注聚合策略,确保模型对不同种族、年龄和性别的用户群体具有更公平的预测表现,从而降低在敏感场景(如仇恨言论检测)中误判或边缘化特定群体的风险。
衍生相关工作
POPQUORN数据集衍生了多项开创性研究工作,推动了自然语言处理中标注者差异建模的方向。基于该数据集,研究者开发了人口统计学感知的标注聚合模型,将标注者背景信息作为特征融入训练过程,以提升模型对主观任务的泛化能力。此外,该数据集激发了关于标注者教育水平与阅读理解表现之间关联的深入分析,揭示了结构性不平等如何通过标注数据渗透到模型之中。后续工作还借鉴其代表性采样方法,构建了跨语言、跨文化的标注者差异基准,并探索了如何利用标注者分歧而非将其视为噪声来训练更鲁棒的NLP系统,这些研究共同促进了社会感知型人工智能的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务