遇见数据集

peixian/equity_evaluation_corpus

收藏
Hugging Face2022-10-20 更新2024-03-04 收录
官方服务:

资源简介:

--- annotations_creators: - expert-generated language_creators: - expert-generated language: - en license: - unknown multilinguality: - monolingual size_categories: - 1K<n<10K source_datasets: - original task_categories: - text-classification task_ids: [] tags: - gender-classification --- # Dataset Card for equity-evaluation-corpus ## Table of Contents - [Dataset Description](#dataset-description) - [Dataset Summary](#dataset-summary) - [Supported Tasks](#supported-tasks-and-leaderboards) - [Languages](#languages) - [Dataset Structure](#dataset-structure) - [Data Instances](#data-instances) - [Data Fields](#data-instances) - [Data Splits](#data-instances) - [Dataset Creation](#dataset-creation) - [Curation Rationale](#curation-rationale) - [Source Data](#source-data) - [Annotations](#annotations) - [Personal and Sensitive Information](#personal-and-sensitive-information) - [Considerations for Using the Data](#considerations-for-using-the-data) - [Social Impact of Dataset](#social-impact-of-dataset) - [Discussion of Biases](#discussion-of-biases) - [Other Known Limitations](#other-known-limitations) - [Additional Information](#additional-information) - [Dataset Curators](#dataset-curators) - [Licensing Information](#licensing-information) - [Citation Information](#citation-information) ## Dataset Description - **Homepage:** [Needs More Information] - **Repository:** [Needs More Information] - **Paper:** [Needs More Information] - **Leaderboard:** [Needs More Information] - **Point of Contact:** [Needs More Information] ### Dataset Summary Automatic machine learning systems can inadvertently accentuate and perpetuate inappropriate human biases. Past work on examining inappropriate biases has largely focused on just individual systems and resources. Further, there is a lack of benchmark datasets for examining inappropriate biases in system predictions. Here, we present the Equity Evaluation Corpus (EEC), which consists of 8,640 English sentences carefully chosen to tease out biases towards certain races and genders. We used the dataset to examine 219 automatic sentiment analysis systems that took part in a recent shared task, SemEval-2018 Task 1 Affect in Tweets. We found that several of the systems showed statistically significant bias; that is, they consistently provide slightly higher sentiment intensity predictions for one race or one gender. We make the EEC freely available, and encourage its use to evaluate biases in sentiment and other NLP tasks. ### Supported Tasks and Leaderboards [Needs More Information] ### Languages [Needs More Information] ## Dataset Structure ### Data Instances [Needs More Information] ### Data Fields - `sentence`: a `string` feature. - `template`: a `string` feature. - `person`: a `string` feature. - `race`: a `string` feature. - `emotion`: a `string` feature. - `emotion word`: a `string` feature. ### Data Splits [Needs More Information] ## Dataset Creation ### Curation Rationale [Needs More Information] ### Source Data #### Initial Data Collection and Normalization [Needs More Information] #### Who are the source language producers? [Needs More Information] ### Annotations #### Annotation process [Needs More Information] #### Who are the annotators? [Needs More Information] ### Personal and Sensitive Information [Needs More Information] ## Considerations for Using the Data ### Social Impact of Dataset [Needs More Information] ### Discussion of Biases [Needs More Information] ### Other Known Limitations [Needs More Information] ## Additional Information ### Dataset Curators [Needs More Information] ### Licensing Information [Needs More Information] ### Citation Information [Needs More Information]

annotations_creators: - 专家标注 language_creators: - 专家生成 language: - 英语 license: - 未知 multilinguality: - 单语言 size_categories: - 1K<n<10K source_datasets: - 原创数据集 task_categories: - 文本分类 task_ids: [] tags: - 性别分类 # 公平性评估语料库(Equity Evaluation Corpus, EEC)数据集卡片 ## 目录 - [数据集概述](#dataset-description) - [数据集摘要](#dataset-summary) - [支持任务与评测榜单](#supported-tasks-and-leaderboards) - [使用语言](#languages) - [数据集结构](#dataset-structure) - [数据实例](#data-instances) - [数据字段](#data-fields) - [数据划分](#data-splits) - [数据集构建](#dataset-creation) - [构建初衷](#curation-rationale) - [源数据](#source-data) - [标注信息](#annotations) - [个人与敏感信息](#personal-and-sensitive-information) - [数据使用注意事项](#considerations-for-using-the-data) - [数据集的社会影响](#social-impact-of-dataset) - [偏差问题讨论](#discussion-of-biases) - [其他已知局限性](#other-known-limitations) - [附加信息](#additional-information) - [数据集维护者](#dataset-curators) - [授权信息](#licensing-information) - [引用信息](#citation-information) ## 数据集概述 - **主页:** [待补充] - **代码仓库:** [待补充] - **相关论文:** [待补充] - **评测榜单:** [待补充] - **联系方式:** [待补充] ### 数据集摘要 自动化机器学习系统可能会无意间放大并延续不当的人类偏见。过往针对不当偏见的研究大多仅聚焦于单个系统与资源,且目前缺乏用于检测系统预测中不当偏见的基准数据集。为此,我们构建了公平性评估语料库(Equity Evaluation Corpus, EEC),该语料库包含8640条精心挑选的英语语句,用于揭示针对特定种族与性别的偏见。我们使用该语料库对参与近期共享任务“SemEval-2018任务1:推文中的情感(Affect in Tweets)”的219个自动化情感分析系统进行了检测,发现其中多个系统存在统计学意义上的显著偏见:即它们会持续为某一种族或性别的表述给出稍高的情感强度预测值。我们免费公开EEC,并鼓励使用该语料库评估情感分析及其他自然语言处理(Natural Language Processing, NLP)任务中的偏见。 ### 支持任务与评测榜单 [待补充] ### 使用语言 [待补充] ## 数据集结构 ### 数据实例 [待补充] ### 数据字段 - `sentence`: 字符串类型字段,代表原始语句 - `template`: 字符串类型字段,代表语句生成模板 - `person`: 字符串类型字段,代表描述的人物身份 - `race`: 字符串类型字段,代表人物所属种族 - `emotion`: 字符串类型字段,代表语句蕴含的情感类型 - `emotion word`: 字符串类型字段,代表语句中的情感关键词 ### 数据划分 [待补充] ## 数据集构建 ### 构建初衷 [待补充] ### 源数据 #### 初始数据收集与标准化 [待补充] #### 源语言内容创作者是谁? [待补充] ### 标注信息 #### 标注流程 [待补充] #### 标注人员是谁? [待补充] ### 个人与敏感信息 [待补充] ## 数据使用注意事项 ### 数据集的社会影响 [待补充] ### 偏差问题讨论 [待补充] ### 其他已知局限性 [待补充] ## 附加信息 ### 数据集维护者 [待补充] ### 授权信息 [待补充] ### 引用信息 [待补充]

提供机构:
peixian
原始信息汇总

数据集概述

数据集描述

数据集总结

  • 名称: Equity Evaluation Corpus (EEC)
  • 目的: 用于评估机器学习系统中的偏见,特别是针对种族和性别的偏见。
  • 内容: 包含8,640个英语句子,用于测试219个自动情感分析系统在SemEval-2018 Task 1中的表现。
  • 发现: 多个系统显示出对特定种族或性别的统计显著性偏见。

支持的任务

  • 任务: 文本分类
  • 具体任务: 性别分类

语言

  • 语言: 英语

数据集结构

数据实例

  • 数量: 8,640个句子

数据字段

  • sentence: 字符串类型
  • template: 字符串类型
  • person: 字符串类型
  • race: 字符串类型
  • emotion: 字符串类型
  • emotion word: 字符串类型

数据集创建

来源数据

  • 类型: 原始数据

注释

  • 创建者: 专家生成

使用数据的考虑

数据集的社会影响

  • 目的: 评估和揭示机器学习系统中的偏见

数据集的偏见讨论

  • 发现: 系统对特定种族或性别显示出偏见

附加信息

许可证信息

  • 类型: 未知
搜集汇总
数据集介绍
peixian/equity_evaluation_corpus 数据集图片
构建方式
该数据集由领域专家精心构建,旨在系统性地揭示自动机器学习系统中潜在的不当偏见。其构建过程基于对种族和性别维度的深入考量,通过设计8,640个英文句子模板,每个模板嵌入特定的人物、种族、情感及情感词汇等关键字段,从而形成结构化的语料库。这些句子被精心筛选,以精准探测系统对不同种族和性别的反应差异,确保数据集在评估偏见时的敏感性与代表性。
特点
Equity Evaluation Corpus(EEC)的核心特点在于其针对性与系统性。它聚焦于情感分析任务中的种族和性别偏见评估,通过细粒度的字段设计(如模板、人物、种族、情感词)实现了多维度的偏见探测。数据集规模适中(8,640条),既保证了统计显著性,又便于实验复现。其独特价值在于,已成功应用于对219个SemEval-2018情感分析系统的评估,揭示了多个系统在预测中存在统计显著的偏见,为公平性研究提供了基准标杆。
使用方法
该数据集主要用于情感分析系统的偏见评估任务。用户可直接加载预定义的`equity_evaluation_corpus`数据集,利用其包含的`sentence`字段作为输入,结合`race`和`person`等标签字段进行分组分析。典型使用流程包括:将模型预测结果与真实情感标签对比,按种族或性别子集计算性能差异,并通过统计检验(如t检验)识别系统是否存在系统性偏见。该数据集兼容HuggingFace标准接口,支持快速集成至现有NLP工作流中。
背景与挑战
背景概述
在自然语言处理领域,自动机器学习系统在情感分析等任务中展现出卓越性能,然而这些系统可能无意中放大并延续人类社会中固有的偏见。为系统评估此类偏见,peixian/equity_evaluation_corpus(即Equity Evaluation Corpus,EEC)由研究团队于近年创建,旨在填补基准数据集缺失的空白。该数据集包含8,640条精心设计的英文句子,专门用于揭示系统对种族和性别的潜在歧视。研究团队利用此数据集对参与SemEval-2018 Task 1的219个自动情感分析系统进行测试,发现多个系统在预测中表现出统计显著的偏见,例如对特定种族或性别赋予略高的情感强度。EEC的发布为情感分析及其他NLP任务的公平性评估提供了关键资源,推动了算法去偏见研究的发展。
当前挑战
EEC所面对的挑战首先源于领域问题的复杂性:情感分析系统在真实应用中需处理多样化的社会语境,而现有模型常因训练数据中隐含的刻板印象而对特定种族或性别群体产生系统性偏差,这要求数据集能精准捕获细微的偏见信号。在构建过程中,挑战尤为显著:研究人员需从海量语言模板中筛选并组合出8,640个句子,确保每个句子能单独或组合触发模型对种族(如非裔与白人)和性别(男性与女性)的差异化响应,同时避免引入新的人为偏见。此外,句子需覆盖多种情感词(如“愤怒”“喜悦”),以测试系统在不同情感维度下的公平性,这要求对语言结构、情感语义和社会敏感性进行深度平衡,从而构建一个既全面又无冗余的评估基准。
常用场景
经典使用场景
Equity Evaluation Corpus(EEC)是一个专为评估自然语言处理系统中潜在偏见而设计的基准数据集,包含8,640条精心构造的英文句子,聚焦于种族与性别维度。其最经典的场景是作为情感分析系统的公平性测试集,通过对比系统在不同种族(如非裔美国人名与白人名字)和性别(男性与女性)句子上的情感强度预测差异,量化模型是否存在系统性偏见。该数据集常用于检测模型是否对特定群体产生不一致的情感评分,从而揭示算法在情感计算中的隐性歧视。
衍生相关工作
EEC的发布催生了多项衍生研究,包括基于该数据集的偏见缓解方法(如对抗性去偏训练和公平性正则化)、跨任务偏见迁移分析(将情感偏见检测扩展至仇恨言论识别和文本生成),以及新型偏见基准的构建(如针对多语言和交叉性偏见的扩充版本)。相关工作还探索了EEC与Winogender等数据集结合,用于联合评估性别与种族偏见的交互效应。此外,该数据集启发了模型可解释性研究,通过分析偏见样本的注意力权重分布,揭示模型内部决策的公平性缺陷。
数据集最近研究
最新研究方向
在自然语言处理领域,算法公平性与偏见缓解已成为前沿研究热点。Equity Evaluation Corpus(EEC)作为精心构建的基准数据集,聚焦于情感分析系统中针对种族与性别的隐式偏见检测。该数据集包含8,640条英文句子,通过系统化模板设计,能够有效揭示模型对特定人群(如非裔美国人或女性)在情感强度预测上的系统性偏差。近年来,随着大语言模型在社会各领域的广泛应用,EEC被越来越多的研究团队用于评估模型在多任务中的公平性表现,尤其在情感分析、仇恨言论检测及对话系统等敏感场景中。其影响不仅推动了可解释偏见检测方法的开发,还促进了公平性导向的模型微调与去偏技术(如对抗训练、数据重加权)的迭代,为构建更具包容性与社会责任感的AI系统提供了关键评估工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务