遇见数据集

yangezheng/CMSB

收藏
Hugging Face2023-12-08 更新2024-03-04 收录
官方服务:

资源简介:

该数据集包含文本、毒性评分和性别歧视标签三个特征。文本为字符串类型,毒性评分为浮点数类型,性别歧视标签为分类标签,包含‘0’(非性别歧视)和‘1’(性别歧视)两个类别。数据集分为训练集、验证集和测试集,分别包含11040、1227和1364个样本。数据集的下载大小为1019308字节,总大小为1439136.0字节。

该数据集包含文本、毒性评分和性别歧视标签三个特征。文本为字符串类型,毒性评分为浮点数类型,性别歧视标签为分类标签,包含‘0’(非性别歧视)和‘1’(性别歧视)两个类别。数据集分为训练集、验证集和测试集,分别包含11040、1227和1364个样本。数据集的下载大小为1019308字节,总大小为1439136.0字节。

提供机构:
yangezheng
原始信息汇总

数据集概述

特征信息

  • text: 数据类型为字符串。
  • toxicity: 数据类型为浮点数(float64)。
  • label_sexist: 数据类型为分类标签,包含两个类别:
    • 0: not sexist
    • 1: sexist

数据分割

  • train: 包含11040个样本,大小为1165582.968234172字节。
  • validation: 包含1227个样本,大小为129544.41141515663字节。
  • test: 包含1364个样本,大小为144008.62035067126字节。

数据集大小

  • 下载大小: 1019308字节
  • 数据集大小: 1439136.0字节

配置信息

  • config_name: default
    • 数据文件路径:
      • train: data/train-*
      • validation: data/validation-*
      • test: data/test-*
搜集汇总
数据集介绍
yangezheng/CMSB 数据集图片
构建方式
在自然语言处理与计算社会学交叉领域,性别歧视语料的构建对于算法公平性研究至关重要。该数据集基于多源社交媒体文本,通过人工标注与自动化毒性评分相结合的方式构建。每条文本不仅被赋予一个连续值toxicity以度量其攻击性程度,还经由专业标注员依据明确标准将其二元分类为性别歧视(sexist)或非性别歧视(not sexist),从而形成多维度标注体系。数据集被划分为训练、验证与测试三个子集,分别包含11040、1227与1364条样本,确保了模型开发与评估的独立性。
使用方法
使用时,研究者可通过HuggingFace的datasets库直接加载该数据集,默认配置下将自动获取训练、验证与测试三个分割。对于性别歧视检测任务,可选用label_sexist字段作为分类目标;若需分析文本的普遍攻击性,则可采用toxicity字段进行回归建模。数据集文本已预先进行清洗与格式化,可直接输入至预训练语言模型进行微调,或作为基准语料用于评估现有性别歧视检测系统的性能表现。
背景与挑战
背景概述
在自然语言处理领域,社交媒体文本中的性别歧视与毒性内容检测已成为一项关键研究课题。yangezheng/CMSB数据集由研究者于近年创建,旨在系统性地捕捉与评估文本中的性别歧视表达及其与毒性之间的关联。该数据集包含超过1.3万条标注文本,每条数据均附带毒性评分与性别歧视标签,为多标签分类任务提供了标准化基准。其核心研究问题聚焦于如何从语义和语用层面区分显性与隐性的性别歧视言论,并探索毒性检测与性别偏见识别之间的交互关系。该数据集的发布推动了社交媒体内容审核模型在公平性与细粒度判别能力上的发展,尤其为低资源语言场景下的偏见检测研究提供了重要支撑。
当前挑战
当前CMSB数据集面临的核心挑战包括:其一,性别歧视与毒性之间的界定模糊性,部分文本虽不包含明显攻击性词汇却隐含性别偏见,导致标注一致性难以保障;其二,数据集中存在类别不平衡问题,性别歧视样本占比显著低于非歧视样本,易使模型偏向多数类;其三,构建过程中依赖人工标注,受标注者主观认知差异影响,边界案例的标签可靠性存疑;其四,社交媒体语言的动态演变特性,使得数据集的时效性面临考验,现有标注可能无法覆盖新兴的歧视性表达形式。这些挑战共同制约了模型在真实场景中的泛化能力与鲁棒性。
常用场景
经典使用场景
在自然语言处理与计算社会科学的交叉领域中,CMSB数据集为识别和分类网络文本中的性别歧视言论提供了宝贵的基准资源。该数据集包含超过1.1万条训练样本、1200余条验证样本及1300余条测试样本,每条文本均标注了毒性分数与二元的性别歧视标签。研究者常将其用于训练和评估基于深度学习的文本分类模型,如BERT、RoBERTa等预训练语言模型的微调,以精准检测性别歧视内容。这一经典场景不仅推动了自动化内容审核技术的发展,也为理解网络空间中性别偏见的语言表征奠定了数据基础。
解决学术问题
CMSB数据集的核心学术贡献在于解决了网络文本中性别歧视言论的量化与自动识别难题。传统研究多依赖小规模人工标注或基于词典的规则方法,难以捕捉语境化的隐性歧视表达。该数据集通过大规模、高质量的双重标注(毒性分数与性别歧视标签),使研究者能够训练模型区分显性与隐性的性别偏见。这一突破促进了计算语言学中偏见检测的理论发展,并揭示了语言特征与歧视意图之间的复杂关联,为构建更公平的在线交流环境提供了可复现的实证依据。
实际应用
在实际应用中,CMSB数据集驱动的模型被广泛部署于社交媒体平台、在线论坛及内容审核系统,用于自动标记或过滤性别歧视言论。例如,在Twitter和Reddit等平台的内容监管流程中,基于该数据集训练的检测器可实时识别有害文本,辅助人工审查团队提升效率。此外,教育机构和新闻媒体也利用相关工具监测评论区中的性别偏见,以营造更具包容性的公共讨论空间。这些实践显著降低了网络暴力的传播风险,并推动了企业社会责任政策的落地。
数据集最近研究
最新研究方向
在自然语言处理与计算社会科学的交叉领域中,性别歧视检测已成为一项紧迫的研究课题。CMSB数据集聚焦于在线文本中的性别偏见与毒性内容,其精细化的标签体系(区分‘性别歧视’与‘非性别歧视’)为构建更公平、更安全的网络环境提供了关键数据支撑。当前前沿研究正借助该数据集探索多任务学习框架,旨在同时捕捉文本的毒性程度与显性或隐性的性别歧视表达,以应对复杂的社会语言现象。这一方向与全球范围内反对网络骚扰、促进性别平等的热点事件紧密相连,例如社交媒体平台对仇恨言论的治理政策升级。CMSB的发布不仅推动了算法公平性的评估基准发展,还促使研究者反思数据标注中的文化语境差异,其意义在于为自动化内容审核系统注入社会敏感性,从而在技术实践中更有效地保护弱势群体免受数字暴力侵害。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务