遇见数据集

yangezheng/SWSR-SexComment

收藏
Hugging Face2023-12-10 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: text_cn dtype: string - name: label_sexist dtype: class_label: names: '0': not sexist '1': sexist - name: category dtype: string - name: target dtype: string - name: text dtype: string splits: - name: train num_bytes: 2486780.276163808 num_examples: 6941 - name: validation num_bytes: 276587.5771788589 num_examples: 772 - name: test num_bytes: 307399.1466573329 num_examples: 858 download_size: 2021156 dataset_size: 3070767.0 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* ---

数据集信息: 特征项: - 中文文本(text_cn):字符串类型 - 性别歧视标签(label_sexist):类别标签(class_label)类型,其类别名称为:'0'表示非性别歧视(not sexist),'1'表示性别歧视(sexist) - 类别(category):字符串类型 - 目标对象(target):字符串类型 - 原文文本(text):字符串类型 数据集划分: - 训练集(train):字节量为2486780.276163808,样本数量为6941 - 验证集(validation):字节量为276587.5771788589,样本数量为772 - 测试集(test):字节量为307399.1466573329,样本数量为858 下载大小:2021156,数据集总大小:3070767.0 配置项: - 默认配置(default):数据文件对应关系如下 - 训练集:路径为data/train-* - 验证集:路径为data/validation-* - 测试集:路径为data/test-*

提供机构:
yangezheng
原始信息汇总

数据集概述

特征信息

  • text_cn: 数据类型为字符串。
  • label_sexist: 数据类型为分类标签,包含两个类别:
    • 0: not sexist
    • 1: sexist
  • category: 数据类型为字符串。
  • target: 数据类型为字符串。
  • text: 数据类型为字符串。

数据分割

  • train: 包含6941个样本,占用2486780.276163808字节。
  • validation: 包含772个样本,占用276587.5771788589字节。
  • test: 包含858个样本,占用307399.1466573329字节。

数据集大小

  • 下载大小: 2021156字节
  • 数据集大小: 3070767.0字节

配置信息

  • config_name: default
    • 数据文件路径:
      • train: data/train-*
      • validation: data/validation-*
      • test: data/test-*
搜集汇总
数据集介绍
yangezheng/SWSR-SexComment 数据集图片
构建方式
该数据集聚焦于中文社交媒体场景中的性别歧视言论识别,构建过程严谨而系统。数据源自公开社交平台评论,经过初步筛选后,由标注团队依据明确的性别歧视定义进行二元标注,区分为“性别歧视”与“非性别歧视”两类。为确保标注质量,数据还进一步划分了细粒度的类别与目标属性,从而形成多维度、结构化的标注体系。最终,数据集被划分为训练集、验证集和测试集,分别包含6941、772和858条样本,为模型训练与评估提供了均衡的分布。
特点
本数据集的核心特点在于其精细的标注层次与领域针对性。除了基础的二分类标签外,每条样本还附带了“类别”与“目标”字段,能够揭示歧视言论的具体类型(如外貌攻击、能力贬低等)及指向对象(如女性群体、个体等),为深入分析性别偏见提供了丰富语义信息。数据覆盖了多样化的社交评论场景,兼具现实复杂性与语言多样性,尤其适合用于训练能够理解中文语境下隐性歧视表达的自然语言处理模型。
使用方法
该数据集的使用极为便捷,兼容HuggingFace Datasets库的标准加载流程。用户可通过`load_dataset("yangezheng/SWSR-SexComment")`一键获取数据,并自动获得预划分的训练、验证与测试子集。每条样本包含原始中文文本(text_cn)、英文翻译(text)、性别歧视标签(label_sexist)以及细粒度分类(category)和目标(target)字段。研究者可直接利用标签进行二分类任务,或利用类别与目标字段开展多标签分类、细粒度分析等进阶研究,适用于微调预训练语言模型或评估模型在性别偏见检测上的表现。
背景与挑战
背景概述
在自然语言处理与社交媒体分析领域,性别歧视言论的自动识别已成为一项紧迫的研究课题。随着社交平台的普及,隐性或显性的性别偏见言论大量涌现,对网络环境的健康与用户心理安全构成严峻挑战。yangezheng/SWSR-SexComment数据集应运而生,由研究者于近年构建,旨在为中文语境下的性别歧视评论检测提供高质量标注资源。该数据集包含近8600条微博评论样本,每条样本均经过人工标注,区分‘性别歧视’与‘非性别歧视’两类,并附带评论的原始文本、中文翻译及所属类别标签。其发布填补了中文性别歧视语料库的空白,为多语言公平性与社会偏见研究提供了重要基准,推动了性别平等议题在计算语言学中的实证探索。
当前挑战
该数据集面临的核心挑战首先在于性别歧视言论的界定模糊性——中文网络表达中常隐含讽刺、反语或文化特定隐喻,使得标注一致性难以保障,且模型易受语境干扰。其次,数据构建过程中需克服社交媒体文本的噪声问题,如表情符号、不规则缩写及多语言混用,增加了预处理与标注难度。此外,现有样本规模有限(训练集仅6941条),可能不足以覆盖性别歧视的多样表现形式,导致模型泛化能力受限。最后,跨文化敏感性要求标注者具备深度社会认知,以避免主观偏见渗入标签,这对团队的专业性与标注流程的严谨性提出了极高要求。
常用场景
经典使用场景
在社交媒体文本分析领域,SWSR-SexComment数据集为识别和分类性别歧视言论提供了宝贵的标注资源。该数据集包含近8600条中文网络评论,每条文本均被标注为‘性别歧视’或‘非性别歧视’,并附带了细粒度的类别与目标属性。研究者常将其作为基准数据集,用于训练和评估基于深度学习的文本分类模型,如BERT、RoBERTa等预训练语言模型在性别歧视检测任务上的表现。其多维度标注信息也支持针对特定性别偏见类型(如针对女性的歧视、针对男性的歧视或针对非二元性别的歧视)的专项分析。
衍生相关工作
基于SWSR-SexComment数据集,研究者已衍生出多项经典工作。例如,有工作探索了多任务学习框架,将性别歧视检测与情感分析、攻击性语言检测等任务联合建模,以提升整体性能。另有研究专注于模型的可解释性,利用注意力机制可视化模型关注的文本片段,揭示歧视性表达的关键词模式。此外,该数据集还催生了针对数据不平衡问题的研究,如采用对抗训练或重采样策略来改善少数类别的识别效果。这些工作不仅深化了对性别歧视语言的理解,也推动了中文社交媒体内容安全分析方法的进步。
数据集最近研究
最新研究方向
在社交媒体与性别平等议题交织的前沿领域,SWSR-SexComment数据集聚焦于中文语境下性别歧视性评论的识别与分类研究。该数据集通过标注文本的性别歧视属性、类别及目标对象,为自然语言处理中的有害内容检测提供了高价值的标注资源。当前研究热点集中于利用该数据集训练和评估预训练语言模型在细粒度性别偏见检测上的表现,并结合社会热点事件(如网络暴力、女性权益讨论)分析歧视性语言的传播模式与语义特征。其意义在于推动中文网络空间性别平等意识的量化研究,为构建更安全、包容的在线交流环境提供数据驱动的技术支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务