遇见数据集

JAugusto97/told-br

收藏
Hugging Face2024-01-18 更新2024-06-15 收录
官方服务:

资源简介:

ToLD-Br是巴西葡萄牙语中最大的有毒推文数据集,由42名注释者通过众包方式标注。注释者来自不同的人口统计背景,以减少偏见。数据集包含多标签和二进制两种版本。多标签版本包含六个类别(恐同、淫秽、侮辱、种族主义、厌女症和仇外心理),每个类别有0到3的投票数。二进制版本则将文本分类为有毒或无毒。数据集包含21,000个多标签示例和16,800个二进制训练示例。

ToLD-Br is the largest toxic tweet dataset in Brazilian Portuguese, annotated by 42 annotators through crowdsourcing. The annotators were recruited from diverse demographic backgrounds to mitigate bias. The dataset provides two variants: a multi-label version and a binary version. The multi-label version encompasses six categories: homophobia, obscenity, insult, racism, misogyny, and xenophobia, with vote counts ranging from 0 to 3 per category. The binary version categorizes texts as either toxic or non-toxic. The dataset comprises 21,000 multi-label instances and 16,800 binary training instances.

提供机构:
JAugusto97
原始信息汇总

数据集概述

基本信息

  • 数据集名称: ToLD-Br
  • 语言: 巴西葡萄牙语 (pt-BR)
  • 许可证: CC BY-SA 4.0
  • 数据集大小: 10K<n<100K
  • 任务类别: 文本分类
  • 标签创建者: 众包
  • 语言创建者: 众包

数据集结构

配置

  • multilabel:

    • 特征:
      • text: 字符串类型,表示用户发布的推文,提及其他用户的地方被替换为@user标签。
      • homophobia, obscene, insult, racism, misogyny, xenophobia: 数值类型,取值范围为{0, 1, 2, 3},表示标注者对该推文在相应类别上的投票数。
    • 数据分割:
      • train: 21,000个样本
  • binary:

    • 特征:
      • text: 字符串类型,表示用户发布的推文,提及其他用户的地方被替换为@user标签。
      • label: 数值类型,取值范围为{0, 1},表示推文是否具有毒性/攻击性。
    • 数据分割:
      • train: 16,800个样本
      • test: 2,100个样本
      • validation: 2,100个样本

数据集创建

数据收集和规范化

  • 数据收集时间: 2019年8月,为期15天
  • 数据收集方法: 关键词和用户提及
  • 关键词列表: 包含多种攻击性词汇

标注过程

  • 标注者选择: 从129名志愿者中选出42名,以确保多样化的背景
  • 标注工具: Google Sheets
  • 标注团队: 14个团队,每组3名标注者
  • 标注报酬: 每位标注者为1500个样本支付R$50 ($10)

标注者信息

  • 性别: 男性18名,女性24名
  • 性取向: 异性恋22名,双性恋12名,同性恋5名,泛性恋3名
  • 种族: 白人25名,棕色人种9名,黑人5名,亚洲人2名,未声明1名
  • 年龄范围: 18至37岁

使用数据集的考虑

社会影响

  • 目的: 帮助开发更好的仇恨言论检测系统

偏见讨论

  • 标注偏见: 通过选择多样化的标注者来减少偏见
  • 数据收集偏见: 使用关键词和用户提及可能导致数据范围受限

其他已知限制

  • 多标签类别: 由于数据偏斜,难以训练稳健的模型
  • 二元类别: 可用于训练分类器,最高可达76%的F1分数

附加信息

数据集创建者

  • João Augusto Leite, Diego F. Silva (联邦大学圣卡洛斯,巴西)
  • Carolina Scarton, Kalina Bontcheva (谢菲尔德大学,英国)

许可证信息

  • 数据集在CC BY-SA 4.0许可证下发布

引用信息

@article{DBLP:journals/corr/abs-2010-04543, author = {Joao Augusto Leite and Diego F. Silva and Kalina Bontcheva and Carolina Scarton}, title = {Toxic Language Detection in Social Media for Brazilian Portuguese: New Dataset and Multilingual Analysis}, journal = {CoRR}, volume = {abs/2010.04543}, year = {2020}, url = {https://arxiv.org/abs/2010.04543}, eprinttype = {arXiv}, eprint = {2010.04543}, timestamp = {Tue, 15 Dec 2020 16:10:16 +0100}, biburl = {https://dblp.org/rec/journals/corr/abs-2010-04543.bib}, bibsource = {dblp computer science bibliography, https://dblp.org} }

搜集汇总
数据集介绍
JAugusto97/told-br 数据集图片
构建方式
在社交网络语言毒性检测领域,巴西葡萄牙语长期缺乏大规模标注资源。ToLD-Br数据集应运而生,其构建过程严谨而富有创新性。数据采集于2019年8月,通过关键词匹配与用户提及策略从Twitter获取千万量级推文。标注环节尤为考究,从129名志愿者中遴选出42位具有多元人口统计学背景(涵盖种族、性取向、年龄与性别)的标注者,并分为14组,每组独立为1500条推文在六类毒性标签(恐同、淫秽、侮辱、种族主义、厌女、仇外)上进行投票,每则推文获得三人标注,最终形成多标签与二值两种版本。
特点
该数据集的核心特色在于其规模与标注的多元性。作为巴西葡萄牙语领域最大的毒性推文数据集,其体量达21,000条示例,远超此前同类资源的总和。多标签版本以0至3的投票数精细刻画每条推文在不同毒性维度的严重程度,为细粒度分析提供可能;二值版本则通过聚合标签形成明确的毒性判定,便于经典分类任务。尤为值得称道的是,标注团队在性别、性取向与种族构成上刻意追求平衡,有效降低了单一群体偏见对标注质量的影响,使数据更具代表性与鲁棒性。
使用方法
ToLD-Br为仇恨言论检测研究提供了灵活的使用路径。多标签配置适宜于探索性分析与多任务学习实验,研究者可借助各维度的投票分布深入理解不同毒性类别的交织模式;二值版本则直接适配监督学习范式,标准训练集含16,800条示例,验证集与测试集各含2,100条,便于模型评估与基准建立。基于BERT的微调模型在该二值任务上已取得0.76的F1分数,验证了其作为训练资源的有效性。用户可通过HuggingFace Datasets库便捷加载数据,并依据任务需求选择相应配置与划分。
背景与挑战
背景概述
在自然语言处理领域,仇恨言论检测作为一项关键的社会计算任务,旨在自动识别和过滤社交媒体中的攻击性内容,以维护网络空间的健康生态。尽管葡萄牙语作为全球第五大语言,巴西更是拥有庞大的推特用户群体,但面向巴西葡萄牙语的仇恨言论数据集却长期匮乏,仅有少数规模有限且标注单一的语料库可用。为填补这一空白,由巴西圣卡洛斯联邦大学的João Augusto Leite、Diego Furtado Silva与英国谢菲尔德大学的Carolina Scarton、Kalina Bontcheva于2020年共同创建的ToLD-Br数据集应运而生。该数据集通过众包方式,由精心筛选的42名来自不同种族、性取向、年龄和性别的标注者,对21,000条推文进行多标签标注,涵盖恐同、淫秽、侮辱、种族主义、厌女和仇外六类仇恨言论,成为巴西葡萄牙语领域规模最大、标注最精细的仇恨言论检测基准,在学术界具有里程碑意义。
当前挑战
ToLD-Br数据集所面临的挑战首先体现在领域问题的复杂性上:仇恨言论检测本身具有高度主观性和语境依赖性,同一文本在不同文化背景下可能被解读为攻击性或非攻击性,且多标签分类任务中类别间常存在重叠与歧义,使得模型难以精准区分。其次,在数据集构建过程中,挑战尤为显著:数据收集阶段依赖关键词和用户提及策略,导致样本分布存在偏差,例如部分类别(如仇外)样本极为稀疏;标注环节虽力求标注者多样性,但三标注者投票机制仍可能引入不一致性,且多标签版本因类别严重不平衡,难以训练出鲁棒模型,仅适用于分析研究。此外,推文匿名化处理虽保护隐私,却丢失了用户上下文信息,进一步增加了检测难度。
常用场景
经典使用场景
ToLD-Br作为巴西葡萄牙语领域规模最大的毒性推文数据集,其经典使用场景聚焦于多标签与二分类的仇恨言论检测任务。该数据集包含21,000条经42名多元背景标注者三方独立标注的推文,覆盖恐同、淫秽、侮辱、种族主义、厌女及仇外六大细分类别。研究者可通过其多标签配置进行细粒度毒性分析,或利用二分类版本训练端到端仇恨检测模型。BERT模型在该二分类任务上可达到0.75的F1分数,为巴西葡萄牙语社交媒体的内容审核提供了基准性能参照。
解决学术问题
该数据集系统性地解决了巴西葡萄牙语在仇恨言论检测领域的数据稀缺问题,填补了该语言仅有欧洲葡萄牙语小规模数据集的学术空白。通过引入42名涵盖不同性别、性取向、族裔及年龄层的标注者,它缓解了传统数据集中因标注者同质化导致的偏见问题。此外,其多标签投票机制(每类0-3票)为研究标注不确定性、标签噪声鲁棒性及弱监督学习提供了独特实验平台,推动了多语种仇恨言论检测的理论发展。
衍生相关工作
ToLD-Br衍生了一系列具有影响力的学术工作,包括基于该数据集的多语言仇恨检测对比研究,其中利用跨语言迁移学习探索英语与葡萄牙语间的知识共享。此外,研究者基于其标注投票机制提出了投票熵加权损失函数,以改善类别不平衡下的模型泛化能力。该数据集还催生了针对巴西政治选举期间仇恨言论演变的时序分析研究,以及结合用户元数据的多模态毒性检测框架,成为巴西自然语言处理领域仇恨言论方向的重要基准平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务