遇见数据集

Poulpidot/FrenchHateSpeechSuperset

收藏
Hugging Face2023-02-04 更新2024-03-04 收录
官方服务:

资源简介:

FrenchHateSpeechSuperset数据集是一个包含多个数据集的超集,主要涉及仇恨言论、骚扰、性别歧视、种族歧视等信息。数据集整合了MLMA、CAA、FTR等多个数据集,以及从英文翻译过来的UC-Berkeley-Measuring-Hate-Speech数据集。为了扩充数据集,还通过机器翻译模型将其他语言的信息整合进来,并使用语言检测模型进行语言验证。每个样本根据是否为仇恨言论被标注为0或1。

The FrenchHateSpeechSuperset dataset is a multi-dataset superset primarily focused on hate speech, harassment, sexism, racism and other related discriminatory content. It integrates multiple datasets including MLMA, CAA, FTR, as well as the UC-Berkeley-Measuring-Hate-Speech dataset which was translated from English. To expand the dataset scale, information in other languages was integrated through machine translation models, and language verification was conducted using language detection models. Each sample is assigned a binary label of 0 or 1 based on whether it contains hate speech.

提供机构:
Poulpidot
原始信息汇总

数据集概述

数据集名称

FrenchHateSpeechSuperset

数据集内容

该数据集是一个包含多种类型负面言论的超集,包括仇恨言论、骚扰、性别歧视、种族歧视等,来源于多个平台。

包含的数据集

  • MLMA dataset
  • CAA dataset
  • FTR dataset
  • "An Annotated Corpus for Sexism Detection in French Tweets" dataset
  • UC-Berkeley-Measuring-Hate-Speech dataset (已翻译自英语)

语言处理

为了增加法语仇恨言论数据集的丰富性,引入了其他语言(目前仅英语)的数据集,并使用机器翻译模型进行翻译。

语言验证

使用papluca/xlm-roberta-base-language-detection模型检测并过滤非法语文本,以确保数据集的纯度。

标注策略

每个样本根据其是否包含仇恨言论被标注为"0"(负样本)或"1"(正样本)。

过滤规则

  • UC-Berkeley Measuring Hate Speech dataset: 如果平均hate_speech_score大于0,则标注为"1"。

许可证

unknown

搜集汇总
数据集介绍
构建方式
在法语仇恨言论检测领域,高质量标注数据的稀缺性一直是制约研究发展的瓶颈。为突破这一困境,研究者整合了多个来源的语料,构建了FrenchHateSpeechSuperset数据集。该数据集汇聚了MLMA、CAA、FTR、Annotated Corpus for Sexism Detection in French Tweets以及UC-Berkeley-Measuring-Hate-Speech(经机器翻译从英语转为法语)五个子数据集。为统一不同数据集间异构的标注体系,所有样本均被重新标注为二分类标签:负面样本标记为“0”,正面样本标记为“1”。针对机器翻译引入的非法语文本,采用xlm-roberta-base-language-detection模型进行语言过滤,确保语料的纯正性。
特点
FrenchHateSpeechSuperset数据集的核心优势在于其广泛的覆盖面和统一的标注标准。它囊括了仇恨言论、骚扰、性别歧视、种族歧视等多类有害信息,样本来源横跨社交媒体、学术语料及翻译数据,极大丰富了法语仇恨言论研究的语料多样性。通过引入机器翻译技术将英语数据集纳入其中,有效弥补了法语相关资源的不足。所有样本经过标签对齐后形成一致的二分类结构,消除了原始数据集间因标注粒度不同带来的歧义,为模型训练提供了清晰、稳定的监督信号。
使用方法
该数据集可直接用于法语仇恨言论检测模型的训练与评估。用户可通过HuggingFace平台加载数据集,将其作为二分类任务的标准输入:利用文本字段作为模型输入,标签字段作为目标输出。推荐使用预训练法语语言模型(如CamemBERT或FlauBERT)进行微调,以充分捕捉法语语境下的语义特征。在评估阶段,可采用准确率、F1分数等常规分类指标衡量模型性能。此外,数据集的多源特性使其适用于跨领域泛化能力测试,研究者可基于不同子集划分训练集与测试集,以检验模型在多样本来源下的鲁棒性。
背景与挑战
背景概述
FrenchHateSpeechSuperset数据集由Poulpidot团队构建,整合了MLMA、CAA、FTR等多个法语仇恨言论检测子集,并引入机器翻译的英文语料以扩充规模。该数据集聚焦于在线仇恨言论、骚扰、性别歧视及种族歧视等多维度有害信息的识别,旨在解决法语领域标注资源稀缺的困境。其核心研究问题在于统一异构标注体系,通过二值化标签(0为无害,1为有害)构建跨平台、跨类型的标准化基准。该数据集引用了Chiril等人(2020)的性别歧视语料、Ousidhoum等人(2019)的多语言仇恨言论研究等经典工作,为法语自然语言处理中的社会安全议题提供了关键数据支撑,推动了对法语数字空间极端言论的量化分析与模型评估。
当前挑战
该数据集面临的挑战首要在于领域问题的复杂性:仇恨言论的语义边界模糊,受文化语境、讽刺手法及隐晦表达影响,单一二值标签难以捕捉多级攻击性强度,且不同子集的原始标注标准(如评分阈值、情感维度)存在显著差异。构建过程中,机器翻译引入的噪声导致部分文本语义失真或未完全转换,需依赖语言检测模型过滤非法语内容,但模型本身可能误判方言或混合语码。此外,跨平台数据(如推特、论坛)的格式异构性增加了预处理难度,而标注者主观偏见进一步影响标签一致性,需设计更精细的过滤规则与标注校准机制以提升数据质量。
常用场景
经典使用场景
FrenchHateSpeechSuperset数据集的核心应用场景在于为法语仇恨言论检测任务提供大规模、多源异构的联合训练语料。该数据集整合了MLMA、CAA、FTR等五个不同来源的子数据集,覆盖仇恨言论、骚扰、性别歧视、种族歧视等多种有害信息类型,并采用统一的二分类标注策略(0为负面样本,1为正面样本),从而显著提升了模型在法语环境下的泛化能力与鲁棒性。研究者可基于此数据集训练多任务学习或跨领域迁移的深度学习模型,以应对法语社交媒体中复杂多变的有害言论表达形式。
实际应用
在实际应用层面,FrenchHateSpeechSuperset可直接赋能法语社交平台的内容审核系统、在线社区管理工具以及舆情监控平台。通过训练基于该数据集的分类模型,平台能够自动识别并标记用户发布中的仇恨言论、性别歧视和种族歧视内容,从而辅助人工审核团队提升工作效率,减少有害信息的传播范围。此外,该数据集还可用于构建法语教育场景中的网络素养辅助工具,帮助用户识别并理解仇恨言论的典型特征,促进更健康的网络交流环境。
衍生相关工作
FrenchHateSpeechSuperset的构建思路与整合策略催生了多项后续研究工作。一方面,该数据集可作为基线语料,支撑法语仇恨言论检测中多标签分类、跨语言迁移学习以及数据增强方法的研究,例如基于机器翻译的英语仇恨言论数据扩充策略(如UC-Berkeley数据集的法语翻译)已被验证有效。另一方面,该数据集的统一标注框架为后续构建更细粒度的法语仇恨言论层级分类体系提供了参考,例如区分攻击目标(个体/群体)与攻击类型(直接/间接)的标注方案,相关研究已在多语言仇恨言论分析领域得到引用与拓展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务