数据链接:
官方服务:
资源简介:
The violence lexicon, offered as a csv file.
应用场景:
创建时间:
2024-12-09
相关数据集
JAugusto97/told-br
ToLD-Br是巴西葡萄牙语中最大的有毒推文数据集,由42名注释者通过众包方式标注。注释者来自不同的人口统计背景,以减少偏见。数据集包含多标签和二进制两种版本。多标签版本包含六个类别(恐同、淫秽、侮辱、种族主义、厌女症和仇外心理),每个类别有0到3的投票数。二进制版本则将文本分类为有毒或无毒。数据集包含21,000个多标签示例和16,800个二进制训练示例。
Hugging Face2024-01-18 更新210
hate-speech-filipino/hate_speech_filipino
--- annotations_creators: - machine-generated language_creators: - crowdsourced language: - tl license: - unknown multilinguality: - monolingual size_categories: - 10K<n<100K source_datasets: - extend
Hugging Face2024-01-18 更新160
mestras-valcir/hatebr_gemma-3-1b-it_5shot_3exp
--- dataset_info: features: - name: idx dtype: int32 - name: sentence dtype: string - name: label dtype: class_label: names: '0': non-offensive '1
Hugging Face2025-04-11 更新100
APEACH
APEACH数据集是由Kakao Corp.等机构合作创建的,专注于韩国仇恨言论检测。该数据集包含约3770条实例,涵盖了多样化的主题和句子长度,旨在通过用户生成的内容减少与预训练语料库的词汇重叠,从而更准确地评估模型性能。创建过程中,采用了匿名付费工作者生成有毒表达的方式,并通过任务管理器进行后标记,确保数据质量。APEACH数据集的应用领域主要集中在评估预训练语言模型在仇恨言论检测中的性能,特
arXiv2022-10-26 更新200
Banglish (Bengali in English letter) Hate Speech Dataset
This dataset contains Banglish comments for hate speech detection. It has 5000 comments in total. 2836 of these are hate speech, and 2164 are non-hate speech. Among the different types of hate speech
Mendeley Data2024-03-27 更新120



