官方服务:
资源简介:
(XLSX)
应用场景:
创建时间:
2021-07-23
相关数据集
mapsoriano/2016_2022_hate_speech_filipino
该数据集包含27,383条推文,标记为仇恨言论(1)或非仇恨言论(0),并按照80-10-10的比例分为训练集、验证集和测试集。数据集结合了[hate_speech_filipino]和2022年菲律宾总统选举相关推文的新数据集。数据集中仇恨和非仇恨推文的数量几乎平衡。数据集主要由菲律宾语文本组成,辅以一些在2016和2022年菲律宾国家/总统选举期间常用的英语单词。
Hugging Face2024-07-13 更新320
TweetBLM
TweetBLM是一个专注于黑人人权运动相关推特的仇恨言论数据集,由印度比拉科技学院梅斯拉分校创建。该数据集包含9165条经过人工标注的推文,分为‘仇恨’和‘非仇恨’两类,旨在识别和分析针对黑人人权运动的仇恨言论。数据收集自2020年5月27日至7月26日,通过Twitter API爬取,使用特定关键词筛选相关推文。该数据集的应用领域主要集中在社交媒体上的仇恨言论识别和过滤,以促进网络环境的积极发
arXiv2021-08-28 更新110
IndoToxic2024
IndoToxic2024是一个印尼语数据集,主要用于检测与2024年印尼总统选举相关的社交媒体上的仇恨言论、毒性内容和极化内容。数据规模在1万到10万条之间,由29位背景各异的标注者进行标注,其中超过44%的条目由多位标注者共同完成。该数据集支持文本分类任务,并提供了标注者的人口统计信息。数据集基于Apache-2.0协议授权。
Opencsg2024-07-19 更新70
APEACH
APEACH数据集是由Kakao Corp.等机构合作创建的,专注于韩国仇恨言论检测。该数据集包含约3770条实例,涵盖了多样化的主题和句子长度,旨在通过用户生成的内容减少与预训练语料库的词汇重叠,从而更准确地评估模型性能。创建过程中,采用了匿名付费工作者生成有毒表达的方式,并通过任务管理器进行后标记,确保数据质量。APEACH数据集的应用领域主要集中在评估预训练语言模型在仇恨言论检测中的性能,特
arXiv2022-10-26 更新200
Sunnah and Shia (SSTD) Hate Speech Dataset
Description of Sunnah and Shia Hate Speech Dataset (SSTD): Consists of one XLS file, which contains (3235) labeled tweets The file contains three features: 1. Tweet id: Unique ID given for each tw
Mendeley Data70



