官方服务:
资源简介:
The dataset appears to be a collection of text
该数据集似乎为一组文本的汇编。
应用场景:
创建时间:
2024-06-28
相关数据集
nemotron-nano2-safety-distill-gptoss
Nemotron Nano 2 安全精简数据集,使用Nemotron Nano 2配方和GPT-OSS-20B及GPT-OSS-120B作为教师模型创建。由于资源限制,生成的推理步骤和响应没有经过守门模型的过滤。该数据集包含大约35,000个示例,可能会在未来版本中增加。数据来源于Nemotron内容安全数据集V2、gretel-v1、HarmfulTasks和RedTeam2K。
Hugging Face2025-10-22 更新250
hate-speech-filipino/hate_speech_filipino
--- annotations_creators: - machine-generated language_creators: - crowdsourced language: - tl license: - unknown multilinguality: - monolingual size_categories: - 10K<n<100K source_datasets: - extend
Hugging Face2024-01-18 更新160
prem-research/MiniGuard-Safety-Dataset
这是一个用于训练MiniGuard-v0.1(一个紧凑的内容安全分类器)的数据集。数据集包含三个子集:标准子集(40,000个样本,来自nvidia/Nemotron-Safety-Guard-Dataset-v3的英文部分)、思维增强子集(34,658个样本,来自openai/gpt-oss-safeguard-120b的推理痕迹)和MiniGuard定向子集(1,199个样本,使用Hermes
Hugging Face2025-12-12 更新80
APEACH
APEACH数据集是由Kakao Corp.等机构合作创建的,专注于韩国仇恨言论检测。该数据集包含约3770条实例,涵盖了多样化的主题和句子长度,旨在通过用户生成的内容减少与预训练语料库的词汇重叠,从而更准确地评估模型性能。创建过程中,采用了匿名付费工作者生成有毒表达的方式,并通过任务管理器进行后标记,确保数据质量。APEACH数据集的应用领域主要集中在评估预训练语言模型在仇恨言论检测中的性能,特
arXiv2022-10-26 更新200
Banglish (Bengali in English letter) Hate Speech Dataset
This dataset contains Banglish comments for hate speech detection. It has 5000 comments in total. 2836 of these are hate speech, and 2164 are non-hate speech. Among the different types of hate speech
Mendeley Data2024-03-27 更新120



