Cyberbullying-Detection-CB1
收藏资源简介:
CB1 是一个用于社交媒体上自动检测网络欺凌的多类别文本分类数据集。每个实例都是一条来自 Twitter/X 的社交媒体帖子,并标注了网络欺凌类别。数据集包含两个字段:`text`(原始社交媒体帖子文本)和 `label`(网络欺凌类别)。标签类别包括:`not_cyberbullying`(不包含网络欺凌内容)、`ethnicity/race`(针对种族或民族的网络欺凌)、`religion`(针对宗教或宗教身份的网络欺凌)、`gender/sexual`(针对性别或性取向的网络欺凌)、`age`(针对年龄的网络欺凌)和 `other_cyberbullying`(不符合上述类别的网络欺凌)。数据集按 75% 训练集、2000 行验证集(从 25% 的保留部分中抽样)和剩余部分作为测试集进行划分。原始数据来源于 Kaggle 的 '[Cyberbullying Detection](https://www.kaggle.com/datasets/andrewmvd/cyberbullying-classification)' 数据集。
Cyberbullying Detection — CB1 数据集概述
数据集简介
CB1 是一个用于社交媒体上自动网络欺凌检测的多类别文本分类数据集。每个实例是一条单独的社交媒体帖子(来源于 Twitter/X),并标注了网络欺凌类别。该数据集是 Hugging Face 上 Cyberbullying-Detection 集合的一部分。
数据集结构
数据字段
| 字段 | 类型 | 描述 |
|---|---|---|
text |
string |
原始的社交媒体帖子文本 |
label |
string |
网络欺凌类别 |
标签类别
| 标签 | 描述 |
|---|---|
not_cyberbullying |
帖子不包含网络欺凌内容 |
ethnicity/race |
针对民族或种族的网络欺凌 |
religion |
针对宗教或宗教身份的网络欺凌 |
gender/sexual |
针对性别或性取向的网络欺凌 |
age |
针对年龄的网络欺凌 |
other_cyberbullying |
不属于以上类别的网络欺凌 |
数据集划分
数据集划分如下:
| 划分 | 大小 | 描述 |
|---|---|---|
train |
占总量的 75% | 训练集 |
validation |
2,000 行 | 开发/验证集(从预留的 25% 部分中采样) |
test |
剩余的约 25% 减去 2,000 行 | 测试集 |
划分方法
python from sklearn.model_selection import train_test_split
步骤 1: 75% 训练,25% 测试+验证
train_df, test_dev_df = train_test_split(df, test_size=0.25, random_state=42)
步骤 2: 2000 行用于验证,其余用于测试
dev_df = test_dev_df.sample(n=2000, random_state=42) test_df = test_dev_df.drop(dev_df.index)
使用方式
python from datasets import load_dataset
dataset = load_dataset("Washii/Cyberbullying-Detection-CB1")
访问划分
train = dataset["train"] validation = dataset["validation"] test = dataset["test"]
示例
print(train[0])
{text: ..., label: ethnicity/race}
数据来源
原始数据来源于 Kaggle 上的 "Cyberbullying Detection" 数据集,包含针对多个类别标注了网络欺凌的推文。完整的原始文件是 CB1.csv。
引用
如果您使用此数据集,请适当引用原始来源。
数据集卡片作者
由 Washii 上传和整理。



