登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
illegal_web
illegal_web
收藏
kaggle
2026-05-12 更新
2026-06-17 收录
网络内容审核
多模态分类
数据链接:
https://www.kaggle.com/datasets/sahalmaghfud/illegal-web
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Dataset Multimodal untuk Klasifikasi Konten Situs Web Ilegal
用于非法网站内容分类的多模态(Multimodal)数据集
应用场景:
创建时间:
2026-05-12
相关数据集
Finnish-NLP/CulturaX_fi_cleaned
网络内容审核
自然语言处理
--- dataset_info: features: - name: text dtype: string - name: timestamp dtype: string - name: url dtype: string - name: source dtype: string - name: label_identity_attack
Hugging Face
2023-12-23 更新
46
0
MUG: a Multimodal Classification Benchmark on Game Data with Tabular, Textual, and Visual Fields
多模态分类
游戏数据
The data used in this benchmark is collected from the Internet, and can only be used for research purposes. License: CC BY-NC 4.0
DataCite Commons
2023-01-31 更新
15
0
wentingzhao/test-info-cleaned
网络内容审核
用户行为分析
--- dataset_info: features: - name: content dtype: string - name: country dtype: string - name: hashed_ip dtype: string - name: header struct: - name: accept-language
Hugging Face
2024-05-22 更新
15
0
Uddessho
多模态分类
低资源自然语言处理
Uddessho数据集由艾哈迈德·沙希德·苏赫拉瓦尔迪大学创建,专门用于低资源孟加拉语中的多模态作者意图分类。该数据集包含3048条从社交媒体平台(如Facebook、X和Instagram)收集的帖子,涵盖六个类别:信息性、倡导性、推广性、展示性、表达性和争议性。数据集的创建过程包括手动收集和标注,确保了数据的质量和一致性。该数据集主要用于解决在低资源语言环境中,通过结合文本和图像信息来准确分类
arXiv
2024-09-15 更新
16
0
Arsive/toxicity_classification_jigsaw
文本分类
网络内容审核
该数据集包含大量来自Wikipedia的评论,这些评论被人工标注为有毒行为。毒性类型包括:有毒、严重有毒、淫秽、威胁、侮辱和身份仇恨。训练数据集是从原始数据集中采样得到的,确保干净和有毒类别的样本数量相等。数据集创建过程包括从原始数据集中读取数据,筛选出有毒和干净的评论,并进行采样和合并。最后,数据集被分为训练集和验证集。
Hugging Face
2023-10-03 更新
15
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广