登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
WhiteAngelss/turkish-offensive-dataset
WhiteAngelss/turkish-offensive-dataset
收藏
Hugging Face
2024-07-25 更新
2025-04-26 收录
冒犯性语言检测
土耳其语自然语言处理
数据链接:
https://hf-mirror.com/datasets/WhiteAngelss/turkish-offensive-dataset
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: apache-2.0 ---
应用场景:
提供机构:
WhiteAngelss
相关数据集
Offensive comments of SE platforms
冒犯性语言检测
软件工程
This dataset contains the offensive language identified from four SE platforms (GitHub, Gitter, Slack and Stack Overflow)
DataCite Commons
2022-04-04 更新
12
0
dataset-unigram.xlsx
冒犯性语言检测
自然语言处理
Offensive lanaguage detection- Unigram feature file
DataCite Commons
2025-05-01 更新
11
0
setswana-offensive-977
冒犯性语言检测
自然语言处理
Setswana冒犯性语言数据集(977)是一个用于二分类冒犯性语言检测任务的数据集,包含977个茨瓦纳语(使用于博茨瓦纳、南非和纳米比亚)的实例,其中477个为冒犯性语言,500个为非冒犯性语言。数据集采用80/20的保留协议进行分割,并在80%的训练数据上进行5折交叉验证。标注标签为0(非冒犯性)和1(冒犯性),标注者间一致性κ值为0.86,显示高度一致。数据集文件包括train.csv、te
Hugging Face
2025-12-04 更新
9
0
upb-nlp/ro-offense-fb
冒犯性语言检测
社交媒体分析
RO-FB-Offense语料库是一个包含来自Facebook直播的4455条用户生成评论的冒犯性言语数据集,评论为罗马尼亚语。数据集的注释遵循了Germeval 2018数据集提出的分层标签集。可用的类别包括:非冒犯性语言(OTHER)、冒犯性语言(OFFENSIVE),后者进一步细分为亵渎(PROFANITY)、侮辱(INSULT)和虐待(ABUSE)。
Hugging Face
2025-07-28 更新
12
0
AustroTox
冒犯性语言检测
语言模型
AustroTox是由维也纳技术大学创建的一个专注于奥地利德语方言的冒犯性语言检测数据集,包含4,562条来自新闻论坛的用户评论。该数据集不仅进行二元冒犯性分类,还识别了构成粗俗语言或冒犯性陈述目标的评论片段。创建过程中,数据集从DerStandard报纸的讨论论坛中抽取评论,并通过专业和学术背景的标注者进行标注。AustroTox的应用领域主要集中在提高语言模型在特定文化和语言背景下的冒犯性检测
arXiv
2024-06-12 更新
10
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广