遇见数据集

halepe/jigsaw_toxicity_pred

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

讨论您关心的事情可能很困难。网络上的滥用和骚扰威胁意味着许多人停止表达自己并放弃寻求不同意见。平台难以有效促进对话,导致许多社区限制或完全关闭用户评论。该数据集包含大量维基百科评论,这些评论已由人类评分者标记为毒性行为。数据集用于多标签分类任务,支持识别评论中的多种毒性类别,如有毒、严重有毒、淫秽、威胁、侮辱和身份仇恨。数据分为训练集和测试集,共包含超过223,000个实例,评论为英文。

Discussing things you care about can be difficult. The threat of abuse and harassment online means that many people stop expressing themselves and give up on seeking different opinions. Platforms struggle to effectively facilitate conversations, leading many communities to limit or completely shut down user comments. This dataset consists of a large number of Wikipedia comments which have been labeled by human raters for toxic behavior.

提供机构:
halepe
搜集汇总
数据集介绍
halepe/jigsaw_toxicity_pred 数据集图片
构建方式
Jigsaw Toxicity Prediction数据集源自Kaggle竞赛“Jigsaw Comment Toxicity Classification”,其核心数据为来自维基百科的大量用户评论。这些评论经由众包标注员进行多维度毒性判别,涵盖六类标签:有毒、严重有毒、猥亵、威胁、侮辱及身份仇恨。每一条评论均由多名人工评估者独立标注,最终以二值标签形式呈现,构成一个多标签分类任务的基础。数据集划分为训练集(159,571样本)与测试集(63,978样本),约28万条样本的规模为模型训练提供了丰富语料。
特点
该数据集的显著特色在于其精细的多标签标注体系:每条评论并非仅被简单判定为“有毒”或“无毒”,而是被细分为六种具体的毒性类别,这使模型能够捕捉网络暴力中微妙的语义差异。此外,数据来源于真实的维基百科讨论语境,兼具生态效度与挑战性。然而,数据集存在固有局限——过多依赖显性冒犯词汇进行标注,可能忽视幽默或自嘲语境下的非恶意表达,从而对少数群体产生潜在偏见。
使用方法
该数据集适用于多标签文本分类任务。使用时,可将`comment_text`作为输入特征,六个毒性标签作为多热编码的目标变量。模型评估推荐采用宏平均F1、微平均F1及加权平均F1等综合指标,以全面衡量分类性能。默认的基准配置将`toxic`标签视为二分类任务,但更为完整的应用应同时兼顾所有六类标签。用户可通过HuggingFace Datasets库便捷加载,并利用预设的`train`与`test`划分进行模型训练与验证。
背景与挑战
背景概述
在数字时代,网络平台上的言论自由与社区和谐之间的平衡日益成为社会关注的焦点。网络暴力和仇恨言论的泛滥不仅抑制了用户参与讨论的意愿,更对个体的心理健康与群体间的信任造成了深远影响。为应对这一挑战,Jigsaw Toxicity Prediction数据集应运而生。该数据集由Jigsaw团队与Google的Conversational AI部门于2018年联合创建,核心研究问题聚焦于通过多标签分类技术自动检测和识别在线评论中的毒性内容。数据集源自维基百科的公开评论,经由众包标注,包含159571条训练样本和63978条测试样本,每条评论被标记为是否含有毒性、严重毒性、淫秽、威胁、侮辱或身份仇恨等六类标签。作为Jigsaw Toxic Comment Classification Challenge竞赛的核心数据资源,它不仅推动了自然语言处理领域对于多标签分类与毒性检测研究的发展,也为学术界和工业界提供了标准化评估基准,对构建更安全、文明的网络沟通环境具有重要影响。
当前挑战
当前,该数据集所解决的领域问题面临多重挑战。首先,毒性言论的识别本质上是一项复杂的多标签分类任务,同一段文本可能同时体现侮辱与身份仇恨等多种毒性维度,且不同标签之间的边界模糊,增加了模型判别的难度。其次,上下文语境与讽刺、幽默等修辞手法的存在,使得仅依赖关键词的模型容易产生误判,例如将自我调侃或历史引用中的敏感词汇误标为毒性。在数据集构建过程中,挑战同样严峻。标注者主观性对毒性界定的差异显著,不同文化背景、教育水平的人对同一评论的毒性感知可能截然不同,导致标签一致性问题。此外,原始评论数据来源于维基百科,其中隐含了基于种族、性别等特征的偏见,如某些少数群体的言论更易被标注为毒性,这可能使得训练出的模型不自觉放大社会刻板印象,影响公平性与普适性。
常用场景
经典使用场景
在自然语言处理领域,jigsaw_toxicity_pred数据集堪称多标签毒性评论分类任务的经典基准。该数据集汇集了来自维基百科的海量评论,每一条评论均经人工标注,涵盖毒害、严重毒害、猥亵、威胁、侮辱及身份仇恨等六个维度的标签。其经典使用场景在于训练和评估能够同时识别多种毒性类别的文本分类模型,例如基于BERT或RoBERTa的深度学习架构,从而实现对网络言论的精细化解构与判断。
解决学术问题
该数据集系统性地解决了网络言论治理中的核心学术难题,即如何构建一个稳健、细粒度的毒性检测框架。它推动了多标签文本分类技术的进步,促使研究者探索标签相关性建模、类别不平衡处理以及跨领域泛化能力等关键问题。这一数据集的问世,为量化网络环境中的言语攻击行为提供了标准化的实验平台,深刻影响了在线内容审核的理论与方法论发展。
衍生相关工作
基于jigsaw_toxicity_pred数据集,学术界涌现出大量衍生工作。其中经典的包括利用对抗训练增强模型对规避审查文本的鲁棒性研究,以及探索基于图神经网络的标签依赖建模方法。此外,该数据集催生了诸如“Jigsaw Unintended Bias in Toxicity Classification”等挑战赛,推动研究者关注模型在性别、种族等维度上的公平性问题,并衍生出解释性AI方法用于揭示毒性分类决策的潜在偏见,极大地拓展了负责任AI的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务