遇见数据集

1-800-SHARED-TASKS/civil_comments_Safety

收藏
Hugging Face2024-09-26 更新2024-12-14 收录
官方服务:

资源简介:

该数据集名为Civil Comments,主要包含来自Civil Comments平台的评论数据,这些评论是从2015年到2017年间在全球约50个英语新闻网站上发布的。数据集由Jigsaw扩展,增加了毒性和身份提及的标签。数据集的结构包括文本、毒性、严重毒性、淫秽、威胁、侮辱、身份攻击和性明确等字段。数据集分为训练集、验证集和测试集,分别包含1804874、97320和97320个样本。数据集的总下载大小为414.95 MB,生成的数据集大小为661.23 MB,总共占用1.08 GB的磁盘空间。

The dataset is named Civil Comments and primarily contains comment data from the Civil Comments platform, which were posted on approximately 50 English-language news sites worldwide between 2015 and 2017. The dataset was extended by Jigsaw to include additional labels for toxicity and identity mentions. The dataset structure includes fields such as text, toxicity, severe toxicity, obscene, threat, insult, identity attack, and sexual explicit. The dataset is divided into training, validation, and test sets, containing 1,804,874, 97,320, and 97,320 samples respectively. The total download size of the dataset is 414.95 MB, the generated dataset size is 661.23 MB, and it occupies a total of 1.08 GB of disk space.

提供机构:
1-800-SHARED-TASKS
搜集汇总
数据集介绍
构建方式
在自然语言处理领域,毒性评论检测是维护在线社区文明交流的重要任务。Civil Comments 数据集源自 Civil Comments 平台,该平台为全球约50家英文新闻网站提供评论插件,收录了2015年至2017年间产生的公开评论。Jigsaw 团队在原始数据基础上,通过人工标注为每条评论添加了毒性分数及多种子类别标签,包括严重毒性、淫秽、威胁、侮辱、身份攻击和性露骨内容,从而构建起一个面向多标签毒性分类的基准数据集。数据集划分为训练集、验证集和测试集,分别包含约180万、9.7万和9.7万条样本。
特点
该数据集的核心特点在于其多维度的毒性评估体系。每条评论均配备八项浮点型标签,其中 toxicity 为综合毒性分数,其余七项细粒度标签分别刻画不同类型的攻击性语言,为模型学习毒性表达的微妙差异提供了丰富监督信号。数据集来源于真实新闻评论场景,覆盖广泛的话题与语境,有助于增强模型在现实应用中的泛化能力。此外,数据集采用 CC0 许可协议发布,消除了使用上的法律障碍,促进了学术研究与工业应用的开放性发展。
使用方法
研究者可借助 Hugging Face Datasets 库便捷加载该数据集,通过指定配置名称 'default' 即可获取预划分好的训练、验证与测试子集。数据以文本字段和对应的浮点标签形式呈现,适用于构建多标签文本分类模型。常见的实践包括将 toxicity 分数二值化后训练二分类器,或利用全部七项子标签训练联合预测模型。评估时可采用 Jigsaw 竞赛中提出的偏倚感知指标,衡量模型在不同身份群体上的公平性表现。
背景与挑战
背景概述
在自然语言处理领域,随着社交媒体和在线评论平台的蓬勃发展,网络言论中的毒性内容识别与管控成为一项紧迫的研究课题。Civil Comments 数据集正是在这一背景下应运而生,由 Jigsaw 团队联合学术界于 2019 年创建,其核心研究问题聚焦于如何利用真实世界的评论数据构建公平且无偏见的毒性分类模型。该数据集源自 2015 至 2017 年间约 50 家英文新闻网站的公开评论,原始数据由 Civil Comments 平台归档并开放,Jigsaw 团队在此基础上扩展了毒性及身份攻击等多维标签。数据集包含近 200 万条训练样本,为毒性检测任务提供了大规模、多标签的标注资源,其发布的“无意图偏见”挑战赛推动了模型在公平性评估上的重要进展,成为该领域影响力深远的基准数据集。
当前挑战
Civil Comments 数据集所面对的领域挑战在于毒性分类任务中固有的偏见问题,即模型可能对特定群体(如种族、性别或宗教相关身份)的表述产生不公正的误判,从而导致算法歧视。这要求研究者不仅关注分类准确率,更需设计度量标准来量化并缓解模型在交叉身份维度上的系统性偏差。在构建过程中,数据集面临的挑战包括:原始评论来源于多样化的新闻语境,其语言风格、文化背景差异巨大,使得标注一致性难以保证;同时,毒性标签由人工标注获得,标注者主观判断的差异可能引入噪声,影响数据质量。此外,数据集中少数群体相关的评论样本相对稀缺,导致模型在身份攻击等细粒度类别上的学习存在不平衡,进一步加剧了公平性挑战。
常用场景
经典使用场景
在自然语言处理与计算社会科学的交叉领域中,Civil Comments数据集被广泛用作毒性评论分类的标准基准。其核心任务是通过多标签分类框架,对网络评论中的毒性、严重毒性、猥亵、威胁、侮辱、身份攻击及性暗示等七种有害维度进行细粒度识别。该数据集源自2015至2017年间全球约50家英文新闻网站的公开评论存档,经Jigsaw团队标注后,成为衡量模型在真实、嘈杂网络语境下检测恶意内容能力的经典评测集。
解决学术问题
该数据集着力解决了毒性检测模型中的隐性偏差问题,即模型可能因评论中提及特定身份群体(如种族、性别)而误判为有害内容。通过提供细粒度的身份攻击标签与多维度毒性评分,研究者得以量化并缓解算法在敏感属性上的系统性偏差。其提出的‘非预期偏差度量’(Nuanced Metrics)框架,为公平性评估提供了可复现的学术范式,显著推动了鲁棒且无偏的在线内容审核模型的发展。
衍生相关工作
该数据集催生了多项里程碑式研究,包括Borkan等人提出的非预期偏差度量方法,以及基于对抗训练与因果推断的偏差缓解技术。后续工作如‘Toxicity Detection with BERT’系列探索了预训练语言模型在毒性分类上的迁移学习潜力;‘Jigsaw Rate Severity of Toxic Comments’挑战则扩展了其标注维度。此外,该数据集还启发了跨语言毒性检测研究,如‘Multilingual Toxic Comment Classification’项目,推动了全球性网络文明治理工具的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务