遇见数据集

textdetox/multilingual_toxic_lexicon

收藏
Hugging Face2025-03-21 更新2024-03-04 收录
官方服务:

资源简介:

多语言毒词词汇表,包含英语、俄语、乌克兰语、西班牙语、德语、阿姆哈拉语、阿拉伯语、中文、印地语、意大利语、法语、希伯来语、印地英语、日语和塔塔尔语等语言的毒词列表。该数据集用于文本解毒任务,并从多个来源整合了毒词。

A multilingual toxic lexicon containing lists of toxic words in languages such as English, Russian, Ukrainian, Spanish, German, Amharic, Arabic, Chinese, Hindi, Italian, French, Hebrew, Hinglish, Japanese, and Tatar. The dataset is used for text detoxification tasks and integrates toxic words from various sources.

提供机构:
textdetox
原始信息汇总

数据集概述

语言支持

  • 英语 (en)
  • 俄语 (ru)
  • 乌克兰语 (uk)
  • 西班牙语 (es)
  • 德语 (de)
  • 阿拉伯语 (ar)
  • 阿姆哈拉语 (am)
  • 印地语 (hi)
  • 中文 (zh)

许可证

  • openrail++

数据集信息

  • 特征

    • 名称: text
    • 数据类型: string
  • 分割

    • 阿姆哈拉语 (am)
      • 字节数: 3540
      • 样本数: 245
    • 西班牙语 (es)
      • 字节数: 14683
      • 样本数: 1195
    • 俄语 (ru)
      • 字节数: 4174135
      • 样本数: 140517
    • 乌克兰语 (uk)
      • 字节数: 153865
      • 样本数: 7356
    • 英语 (en)
      • 字节数: 39323
      • 样本数: 3386
    • 中文 (zh)
      • 字节数: 45303
      • 样本数: 3839
    • 阿拉伯语 (ar)
      • 字节数: 6050
      • 样本数: 430
    • 印地语 (hi)
      • 字节数: 2771
      • 样本数: 133
    • 德语 (de)
      • 字节数: 3036
      • 样本数: 247
  • 下载大小

    • 2071857 字节
  • 数据集大小

    • 4442706 字节

配置

  • 默认配置
    • 数据文件路径
      • 阿姆哈拉语 (am): data/am-*
      • 西班牙语 (es): data/es-*
      • 俄语 (ru): data/ru-*
      • 乌克兰语 (uk): data/uk-*
      • 英语 (en): data/en-*
      • 中文 (zh): data/zh-*
      • 阿拉伯语 (ar): data/ar-*
      • 印地语 (hi): data/hi-*
      • 德语 (de): data/de-*
搜集汇总
数据集介绍
构建方式
在自然语言处理领域,毒性词汇的识别与过滤是保障在线交流环境安全的关键任务。该数据集通过整合多个公开的毒性词表构建而成,覆盖英语、俄语、乌克兰语、西班牙语、德语、阿姆哈拉语、阿拉伯语、印地语、中文、意大利语、法语、希伯来语、印地英语、日语和鞑靼语共15种语言。构建过程中,研究者从GitHub上的专业词库、Facebook Research的Toxicity-200语料库以及维基词典等权威来源提取词汇,并针对阿姆哈拉语和阿拉伯语进行了自主编纂,同时将俄语关键词翻译后融入鞑靼语词表,确保各语言词条的全面性与均衡性。
特点
该数据集以单列文本格式存储,仅包含'text'字段,结构简洁高效,便于直接用于毒性词汇的标注与分类任务。其显著特点在于多语言覆盖的广度与深度,涵盖从高资源语言如英语、俄语到低资源语言如阿姆哈拉语、鞑靼语的丰富语种,其中俄语子集规模最大,包含超过14万条样本,而印地语、阿姆哈拉语等子集则相对精简。数据集按语言划分为15个独立子集,每个子集的大小从数百到数万不等,整体规模介于10K至100K之间,为跨语言毒性检测研究提供了标准化基准。
使用方法
该数据集适用于令牌分类任务,用户可通过Hugging Face的datasets库便捷加载。使用时,首先指定配置名'default',然后按语言代码选择对应子集,例如加载英语子集可通过split参数设为'en'。数据加载后,每个样本均为包含毒性词汇的文本字符串,可直接用于训练或评估毒性词识别模型。此外,数据集遵循openrail++许可证,允许广泛的研究与应用,引用时应参考PAN 2024和ECIR 2024的相关论文以标注原始工作。
背景与挑战
背景概述
随着互联网社交平台的全球化扩张,多语言环境下的有害内容检测成为自然语言处理领域亟待解决的核心议题。为此,由PAN CLEF评估论坛发起、多国研究机构联合构建的Multilingual Toxic Lexicon数据集应运而生,其最新版本于2025年发布,涵盖英语、俄语、中文、阿拉伯语等15种语言,共计约17万条毒性词汇条目。该数据集的核心研究问题在于系统性地收录并标准化跨语言场景下的辱骂性、攻击性及不当用语,为多语言文本去毒化任务提供基准资源。通过整合Facebook Research的Toxicity-200语料库及多个开源词库,该数据集在文本去毒化、仇恨言论检测及多语言内容审核领域产生了广泛影响,成为评估模型跨语言泛化能力的重要基石。
当前挑战
该数据集所应对的领域挑战主要源于多语言毒性词汇的复杂性与文化特异性。一方面,各语言中侮辱性表达的语义强度、语法变形及隐含攻击性存在显著差异,例如俄语通过词形变化生成大量派生词,而阿拉伯语则依赖方言变体与宗教语境,这要求数据集必须具备对语言形态学与文化背景的深度覆盖能力。另一方面,构建过程中面临数据稀疏性与标注一致性难题:部分低资源语种如阿姆哈拉语、鞑靼语的毒性词汇来源有限,需依赖机器翻译与专家人工校验的混合策略;同时,从不同来源整合词表时,需解决术语定义冲突(如中性词在特定语境下的毒性转化)及跨语言对齐问题,这对数据质量保障提出了严苛要求。
常用场景
经典使用场景
Multilingual Toxic Lexicon 数据集汇聚了涵盖英语、俄语、乌克兰语、西班牙语、德语、阿拉伯语、阿姆哈拉语、印地语、中文、意大利语、法语、希伯来语、日语、鞑靼语及印地英语共15种语言的毒性词汇列表,是跨语言文本去毒化研究的基石。该数据集最经典的使用场景在于为多语言毒性内容检测提供标准化的标注资源,研究者可基于其构建高精度的毒性词识别模型,或将其作为特征工程的核心组成部分,用于训练分类器以判别文本是否包含攻击性、侮辱性或仇恨性表达。其分层结构支持针对特定语言或跨语言场景的灵活调用,尤其适合在PAN@CLEF系列评测任务中作为基准数据集,推动多语言环境下网络言论治理技术的公平性与鲁棒性评估。
解决学术问题
该数据集系统性地回应了自然语言处理领域中多语言毒性检测面临的标注稀缺与跨语言泛化难题。通过整合来自Facebook Research Toxicity-200、开源脏话词库及学术论文等多源异构数据,它解决了单一语言模型难以覆盖文化特异性辱骂表达的问题,为对比语言学视角下的攻击性语言研究提供了量化分析工具。其学术意义在于揭示了不同语言社群中毒性词汇的分布规律与语义漂移现象,并支撑了诸如文本风格迁移、对抗性去毒化等前沿课题的实证研究。该数据集的应用直接催生了PAN 2024与2025年多语言文本去毒化共享任务,显著提升了跨语言毒性过滤系统的基准性能。
衍生相关工作
基于该数据集,学术界衍生了一系列标志性工作。Dementieva等人(2024)在PAN 2024共享任务中提出了多语言文本去毒化的系统评测框架,并发布了首个包含9种语言的毒性词词典。后续研究进一步将其扩展至15种语言,并联合Toxicity-200语料库构建了统一的多语言毒性词嵌入表示。在模型层面,研究者基于该数据集训练了多语言BERT变体(如XLM-RoBERTa)的毒性分类器,并探索了利用对比学习增强跨语言迁移效果的方法。此外,该数据集还支撑了Hinglish脏话列表的构建与印地英语混合语言的攻击性文本分类研究,推动了低资源语言毒性检测的进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务