CLANDESTINO
收藏资源简介:
CLANDESTINO是一个西班牙语毒性语言数据集,旨在检测和理解西班牙语中的毒性语言。考虑到西班牙语在多个国家和地区的广泛使用,以及文化和语言的多样性,该数据集特别关注不同地区和文化背景下的语言毒性。数据集包括本地语言标注、多种毒性类别覆盖、正式和非正式语言表达,并包含AI和人工生成的毒性内容。
CLANDESTINO is a Spanish toxic language dataset designed to detect and understand toxic language in Spanish. Given the widespread use of Spanish across multiple countries and regions, as well as the diversity of cultures and languages, this dataset particularly focuses on linguistic toxicity across different regions and cultural contexts. The dataset includes native language annotations, coverage of multiple toxicity categories, formal and informal language expressions, and contains both AI-generated and human-generated toxic content.
CLANDESTINO数据集概述
数据集目的
CLANDESTINO是一个专为西班牙语毒性语言检测设计的语料库。考虑到西班牙语在不同国家和地区的文化差异,该数据集旨在帮助改进毒性检测方法。
数据集特点
- 多国原生语言标注:覆盖七个国家的原生语言标注。
- 多类别毒性内容:包括仇恨言论、微侵犯、正面刻板印象、自残、虚假信息等类别。
- 语言多样性:涵盖非正式和正式语言表达,包括基于文本的拼写。
- 地域特定语言:包含地域标签,反映地域特定语言。
- 内容来源:结合AI生成和人工生成的毒性内容,并明确标注。
数据集警告
本数据集包含和讨论的内容可能具有冒犯性或令人不安,旨在支持研究以改进毒性检测方法。
数据集更新
数据集目前处于积极开发中,首个版本已于5月15日发布。
责任AI考量
数据集在捕捉西班牙语中问题语言方面仍存在局限性,注释可能未能完全捕捉到这些问题的复杂性。数据集的规模可能导致自然噪声,且所有注释都引入了内在偏见。这些局限性应成为未来研究的主题。



