MixDetox
收藏资源简介:
该数据集是一个多语言有毒评论检测数据集,包含阿姆哈拉语(Amharic)、西班牙语(Spanish)和鞑靼语(Tatar)三种语言的有毒评论与中性评论配对样本。每个样本包含有毒评论(toxic_comment或toxic_sentence)、中性评论(neutral_comment或neutral_sentence)、语言标签(language)、分割类型(split)以及完整分割标签(full_split)。数据集提供多种数据分割版本,包括开发集合成数据(dev_syn)、开发集翻译数据(dev_trans)、所有数据混合(mix_of_all)、均衡混合(mix_of_all_eq)以及合成与翻译混合(syn_trans)。各语言配置的样本数量不同,例如阿姆哈拉语共有约4991个样本(mix_of_all),西班牙语约4800个样本(mix_of_all),鞑靼语约7011个样本(mix_of_all)。该数据集可用于多语言有毒评论分类、跨语言迁移学习以及毒性检测模型的训练与评估。
This dataset is a multilingual toxic comment detection dataset, containing paired samples of toxic and neutral comments in three languages: Amharic, Spanish, and Tatar. Each sample includes a toxic comment (toxic_comment or toxic_sentence), a neutral comment (neutral_comment or neutral_sentence), a language label (language), a split type (split), and a full split label (full_split). The dataset provides multiple data split versions, including dev_syn, dev_trans, mix_of_all, mix_of_all_eq, and syn_trans. The number of samples varies by language configuration, for example, Amharic has about 4991 samples (mix_of_all), Spanish about 4800 samples (mix_of_all), and Tatar about 7011 samples (mix_of_all). This dataset can be used for multilingual toxic comment classification, cross-lingual transfer learning, and training and evaluation of toxicity detection models.
数据集概述:MixDetox
MixDetox 是一个用于多语言毒害评论去毒化的数据集,包含三种语言的配置:阿姆哈拉语(Amharic)、西班牙语(Spanish)和鞑靼语(Tatar)。每个配置提供有毒评论与对应的中性评论配对,用于训练和评估文本中性化模型。
数据内容与特征
- 语言覆盖:阿姆哈拉语、西班牙语、鞑靼语。
- 字段:
- 阿姆哈拉语与鞑靼语:
toxic_comment(有毒评论)、neutral_comment(中性评论)、language、split、full_split。 - 西班牙语:
toxic_sentence、neutral_sentence(评论文本字段命名不同),同样包含language、split、full_split。
- 阿姆哈拉语与鞑靼语:
- 数据用途:文本去毒化任务,即将有毒表述转换为中性表述。
数据划分
数据集提供了多种划分,涵盖合成数据和翻译数据的混合:
- Amharic(阿姆哈拉语):
dev_syn(合成验证集):1008条dev_trans(翻译验证集):4383条mix_of_all(全混合):4991条mix_of_all_eq(均衡混合):1200条syn_trans(合成+翻译):4591条- 总大小:4.61 MB
- Spanish(西班牙语):
dev_syn(合成验证集):4400条mix_of_all(全混合):4800条- 总大小:2.18 MB
- Tatar(鞑靼语):
dev_syn(合成验证集):2808条dev_trans(翻译验证集):4803条mix_of_all(全混合):7011条mix_of_all_eq(均衡混合):1800条syn_trans(合成+翻译):6411条- 总大小:6.30 MB
数据规模与存储
- 数据集总下载大小:约1.83 MB(阿姆哈拉语)、1.24 MB(西班牙语)、2.65 MB(鞑靼语)。
- 数据集总大小(解压后):4.61 MB(阿姆哈拉语)、2.18 MB(西班牙语)、6.30 MB(鞑靼语)。
数据文件结构
每个语言配置对应独立的文件夹,其中数据文件按划分类型存放,使用通配符(如dev_syn-*)匹配实际文件。文件格式为HuggingFace标准数据集格式(如parquet)。
适用场景
- 多语言文本去毒化模型的训练与评估。
- 研究有毒评论的自动改写与中性化处理。




