遇见数据集

MixDetox

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

该数据集是一个多语言有毒评论检测数据集,包含阿姆哈拉语(Amharic)、西班牙语(Spanish)和鞑靼语(Tatar)三种语言的有毒评论与中性评论配对样本。每个样本包含有毒评论(toxic_comment或toxic_sentence)、中性评论(neutral_comment或neutral_sentence)、语言标签(language)、分割类型(split)以及完整分割标签(full_split)。数据集提供多种数据分割版本,包括开发集合成数据(dev_syn)、开发集翻译数据(dev_trans)、所有数据混合(mix_of_all)、均衡混合(mix_of_all_eq)以及合成与翻译混合(syn_trans)。各语言配置的样本数量不同,例如阿姆哈拉语共有约4991个样本(mix_of_all),西班牙语约4800个样本(mix_of_all),鞑靼语约7011个样本(mix_of_all)。该数据集可用于多语言有毒评论分类、跨语言迁移学习以及毒性检测模型的训练与评估。

This dataset is a multilingual toxic comment detection dataset, containing paired samples of toxic and neutral comments in three languages: Amharic, Spanish, and Tatar. Each sample includes a toxic comment (toxic_comment or toxic_sentence), a neutral comment (neutral_comment or neutral_sentence), a language label (language), a split type (split), and a full split label (full_split). The dataset provides multiple data split versions, including dev_syn, dev_trans, mix_of_all, mix_of_all_eq, and syn_trans. The number of samples varies by language configuration, for example, Amharic has about 4991 samples (mix_of_all), Spanish about 4800 samples (mix_of_all), and Tatar about 7011 samples (mix_of_all). This dataset can be used for multilingual toxic comment classification, cross-lingual transfer learning, and training and evaluation of toxicity detection models.

提供机构:
s-nlp
创建时间:
2026-08-26
原始信息汇总

数据集概述:MixDetox

MixDetox 是一个用于多语言毒害评论去毒化的数据集,包含三种语言的配置:阿姆哈拉语(Amharic)、西班牙语(Spanish)和鞑靼语(Tatar)。每个配置提供有毒评论与对应的中性评论配对,用于训练和评估文本中性化模型。

数据内容与特征

  • 语言覆盖:阿姆哈拉语、西班牙语、鞑靼语。
  • 字段
    • 阿姆哈拉语与鞑靼语:toxic_comment(有毒评论)、neutral_comment(中性评论)、languagesplitfull_split
    • 西班牙语:toxic_sentenceneutral_sentence(评论文本字段命名不同),同样包含languagesplitfull_split
  • 数据用途:文本去毒化任务,即将有毒表述转换为中性表述。

数据划分

数据集提供了多种划分,涵盖合成数据和翻译数据的混合:

  • Amharic(阿姆哈拉语):
    • dev_syn(合成验证集):1008条
    • dev_trans(翻译验证集):4383条
    • mix_of_all(全混合):4991条
    • mix_of_all_eq(均衡混合):1200条
    • syn_trans(合成+翻译):4591条
    • 总大小:4.61 MB
  • Spanish(西班牙语):
    • dev_syn(合成验证集):4400条
    • mix_of_all(全混合):4800条
    • 总大小:2.18 MB
  • Tatar(鞑靼语):
    • dev_syn(合成验证集):2808条
    • dev_trans(翻译验证集):4803条
    • mix_of_all(全混合):7011条
    • mix_of_all_eq(均衡混合):1800条
    • syn_trans(合成+翻译):6411条
    • 总大小:6.30 MB

数据规模与存储

  • 数据集总下载大小:约1.83 MB(阿姆哈拉语)、1.24 MB(西班牙语)、2.65 MB(鞑靼语)。
  • 数据集总大小(解压后):4.61 MB(阿姆哈拉语)、2.18 MB(西班牙语)、6.30 MB(鞑靼语)。

数据文件结构

每个语言配置对应独立的文件夹,其中数据文件按划分类型存放,使用通配符(如dev_syn-*)匹配实际文件。文件格式为HuggingFace标准数据集格式(如parquet)。

适用场景

  • 多语言文本去毒化模型的训练与评估。
  • 研究有毒评论的自动改写与中性化处理。
搜集汇总
数据集介绍
MixDetox 数据集图片
构建方式
MixDetox数据集旨在为多语言环境下的有毒评论识别与文本中性化提供高质量语料资源。该数据集覆盖阿姆哈拉语、西班牙语和鞑靼语三种语言,通过整合人工注释与自动翻译机制构建而成。具体而言,数据集的构建融合了合成样本(dev_syn)与翻译样本(dev_trans),并将两者结合形成混合数据集(mix_of_all),同时提供平衡子集(mix_of_all_eq)以确保类别分布的均衡性。各语言配置下均包含毒性与中性评论对,为模型训练提供了丰富的对照样本。
特点
MixDetox数据集的核心特点在于其多语言覆盖与多样化的分割设计。每个语言子集均包含原始毒句、对应的中性改写句以及语言标签和分割标识,便于研究者按需选用。数据集提供了多种分割组合,如合成与翻译的联合(syn_trans),使得研究者能够灵活地评估不同数据来源对模型性能的影响。此外,平衡子集(mix_of_all_eq)在样本数量上进行了均衡处理,有效避免了因类别不平衡导致的偏差问题,从而提升了数据集的实用性与鲁棒性。
使用方法
使用MixDetox数据集时,研究者可根据目标语言选择相应的配置(如'Amharic'、'Spanish'或'Tatar'),并加载所需的split子集。例如,可调用datasets库中的load_dataset函数,指定config_name和split参数来获取特定数据。数据集中的'toxic_comment'(或'toxic_sentence')字段可用于训练有毒评论检测模型,而'neutral_comment'(或'neutral_sentence')字段则适用于文本风格转换或文本中性化的生成任务。此外,'mix_of_all'等组合分割适合进行跨域泛化实验,而'dev_syn'与'dev_trans'可用于验证合成数据与真实翻译数据对模型的不同影响,为多语言文本净化研究提供坚实的数据支撑。
背景与挑战
背景概述
MixDetox数据集诞生于多语言文本去毒化研究的浪潮中,由致力于缓解在线有害内容传播的研究团队构建,其核心目标是改善低资源语言环境下的毒性文本处理能力。该数据集覆盖阿姆哈拉语、西班牙语和鞑靼语三种语言,通过合成与翻译相结合的方式,提供了丰富的毒性-中性文本对,为开发多语言去毒模型提供了宝贵资源。其创建时间虽未明确标注,但反映了当前自然语言处理领域对低资源语言安全性的日益关注。MixDetox的发布不仅填补了非英语语言在毒性文本研究中的空白,也为跨语言模型迁移学习提供了新的基准,推动了多语言内容审核技术的边界,对构建更安全、包容的在线交流环境具有重要影响。
当前挑战
MixDetox数据集所面临的挑战是多维度的。在领域问题层面,针对低资源语言如阿姆哈拉语和鞑靼语,毒性文本检测与去毒化因缺乏大规模标注数据而尤为困难,且文化特异性使得毒性定义存在差异,增加了模型泛化的难度。在构建过程中,团队需克服数据稀缺性,采用合成数据生成和机器翻译技术,但这可能导致数据质量不均和语义偏离。此外,处理西班牙语等相对资源丰富的语言时,如何确保不同来源数据的平衡与一致性亦是一大挑战。MixDetox通过提供dev_syn、dev_trans等不同数据分割,试图缓解这些问题,但如何有效建模真实世界中的复杂毒性表达,仍是该领域持续面临的考验。
常用场景
经典使用场景
MixDetox数据集是面向多语言文本去毒化任务的重要资源,涵盖阿姆哈拉语、西班牙语和鞑靼语等低资源语言。该数据集的经典用途在于训练和评估神经文本改写模型,以实现有毒评论到中性表达的转换。研究人员可基于其提供的成对语料(如dev_syn和dev_trans子集)进行监督微调,或利用混合分割(mix_of_all)提升模型的泛化能力。其设计兼顾了平行语料与合成数据,特别适用于探索跨语言知识迁移和低资源场景下的文本风格迁移任务。
解决学术问题
该数据集直面网络言论治理中的关键技术瓶颈——低资源语言的毒性内容缓解。传统去毒化研究多集中于英语等富资源语言,而MixDetox填补了小语种数据匮乏的空白,为学术社区提供了标准化的基准。它解决了两个核心问题:一是如何在缺乏平行语料的情况下,利用合成与翻译数据构造有效的训练集;二是如何评估文本去毒化在保真度、流畅性和毒性降低之间的平衡。这推动了多语言自然语言处理在内容安全领域的理论发展,并为跨语言模型适应性研究提供了实证基础。
衍生相关工作
基于MixDetox,衍生了一系列前沿研究方向。例如,利用对抗训练和预训练语言模型(如mT5)进行文本风格迁移的优化工作,旨在增强去毒化输出的一致性;多任务学习框架被引入,将毒性识别与中性化改写联合建模,提高整体性能。此外,该数据集促进了跨语言去毒化模型的可解释性研究,以及评估指标如联合得分(joint score)的改进。这些工作不仅深化了对低资源语言文本生成的理解,也推动了内容 moderation 领域从分类向生成式干预的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务