luizapzbn/from-one-to-many-toxicity-mitigation
收藏资源简介:
该数据集伴随论文《从一到多:扩展语言模型中的毒性缓解范围》发布,旨在解决多语言环境下的毒性缓解问题。数据集包含九种语言的文本数据,包括英语、葡萄牙语、西班牙语、意大利语、法语、俄语、阿拉伯语、印地语和韩语。数据集主要由翻译自现有数据集的样本组成,包括Jigsaw Multilingual Toxicity分类挑战和Jigsaw Unintended Bias数据集的内容。数据集结构包括训练集和评估集,训练集包含原始数据和翻译数据,评估集包含随机选择的样本。数据集的使用目的是帮助减少语言模型中的有害内容,但需要注意的是,由于使用了机器翻译,可能会引入或减少原有的毒性。
该数据集伴随论文《从一到多:扩展语言模型中的毒性缓解范围》发布,旨在解决多语言环境下的毒性缓解问题。数据集包含九种语言的文本数据,包括英语、葡萄牙语、西班牙语、意大利语、法语、俄语、阿拉伯语、印地语和韩语。数据集主要由翻译自现有数据集的样本组成,包括Jigsaw Multilingual Toxicity分类挑战和Jigsaw Unintended Bias数据集的内容。数据集结构包括训练集和评估集,训练集包含原始数据和翻译数据,评估集包含随机选择的样本。数据集的使用目的是帮助减少语言模型中的有害内容,但需要注意的是,由于使用了机器翻译,可能会引入或减少原有的毒性。
数据集概述
数据集名称
- From One to Many: Expanding the Scope of Toxicity Mitigation in Language Models
数据集语言
- 语言种类: 英语、葡萄牙语、西班牙语、意大利语、法语、俄语、阿拉伯语、印地语、韩语
数据集许可证
- 许可证: Apache-2.0
数据集任务类别
- 任务类别: 文本生成、文本分类
数据集标签
- 标签: 有害、有毒
数据集结构
- 训练数据:
- jigsaw_english: 原始的Jigsaw Unintended Bias英语数据集。
- multilingual:
- jigsaw_multilingual: Jigsaw Multilingual Toxicity分类挑战中的本地语言示例。
- translated_jigsaw_english: Jigsaw Unintended Bias挑战的翻译样本。
- full_sized: 完整的jigsaw数据集翻译。
- minimal: 主要实验中选用的约3K(或3.5K)有毒和10K非有毒样本,由NLLB 600M模型翻译。
- nllb1.3b: 所有语言的相同数据子集,由NLLB 1.3B模型翻译(更高翻译质量)。
- m2m: 所有语言的相同数据子集,由M2M 418M模型翻译(较低翻译质量)。
- different_subsets: 每种语言的不同子集(无平行内容),由NLLB 600M模型翻译。
- bleu_subset: 用于计算论文中BLEU分数的样本。
- 评估数据:
- 随机选取的200个样本,用于整体偏见(英语)翻译到每种目标语言。内容在所有语言中相同。
- _hi: 高资源语言实验的评估集。
- _mid: 中等资源语言实验的评估集。
- individual: 每种语言的单独样本文件夹。
- 随机选取的200个样本,用于整体偏见(英语)翻译到每种目标语言。内容在所有语言中相同。
- 结果数据:
- 论文中所有模型的生成和实验结果,用于生成图表(数据量约15GB)。
数据集来源
数据集风险与限制
- 风险与限制: 使用机器翻译生成数据集可能增加或减少原始句子的现有毒性。数据集包含可能使模型更具毒性的有毒句子,作者强烈反对此种使用。
数据集引用
-
引用信息:
@article{pozzobon2024one, title={From One to Many: Expanding the Scope of Toxicity Mitigation in Language Models}, author={Pozzobon, Luiza and Lewis, Patrick and Hooker, Sara and Ermis, Beyza}, journal={arXiv preprint arXiv:2403.03893}, year={2024} }




