遇见数据集

Tatar detoxification dataset

收藏
arXiv2026-06-25 更新2026-06-26 收录
数据链接:
官方服务:

资源简介:

该数据集是由斯科尔科沃科学技术学院等机构为低资源鞑靼语文本去毒任务构建的专项语料库,旨在扩充现有CLEF竞赛数据。其内容包含701条人工标注的平行文本对,涵盖从社交媒体采集的原始毒性语句及其中性化改写版本,平均字符长度约55,并标注了毒性等级与去毒方法。数据通过遵循CLEF指南的双标注者加审核流程创建,特别处理了鞑靼语字母替代现象。该数据集主要用于训练和评估鞑靼语文本去毒模型,解决低资源语言在内容安全领域缺乏监督数据的问题。

This specialized corpus was developed by the Skolkovo Institute of Science and Technology and other institutions for the low-resource Tatar text detoxification task, with the goal of expanding the existing CLEF competition dataset. It comprises 701 manually annotated parallel text pairs, including original toxic sentences and their neutralized rewritten variants collected from social media, with an average character length of around 55. Annotations for toxicity levels and detoxification methods are included for each sample. The dataset was constructed following a dual-annotator plus review process specified in the CLEF guidelines, with special handling of the Tatar alphabet substitution phenomenon. This dataset is primarily utilized for training and evaluating Tatar text detoxification models, addressing the gap of supervised data for low-resource languages in the content safety domain.

创建时间:
2026-06-25
原始信息汇总

数据集概述

Tatoxa 是一个针对低资源语言(鞑靼语)的文本去毒化系统,旨在减轻文本中的有害性(毒性)。该项目包含一个扩展的鞑靼语去毒化数据集。

数据集构成

  • 来源:基于 CLEF-2025 竞赛的鞑靼语数据集,并额外添加了 701 条人工标注示例
  • 标注:由两名标注员独立标注,并由一名审核员审查,遵循 CLEF-2025 组织者提供的指南。标注任务为:在尽可能少修改原文、保留原意的条件下,将文本去毒化。
  • 文件
    • Datasets/ 文件夹包含:
      • CLEF-2025 数据集(在实验中用作验证集)。
      • 人工标注数据集(在实验中用作测试集)。
  • 重要说明:用于跨语言实验的 MultiParaDetox 数据集 的测试子集不包含在本仓库中。如需访问,需联系以下论文的作者:
    • Dementieva, Daryna, Nikolay Babakov, and Alexander Panchenko. "MultiParaDetox: Extending text detoxification with parallel data to new languages." Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 2: Short Papers). 2024. 论文链接

数据处理与生成

数据集是通过一个四阶段流水线构建的:

  1. 翻译模型微调:使用 LoRA 方法微调多语言模型 facebook/nllb-200-3.3B,以改善俄语↔鞑靼语的翻译质量。训练数据来自 AigizK/tatar-russian-parallel-corpora
  2. 合成数据集生成:将俄语去毒化数据集(ru_paradetoxmultilingual_paradetoxrudetoxifiertoxic_dvach)中的“有毒→中性”对翻译为鞑靼语,并使用 sentence-transformers/LaBSE 过滤语义相似度低于 0.7 的句子对,生成鞑靼语平行语料库 tatar_detox_ds
  3. 去毒化模型训练:基于指令微调的多语言模型 s-nlp/mt0-xl-detox-orpo,使用 3 折交叉验证训练三个独立的 LoRA 适配器。
  4. 推理与重排序:加载基座模型和三个适配器,对每条输入句子生成最多 60 个候选,并基于以下加权分数选择最佳候选:
    • 毒性:使用分类器 textdetox/xlmr-large-toxicity-classifier-v2 评估“中性”类的概率。
    • 意义:使用 LaBSE 计算与源文本的余弦相似度。

可用实验脚本

项目中提供了多个实验脚本,用于在不同数据集上微调 mT0 模型:

  • 跨语言设置script_crosslingual_train.pyscript_crosslingual_test.pyscript_crosslingual_all.py,分别用于在 MultiParaDetox 数据集的训练子集、测试子集和完整数据集上进行微调。
  • 训练集规模影响script_size_impact.py,用于在 ParaDetox 数据集上测试不同训练样本数量(如 12000 条)对模型性能的影响。通过修改 load_training_data 函数可在 ParaDetox 和 Ru-ParaDetox 数据集之间切换。

所有脚本的参数包括:--finalpath(输出文件路径)、--logpath(日志路径)、--valpath(验证集路径)、--testpath(测试集路径),以及 --epochs--batch-size--learning-rate--lora-rank--lora-alpha--early-stopping-patience 等可选参数。script_crosslingual_test.py 额外需要 --trainset 参数,script_size_impact.py 额外需要 --train-samples 参数。

搜集汇总
数据集介绍
Tatar detoxification dataset 数据集图片
构建方式
Tatar detoxification dataset的构建以应对低资源语言文本 detoxification 的挑战为出发点。研究团队首先基于公开的俄语 detoxification 语料库,通过微调 NLLB-200 神经机器翻译模型,将其高质量翻译为鞑靼语,生成合成平行语料。翻译后的句子对经 LaBSE 跨语言语义相似度过滤(阈值设为0.7),筛选后获得38,380对平行句。在此基础上,为弥补 CLEF-2025 竞赛中鞑靼语部分规模不足的缺陷,手动扩充了701个毒性与非毒性文本对。这些示例取材于多语言毒性数据集中的鞑靼语部分,并由两位母语标注者遵循 CLEF 指南进行最小化改写,最终由具有自然语言处理背景的仲裁者审核后完成。
使用方法
该数据集主要服务于鞑靼语文本 detoxification 模型的微调与评估。研究者采用 Tatoxa 流水线,基于翻译后的平行语料训练 mT0-XL 模型,并通过 K 折交叉验证集成多个 LoRA 适配器以增强鲁棒性。推理阶段采用多候选生成与排序策略:每个适配器生成60个候选 detoxification 文本,依据 XLM-R 分类器的中性度评分和 LaBSE 语义相似度进行综合排序,选取最优结果。数据集也可用于跨语言迁移学习实验,评估从其他语言(如法语、英语)训练后迁移至鞑靼语的效果。此外,其毒性等级与 detoxification 策略标注支持对模型行为进行多维度分析。
背景与挑战
背景概述
鞑靼语文本去毒数据集(Tatar detoxification dataset)由Skoltech、HSE、ITMO等机构于2025年联合创建,核心研究人员包括Ilseyar Alimova、Bogdan Monogov等。该数据集聚焦于低资源语言——鞑靼语的文本去毒任务,旨在自动检测并改写网络内容中的侮辱、脏话与攻击性语言,以维护在线社区的安全性。研究背景植根于多语言去毒共享任务(CLEF 2025)的发现:鞑靼语的自动去毒质量在所有评估语言中得分最低。为此,研究者系统性地构建了包含701个手工标注样本的扩展语料库,并提出了Tatoxa系统,显著提升了该语言在去毒精度与语义保留方面的表现。该数据集为低资源语言的自然语言处理研究提供了重要基准,也推动了跨语言去毒迁移方法的探索。
当前挑战
鞑靼语文本去毒面临多重挑战。首先,作为低资源语言,鞑靼语缺乏大规模高质量的并行去毒语料,现有多语言模型在该语言上表现不佳,导致去毒效果远逊于高资源语言。其次,文化知识的缺乏使系统难以识别隐含冒犯内容,即使是人工标注也需依赖母语者的语用直觉,自动化系统更易失效。在数据集构建过程中,研究团队需处理机器翻译引入的噪声,通过跨语言语义相似度过滤(如LaBSE)确保质量;同时,由于鞑靼语用户常以俄文字母替代鞑靼字母拼写,标注需提供两种变体以反映实际使用场景,这加大了标注一致性的难度。此外,训练数据规模对模型性能的边际递减效应、跨语言迁移效果显著弱于目标语言内训等,均是制约该领域发展的核心难题。
常用场景
经典使用场景
在低资源语言文本去毒化的学术领域,Tatar detoxification dataset 是最具代表性的基准数据集之一。该数据集专为鞑靼语设计,包含701条人工标注的有毒-无毒文本对,并结合了CLEF-2025共享任务中的鞑靼语子集。研究者常利用该数据集对去毒化系统进行微调与评估,尤其关注在数据极度稀缺情境下,模型能否兼顾毒性消除与语义保留。其经典使用场景集中于评估基于翻译合成的数据增强策略、跨语言迁移学习的有效性,以及多候选生成与排序机制的优化。该数据集以其高质量的人工标注和针对低资源语言挑战的设计,成为鞑靼语去毒化研究的核心实验平台。
解决学术问题
Tatar detoxification dataset 的提出,系统性地解决了低资源语言文本去毒化研究中数据匮乏与模型泛化能力不足的双重困境。在学术层面,该数据集首先填补了鞑靼语平行去毒化语料的空白,使研究者得以摆脱对单一多语言大模型的依赖,转而探索语言特定的微调策略。其次,数据集支持跨语言迁移实验的严谨对比,实证揭示即便文化相近的俄语迁移至鞑靼语时效果显著劣于原生数据训练,这一发现挑战了跨语言迁移的普适性假设。此外,基于该数据集的实验表明,自动翻译生成的平行语料经语义过滤后可用于模型训练,为低资源场景下的人工标注成本问题提供了可行替代方案。这些贡献推动了文本去毒化领域从数据中心向低资源语言的拓展,并促使学界重新审视语言特定知识在安全内容生成中的核心地位。
实际应用
在实际应用层面,Tatar detoxification dataset 赋能了鞑靼语社交媒体平台的内容安全治理。借助基于该数据集训练的Tatoxa系统,平台可将用户发布的攻击性言论自动改写为保留原意的中性表述,既避免了简单删帖对表达自由的侵害,又维护了在线社区的和谐氛围。该系统可部署于鞑靼语论坛、即时通讯工具及新闻评论区,实时过滤仇恨言论与侮辱性语言。此外,数据集支持构建面向鞑靼语教育的辅助工具,帮助学生识别并改写不当表达。在跨语言场景中,该数据集还可用于检验多语言客服机器人的安全响应能力,确保其在低资源语境下仍能产出得体回复。这些实践表明,该数据集不仅推动了低资源语言NLP技术的落地,也为多语种内容审核提供了可复用的方法论框架。
数据集最近研究
最新研究方向
当前,针对鞑靼语(Tatar)等低资源语言的文本去毒化研究正成为自然语言处理领域的前沿热点。Tatoxa系统通过构建包含701条人工标注样本的扩展数据集,并结合神经机器翻译、多候选生成与排序策略,在鞑靼语去毒化任务上超越了GPT-5、Claude等先进闭源大语言模型。该方向的核心挑战在于跨语言迁移的有效性——实验表明,即使利用文化相近的俄语数据进行迁移学习,其效果也显著低于基于目标语言原生数据的训练,这揭示了语言特异性知识与文化语境在去毒化任务中的不可替代性。相关研究正推动低资源语言安全领域从通用多语言模型向数据增强、参数高效微调与语料质量控制的精细化方向演进。
相关研究论文
  • 1
    The Tatoxa System for Text Detoxification in Low-Resource Languages: The Case of Tatar斯科尔科沃科学技术学院; 高等经济学院; 国立信息技术、机械学与光学研究型大学; 鞑靼斯坦科学院应用符号学研究所; 喀山联邦大学; 人工智能研究所 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务