遇见数据集

thu-coai/SeTox

收藏
Hugging Face2026-07-05 更新2026-07-22 收录
官方服务:

资源简介:

SeTox 是一个用于评估和训练搜索增强安全模型的中文新词毒性检测数据集。它专注于新兴术语、隐式表达和上下文相关的在线含义,旨在帮助研究和改进中文互联网环境中新词和隐式表达的毒性检测能力。

SeTox is a Chinese neologism toxicity detection dataset for evaluating and training search-augmented safety models. It focuses on emerging terms, implicit expressions, and context-dependent online connotations, aiming to facilitate research and improve the toxicity detection capabilities for neologisms and implicit expressions in Chinese internet environments.

提供机构:
thu-coai
搜集汇总
数据集介绍
thu-coai/SeTox 数据集图片
构建方式
SeTox数据集专为中文网络新词毒性检测而构建,旨在评估与训练具备搜索增强能力的安全模型。其数据来源包括一份包含974条记录的新词词典,以及经由监督微调生成的两种训练样本:一种是集成搜索观测结果的工具调用样本,共995条;另一种是直接的监督微调样本,共600条。评估集则分为新词毒性测试集(624条)与通用安全测试集(368条)。构建过程中保留了原始词典的重复标识符,并通过启发式审计识别了工具调用样本中的搜索噪声,如广告或页面质量缺陷。
特点
该数据集聚焦于新兴术语、隐性表达及依赖上下文语境的中文网络意涵,区别于传统毒性检测数据集。标注采用二元分类(安全与不安全),同时新词词典还细分为贬损攻击、成人内容、违法犯罪、违背道德与敏感话题五类风险标签。值得注意的是,工具调用训练样本包含真实的搜索结果噪声,这为模拟实际应用场景中的不确定性提供了研究基础,但也要求使用者谨慎对待其作为事实来源的可靠性。
使用方法
研究者可通过Python的json库直接加载评估文件以复现基准评测,例如读取'data/eval/neologism_test.json'并获取记录键值。该数据集支持搜索增强推理范式的毒性检测研究,使用者可结合提供的词典与训练样本进行模型微调或评估。由于数据包含敏感内容及搜索噪声,建议在审查下游用途后谨慎使用,并引用相关ACL论文以遵循学术规范。
背景与挑战
背景概述
随着互联网社交媒体的迅猛发展,中文网络新词(neologism)不断涌现,其语义往往依赖特定语境且具有隐含性,给传统的毒性检测(toxicity detection)模型带来了严峻挑战。SeTox数据集由清华大学黄民烈教授团队与阿里巴巴合作创建,其核心研究聚焦于借助搜索增强推理技术来提升大语言模型对中文新词毒性内容的理解与识别能力。该数据集发布于2026年,已在ACL 2026长文上发表,为中文网络内容安全领域开辟了新的研究路径。SeTox不仅提供了涵盖贬损攻击、成人内容、违法犯罪、违背道德及敏感话题五个细粒度风险类别的新词词典,还构建了包含工具调用与直接监督微调两种范式的高质量训练集,对推动安全模型在动态网络环境中的适应与泛化具有重要影响。
当前挑战
该数据集所解决的领域问题核心在于:传统毒性检测模型多依赖静态词表与规则,难以应对网络新词的快速演变与歧义消解,尤其缺乏对隐含表达及上下文依赖语义的捕获能力。SeTox的构建过程同样面临多重挑战。其一,新词词典的构建需要持续追踪网络高频变异用语,并横跨各平台海量语料,数据清洗与去重工作极为繁重,如原始词典中存在七条重复源ID需要人工比对。其二,工具调用训练数据中的搜索观测结果天然包含广告、翻译页面及抓取失败等噪声,经启发式审计发现噪声率达23.62%,需设计鲁棒的过滤与标注策略。其三,标注过程涉及大量敏感与不良内容,需在保证标注质量的同时遵循严格的数据伦理与安全规范。
常用场景
经典使用场景
SeTox数据集为中文网络新词毒性检测提供了首个系统化的评测基准。该数据集精心构建了包含974条新词词库的评估体系,并设计了624条新词毒性测试样本与368条通用安全测试样本,覆盖了网络语言中涌现的隐晦表达、语境依赖的在线用语及新兴术语。经典使用范式通常围绕检索增强的安全模型展开,研究者利用该数据集训练具备工具调用能力的语言模型,使其能够通过实时搜索引擎获取语境信息,从而精准识别那些在静态知识库中难以判定的毒性表达。数据集中提供的995条工具调用训练样本与600条直接指令微调样本,为探索检索与推理的协同机制提供了宝贵素材。
实际应用
在实际部署层面,SeTox推动了社交平台内容审核系统从关键词过滤向智能语义检测的演进。基于该数据集训练的模型可以实时捕捉并解读网络新创词汇的隐含恶意,有效识别贬损攻击、成人内容、违法犯罪、违背道德及敏感话题等五大风险类别。在短视频评论区、即时通讯群组、弹幕互动等场景中,系统能够动态查询搜索引擎以获取最新语境信息,克服传统审核模型对流行语、黑话的识别盲区。此外,该数据集的训练数据还包含实际搜索结果噪声样本,使得模型在实际应用中具备更强的抗干扰能力,能够区分广告信息、翻译页面与真实有毒内容,显著降低误报率。
衍生相关工作
SeTox的出现催生了多项富有启发性的后续研究。在模型架构层面,研究者开始探索多轮检索与推理链的联合优化策略,通过强化学习框架使语言模型学会何时应主动触发搜索、如何整合异构源信息并作出合理解释。在评估维度上,一些工作借鉴SeTox的二元标签与细粒度风险分类体系,构建了面向多语言新词毒性的跨文化迁移评测基准。而在工具学习领域,SeTox的搜索增强范式启发了针对模型推理过程中检索噪声消减的方法研究,如引入对抗训练提升对误导性搜索结果的鲁棒性。该数据集还促成了安全大模型评测标准从静态测试集向动态对抗性评估的转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务