遇见数据集

Selected Adversarial SemanticS (SASS)

收藏
arXiv2023-01-05 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

SASS数据集是由纽约大学开发的一个用于评估和挑战现有毒性语言检测工具的基准。该数据集包含250个自然语言示例,覆盖10个毒性类别,如刻板印象、阶级歧视和勒索等。每个示例约1-2句话,旨在揭示毒性检测系统中的漏洞。SASS数据集的创建旨在帮助研究人员和公司改进毒性内容检测技术,以更有效地管理和减少社交媒体和在线论坛中的有害内容。

The SASS dataset is a benchmark developed by New York University for evaluating and challenging existing toxic language detection tools. This dataset contains 250 natural language examples spanning 10 toxicity categories, including stereotypes, class discrimination, blackmail, and others. Each example consists of approximately 1 to 2 sentences, designed to uncover vulnerabilities in toxicity detection systems. The SASS dataset was created to help researchers and companies improve toxic content detection technologies, enabling more effective management and reduction of harmful content on social media and online forums.

提供机构:
纽约大学
创建时间:
2023-01-05
搜集汇总
数据集介绍
构建方式
在互联网内容毒性检测领域,现有工具往往依赖多数标注者的规范性判断,导致对边缘性有害语言的识别存在盲区。为挑战这一范式,研究者提出了Selected Adversarial SemanticS(SASS)基准数据集。该数据集包含250条人工构建的自然语言样本,覆盖10个精细化的毒性类别(如刻板印象、阶级歧视、勒索等),其中8个类别专门针对假阴性案例设计,1个针对假阳性案例,另设中性对照组。每条样本长度为1至2句话,通过文献回顾与对Perspective API等工具的脆弱性测试确定类别。构建时采用过滤与非过滤双轨策略:过滤样本需经Perspective评分低于0.5以确保其规避现有检测,非过滤样本则基于创作经验直接生成。每条样本还附有作者盲评后经z标准化处理的人类毒性分数,作为评估基线。
使用方法
SASS适用于评估毒性检测模型在二元分类场景中的表现。使用时,可将Perspective API或GPT-3等模型的输出分数二值化(阈值设为0.5),与人类基线进行对比。论文提供了零样本、单样本和少样本三种GPT-3提示设置,其中少样本提示(含两个示例)效果最优。评估指标包括精确率、召回率和F1分数。研究者建议将SASS作为现有基准的补充,而非替代,因其规模较小但针对性强。代码已开源,便于复现。未来可扩展样本数量、纳入更多语言模型,或结合随机标注者验证其规范性假设。在应用中,需注意数据集的英语中心性及美国文化背景限制,避免跨文化误用。
背景与挑战
背景概述
在互联网内容治理领域,有毒语言检测一直是备受关注的社会与技术挑战。2023年,来自纽约大学的Lorena Piedras、Lucas Rosenblatt与Julia Wilkins联合提出了Selected Adversarial SemanticS(SASS)基准数据集,旨在揭示主流毒性检测工具——如Jigsaw旗下Perspective API——在规范性假设上的深层缺陷。该数据集包含250条精心构造的自然语言样本,横跨敲诈、阶级歧视、煤气灯效应等十个细腻的毒性类别,聚焦于那些虽符合毒性定义却常被主流模型忽略的“边缘”表达。SASS的诞生不仅挑战了传统基于多数投票的标注聚合方式,更推动了毒性检测领域对模型隐含偏见的反思与再评估,成为评估未来系统鲁棒性的重要标尺。
当前挑战
SASS数据集所面临的挑战主要体现于两个层面。其一,在领域问题上,现有毒性检测模型如Perspective API对隐性恶意表达识别能力薄弱,在SASS的二进制分类任务中F1分数仅为0.08,远低于人类基线;模型过度依赖脏词作为毒性信号,导致对不含冒犯词汇的歧视、操纵等有害内容漏判严重,暴露出语义理解深度不足的局限。其二,在构建过程中,SASS的样本设计需规避多种规范性陷阱,例如确保文本自然性、避免逻辑谬误与概念混淆;同时,仅250条的小规模样本难以覆盖所有文化语境,且作者不可避免的偏见可能影响类别代表性,这要求后续工作持续扩展样本集并跨语言验证其有效性。
常用场景
经典使用场景
Selected Adversarial SemanticS (SASS) 作为一个精密的对抗性基准数据集,广泛用于评估毒性检测模型在微妙、隐蔽毒性语言上的表现。其经典使用场景聚焦于对 Perspective API 等主流工具进行压力测试,通过涵盖敲诈、煤气灯效应、刻板印象等十类边缘毒性类别,揭示模型在非显式侮辱性文本上的脆弱性。研究者利用 SASS 中精心构造的短句样本,检测模型是否仅依赖粗俗词汇或显性攻击信号,从而衡量其语义理解深度与鲁棒性。该数据集特别适用于对比不同架构(如 Transformer 与大语言模型)在低资源或少样本提示下的毒性分类能力,为模型迭代提供可复现的评估框架。
解决学术问题
SASS 数据集直面毒性检测领域中长期存在的规范性问题与标注偏差,解决了主流基准因依赖多数标注者共识而忽略边缘毒性表达的学术困境。传统方法通过聚合二元标注产生毒性概率,容易掩盖针对少数群体的隐性攻击,如性别歧视或阶级歧视的委婉表述。SASS 通过设计过滤与非过滤样本,系统性地暴露 Perspective 等模型在识别此类有害文本时的低召回率,证明其性能提升可能源自对脏话的过拟合而非深层意图理解。这一发现挑战了既有模型声称的先进性,推动了关于毒性定义主观性与模型公平性的学术讨论,并为构建更具包容性的检测标准提供了方法论基础。
实际应用
在实际应用中,SASS 数据集为社交媒体平台与在线论坛的内容审核系统提供了关键的诊断工具。通过部署 SASS 进行定期评估,平台能够识别出当前毒性检测模型在识别操纵性言论、隐形歧视或讽刺性攻击时的盲区,从而针对性地优化模型阈值或引入多模态特征。例如,在 Reddit 或 Twitter 等用户生成内容密集的场景中,SASS 帮助审核团队发现那些看似中性但实则具有排他性的评论,避免有害内容因表面无害而漏检。此外,该数据集还被用于训练更鲁棒的少样本分类器,如基于 GPT-3 的提示模型,以较低成本提升对新兴毒性模式的响应能力,最终减少对人工审核员的心理负担并维护社区健康。
数据集最近研究
最新研究方向
在在线内容审核领域,毒性语言检测工具如PerspectiveAPI的部署已成为应对网络骚扰的关键技术。然而,近期研究揭示了一个严峻挑战:现有模型在捕捉隐性恶意语义时存在系统性缺陷。Selected Adversarial SemanticS (SASS) 基准数据集应运而生,它聚焦于传统毒性检测中容易被忽视的细微语义类别,如操纵性言论、煤气灯效应和阶级歧视。通过精心构造的对抗性样本,SASS 暴露了主流检测工具在面对非显式侮辱性但具有深层伤害性的语言时的脆弱性,尤其凸显了其过度依赖冒犯性词汇而忽视语境恶意意图的倾向。这一工作推动了毒性检测从简单的词汇匹配向理解复杂社会权力动态的范式转变,对于构建更公平、更具文化敏感性的内容审核系统具有里程碑式的意义,也呼应了当前对算法偏见与少数群体保护的热点关切。
相关研究论文
  • 1
    Critical Perspectives: A Benchmark Revealing Pitfalls in PerspectiveAPI纽约大学 · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务