遇见数据集

Slang-Q

收藏
arXiv2026-08-05 更新2026-08-07 收录
数据链接:
官方服务:

资源简介:

Slang-Q是一个由都灵大学与布鲁诺·凯斯勒基金会联合创建的人工精选评估数据集,聚焦于英语用户生成内容中的酷儿俚语理解。该数据集包含1,024条手工标注的句子,每条句子配有一个酷儿俚语术语及其参考定义,术语来源于涵盖118个词汇的新建分类体系。数据构建过程基于Urban Dictionary语料库,通过自动提取与人工筛选相结合,剔除了语义无关及有害内容,最终保留77个术语的有效实例。该数据集旨在评估大语言模型对社区特异性语言的掌握程度,尤其关注模型能否准确理解并解释酷儿俚语,从而为减轻NLP系统中的偏见与信息缺失提供基础资源。

Slang-Q is a manually curated evaluation dataset jointly created by the University of Turin and Bruno Kessler Foundation, focusing on queer slang comprehension in English user-generated content. This dataset comprises 1,024 manually annotated sentences, each paired with a queer slang term and its reference definition. The terms are derived from a newly constructed taxonomy consisting of 118 vocabulary items. The dataset construction process is based on the Urban Dictionary corpus, combining automatic extraction and manual screening to remove semantically irrelevant and harmful content, ultimately retaining valid instances of 77 distinct terms. This dataset aims to evaluate the proficiency of Large Language Models (LLMs) in comprehending community-specific language, with particular focus on the model's ability to accurately understand and explain queer slang, thereby providing foundational resources for mitigating bias and information gaps in NLP systems.

创建时间:
2026-08-05
原始信息汇总

数据集概述

Slang-Q 是一个人工整理的数据集,用于评估语言模型对英语用户生成内容中酷儿俚语(Queer Slang)的理解能力。该数据集与论文 Do Language Models Know Their Slang? Queer Slang Understanding in User-Generated Content(CLiC-it 2026)配套发布。

数据集规模

  • 包含118个与酷儿相关的术语分类体系(Taxonomy)
  • 1,024条经过人工筛选的用户生成句子
  • 1,073个术语-句子评估对(因部分句子包含多个目标术语)
  • 覆盖77个在最终句子数据集中出现的术语
  • 200个模型输出的手动标注子集

分类体系(Taxonomy)

数据集中每个术语关联以下信息:

  • 参考定义(reference definition)
  • 一个或多个宽泛类别,包括:
    • Identity(身份)
    • Slang(俚语)
    • Intersectional(交叉性)
  • 零个或多个语言子类别,包括:
    • Reclaimed(回收术语)
    • Shorthand(缩写)
    • Idiomatic expression(习语表达)
    • Pronoun(代词)
    • Spelling variation(拼写变体)

分类体系独立于源语料构建,因此并非所有118个术语都出现在最终句子数据集中。

句子数据集

data/slangq_sentences.csv 包含1,024条经人工验证的唯一用户生成句子,来源于Urban Dictionary,并经过语义相关性和有害/粗俗内容的过滤。

句子数据集的字段包括:

字段 说明
contributor Urban Dictionary条目的贡献者用户名
date 原始条目提交日期
downvotes 原始条目收到的踩数
example 包含匹配术语的用户生成例句
meaning 原始Urban Dictionary释义
upvotes 原始条目收到的赞数
word 原始条目的词目
matched_terms 提取时匹配到的酷儿相关术语(多个以分号分隔)

评估设置

提示条件

数据集包含四个主要提示条件,结合两个维度:

  1. 输入内容:仅提供目标术语 vs. 提供术语及句子上下文
  2. 提示框架:通用语言专家框架 vs. 明确的酷儿俚语知情框架

四个条件分别为:术语基线(terms_base)、术语俚语知情(terms_informed)、上下文基线(context_base)、上下文俚语知情(context_informed)。

模型输出

包含四个评估模型的原始生成结果:

  • Claude Sonnet 4.6
  • Llama 3.3 70B
  • Llama 4 Scout
  • Qwen3 32B

每个模型目录下包含对应四个提示条件的输出文件。

自动评估

evaluation/metrics_scores.csv 包含行级别的模型输出、三个参考定义及对应的ROUGE-L和BERTScore值。每个生成定义均与三个参考(原始人工编写的分类定义和两个经人工验证的GPT-5.5生成的替代定义)进行独立评估,最终分数为三个参考的平均值。聚合结果时,先对同一术语对应的所有句子取平均,再对术语取平均,以防止高频术语主导最终结果。

手动评估

evaluation/manual_evaluation.csv 包含200个输出的手动标注,覆盖50个术语-句子对、两个模型(Claude Sonnet 4.6和Llama 4 Scout)以及两个提示条件(术语基线和俚语知情上下文条件)。每个输出标注为:

  • Correct:正确传达预期含义
  • Partially correct:识别出相关俚语或酷儿含义,但遗漏或扭曲了一个核心成分
  • Incorrect:模型选择了无关含义、凭空捏造含义或未能定义该术语

用途与许可

该数据集旨在支持社区特定语言和俚语的研究,可用于复现论文中的定义生成、自动评估和手动分析等实验流程。数据集以 Creative Commons Attribution 4.0 International License 发布,使用时应引用配套的CLiC-it 2026论文。

搜集汇总
数据集介绍
Slang-Q 数据集图片
构建方式
在自然语言处理领域,俚语因其动态演变和社群特定性而成为极具挑战性的研究对象,尤其当涉及酷儿社群的语言实践时,这一挑战更为显著。针对这一空白,Slang-Q数据集应运而生,其构建过程融合了自动化提取与人工精细化审核。研究团队首先通过整合学术文献、在线词典及社群资源,构建了一个包含118个酷儿相关术语的分类体系,该体系涵盖身份认同、社群俚语及交叉性词汇等维度。随后,基于公开的Urban Dictionary语料,采用字符串匹配技术提取含有目标术语的候选句子,并经历两阶段人工标注:其一判断术语是否用于预期的酷儿义项,其二剔除含有冒犯性或粗俗内容的实例,以确保数据的中立与安全性。最终,数据集保留了1,024条自然生成的英文语句,每条均配有匹配的术语、参考定义及分类标签,从而形成了一个精准、高质量且具有社群敏感性的评测资源。
特点
Slang-Q数据集的核心特点在于其独特的社群针对性与精细的结构设计。该数据集不仅聚焦于酷儿俚语这一在NLP研究中长期被忽视的领域,还通过双层分类体系(主类别与子类别)精准刻画了术语的语义属性和语言学机制,例如将术语划分为身份、俚语、交叉性等主范畴,并辅以回收词、缩写形式、习语表达等子类,从而全面捕捉了酷儿语言的多样性。数据集的另一显著优势在于其自然性与可靠性:所有语句均源自真实的用户生成内容,而非人工合成,这保证了语言使用的生态效度。此外,数据构建过程中对语义相关性及有害内容的严格人工审核,确保了数据集既贴近真实社群的语言实践,又避免了潜在的偏见与伤害,为评估语言模型在处理敏感、社群特定语言时的表现提供了坚实的基准。
使用方法
Slang-Q数据集旨在作为语言模型对酷儿俚语理解能力的评测基准,其使用方法灵活多样。研究者可通过定义生成任务来评估模型:给定术语或术语加示例句,要求模型生成简明定义,并依据参考定义通过ROUGE-L和BERTScore等自动指标进行评分,从而量化模型的语义把握能力。数据集的设计支持多种提示条件的对比实验,例如仅提供术语与提供上下文例句的差异,以及通用提示与酷儿俚语专家框架的差异,这使研究者能够系统探究上下文信息和领域导向对模型表现的影响。此外,数据集还适用于多维度分析,比如按术语类别或子类别进行性能分解,从而揭示模型在不同类型俚语上的强弱项。其公开可获取的特性也鼓励了社区驱动的进一步研究,如数据污染检测和人工错误分析,为深入理解大语言模型在边缘化语言知识上的局限与潜力提供了重要工具。
背景与挑战
背景概述
随着大型语言模型在在线交互与信息获取中的深度渗透,其对社区特有语言的掌握能力成为自然语言处理领域的重要议题。然而,酷儿俚语作为动态且高度依赖社群文化的语言变体,长期在NLP研究中处于边缘地位。为填补这一空白,Arianna Denitto与Beatrice Savoldi于2026年构建了Slang-Q数据集,该资源基于118个酷儿术语的分类体系,从Urban Dictionary中筛选并人工标注了1,024条自然生成的用户语句。此数据集不仅为评估语言模型对酷儿俚语的理解能力提供了基准,更将研究视角从偏见与危害转向语言知识本身,推动了LGBTQIA+语言计算研究的纵深发展。
当前挑战
Slang-Q的构建面临双重挑战。领域层面,酷儿俚语具有高度多义性,如'bear'、'tea'等词在跨社群语境中含义迥异,且其与AAVE等边缘化方言的交叉进一步加剧了语义消歧难度;同时,现有模型常将中性或正向的酷儿用语误判为有害内容,暴露了文化偏见的根深蒂固。数据构建层面,从185,795条Urban Dictionary条目中提取的3,184条候选句经人工审核后,仅保留1,024条有效样本,高达57.57%的句子因语义不匹配被剔除,10.27%因涉粗俗或有害内容被过滤,该过程不仅需精确识别俚语的非字面意义,还需在缺乏可靠元数据的情况下审慎界定'回收性使用',这要求标注者兼具社群文化背景与批判性判断力。
常用场景
经典使用场景
Slang-Q数据集的核心应用场景在于评估大语言模型对酷儿俚语的理解与定义能力,这尤为贴近当前自然语言处理领域对边缘化社群语言现象日益增长的关注。该数据集精心构建了一个包含118个酷儿相关术语的分类体系,并结合了1024条真实的用户生成英文句子,为在多变且富有文化内涵的语境下探究模型的语义解析能力提供了坚实的实验基础。其典型使用方式是将术语、句子及参考定义组合成提示,考察模型在不同上下文与提示框架下生成准确定义的表现,从而系统性地揭示模型在处理具有社群特异性和文化敏感性的语言时存在的优势与不足。
衍生相关工作
Slang-Q的发布预期将催生一系列延伸性研究工作,深化对酷儿语言计算处理的理解。其详尽的三级分类体系为后续研究提供了框架,可启发针对特定子类别(如交叉性术语或回收词汇)的深入探索,进一步细化模型在不同语言机制上的表现差异。该数据集也可作为训练或微调模型的资源,旨在提升模型对酷儿俚语的泛化能力,或开发专门的术语消歧系统。此外,Slang-Q所采用的人工审核流程与质量控制方法,为构建其他关注边缘社群语言的资源树立了范本,有望推动更多类似的高质量数据集的创建。围绕该数据集的后续研究将在时间维度上追踪俚语的演变,促进历时性分析与模型适应性的持续改进。
数据集最近研究
最新研究方向
针对语言模型对酷儿俚语理解能力的前沿探索,Slang-Q数据集聚焦于用户生成内容中的酷儿社群特有语言,构建了包含118个术语的分类体系及1,024条人工注释的英文句子,旨在填补自然语言处理领域对酷儿俚语表征不足的空白。研究通过定义生成任务,系统评估了专有与开源语言模型在不同提示条件下的理解能力,揭示了领域特定框架与语境信息对模型正确解读多义词和社群特定表达的关键作用。该数据集不仅为探究语言模型处理敏感且社群特异性语言提供了基准资源,还推动了NLP系统在文化敏感性和社会包容性方面的发展,对促进技术在多元社群中的公平应用具有重要影响。
相关研究论文
  • 1
    Do Language Models Know Their Slang? Queer Slang Understanding in User-Generated Content都灵大学; 布鲁诺·凯斯勒基金会 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务