yor-sarc
收藏资源简介:
Yor-Sarc 是一个用于约鲁巴语(Yorùbá)讽刺检测的黄金标准数据集,约鲁巴语是一种声调丰富、形态复杂的非洲语言,使用人口超过5000万。该数据集旨在解决非洲自然语言处理(NLP)中高质量标注资源稀缺的问题,特别是在比喻性语言理解方面。数据集包含436个手动标注的约鲁巴语文本实例,用于二元讽刺分类。每个实例均以标准化约鲁巴语正字法书写(包含变音符号),并由三位母语者独立标注,标注结果为二元标签(0表示非讽刺,1表示讽刺)。数据集具有较高的标注者间一致性(Fleiss’ κ = 0.7660,83.3%的一致同意率),适用于讽刺检测、比喻性语言理解、情感分析、低资源NLP及非洲语言建模等研究任务。数据集还提供了标注者投票比例,支持软标签建模。Yor-Sarc的创建旨在为低资源环境下的讽刺检测系统提供文化基础扎实的基准,并推动声调语言的比喻性语言建模研究。
Yor-Sarc 数据集概述
数据集基本信息
- 数据集名称: Yor-Sarc
- 简介: Yor-Sarc 是一个用于约鲁巴语(Yorùbá)讽刺检测的黄金标准数据集。约鲁巴语是一种声调丰富、形态复杂的低资源非洲语言,使用人口超过5000万。该数据集旨在解决非洲自然语言处理领域中高质量、带注释的比喻语言理解资源的稀缺问题。
- 语言: 约鲁巴语 (yo)
- 许可协议: CC-BY-4.0
- 数据量: 包含 436 个手动标注的约鲁巴语文本实例。
数据集详情
描述与特点
- 核心任务: 专注于细粒度的比喻语言理解,特别是讽刺检测。讽刺是一种依赖于语调、上下文和文化线索的语用复杂现象。
- 文本特征: 所有实例均采用标准约鲁巴语正字法书写(包含变音符号)。
- 标注信息: 每个实例由三位约鲁巴语母语者独立标注,采用二元标签(0 = 非讽刺,1 = 讽刺),并基于多数投票确定最终标签。数据集中保留了标注者一致性信息,以支持不确定性感知建模。
- 标注者一致性: 数据集具有较高的标注者间一致性:
- Fleiss’ κ = 0.7660
- 配对 Cohen’s κ = 0.6732–0.8743
- 一致同意率 = 83.3%
数据集结构
- 总实例数: 436
- 每条记录包含字段:
text: 约鲁巴语句子(带变音符号)label: 基于多数投票的二元讽刺标签- (可选)标注者投票比例,用于软标签建模
- 一致性分布:
- 83.26% 的实例为一致同意(3–0)
- 16.74% 的实例为多数同意(2–1)
预期用途
直接用途
该数据集适用于以下领域的研究:
- 讽刺检测
- 比喻语言理解
- 情感和情绪分析
- 低资源自然语言处理
- 非洲语言建模
- 跨语言迁移学习
- 不确定性感知和分歧感知建模
适用于以下模型的基准测试:
- 机器学习模型
- 深度学习架构
- 基于 Transformer 的模型
- 大语言模型
超出范围的用途
该数据集不应用于:
- 监控或用户画像
数据集创建
创建动机
讽刺检测研究主要由英语和其他高资源语言主导。尽管约鲁巴语具有丰富的语言特征和广泛的使用基础,但此前缺乏公开可用的黄金标准讽刺数据集。Yor-Sarc 的创建旨在:
- 提供一个基于文化的基准
- 支持非洲自然语言处理研究
- 鼓励在声调语言中进行比喻语言建模
- 实现在低资源环境下对讽刺检测系统的稳健评估
数据来源与处理
- 数据来源: 约鲁巴语新闻平台、社交媒体平台(X, Facebook, Instagram, YouTube 字幕)以及众包贡献。
- 处理流程: 所有文本在标注前都经过清洗和标准化。具体包括网络爬取、手动收集和过滤、标准化正字法规范化、三位母语者独立标注、多数投票确定最终标签,并使用 Cohen’s κ 和 Fleiss’ κ 计算一致性指标。
标注过程
- 标注人员: 三位熟悉方言变体的、具备语言能力的约鲁巴语母语者。标注者独立工作并获得公平报酬。
- 标注过程: 采用二元讽刺标签,标注指南经过迭代细化,并进行统计一致性验证。
个人与敏感信息
数据集包含公开可用和自愿贡献的文本。已移除必要的个人身份信息,不包含敏感元数据。
偏见、风险与局限性
- 数据集规模相对较小(436个实例)
- 领域覆盖不全面
- 讽刺解释受文化理解影响
相关资源
- 论文 (arXiv): https://arxiv.org/abs/2602.18964
- ePrint: 2602.18964
- 官方 GitHub 仓库: https://github.com/toheebadura/yor-sarc
引用信息
如果使用 Yor-Sarc,请引用: bibtex @misc{jimoh2026yorsarcgoldstandarddatasetsarcasm, title={Yor-Sarc: A gold-standard dataset for sarcasm detection in a low-resource African language}, author={Toheeb Aduramomi Jimoh and Tabea De Wille and Nikola S. Nikolov}, year={2026}, eprint={2602.18964}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2602.18964} }



