遇见数据集

StanceNakba 2026 dataset

收藏
arXiv2026-06-10 更新2026-06-12 收录
数据链接:
官方服务:

资源简介:

StanceNakba 2026数据集由卡塔尔西北大学与哈马德·本·哈利法大学联合构建,专为巴以冲突背景下的立场检测研究设计,包含2,606条经过标注的英文与阿拉伯文社交媒体帖子。该数据集内容涵盖两个子任务:子任务A包含1,401条英文帖子,通过梅尔沃特媒体平台采集并基于关键词查询进行平衡采样,每条数据均经过去除噪声字符、长度过滤及去重等预处理;子任务B则聚焦阿拉伯文帖子,针对“与以色列关系正常化”和“约旦难民问题”两个冲突相关主题进行标注。数据集通过系统化的数据收集、清洗与标注流程构建,旨在为政治话语分析与跨语言立场检测模型提供基准资源,推动冲突领域自然语言处理技术发展。

The StanceNakba 2026 dataset was jointly constructed by Northwestern University in Qatar and Hamad Bin Khalifa University, specifically designed for stance detection research in the context of the Israeli-Palestinian conflict. It comprises 2,606 annotated English and Arabic social media posts, covering two subtasks: Subtask A includes 1,401 English posts, collected via the Melwote Media Platform and balancedly sampled through keyword queries, with each data entry undergoing preprocessing steps such as noise character removal, length filtering and deduplication. Subtask B focuses on Arabic posts, annotated for two conflict-related topics: "normalization of relations with Israel" and "Jordanian refugee issue". Constructed via a systematic workflow of data collection, cleaning and annotation, this dataset aims to provide benchmark resources for political discourse analysis and cross-lingual stance detection models, and promote the development of natural language processing technologies in the conflict domain.

创建时间:
2026-06-10
搜集汇总
数据集介绍
StanceNakba 2026 dataset 数据集图片
构建方式
StanceNakba 2026数据集针对巴以冲突这一高度两极化的公共话语场景,系统性地构建了立场检测资源。数据集包含两个子任务:子任务A为英文社交媒体帖子,通过关键词检索(如“I stand with Palestine”)辅以多步清洗流程(去除标签泄漏词、URL、表情符号等),确保文本纯净且立场信号不被泄露,最终获得1,401条均衡标注的帖子,涵盖Pro-Palestine、Pro-Israel和Neutral三类。子任务B则选取MARASTA语料库中与冲突最相关的两个阿拉伯语议题(与以色列关系正常化、约旦难民问题),经两轮独立标注与第三方仲裁,得到1,205条涵盖Favor、Against和Neither立场的高质量样本。数据集严格划分为训练、开发和测试集,保持类别平衡。
使用方法
该数据集可通过共享任务的CodaBench平台获取,仅限非商业科研用途。使用者需提交访问请求并遵守平台服务条款,禁止去匿名化或用于监控等歧视性目的。在模型应用层面,建议采用微调后的阿拉伯语Transformer架构(如MARBERT、AraBERT、DeBERTa-v3)作为基线,并尝试交叉验证、集成学习或主题条件输入格式化等策略以提升跨主题泛化能力。评估指标以宏平均F1为核心,重点惩罚中性类别的性能缺陷。结果解读应谨慎,模型输出仅为基于有限文本的概率分类,不构成对用户真实政治信念的可靠推断,且不可推广至全体人口。
背景与挑战
背景概述
StanceNakba 2026数据集由西北大学卡塔尔分校与哈马德·本·哈利法大学的研究团队于2026年创建,旨在填补高度极化政治话语中立场检测研究的空白。该数据集聚焦巴以冲突相关的社交媒体讨论,包含2606条英文与阿拉伯文帖子,围绕两个核心子任务设计:子任务A针对英文帖子进行行为者级立场分类(亲巴勒斯坦、亲以色列或中立),子任务B面向阿拉伯文帖子进行跨主题立场检测(支持、反对或中立),涵盖与以色列正常化及约旦难民存在等敏感议题。作为Nakba-NLP 2026研讨会的一部分,该数据集为多语言、冲突驱动的立场分析提供了首个基准资源,推动了自然语言处理在政治话语分析中的应用,其影响力体现在吸引了多支团队参与,并催生了基于MARBERT、AraBERT等预训练模型的高性能系统。
当前挑战
该数据集面临多重挑战。在领域问题层面,高度极化的巴以冲突话语中,立场常通过隐性框架而非显性标记表达,使得中立类别的预测尤为困难,跨主题泛化能力不足成为核心瓶颈——模型在子任务B中面对训练与测试主题间的领域漂移时性能显著下降。在构建过程中,数据采集依赖特定关键词检索,可能导致样本偏倚;预处理时需剥离立场信号词以避免标签泄露,但又需保留语义完整性;跨语言与跨方言的标注一致性难以保障,阿拉伯语的多方言特性增加了标注难度,且情感强烈的冲突内容对标注者心理负担构成伦理考验。此外,类别平衡虽被刻意维持,但少数类别(如中立)的固有模糊性仍加剧了分类误差。
常用场景
经典使用场景
StanceNakba 2026数据集的核心经典使用场景在于对高度政治化、情感极化社会媒体语篇中的立场进行自动化建模。该数据集专为巴勒斯坦-以色列冲突相关讨论设计,涵盖英文与阿拉伯文双语社交媒体帖子,提供了两大核心任务:其一是行动者级立场检测,旨在判别作者整体政治倾向为亲巴勒斯坦、亲以色列或中立;其二是跨主题立场检测,要求系统针对阿语帖子就“与以色列关系正常化”及“约旦难民存在”两个具体争议话题,识别其支持、反对或中性立场。这一双框架设计使其成为研究极化话语中多层级立场推断的标志性资源。
解决学术问题
该数据集系统性地回应了立场检测领域一个长期未决的学术难题:在冲突驱动的多语言与跨主题语境下,如何同时捕获概括性政治立场与话题特异性立场。不同于以往英语中心或政治中性话题的基准资源,StanceNakba 2026填补了冲突相关、多语言极化话语标注的空白,使研究者能够深入探究一般政治取向与具体政策议题立场之间的映射关系,以及跨主题立场表征的可迁移性。其发布推动了阿拉伯语自然语言处理在敏感政治语境下的方法论进展,也为评估当代Transformer架构(如MARBERT、AraBERT、DeBERTa-v3)在高度不平衡与模糊中立类别上的鲁棒性提供了严苛测试平台。
实际应用
在实际应用中,StanceNakba 2026数据集所催生的立场检测模型可用于多个高影响力场景。在公共舆论监测领域,政府和智库可借助这些模型实时追踪社交媒体上关于冲突议题的舆论分布与态度演变,辅助外交政策评估与人道主义响应决策。新闻媒体机构可利用其识别新闻报道的叙事偏向,提升内容分析的客观性。此外,在舆情风险管理中,该技术可预警极端化言论的蔓延,支持构建更负责任的信息生态。对于阿拉伯世界特有的方言多样性场景,该数据集所驱动的跨方言立场识别能力,为区域性社会倾听平台提供了关键技术支撑。
数据集最近研究
最新研究方向
在当前高度两极化的社会媒体语境中,StanceNakba 2026数据集聚焦于巴勒斯坦-以色列冲突这一敏感议题,开创性地引入了行动者层级与跨话题两种立场检测子任务。前沿研究不仅探索了MARBERT、AraBERT及DeBERTa-v3等预训练Transformer模型在该领域的微调策略,还结合交叉验证、集成学习与基于自然语言推理的重新表述等先进技术,显著提升了立场分类的宏F1值。该数据集的价值尤为体现在其对跨话题泛化能力的深度检验,揭示了中性类别预测的固有挑战,为未来针对冲突领域、多语言及极化政治话语的细粒度立场分析奠定了关键基准。
相关研究论文
  • 1
    StanceNakba Shared Task: Actor and Topic-Aware Stance Detection in Public Discourse卡塔尔西北大学; 哈马德·本·哈利法大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务