遇见数据集

laugustyniak/political-advertising-pl

收藏
Hugging Face2023-03-29 更新2024-03-04 收录
官方服务:

资源简介:

Polish-Political-Advertising数据集是第一个公开的用于检测波兰语政治广告特定文本块和类别的数据集。它包含1,705条人工标注的推文,标注了九个类别,这些类别构成了波兰选举法下的竞选活动。数据集的创建者通过雇佣注释者进行标注,并达到了0.65的注释者间一致性(Cohens kappa分数)。数据集的任务类别为标记分类,具体任务包括命名实体识别和词性标注。数据集的输入是令牌序列,输出是标签序列,评估指标为F1分数(seqeval)。数据集分为训练集、测试集和验证集,分别包含1020、341和340条推文。数据集的类别分布也提供了详细信息。

The Polish-Political-Advertising dataset is the first publicly available dataset for detecting specific text segments and categories of Polish-language political advertisements. It contains 1,705 manually annotated tweets labeled with nine categories that correspond to campaign activities stipulated under Polish election law. The dataset's creators hired annotators to perform the labeling work, achieving an inter-annotator agreement score of 0.65 (Cohen's kappa). The task type of this dataset is token classification, with specific subtasks including named entity recognition (NER) and part-of-speech (POS) tagging. The input of the dataset is token sequences, while the output is label sequences, and the evaluation metric is the F1 score based on seqeval. The dataset is split into training, test, and validation sets, which contain 1,020, 341, and 340 tweets respectively. Detailed information on the category distribution of the dataset is also provided.

提供机构:
laugustyniak
原始信息汇总

Polish-Political-Advertising 数据集概述

基本信息

  • 数据集名称: Polish-Political-Advertising
  • 语言: 波兰语
  • 许可: 其他
  • 多语言性: 单语种
  • 数据集大小: 10 < n < 10K
  • 任务类别:
    • 令牌分类
    • 命名实体识别
    • 词性标注
  • 数据集别名: Polish-Political-Advertising

数据集描述

政治广告是政治竞选活动中的基本形式,受到各种社会要求的影响。该数据集是首个公开的用于检测波兰语中特定文本块和政治广告类别的数据集。它包含1,705条人工标注的推文,标记了九个类别,这些类别构成了波兰选举法下的竞选活动。

任务描述

  • 输入: 令牌序列(tokens 列)
  • 输出: 标签序列(tags* 列)
  • 领域: 政治
  • 评估指标: F1-Score (seqeval)

数据分割

子集 数量
训练集 1020
测试集 341
验证集 340

类别分布

类别 训练集 验证集 测试集
B-HEALHCARE 0.237 0.226 0.233
B-WELFARE 0.210 0.232 0.183
B-SOCIETY 0.156 0.153 0.149
B-POLITICAL_AND_LEGAL_SYSTEM 0.137 0.143 0.149
B-INFRASTRUCTURE_AND_ENVIROMENT 0.110 0.104 0.133
B-EDUCATION 0.062 0.060 0.080
B-FOREIGN_POLICY 0.040 0.039 0.028
B-IMMIGRATION 0.028 0.017 0.018
B-DEFENSE_AND_SECURITY 0.020 0.025 0.028

许可

Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0)

搜集汇总
数据集介绍
laugustyniak/political-advertising-pl 数据集图片
构建方式
在政治传播研究中,竞选广告作为社会诉求的载体,其内容分析对理解选举动态至关重要。该数据集聚焦波兰语政治广告的文本片段识别与类别划分,由1,705条经人工标注的推文构成,涵盖波兰选举法下九类竞选范畴。标注流程采用双重编码策略,两位标注员独立完成初始标注,其Cohen's kappa系数达0.65,随后由第三位标注员裁定分歧,从而提升标注的一致性与复杂性。数据集划分为训练集(1,020条)、测试集(341条)与验证集(340条),类别分布涵盖医疗、福利、社会、政治法律体系、基础设施与环境、教育、外交政策、移民及国防安全等领域。
使用方法
数据集以token-classification任务形式呈现,输入为分词后的推文序列,输出为对应的类别标签。研究者可直接利用HuggingFace平台加载数据,采用seqeval评估指标衡量模型在F1分数上的表现。典型应用场景包括训练基于Transformer的序列标注模型(如BERT、RoBERTa),以检测推文中与福利、医疗等相关的政治广告片段。由于数据采用CC BY-NC-SA 4.0许可协议,用户需在非商业用途下遵守署名与共享要求。建议结合波兰语预训练语言模型(如HerBERT)进行微调,以适配目标语言的形态学特征。
背景与挑战
背景概述
在政治传播与选举研究领域,社交媒体上的政治广告已成为候选人竞选活动的核心载体,其内容分析对理解选举策略、公众舆论及法律合规性至关重要。2020年,由Lukasz Augustyniak、Krzysztof Rajda、Tomasz Kajdanowicz及Michał Bernaczyk等研究人员组成的团队,针对波兰2020年总统选举,创建了首个公开可用的波兰语政治广告数据集。该数据集包含1,705条经过人工标注的推文,覆盖九类波兰选举法界定的竞选主题,如医疗卫生、社会福利、基础设施等,旨在推动自然语言处理技术在政治文本细粒度识别与分类中的研究。该工作发表于ACL WiNLP 2020,后亦被纳入NeurIPS 2022的LEPISZCZE波兰语综合基准,显著提升了该领域在低资源语言中的研究深度与可复现性。
当前挑战
该数据集所面临的挑战首先体现在领域问题的复杂性上:政治广告文本常隐含微妙修辞、隐喻及文化特定表达,使得从简短推文中准确识别多类别竞选主题(如区分“社会福利”与“医疗卫生”相关表述)成为一项高难度序列标注任务。其次,构建过程中,标注者间的一致性仅达到0.65的Cohen's kappa系数,反映出政治语料标注的主观性与歧义性;为此,研究团队引入第三位标注者以解决分歧,但该过程仍无法完全消除标签噪声。此外,数据集规模较小(约1,700条),类别分布不均衡(如“国防与安全”类仅占2%),可能限制模型泛化能力及对长尾主题的鲁棒性,进一步加剧了在真实场景中部署时的可靠性挑战。
常用场景
经典使用场景
在政治传播与计算社会科学的交叉领域中,Polish-Political-Advertising数据集作为首个面向波兰语政治广告文本的细粒度标注资源,其经典使用场景聚焦于命名实体识别与序列标注任务。研究者可基于该数据集的1705条人工标注推文,针对九类波兰选举法规定的竞选主题(如医疗、福利、基础设施等)进行文本片段检测与分类,从而揭示政治话语在社交媒体上的分布规律与修辞策略。
解决学术问题
该数据集有效回应了非英语环境下政治广告自动检测的学术空白,解决了波兰语政治文本中缺乏高质量标注语料的关键瓶颈。通过提供0.65的Cohen's kappa一致性评分与多轮标注修正机制,它支撑了跨语言政治信息抽取方法的可迁移性研究,并为探索选举宣传中的议题框架、情感倾向与语言操纵模式提供了可复现的基准,推动了计算政治学与自然语言处理的深度融合。
实际应用
在实际应用层面,该数据集赋能了社交媒体平台的政治内容审核系统,使其能够自动识别并标注候选人在竞选期间发布的广告性推文,辅助监管机构监测选举公平性。同时,它被整合进波兰语自然语言处理工具链,服务于新闻聚合平台的议题聚类分析、舆情监测系统的实时预警,以及政治学研究中关于选民注意力分配与政策议题优先级的大规模量化评估。
数据集最近研究
最新研究方向
在当前全球政治传播日益数字化与碎片化的背景下,波兰语政治广告数据集(Polish-Political-Advertising)的发布恰逢其时,为计算社会科学与自然语言处理的交叉领域注入了新的活力。该数据集聚焦于2020年波兰总统选举期间社交媒体上的竞选文本,通过人工精细标注的1705条推文,首次系统性地定义了九类符合波兰选举法的政治宣传语料,涵盖医疗、福利、社会、法律体系、基础设施等关键议题。其前沿研究方向不仅在于推动多标签序列标注与命名实体识别在低资源语言政治语料中的性能突破,更在于为选举诚信监测、虚假信息溯源及跨文化政治修辞分析提供了可复现的基准。该工作已被NeurIPS 2022数据集与基准轨道收录,并成为LEPISZCZE波兰语综合NLP基准的重要组成部分,预示着政治广告自动检测将从实验性探索迈向标准化评估,对保障民主选举透明度具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务