遇见数据集

ProBel

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

ProBel 是一个双语(阿拉伯语和英语)的可解释宣传检测基准数据集。它包含来自新闻和社交媒体的句子和帖子,每条数据都标注了以下信息:二元宣传标签(是否存在宣传)、23 种细粒度宣传技术(映射到 6 种粗粒度类别:操纵性措辞、声誉、合理化、简化、呼吁、分散注意力)、技术标记的字符跨度(起始和结束位置),以及用输入语言编写的参考解释。数据集分为阿拉伯语和英语两个子集,每个子集都有训练集、验证集和测试集。阿拉伯语子集包含 18,453 条训练样本、1,318 条验证样本和 1,326 条测试样本;英语子集包含 20,077 条训练样本、2,567 条验证样本和 3,993 条测试样本。每条记录包含唯一标识符、文本、语言、分割、来源类型、来源数据集、二元标签、技术列表、粗粒度类别列表、跨度列表(每个跨度包含技术、文本、起始和结束位置)、解释、元数据(来源 URL 等)以及原始嵌套注释结构。数据的标签分布呈长尾特征,英语测试集中宣传样本占比 27.8%,阿拉伯语测试集中占比 61.3%。该数据集适用于文本分类(二元宣传检测)、序列标注(跨度识别)以及文本生成(解释生成)等任务。许可证为 CC BY-NC-SA 4.0,仅限非商业用途,需署名且以相同方式共享。

ProBel is a bilingual (Arabic and English) interpretable propaganda detection benchmark dataset. It contains sentences and posts from news and social media, each annotated with: binary propaganda label (presence of propaganda), 23 fine-grained propaganda techniques (mapped to 6 coarse-grained categories: Manipulative Wording, Reputation, Rationalization, Simplification, Appeal, Distraction), character spans of technique annotations (start and end positions), and reference explanations written in the input language. The dataset is divided into Arabic and English subsets, each with training, validation, and test splits. The Arabic subset contains 18,453 training samples, 1,318 validation samples, and 1,326 test samples; the English subset contains 20,077 training samples, 2,567 validation samples, and 3,993 test samples. Each record includes a unique identifier, text, language, split, source type, source dataset, binary label, list of techniques, list of coarse-grained categories, list of spans (each containing technique, text, start and end positions), explanation, metadata (source URL, etc.), and the original nested annotation structure. The label distribution shows a long-tail characteristic, with propaganda samples accounting for 27.8% in the English test set and 61.3% in the Arabic test set. The dataset is suitable for tasks such as text classification (binary propaganda detection), sequence labeling (span identification), and text generation (explanation generation). The license is CC BY-NC-SA 4.0, non-commercial use only, requiring attribution and share-alike.

创建时间:
2026-08-13
原始信息汇总

ProBel 数据集详情

数据集概述

ProBel 是一个用于可解释性宣传检测的双语基准数据集,涵盖阿拉伯语和英语的新闻句子及社交媒体帖子。每个样本都标注了二元宣传标签23种细粒度说服技巧(映射到6个粗粒度类别)、技巧标注的字符跨度以及输入语言对应的参考解释

数据集规模与划分

语言 训练集 验证集 测试集 测试集宣传占比
阿拉伯语 18,453 1,318 1,326 61.3%
英语 20,077 2,567 3,993 27.8%
  • 验证集对应dev文件
  • 英语训练集存在重复:20,077行中包含18,775条唯一文本
  • 阿拉伯语划分与PropXplain一致,保证与先前工作的可比性;英语语料大幅扩展并引入新的开发/测试划分

标注体系

6个粗粒度类别(遵循SemEval-2023说服技巧分类法):

  • Manipulative_Wording
  • Reputation
  • Justification
  • Simplification
  • Call
  • Distraction

细粒度技巧分布呈长尾分布,最常见的3种技巧覆盖了阿拉伯语94.8%和英语67.0%的宣传实例。

数据字段说明

字段 类型 含义
id str 源派生标识符
text str 句子/帖子内容
language, split str 语言(arabic/english)和划分(train/dev/test
source_type, source_dataset str 来源类型(news/tweet)及来源集合
binary bool 是否标注了至少一种技巧
techniques list[str] 细粒度技巧名称(23类标签体系)
coarse_categories list[str] 覆盖techniques的粗粒度类别
spans list[struct] 每个标注跨度的 {technique, text, start, end} 结构
explanation str 参考解释(使用输入语言)
metadata struct 来源信息(页面/推文ID、URL、日期)
annotations struct 原始嵌套布局中的相同标注
  • 细粒度与粗粒度标签均由跨度推导而来,各标注层级在结构上保持一致
  • 跨度偏移采用半开区间的码点位索引(text[start:end] 与跨度文本一致)
  • 跨度可能重叠,同一技巧可在同一句子中出现多次

数据来源

  • 阿拉伯语:来自ArPro/PropXplain的新闻段落和推文,由训练有素的标注者按23种技巧分类法标注,并经专家裁定
  • 英语:在PropXplain语料基础上扩展了97篇文章(来自42个来源的347篇文章),每篇文章由至少两位标注者标注并经过专家审核
  • 解释文本:使用OpenAI o1从金标签、技巧和跨度生成,经人工评估验证(一致性0.89-0.95)

文件结构与格式

  • label_taxonomy.json:23种技巧到6个粗粒度类别的映射
  • arabic/{train,dev,test}.jsonl:阿拉伯语数据
  • english/{train,dev,test}.jsonl:英语数据

UTF-8编码,每行一个JSON对象,所有划分采用相同模式。

许可证

采用CC BY-NC-SA 4.0许可:允许非商业用途的共享和改编,需标注引用(引用论文)并保持相同许可。底层源文本和资源保留其原有条款。

注意事项

数据包含宣传性及可能冒犯性的新闻和社交媒体内容。原始数据来源中少量阿拉伯语推文的跨度偏移因表情符号/规范化问题出现偏差,已通过确定性方法重新对齐至精确文本,未改动任何标签、技巧、粗粒度类别或解释。

搜集汇总
数据集介绍
ProBel 数据集图片
构建方式
ProBel数据集由卡塔尔计算研究所构建,旨在推动可解释的宣传检测研究。数据集涵盖阿拉伯语和英语两种语言,包含新闻句子和社交媒体帖子。每一条样本均经过专业标注,提供二元宣传标签、细粒度的23种说服技巧分类、对应的6个大类、字符级别的跨度标注以及输入语言的自然语言解释。标注过程结合了人工标注与专家审核,并利用OpenAI o1生成解释,通过人工评估验证其质量。数据集的构建充分考虑了标注的一致性和代表性,确保了不同语言和数据源之间的平衡。
特点
ProBel数据集具有多语言、多粒度标注的特点,支持文本分类、序列标注和生成式解释等多种任务。其独特的解释字段有助于模型输出的可解释性,而精细的技巧分类和跨度标注则为深入研究宣传策略提供了基础。数据集的规模适中,训练集约两万条,测试集包含不同比例的阳性样本,且阿拉伯语部分与PropXplain保持一致,便于与先前研究对比。此外,数据分布呈长尾形态,少数技巧占据主导,反映了真实场景中的宣传现象。
使用方法
使用ProBel数据集时,可通过HuggingFace的datasets库轻松加载,支持阿拉伯语和英语两种配置。数据集划分为训练、验证和测试三个部分,结构统一为JSON格式,包含文本、标签、跨度、解释及元数据。用户可根据需要选用顶层字段进行模型训练,或结合原始annotations结构进行更复杂的分析。该数据集适用于多任务学习、跨度检测、解释生成等场景,并提供了配套的代码和基准模型,便于研究者复现实验和评估性能。
背景与挑战
背景概述
ProBel数据集由卡塔尔计算研究所(QCRI)的研究人员于2026年创建,旨在推动可解释的宣传检测研究。该数据集涵盖阿拉伯语和英语的新闻及社交媒体文本,不仅标注了二元的宣传标签,还细化了23种说服技巧及其对应的6个粗粒度类别,并提供了字符级跨度和参考解释。其核心研究问题在于如何通过多任务学习实现宣传的细粒度识别与解释,从而提升模型的可信度和透明度。ProBel的发布为多语言宣传检测领域提供了首个兼具双语、多层级标注和解释的基准,对相关研究产生了显著影响,尤其在跨语言可迁移性方面。
当前挑战
该领域面临的挑战包括:宣传技术常以复杂、隐蔽的方式嵌入文本,且因语言和文化而异,使得自动检测难以统一;同时,每种宣传技巧的字符跨度标注需要精细的语义理解,对现有模型构成较大考验。构建过程中,ProBel团队需处理长尾分布问题(少数技巧占据多数样本),并克服跨语言标注一致性难题;此外,他们利用大型语言模型生成解释,并需确保解释与标签、跨度的高一致性(一致性达0.89-0.95),同时修正原有数据源中的字符偏移错误,且不改变原始标签,这一过程需要大量人工校验,确保数据质量与可复现性。
常用场景
经典使用场景
在信息战与舆论操纵日益复杂的数字时代,ProBel作为首个涵盖阿拉伯语与英语的双语可解释宣传检测基准,为细粒度宣传分析提供了统一范式。该数据集整合新闻语句与社交媒体帖子,每项样本均标注二元宣传标签、23种精细技巧及其映射的6个粗粒度类别,并辅以字符级跨度定位与跨语言参考解释。这一多层级、多语言的标注体系,使研究者在跨文化语境下开展宣传检测、技巧分类、跨度识别与解释生成等任务成为可能,尤其适用于训练与评估多任务联合模型,推动可解释人工智能在虚假信息治理领域的前沿探索。
衍生相关工作
ProBel的发布催生了若干衍生研究方向,包括但不限于:基于多任务学习的宣传检测统一模型(如随数据集发布的ProBel-MTL,联合建模二分类、多标签分类与跨度预测);跨语言零样本迁移研究,探索在单一语言训练的模型对另一语言的泛化能力;以及利用大型语言模型生成解释的消融研究,验证参考解释对模型性能与可解释性的增益。该基准的设计模式也为其他低资源语言的可解释虚假信息分析提供了可复制的范例,后续工作可能借鉴其层级化标签与解释联合标注流程,拓展至仇恨言论或深度伪造检测等其他操纵性内容领域,从而丰富计算社会科学与自然语言处理交叉方向的研究图谱。
数据集最近研究
最新研究方向
ProBel数据集的最新研究聚焦于构建一个双语(阿拉伯语与英语)可解释的 propaganda 检测基准,其核心创新在于将二元分类、23种细粒度说服技巧识别、字符级跨度标注及自然语言解释无缝整合,旨在推动细粒度与可解释的虚假信息分析。该基准的发布恰逢全球对社交媒体虚假宣传、选举干预及公共卫生信息误导的关切日益加深之际,其双语设计尤为凸显跨文化比较研究的价值。通过提供多层级标签一致性验证和人工核验的解释文本,ProBel不仅为模型评估提供了坚实基础,还促进了多任务学习与跨度识别等前沿技术的落地,对提升信息生态安全与社会韧性具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务