遇见数据集

Ax-to-Grind Urdu

收藏
arXiv2024-03-21 更新2024-06-21 收录
官方服务:

资源简介:

Ax-to-Grind Urdu是首个大规模公开的乌尔都语假新闻检测数据集,由武汉大学网络空间安全学院创建。该数据集包含10,083条来自巴基斯坦和印度主流乌尔都语报纸和新闻网站的新闻,涵盖15个不同领域,从2017年至2023年。数据集的创建过程包括从网站抓取新闻,并通过专家记者进行手动标注。该数据集主要用于解决乌尔都语假新闻检测问题,旨在通过提供丰富的多领域数据来提高检测算法的准确性和鲁棒性。

Ax-to-Grind Urdu is the first large-scale publicly available Urdu fake news detection dataset, developed by the School of Cyberspace Security, Wuhan University. This dataset comprises 10,083 news articles sourced from mainstream Urdu newspapers and news websites in Pakistan and India, spanning 15 distinct domains and covering the period from 2017 to 2023. The dataset construction process involves scraping news from websites and manual annotation by professional journalists. This dataset is primarily designed to tackle the problem of Urdu fake news detection, aiming to improve the accuracy and robustness of detection algorithms by providing rich multi-domain data.

创建时间:
2024-03-21
搜集汇总
数据集介绍
Ax-to-Grind Urdu 数据集图片
构建方式
Ax-to-Grind Urdu 数据集由研究者从巴基斯坦和印度主流的乌尔都语报纸及新闻频道网站中,收集了2017年至2023年间涵盖15个领域的10,083条新闻,其中虚假新闻与真实新闻各占约5,053条与5,030条,以保持类别平衡。真实新闻源自Jang、Dawn News Urdu、Geo Urdu等权威媒体,虚假新闻则通过专门网站(如vishvasnews.com)及众包方式获取。为确保原创性,数据集未包含任何从英语翻译至乌尔都语的新闻。所有新闻条目均由资深记者进行人工标注,并通过Cohen's Kappa系数(0.94)验证了标注一致性。数据经过预处理,包括去除英语停用词、URL、非字母数字字符,并执行句子分割、词干提取和分词,以提升模型处理效率。
特点
该数据集是乌尔都语虚假新闻检测领域首个大规模、公开可用的基准数据集,包含10,083条新闻,覆盖政治、健康、体育、科技、经济、宗教等15个领域,极大增强了词汇多样性与跨领域泛化能力。数据集具有高度平衡性(真实与虚假新闻比例接近1:1),并包含29,911个独特词汇,其中虚假新闻平均每条约117词,真实新闻约35词,反映了虚假新闻通常更长的文本特征。所有新闻均经过专家人工验证,确保了标签的可靠性。此外,数据集新闻来源涵盖印度与巴基斯坦两大乌尔都语使用国,使其能够反映不同社会文化背景下的虚假新闻传播模式。
使用方法
该数据集适用于乌尔都语虚假新闻检测任务,用户可从GitHub仓库(https://github.com/Sheetal83/Ax-to-Grind-Urdu-Dataset)公开获取。研究采用60:20:20的比例将数据划分为训练集、验证集和测试集。论文建议使用基于mBERT、XLNet和XLM-RoBERTa的集成模型(采用MV-V投票策略)进行基准测试,该模型在测试集上取得了0.956的准确率和0.924的F1分数。用户可直接使用预训练模型进行微调,或结合TF-IDF等特征提取方法搭配传统机器学习模型(如KNN、SVM)进行实验。数据预处理步骤(如停用词去除、分词)已在论文中详细说明,便于复现。
背景与挑战
背景概述
在信息数字化浪潮席卷全球的背景下,虚假新闻的泛滥已成为威胁社会信任与公共安全的严峻挑战。尽管基于事实核查的虚假新闻检测在英语等资源丰富语言中取得显著进展,但乌尔都语等区域语言因缺乏大规模标注语料库与自然语言处理工具,相关研究仍处于起步阶段。为弥合这一鸿沟,武汉大学网络空间安全学院的Sheetal Harris、Jinshuo Liu、Hassan Jalil Hadi与Yue Cao于2023年创建了“Ax-to-Grind Urdu”数据集。该数据集包含10,083条来自巴基斯坦与印度主流乌尔都语报纸及新闻网站的真实与虚假新闻,覆盖政治、健康、体育等15个领域,时间跨度从2017年至2023年。由专业记者手动标注,Cohen’s Kappa系数高达0.94,确保了标注的可靠性。作为首个大规模公开可用的乌尔都语虚假新闻检测基准数据集,它为区域语言虚假信息治理提供了关键资源,推动了多语言自然语言处理技术的发展。
当前挑战
该数据集所解决的领域问题核心在于乌尔都语虚假新闻检测的资源匮乏困境:现有数据集规模有限(如Bend the Truth仅含900条样本)、领域单一(多为5个领域)、未公开或依赖机器翻译,难以支撑鲁棒模型的训练与泛化。构建过程中面临多重挑战:首先,乌尔都语网络资源稀缺,需从21个主流新闻网站及众包渠道手工采集数据,并确保新闻来源的真实性与原创性,避免引入翻译文本;其次,标注工作依赖资深记者,需跨语言、跨文化背景(印度与巴基斯坦)进行一致性校验,以应对政治、宗教等敏感话题带来的主观偏差;此外,数据预处理需处理乌尔都语特有的停用词、词干提取与句子分割规则,清洗噪声信息,最终在保持类别平衡(5,053条虚假与5,030条真实)的基础上,实现了29,911个独特词汇的词汇多样性,为模型评估提供了坚实基础。
常用场景
经典使用场景
Ax-to-Grind Urdu数据集作为乌尔都语假新闻检测领域的首个大规模基准语料库,其经典使用场景聚焦于多领域新闻文本的真伪二元分类任务。该数据集涵盖政治、健康、体育、娱乐、科技等15个领域,包含10,083条经专业记者人工标注的新闻条目,确保了标签的可靠性与语料的多样性。研究者通常利用该数据集训练和评估基于Transformer的预训练语言模型(如mBERT、XLNet、XLM-RoBERTa)及其集成方法,以验证模型在低资源语言上的泛化能力与鲁棒性。此外,该数据集支持跨领域与多领域新闻的传播模式分析,为乌尔都语自然语言处理研究提供了标准化的测试基准。
衍生相关工作
基于Ax-to-Grind Urdu数据集,学术界已衍生出多项具有影响力的后续工作。在模型层面,研究者探索了更高效的集成策略,如结合字符级CNN与RoBERTa的混合架构,以及基于对比学习的少样本检测方法,进一步提升了乌尔都语假新闻检测的精度。在语料扩展方面,该数据集启发了面向其他南亚语言(如印地语、旁遮普语)的假新闻语料库构建,推动了区域语言虚假信息研究的协同发展。此外,该数据集还被用于验证跨语言迁移学习的有效性,例如将多语言预训练模型在英语假新闻数据上微调后,迁移至乌尔都语场景,显著降低了标注成本。这些衍生工作共同巩固了Ax-to-Grind Urdu作为低资源语言假新闻检测领域里程碑式基准的地位。
数据集最近研究
最新研究方向
在虚假新闻检测领域,针对资源匮乏语言的研究正逐渐成为前沿热点,尤其是在乌尔都语这一拥有超过2.3亿使用者的语言中。Ax-to-Grind Urdu数据集的提出,标志着该领域迈出了关键性的一步,它不仅是目前规模最大的公开乌尔都语虚假新闻基准数据集,更通过涵盖2017至2023年间来自印度和巴基斯坦主流新闻源的15个领域、共计10,083条真实与虚假新闻,有效突破了以往数据集规模小、领域单一、未公开或依赖机器翻译的瓶颈。该研究结合了mBERT、XLNet和XLM-RoBERTa三种多语言预训练模型的集成方法,在F1分数(0.924)和准确率(0.956)等核心指标上显著超越了现有模型,为低资源语言的虚假信息治理提供了可靠的技术路径与评估标准,对维护地缘政治敏感区域的信息生态安全具有深远意义。
相关研究论文
  • 1
    Ax-to-Grind Urdu: Benchmark Dataset for Urdu Fake News Detection武汉大学网络空间安全学院 · 2024年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务