遇见数据集

The Spanish Fake News Corpus

收藏
github2024-01-29 更新2024-05-31 收录
官方服务:

资源简介:

西班牙虚假新闻语料库包含971篇新闻,分为491篇真实新闻和480篇虚假新闻。该语料库涵盖了科学、体育、经济、教育、娱乐、政治、健康、安全和社 会等9个不同主题。

The Spanish Fake News Corpus comprises 971 news articles, categorized into 491 authentic news pieces and 480 fake news pieces. This corpus spans across nine distinct themes including science, sports, economy, education, entertainment, politics, health, security, and society.

创建时间:
2018-10-15
原始信息汇总

数据集概述

数据集名称

  • The Spanish Fake News Corpus Version 2.0

数据集描述

  • 时间范围:数据收集自2020年11月至2021年3月。
  • 内容:包含572对虚假和真实新闻出版物,涉及多个事件,主要使用两种类型的网络来源:1) 报纸和媒体公司网站,2) 事实核查网站。
  • 分类:数据集中的新闻被标记为真实或虚假,测试集平衡了这两个类别。
  • 主题:涵盖科学、体育、政治、社会、COVID-19、环境和国际等主题。
  • 特殊内容:包括90个社交媒体帖子作为虚假新闻(占总数的15.73%),主要来自Facebook和WhatsApp。

数据集结构

  • 文件:主要集中在test.xlsx文件中。
  • 列描述
    • Id:为每个实例分配一个标识符。
    • Category:指示新闻的类别(真实或虚假)。
    • Topic:指示与新闻相关的主题。
    • Source:指示来源的名称。
    • Headline:包含新闻标题。
    • Text:包含新闻的原始文本。
    • Link:包含来源的URL。

引用信息

  • 若使用该数据集,请引用以下文章:
    1. Gómez-Adorno, H., Posadas-Durán, J. P., Enguix, G. B., & Capetillo, C. P. (2021). Overview of FakeDeS at IberLEF 2021: Fake News Detection in Spanish Shared Task. Procesamiento del Lenguaje Natural, 67, 223-231.
    2. Aragón, M. E., Jarquín, H., Gómez, M. M. Y., Escalante, H. J., Villaseñor-Pineda, L., Gómez-Adorno, H., ... & Posadas-Durán, J. P. (2020, September). Overview of mex-a3t at iberlef 2020: Fake news and aggressiveness analysis in mexican spanish. In Notebook Papers of 2nd SEPLN Workshop on Iberian Languages Evaluation Forum (IberLEF), Malaga, Spain.
    3. Posadas-Durán, J. P., Gómez-Adorno, H., Sidorov, G., & Escobar, J. J. M. (2019). Detection of fake news in a new corpus for the Spanish language. Journal of Intelligent & Fuzzy Systems, 36(5), 4869-4876.

使用场景

  • 该数据集用于**Fake News Detection in Spanish (FakeDeS)**共享任务,在2021年的IberLEF会议上。
搜集汇总
数据集介绍
The Spanish Fake News Corpus 数据集图片
构建方式
The Spanish Fake News Corpus Version 2.0的构建过程主要依赖于从2020年11月至2021年3月期间收集的西班牙语新闻数据。数据来源包括报纸和媒体公司网站以及事实核查网站,特别是遵循国际事实核查网络(IFCN)推荐的网站。数据集的构建遵循了严格的准则,即只有当选定的事实核查网站确认某条新闻为假新闻时,才将其纳入数据集,并同时收录其对应的真实新闻。此外,数据集还包含了来自社交媒体平台的90条假新闻,主要来源于Facebook和WhatsApp。
特点
该数据集包含了572条新闻实例,涵盖了科学、体育、政治、社会、COVID-19、环境和国际等多个主题。数据集的特点在于其平衡性,真实新闻和假新闻的数量相等。此外,数据集不仅包含了新闻文章,还首次引入了社交媒体帖子作为假新闻的一部分,反映了现代信息传播的多样性。数据集中还包含了来自不同西班牙语国家的新闻,展示了西班牙语的语言变体。
使用方法
The Spanish Fake News Corpus Version 2.0的使用方法较为直观,数据集以Excel文件形式提供,包含Id、Category、Topic、Source、Headline、Text和Link等列。用户可以通过这些列信息进行数据分析和模型训练。数据集特别适用于西班牙语假新闻检测任务,用户可以根据新闻的类别和主题进行分类研究,或利用文本内容进行自然语言处理模型的训练和评估。
背景与挑战
背景概述
西班牙假新闻语料库(The Spanish Fake News Corpus)由墨西哥国立自治大学(UNAM)和墨西哥国立理工学院(IPN)的研究团队于2018年首次创建,并于2021年发布了2.0版本。该语料库旨在为西班牙语假新闻检测提供高质量的数据支持,涵盖了科学、体育、政治、社会、COVID-19、环境和国际等多个主题。语料库的构建基于从新闻媒体网站和事实核查网站收集的真实与虚假新闻对,并通过国际事实核查网络(IFCN)的推荐标准进行筛选。该语料库在IberLEF 2021会议中的FakeDeS任务中被广泛应用,推动了西班牙语假新闻检测领域的研究进展。
当前挑战
西班牙假新闻语料库在构建和应用过程中面临多重挑战。首先,假新闻检测本身具有复杂性,尤其是在多语言和多文化背景下,西班牙语的多样性和地域差异增加了模型训练的难度。其次,语料库的构建依赖于事实核查网站和新闻媒体的可信度,如何确保数据来源的权威性和准确性是一个关键问题。此外,社交媒体上的虚假信息传播速度快、形式多样,如何有效捕捉并整合这些信息也是构建过程中的一大挑战。最后,语料库的规模相对较小,如何在有限数据下提升模型的泛化能力仍需进一步探索。
常用场景
经典使用场景
在自然语言处理领域,The Spanish Fake News Corpus被广泛用于西班牙语假新闻检测的研究与开发。该数据集通过提供真实与虚假新闻的配对,为研究者提供了一个标准化的基准,用于训练和评估假新闻检测模型。特别是在IberLEF 2021的FakeDeS共享任务中,该数据集被用于评估不同算法在西班牙语环境下的假新闻检测能力。
衍生相关工作
基于The Spanish Fake News Corpus,研究者们开发了多种假新闻检测模型和算法。例如,Gómez-Adorno等人提出了一种基于深度学习的假新闻检测方法,该方法在IberLEF 2021的FakeDeS任务中取得了优异的成绩。此外,该数据集还催生了一系列关于西班牙语假新闻检测的研究论文,推动了该领域的学术进展。
数据集最近研究
最新研究方向
在西班牙语假新闻检测领域,The Spanish Fake News Corpus的最新研究方向聚焦于多源数据融合与跨语言模型的应用。随着社交媒体平台的广泛使用,假新闻的传播速度和范围显著增加,尤其是在COVID-19等全球性事件中,假新闻对社会的影响尤为突出。该数据集通过整合来自多个西班牙语国家的新闻来源,涵盖了科学、体育、政治、社会、COVID-19、环境和国际等多个主题,为研究者提供了丰富的语料资源。最新的研究趋势包括利用深度学习模型进行假新闻的自动检测,以及探索跨语言模型的泛化能力,以应对不同西班牙语变体的挑战。此外,该数据集在IberLEF 2021的FakeDeS任务中得到了广泛应用,推动了西班牙语假新闻检测技术的发展,为全球假新闻治理提供了重要的技术支持和数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务