遇见数据集

FakeCovid

收藏
arXiv2020-06-20 更新2024-06-21 收录
官方服务:

资源简介:

FakeCovid是一个多语言跨领域的事实核查新闻数据集,专门针对COVID-19,由德国的杜伊斯堡-埃森大学和班贝格大学创建。该数据集包含5182篇文章,覆盖105个国家的40种语言,主要从92个不同的核查网站收集。数据集内容涉及COVID-19的多个方面,如起源、国际反应等,通过手动标注分为11个类别。创建过程中,研究者从Poynter和Snopes获取参考链接,并手动收集和标注文章。该数据集主要用于自动检测假新闻,帮助解决疫情期间的信息真实性问题。

FakeCovid is a multilingual, cross-domain fact-checking news dataset dedicated to COVID-19, created by the University of Duisburg-Essen and the University of Bamberg in Germany. This dataset contains 5,182 articles covering 40 languages from 105 countries, and was primarily collected from 92 distinct fact-checking websites. The content of the dataset covers multiple aspects of COVID-19, such as its origins and international responses, and is manually annotated into 11 categories. During its creation, researchers obtained reference links from Poynter and Snopes, and manually collected and annotated the articles. This dataset is mainly used for automatic fake news detection to help address the issue of information authenticity during the COVID-19 pandemic.

创建时间:
2020-06-20
搜集汇总
数据集介绍
构建方式
在新冠疫情催生的“信息疫情”背景下,FakeCovid数据集应运而生,旨在为多语言、跨领域的虚假新闻检测提供可靠资源。该数据集以Poynter与Snopes两大事实核查平台为桥梁,每周定期抓取其收录的已核查新闻链接,进而利用Beautiful Soup等工具爬取原始核查网站中的文本内容、发布日期、来源国别及社交媒体嵌入链接等元数据。数据收集时间跨度为2020年1月4日至5月15日,最终汇聚了来自105个国家、92个不同核查机构的5182篇新闻文章,覆盖40种语言。为提升数据质量,研究者对失效链接、缺失标题及重复条目进行了人工清洗与校正。
特点
FakeCovid数据集的核心特色在于其多语言与跨领域的双重属性,突破了以往事实核查语料库多局限于单一语言和少数来源的瓶颈。数据集包含23种事实核查类别,如“虚假”、“误导”、“阴谋论”等,均由各核查机构原始标注。此外,研究团队对其中1951篇英语、印地语和德语文章进行了细粒度的人工主题标注,划分出“起源与传播”、“预防与治疗”、“国际响应”等11个主题类别,标注者间一致性高达91%至96%。数据中还记录了Twitter、Facebook、YouTube等社交媒体的嵌入链接,为研究虚假信息的跨平台传播提供了独特视角。
使用方法
FakeCovid数据集为虚假新闻检测研究提供了灵活的应用途径。研究者可直接利用其丰富的文本内容与多元标注进行有监督的机器学习建模,例如论文中采用BERT模型进行二分类(虚假类与其他类)实验,取得了0.76的F1分数。此外,数据集的多语言特性支持跨语言迁移学习与零样本分类研究,而11个主题类别则可用于细粒度的虚假信息主题识别任务。社交媒体验证链接的存在使得联合分析新闻内容与其在社交平台上的传播模式成为可能。该数据集以开源形式托管于GitHub,便于学术界直接下载与复现。
背景与挑战
背景概述
在新型冠状病毒肺炎(COVID-19)全球大流行的背景下,世界卫生组织提出的“信息疫情”(infodemic)概念揭示了虚假信息与病毒同步扩散的严峻现实。为应对这一挑战,Gautam Kishore Shahi与Durgesh Nandini于2020年创建了FakeCovid数据集,该数据集由德国杜伊斯堡-埃森大学和班贝格大学的研究人员主导,旨在填补多语言、跨领域虚假新闻检测语料库的空白。FakeCovid收录了2020年1月4日至5月15日期间来自92个事实核查网站、覆盖105个国家及40种语言的5182篇已核查新闻,并手动标注为11个细分类别,为全球范围内的COVID-19虚假信息研究提供了首个跨语言、多源头的基准资源,显著推动了自动虚假新闻检测领域的发展。
当前挑战
FakeCovid数据集面临的核心挑战包括:其一,所解决的领域问题——COVID-19虚假新闻检测的复杂性,在于虚假信息主题广泛(如病毒起源、治疗阴谋论)、传播速度快且语言多样,现有单语或单领域模型难以泛化,亟需多语言跨域语料支持;其二,构建过程中的困难——数据采集需从Poynter和Snopes等参考源爬取92个不同事实核查网站的链接,面临URL失效、重复文章及缺失标题等数据质量问题;人工标注仅覆盖英语、印地语和德语三种语言,受限于多语言标注者的匮乏,且不同网站的分类体系(共86种原始类别)需统一合并为23类,增加了标注一致性的维护难度。
常用场景
经典使用场景
在信息疫情与新冠疫情交织的背景下,FakeCovid数据集为多语言、跨领域的虚假新闻检测提供了宝贵的基准资源。其经典使用场景聚焦于构建和评估自动化的虚假信息分类器,研究者可利用该数据集训练模型,以区分关于COVID-19的虚假声明与其他事实核查类别。数据集涵盖40种语言、105个国家的5182篇人工标注文章,并细分为11个主题类别,如起源与传播、预防与治疗、阴谋论等,从而支持细粒度的虚假新闻识别任务。这一资源尤其适合在低资源语言环境下测试迁移学习或跨语言模型的泛化能力,成为疫情期间事实核查研究的标准测试平台。
衍生相关工作
FakeCovid数据集催生了一系列具有影响力的衍生研究。例如,Shahi等人基于该数据集扩展了Twitter上的COVID-19虚假信息传播分析,揭示了谣言在社交网络中的级联模式。另有工作利用该数据集构建知识图谱,将事实核查文章与实体关系链接,以支持复杂查询的自动应答。在方法层面,研究者基于FakeCovid开发了多任务学习框架,同时预测声明真假与主题类别,提升了分类的语义一致性。此外,该数据集被用于评估预训练语言模型(如BERT)在多语言虚假新闻检测中的零样本迁移能力,推动了跨语言事实核查技术的进步。这些工作共同构建了一个从数据采集到模型部署的完整研究链条,深化了对信息疫情的理解与应对。
数据集最近研究
最新研究方向
在当前全球信息生态环境中,新冠疫情催生的“信息疫情”成为研究焦点。FakeCovid数据集作为首个多语言跨领域的新冠事实核查新闻语料库,涵盖了来自105个国家、40种语言的5182篇经过人工标注的核查文章,并细分为11个类别。该数据集的前沿研究方向聚焦于利用深度学习与自然语言处理技术构建自动化的假新闻检测系统,尤其关注多语言环境下的跨域泛化能力。其发布恰逢全球对虚假信息治理需求激增之际,不仅为应对疫情期间的谣言传播提供了基准测试平台,更推动了可解释性、低资源语言适应性及社交媒体传播链分析等关键议题的突破,对构建健康、韧性的数字公共空间具有深远意义。
相关研究论文
  • 1
    FakeCovid -- A Multilingual Cross-domain Fact Check News Dataset for COVID-19杜伊斯堡-埃森大学, 德国1, 班贝格大学, 德国2 · 2020年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务