遇见数据集

awesome-fake-news-datasets

收藏
github2026-05-10 更新2026-06-04 收录
官方服务:

资源简介:

这是一个关于社交媒体虚假新闻检测和分析的数据集精选合集,涵盖了图像-文本多源分类、来源-回复传播图分类、社交上下文虚假新闻检测、虚假视频分类和外部证据事实核查等多个主题领域,收录了如PHEME、Weibo、Twitter15/16、Politifact、Gossipcop等数据集资源,以列表形式组织并提供链接。

This is a curated collection of datasets for social media fake news detection and analysis, covering multiple thematic domains including image-text multimodal classification, source-reply propagation graph classification, social context-aware fake news detection, fake video classification, and fact-checking with external evidence. It includes widely used dataset resources such as PHEME, Weibo, Twitter15/16, Politifact, and Gossipcop, and is organized in list format with associated links provided.

创建时间:
2022-09-09
原始信息汇总

数据集详情概述

该页面整理了一份用于社交媒体虚假新闻/谣言检测与分析的数据集清单,按任务类型划分为以下类别:

图文多模态源分类

  • Image Verification Corpus:图像验证语料库,用于多模态虚假信息检测。
    • 来源:https://github.com/MKLab-ITI/image-verification-corpus
  • Weibo Dataset:微博数据集,侧重于多模态虚假新闻分类。
    • 来源:https://github.com/yaqingwang/EANN-KDD18

源-回复传播图分类

  • PHEME Dataset:基于传播图结构进行真实性分类的数据集。
    • 来源:https://github.com/kochkinaelena/Multitask4Veracity
  • Weibo Dataset:中文微博谣言数据集,适用于传播图分析。
    • 来源:https://github.com/thunlp/Chinese_Rumor_Dataset
  • Cantonese Rumor Dataset:粤语谣言数据集,聚焦粤语社交媒体内容。
    • 来源:https://github.com/cxyccc/CR-Dataset
  • RumorEval 2019:谣言评估数据集(2019版),支持传播路径分析。
    • 来源:https://github.com/kochkinaelena/RumourEval2019
  • Twitter15 and Twitter16:Twitter数据集(2015/2016),适用于递归神经网络验证。
    • 来源:https://github.com/majingCUHK/Rumor_RvNN

基于社交上下文的虚假新闻检测

  • Politifact:结合社交上下文(如用户、传播链)的虚假新闻数据集。
    • 来源:https://github.com/KaiDMML/FakeNewsNet
  • Gossipcop:基于八卦媒体内容的社交上下文虚假新闻数据集。
    • 来源:https://github.com/KaiDMML/FakeNewsNet

虚假视频分类

  • Fake Video Corpus:虚假视频检测语料库。
    • 来源:https://github.com/MKLab-ITI/fake-video-corpus
  • YouTubeAudit Dataset:YouTube审核数据集,用于视频真实性分析。
    • 来源:https://github.com/social-comp/YouTubeAudit-data

基于外部证据的事实核查

  • Politifact:利用外部证据进行事实核查的数据集。
    • 来源:https://github.com/Nicozwy/CofCED
  • Snopes:基于Snopes核实结果的外部证据数据集。
    • 来源:https://github.com/Nicozwy/CofCED
  • PHEME PLUS:PHEME增强版,整合外部证据用于细粒度真实性判断。
    • 来源:https://github.com/JohnNLP/PhemePlus
搜集汇总
数据集介绍
awesome-fake-news-datasets 数据集图片
构建方式
该数据集集合以社交媒体虚假新闻检测为核心,系统性地整合了多源、多模态的数据资源。构建方式上,通过从公开研究项目中筛选并收录了涵盖图像-文本多模态、源-回复传播图、社交上下文、虚假视频分类及外部证据事实核查等五大类别的数据集。每一类别均基于其特有任务进行数据采集与标注,例如图像验证语料库源自新闻图片的真实性验证,而PHEME数据集则针对推特事件中的谣言传播结构进行标注。此外,通过链接导向GitHub仓库,确保了数据集的持续更新与社区协作。
特点
该集合的核心特征在于其多维度的覆盖与专业化分类。它不仅包含了用于多模态虚假新闻检测的图像-文本语料库(如Weibo Dataset),还提供了基于社交网络传播结构的图分类数据(如Twitter15和Twitter16),以及融合外部证据的事实核查数据集(如Politifact与Snopes)。这种结构化分类使得研究者能够针对不同检测任务(如传播路径分析、多模态融合、上下文验证)选取合适的数据源。同时,数据集均来自已发表的研究工作,具备可靠的标注质量与可复现性。
使用方法
使用方法上,用户可直接访问各数据集的GitHub页面获取原始数据与标注文件。例如,进行多模态检测时可选用Image Verification Corpus或EANN-KDD18中的Weibo Dataset;若需分析谣言传播图,则可下载PHEME或Twitter15/16数据集。部分数据集(如FakeNewsNet中的Politifact与Gossipcop)还提供了爬取脚本,便于用户基于社交平台实时更新数据。建议研究者根据任务类型(如分类、图神经网络或事实核查)选择对应类别,并遵循各仓库中的许可协议与引用规范。
背景与挑战
背景概述
在社交媒体信息爆炸式增长的背景下,虚假新闻的快速传播对公共信任与社会稳定构成了严峻挑战。为应对这一问题,研究者自2010年代起致力于构建大规模、多模态的虚假新闻检测数据集。该数据集集合由多个国际知名机构(如MKLab、清华大学、新加坡国立大学等)于2015年至2021年间陆续创建,涵盖图像-文本多模态、传播图结构、社会上下文及外部证据验证等核心研究问题。这些数据集不仅推动了虚假新闻检测领域的算法演进,还为跨语言、跨平台的谣言分析提供了基准资源,对社交媒体信息真实性评估的学术探索具有重要奠基意义。
当前挑战
当前该领域面临的核心挑战包括:首先,虚假新闻的语义伪装日益精细,单模态特征(如文本或图像)难以捕捉其欺骗性,需发展跨模态联合推理模型;其次,社交媒体中的传播图结构复杂且动态变化,现有数据集在时序标注与传播路径完整性上存在不足,限制了图神经网络方法的泛化能力;此外,数据集构建过程中面临标注一致性难题,不同标注者对虚假新闻的界定标准差异显著,且多语言数据源(如中文、粤语)的文化语境差异增加了标注难度;最后,外部证据的实时获取与可信度评估仍是瓶颈,现有事实核查数据集在时效性与覆盖广度上难以满足动态检测需求。
常用场景
经典使用场景
在社交媒体信息泛滥的时代,虚假新闻的传播对社会稳定与公众信任构成严峻挑战。awesome-fake-news-datasets 汇聚了多个经典数据集,覆盖图像-文本多模态分类、源-回复传播图分类、社交上下文分析及外部证据事实核查等场景。研究者可基于这些数据训练模型,以识别推文中的虚假信息,例如利用 Twitter15 和 Twitter16 数据集构建传播图特征,区分谣言与真实新闻。该数据集集合为跨平台、多语言的虚假新闻检测提供了统一基准,显著推动了信息验证技术的发展。
实际应用
实际应用中,该数据集集合赋能多类系统:社交媒体平台可部署基于传播图的实时谣言检测模块,例如利用 RumorEval 2019 数据优化预警机制;新闻机构借助 Fake Video Corpus 训练深度伪造视频鉴别工具,提升内容审核效率;事实核查组织则通过 CofCED 数据集中的外部证据链,自动化比对声明与权威来源的一致性。这些应用不仅降低了人工核查成本,还遏制了虚假信息的二次传播,尤其在政治选举和公共卫生事件中发挥了关键作用。
衍生相关工作
该数据集集合衍生出众多经典工作,例如基于 EANN(Event Adversarial Neural Networks)的 Weibo 多模态检测模型,通过对抗学习消除事件偏差;RvNN(Recursive Neural Networks)利用 Twitter15/16 的传播树结构实现谣言早期检测;CofCED 提出的跨模态对比学习框架在 Politifact 上达到领先性能。此外,PHEME PLUS 扩展了原始数据集,引入细粒度立场标注,催生了多任务谣言验证研究。这些工作共同构建了虚假新闻检测的理论体系,并持续推动领域向少样本和零样本场景演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务