遇见数据集

Multimodal Fake News Datasets

收藏
github2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

一个面向研究的多模态假新闻/虚假信息/谣言/误导信息/事实核查/脱离上下文/媒体操纵/AI生成新闻数据集的集合。

A research-oriented collection of multimodal datasets focusing on fake news, disinformation, rumors, misinformation, fact-checking, out-of-context content, media manipulation, and AI-generated news.

创建时间:
2026-08-30
原始信息汇总

多模态假新闻数据集集合

该仓库是一个面向研究的多模态假新闻/错误信息/谣言/虚假信息/事实核查/脱离语境/媒体篡改/AI生成新闻数据集的集合,汇总了论文、官方仓库、数据集访问链接以及结构化元数据(包括任务、模态、语言、领域、标签类型和数据来源),旨在促进**多模态假新闻检测(MFND/MMD)**及相关研究。


数据集概览

当前共收录 33个数据集/基准,分为 21个核心数据集12个紧密相关数据集

类别 数量 主要特点
核心数据集 21 直接支持假新闻、错误信息、谣言、虚假信息、细粒度归因或短视频假新闻检测
紧密相关数据集 12 面向相邻任务,如脱离语境检测、事实核查、媒体篡改定位、AI生成内容检测

核心多模态假新闻数据集

下表收录了直接服务于假新闻/错误信息/谣言/虚假信息检测的核心数据集(摘要):

数据集 年份 语言 主要场景 模态 任务/标签 规模
DeceptionDecoded 2026 英语 创作者意图/欺骗意图 文本+图像+参考文章 意图中心多任务/误导意图检测 12,000
DriftBench 2026 英语 GenAI鲁棒性 文本+图像+外部证据 真实性验证+6类多样化分类 16,000
FakeVE 2026 英语 视频假新闻 视频+音频+文本 可解释假新闻视频检测 2,672
FineFake 2026 英语 细粒度/多领域 文本+图像+社交上下文+元数据+外部知识 二分类+6路细粒度分类 16,909
ReMMDBench 2026 多语言 多语言/多图像/证据验证 文本+多图像+外部证据 5路真实性+8类失真标签 500
VLDBench 2026 英语 多类别虚假信息 文本+图像 13个基准特定类别 ≈62,000
AMG 2025 中文 细粒度假新闻归因 文本+图像 6路分类/归因 4,922
MFND 2025 英语 多模态篡改 文本+图像 11种篡改类型+定位
MM-Health 2025 英语 健康错误信息/AI生成 文本+图像 可靠性+原创性+细粒度标签 34,746
MMFakeBench 2025 英语 混合来源错误信息 文本+图像 二分类+3粗类+12子类型 11,000
FakeTT 2024 英语 短视频假新闻 视频+音频+文本 二分类 1,991
M³A 2024 全球 多媒体真实性 文本+图像+音频+视频 细粒度/多任务
FakeSV 2023 中文 短视频假新闻 视频+音频+文本+社交上下文+元数据 二分类+辟谣信息 5,538
MR² 2023 英语/中文 检索增强谣言检测 文本+图像+社交上下文+元数据+外部证据 3路分类 14,700
MuMiN 2022 41种语言 多语言错误信息 文本+图像+社交上下文+元数据+知识图谱 二分类 12,914条声明
CHECKED 2021 中文 COVID-19/健康 文本+图像+社交上下文+元数据 二分类 2,104
Weibo21 2021 中文 多领域假新闻 文本+图像+元数据 二分类 9,128
Fakeddit 2020 英语 社交媒体 文本+图像+社交上下文+元数据 2/3/6路分类 1,063,106
MM-COVID 2020 6种语言 COVID-19/跨语言 文本+社交上下文+元数据 二分类 11,173
FakeNewsNet 2018 英语 新闻+社交传播 文本+图像+社交上下文+元数据 二分类
微博多模态谣言数据集 2017 中文 微博谣言检测 文本+图像+社交上下文+元数据 二分类 9,528

数据集特征对比

下表概括了核心数据集的主要研究特征(✅表示该特征是数据集的重要研究设置;—表示非主要特征):

数据集 多领域 多语言 社交上下文 外部证据/知识 细粒度标签 生成/合成数据 音视频/多图像
DeceptionDecoded
DriftBench
FakeVE
FineFake
ReMMDBench
VLDBench
AMG
MFND
MM-Health
MMFakeBench
FakeTT
M³A
FakeSV
MR²
MuMiN
CHECKED
Weibo21
Fakeddit
MM-COVID
FakeNewsNet
微博多模态谣言

紧密相关基准

以相邻任务为主的高度相关数据集,主要包括脱离语境检测、事实核查、媒体篡改定位或AI生成内容检测:

数据集 年份 主要关注点 模态 任务 规模
ROM 2026 推理增强多模态篡改 文本+图像+取证依据 检测+篡改定位+取证推理 704,456
MDSM 2026 MLLM驱动的语义对齐篡改 文本+图像 检测+5种篡改类型+图像定位 441,423
MiRAGeNews 2024 AI生成新闻 文本+图像 真实vs AI生成 15,000
VERITE 2024 脱离语境错误信息 文本+图像 3路分类 1,000
COSMOS 2023 脱离语境检测 文本+图像 二分类 204,458张图像
DGM⁴ 2023 多模态媒体篡改 文本+图像 检测+篡改类型分类+图像/文本定位 230,000
FACTIFY 2 2023 多模态事实核查 文本+图像+外部证据 5路分类 50,000
MOCHEG 2023 事实核查+解释 文本+图像+外部证据 验证+解释生成
FACTIFY 2022 多模态事实核查 文本+图像+外部证据 3路分类 50,000
NewsCLIPpings 2021 脱离语境图文不匹配 文本+图像 二分类 988,283
VisualNews 2021 真实新闻图文语料 文本+图像+元数据 新闻图像描述/图文来源语料 1,080,595张图像
NYTimes800k 2020 真实纽约时报图文语料 文本+图像+元数据 新闻图像描述/图文来源语料 792,971张图像

数据集选择指南

按研究方向提供首选数据集建议:

研究方向 推荐数据集
经典图文假新闻检测 Fakeddit, 微博, Weibo21
社交传播/社交上下文 FakeNewsNet, MuMiN, CHECKED, MR²
细粒度假类型/归因 FineFake, AMG, MMFakeBench, MFND
多领域泛化 FineFake, Weibo21, M³A, VLDBench
脱离语境图文错误信息 COSMOS, NewsCLIPpings, VERITE
图文篡改检测与定位 ROM, MDSM, DGM⁴, MFND
真实新闻图文来源语料/新闻描述 VisualNews, NYTimes800k
外部证据/检索增强验证 MR², MOCHEG, FACTIFY, FineFake, ReMMDBench
GenAI时代的鲁棒性 MMFakeBench, MM-Health, VLDBench, DriftBench, DeceptionDecoded
AI生成多模态新闻 MiRAGeNews, MM-Health
短视频假新闻 FakeSV, FakeTT, FakeVE
多语言/跨语言 MM-COVID, MuMiN, MR², ReMMDBench
多图像验证 ReMMDBench

模态图例

缩写 含义 缩写 含义
T 文本 I 图像
MI 多张图像 V 视频
A 音频 S 社交上下文
M 元数据 E 外部证据
K 外部知识 G 知识图谱
R 参考文章 FR 取证依据

数据集范围

  • 核心数据集:直接用于多模态假新闻/错误信息/谣言/虚假信息检测,包括图文假新闻检测、多领域/多语言检测、细粒度假类型和归因、社交上下文建模、短视频假新闻检测、GenAI环境中的假新闻检测与鲁棒性评估。
  • 相关数据集:与多模态假新闻研究高度相关但主要面向相邻任务,如脱离语境检测、多模态事实核查、媒体篡改检测与定位、AI生成新闻检测、证据检索与解释生成。

数据来源类型

类型 描述
real_world 自然发生的错误信息,来自新闻网站、社交媒体或短视频平台
real_world_curated 经过选择、策划或人工验证的真实世界样本,用于基准构建
synthetic_pairing 将真实图像/标题/文本重新配对以创建脱离语境的样本
synthetic_manipulation 通过受控篡改修改图像或文本
mixed_real_and_synthetic 结合真实数据与生成/篡改样本
genai_diversified 使用生成式AI重写、多样化或重新生成新闻内容

仓库结构

仓库主要结构如下:

  • README.md — 数据集总览
  • CONTRIBUTING.mdCITATION.cffrequirements.txt — 贡献与引用指南
  • catalog/datasets.yaml — 结构化元数据
  • datasets/datasets.csv — 可直接用于统计分析的表格数据
  • analysis/ — 可视化摘要(按年份分布、模态覆盖、范畴分布等)
  • docs/ — 元数据模式与来源文档
  • scripts/build_assets.py — 构建脚本

数据集链接政策

该仓库仅用于收集和汇总数据集的论文、官方仓库及访问链接,不重新上传或分发原始数据文件。如需下载流程、申请要求和用途限制,请参考每个数据集的官方页面。

搜集汇总
数据集介绍
Multimodal Fake News Datasets 数据集图片
构建方式
该数据集集合致力于系统性地梳理与整合多模态虚假新闻检测领域的学术资源,其构建过程体现了严谨的学术规范与分类逻辑。具体而言,项目团队通过广泛检索相关文献与官方存储库,遴选出33个具有代表性的数据集或基准测试,并将其细致划分为21个核心数据集及12个紧密相关的基准。核心数据集聚焦于多模态虚假新闻、错误信息、谣言等直接检测任务,而相关基准则涵盖如文本与图像不匹配检测、事实验证、媒体操纵定位等邻近方向。为便于研究者进行对比与访问,每个数据集均关联了对应的论文、官方代码库及数据获取链接。此外,团队对所有数据集的结构化元数据进行了统一编码,涵盖任务类型、模态构成、语言、领域、标签体系及数据来源等关键属性,并将信息存储于YAML及CSV文件中,以便高效检索与统计分析。其数据来源类型亦被细致划分为真实世界数据、精选真实数据、合成配对、合成操纵、混合真实与合成及生成式AI扩张等不同类别,以此凸显数据构建方式的差异性。
使用方法
数据集的访问与使用方式体现了极高的可操作性。该存储库并未直接分发原始数据文件,而是作为索引中心,将用户引导至每个数据集的官方发布页面。研究者可以借助层次化的目录(核心数据集目录、紧密相关基准及特征对比表)进行初步筛选,随后依据具体的研究问题,参照推荐列表快速定位合适的数据集。对于需要编程化复用的场景,项目提供了结构化的YAML数据目录及可直接用于统计分析的CSV文件,极大地方便了数据集的批量比较与元数据挖掘。该资源库的使用流程设计为:研究者先依据研究方向查阅核心或相关目录,利用功能特征比较表评估数据集,再通过官方链接获取数据并遵循其特定的许可与访问政策。在比较各数据集性能时,项目建议超越单纯的准确率指标,而应综合考量数据来源类型、任务定义、标签粒度及模态设置等因素,以确保研究结论的严谨性。
背景与挑战
背景概述
随着社交媒体与新闻传播的深度融合,虚假信息以前所未有的速度扩散,其形态也从单一文本演化为图文并茂、音视频交融的多模态复合体。为应对这一挑战,学术界自2017年起陆续构建了包括Fakeddit、FakeNewsNet、Weibo、MuMiN、FakeSV等在内的经典多模态虚假新闻数据集,为检测算法提供了基准测试平台。近年来,生成式AI技术的爆发进一步催生了诸如MMFakeBench、DriftBench、DeceptionDecoded等新型数据集,这些工作多由国际知名高校及研究机构主导,发表于ICLR、AAAI、CVPR等顶会,聚焦于细粒度标注、跨语言泛化、多域覆盖及生成内容识别等前沿问题。该领域的数据集建设已从初期的单一真伪判别,演进为涵盖事实核查、操纵定位、溯源归因及鲁棒性评估的综合性生态体系,对推动多模态语义理解、可信人工智能及数字内容治理研究起到了关键支撑作用。
当前挑战
该领域面临的挑战颇为多维。研究层面,不同数据集在任务定义、标签粒度、数据来源及模态构成上差异显著,导致模型跨数据集泛化能力不足;多数数据集集中于图片与文本,视频、音频及多图像场景覆盖有限;数据多源自英文或中文社交平台,跨语言数据稀缺;生成式AI制造的虚假内容仿真度极高,传统检测方法难以应对。构建层面,真实世界中虚假样本的自然采集耗时且标注难度大,需借助人工审核或众包,成本高昂;部分数据因隐私或平台政策限制,获取流程繁琐且规模受限,如FakeSV需申请使用;操纵样本的合成与标注则易引入偏差,难以完全代表真实分布;跨域与多语言数据对齐亦非易事。此外,数据集的持续更新与维护,包括追踪新出现的操纵手段及确保标注一致性,同样构成长期性挑战。
常用场景
经典使用场景
该数据集集合为多模态虚假新闻检测(MFND)领域的研究提供了系统的基准资源,涵盖从经典图像-文本配对(如Fakeddit、Weibo)到短视频(FakeSV)和多语言(MuMiN)等多样化的数据形态。研究人员常将其作为模型性能对比的统一评估平台,通过统一的元数据框架(如datasets.yaml)快速筛选适配特定研究问题的数据集,从而在可控条件下验证多模态融合、跨域泛化等核心能力。
解决学术问题
该资源有效解决了多模态虚假新闻研究中长期存在的数据碎片化和基准不统一问题。通过系统梳理33个数据集的属性(如模态、语言、标签粒度、数据来源),它使研究者能清晰辨识不同数据集的构造偏差(如真实世界数据与合成操纵的差异),从而推动更严谨的实验设计。这一整合不仅降低了数据集选取的盲目性,还为跨数据集泛化研究、鲁棒性评估以及可解释性分析提供了稳固的实证基础,促进了该领域结论的可重复性与可比性。
实际应用
在实际应用中,该数据集集合对社会化媒体平台和新闻机构的虚假信息治理具有直接支撑作用。基于这些数据训练的多模态检测模型可用于自动识别与图像相伴的失实文本、短视频中的断章取义内容以及跨语言传播的谣言,例如在COVID-19健康信息核查、政治事件事实核查等场景中辅助人工审核。此外,相关基准(如DGM4和COSMOS)也为媒体取证工具的开发提供了素材,推动构建更高效的自动化事实核查与内容溯源系统。
数据集最近研究
最新研究方向
多模态虚假新闻检测领域正经历从传统二元分类向细粒度、可解释性及生成式AI鲁棒性评估的深刻范式转型。最新数据集如FineFake、AMG及MFND等不再局限于简单的真伪判别,而是深入挖掘虚假信息的操纵类型、归因溯源与语义对齐,推动研究向多媒体操纵定位与取证推理等更高层次认知任务迈进。同时,以MMFakeBench、DriftBench和DeceptionDecoded为代表的基准,聚焦于大语言模型与扩散模型所催生的合成及多样化虚假内容,着力构建对抗生成式操纵的稳健评估体系,并引入跨语言、多图像、外部证据等复杂设定,全面模拟真实信息生态的多元挑战,从而为构建可信、鲁棒且具备泛化能力的多模态事实核查系统奠定坚实的数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务