遇见数据集

Misinformation-Dataset

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

FakeNews Master Dataset 是一个合并、清理和去重的研究语料库,旨在研究不同上下文条件下的错误信息分类。它整合了 ClaimReview、Fakeddit、FakeNewsNet 和 MuMiN 的本地可用镜像,形成一个规范模式,同时保留源数据集来源。该数据集适用于实验,探讨开源模型在给定不同数量或质量的上下文(如完整上下文、最小上下文或误导性上下文)时是否能分类错误信息。数据规模方面,去重前总行数为 374,738,去重后为 360,348 行。数据来源包括 ClaimReview(265,884 行)、Fakeddit(85,577 行)、FakeNewsNet(21,889 行)和 MuMiN(1,388 行),保留率分别为 0.9809、0.8558、0.9437 和 0.9886。主要任务为二元错误信息分类,内部标签约定为 mapped_label: 0 = 真实,1 = 虚假;扁平导出标签约定为 Real: 1 = 真实,0 = 虚假。模态包括文本以及可用的图像/新闻元数据。数据集提供三种导出家族:测试、训练和验证分割用于适配器训练和评估;规范化记录用于实验和训练;主记录包含丰富的来源字段;扁平分析导出包含 id、Title、Claim、news source、Real 和 tweet_num 字段。关键字段包括 dataset(源数据集名称)、sample_id(源感知稳定样本标识符)、text(主要声明文本)、context_text(附加上下文)、original_label(源特定标签值)、mapped_label(内部二元标签)、split(数据集分割值)、modality(源模态描述符)、has_image(图像元数据可用性)、metadata(源特定来源和辅助字段)。扁平导出字段覆盖情况:Title 非空行 106,125(空值率 0.7055),Claim 非空行 360,348(空值率 0.0000),news source 非空行 360,348(空值率 0.0000),Real 非空行 360,348(空值率 0.0000),tweet_num 非空行 20,732(空值率 0.9425)。数据集适用于错误信息和假新闻分类研究、上下文消融实验、跨数据集和上下文设置的模型行为比较、适配器微调的确定性训练/验证/测试分割构建,以及合并错误信息数据集的源覆盖和字段可用性检查。不应作为自动化内容审核、无人工审查的真实世界事实核查、法律、医疗、选举、财务或安全关键决策的唯一真相来源。数据集存在源不平衡、收集方法差异、上下文有限、图像 URL 有效性不保证等偏差和限制。许可为其他,用户需遵守各上游数据集的条款。

FakeNews Master Dataset is a merged, cleaned, and deduplicated research corpus designed to study misinformation classification under varying contextual conditions. It integrates locally available mirrors of ClaimReview, Fakeddit, FakeNewsNet, and MuMiN into a canonical schema while preserving source dataset provenance. The dataset is suitable for experiments exploring whether open-source models can classify misinformation given different amounts or qualities of context, such as full context, minimal context, or misleading context. In terms of data scale, the total number of rows before deduplication is 374,738, and after deduplication, it is 360,348 rows. Data sources include ClaimReview (265,884 rows), Fakeddit (85,577 rows), FakeNewsNet (21,889 rows), and MuMiN (1,388 rows), with retention rates of 0.9809, 0.8558, 0.9437, and 0.9886, respectively. The primary task is binary misinformation classification, with internal label conventions as mapped_label: 0 = true, 1 = false; and flat export label conventions as Real: 1 = true, 0 = false. Modalities include text and available image/news metadata. The dataset provides three export families: test, train, and validation splits for adapter training and evaluation; canonicalized records for experiments and training; master records with rich provenance fields; and flat analytical exports containing fields such as id, Title, Claim, news source, Real, and tweet_num. Key fields include dataset (source dataset name), sample_id (source-aware stable sample identifier), text (primary claim text), context_text (additional context), original_label (source-specific label value), mapped_label (internal binary label), split (dataset split value), modality (source modality descriptor), has_image (image metadata availability), and metadata (source-specific provenance and auxiliary fields). Flat export field coverage: Title has 106,125 non-null rows (null rate 0.7055), Claim has 360,348 non-null rows (null rate 0.0000), news source has 360,348 non-null rows (null rate 0.0000), Real has 360,348 non-null rows (null rate 0.0000), and tweet_num has 20,732 non-null rows (null rate 0.9425). The dataset is applicable for misinformation and fake news classification research, context ablation experiments, comparing model behaviors across datasets and contextual settings, constructing deterministic train/validation/test splits for adapter fine-tuning, and checking source coverage and field availability in merged misinformation datasets. It should not be used as the sole source of truth for automated content moderation, real-world fact-checking without human review, or legal, medical, electoral, financial, or safety-critical decisions. The dataset has biases and limitations such as source imbalance, differences in collection methods, limited context, and no guarantee of image URL validity. The license is other, and users must comply with the terms of each upstream dataset.

创建时间:
2026-06-19
搜集汇总
数据集介绍
Misinformation-Dataset 数据集图片
构建方式
FakeNews Master Dataset 是一个面向虚假信息分类研究的融合语料库,通过整合 ClaimReview、Fakeddit、FakeNewsNet 和 MuMiN 四个开源数据集构建而成。构建流程首先复用各源数据集的专用加载器,随后经统一的清洗管线进行去重与标签映射,将原始标签转化为二值研究标签(mapped_label: 0 为真,1 为假)。去重操作基于稳定的样本指纹执行,最终生成规范化的统一记录、保留溯源信息的原始记录以及用于快速分析的扁平化导出表。构建脚本支持完全复现,用户可通过执行 fetch_datasets.py 与 build_master_dataset.py 重新生成完整数据集。
特点
该数据集汇集了逾36万条经去重处理的样本,规模介于十万至百万级之间。其核心特色在于支持上下文消融实验,为研究不同上下文条件(如完整上下文、最小上下文或误导性上下文)对开源模型虚假信息分类能力的影响提供了丰富素材。数据集保留了来源数据集的身份标注,便于跨数据集比较。除文本主诉外,部分样本还包含图像元数据及社交平台互动计数,支持多模态探索。此外,数据集提供两种标签约定(内部映射标签与扁平化分析标签),适配不同研究管线的需求。
使用方法
用户可通过 Hugging Face datasets 库便捷加载该数据集。若需使用规范化的完整架构,建议加载 normalized_records.jsonl 文件,采用 json 格式读取,核心字段包含文本内容、上下文文本、映射标签及样本元数据。若偏好紧凑型表格进行快速分析,可选用 master_flat_records.csv 文件,以 CSV 格式加载,字段包括 ID、标题、声明、新闻来源及二元真实标签。需注意,两种导出文件的标签约定恰好相反:规范文件以 0 表示真实、1 表示虚假,而扁平文件以 1 表示真实、0 表示虚假。数据集已预划分训练集、验证集与测试集,可直接用于模型微调与评估。
背景与挑战
背景概述
在虚假新闻泛滥与信息生态恶化的时代背景下,精准识别 misinformation 已成为计算社会科学与自然语言处理领域的关键课题。2026年,英国金斯顿大学研究团队(Dr. Yi Peiling、Jay Bell Compaan 与 Michael JC Charles)整合 ClaimReview、Fakeddit、FakeNewsNet 与 MuMiN 四个权威数据集,构建了规模达36万余条样本的 FakeNews Master Dataset(即 Misinformation-Dataset)。该数据集以统一的规范化模式融合多来源、多模态信息,旨在探索开源模型在不同上下文条件(完整、精简或误导性上下文)下对错误资讯的分类效能,为上下文消融实验与事实核查研究提供了高质量的基准资源。
当前挑战
该数据集所应对的核心领域挑战在于 misinformation 分类任务对上下文质量的极度敏感性:不同来源样本的标签定义、时间跨度、语言及领域差异导致模型泛化困难,且部分样本仅含简略标题或声明,缺乏足够上下文以支持可靠判断。构建过程中,团队面临来源数据不平衡(ClaimReview 占比过高)、近重复内容难以完全消除、部分源数据集仅能获取本地镜像或样本快照等难题;同时,由于图片 URL 可能失效及元数据缺失,多模态信息的可用性亦受制约。此外,数据集中 Real 标签与内部标注惯例的相反二进制约定,要求使用者在训练前仔细校验,以避免标签混淆风险。
常用场景
经典使用场景
在虚假信息泛滥的数字时代,FakeNews Master Dataset作为整合了ClaimReview、Fakeddit、FakeNewsNet与MuMiN四大源数据的大规模研究语料库,为假新闻检测领域的经典实验场景提供了坚实的数据基础。该数据集最典型的应用场景是二元的虚假信息分类任务,研究者能够利用其统一规范的标签体系(mapped_label: 0代表真实,1代表虚假),在文本、图像及新闻元数据等多模态信息上训练和评估分类模型。尤为重要的是,该数据集的独特设计支持上下文消融实验,允许学者探究不同上下文条件(如完整语境、最小语境或误导性语境)如何影响开源语言模型对虚假信息的判别能力,从而揭示模型在信息片段化环境中的鲁棒性与缺陷。
衍生相关工作
围绕该数据集已衍生出一系列具有影响力的学术工作,其中最直接的成果是名为FakeNews的适配器模型(Hugging Face平台发布),该适配器基于数据集的清洗分割集进行了针对性微调,专门用于上下文感知的虚假信息分类任务。此外,数据集的构建方法论催生了对跨源数据去重、标签统一映射及字段覆盖分析等技术的深入讨论,促使研究者开发出更鲁棒的规范化记录模式(UnifiedRecord Schema)。在更广阔的领域,该数据集作为基准,推动了针对多源标签偏差、模型在极端上下文缺失下的行为分析以及多模态特征融合等课题的实证研究,为后续探索如何构建更具泛化能力与公平性的虚假信息检测系统提供了宝贵的参照系与可复现的实验平台。
数据集最近研究
最新研究方向
当前,虚假信息检测领域正从单一文本分类向多模态、多源融合与上下文消融实验方向演进。该数据集整合了ClaimReview、Fakeddit、FakeNewsNet和MuMiN四大来源,经过清洗与去重,构建了包含逾36万条样本的规范化语料库,为研究开放源代码模型在不同上下文条件(如完整上下文、最小上下文或误导性上下文)下的虚假信息分类能力提供了坚实基础。其独特的标签体系与丰富的元数据字段,支持研究者深入探索上下文信息对检测性能的影响机制,推动了可解释、可复现的虚假信息检测研究,尤其在大语言模型微调与适配器训练方面具有重要应用价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务