Fake News Corpus
收藏资源简介:
该数据集包含了从多个假新闻网站和真实新闻来源收集的新闻文章,旨在用于训练和评估机器学习模型以区分假新闻和真实新闻。数据集要求主题和来源多样性,并力求在假新闻和真实新闻之间保持平衡的类别分布。
This dataset comprises news articles collected from multiple fake news websites and authentic news sources, designed for training and evaluating machine learning models to distinguish between fake and real news. The dataset emphasizes diversity in topics and sources, striving to maintain a balanced distribution between fake and real news categories.
数据集概述
数据集目的
本数据集旨在用于训练和评估机器学习模型,以区分真实新闻与虚假新闻(包括假新闻、讽刺/模仿、偏见/阴谋论)。
数据集内容
-
虚假新闻数据:
- 来源:主要从以下网站收集:
- http://www.theonion.com (讽刺)
- http://www.politicops.com (假新闻/骗局/偏见)
- http://www.realnewsrightnow.com (假新闻/骗局/偏见)
- http://www.enduringvision.com (假新闻/骗局/偏见)
- http://www.civictribune.com (假新闻/骗局/偏见)
- http://www.newsbiscuit.com (假新闻/骗局/偏见)
- 数量:共收集3313篇文章。
- 补充数据:使用Kaggle上的一个公开数据集,包含12403篇文章,总虚假新闻文章数达到15716篇。
- 来源:主要从以下网站收集:
-
真实新闻数据:
- 来源:主要来自《纽约时报》、《卫报》和BBC新闻。
- 数量:共12591篇文章。
数据集特点
- 主题多样性:涵盖多个新闻类别,如政治、商业、体育、娱乐等。
- 来源多样性:从多个不同的新闻网站和来源收集,以考虑不同的写作风格和词汇使用。
- 类别分布:理想情况下,虚假和真实新闻的实例数量大致相等。
数据集使用
数据集用于评估不同向量空间模型在分类虚假新闻上的性能,包括Bag-of-words (BoW)、Term-frequency Inverse document frequency (tfidf)、N-gram模型和Latent Semantic Analysis (LSA)。通过这些模型,将文本文章转换为机器学习模型可处理的固定长度向量表示。
实验结果
- TFIDF模型:最高准确率达到97.14%,性能指标普遍在96-98%之间。
- LSA模型:性能略优于TFIDF,最高准确率达到97.44%。
结论
TFIDF模型在区分虚假新闻与真实新闻方面表现出色,而LSA模型虽然性能略高,但考虑到额外的计算资源和时间,TFIDF模型可能是更实用的选择。




