Fake News Corpus
收藏资源简介:
这是一个开源数据集,包含数百万篇新闻文章,主要从http://www.opensources.co/的1001个精选域名中抓取。为了更好地平衡类别,还包含了[NYTimes](https://developer.nytimes.com/)和[WebHose English News Articles](https://webhose.io/datasets)的文章。该数据集主要用于训练深度学习算法,以识别假新闻。
本开源数据集汇聚了数百万篇新闻文章,其来源广泛,主要涵盖来自http://www.opensources.co/的1001个精选域名的信息。为追求类别平衡,亦纳入了[NYTimes](https://developer.nytimes.com/)及[WebHose English News Articles](https://webhose.io/datasets)的相关内容。该数据集旨在为深度学习算法的训练提供素材,尤其专注于假新闻的识别。
数据集概述
数据集名称
Fake News Corpus
数据集描述
这是一个开源数据集,包含数百万篇新闻文章,主要从OpenSources的1001个精选域名中抓取。为了平衡类别,还包含了NYTimes和WebHose English News Articles的文章。数据集主要用于训练深度学习算法,以识别假新闻。
数据集状态
目前公开版本包含9,408,908篇文章,覆盖了1001个域名中的745个。数据集仍在进行中。
数据集创建方法
通过使用Scrapy抓取所有域名,并使用newspaper库处理纯HTML内容以提取文章文本和其他字段。
数据集格式
数据集格式为CSV,包含以下字段:
- id
- domain
- type
- url
- content
- scraped_at
- inserted_at
- updated_at
- title
- authors
- keywords
- meta_keywords
- meta_description
- tags
- summary
- source (opensources, nytimes, or webhose)
数据集类型及统计
| Type | Tag | Count | Description |
|---|---|---|---|
| Fake News | fake | 928,083 | 完全捏造信息,传播欺骗性内容,或严重歪曲实际新闻报道的来源 |
| Satire | satire | 146,080 | 使用幽默、讽刺、夸张、嘲笑和虚假信息评论当前事件的来源 |
| Extreme Bias | bias | 1,300,444 | 来自特定观点的来源,可能依赖于宣传、断章取义的信息和扭曲为事实的观点 |
| Conspiracy Theory | conspiracy | 905,981 | 著名推广奇特阴谋论的来源 |
| State News | state | 0 | 在政府授权下运营的压制性国家的来源 |
| Junk Science | junksci | 144,939 | 推广伪科学、形而上学、自然主义谬误和其他科学上可疑声明的来源 |
| Hate News | hate | 117,374 | 积极推广种族主义、厌恶女性、恐同和其他形式歧视的来源 |
| Clickbait | clickbait | 292,201 | 提供一般可信内容,但使用夸张、误导或可疑标题、社交媒体描述和/或图像的来源 |
| Proceed With Caution | unreliable | 319,830 | 内容可能可靠但需要进一步验证的来源 |
| Political | political | 2,435,471 | 提供一般可验证信息以支持某些观点或政治倾向的来源 |
| Credible | reliable | 1,920,139 | 以与新闻业传统和道德实践一致的方式传播新闻和信息的来源 |
数据集下载
数据集限制
数据集未经过手动筛选,因此某些标签可能不正确,某些URL可能不指向实际文章而是指向网站上的其他页面。此外,数据集完成后不打算更新,因此可能很快对基于内容的算法以外的目的过时。
数据集贡献
由于目前只有一个人在维护这个数据集,非常欢迎所有贡献。如果发现任何文章的标签错误、格式奇怪的内容或指向非文章的URL,请自由发布带有问题和确切文章ID的问题,我将尽力及时响应。由于数据集的大小,无法在GitHub上托管,因此目前无法使用拉取请求协作处理数据。




