Fake News Corpus
收藏资源简介:
这是一个开源数据集,包含数百万篇新闻文章,主要从http://www.opensources.co/的1001个精选域名中抓取。为了更好地平衡类别,还包含了[NYTimes](https://developer.nytimes.com/)和[WebHose English News Articles](https://webhose.io/datasets)的文章。该数据集主要用于训练深度学习算法,以识别假新闻。
本开源数据集汇聚数百万篇新闻文章,其内容主要源自于源自http://www.opensources.co/的1001个精选网站。为达到类别平衡的目的,亦纳入了[NYTimes](https://developer.nytimes.com/)及[WebHose English News Articles](https://webhose.io/datasets)所提供之文章。该数据集旨在辅助深度学习算法的训练,以期实现假新闻的识别功能。
数据集概述
数据集名称
Fake News Corpus
数据集描述
这是一个开放源代码数据集,包含数百万篇新闻文章,主要从http://www.opensources.co/的1001个精选域名中抓取。为平衡类别,还包含了NYTimes和WebHose English News Articles的文章。该数据集主要用于训练深度学习算法,以识别假新闻。
数据集规模
目前公开版本包含9,408,908篇文章,覆盖了1001个域名中的745个。
数据集创建方法
数据集通过使用scrapy抓取所有域名,并使用newspaper库处理纯HTML内容以提取文章文本和其他字段。
数据集格式
数据集格式为CSV,包含以下字段:
- id
- domain
- type
- url
- content
- scraped_at
- inserted_at
- updated_at
- title
- authors
- keywords
- meta_keywords
- meta_description
- tags
- summary
- source (opensources, nytimes, or webhose)
数据集类型及统计
| Type | Tag | Count (so far) | Description |
|---|---|---|---|
| Fake News | fake | 928,083 | 完全捏造信息的来源 |
| Satire | satire | 146,080 | 使用幽默评论当前事件的来源 |
| Extreme Bias | bias | 1,300,444 | 来自特定观点的来源 |
| Conspiracy Theory | conspiracy | 905,981 | 推广阴谋论的来源 |
| State News | state | 0 | 政府授权的压制国家来源 |
| Junk Science | junksci | 144,939 | 推广伪科学的来源 |
| Hate News | hate | 117,374 | 积极推广歧视的来源 |
| Clickbait | clickbait | 292,201 | 使用夸张标题的来源 |
| Proceed With Caution | unreliable | 319,830 | 内容需进一步验证的来源 |
| Political | political | 2,435,471 | 支持特定政治观点的来源 |
| Credible | reliable | 1,920,139 | 遵循新闻伦理的来源 |
数据集限制
数据集未经过手动过滤,因此某些标签可能不正确,某些URL可能不指向实际文章。此外,数据集完成后不打算更新,可能很快会过时。
数据集贡献
目前只有作者一人维护此数据集,欢迎任何形式的贡献,如发现标签错误、格式问题或无效URL等。
数据集下载




