CRED-1
收藏资源简介:
CRED-1是一个开放的、可重现的领域级可信度数据集,结合了多个开放许可的源列表和计算出的丰富信号。它为2672个已知发布虚假/错误信息、阴谋论或其他不可靠内容的领域提供了可信度评分。
CRED-1 is an open, reproducible domain-level credibility dataset that combines multiple open-licensed source lists and a rich set of computationally derived signals. It provides credibility scores for 2,672 domains known to publish false/misinformation, conspiracy theories, or other unreliable content.
CRED-1: 开放领域可信度数据集概述
数据集简介
CRED-1 是一个开放的、可复现的领域级可信度数据集,它结合了多个开放许可的源列表与计算出的增强信号。该数据集为 2,672 个 已知发布虚假/错误信息、阴谋论或其他不可靠内容的域名提供了可信度评分。
核心特性
- 域名数量:包含 2,672 个带有可信度评分(0.0–1.0)的域名。
- 可复现性:完全可复现,Python 流水线可从零开始重建数据集。
- 多信号评分:结合了源标签、域名年龄、网络流行度、事实核查频率和威胁情报。
- 隐私保护:专为设备端客户端部署设计(无需服务器调用)。
- 开放许可:依赖两个开放许可的源,无专有数据依赖。
数据模式与格式
数据集提供三种格式:
- JSON 格式 (
cred1_current.json):包含所有字段的完整数据。 - CSV 格式 (
cred1_current.csv):包含 18 列的表格格式,按credibility_score升序排列。 - 紧凑格式 (
cred1_compact.json):用于设备端嵌入的最小化格式,约 168KB。
主要字段说明
| 字段 | 描述 |
|---|---|
category |
完整类别名称:fake(虚假)、unreliable(不可靠)、mixed(混合)、conspiracy(阴谋论)、satire(讽刺)、reliable(可靠) |
credibility_score |
可信度评分(0.0-1.0,越低越不可信) |
sources |
标记此域名的独立源列表数量 |
tranco_rank |
Tranco 排名(可选,未排名则无) |
domain_registered |
来自 RDAP 的域名注册日期,ISO 8601 格式(可选) |
domain_age_years |
域名年龄(年),根据 domain_registered 计算(可选) |
iffy_factual |
MBFC 事实报道评级(可选) |
iffy_bias |
MBFC 政治偏见评级(可选) |
iffy_score |
Iffy.news 可信度评分,0.0-1.0(可选) |
factcheck_claims |
来自 Google Fact Check Tools API 的事实核查声明数量(可选) |
safe_browsing_flagged |
Google Safe Browsing 威胁标记(可选) |
score_cat |
类别评分分量 |
score_iffy |
Iffy.news 评分分量 |
score_tranco |
Tranco 排名评分分量 |
score_age |
域名年龄评分分量 |
score_factcheck |
事实核查频率评分分量 |
score_safebrowsing |
Safe Browsing 评分分量 |
评分模型
可信度评分是五个独立信号的加权混合:
| 信号 | 权重 | 来源 |
|---|---|---|
| 源类别 | 50% | OpenSources.co 与 Iffy.news 共识标签 |
| Iffy.news 评分 | 15% | Iffy.news 可信度评级(如可用) |
| 事实核查频率 | 15% | Google Fact Check Tools API — 声明数量 |
| 网络流行度 | 5% | Tranco Top-1M 排名(对数归一化) |
| 域名年龄 | 5% | WHOIS/RDAP 注册日期 |
| Google Safe Browsing | 覆盖 | 若被标记为恶意软件/社会工程,则硬上限为 0.05 |
信号不可用时,剩余权重默认为源类别评分。
数据来源
| 来源 | 域名数量 | 许可 | 类型 |
|---|---|---|---|
| OpenSources.co (https://github.com/BigMcLargeHuge/opensources) | 825 | CC BY 4.0 | 精选的虚假/错误信息域名列表 |
| Iffy.news Index (https://iffy.news/index/) | 2,040 | MIT | 基于 MBFC 的不可靠源索引 |
| Tranco Top-1M (https://tranco-list.eu/) | 1,000,000 | 免费使用 | 聚合的网络流行度排名 |
| RDAP (https://rdap.org/) | 公共协议 | N/A | 域名注册数据 |
| Google Fact Check Tools API (https://developers.google.com/fact-check/tools/api) | N/A | 免费(需署名) | 事实核查声明数据库 |
| Google Safe Browsing API (https://developers.google.com/safe-browsing) | N/A | 免费(需署名) | 威胁情报 |
类别分布
| 类别 | 数量 | 百分比 |
|---|---|---|
| 混合 (Mixed) | 1,335 | 50.0% |
| 不可靠 (Unreliable) | 589 | 22.0% |
| 虚假 (Fake) | 493 | 18.4% |
| 阴谋论 (Conspiracy) | 153 | 5.7% |
| 讽刺 (Satire) | 94 | 3.5% |
| 可靠 (Reliable) | 8 | 0.3% |
应用场景
- 浏览器扩展:在内容分发阶段进行设备端预先辟谣。
- 错误信息研究:作为领域级可信度研究的基础事实。
- 内容审核:自动标记低可信度来源。
- 教育:媒体素养工具和课程。
引用
如需在研究中使用 CRED-1,请引用: bibtex @article{loth2026cred1, title = {{CRED-1}: An Open Multi-Signal Domain Credibility Dataset for Automated Pre-Bunking of Online Misinformation}, author = {Loth, Alexander}, journal = {Data in Brief}, year = {2026}, doi = {10.5281/zenodo.18769460} }
许可
此仓库(代码和数据)采用 CC BY 4.0 许可。
致谢
本数据集基于以下工作构建:
- Melissa Zimdars 和 OpenSources.co 项目。
- 雷诺兹新闻研究所的 Iffy.news 团队。
- Google Fact Check Tools 和 Safe Browsing API。



