遇见数据集

credi-grain

收藏
Hugging Face2026-06-16 更新2026-06-17 收录
官方服务:

资源简介:

CrediGrain是一个大规模、细粒度的网络域名数据集,按照网络安全、来源可靠性和流行度三个维度进行分类。该数据集基于domain-pool构建,整合了来自50多个不同来源的数据,主要来源包括UT1(占34.6%)、Tranco List(占30.5%)、黑名单(占29.1%)和DNS阻止列表(占11.6%)。数据集总规模庞大,涵盖了数百万个域名条目,每个条目都附带了细粒度的分类标签。该数据集由CrediNet组织策划,该组织由来自Mila - Quebec AI Institute、牛津大学、麦吉尔大学、康考迪亚大学、加州大学伯克利分校、蒙特利尔大学和AITHYRA等机构的研究人员组成。资金支持来自英国工程和物理科学研究理事会(EPSRC)和人工智能安全研究所(AISI)等机构。该数据集适用于网络安全分析、来源可靠性评估、网络流行度研究以及相关机器学习任务,如域名分类和威胁检测。

CrediGrain is a large-scale, fine-grained web domain dataset categorized along three dimensions: cybersecurity, source reliability, and popularity. Built on a domain-pool, the dataset integrates data from over 50 distinct sources, with its primary sources being UT1 (34.6%), Tranco List (30.5%), blacklists (29.1%), and DNS blocklists (11.6%). It has a massive overall scale, encompassing millions of domain entries, each paired with fine-grained classification labels. Curated by the CrediNet organization, which comprises researchers from institutions including Mila - Quebec AI Institute, University of Oxford, McGill University, Concordia University, University of California, Berkeley, Université de Montréal, and AITHYRA, the dataset is funded by organizations such as the UK Engineering and Physical Sciences Research Council (EPSRC) and the AI Safety Institute (AISI). This dataset is applicable to cybersecurity analysis, source reliability assessment, web popularity research, and related machine learning tasks including domain classification and threat detection.

创建时间:
2026-06-16
原始信息汇总

数据集卡片:CrediGrain

CrediGrain (credi-grain) 是一个大规模、细粒度的网络域名集合,从 domain-pool 中提取,并沿着三个主要维度进行标注。

核心维度

数据集对每个域名从以下三个方面进行评级:

  • 网络安全 (Cybersecurity)
  • 认知可靠性 (Epistemic Reliability)
  • 流行度 (Popularity)

此外,每个数据点还包含其出现的年份、网站的功能类别以及每个标签的来源信息。

数据来源

数据集整合了多个来源的数据,主要贡献者包括:

来源 行数 占总数据百分比
UT1 (图卢兹第一大学) 5,617,370 34.6%
Tranco List 4,944,553 30.5%
Blacklists 4,718,888 29.1%
Dns Blocklists 1,882,315 11.6%
Malicious And Benign Webpages Train 755,500 4.7%
Phish DB 496,270 3.1%
Radek Benign C 436,807 2.7%
Radek Benign U 335,031 2.1%
Malicious And Benign Webpages Test 250,568 1.5%
Benign Malicious Urls 210,492 1.3%
Malicious Urls 192,961 1.2%
Radek Phishing 163,499 1.0%
Url Phish 102,745 0.63%
Radek Malware 94,823 0.58%
Hosts Porn 64,217 0.40%
Legitphish 63,944 0.39%
Hosts Adware Malware 58,834 0.36%
Phish Dataset 44,102 0.27%
Urlhaus 28,755 0.18%
Domains Quality Ratings 11,480 0.0708%
Meta Threat Reports 6,325 0.0390%
Redirection Domains 5,725 0.0353%
MBFC 5,447 0.0336%
Misinfodomains 4,738 0.0292%
Hosts Gambling 4,469 0.0276%
Wikipedia General 3,372 0.0208%
Manual 2,198 0.0136%
Hosts Fake News 2,180 0.0134%
Iffy Index 2,005 0.0124%
FakeNewsNet 1,108 0.0068%
CheckThat! 1,067 0.0066%
Wikipedia Miscellaneous 822 0.0051%
Wikipedia Campaigns 821 0.0051%
Providers (Manual) 650 0.0040%
Providers Manual 650 0.0040%
Wikipedia Fake News 454 0.0028%
Zoznam 337 0.0021%
Politifacts Almenac 325 0.0020%
Dictionaries Manual 297 0.0018%
Reliable Health Resources 223 0.0014%
Sd22 Approved Software List 193 0.0012%
Reliable Legal Resources 183 0.0011%
Paperwall 123 0.0008%
Ngo Report Uae Blacklist 99 0.0006%
Ngo Report Israel Blacklist 98 0.0006%
Ngo Report Saudi Blacklist 85 0.0005%
Wikipedia II Actors 62 0.0004%
Nelež 51 0.0003%
Tools Manual 48 0.0003%
C2 Domains 20 0.0001%
Hasbara Tracker 19 0.0001%
EDMO Hubs 16 0.0001%
Ngo Report Russia Blacklist 4 0.0000%

数据集构建与资助

  • 策划方: CrediNet 组织,合作者来自 Mila - 魁北克人工智能研究所、牛津大学、麦吉尔大学、康考迪亚大学、加州大学伯克利分校、蒙特利尔大学及 AITHYRA。
  • 资助: 本研究由工程与物理科学研究理事会 (EPSRC) 和人工智能安全研究所 (AISI) 的资助支持。

许可

  • 许可证: CC-BY-4.0

联系方式

如有问题、意见或错误报告,请联系:

  • Emma Kondrup:emma.kondrup@mila.quebec
搜集汇总
数据集介绍
credi-grain 数据集图片
构建方式
CrediGrain数据集是一个大规模、细粒度的网络域名集合,源自于DomainPool数据池。它通过整合多源数据构建而成,包括来自图卢兹第一大学的UT1黑名单、Tranco列表、多种黑名单及DNS封锁列表等数十个来源,覆盖从网络安全到信息可信度等多个维度。每个域名都附有标签来源标签和所属数据集的年份信息,确保数据的可追溯性与透明度。
特点
该数据集的核心特点在于其三维分类体系:网络安全、认知可靠性和流行度。域名不仅获得基于安全性的评级,还被评估其认知可信度与流行程度,涵盖恶意网页、钓鱼站点、虚假新闻源及可靠知识库等多种类型。每年份的数据分布清晰可视化,且所有标签均附有来源标注,支持细粒度分析与跨领域研究。
使用方法
用户可通过HuggingFace平台直接加载该数据集,适用于机器学习模型的训练与评估,尤其在网络安全威胁检测、信息可靠性验证及域名信誉分析等领域。数据集以标准格式提供,支持常见的数据处理框架。研究者可利用其多标签结构进行多任务学习,或结合年份信息分析域名信誉随时间的变化趋势。
背景与挑战
背景概述
CrediGrain数据集由Mila-魁北克人工智能研究所复杂数据实验室与牛津大学、麦吉尔大学、康考迪亚大学、加州大学伯克利分校、蒙特利尔大学及AITHYRA等机构合作创建,旨在应对数字时代信息生态系统中日益严峻的虚假信息与网络安全威胁。该数据集基于超过50个数据源(如UT1、Tranco List及各类黑名单)整合而成,围绕网络安全、来源可靠性及流行度三个维度对网页域名进行细粒度标注,为跨学科研究提供了大规模、多标签的结构化资源。其发布不仅填补了现有域名评级数据在覆盖范围和标注粒度上的空白,还通过融合学术机构与行业力量,推动了信息验证、网络防御及虚假信息检测领域的实证研究,成为连接数据科学、社会学与网络治理的重要基础工具。
当前挑战
CrediGrain数据集主要面临三方面挑战。首先,在领域问题层面,虚假信息和恶意网站呈现动态演化特性,如钓鱼域名和虚假新闻源的快速涌现要求标注体系具备时序适应能力,而现有数据源(如黑名单)的滞后性可能导致标签陈旧,影响模型在实时场景中的泛化性能。其次,构建过程中需应对数据源的异构性与标签冲突:例如,UT1提供基于黑名单的分类,而Tranco List侧重流行度,两者对同一域名的可靠性判断可能矛盾,需要设计鲁棒的融合策略。此外,数据源的稀疏性(如部分来源仅贡献数百条记录)和分布偏差(如流行域名占主导)增加了细粒度标注的不平衡性,对算法公平性构成挑战。最后,跨机构协作中数据隐私与版权问题(如手动标注的域使用条款)也需在开放共享中谨慎权衡。
常用场景
经典使用场景
在网络安全与信息可信度交叉研究领域,CrediGrain数据集为多维度的域名评估提供了坚实基础。其经典使用场景集中于利用细粒度标签体系,对网络域名的网络安全风险、信源可靠性及流行度进行联合建模。研究者可基于该数据集训练分类模型,以识别钓鱼网站、恶意软件分发站点或虚假新闻平台,亦可探究域名可信度与流量特征之间的潜在关联。该数据集的大规模、多年度特性使其尤其适用于时序分析,例如追踪恶意域名演化模式或评估网络黑名单的覆盖时效性。
解决学术问题
CrediGrain数据集有效解决了现有研究中缺乏统一、细粒度网络域名标注体系的困境。传统工作常孤立地处理网络安全、虚假信息或域名流行度问题,而该数据集通过整合数十种公开黑名单、学术标注及专业评级,首次实现了三大维度的跨领域关联分析。这为理解信息操纵的传播基础设施、评估黑名单的互补性与偏差提供了量化基础。其开源特性推动了两类关键研究:其一,跨模态信源可信度评估模型的构建;其二,大规模域名信任度量表的动态更新机制设计,显著降低了相关领域的标注门槛与偏差风险。
衍生相关工作
CrediGrain数据集有望催生一系列衍生工作,尤其在跨语种和多模态信息可信度评估方向。借鉴其多维标注框架,研究者可能构建融合网页内容与域名元数据的联合分类模型,例如结合文本语义与黑名单声誉预测虚假信息传播路径。其时间跨年度特性为动态网络生态分析铺平道路,衍生工作可能包括网络信任度退化预测、黑名单覆盖率与数据集偏倚的量化比较。此外,该数据集与领域概念的精细分级设计,为可解释性威胁情报系统的开发提供了激励,推动从简单黑名单匹配到上下文感知风险评估的范式迁移。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务