遇见数据集

malicious_domains

收藏
arXiv2026-06-10 更新2026-06-11 收录
官方服务:

资源简介:

该数据集由南新罕布什尔大学和国立大学的研究团队创建,是一个包含约152万条恶意域名记录的纵向研究数据集,数据来源于2026年1月至5月期间VirusTotal平台首次观测到的恶意域名。数据集整合了WHOIS注册记录、被动DNS数据及Tranco流行域名列表,通过至少五个独立扫描引擎的检测阈值进行筛选,并标注了域名类型(攻击者创建或受感染域名)、注册时间、查询量等关键特征。数据集的构建过程包括从VirusTotal提取原始域名,结合多源外部数据进行标注与分类,旨在支持网络安全领域的研究,特别是针对恶意域名的特征分析、基础设施滥用模式识别以及品牌仿冒检测等关键问题。

This dataset was developed by a research team from Southern New Hampshire University and National University. It is a longitudinal research dataset containing approximately 1.52 million malicious domain name records, with data sourced from malicious domains first observed on the VirusTotal platform between January and May 2026. The dataset integrates WHOIS registration records, passive DNS data, and the Tranco list of popular domains, and is filtered against detection thresholds from at least five independent scanning engines. It annotates key features such as domain type (attacker-created or compromised domain), registration time, and query volume. The dataset's construction process includes extracting raw domains from VirusTotal, and performing annotation and classification by combining multi-source external data. This dataset aims to support cybersecurity research, particularly key research areas including feature analysis of malicious domains, infrastructure abuse pattern recognition, and brand spoofing detection.

创建时间:
2026-06-10
原始信息汇总
  • 数据集名称: malicious_domains
  • 数据集描述: 该数据集包含对2026年上半年VirusTotal恶意域名的纵向研究数据。
  • 数据集来源: GitHub仓库 (https://github.com/mufimash/malicious_domains)
  • 研究时间范围: 2026年上半年
  • 研究内容: 针对VirusTotal平台收录的恶意域名进行长期跟踪与分析
  • 数据用途: 可用于分析恶意域名的演变模式、生命周期及威胁情报研究
搜集汇总
数据集介绍
malicious_domains 数据集图片
构建方式
该数据集源自2026年1月至5月间VirusTotal平台首次观测到的约152万个恶意域名,选取标准为至少被5个独立扫描引擎标记为恶意。研究者结合WHOIS注册记录、被动DNS解析数据及Tranco Top-100万流行度列表进行多源标注,并依据域名是否出现在Tranco前50万名内或注册年龄超过三年,将域名划分为被入侵域名(10.7%)与攻击者注册域名(89.3%),构建了结构化的恶意域名知识库。
特点
数据集具有显著的纵向覆盖与多维标注特性。在时间维度上,记录了域名从注册到首次检测的年龄分布,中位年龄仅60天,7.4%的域名在注册一天内即被检测,揭示了攻击者快速部署的特点。在空间维度上,发现前四大注册商掌控36%的恶意域名,Cloudflare的IP与AS占据托管基础设施主导地位,且77.9%的攻击域名以批量注册方式生成,单日单注册商最高批量达2168个域名,展现了高度集中化与自动化攻击态势。
使用方法
该数据集以JSON格式公开于GitHub仓库,支持多种安全研究场景。研究者可直接使用预分类标签(被入侵/攻击者注册)进行统计建模;可联合WHOIS创建时间与PDNS查询数量分析域名生命周期与危害程度;还可利用品牌字符串匹配模块开展钓鱼品牌仿冒检测(如WhatsApp被仿冒19511次)。数据集特别适用于恶意域名早期检测、注册商滥用模式分析及威胁情报验证等研究方向。
背景与挑战
背景概述
恶意域名作为网络钓鱼、恶意软件分发、命令与控制通信及在线欺诈的主要载体,一直是网络安全领域的核心关注点。尽管持续的黑名单策略在一定程度上遏制了恶意活动,攻击者仍通过利用低成本注册服务、隐私保护功能及多样化的通用顶级域(gTLD)以规避检测。针对这一日益严峻的威胁,Fathima Mashood与Mohamed Nabeel等研究者于2026年通过VirusTotal平台收集了近152万个恶意域名,构建了malicious_domains数据集。该研究跨越2026年1月至5月,首创性地将域名区分为受侵域名(10.7%)与攻击者创建域名(89.3%),并融合WHOIS注册记录、被动DNS数据和Tranco排名,从时间分布、注册商偏好、基础设施集中度等八个维度刻画攻击者行为。这一数据集为实时检测、优先级阻断及政策制定提供了珍贵的当代资源,显著推动了网络安全实证研究的深入发展。
当前挑战
该数据集面临的核心挑战首先源于其研究领域的内在复杂性:恶意域名的快速更新周期与多样化的生成策略,使得传统基于检测标签的方法难以跟上攻击者的进化步伐,尤其是攻击者在注册后60天内即投入使用的行为,留给防御者极短的时间窗口进行干预。其次,在数据集构建过程中,数据融合与标注面临显著障碍:约10.1%的域名缺乏可解析的WHOIS创建日期,导致基于域名年龄的分类策略受限;同时,约11.9%的域名存在空的被动DNS解析记录,影响了基于查询量的潜在危害评估。此外,VirusTotal非全面覆盖的特性,以及部分流行域名可能被误归类为攻击者创建域名的风险,也对数据集的代表性与分类准确性提出了严峻挑战。
常用场景
经典使用场景
在网络安全研究领域,malicious_domains数据集被广泛用于恶意域名行为特征的挖掘与建模。该数据集收录了2026年1月至5月期间VirusTotal平台首次观测到的约152万个恶意域名,并辅以WHOIS注册记录、被动DNS解析历史和Tranco网站排名进行多维度标注。研究者常利用该数据集分析恶意域名的时间分布规律、注册商与顶级域名的滥用集中度、攻击域名与受损域名的比例结构,以及品牌仿冒的流行趋势,从而为基于DNS的威胁情报系统提供坚实的实证基础。
实际应用
在现实世界的网络安全防御体系中,该数据集展现出显著的应用价值。安全运营团队可依据数据集揭示的注册商滥用排名(GNAME、Dynadot等主导了超36%的攻击域名),优先与这些注册商建立快速下架协作机制。DNS服务提供商能利用高频查询域名的分布特征(99分位数达9万余次),针对性实施域名沉没(sinkholing)以阻断大规模恶意活动。品牌保护部门则可参照WhatsApp(19,511个仿冒域名)、Google(2,302个)等被冒充频率最高的品牌清单,构建自动化品牌监控流水线,及时拦截钓鱼攻击。同时,批量注册的模式发现为域名注册商制定速率限制策略提供了直接依据。
衍生相关工作
基于这一数据集,学术界已衍生出多项具有影响力的经典工作。在恶意域名分类维度,该研究细化了De Silva等人提出的内容无关分类方法,将攻击者创建与受损域名的判别逻辑从短期数据扩展至五个月的纵向分析,显著提升了分类体系的鲁棒性。在品牌仿冒层面,研究沿用了Kintis等人提出的combosquatting(组合抢注)分析框架,通过子串匹配技术将品牌保护范围从简单拼写变体拓展至更复杂的组合域名模式。此外,数据集还启发了新型DNS信誉系统的设计思路,探究如何将被动DNS查询计数作为恶意程度代理指标,借鉴了Antonakakis等人关于动态DNS声誉系统的早期理论,并在2026年的威胁格局下重新验证了基础设施共享等核心发现。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务