five

harpomaxx/dga-detection|网络安全数据集|恶意软件分析数据集

收藏
hugging_face2023-05-10 更新2024-03-04 收录
网络安全
恶意软件分析
下载链接:
https://hf-mirror.com/datasets/harpomaxx/dga-detection
下载链接
链接失效反馈
资源简介:
该数据集包含DGA(域名生成算法)生成的域名和正常域名。正常域名来源于Alexa排名前一百万的域名,以及Bambenek Consulting提供的3,161个可疑但非DGA生成的域名,总计1,003,161个正常域名。DGA域名来源于Andrey Abakumov和John Bambenek的仓库,总计1,915,335个DGA域名,涉及51种不同的恶意软件家族。其中约55%的DGA域名样本来自Banjori、Post、Timba、Cryptolocker、Ramdo和Conficker等恶意软件。DGA生成方案包括简单的算术方案(A)和基于单词的方案(W)。算术方案通过计算可直接表示为ASCII字符的序列生成域名,而基于单词的方案则是通过拼接一个或多个单词列表中的单词生成域名。
提供机构:
harpomaxx
原始信息汇总

数据集概述

数据集内容

  • 正常域名:数据集包含来自Alexa排名前一百万的域名,以及由Bambenek Consulting提供的额外3,161个正常域名,这些域名被认为是可疑的但非DGA生成。
  • DGA域名:数据集中的DGA域名来源于Andrey Abakumov和John Bambenek的DGA域名仓库,总数为1,915,335个。

数据集规模

  • 正常域名总数:1,003,161个。
  • DGA域名总数:1,915,335个。

数据集特点

  • DGA域名来源:DGA域名对应51种不同的恶意软件家族。
  • DGA生成方案:包括简单的算术(A)和基于单词(W)的生成方案。
  • DGA域名构成:约55%的DGA域名来自Banjori、Post、Timba、Cryptolocker、Ramdo和Conficker这六种恶意软件。

数据集许可

  • 许可证:CC-BY-2.0
用户留言
有没有相关的论文或文献参考?
这个数据集是基于什么背景创建的?
数据集的作者是谁?
能帮我联系到这个数据集的作者吗?
这个数据集如何下载?
点击留言
数据主题
具身智能
数据集  4098个
机构  8个
大模型
数据集  439个
机构  10个
无人机
数据集  37个
机构  6个
指令微调
数据集  36个
机构  6个
蛋白质结构
数据集  50个
机构  8个
空间智能
数据集  21个
机构  5个
5,000+
优质数据集
54 个
任务类型
进入经典数据集
热门数据集

中国气象数据

本数据集包含了中国2023年1月至11月的气象数据,包括日照时间、降雨量、温度、风速等关键数据。通过这些数据,可以深入了解气象现象对不同地区的影响,并通过可视化工具揭示中国的气温分布、降水情况、风速趋势等。

github 收录

中国1km分辨率逐月降水量数据集(1901-2023)

该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。

国家青藏高原科学数据中心 收录

中国区域交通网络数据集

该数据集包含中国各区域的交通网络信息,包括道路、铁路、航空和水路等多种交通方式的网络结构和连接关系。数据集详细记录了各交通节点的位置、交通线路的类型、长度、容量以及相关的交通流量信息。

data.stats.gov.cn 收录

中国农村金融统计数据

该数据集包含了中国农村金融的统计信息,涵盖了农村金融机构的数量、贷款余额、存款余额、金融服务覆盖率等关键指标。数据按年度和地区分类,提供了详细的农村金融发展状况。

www.pbc.gov.cn 收录

THUCNews

THUCNews是根据新浪新闻RSS订阅频道2005~2011年间的历史数据筛选过滤生成,包含74万篇新闻文档(2.19 GB),均为UTF-8纯文本格式。本次比赛数据集在原始新浪新闻分类体系的基础上,重新整合划分出14个候选分类类别:财经、彩票、房产、股票、家居、教育、科技、社会、时尚、时政、体育、星座、游戏、娱乐。提供训练数据共832471条。

github 收录