遇见数据集

Malware Research Hub

收藏
github2026-08-07 更新2026-08-08 收录
官方服务:

资源简介:

自包含的恶意软件研究中心:精选的80个家族(1971-2024)目录,加上2,699个真实加密样本,可索引和搜索。

Self-contained Malware Research Hub: A curated catalog of 80 malware families spanning 1971 to 2024, together with 2,699 real encrypted malware samples that are indexable and searchable.

创建时间:
2026-08-06
原始信息汇总

☣️ Malware Research Hub — 数据集概述

基本信息

  • 名称: Malware Research Hub
  • 地址: https://github.com/darama22/Malware-Research-Hub
  • 性质: 本地化恶意软件研究平台(自包含式恶意软件情报工具库)
  • 时间覆盖: 1971年(Creeper)至 2024年,共计53年
  • 语言支持: 西班牙语(ES)与英语(EN)双语

数据规模

指标 数量
恶意软件标本(Specimens) 2,681(另有标注2,699处)
恶意软件家族(Families) 80
集成数据集(Collections) 11

功能模块

模块 说明
🗂️ 取证目录(Catálogo forense) 80个经去重处理的恶意软件家族,将同源变体/重制版(如Petya/NotPetya/GoldenEye)归并为单一条目,包含影响、归因与时间线信息
🔬 标本浏览器(Explorador de especímenes) 2,699个可搜索、可筛选的样本(按家族、平台、类型、数据集筛选),支持直达对应文件夹
🌐 资源中心(Hub de recursos) 汇集仓库、沙箱、机器学习数据集(EMBER/SOREL-20M)、模糊哈希(IMPHASH/SSDeep/TLSH)、STIX/MAEC 标准等研究资源
📡 自动采集器(Captador automático) mb_download.py 脚本可通过 API 从可信来源扩充样本库(校验哈希、加密交付)
🔐 设计性隔离(Contención por diseño) 所有样本均存放于加密 ZIP(密码为 infected)中;服务器不执行也不提供二进制文件,树目录中无原始可执行文件

内置数据集(Collections)构成

数据集 标本数 内容
Malware-Database — Src 1,041 按平台分类的源代码(MSDOS、Win32、Linux等)
VX-Underground 364 按语言/平台分类的恶意软件源码
theZoo 359 各家族的加密二进制文件 + 源代码
Malware-Database 314 按类别分类的历史二进制文件(加密)
VX-API 261 用 C/C++ 记录的恶意软件技术
JavaScript Malware 144 按日期分组的 JS 样本(加密)
Malware-Samples 130 现代恶意软件家族(加密)
InQuest Samples 41 Office宏、PDF、脚本等攻击载荷 + VirusTotal 元数据
MalwareBazaar 43 通过官方 API 下载(哈希已校验)
Stuxnet 1 dropper + rootkit 源代码
NotPetya 1 文件加密器源代码

数据安全与使用限制

  • 所有样本均为真实且功能完整的恶意软件,一旦在非隔离环境运行即可造成加密、窃取、监控或破坏
  • 所有样本存放于**加密 ZIP(密码 infected)**中,禁止在主系统解压
  • 操作环境要求:仅限隔离虚拟机(host-only / 无网络)并启用快照,配合 REMnux + FakeNet-NG 使用
  • 服务器设计为不执行、不提供二进制文件,仅提供元数据与"打开文件夹"功能

技术架构

  • 技术栈: Python + Flask
  • 启动方式: 运行 indexer.py 生成索引,再运行 server.py(默认端口 http://127.0.0.1:5057)
  • 可扩展性: 通过 mb_download.py(需 MalwareBazaar 免费 API 密钥)及 integrate_collections.py 可扩充样本库
  • 目录结构: app/(Flask引擎、索引器、采集器、网页界面)与 collections/(加密活体标本)

数据来源与授权

  • 语料库由公开知名研究数据集聚合而成:theZoo、VX-Underground、MalwareBazaar/abuse.ch、InQuest、javascript-malware-collection 等
  • 每个子集保留其原始许可协议(存放于各自文件夹)
  • 数据集仅限教育目的与防御性网络安全研究,恶意分发或执行属违法行为
搜集汇总
数据集介绍
Malware Research Hub 数据集图片
构建方式
Malware Research Hub是一个精心构建的恶意软件研究平台,其构建方式体现了严谨的学术态度与工程实践。该数据集汇集了来自theZoo、VX-Underground、MalwareBazaar等公认研究来源的2,699个真实恶意软件样本,覆盖80个家族与11个独立子集,时间跨度从1971年的Creeper到2024年的现代勒索软件。所有样本均经过AES加密封装于ZIP容器中,并以密码'infected'保护,确保原始二进制文件不直接暴露于存储体系。平台通过自研索引器扫描collections目录,生成跨语言(西班牙语与英语)的结构化目录,同时利用mb_download.py脚本从可靠API动态扩充样本库,全部流程实现了自动化与安全性的平衡。
特点
该数据集的核心特色在于其多维度的组织架构与深度整合能力。每个恶意软件家族均经过去重处理,将同一威胁的变体(如Petya/NotPetya/GoldenEye)归并为单一条目,并附有影响范围、归属推演与时间线信息。样本库支持按家族、平台、类型及来源子集的多维过滤,直通真实样本文件夹的路径跳转功能极大提升了研究效率。平台内置的资源配置中心整合了机器学习数据集(EMBER/SOREL-20M)、模糊哈希工具(IMPHASH/SSDeep/TLSH)及STIX/MAEC标准文档,为深度分析提供了完善的基础设施。严格的隔离策略确保服务器默认不执行任何二进制文件,仅提供元数据服务,构筑了安全的研究边界。
使用方法
使用该数据集时,研究者需遵循严格的操作规程。推荐在配置了快照功能的隔离虚拟机(如REMnux配合FakeNet-NG)中进行,并确保网络设置为host-only模式。启动流程简洁高效:通过Python虚拟环境安装Flask依赖后,依次运行indexer.py生成索引与server.py启动本地Web服务(默认端口5057),即可在浏览器中访问交互式搜索界面。样本均以加密ZIP形式存储,密码为'infected',严禁在主机环境中解压。扩充样本库时,用户需从abuse.ch申请免费API密钥,通过mb_download.py按签名或家族定向下载,随后调用integrate_collections.py完成自动加密与重新索引。所有操作必须秉持防御性安全研究的伦理准则。
背景与挑战
背景概述
Malware Research Hub 数据集创建于2024年,由网络安全研究社区维护,旨在提供一个全面、结构化的恶意软件研究资源库。该平台整合了从1971年Creeper到现代勒索软件的2,699个真实恶意软件样本,覆盖80个家族和11个集合,横跨53年历史。其核心研究问题在于为防御性网络安全研究提供可访问、可搜索的恶意软件语料库,同时确保样本安全封装。作为开源项目,它汇集了theZoo、VX-Underground等公认资源,对恶意软件分析、机器学习模型训练及威胁情报研究具有重要影响力,促进了该领域的数据共享与协作。
当前挑战
该数据集面临的挑战主要涉及两大方面。其一,领域内研究难题:恶意软件样本的多样性与快速演化导致分类与特征提取困难,且样本的时效性要求持续更新以应对新型威胁。其二,构建过程中的安全困境:需在提供真实样本与确保安全间取得平衡,所有样本必须加密存储,严禁直接执行,操作需在隔离环境中进行,以防止泄露或误用。此外,数据整合需处理多源格式兼容与去重,同时遵循法律合规,确保仅用于教育与研究目的,这些均对数据集的可扩展性与可用性构成持续挑战。
常用场景
经典使用场景
Malware Research Hub作为集成了2,699个真实恶意软件样本、覆盖80个家族、横跨1971年至2024年的综合恶意软件语料库,其经典使用场景聚焦于网络安全领域的深度剖析与逆向工程研究。研究人员可在隔离的虚拟机环境中,利用该库对各类恶意软件进行静态与动态分析,追溯其攻击载体、传播机制与载荷行为。其内置的搜索与过滤功能支持按家族、平台、类型及集合进行定向筛选,极大便利了针对特定恶意软件系谱的追踪与验证,成为学术验证、威胁建模及入侵检测算法训练的基石性数据源。
解决学术问题
该数据集解决了长期困扰学术界的恶意软件样本稀缺、分散且缺乏统一标注的问题,为实证研究提供了规模可观且体系化的语料基础。其去重后的家族目录整合了Petya/NotPetya/GoldenEye等变种,厘清了恶意软件的演化脉络,助力学术研究深入剖析恶意代码的分支衍化规律与攻击策略的迁移路径。同时,加密存储与隔离操作规范保障了研究过程的安全性与合规性,使得大规模、可复现的恶意软件分类、聚类及行为预测实验成为可能,有力推动了该领域理论模型的验证与迭代。
衍生相关工作
该数据集衍生了多项具有影响力的学术与工程工作,尤其在恶意软件表征学习与智能检测领域。基于其丰富的样本与标签,研究者已开发出针对恶意软件家族分类的深度神经网络模型,并探索了将静态特征(如IMPHASH、SSDeep)与动态行为序列相结合的融合表征方法,显著提升了恶意变种的识别精度。此外,数据集中包含的密集代码样本启发了对恶意软件编写模式及其演化趋势的计量分析,为软件基因学理论提供了坚实的数据支撑。同时,该数据集与EMBER、SOREL-20M等公开数据集互为补充,共同推动了机器学习模型在恶意软件检测中的对抗鲁棒性与泛化能力研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务