遇见数据集

Jordan123234/malware-families-catalog

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

恶意软件家族目录是一个包含2,899个真实世界恶意软件家族的数据集,这些家族提取自EMBER 2018基准,并为安全团队、SOC分析师和事件响应进行了分类。数据集总计包含2,899个家族,其中245个已分类(经过人工整理),2,654个未分类(长尾部分)。类别共有19种,如特洛伊木马、银行木马、勒索软件等。数据来源于EMBER 2018 v2(Elastic恶意软件基准),采用Parquet格式(附带JSONL镜像),每个记录代表一个恶意软件家族,包含家族名称、样本数量、类别、描述和事件响应指导等字段。该目录旨在帮助安全运营中心分析师构建或调整检测规则,威胁情报团队生成报告,机器学习研究人员训练恶意软件分类器,以及事件响应人员快速分类和处理感染事件。

The Malware Family Catalog is a dataset comprising 2,899 real-world malware families extracted from the EMBER 2018 benchmark, which has been categorized for security teams, SOC analysts, and incident responders. The dataset totals 2,899 families, among which 245 are manually curated and categorized, while the remaining 2,654 remain uncategorized (long-tail segment). There are 19 categories in total, including Trojan, banking Trojan, ransomware, and others. The dataset is sourced from EMBER 2018 v2 (Elastic Malware Benchmark), and is provided in Parquet format with a JSONL mirror. Each record represents a malware family, containing fields such as family name, sample count, category, description, and incident response guidance. This catalog aims to assist SOC analysts in developing or tuning detection rules, threat intelligence teams in generating reports, machine learning researchers in training malware classifiers, and incident responders in rapidly classifying and handling infection incidents.

提供机构:
Jordan123234
搜集汇总
数据集介绍
Jordan123234/malware-families-catalog 数据集图片
构建方式
该数据集源自EMBER 2018 v2基准测试集,后者由Elastic发布,包含110万份Windows PE二进制样本及其预提取的静态特征。研究团队依据avclass工具对每一样本进行家族标签共识投票,聚合所有样本的avclass标签并统计频次,从而获得2899个独特的恶意软件家族名称。在此基础上,对样本量最高的245个家族以及部分中等规模的家族,基于公共威胁情报报告和反病毒厂商文档,手工分配了19个高级类别,并为每个家族撰写了简短的事实性描述。对于样本量极低的长尾家族,则标记为“未知”类别,以避免因无法验证而降低数据集的可靠性。
特点
该数据集以类别分布的长尾特性为核心特征,其中2653个家族归入“未知”类别,剩余246个家族则被细分为特洛伊木马、银行木马、勒索软件、蠕虫、间谍软件等19个涵盖主流行业分类法的类别。每条记录包含家族名称、样本数量、高级类别、描述及标准化应急响应指南五个字段。对于Emotet、Qbot等高频家族,数据集还额外丰富了来自CISA公告、MITRE ATT&CK框架及供应商威胁报告的结构化字段,涵盖IOC捆绑包、检测规则引用、遏制策略及具体ATT&CK技术ID,为深度分析提供了元数据支撑。
使用方法
用户可通过Hugging Face Datasets库以标准接口加载数据集,例如执行`load_dataset("Jordan123234/malware-families-catalog")`即可获取训练集。数据以Parquet格式提供,并附有JSONL镜像。每条样本可通过字段名称直接访问,适合安全运营中心分析师用于校验现有检测规则覆盖的家族优先级,威胁情报团队用于生成类别级统计汇总报告,机器学习研究者则可在EMBER 2018特征基础上结合本目录的可读标签进行多分类模型训练。此外,应急响应人员在获取家族名称后,可快速查找类别并匹配对应的处置手册。
背景与挑战
背景概述
恶意软件家族分类是网络安全领域长期关注的核心议题之一,精准的家族标签体系对于威胁情报分析、入侵响应以及机器学习驱动的恶意软件检测均具有基础性支撑作用。在此背景下,由SystemHelpdesk团队于2026年创建的Malware Families Catalog数据集应运而生,它基于Elastic公司发布的EMBER 2018 v2基准数据集,对其中包含的1.1百万个PE二进制样本进行了avclass标签聚合与人工归约,最终形成了涵盖2,899个真实恶意软件家族的目录体系,其中246个高频家族被细分为19个高等级类别。该数据集以Apache-2.0许可协议公开,并同步至Hugging Face、Kaggle与GitHub多平台,为安全运营中心分析师、威胁情报团队及机器学习研究者提供了可直接使用的标准化恶意软件家族参考,在促进安全研究可复现性与跨团队协作方面具有显著影响。
当前挑战
该数据集所解决的领域问题之一是恶意软件分类的语义鸿沟:原始EMBER数据集仅提供avclass原始标签,缺乏可解释的家族类别与行为描述,使得安全分析师在研判威胁类型时效率低下。此外,构建过程中面临的挑战尤为突出:首先,长尾分布现象严重,2,653个低频家族因样本稀少且缺乏公开威胁情报佐证,无法可靠归类,研究团队选择将其标记为‘unknown’以避免臆测,但这限制了数据集的覆盖完整性;其次,avclass标签来源于多款杀毒引擎的投票一致结果,对模糊样本可能出现错误标注,而人工归约过程需依赖公开威胁情报、厂商报告与学术论文进行交叉验证,工作量巨大且难以完全避免主观偏差。
常用场景
经典使用场景
在网络安全研究领域,Malware Families Catalog数据集最典型的应用场景是作为恶意软件家族分类与标注的基准参考。该数据集从EMBER 2018数据集中提取了2,899个真实恶意软件家族的标签,并对其中的246个知名家族进行了人工归类,涵盖19个高等级类别(如木马、银行木马、勒索软件、蠕虫等)。研究人员可以借助该数据集为大规模恶意软件样本提供精准的语义标签,从而将原本抽象的二进制特征映射到可解释的家族名称和威胁类别上,为后续的多分类机器学习模型训练提供标准化的标注依据。
实际应用
在实际网络安全运营中,该数据集展现出广泛的应用价值。安全运营中心的分析师可利用其构建和验证SIEM系统的检测规则,通过样本数量这一流行度指标优先覆盖最具威胁的家族。威胁情报团队能够将细粒度的家族级遥测汇总为类别级摘要,便于向管理层汇报。应急响应人员在处理疑似感染事件时,可借助该数据集快速查杀毒引擎返回的家族名称,立即确定其所属的高层类别(如勒索软件还是银行木马),从而依据标准化的事件响应手册采取正确的隔离措施。托管安全服务提供商亦可利用统一的类别标签构建跨客户的安全态势仪表盘。
衍生相关工作
该数据集衍生出多项具有影响力的相关工作。首先,它直接支撑了基于EMBER特征的多分类机器学习研究,使研究者能够从传统的二分类恶意软件检测迈向更细粒度的家族级分类。其次,数据集为234个高频恶意家族增加了丰富的结构化字段,包括公开情报源中的入侵指标、ATT&CK技术映射、检测规则的Sigma与Yara引用,以及应急响应隔离措施,形成了从明确技术细节到可操作防御建议的完整情报链条。此外,该数据集还衍生出跨平台同步的自动化工作流,数据可从GitHub自动推送至Hugging Face和Kaggle,为安全社区提供了持续更新、可复用的开源恶意软件情报资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务