Adversarial Malware Dataset
收藏资源简介:
该对抗性恶意软件数据集由捷克技术大学研究团队构建,基于真实世界恶意软件样本库RawMal-TF生成,包含按家族和类型标记的两个子集共计77,943个对抗性PE文件。数据集采用多种对抗生成技术(包括Gym-malware、MAB-Malware等工具)对原始恶意软件进行功能保持性修改,每个样本均附带详细的元数据,包括EMBER分类器评分和VirusTotal检测结果。该数据集专门设计用于评估机器学习恶意软件检测系统的鲁棒性,支持对抗训练、数据投毒攻击研究等安全应用场景,旨在提升网络安全防御体系对抗新型逃避攻击的能力。
This adversarial malware dataset was constructed by a research team at the Czech Technical University in Prague, based on the real-world malware sample repository RawMal-TF. It contains two subsets labeled by malware family and type, totaling 77,943 adversarial PE files. The dataset utilizes multiple adversarial generation techniques (including tools such as Gym-malware and MAB-Malware) to conduct functionality-preserving modifications on original malware samples. Each sample is accompanied by detailed metadata, including EMBER classifier scores and VirusTotal detection results. This dataset is specifically designed to evaluate the robustness of machine learning-based malware detection systems, supporting security application scenarios such as adversarial training and data poisoning attack research, with the goal of improving the ability of cybersecurity defense systems to counter novel evasion attacks.
数据集概述
本数据集专注于对抗性恶意软件样本构建,旨在评估和提升基于机器学习的恶意软件检测系统的鲁棒性。
- 来源数据集:基于公开的 RawMal-TF 真实恶意软件二进制文件集合生成。
- 生成方法:使用一套对抗性恶意软件生成器,构建了两组对抗性PE文件样本。
- 样本规模:
- 家族标签样本:共 44,347 个样本。
- 类型标签样本:共 33,596 个样本。
- 逃逸性能:
- 家族标签样本针对 EMBER 分类器的逃逸率高达 98.35%。
- 类型标签样本针对 EMBER 分类器的逃逸率为 92.20%。
- 元数据:每个对抗性二进制文件均附带详细的元数据,包括 EMBER 评分和 VirusTotal 分类结果。
- 数据中毒实验:通过训练实验证明,该数据集可被用于数据中毒攻击研究。实验表明,在家族标签数据集的训练数据中注入仅占 0.5% 的完全错误标记的对抗性样本,可将重新训练后的分类器的逃逸率从 26.1% 提升至 92.8%。
- 主题领域:归属计算机科学下的 密码学与安全 (cs.CR) 和 机器学习 (cs.LG)。
- 发布状态:数据集已公开发布,旨在促进对抗性恶意软件、中毒攻击以及基于机器学习的恶意软件检测系统鲁棒性方面的未来研究。

- 1Building an Adversarial Malware Dataset by Family and Type: Generation, Evasion, and Poisoning Evaluation捷克技术大学·信息学院·信息安全系 · 2026年




