EMBER_cleaned
收藏资源简介:
EMBER Cleaned 是原始 EMBER(Endgame Malware Benchmark for Research)数据集的清理和 AI 就绪版本,广泛用于基于静态分析的 Windows 可执行文件(PE)恶意软件检测基准。该数据集保留了原始 EMBER 的目的,同时通过标准化元数据、移除重复样本、删除常量特征,并将未标记样本导出到专用分割中,使其更易于加载和用于下游实验。数据集包含 799,838 个标记样本(平衡了良性文件和恶意文件)和 199,966 个未标记样本,每个样本表示为从 PE 文件结构和内容中提取的 2,099 维数值特征向量。这些特征包括 PE 头信息、导入的 API/库、节统计、字节直方图相关信息和熵相关特性。数据集适用于二进制恶意软件检测、表格机器学习管道基准测试、特征重要性分析、半监督学习等任务。
EMBER Cleaned 数据集概述
数据集基本信息
- 数据集名称:EMBER Cleaned
- 原始数据集:EMBER (Endgame Malware Benchmark for Research)
- 原始提供方:Endgame / Elastic
- 语言:英语
- 许可证:MIT
- 任务类别:表格分类
- 标签:网络安全、恶意软件、静态分析、PE文件、恶意软件检测、基准测试、表格、AI就绪、聚类
- 数据规模:1M < n < 10M
数据集描述
EMBER Cleaned 是原始 EMBER(Endgame Malware Benchmark for Research) 数据集的清理和AI就绪版本。EMBER 是一个广泛使用的基准数据集,用于对Windows可移植可执行(PE)文件进行静态恶意软件检测。该清理版本保留了原始目的,同时使数据集更易于加载、更具可重复性,并更直接地适用于下游实验。
文件构成
| 文件 | 描述 |
|---|---|
ember_clean.npz |
包含行数/特征数计数和文件引用的索引文件 |
ember_clean_X.npy |
特征矩阵(float32),原始内存映射,形状 (799838, 2099) |
ember_clean_y.npy |
标签向量(int32),0 = 良性,1 = 恶意软件 |
ember_clean_metadata.parquet |
每个样本的元数据:SHA-256、时间戳、可用时的恶意软件相关字段、质量标志 |
ember_unlabeled.npz |
未标记数据分割的索引文件 |
ember_unlabeled_X.npy |
具有相同2,099个特征的未标记特征矩阵 |
ember_unlabeled_y.npy |
未标记分割的标签标记数组(int32);预期仅包含 -1 值 |
ember_clean_metadata_unlabeled.parquet |
未标记样本的元数据 |
manifest.json |
包含校验和和工件引用的版本化清单 |
ember_cleaned_dataset.ipynb |
探索和使用笔记本 |
数据内容
标记数据分割
- 799,838 个标记样本
- 良性和恶意文件之间大致平衡
- 2,099 个数值特征
- 特征数据类型:
float32 - 标签数据类型:
int32 - 标签:
0= 良性1= 恶意软件
未标记数据分割
- 199,966 个未标记样本
- 为半监督工作流程单独导出
- 相同的2,099维特征空间
- 不应被解释为良性或恶性的真实标签
特征表示
样本不是原始可执行文件。每个文件都表示为一个从原始PE文件提取的固定长度静态特征向量。这些特征描述了二进制文件的结构和统计属性,例如:
- PE头信息
- 导入的API/库
- 节区信息
- 字节直方图相关信息
- 熵相关特征
清理摘要
此版本是对原始EMBER工件应用质量控制和标准化流程的输出。
主要处理步骤:
- 使用特征指纹进行重复样本移除
- 常量特征过滤,将特征空间从2,381减少到2,099
- 元数据标准化
- 缺失值归一化和质量标记
- 标签分离,将
label = -1的样本导出到专用的未标记分割中 - 为可重复性和完整性检查生成清单
主要变更摘要:
- 移除了196个重复样本
- 删除了282个常量特征
- 单独导出了199,966个未标记样本
- 最终标记数据集形状:799,838 × 2,099
典型用例
EMBER Cleaned 支持:
- 二进制恶意软件检测
- 表格机器学习流程的基准测试
- 特征重要性分析
- 使用单独的未标记分割进行半监督学习
- 探索性数据分析
- 表示学习和聚类
注意事项与限制
- 这仅是一个静态分析数据集。
- 清理版本包含衍生特征,而非原始PE二进制文件。
- 未标记分割不应被视为真实标签。
- 不应在没有额外验证的情况下将EMBER的结果过度泛化到现代恶意软件。
- 该数据集旨在用于防御性研究、基准测试和教育。
引用
如果使用此数据集,请引用原始的EMBER论文: Anderson, H. S., & Roth, P. (2018). EMBER: An Open Dataset for Training Static PE Malware Machine Learning Models. arXiv. https://doi.org/10.48550/arXiv.1804.04637
原始参考信息
- 原始论文:Anderson, H. S., & Roth, P. (2018). EMBER: An Open Dataset for Training Static PE Malware Machine Learning Models
- 原始DOI:https://doi.org/10.48550/arXiv.1804.04637
- 原始项目/仓库:https://github.com/elastic/ember




