遇见数据集

auren-research/astraea-unified-threat

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

Astraea统一威胁数据集(v4)是由Auren Research开发的一个高度优化、生产平衡的遥测数据集,专为微调现代多任务编码器架构(如chandar-lab/NeoBERT和answerdotai/ModernBERT)而设计。该数据集通过将原始事件流聚合为按时间顺序排列的多行会话,使编码器模型能够学习长上下文时间相关性、计算连续异常分数,并对妥协指标(IOC)执行令牌级命名实体识别。数据集包含274,778行按时间顺序会话化的日志流,类别平衡(is_malicious)为44.7%,以模拟真实世界生产环境;平均异常得分为0.458;已验证的IOC跨度为1,136,768个字符偏移;覆盖822种独特的MITRE技术;语言为100%英语;格式为Parquet(zstd压缩),压缩后大小为132.0 MB。技术特点包括:2026年威胁向量遥测,涵盖现代企业攻击面;良性背景基线,包含140,000个基线企业会话;令牌边界模糊化,以强制行为模式学习。数据模式包含12个结构化列,如row_id、text、source、label_type等,用于统一的多头架构训练。

Developed by Auren Research, Astraea Unified Threat (v4) is a highly optimized, production-balanced telemetry dataset engineered for fine-tuning modern multi-task encoder architectures (such as chandar-lab/NeoBERT and answerdotai/ModernBERT). By aggregating raw event streams into chronological multi-line sessions, Astraea enables encoder models to learn long-context temporal correlations, compute continuous anomaly scores, and perform token-level named entity recognition (NER) on indicators of compromise. The dataset includes 274,778 rows of chronological sessionized log streams with a class balance (is_malicious) of 44.7%, a mean anomaly score of 0.458, 1,136,768 validated IOC spans, coverage of 822 unique MITRE techniques, 100% English language, and a compressed Parquet (zstd) format of 132.0 MB. Technical features incorporate 2026 threat vector telemetry, benign background baseline sessions, and token boundary fuzzing. The data schema consists of 12 structured columns for unified multi-head architecture training.

提供机构:
auren-research
搜集汇总
数据集介绍
auren-research/astraea-unified-threat 数据集图片
构建方式
Astraea Unified Threat Dataset v4由Auren Research团队构建,旨在为多任务编码器架构提供生产环境均衡的遥测数据。该数据集通过整合21种日志类型(涵盖Windows、Linux、云平台、端点检测与响应、网络、身份与访问管理、Kubernetes、Web应用防火墙及电子邮件等)与23个数据来源,模拟了企业攻击面。构建过程采用任务感知前缀机制(如[TASK=LOG_CLS]),使单一模型能够同时处理日志分类、入侵指标抽取、MITRE ATT&CK映射、攻击链分类及钓鱼检测等任务。数据集包含27万余条记录,分为训练集、验证集和测试集,并严格确保各分割间无文本重叠,防止数据泄漏。
特点
该数据集的核心特点在于其生产环境均衡性与任务多样性。恶意样本占比为44.2%,异常分数均值0.443,有效模拟了真实场景中的威胁分布。数据集提供了超过113万个已验证的入侵指标跨度注释,覆盖IP、域名、哈希值等九种类型。在MITRE ATT&CK覆盖方面,包含19种技术与10种策略,为威胁狩猎提供了丰富的标签体系。此外,数据集通过令牌边界模糊化处理(随机化IP、域名、哈希与文件名)鼓励模型学习行为模式而非机械记忆,并引入了2026年威胁向量场景,包括无人类身份滥用、CI/CD与OAuth妥协、云审计异常及生成式AI驱动的鱼叉式钓鱼等先进攻击模式。
使用方法
研究者可通过Hugging Face datasets库加载Parquet格式的官方分割文件,使用load_dataset函数直接读取训练、验证与测试数据。使用时需注意text字段包含[TASK=...]任务前缀,应将其完整输入编码器模型(如ModernBERT),并基于label_type字段选择对应的任务头进行微调。日志分类与入侵指标抽取任务可依赖验证集进行评估,而MITRE映射与攻击链分析需自行从训练集中划分持有样本;测试集专为钓鱼检测设计,包含两万条公共钓鱼邮件样本,用于无偏评估。推荐采用多任务学习策略,通过共享编码器与独立任务头实现高效训练。
背景与挑战
背景概述
Astraea Unified Threat Dataset v4是由Auren Research于2026年开发的综合性网络安全遥测数据集,旨在应对现代企业级安全运营中心(SOC)中多任务学习的迫切需求。该数据集的核心研究问题聚焦于如何通过统一的文本前缀任务标记(如TASK=LOG_CLS)训练单一编码器架构同时执行日志分类、IOC提取、MITRE ATT&CK映射、攻击链分类和钓鱼检测等五项安全任务。其开创性在于构建了生产环境平衡的遥测数据,包含超过27万条结构化日志和邮件载荷,覆盖21种日志类型与23种数据源,并集成19项MITRE技术与10项战术。该数据集的出现填补了网络安全领域缺乏多任务、长上下文、防泄露的高质量基准数据集的空白,为ModernBERT等先进编码器的微调提供了标准化平台,推动了安全AI模型从单任务向多任务泛化的范式转变。
当前挑战
Astraea Unified Threat Dataset v4所解决的领域挑战包括:传统安全模型依赖单任务专用数据集,导致部署时需维护多个独立模型,效率低下且难以捕捉跨任务关联攻击模式;现有基准数据常存在标签泄露问题,且缺乏对云审计、CI/CD滥用、生成式AI钓鱼等2026年新型威胁向量的覆盖。其构建过程中的关键挑战在于:如何生成生产环境平衡的正负样本(正样本44.2%)以避免模型对日志类型的捷径学习;如何设计任务感知的分割方案确保训练、验证与测试集间无文本重叠;以及如何通过令牌边界模糊化技术(随机化IP、域名、哈希值)强制模型学习行为模式而非记忆特征,同时保持IOC标注的高精度(验证集达110万有效字符偏移)。
常用场景
经典使用场景
在网络安全领域,Astraea Unified Threat v4数据集为多任务安全编码器模型的精调提供了标杆性的训练资源。其核心使用场景包括日志分类、入侵指标(IOC)的命名实体识别、MITRE ATT&CK战术与技术映射、攻击链分类以及钓鱼邮件检测。通过为每条安全日志或邮件负载添加任务前缀(如[TASK=LOG_CLS]),研究者可在一个统一框架下训练单一模型完成多项安全分析任务,极大提升了安全运营场景下的模型泛化能力与部署效率。
实际应用
在实际安全运营中,该数据集支撑了全自动安全编排与响应(SOAR)管线的构建。基于精调的模型可同时执行日志告警优先级排序、可疑文件哈希与恶意域名提取、攻击者TTP(战术、技术与过程)自动识别及针对定向钓鱼攻击的精准拦截。其模拟了2026年威胁向量的真实环境,包括非人类身份滥用、CI/CD管道攻击、云审计异常和AI增强型鱼叉式钓鱼,使安全团队能够在生产级场景中有效降低误报率并加速威胁响应。
衍生相关工作
基于该数据集,研究社区已衍生出多项开创性工作。例如,适配ModernBERT与NeoBERT等长上下文编码器架构的多任务安全模型,实现了单一模型在日志分类、IOC抽取和MITRE映射等五个任务上的联合优化。此外,利用其公共钓鱼测试集,衍生出一系列针对生成式AI钓鱼邮件检测的鲁棒性研究,以及将攻击链预测与ATT&CK知识图谱融合的推理增强方法,推动了安全领域从单点检测向战役级态势感知的演进步伐。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务