遇见数据集

GARAGE dataset

收藏
arXiv2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

GARAGE数据集是由高丽大学网络安全学院主导构建的汽车网络安全知识库,旨在为基于大语言模型的攻击图生成提供结构化数据支持。该数据集整合了12,786个CVE漏洞描述和140份安全事件文档,数据来源于AutoSec-Timeline仓库及公开技术文档,经过多阶段处理形成标准化知识表示。创建过程采用混合检索增强生成框架,通过四大语言模型进行实体抽取、关系提取和事件结构化,最终构建符合STIX 2.1标准和Auto-ISAC ATM框架的知识图谱与向量存储。该数据集主要应用于汽车网络安全领域,支持自动化威胁分析与风险评估,能够帮助识别跨电子控制单元的链式漏洞,提升车辆级攻击路径的生成准确性与效率。

The GARAGE Dataset is an automotive cybersecurity knowledge base primarily developed by the School of Cybersecurity at Korea University, aiming to provide structured data support for attack graph generation powered by large language models (LLMs). This dataset integrates 12,786 CVE vulnerability descriptions and 140 cybersecurity incident documents sourced from the AutoSec-Timeline repository and publicly available technical materials, and has undergone multi-stage processing to form standardized knowledge representations. Its development adopts a hybrid retrieval-augmented generation framework, leveraging four large language models to perform entity extraction, relation extraction and event structuring. Finally, it constructs knowledge graphs and vector storage that comply with the STIX 2.1 standard and the Auto-ISAC ATM framework. Mainly applied in the automotive cybersecurity field, this dataset supports automated threat analysis and risk assessment, helping identify chained vulnerabilities across electronic control units (ECUs) and improving the accuracy and efficiency of vehicle-level attack path generation.

创建时间:
2026-07-21
搜集汇总
数据集介绍
构建方式
GARAGE数据集由12,786条CVE记录与140份安全事件文档构成,数据源自AutoSec-Timeline存储库。构建过程首先通过基于正则表达式的筛选,从三家原始设备制造商(现代摩比斯、大众、起亚)的软件许可声明中提取与汽车软件相关的漏洞;安全事件数据则从技术博客、报告与演示文稿等源材料中经人工筛选与格式统一后获得。随后,利用四种大型语言模型(Gemini 3.0 Flash、GPT-5.2、Claude 4.5 Sonnet与DeepSeek-V3.2)独立执行实体提取、关系抽取与事件提取,生成遵循STIX 2.1与Auto-ISAC汽车威胁矩阵规范的结构化知识。通过嵌入向量聚类进行实体规范化处理以消除语义冗余,并使用监督微调模型对事件进行战术技术分类,最终构建出包含约8,824个唯一实体节点与9,265条关系边的知识图谱,同时辅以向量数据库存储重写的自然语言摘要。
使用方法
GARAGE数据集在设计上服务于汽车网络安全攻击图的自动化生成任务。使用者可通过检索增强生成框架,首先依据目标车辆架构规格提取实体种子节点,结合汽车威胁矩阵引导的查询在向量数据库中检索语义相似的攻击案例,同时遍历知识图谱获取结构性证据。随后将两类证据整合为统一提示,交由大型语言模型推演多阶段攻击路径,并以结构化JSON格式输出攻击图。数据集附带的评估体系包含实际可行性(衡量攻击路径的连贯生存能力)与知识重建(评估安全知识深度)双重指标,支持对不同语言模型在留一法实验下的性能对比,指导安全分析师在人类参与的工作流中高效部署该工具。
背景与挑战
背景概述
在智能网联汽车安全领域,攻击图生成是实现威胁分析与风险评估(TARA)自动化的关键环节。然而,传统方法受限于人工分析的跨领域知识壁垒与结构化程度不足,难以应对日益碎片化的网络威胁情报(CTI)。为填补这一空白,韩国高丽大学网络安全学院联合三星电子与韩国国防科学研究所的研究人员于2025年提出了GARAGE数据集。该数据集核心服务于基于检索增强生成(RAG)框架的自动化攻击图生成系统,涵盖12,786项CVE漏洞与140份安全事件报告,并严格遵循STIX 2.1与Auto-ISAC汽车威胁矩阵(ATM)标准。通过将分散的CTI转化为领域知识库,GARAGE为车辆级安全评估提供了可复现的数据基础,在Automotive CTI与LLM交叉领域树立了重要基准。
当前挑战
GARAGE数据集面临的核心挑战在于知识粒度与自动化推理边界之间的矛盾。一方面,领域问题层面,当前自动化工具难以处理非结构化CTI中隐含的汽车架构特异性,例如CAN总线协议、ECU间脆弱性链式利用等语义关联,导致传统基于规则或纯向量的方法在因果推理上存在结构性缺失。另一方面,数据集构建过程中,需要从多源异构文档(技术博客、PDF报告、YouTube转录等)中精准提取12类预定义实体与9种关系类型,并消除语义冗余——如将'CAN'与'Controller Area Network'归一化——同时通过留一法(LOO)实验严格排除目标攻击知识,迫使模型依赖跨案例知识迁移。此外,自动化边界实验揭示了战术级别场景(如初始访问覆盖率95%)与实现细节级别(如执行阶段仅15%)的显著性能落差,表明底层固件逆向与协议特异性分析仍需人类专家介入,这为构建端到端自动化系统设定了物理上限。
常用场景
经典使用场景
在车载网络安全领域,GARAGE数据集被广泛用于构建和评估基于大语言模型的自动化攻击图生成系统。该数据集整合了12,786条CVE记录与140份安全事件报告,并按照STIX 2.1和Auto-ISAC ATM标准构建了领域特定的知识库。研究者通过该数据集验证利用混合检索增强生成框架从非结构化威胁情报中提取实体、关系和事件,进而生成符合车辆架构特征的攻击路径。其典型的实验范式为留一法,即在排除目标攻击案例知识的前提下,评估模型对未知威胁的推理能力,使该数据集成为衡量知识迁移性能的核心基准。
解决学术问题
该数据集解决了车载网络安全领域长期存在的自动化威胁建模难题,尤其弥补了传统威胁分析与风险评估方法在应对跨ECU、多层级攻击链时的能力不足。通过引入基于知识图谱与向量检索的混合RAG方法,GARAGE数据集实现了从碎片化网络威胁情报到可执行攻击图的系统化转换,显著提升了战术模式层面威胁场景的自动生成效率。实验结果表明,在大模型生成攻击路径的可行性得分达到59.0/100的同时,该数据集帮助学界明晰了自动化与人工干预之间的边界,即高层战术推理可由模型自主完成,而底层实现细节仍需专家介入。
实际应用
在实际工业场景中,GARAGE数据集作为支撑UN R155与ISO/SAE 21434合规性评估的实用工具,能够系统性生成初始威胁场景候选。其高覆盖率的初始访问(95.0%)与影响车辆功能(98.8%)战术分析能力,帮助安全分析师发现可能被忽略的攻击入口与后果。数据集成品化后可在人机协同工作流中扮演专家助手角色,自动完成初始威胁探索,而将执行与命令控制等低覆盖率技术环节的验证工作交由领域专家处理。此外,数据集提供的成本效益分析指南支持不同层级大模型的实际部署选择,从准确性优先的专有模型到面向气隙环境的高性价比开源模型均有覆盖。
数据集最近研究
最新研究方向
GARAGE数据集聚焦于大语言模型在汽车网络安全领域的自动化攻击图生成,前沿研究方向集中在通过检索增强生成与知识图谱的混合架构,实现跨车辆架构的威胁知识迁移。该研究通过320次留一法实验,验证了模型在战术模式层面(如初始访问成功率95%)的自动化推理能力,同时揭示了在实施细节层面(如执行阶段仅15%)需要人类专家介入的自动化边界。数据集将12786个CVE和140个安全事件结构化为STIX 2.1兼容的知识库,为UN R155和ISO/SAE 21434合规的威胁分析与风险评估提供了可扩展的自动化支持工具,并量化了从开源到闭源模型间成本-性能的权衡策略。
相关研究论文
  • 1
    GARAGE: Characterizing the Automation Boundary in LLM-based Attack Graph Generation高丽大学·网络安全学院; 三星电子; 国防发展局 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务