遇见数据集

VANET-IDS26

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

VANET-IDS26是一个大规模车载自组织网络入侵检测数据集,包含良性VANET消息和26种网络攻击类别。该数据集专为VANET网络安全、入侵检测系统、机器学习、深度学习、基于Transformer的模型、图学习和联邦学习等研究设计。数据集总规模为786,798,378行,46列,其中良性记录37,577,963行,攻击记录749,220,415行,压缩后主文件约79GB。数据由20个大型模拟运行生成,涵盖四种交通密度(低、中、高、极高)和四种攻击者比例(5%、10%、20%、30%)。每条记录包含二进制标签(0表示良性,1表示攻击)和多类标签(0-26,对应26种具体攻击类型,如位置伪造、运动学伪造、事件伪造、定时重放、身份欺骗和可用性洪水等)。数据集提供了46个详细字段,包括模拟时间、真实与声称的发送者ID、坐标、速度、加速度、航向、车道信息、攻击相关参数以及为Transformer模型准备的文本表示(`text_input`列)。数据集以单一压缩CSV文件形式发布,支持用户自定义数据划分策略,适用于二进制入侵检测、多类攻击分类、传统机器学习、深度学习、图学习和联邦学习等多种任务。GitHub仓库提供了一个包含27,000行(每类1,000行)的平衡样本用于快速测试。

VANET-IDS26 is a large-scale Vehicular Ad-hoc Network intrusion detection dataset containing benign VANET messages and 26 categories of network attacks. This dataset is specifically designed for research in VANET network security, intrusion detection systems, machine learning, deep learning, Transformer-based models, graph learning, and federated learning. The total dataset size is 786,798,378 rows and 46 columns, with 37,577,963 benign records and 749,220,415 attack records, and the compressed main file is approximately 79GB. Data is generated from 20 large-scale simulation runs, covering four traffic densities (low, medium, high, very high) and four attacker ratios (5%, 10%, 20%, 30%). Each record includes binary labels (0 for benign, 1 for attack) and multi-class labels (0-26, corresponding to 26 specific attack types, such as location forgery, kinematics forgery, event forgery, timed replay, identity spoofing, and availability flooding). The dataset provides 46 detailed fields, including simulation time, real and claimed sender IDs, coordinates, speed, acceleration, heading, lane information, attack-related parameters, and a text representation for Transformer models (`text_input` column). The dataset is released as a single compressed CSV file, supporting user-defined data splitting strategies, and is suitable for various tasks such as binary intrusion detection, multi-class attack classification, traditional machine learning, deep learning, graph learning, and federated learning. A balanced sample of 27,000 rows (1,000 rows per class) is provided in the GitHub repository for quick testing.

创建时间:
2026-07-23
原始信息汇总

数据集名称

VANET-IDS26

数据集概述

VANET-IDS26 是一个大规模车载自组织网络入侵检测数据集,包含良性 VANET 消息和 26 类网络攻击。该数据集适用于 VANET 网络安全、入侵检测系统、机器学习、深度学习、基于 Transformer 的模型、图学习和联邦学习等研究领域。

数据规模与统计

项目 数值
完整主文件 vanet_ids26_master.csv.gz
完整主文件大小 约 79 GB(压缩后)
总行数 786,798,378
良性行数 37,577,963
攻击行数 749,220,415
列数 46
二分类标签数 2
多分类标签范围 0–26
攻击类别数 26
最终仿真运行次数 20
密度等级数 4
攻击者比例 5%、10%、20%、30%

样本文件

GitHub 仓库中提供了一个平衡样本文件 samples/vanet_ids26_sample.csv.gz,包含:

  • 1,000 行良性数据
  • 每个攻击类别(1–26)各 1,000 行
  • 总共 27,000 行
  • 46 列
  • 压缩后约 2.26 MB

数据集用途

  • 二分类入侵检测
  • 多分类攻击分类
  • 基于 Transformer 的入侵检测系统(使用 text_input
  • 经典机器学习入侵检测系统
  • 深度学习入侵检测系统
  • 基于图的入侵检测系统
  • 联邦学习入侵检测系统
  • 非独立同分布客户端划分
  • 基于密度的鲁棒性评估
  • 基于攻击者比例的鲁棒性评估
  • 攻击家族泛化能力评估

数据集设计

数据集包含两种主要记录类型:

  • benign_base:原始良性 VANET 消息
  • attack_overlay:被攻击或合成的攻击覆盖消息

最终主文件将良性 VANET 消息与攻击覆盖消息合并为一个压缩 CSV 文件 vanet_ids26_master.csv.gz

数据来源

最终主文件由 20 个大规模仿真运行构建,包括 dataset/processed/run_001001run_001020messages.csv 文件及对应的攻击覆盖文件 attack_overlay.csv

仿真运行与密度等级

运行编号 密度
run_001001run_001005 低 (low)
run_001006run_001010 中 (medium)
run_001011run_001015 高 (high)
run_001016run_001020 非常高 (very_high)

密度信息包含在 density 列中。

攻击者比例

攻击覆盖生成时使用了四种攻击者比例,记录在 attack_ratio 列中(良性行该值为 0)。

含义
5 5% 攻击者比例
10 10% 攻击者比例
20 20% 攻击者比例
30 30% 攻击者比例

标签

二分类标签 (binary_label)

含义
0 良性
1 攻击

多分类标签 (multiclass_label)

标签 攻击类型
0 良性
1 constant_position
2 position_offset
3 random_position
4 speed_manipulation
5 acceleration_manipulation
6 heading_manipulation
7 lane_spoofing
8 impossible_kinematics
9 eventual_stop
10 false_brake_event
11 false_emergency_vehicle
12 false_hazard_event
13 replay
14 delayed_message
15 timestamp_shift
16 stale_message_replay
17 sybil
18 impersonation
19 pseudonym_abuse
20 flooding_ddos
21 beacon_rate_abuse
22 gnss_spoofing
23 map_location_spoofing
24 ghost_vehicle
25 false_object_injection
26 object_position_shift

攻击分类

标签 攻击类型 攻击家族 简要描述
0 benign benign 正常 VANET 消息
1 constant_position position_falsification 报告固定的虚假位置
2 position_offset position_falsification 报告偏移的虚假位置
3 random_position position_falsification 报告随机伪造的位置
4 speed_manipulation kinematic_falsification 篡改声称的速度
5 acceleration_manipulation kinematic_falsification 篡改声称的加速度
6 heading_manipulation kinematic_falsification 篡改声称的航向
7 lane_spoofing lane_map_falsification 报告虚假车道
8 impossible_kinematics kinematic_falsification 创建物理上不合理的运动
9 eventual_stop kinematic_falsification 伪造倾向于停止的行为
10 false_brake_event event_falsification 注入或报告虚假制动事件
11 false_emergency_vehicle event_falsification 声明虚假的应急车辆行为
12 false_hazard_event event_falsification 注入或报告虚假危险事件
13 replay timing_replay 重放先前的 VANET 消息
14 delayed_message timing_replay 延迟消息时间
15 timestamp_shift timing_replay 移动消息时间戳
16 stale_message_replay timing_replay 将过时消息重放为当前消息
17 sybil identity_spoofing 创建多个声称的身份
18 impersonation identity_spoofing 冒充其他车辆
19 pseudonym_abuse identity_spoofing 滥用假名或身份变更行为
20 flooding_ddos availability_flooding 用过多消息泛洪网络
21 beacon_rate_abuse availability_flooding 滥用信标传输频率
22 gnss_spoofing position_falsification 伪造 GNSS 衍生的位置
23 map_location_spoofing lane_map_falsification 伪造地图匹配的位置
24 ghost_vehicle identity_spoofing 注入不存在的车辆身份
25 false_object_injection event_falsification 注入虚假感知对象
26 object_position_shift event_falsification 移动对象的报告位置

列模式

数据集中包含 46 列,例如:

  • dataset_name:数据集标识符,始终为 VANET-IDS26
  • record_id:主文件中行的唯一标识符
  • source_typebenign_baseattack_overlay
  • source_file:用于创建该行的原始文件路径
  • base_run_id:仿真运行 ID
  • density:交通密度(low、medium、high、very_high)
  • attack_ratio:攻击者比例(0、5、10、20 或 30)
  • message_id:主文件中的消息 ID
  • base_message_id:原始基础消息 ID
  • overlay_message_id:攻击行的覆盖消息 ID
  • original_message_id:重放或延迟攻击时的原始消息 ID
  • time:仿真时间
  • claimed_time:声称的消息时间
  • physical_sender_id:实际发送者车辆 ID
  • claimed_sender_id:声称的发送者身份
  • sequence_number:消息序列号
  • true_xtrue_y:真实坐标
  • true_speed:真实速度
  • true_acceleration:真实加速度
  • true_heading:真实航向
  • true_lane:真实车道标识符
  • claimed_xclaimed_y:声称坐标
  • claimed_speed:声称速度
  • claimed_acceleration:声称加速度
  • claimed_heading:声称航向
  • claimed_lane:声称车道标识符
  • malicious_delay_ms:恶意延迟(毫秒)
  • sybil_group_id:Sybil 组标识符
  • event_type:基于事件的攻击的事件类型
  • false_object_id:虚假对象标识符
  • object_type:注入或移动对象的类型
  • object_xobject_y:对象坐标
  • attack_start_time:攻击开始时间
  • attack_notes:额外攻击备注
  • is_attacker:物理发送者是否为攻击者
  • is_synthetic_message:该行是否为合成注入消息
  • attack_type:人类可读的攻击类型
  • attack_label:数值攻击标签
  • message_label:源文件中的原始消息标签
  • binary_label:0 为良性,1 为攻击
  • multiclass_label:0 为良性,1–26 为攻击类别
  • text_input:VANET 消息的 BERT-ready 文本表示

Transformer 模型的文本输入

数据集中包含 text_input 列,适用于 BERT、DistilBERT、RoBERTa 等基于 Transformer 的模型。该列排除了直接标签列以减少标签泄漏。

类别不平衡

完整主文件存在不平衡:

  • 良性行:37,577,963
  • 攻击行:749,220,415

研究人员可选择使用所有行、对攻击行进行下采样、对良性行进行上采样、创建平衡子集、使用类别权重或分层抽样等方法。

建议的评估协议

  • 协议 A:随机分层划分:用于快速基线实验
  • 协议 B:运行级划分:减少跨仿真运行的信息泄漏
  • 协议 C:密度留出:评估对未见交通密度的泛化能力
  • 协议 D:攻击者比例留出:评估对未见攻击者强度的泛化能力
  • 协议 E:攻击家族留出:评估对未见攻击家族的泛化能力
  • 协议 F:联邦非独立同分布划分:用于联邦学习

推荐模型输入

  • 基于 Transformer 的模型:text_input
  • 结构化机器学习模型:timeclaimed_timephysical_sender_idclaimed_sender_idsequence_numbertrue_xtrue_ytrue_speedtrue_accelerationtrue_headingtrue_laneclaimed_xclaimed_yclaimed_speedclaimed_accelerationclaimed_headingclaimed_lanemalicious_delay_mssybil_group_idevent_typeobject_xobject_yis_attackeris_synthetic_message

应避免作为特征的列

不应将直接标签或标识符列用作模型输入,例如:

  • attack_type
  • attack_label
  • message_label
  • binary_label
  • multiclass_label
  • record_id
  • source_file
  • attack_dataset_id

完整数据集下载

完整数据集可在 Hugging Face 上获取:

  • 数据集页面:https://huggingface.co/datasets/mail2sia/VANET-IDS26
  • 数据文件目录:https://huggingface.co/datasets/mail2sia/VANET-IDS26/tree/main/data
  • 完整主文件:data/vanet_ids26_master.csv.gz

引用要求

如果在任何出版物、论文、报告、基准测试、软件发布、模型发布或衍生数据集中使用 VANET-IDS26,请引用该数据集及相关研究工作。

临时引用格式: bibtex @ARTICLE{Ahsan2024-mo, title = "Privacy-preserving intrusion detection in software-defined {VANET} using Federated Learning with {BERT}", author = "Ahsan, Shakil Ibne and Legg, Phil and Iftekharul Alam, S M", year = 2024, eprint = "2401.07343" }

搜集汇总
数据集介绍
VANET-IDS26 数据集图片
构建方式
VANET-IDS26数据集的构建源于对车载自组织网络(VANET)安全防御的深度需求,旨在为入侵检测研究提供大规模、高保真的基准数据。其构建过程基于20次大规模仿真运行,覆盖低、中、高、极高四种交通密度场景,并通过模拟5%、10%、20%、30%四种攻击者比例生成攻击覆盖层。最终将良性VANET消息与26类攻击覆盖消息融合为单一主文件,每条记录包含46维特征,确保研究者可直接载入使用,无需从原始仿真文件夹重建数据。
使用方法
研究者可通过Hugging Face平台获取约79 GB的压缩主文件,并采用分块加载策略处理大规模数据。使用Pandas的read_csv函数配合chunksize参数可高效读取;对于特定任务,建议选择text_input与标签列作为模型输入。数据集提供了从简单二分类到复杂多分类的完整示例代码,支持scikit-learn进行训练测试拆分。需注意避免将attack_type、binary_label等标签列作为特征以防止信息泄露,并可依据建议的六种评估协议之一设计实验流程,确保结果的可比性与可靠性。
背景与挑战
背景概述
车载自组织网络(VANET)作为智能交通系统的核心支撑技术,其通信安全正面临日益严峻的挑战。2024年,由Shakil Ibne Ahsan、Phil Legg与S M Iftekharul Alam等学者共同创建的VANET-IDS26数据集应运而生,旨在为VANET环境下的入侵检测研究提供标准化基准。该数据集依托20次大规模仿真运行,涵盖了从低到极高四种交通密度及四种攻击者比例(5%至30%),系统性地构建了包含约7.87亿条记录的庞大数据库,其中涵盖26种细粒度攻击类型。其核心研究问题在于推动机器学习、深度学习、基于Transformer的模型、图学习及联邦学习等方法在VANET入侵检测领域的可重复性研究。通过对良性消息与攻击行为的精准标注,该数据集为车联网安全领域提供了迄今为止最为全面且规模宏大的公开研究资源,对智能交通系统的安全性评估与防御技术发展具有重要的推动意义。
当前挑战
VANET-IDS26数据集旨在应对车联网安全领域的多重挑战。首先,在领域问题层面,VANET的开放无线通信特性使其极易遭受位置伪造、运动学篡改、身份欺骗及分布式拒绝服务等多样化网络攻击,现有入侵检测系统(IDS)在实时性、准确性与泛化能力上存在显著不足,难以兼顾低误报率与高检测率,且缺乏能够综合评估不同攻击家族及交通场景的标准化基准。其次,在数据集构建过程中,面临的核心挑战在于:如何高效采集并整合来自20次仿真运行、四种密度水平及四种攻击者比例的庞大数据流;如何确保攻击标签的精确性并避免类别混淆,例如区分26种攻击类型中细微的行为差异;如何设计涵盖46个特征列的丰富特征空间以支持多种机器学习范式的直接应用;以及如何处理高达79GB压缩数据的存储与分发挑战,同时提供便于各研究团队快速验证的采样策略与评估协议,以促进跨场景、跨模型的公平比较与结果可复现性。
常用场景
经典使用场景
在车联网(VANET)安全研究领域,VANET-IDS26数据集凭借其大规模、多类型的攻击覆盖,成为评估入侵检测系统的经典基准。该数据集包含超过7.86亿条消息记录,涵盖26种网络攻击类别,从位置伪造、运动学操纵到身份欺骗和洪泛攻击,全面反映了现实VANET环境中的安全威胁。研究者通常使用该数据集进行二分类入侵检测(区分正常与恶意消息)以及多分类攻击识别任务,在统一的仿真场景下检验不同检测模型的性能。数据集提供了丰富的特征维度,包括时空信息、车辆运动学参数和通信元数据,支持从经典机器学习到深度学习的多种建模范式,尤其适合作为不同检测方法对比验证的标准化平台。
解决学术问题
VANET-IDS26的发布有效解决了车联网安全领域长期面临的数据匮乏与场景碎片化问题。此前,缺乏大规模、标准化且攻击类型全面的公开数据集,导致不同研究结果难以横向比较,模型泛化能力评估受限。该数据集通过精心设计的模拟实验,涵盖四种交通密度等级和四种攻击者比例,使研究人员能够系统性地探究入侵检测模型在不同网络负载和威胁强度下的鲁棒性。此外,数据集支持多种评估协议,如密度留出法、攻击比例留出法和攻击家族留出法,推动了模型泛化能力评估的规范化。在联邦学习和隐私保护领域,该数据集也为非独立同分布(non-IID)场景下的分布式入侵检测提供了宝贵的实验基础,显著促进了车联网安全研究从定性分析向定量评估的跨越。
实际应用
在实际应用中,VANET-IDS26数据集为车联网安全系统的研发与部署提供了坚实的实验支撑。工业界可基于该数据集训练高精度的入侵检测模型,并将其集成至车载单元(OBU)或路侧单元(RSU)中,实现实时威胁感知与响应。数据集对多种攻击类型的覆盖,使安全厂商能够针对特定攻击家族(如位置欺骗或拒绝服务攻击)开发专用检测算法。此外,数据集内嵌的text_input字段专为BERT等预训练语言模型设计,便于将自然语言处理技术迁移至网络安全领域,探索新型检测范式。在自动驾驶汽车V2X通信系统中,该数据集助力构建轻量化、低延迟的边缘检测方案,在确保通信安全的同时满足实时性要求,有效提升智能交通系统的整体安全性与可靠性。
数据集最近研究
最新研究方向
VANET-IDS26作为车载自组织网络安全领域迄今规模最大的入侵检测基准数据集,正引领着前沿研究方向从传统机器学习向多模态深度学习的范式跃迁。该数据集囊括26类攻击类型与4种交通密度等级,特别设计的预训练文本特征列(text_input)为BERT、DistilBERT等Transformer架构在车载网络异常检测中的落地提供了关键支撑。结合联邦学习场景下的非独立同分布客户端划分机制与基于攻击家族泛化能力的评估协议,该数据集有力地推动了隐私保护型分布式入侵检测系统的研究进展。其超越79GB的庞大规模和针对攻击者比例、时序重放攻击等热点安全事件的精细化标注,为构建高鲁棒性的车载入侵检测系统奠定了坚实的数据基础,深刻影响着智能网联汽车安全生态的演进方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务