covcollab-eve-detection
收藏资源简介:
Covert-Collaboration Eve-Detection Dataset 是一个用于隐蔽协作窃听检测的基准数据集。该数据集针对被动窃听者Eve,解决一个二分类问题:判断一组分布式用户是否正在秘密地将其消息合并成一个连贯的虚拟MIMO传输。每个样本是一个复数接收块Y ∈ ℂ^(R×T),其中R=4为Eve天线数,T=320为时间样本数,标签为H1(存在协作信号)或H0(仅接收机噪声)。数据集包含114,048个平衡样本,覆盖六种波形族(sc, ofdm, dfts_ofdm, otfs, afdm, ofdm_comb)、三种协作策略(none, random, optimized)以及多种系统参数(用户数M、消息用户数K、消息维度d、信道条件等)。数据分为训练集(82,944)、验证集(10,368)、测试集IID(10,368)和测试集OOD(10,368,强多普勒信道)。此外,还提供了multi_ne配置,变化Eve天线数N_E ∈ {1,2,4,8},用于研究孔径对检测的影响。数据集以parquet格式存储,约1.05 GiB,可完全复现。适用于无线物理层安全、隐蔽通信检测、异常检测、信号处理等任务。
The Covert-Collaboration Eve-Detection Dataset is a benchmark dataset for covert collaborative eavesdropping detection. It addresses a binary classification problem for a passive eavesdropper Eve: determining whether a group of distributed users are secretly combining their messages into a coherent virtual MIMO transmission. Each sample is a complex received block Y ∈ ℂ^(R×T), where R=4 is the number of Eve antennas and T=320 is the number of time samples. The labels are H1 (cooperative signal present) or H0 (receiver noise only). The dataset contains 114,048 balanced samples, covering six waveform families (sc, ofdm, dfts_ofdm, otfs, afdm, ofdm_comb), three collaboration strategies (none, random, optimized), and various system parameters (number of users M, number of message users K, message dimension d, channel conditions, etc.). The data is split into training (82,944), validation (10,368), IID test (10,368), and OOD test (10,368, strong Doppler channel). Additionally, a multi_ne configuration is provided, varying Eve antennas N_E ∈ {1,2,4,8} to study the impact of aperture on detection. The dataset is stored in parquet format, approximately 1.05 GiB, and is fully reproducible. It is suitable for tasks such as wireless physical layer security, covert communication detection, anomaly detection, and signal processing.
数据集概述
该数据集名为 Covert-Collaboration Eve-Detection Dataset,是一个用于检测隐蔽协作通信(covert-collaboration warden problem)的受控、平衡且可复现的基准数据集。其核心任务是判断一组分布式用户是否在秘密地将其消息合并为相干虚拟多输入多输出(virtual-MIMO)传输,检测方为被动窃听者 Eve。
核心任务
每个样本是一个复数接收块 Y ∈ ℂ^{R×T}(R=4 个 Eve 天线,T=320 个采样点),并带有标签 H1(存在协作信号)或 H0(仅接收机噪声)。任务是对 H0 与 H1 进行二元假设检验,检测隐蔽协调行为。数据集覆盖了六种波形族、三种协作策略、系统规模扫描、三种信道条件以及从隐蔽到可检测的完整信噪比范围。
主要特征
| 属性 | 详情 |
|---|---|
| 样本总数 | 114,048(H0/H1 平衡) |
| 数据划分 | train 82,944 · validation 10,368 · test_iid 10,368 · test_ood 10,368 |
| 波形格式 | sc, ofdm, dfts_ofdm, otfs, afdm, ofdm_comb(每种 19,008 个样本) |
| 协作策略 | none(无协作矩阵)、random(随机矩阵)、optimized(PSGD 优化矩阵)(每种 38,016 个样本) |
| 块形状 | Y = (R, T) = (4, 320) complex64,存储为 y_real / y_imag |
| 数据集大小 | 约 1.05 GiB(parquet 格式,zstd 压缩) |
| 可复现性 | 可从主种子进行逐位一致的重新生成(manifest.json 中记录每个划分的 SHA-256) |
| 许可证 | CC-BY-4.0 |
三种协作策略(核心对比)
对于每个 (format, M, K, d, channel) 单元,信号在三种策略下生成,且共享相同的 Frobenius 功率预算 ‖W‖_F² = P_W = M,因此各策略在结构上而非接收能量上有所区别:
none:对角消息到天线分配,无跨用户混合、无波束赋形,代表“用户不进行隐蔽协作”的诚实基线。random:每组生成随机可行的协作矩阵,表示有协作但未整形。optimized:PSGD 球度隐蔽优化矩阵,在满足 Bob 的 SINR 下限 J_B ≥ γ 的前提下对 Eve 的接收协方差进行白化。该策略测量上最具隐蔽性,留下的二阶结构信息最少。
参数扫描
- M(协作用户数):多载波 {8, 16, 25} / 单载波 {8, 12, 16}
- (K, d):{(2,1), (2,2), (4,1), (2,4)},K 和 d 独立扫描
- 信道条件(单元内各策略共享):平坦、多径(4 抽头指数 PDP)、中等多普勒(ε=0.10)用于 IID 核心;强多普勒(ε=0.25)作为
test_ood留出 - SNR / 状态:Eve SNR 为 {-16,-12,-8,-4} dB;Δ = SNR_E − SNR_B 为 {-20,-12,0,+6} dB,标记为隐蔽(Δ<0)、可比(|Δ|≤3)或可检测(Δ>0)
- N_E 固定为 4(默认配置)
数据划分
划分按 组(group) 进行,因此各划分的策略实例互不重叠(测试块是真正未见过的采样):
train/validation/test_iid:IID 核心(平坦/多径/中等多普勒),按组 80/10/10 分配。test_iid用于衡量分布内泛化。test_ood:强多普勒单元(ε=0.25),属于训练分布明确排除的信道偏移,用于衡量分布外泛化能力。各格式样本数仍相等。
multi_ne 配置
此配置引入正交维度——N_E ∈ {1, 2, 4, 8}(Eve 天线数),用于研究监听方孔径对检测和结构指纹识别的影响。由于 R 可变,每个块被填充至 R_max = 8(y_real/y_imag 长度为 8·320 = 2560),由 n_rx_eve 列给出有效天线数。数据划分结构同默认配置,各格式样本数相等。分析发现:更大的天线阵列和更多的时间观测量能提升格式/信道指纹识别,且大阵列显著提升检测性能(空间阵列增益),但均无法恢复 M 或判断隐蔽策略是否开启——隐蔽设计的结构隐藏特性依然成立。
数据模式(Schema)
每条样本包含 y_real, y_imag, label 及丰富的元数据字段:split, format, policy_arm, policy_kind, n_tx (M), n_msg_users (K), msg_dim (d), kd, n_rx_eve, n_samples_t, eve_snr_db, bob_snr_db, delta_db, regime, policy_design_snr_db, channel_family, n_taps, nu_max, pdp_decay, noise_kind, nuisance, constellation, cell_id, group_id, base_seed。字段含义详见 manifest.json → schema。
使用方式
使用 🤗 datasets 加载:
python
from datasets import load_dataset
import numpy as np
ds = load_dataset("<your-username>/covcollab-eve-detection") row = ds["train"][0] R, T = row["n_rx_eve"], row["n_samples_t"] # (4, 320) Y = (np.array(row["y_real"], np.float32) + 1j*np.array(row["y_imag"], np.float32)).reshape(R, T) label = row["label"] # 1 = H1 (signal), 0 = H0 (noise)
独立加载器(仅需 pyarrow + numpy):
python
from covcollab_eve_loader import load_split, features_from_Y
d = load_split(".", "train") # dict of numpy arrays; d["Y"] is (N, 4, 320) complex64
x = features_from_Y(d["Y"][:64]) # model input [Re, Im, |Y|^2] -> (64, 4, 3, 320) float32
随附资源
- 训练器:仓库附带
covcollab-eve-mtl(多任务监听器),可联合检测(H0/H1)和指纹识别(format, M, K, d, channel, policy-arm),支持在 NVIDIA GPU 上以 complex64 精度运行。 - 生成与验证:可通过
covcollab-eve-controlled命令进行数据重新生成和逐位校验(--verify),断言存储的每个划分 Y 的 SHA-256 逐位一致。 - 文档与教程:
TRAINING.md提供完整训练指南(模型、CLI 参数、三种训练模式、A100 GPU 训练细节);notebooks/train_universal_eve.ipynb提供从加载到训练到评估的可运行端到端教程;notebooks/generate_dataset.ipynb展示生成流程和每种格式的详解。
固定不变的因素
以下因素在此数据集中刻意保持固定(由流式训练分布或其他配套分析覆盖):有色和脉冲接收噪声、N_E ≠ 4(默认配置)、每用户振荡器/协调签名。这保证了因子设计的纯净性,对这些因素的鲁棒性被单独研究。
可复现性说明
manifest.json 记录了 git SHA、numpy/torch 版本、平台、完整参数网格、划分策略及各划分的 Y SHA-256。逐位一致性仅在固定环境下成立——浮点归约依赖于 BLAS 实现,因此不声称跨机器逐位一致;--verify 仅在构建机器上断言该属性。




