遇见数据集

covcollab-eve-detection

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

Covert-Collaboration Eve-Detection Dataset 是一个用于隐蔽协作窃听检测的基准数据集。该数据集针对被动窃听者Eve,解决一个二分类问题:判断一组分布式用户是否正在秘密地将其消息合并成一个连贯的虚拟MIMO传输。每个样本是一个复数接收块Y ∈ ℂ^(R×T),其中R=4为Eve天线数,T=320为时间样本数,标签为H1(存在协作信号)或H0(仅接收机噪声)。数据集包含114,048个平衡样本,覆盖六种波形族(sc, ofdm, dfts_ofdm, otfs, afdm, ofdm_comb)、三种协作策略(none, random, optimized)以及多种系统参数(用户数M、消息用户数K、消息维度d、信道条件等)。数据分为训练集(82,944)、验证集(10,368)、测试集IID(10,368)和测试集OOD(10,368,强多普勒信道)。此外,还提供了multi_ne配置,变化Eve天线数N_E ∈ {1,2,4,8},用于研究孔径对检测的影响。数据集以parquet格式存储,约1.05 GiB,可完全复现。适用于无线物理层安全、隐蔽通信检测、异常检测、信号处理等任务。

The Covert-Collaboration Eve-Detection Dataset is a benchmark dataset for covert collaborative eavesdropping detection. It addresses a binary classification problem for a passive eavesdropper Eve: determining whether a group of distributed users are secretly combining their messages into a coherent virtual MIMO transmission. Each sample is a complex received block Y ∈ ℂ^(R×T), where R=4 is the number of Eve antennas and T=320 is the number of time samples. The labels are H1 (cooperative signal present) or H0 (receiver noise only). The dataset contains 114,048 balanced samples, covering six waveform families (sc, ofdm, dfts_ofdm, otfs, afdm, ofdm_comb), three collaboration strategies (none, random, optimized), and various system parameters (number of users M, number of message users K, message dimension d, channel conditions, etc.). The data is split into training (82,944), validation (10,368), IID test (10,368), and OOD test (10,368, strong Doppler channel). Additionally, a multi_ne configuration is provided, varying Eve antennas N_E ∈ {1,2,4,8} to study the impact of aperture on detection. The dataset is stored in parquet format, approximately 1.05 GiB, and is fully reproducible. It is suitable for tasks such as wireless physical layer security, covert communication detection, anomaly detection, and signal processing.

创建时间:
2026-08-11
原始信息汇总

数据集概述

该数据集名为 Covert-Collaboration Eve-Detection Dataset,是一个用于检测隐蔽协作通信(covert-collaboration warden problem)的受控、平衡且可复现的基准数据集。其核心任务是判断一组分布式用户是否在秘密地将其消息合并为相干虚拟多输入多输出(virtual-MIMO)传输,检测方为被动窃听者 Eve。

核心任务

每个样本是一个复数接收块 Y ∈ ℂ^{R×T}(R=4 个 Eve 天线,T=320 个采样点),并带有标签 H1(存在协作信号)或 H0(仅接收机噪声)。任务是对 H0 与 H1 进行二元假设检验,检测隐蔽协调行为。数据集覆盖了六种波形族、三种协作策略、系统规模扫描、三种信道条件以及从隐蔽到可检测的完整信噪比范围。

主要特征

属性 详情
样本总数 114,048(H0/H1 平衡)
数据划分 train 82,944 · validation 10,368 · test_iid 10,368 · test_ood 10,368
波形格式 sc, ofdm, dfts_ofdm, otfs, afdm, ofdm_comb(每种 19,008 个样本)
协作策略 none(无协作矩阵)、random(随机矩阵)、optimized(PSGD 优化矩阵)(每种 38,016 个样本)
块形状 Y = (R, T) = (4, 320) complex64,存储为 y_real / y_imag
数据集大小 约 1.05 GiB(parquet 格式,zstd 压缩)
可复现性 可从主种子进行逐位一致的重新生成(manifest.json 中记录每个划分的 SHA-256)
许可证 CC-BY-4.0

三种协作策略(核心对比)

对于每个 (format, M, K, d, channel) 单元,信号在三种策略下生成,且共享相同的 Frobenius 功率预算 ‖W‖_F² = P_W = M,因此各策略在结构上而非接收能量上有所区别:

  • none:对角消息到天线分配,无跨用户混合、无波束赋形,代表“用户不进行隐蔽协作”的诚实基线。
  • random:每组生成随机可行的协作矩阵,表示有协作但未整形。
  • optimized:PSGD 球度隐蔽优化矩阵,在满足 Bob 的 SINR 下限 J_B ≥ γ 的前提下对 Eve 的接收协方差进行白化。该策略测量上最具隐蔽性,留下的二阶结构信息最少。

参数扫描

  • M(协作用户数):多载波 {8, 16, 25} / 单载波 {8, 12, 16}
  • (K, d):{(2,1), (2,2), (4,1), (2,4)},K 和 d 独立扫描
  • 信道条件(单元内各策略共享):平坦、多径(4 抽头指数 PDP)、中等多普勒(ε=0.10)用于 IID 核心;强多普勒(ε=0.25)作为 test_ood 留出
  • SNR / 状态:Eve SNR 为 {-16,-12,-8,-4} dB;Δ = SNR_E − SNR_B 为 {-20,-12,0,+6} dB,标记为隐蔽(Δ<0)、可比(|Δ|≤3)或可检测(Δ>0)
  • N_E 固定为 4(默认配置)

数据划分

划分按 组(group) 进行,因此各划分的策略实例互不重叠(测试块是真正未见过的采样):

  • train / validation / test_iid:IID 核心(平坦/多径/中等多普勒),按组 80/10/10 分配。test_iid 用于衡量分布内泛化。
  • test_ood:强多普勒单元(ε=0.25),属于训练分布明确排除的信道偏移,用于衡量分布外泛化能力。各格式样本数仍相等。

multi_ne 配置

此配置引入正交维度——N_E ∈ {1, 2, 4, 8}(Eve 天线数),用于研究监听方孔径对检测和结构指纹识别的影响。由于 R 可变,每个块被填充至 R_max = 8(y_real/y_imag 长度为 8·320 = 2560),由 n_rx_eve 列给出有效天线数。数据划分结构同默认配置,各格式样本数相等。分析发现:更大的天线阵列和更多的时间观测量能提升格式/信道指纹识别,且大阵列显著提升检测性能(空间阵列增益),但均无法恢复 M 或判断隐蔽策略是否开启——隐蔽设计的结构隐藏特性依然成立。

数据模式(Schema)

每条样本包含 y_real, y_imag, label 及丰富的元数据字段:split, format, policy_arm, policy_kind, n_tx (M), n_msg_users (K), msg_dim (d), kd, n_rx_eve, n_samples_t, eve_snr_db, bob_snr_db, delta_db, regime, policy_design_snr_db, channel_family, n_taps, nu_max, pdp_decay, noise_kind, nuisance, constellation, cell_id, group_id, base_seed。字段含义详见 manifest.json → schema

使用方式

使用 🤗 datasets 加载: python from datasets import load_dataset import numpy as np

ds = load_dataset("<your-username>/covcollab-eve-detection") row = ds["train"][0] R, T = row["n_rx_eve"], row["n_samples_t"] # (4, 320) Y = (np.array(row["y_real"], np.float32) + 1j*np.array(row["y_imag"], np.float32)).reshape(R, T) label = row["label"] # 1 = H1 (signal), 0 = H0 (noise)

独立加载器(仅需 pyarrow + numpy): python from covcollab_eve_loader import load_split, features_from_Y d = load_split(".", "train") # dict of numpy arrays; d["Y"] is (N, 4, 320) complex64 x = features_from_Y(d["Y"][:64]) # model input [Re, Im, |Y|^2] -> (64, 4, 3, 320) float32

随附资源

  • 训练器:仓库附带 covcollab-eve-mtl(多任务监听器),可联合检测(H0/H1)和指纹识别(format, M, K, d, channel, policy-arm),支持在 NVIDIA GPU 上以 complex64 精度运行。
  • 生成与验证:可通过 covcollab-eve-controlled 命令进行数据重新生成和逐位校验(--verify),断言存储的每个划分 Y 的 SHA-256 逐位一致。
  • 文档与教程TRAINING.md 提供完整训练指南(模型、CLI 参数、三种训练模式、A100 GPU 训练细节);notebooks/train_universal_eve.ipynb 提供从加载到训练到评估的可运行端到端教程;notebooks/generate_dataset.ipynb 展示生成流程和每种格式的详解。

固定不变的因素

以下因素在此数据集中刻意保持固定(由流式训练分布或其他配套分析覆盖):有色和脉冲接收噪声、N_E ≠ 4(默认配置)、每用户振荡器/协调签名。这保证了因子设计的纯净性,对这些因素的鲁棒性被单独研究。

可复现性说明

manifest.json 记录了 git SHA、numpy/torch 版本、平台、完整参数网格、划分策略及各划分的 Y SHA-256。逐位一致性仅在固定环境下成立——浮点归约依赖于 BLAS 实现,因此不声称跨机器逐位一致;--verify 仅在构建机器上断言该属性。

搜集汇总
数据集介绍
covcollab-eve-detection 数据集图片
构建方式
本数据集为隐蔽协作窃听者检测问题构建了一个受控、均衡且可复现的基准测试集。其构建基于因子化设计,系统性地遍历了六种波形族、三种协作策略、系统规模参数(M, K, d)、三种信道条件以及从完全隐蔽到可探测的完整信噪比范围。每个样本为一个复数接收块Y∈ℂ^{4×320},并标注H1(存在协作信号)或H0(仅噪声)标签。数据按组划分训练、验证、测试及分布外测试子集,确保测试集为不可见的数据抽取。特别地,优化协作策略采用PSGD算法生成满足球度隐蔽性的协作矩阵,使三种策略臂在相同功率预算下仅结构不同,从而构建了检测难度梯度。
使用方法
数据集可通过HuggingFace的datasets库便捷加载,每个样本包含复数接收矩阵的实部和虚部及丰富的元数据字段。为便于模型使用,提供了轻量级加载器,仅依赖pyarrow和numpy即可读取数据并计算特征x=[Re(Y), Im(Y), |Y|²]。仓库还包含配套的多任务训练器covcollab-eve-mtl,可联合执行检测与指纹识别任务,支持在GPU上高效运行。通过附带命令可一键复现、验证或扩展数据集,甚至可直接在仓库源码基础上进行定制化训练,极大降低了使用门槛并保证了研究的可延续性。
背景与挑战
背景概述
该数据集由 covert-collaboration 项目团队于近期构建,旨在解决无线物理层安全中隐蔽协作检测的基准缺失问题。其核心研究问题在于,被动窃听者 Eve 如何从接收信号中判别一组分布式用户是否通过虚拟多输入多输出架构秘密协同传输。该数据集通过受控因子实验设计,涵盖六种波形族、三种协作策略及多种信道条件,为分布鲁棒的学习型守卫者提供标准化评估平台。其影响力体现在为低检测概率通信研究提供了首个可复现、平衡的公开基准,推动了无线隐蔽通信检测领域的实证研究。
当前挑战
该领域面临的核心挑战在于,隐蔽协作信号设计刻意消除可检测的二阶统计特征,使得传统假设检验方法在低信噪比与动态信道下性能骤降,亟需对分布偏移鲁棒的检测模型。数据集构建过程中亦遭遇多重困难:需在恒定功率预算下生成三种协作策略以保证可对比性,独立扫描维度(用户数、消息长度等)的同时维持各格式样本数平衡,并确保训练、验证及测试分组严格分离以避免数据泄漏。此外,强多普勒场景的留出设置要求构建兼具外推能力与指纹识别精度的统一评估体系,对数据生成与验证流程的位级可复现性提出了极高要求。
常用场景
经典使用场景
该数据集专为无线物理层安全中隐蔽协作检测问题而设计,其核心任务是从被动窃听者Eve的视角,在复杂接收信号中判定是否存在多用户虚拟MIMO的隐蔽协作。数据集提供平衡的H0/H1二元假设检验样本,涵盖六种波形族、三种协作策略以及丰富的系统参数扫描,为研究隐蔽通信的物理层指纹特征提供了受控、可复现的基准实验场。该数据集特别适用于评估和训练基于深度学习的窃听检测器,即所谓的'通用Eve',以实现对隐蔽协作信号的鲁棒识别。
解决学术问题
该数据集系统性地解决了隐蔽协作通信检测中的关键学术难题:如何在接收功率匹配的条件下,仅凭信号结构差异区分随机协作与优化后的隐蔽协作。通过精心设计的因子化实验,数据集隔离了波形、用户数、消息维度、信道条件等变量对检测性能的影响,揭示了优化协作矩阵在球度隐蔽性上的优势,为验证信号二阶统计量在隐蔽检测中的局限性提供了权威依据。它推动了分布鲁棒学习在物理层安全中的应用,使模型能够应对分布外信道变化。
实际应用
在实际应用中,该数据集为无线网络的安全监控提供了有力的工具。它可被用于开发部署在接入点或专用监测节点的智能窃听检测系统,实时识别潜在的隐蔽通信行为,从而增强频谱管理和信息安全的监管能力。此外,数据集支持评估不同接收天线配置(N_E)对检测性能的影响,引导实际系统设计者在成本与检测灵敏度之间做出权衡。其可复现性保证了在不同研究团队间进行公平的算法对比,促进了安全通信技术的实用化验证。
数据集最近研究
最新研究方向
该数据集聚焦于物理层安全与隐蔽通信的前沿交叉领域,针对被动窃听者Eve检测分布式用户通过虚拟多输入多输出(virtual-MIMO)方式进行隐蔽协作的难题。研究涵盖了从单载波到多载波、从平坦信道到多径及多普勒频移的多样化波形与信道条件,并对协作策略(无协作、随机协作、优化的球形度隐蔽协作)进行了系统对比,尤其关注在相同功率预算下不同策略在接收协方差结构上的可检测性差异。通过引入独立同分布(IID)与分布外(OOD)测试集,以及多接收天线配置(multi_ne),数据集为评估稳健的机器学习检测器(如Universal Eve)提供了基准。其意义在于推动隐蔽通信检测技术的鲁棒性研究,为物理层安全中的对抗性机器学习提供标准化的实验平台,并促进对频谱态势感知与低截获概率通信的深入理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务