STAR-200K
收藏资源简介:
STAR-200K是由中国科学院信息工程研究所和清华大学联合构建的大规模跨模态指纹数据集,包含15万条自动化采集的网站逻辑-流量配对样本。该数据集通过爬虫获取网站语义逻辑特征(如URI长度、资源大小)并同步捕获加密流量特征(如数据包时序、方向),采用对比学习框架构建联合嵌入空间。数据经过结构感知增强处理,支持零样本条件下通过跨模态检索实现HTTPS网站指纹识别,旨在解决传统监督学习方法无法识别未知网站的核心挑战,为加密流量语义分析提供基准。
STAR-200K is a large-scale cross-modal fingerprinting dataset jointly constructed by the Institute of Information Engineering, Chinese Academy of Sciences and Tsinghua University, containing 150,000 automatically collected paired samples of website logic and traffic. This dataset acquires website semantic logic features such as URI length and resource size via crawlers, synchronously captures encrypted traffic features including packet timing and direction, and builds a joint embedding space using a contrastive learning framework. The data has undergone structure-aware enhancement processing, enabling zero-shot cross-modal retrieval-based HTTPS website fingerprinting. It aims to address the core challenge that traditional supervised learning methods fail to identify unknown websites, providing a benchmark for encrypted traffic semantic analysis.
STAR-Website-Fingerprinting 数据集概述
数据集基本信息
- 数据集名称: STAR-Website-Fingerprinting
- 关联论文: 《STAR: Semantic-Traffic Alignment and Retrieval for Zero-Shot HTTPS Website Fingerprinting》
- 论文状态: 已被 IEEE INFOCOM 2026 接收
- 论文链接: https://arxiv.org/abs/2512.17667
- 代码仓库地址: https://github.com/2654400439/STAR-Website-Fingerprinting
- 许可协议: Apache License 2.0
- 用途声明: 仅限研究用途
数据集内容与获取
- 公开内容: 处理后的数据集与预训练模型检查点
- 获取地址: https://doi.org/10.5281/zenodo.17060855
- 数据规模: 基于超过 170,000 次网站访问和 100 GB 以上的原始流量轨迹(PCAP 格式)处理而成
- 原始数据: 由于存储和分发限制,原始流量轨迹和逻辑侧爬取日志未公开托管。如需获取,请联系:chengyifei@iie.ac.cn
研究背景与核心问题
- 研究领域: 零样本 HTTPS 网站指纹识别
- 核心问题: 能否在不收集目标网站任何流量的情况下,从加密流量中识别未见过的网站?
- 现实挑战: 现代 HTTPS 机制隐藏了 SNI 和 DNS 查询等传统标识符,而现有网站指纹识别方法仍依赖站点特定的标记流量,导致部署成本高、对网站演化脆弱且无法识别未见过的网站。
关键发现与方法
- 关键观察: 加密流量并非完全随机,现代网络协议引入了结构化的语义泄漏,在网站级语义逻辑与加密流量行为之间创建了一致的对齐锚点。
- 对齐锚点:
- 请求侧锚点: 请求数据包长度与霍夫曼编码的 URI 长度相关。
- 响应侧锚点: 聚合的响应数据包大小反映了返回的网络资源总大小。
- 协议锚点: 通过传输层的 UDP 流量比率可观察 HTTP/3 的采用情况。
- 方法(STAR): 将网站指纹识别重新定义为零样本跨模态检索问题。采用双编码器架构,通过对比学习对齐逻辑模态(爬取时的语义网站配置文件)和流量模态(加密的数据包级轨迹),从而无需在训练期间使用目标网站的流量即可进行检索。
主要实验结果
- 零样本封闭世界分类: 在 1,600 个未见过的网站上达到 87.9% 的 Top-1 准确率。
- 开放世界检测: AUC 达到 0.963,优于有监督和少样本基线方法。
- 少样本适应: 仅使用每个站点 4 条标记轨迹,Top-5 准确率达到 98.8%。
数据集使用与复现
-
环境要求: Python 3.9+
-
依赖安装:
pip install -r requirements.txt -
文件结构要求:
STAR/ ├── STAR_dataset/ # 存放处理后的数据集文件 └── STAR_model_pt/ └── best_STAR_model.pt # 预训练模型检查点
-
复现脚本:
- 封闭世界零样本分类:
python cw_zero_shot.py - 封闭世界少样本适应(线性探测):
python cw_linear_probe.py - 封闭世界少样本适应(Tip-Adapter):
python cw_tip_adapter.py - 开放世界零样本检测:
python ow_zero_shot.py - 模型预训练(可选):
python pretrain.py
- 封闭世界零样本分类:
-
预训练说明: 预训练计算成本高(约4小时,使用5个NVIDIA A100 GPU),非复现主要结果所必需,因已提供预训练检查点。




