IoT-23|物联网安全数据集|网络流量分析数据集
收藏数据集概述
数据集名称
- IoT-23
数据集来源
- 提供者:Stratosphere Laboratory
数据集内容
- 包含标记的IoT网络流量,包括良性与恶意流量。
- 轻量版本不包含PCAP文件,仅包含标记的流量。
数据集大小
- 下载的压缩文件大小:8.8 GB
- 解压后文件大小:约44 GB
数据集使用
- 用于网络流量异常检测和分类的研究项目。
- 数据集需下载并解压,然后通过特定的Python脚本进行数据提取和处理。
数据集处理步骤
- 数据提取:从场景文件中提取数据,生成单独的攻击和良性流量文件。
- 数据洗牌:将大文件分割并随机洗牌,以提高数据样本的可靠性。
数据集依赖
- 编程语言:Python 3.8.8
- 机器学习工具:scikit-learn 0.24.1
- 科学计算工具:NymPy 1.19.5
- 数据分析工具:pandas 1.2.2
- 数据可视化工具:matplotlib 3.3.4, seaborn 0.11.1
- 系统信息获取:psutil 5.8.0
- 模型序列化:pickle
数据集配置
- 配置文件:config.py,需设置数据集和实验文件的存储路径。
- 配置检查:通过运行配置检查脚本确认配置正确。
数据集实验
- 演示实验:使用10,000条记录快速验证系统。
- 设计实验:处理超过2000万条记录,耗时约24小时。
- 自定义实验:TODO

Figshare
Figshare是一个在线数据共享平台,允许研究人员上传和共享各种类型的研究成果,包括数据集、论文、图像、视频等。它旨在促进科学研究的开放性和可重复性。
figshare.com 收录
中国1km分辨率逐月降水量数据集(1901-2023)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
Fruits-360
一个高质量的水果图像数据集,包含多种水果的图像,如苹果、香蕉、樱桃等,总计42345张图片,分为训练集和验证集,共有64个水果类别。
github 收录
TCIA
TCIA(The Cancer Imaging Archive)是一个公开的癌症影像数据集,包含多种癌症类型的医学影像数据,如CT、MRI、PET等。这些数据通常与临床和病理信息相结合,用于癌症研究和临床试验。
www.cancerimagingarchive.net 收录
VisDrone2019
VisDrone2019数据集由AISKYEYE团队在天津大学机器学习和数据挖掘实验室收集,包含288个视频片段共261,908帧和10,209张静态图像。数据集覆盖了中国14个不同城市的城市和乡村环境,包括行人、车辆、自行车等多种目标,以及稀疏和拥挤场景。数据集使用不同型号的无人机在各种天气和光照条件下收集,手动标注了超过260万个目标边界框,并提供了场景可见性、对象类别和遮挡等重要属性。
github 收录