PerfCastDB|CPU性能预测数据集|深度学习数据集
收藏NCPP - Nova CPU性能预测器
简介
NCPP是一个用于CPU基准性能预测的机器学习模型。它包括数据处理、模型训练和预测模块,专门为Intel X86产品开发。
安装指南
在开始之前,请确保已安装Python和pip。然后按照以下步骤安装NCPP模型及其依赖项:
bash git clone https://github.com/xiaoman-liu/NCPP.git cd NCPP pip install -r requirements.txt
文件结构
plaintext NCPP │ ├── LICENSE <- 项目的许可证文件,详细说明版权和许可信息。 ├── README.md <- 项目的README文件,提供概述、安装说明和使用信息。 │ ├── data <- 数据目录,包含数据集样本。 │ ├── external <- 来自公共源的外部数据。 │ ├── interim <- 已转换的中间数据。 │ ├── processed <- 用于建模的最终、规范数据集。 │ └── raw <- 原始的、不可变数据。 │ └── SPR <- 特定实验的数据。 │ ├── characteristic_description.md <- 特征描述文件。 │ ├── test_data.csv <- 测试数据集。 │ └── train_data.csv <- 训练数据集。 │ ├── docs <- 文档目录,包含默认的Sphinx项目文档。 │ │ ├── module <- 源代码目录,包含所有项目代码。 │ ├── init.py <- 初始化文件,使该目录成为Python包。 │ ├── predict <- 预测模块,包含与预测相关的代码。 │ ├── train <- 训练模块,包含与模型训练相关的代码。 │ └── visualization <- 可视化模块,包含与数据可视化相关的代码。 │ └── init.py <- 初始化文件,使该目录成为Python包。 │ ├── .gitignore <- Git忽略文件,列出要从版本控制中排除的文件和目录。 ├── contributing.md <- 贡献指南,提供如何为项目做出贡献的说明。 ├── requirements.txt <- 列出项目所需的Python依赖项。 └── setup.py <- 项目的安装脚本,包含元数据和安装信息。
使用说明
训练模型
bash python module/train/train.py
预测
bash python module/predict/infer.py
许可证
本项目基于Apache-2.0许可证。详细信息请参阅LICENSE文件。

MedDialog
MedDialog数据集(中文)包含了医生和患者之间的对话(中文)。它有110万个对话和400万个话语。数据还在不断增长,会有更多的对话加入。原始对话来自好大夫网。
github 收录
中国1km分辨率逐月降水量数据集(1901-2023)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
CE-CSL
CE-CSL数据集是由哈尔滨工程大学智能科学与工程学院创建的中文连续手语数据集,旨在解决现有数据集在复杂环境下的局限性。该数据集包含5,988个从日常生活场景中收集的连续手语视频片段,涵盖超过70种不同的复杂背景,确保了数据集的代表性和泛化能力。数据集的创建过程严格遵循实际应用导向,通过收集大量真实场景下的手语视频材料,覆盖了广泛的情境变化和环境复杂性。CE-CSL数据集主要应用于连续手语识别领域,旨在提高手语识别技术在复杂环境中的准确性和效率,促进聋人与听人社区之间的无障碍沟通。
arXiv 收录
Breast-Caner-Detection Dataset
该数据集包含约5000张用于训练和验证的标记乳房X光图像,以及约1800张未标记的测试图像。所有图像均为(224,224,3)格式,标签从Density1到Density4,表示乳房密度的增加,并分为良性或恶性。
github 收录
长江干流实时水位观测数据集(2024年)
该数据集为长江干流主要水文站实时水位观测数据集,包含了汉口、户口、九江、宜昌等16个水文站点的逐小时或逐日水位观测数据。 该数据集包含3个excel表格文件,长江干流站点.xls,逐日水位.xlsx,逐小时水位.xlsx。
国家地球系统科学数据中心 收录