DyGraphs|动态图数据集|链接预测数据集
收藏CrossLink: Enhancing Cross-domain Link Prediction via Evolution Process Modeling
数据集概述
- 数据集名称: CrossLink
- 数据集用途: 用于跨域链接预测,通过建模图的演化过程来增强链接预测。
- 数据集规模: 包含600万个动态边。
- 数据集格式:
- 数据集包含以下字段:
Unnamed: 0
: 索引u
: 源节点i
: 目标节点ts
: 交互时间label
: 默认值为0idx
: 从1到边的总数
- 数据集包含以下字段:
- 数据集来源:
- 数据集已预处理并可在Hugging Face获取。
数据集特点
- 技术方法: 采用条件链接生成技术,结合演化和结构建模进行演化特定的链接预测。
- 模型架构: 使用Transformer解码器架构,支持高效的并行训练和推理。
- 性能表现: 在八个未训练的图上进行广泛实验,CrossLink在跨域链接预测中达到了最先进的性能,平均精度提高了11.40%。
数据集使用
- 数据准备: 可以使用
preprocess_data
文件夹中的代码准备数据。 - 训练与评估: 训练和评估代码将在未来发布。
引用
- 引用信息: bibtex @misc{huang2024graphmodelcrossdomaindynamic, title={One Graph Model for Cross-domain Dynamic Link Prediction}, author={Xuanwen Huang and Wei Chow and Yang Wang and Ziwei Chai and Chunping Wang and Lei Chen and Yang Yang}, year={2024}, eprint={2402.02168}, archivePrefix={arXiv}, primaryClass={cs.LG}, url={https://arxiv.org/abs/2402.02168}, }

中国1km分辨率逐月降水量数据集(1901-2023)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
学生课堂行为数据集 (SCB-dataset3)
学生课堂行为数据集(SCB-dataset3)由成都东软学院创建,包含5686张图像和45578个标签,重点关注六种行为:举手、阅读、写作、使用手机、低头和趴桌。数据集覆盖从幼儿园到大学的不同场景,通过YOLOv5、YOLOv7和YOLOv8算法评估,平均精度达到80.3%。该数据集旨在为学生行为检测研究提供坚实基础,解决教育领域中学生行为数据集的缺乏问题。
arXiv 收录
中国行政区划数据
本项目为中国行政区划数据,包括省级、地级、县级、乡级和村级五级行政区划数据。数据来源于国家统计局,存储格式为sqlite3 db文件,支持直接使用数据库连接工具打开。
github 收录
THUCNews
THUCNews是根据新浪新闻RSS订阅频道2005~2011年间的历史数据筛选过滤生成,包含74万篇新闻文档(2.19 GB),均为UTF-8纯文本格式。本次比赛数据集在原始新浪新闻分类体系的基础上,重新整合划分出14个候选分类类别:财经、彩票、房产、股票、家居、教育、科技、社会、时尚、时政、体育、星座、游戏、娱乐。提供训练数据共832471条。
github 收录
Wind Turbine Data
该数据集包含风力涡轮机的运行数据,包括风速、风向、发电量等参数。数据记录了多个风力涡轮机在不同时间点的运行状态,适用于风能研究和风力发电系统的优化分析。
www.kaggle.com 收录