MovieTweetings|电影评分数据集|社交媒体数据数据集
收藏MovieRatings-recommendation 数据集概述
数据集描述
MovieTweetings 数据集包含从Twitter上结构化推文中提取的电影评分。该数据集包括电影及其评价,相关数据已整理并收集至 train_data.csv
文件中。
数据集目的
该项目旨在开发基于知识、协同过滤和内容推荐的电影推荐技术。由于存在缺失值,传统的奇异值分解(SVD)方法不适用。FunkSVD技术被采用,有效处理了缺失值问题,并生成了包含5个潜在特征的U矩阵和V矩阵。
文件列表
movies_clean.csv
: 包含电影数据集。recommender_function.py
: 用于知识基础和内容基础推荐策略的Python文件。recommender_template.py
: 包含处理矩阵分解和进行电影推荐的Recommender类的Python文件。train_data.csv
: 包含电影评分的评价数据集。

AISHELL/AISHELL-1
Aishell是一个开源的中文普通话语音语料库,由北京壳壳科技有限公司发布。数据集包含了来自中国不同口音地区的400人的录音,录音在安静的室内环境中使用高保真麦克风进行,并下采样至16kHz。通过专业的语音标注和严格的质量检查,手动转录的准确率超过95%。该数据集免费供学术使用,旨在为语音识别领域的新研究人员提供适量的数据。
hugging_face 收录
AgiBot World
为了进一步推动通用具身智能领域研究进展,让高质量机器人数据触手可及,作为上海模塑申城语料普惠计划中的一份子,智元机器人携手上海人工智能实验室、国家地方共建人形机器人创新中心以及上海库帕思,重磅发布全球首个基于全域真实场景、全能硬件平台、全程质量把控的百万真机数据集开源项目 AgiBot World。这一里程碑式的开源项目,旨在构建国际领先的开源技术底座,标志着具身智能领域 「ImageNet 时刻」已到来。AgiBot World 是全球首个基于全域真实场景、全能硬件平台、全程质量把控的大规模机器人数据集。相比于 Google 开源的 Open X-Embodiment 数据集,AgiBot World 的长程数据规模高出 10 倍,场景范围覆盖面扩大 100 倍,数据质量从实验室级上升到工业级标准。AgiBot World 数据集收录了八十余种日常生活中的多样化技能,从抓取、放置、推、拉等基础操作,到搅拌、折叠、熨烫等精细长程、双臂协同复杂交互,几乎涵盖了日常生活所需的绝大多数动作需求。
github 收录
poi
本项目收集国内POI兴趣点,当前版本数据来自于openstreetmap。
github 收录
网易云音乐数据集
该数据集包含了网易云音乐平台上的歌手信息、歌曲信息和歌单信息,数据通过爬虫技术获取并整理成CSV格式,用于音乐数据挖掘和推荐系统构建。
github 收录
猫狗图像数据集
该数据集包含猫和狗的图像,每类各12500张。训练集和测试集分别包含10000张和2500张图像,用于模型的训练和评估。
github 收录