Netflix内容数据集
收藏资源简介:
该数据集包含Netflix平台上电影和电视节目的详细信息,如唯一ID、类型、标题、导演、演员、制作国家、添加日期、发布年份、评级、持续时间和描述等。
This dataset contains detailed information about movies and TV shows on the Netflix platform, including unique ID, genre, title, director, cast, country of production, date added, release year, rating, duration, and description, etc.
Netflix节目聚类与推荐系统
描述
本项目对Netflix内容数据集进行探索性数据分析(EDA)和聚类分析。目标是揭示洞察和模式,基于文本属性对内容进行聚类,以理解分类和趋势。
目标
本项目的目标是分析Netflix数据集,识别平台内容的模式和趋势。此外,旨在通过聚类将相似的电影和电视节目基于其属性进行分组,提供对内容分布和特征的更清晰理解。
属性信息
show_id: 每个电影/电视节目的唯一IDtype: 标识 - 电影或电视节目title: 电影/电视节目的标题director: 电影的导演cast: 参与电影/节目的演员country: 电影/节目制作的国家date_added: 在Netflix上添加的日期release_year: 电影/节目的实际发行年份rating: 电影/节目的电视评级duration: 总时长 - 以分钟或季数表示listed_in: 类型description: 摘要描述
结论
-
EDA的关键发现: Netflix上的电影数量多于电视节目,节目总数随时间显著增加。大多数节目在美国制作,主要面向成年和年轻成年观众。
-
聚类方法: 我们基于导演、演员、国家、类型和描述等属性对数据进行聚类。这些属性通过TFIDF向量化器进行标记化、预处理和向量化。
-
特征工程: 我们使用TFIDF向量化生成了20,000个属性。
-
降维: 应用主成分分析(PCA)进行降维。我们发现4,000个成分捕获了超过80%的方差,因此将成分限制为4,000个。
-
聚类算法: 肘方法和轮廓分数分析确定了6个最优聚类数。- 凝聚聚类:树状图可视化确定了12个最优聚类。
-
基于内容的推荐系统: 开发了一个基于内容的推荐系统,使用余弦相似度。该系统根据用户观看的节目类型提供10个推荐。




