AiresPucrs/tmdb-5000-movies
收藏资源简介:
tmdb-5000-movies数据集是一个包含电影信息的集合,这些信息来源于The Movie Database (TMDB)。该数据集通常用于机器学习和数据分析,以探索电影行业中的模式和趋势,也可以用于推荐系统。数据集包含两个主要表格:movies_metadata.csv和credits.csv,分别包含电影的一般信息和演员及工作人员的信息。数据集包含22个特征,如id、budget、genres、homepage等,总共有4,803个样本。
The tmdb-5000-movies dataset is a collection of movie information sourced from The Movie Database (TMDB). This dataset is commonly utilized in machine learning and data analytics to explore patterns and trends within the film industry, and can also be applied to recommendation systems. The dataset consists of two primary tables: movies_metadata.csv and credits.csv, which contain general movie information as well as information about cast and crew respectively. It encompasses 22 features including id, budget, genres, homepage, among others, with a total of 4,803 samples.
tmdb-5000-movies 数据集概述
数据集详情
数据集名称
- tmdb-5000-movies
语言
- 英语
数据集大小
- 总样本数:4,803
数据集结构
- 包含两个主要表格:
- movies_metadata.csv:
- 包含电影的通用信息,如标题、语言、发行日期、预算、收入、受欢迎程度和平均投票。
- 每行对应一部电影。
- credits.csv:
- 包含每部电影的演员和工作人员的详细信息。
- 每行对应一个特定电影的工作人员(演员、导演、编剧等)。
- movies_metadata.csv:
数据集特征
- 数据集包含以下22个特征:
- id
- budget
- genres
- homepage
- keywords
- original_language
- original_title
- overview
- popularity
- production_companies
- production_countries
- release_date
- revenue
- runtime
- spoken_languages
- status
- tagline
- title
- vote_average
- vote_count
- cast
- crew
数据集分割
- 训练集(train)
- 样本数:4803
- 字节数:40655819
数据集大小
- 下载大小:13875246 字节
- 数据集大小:40655819 字节
许可证
- 该数据集的许可证为 Other。




