遇见数据集

Replication Data for: Movie Scripts Corpus

收藏
DataONE2024-05-06 更新2025-04-26 收录
官方服务:

资源简介:

Data Source: https://www.kaggle.com/datasets/gufukuro/movie-scripts-corpus Data Description : Movie Scripts Corpus This corpus was collected to use for screenplay analysis with machine learning methods. Corpus includes movie scripts, crawled from different sources, their annotations by script structural elements and movies metadata. Corpus description Screenplay data consists of: Movie scripts TXT-documents with raw full text (2858 docs) Movie scripts TXT-documents with full text lemmas (2858 docs) Manual annotation TXT-documents for some movie scripts (33 docs, more than 6000 annotated rows) Movie scripts annotations TXT-documents obtained by BERT Movie scripts annotations json-documents obtained by rule-based annotator ScreenPy Movies metadata consists of: Cut versions of movie reviews and scores from metacritic: Number of reviews: 21025 Number of movies with reviews: 2038 Metadata for movies, including: title, akas, launch year, score from metacritic, imdb user rating and number of votes from imdb.com, movie awards, opening weekend, producers, budget, script department, production companies, writers, directors, cast info, countries involved in production, age restrict, plot (with outline), keywords, genres, taglines, critics' synopsis Screenplay awards information: Academy Awards adapted screenplay, Academy Awards original screenplay, BAFTA, Golden Globe Award for Best Screenplay, Writers Guild Awards Winners & Nominees 2020-2013 nominations information for 462 movies in total. Movie characters data consists of: Script text fragments with dialogs and scene descriptions for characters, gathered with annotators: 2153 movies and text fragments for 32114 characters in total Gender labels for 4792 characters

数据来源:https://www.kaggle.com/datasets/gufukuro/movie-scripts-corpus 数据集描述:本数据集为电影剧本语料库(Movie Scripts Corpus),专为依托机器学习方法开展剧本分析而构建。 语料库详情如下: ### 剧本数据 包含以下类型的文件: 1. 原始全文剧本文本文件(TXT文档,共2858份) 2. 包含全文词形还原(lemmas)结果的剧本文本文件(TXT文档,共2858份) 3. 针对部分电影剧本的人工标注文本文件(共33份,标注行数超6000行) 4. 基于BERT模型生成的电影剧本标注文本文件(TXT文档) 5. 基于规则标注器ScreenPy生成的电影剧本标注JSON文档 ### 电影元数据 包含两类核心内容: 1. 来自Metacritic的精简版影评与评分数据: - 影评总数:21025条 - 收录影评的电影数量:2038部 2. 电影基础元数据,涵盖:标题、别名、上映年份、Metacritic评分、IMDb(互联网电影数据库)用户评分与IMDb投票数、电影奖项、首映周末票房、制片方、预算、剧本部门信息、制作公司、编剧、导演、演职人员信息、制作参与国家、年龄分级、剧情梗概(含大纲)、关键词、影片类型、宣传标语、影评人剧情简介。 ### 剧本奖项信息 涵盖2013至2020年间共462部电影的以下奖项的获奖与提名情况:奥斯卡金像奖(Academy Awards)最佳改编剧本、奥斯卡金像奖最佳原创剧本、英国电影学院奖(BAFTA)、金球奖最佳剧本奖、美国编剧工会奖(Writers Guild Awards)。 ### 电影角色数据 由标注人员收集的、标注有角色对话与场景描述的剧本文本片段,总计覆盖2153部电影,共32114个角色的文本片段;其中4792个角色标注了性别标签。

创建时间:
2024-09-24
搜集汇总
数据集介绍
Replication Data for: Movie Scripts Corpus 数据集图片
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务