登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Movie Scripts Corpus
Movie Scripts Corpus
收藏
kaggle
2021-11-09 更新
2024-03-07 收录
电影剧本分析
文本处理
数据链接:
https://www.kaggle.com/datasets/gufukuro/movie-scripts-corpus
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Almost 3000 movie script texts and annotations by structural elements
近3000份电影剧本文本及基于结构元素的标注注释
应用场景:
创建时间:
2021-11-09
相关数据集
SALT-NLP/positive_reframing
情感分析
文本处理
Positive Psychology Frames数据集包含8,349对重新构建的句子,其中原始句子来自负面推文(#stressed),而重新构建的句子则由接受过积极心理学方法培训的众包工作者提供。该数据集旨在通过积极心理学的策略,将过度负面的文本自动重构为更积极的视角。数据集中的重构策略包括成长心态、无常性、中立化、乐观主义、自我肯定和感恩等。
Hugging Face
2023-03-23 更新
49
0
dbbiyte/CISA-testset
情感分析
文本处理
CISA-testset是一个从İbrahim Temo的回忆录中提取的历史土耳其文本数据集,用于评估跨个体情感分析模型在真实历史文本上的性能。该数据集包含了200个句子,专注于历史人物和个性的情感分析,并具有连续性和真实性。数据集的创建旨在保持历史真实性,确保实体-情感关系的多样性,保留原始奥斯曼土耳其语的语言学特征,并提供全面的研究可再现性元数据。
Hugging Face
2025-08-01 更新
7
0
cicero-im/processed
文本处理
机器学习
这是一个包含文本数据的训练集,其中包括原始文本、遮蔽文本、文件类型、创建时间和错误信息等字段。数据集分为训练集部分,共有1356个示例。
Hugging Face
2025-02-09 更新
6
0
Cohere/miracl-ja-corpus-22-12
文本处理
自然语言处理
MIRACL(跨语言信息检索)是一个多语言检索数据集,专注于18种不同语言的搜索,这些语言涵盖了全球超过30亿的母语使用者。每个语言的语料库是从维基百科的转储中准备的,仅保留纯文本并丢弃图像、表格等内容。每篇文章根据自然话语单元(如维基标记中的` `)分割成多个段落,每个段落构成一个“文档”或检索单元。我们保留了每个段落的维基百科文章标题。该数据集的日语版本使用了cohere.ai的`multi
Hugging Face
2023-02-06 更新
16
0
geodesic-research/sfm-midtraining-mix-ai-filtering-results
AI过滤
文本处理
该数据集名为alignment_filtering_20251126-0344,由geodesic-research提供。数据集包含多个特征字段,包括id、word_filter(布尔类型)、word_filter_metadata(结构化数据,包含keywords和reason字段)、bert_filter(布尔类型)、bert_filter_metadata(结构化数据,包含highest_s
Hugging Face
2025-12-17 更新
7
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广