登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Movies dataset IMDB 550k+
Movies dataset IMDB 550k+
收藏
kaggle
2026-07-13 更新
2026-07-24 收录
电影信息分析
多语言数据
数据链接:
https://www.kaggle.com/datasets/alanksijo/all-movies-1950-2026
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
All movies , All Languages as available on IMDB :)
本数据集包含互联网电影数据库(IMDb)平台上可获取的所有语种的全部影片资源
应用场景:
创建时间:
2026-07-13
相关数据集
Bharat Scene Text Dataset
场景文本识别
多语言数据
Bharat场景文本数据集包含13种语言的图像和文本标注,用于场景文本识别和检测。数据集详细记录了每种语言的图像数量、总词数及带有识别标注的词数,并通过JSON文件格式提供文本的标注信息。
github
2024-05-03 更新
49
0
C4Corpus
多语言数据
网络数据分析
C4Corpus是一个多语言的Web规模数据集,具有免费许可证,用于处理和分析来自CommonCrawl的Creative Commons内容。
github
2024-03-01 更新
31
0
Arknights En-Ja-Zh
游戏本地化
多语言数据
Multilingual in Arknignights. English, Japanese and Chinese langs. Cleaned.
kaggle
2023-07-01 更新
21
0
sentence-transformers/miracl
句子嵌入
多语言数据
MIRACL数据集是一个多语言数据集,支持包括英语、阿拉伯语、孟加拉语、西班牙语、波斯语、芬兰语、法语、印地语、印尼语、日语、韩语、俄语、斯瓦希里语、泰卢固语、泰语和中文在内的多种语言。该数据集主要用于特征提取和句子相似性任务。数据集包含多种配置,每种配置都有不同的特征和分割,主要关注三元组数据结构(anchor、positive、negative)。README文件中还提供了每种配置的字节数、示
Hugging Face
2024-06-20 更新
47
0
classla/xlm-r-bertic-data
自然语言处理
多语言数据
该数据集包含115亿个克罗地亚语、波斯尼亚语、黑山语和塞尔维亚语的文本单词,是BERTić-data数据集的扩展。新增了MaCoCu HBS爬取集合和mC4 HBS数据集。数据集通过`onion`工具基于5个单词的元组进行去重,重复阈值为90%。
Hugging Face
2024-05-29 更新
28
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广