sapa1510/MSR-VTT
收藏资源简介:
MSRVTT数据集包含10,000个视频片段和200,000个字幕。我们采用标准1K-A分割协议,该协议由JSFusion引入,并已成为文本-视频检索领域的实际基准分割。训练集包括train_7k(7,010个视频,140,200个字幕)和train_9k(9,000个视频,180,000个字幕);测试集为test_1k(1,000个视频,1,000个字幕)。
配置项: - 配置名称:train_9k 数据文件: - 数据集划分:训练集(train) - 文件路径:"msrvtt_train_9k.json" - 配置名称:train_7k 数据文件: - 数据集划分:训练集(train) - 文件路径:"msrvtt_train_7k.json" - 配置名称:test_1k 数据文件: - 数据集划分:测试集(test) - 文件路径:"msrvtt_test_1k.json" 任务类别: - 文本到视频(text-to-video) - 文本检索(text-retrieval) - 视频分类(video-classification) 语言: - 英语(en) 规模类别: - 1K<n<10K [MSRVTT](https://openaccess.thecvf.com/content_cvpr_2016/html/Xu_MSR-VTT_A_Large_CVPR_2016_paper.html) 包含10000个视频片段与200000条字幕。 我们采用了[JSFusion](https://openaccess.thecvf.com/content_ECCV_2018/html/Youngjae_Yu_A_Joint_Sequence_ECCV_2018_paper.html)中提出的标准`1K-A划分`协议,该划分方式现已成为`文本-视频检索`领域的事实基准划分标准。 训练集: - train_7k:7010个视频,140200条字幕 - train_9k:9000个视频,180000条字幕 测试集: - test_1k:1000个视频,1000条字幕 🌟 引用 bibtex @inproceedings{xu2016msrvtt, title={Msr-vtt: A large video description dataset for bridging video and language}, author={Xu, Jun and Mei, Tao and Yao, Ting and Rui, Yong}, booktitle={Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)}, year={2016} }




