遇见数据集

InternVid

收藏
魔搭社区2026-07-07 更新2024-05-15 收录
官方服务:

资源简介:

### Clone with HTTP ```bash git clone https://www.modelscope.cn/datasets/AI-ModelScope/InternVid.git ``` ### Load dataset 该数据集需要token认证: ```python from modelscope import MsDataset from modelscope.hub.api import HubApi api = HubApi() api.login('YOUR_SDK_TOKEN') ds = MsDataset.load('AI-ModelScope/InternVid', subset_name='InternVid-10M-DIV', split='train') print(next(iter(ds))) ```

# InternVid ## 数据集说明 - **主页:** [InternVid](https://github.com/OpenGVLab/InternVideo/tree/main/Data/InternVid) - **代码仓库:** [OpenGVLab](https://github.com/OpenGVLab/InternVideo/tree/main/Data/InternVid) - **论文:** [2307.06942](https://arxiv.org/pdf/2307.06942.pdf) - **联系方式:** 邮件至 [InternVideo](mailto:gvx-sh@pjlab.org.cn) ## InternVid-10M-FLT 我们推出了本数据集的子集InternVid-10M-FLT,该子集包含1000万个视频片段,并为公开可用的网络视频生成了高质量的视频描述字幕。 ## 下载 该1000万条样本以JSON行格式(jsonlines)存储,数据字段包含视频ID(videoID)、时间戳(timestamps)、生成的描述字幕以及对应的UMT相似度得分。 ## 使用方法 from datasets import load_dataset dataset = load_dataset("OpenGVLab/InternVid") ## 方法 ![字幕生成方法](assert/caption_fig.jpg) ## 引用 如果您的研究中用到了本数据集,请引用InternVid相关论文。您的认可将极大助力我们持续为科研社区贡献相关资源。 @article{wang2023internvid, title={InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation}, author={Wang, Yi and He, Yinan and Li, Yizhuo and Li, Kunchang and Yu, Jiashuo and Ma, Xin and Chen, Xinyuan and Wang, Yaohui and Luo, Ping and Liu, Ziwei and Wang, Yali and Wang, Limin and Qiao, Yu}, journal={arXiv preprint arXiv:2307.06942}, year={2023} } @article{wang2022internvideo, title={InternVideo: General Video Foundation Models via Generative and Discriminative Learning}, author={Wang, Yi and Li, Kunchang and Li, Yizhuo and He, Yinan and Huang, Bingkun and Zhao, Zhiyu and Zhang, Hongjie and Xu, Jilan and Liu, Yi and Wang, Zun and Xing, Sen and Chen, Guo and Pan, Junting and Yu, Jiashuo and Wang, Yali and Wang, Limin and Qiao, Yu}, journal={arXiv preprint arXiv:2212.03191}, year={2022} }

提供机构:
maas
创建时间:
2024-03-06
搜集汇总
数据集介绍
InternVid 数据集图片
背景与挑战
背景概述
InternVid是由OpenGVLab提供的大规模视频-文本数据集,旨在支持多模态理解和生成研究。其子集InternVid-10M-FLT包含1000万个视频片段,每个片段都配有高质量生成字幕,数据以jsonlines格式提供,包括视频ID、时间戳和字幕信息。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务