VST-Training-Data
收藏资源简介:
VST Training Data 是一个用于训练视频大语言模型的完整训练数据集,专门支持“视频流式思考”方法的研究与应用。该数据集旨在使模型能够同时观看和思考视频内容,涵盖了监督微调和强化学习两个训练阶段。数据内容包含多来源的视频-文本对(位于 vst_sft_data 子集中),以及用于强化学习阶段的专门数据(vst_rl_data 子集)。数据集适用于视频文本到文本生成、视觉问答等视频理解任务,并已用于训练 VST-3B、VST-7B 和 VST-32B 等一系列模型。相关研究发表于 arXiv:2603.12262。
VST Training Data is a comprehensive training dataset for training video large language models, specifically supporting the research and application of the Video Streaming Thinking method. This dataset aims to enable models to simultaneously watch and think about video content, covering both supervised fine-tuning and reinforcement learning training phases. The data includes multi-source video-text pairs (located in the vst_sft_data subset) and specialized data for the reinforcement learning phase (vst_rl_data subset). The dataset is suitable for video understanding tasks such as video text-to-text generation and visual question answering, and has been used to train a series of models including VST-3B, VST-7B, and VST-32B. Related research is published in arXiv:2603.12262.
数据集概述
- 数据集名称:VST Training Data
- 许可证:Apache-2.0
- 语言:英语
- 任务类别:视频文本到文本、视觉问答
- 标签:视频理解、视频大语言模型、流式视频、监督微调、强化学习
数据集用途
该数据集用于训练Video Streaming Thinking (VST) 模型,包含监督微调(SFT)和强化学习(RL)两个阶段的完整训练数据。
数据集结构
数据集包含两个子集:
| 子集 | 描述 |
|---|---|
vst_sft_data |
监督微调数据,包含来自多个来源的视频-文本对 |
vst_rl_data |
强化学习阶段数据 |
相关模型
使用本数据集训练的模型包括:
| 模型 | 链接 |
|---|---|
| VST-3B | https://huggingface.co/Catalan258/VST-3B |
| VST-7B | https://huggingface.co/Catalan258/VST-7B |
| VST-32B | https://huggingface.co/Catalan258/VST-32B |
引用信息
该数据集基于论文《Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously》(arXiv:2603.12262),作者为Yiran Guan等人。





