遇见数据集

VST-Training-Data

收藏
Hugging Face2026-05-27 更新2026-05-28 收录
官方服务:

资源简介:

VST Training Data 是一个用于训练视频大语言模型的完整训练数据集,专门支持“视频流式思考”方法的研究与应用。该数据集旨在使模型能够同时观看和思考视频内容,涵盖了监督微调和强化学习两个训练阶段。数据内容包含多来源的视频-文本对(位于 vst_sft_data 子集中),以及用于强化学习阶段的专门数据(vst_rl_data 子集)。数据集适用于视频文本到文本生成、视觉问答等视频理解任务,并已用于训练 VST-3B、VST-7B 和 VST-32B 等一系列模型。相关研究发表于 arXiv:2603.12262。

VST Training Data is a comprehensive training dataset for training video large language models, specifically supporting the research and application of the Video Streaming Thinking method. This dataset aims to enable models to simultaneously watch and think about video content, covering both supervised fine-tuning and reinforcement learning training phases. The data includes multi-source video-text pairs (located in the vst_sft_data subset) and specialized data for the reinforcement learning phase (vst_rl_data subset). The dataset is suitable for video understanding tasks such as video text-to-text generation and visual question answering, and has been used to train a series of models including VST-3B, VST-7B, and VST-32B. Related research is published in arXiv:2603.12262.

创建时间:
2026-05-14
原始信息汇总

数据集概述

  • 数据集名称:VST Training Data
  • 许可证:Apache-2.0
  • 语言:英语
  • 任务类别:视频文本到文本、视觉问答
  • 标签:视频理解、视频大语言模型、流式视频、监督微调、强化学习

数据集用途

该数据集用于训练Video Streaming Thinking (VST) 模型,包含监督微调(SFT)和强化学习(RL)两个阶段的完整训练数据。

数据集结构

数据集包含两个子集:

子集 描述
vst_sft_data 监督微调数据,包含来自多个来源的视频-文本对
vst_rl_data 强化学习阶段数据

相关模型

使用本数据集训练的模型包括:

模型 链接
VST-3B https://huggingface.co/Catalan258/VST-3B
VST-7B https://huggingface.co/Catalan258/VST-7B
VST-32B https://huggingface.co/Catalan258/VST-32B

引用信息

该数据集基于论文《Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously》(arXiv:2603.12262),作者为Yiran Guan等人。

搜集汇总
数据集介绍
VST-Training-Data 数据集图片
构建方式
该数据集面向视频流式思维(Video Streaming Thinking, VST)研究范式,包含监督微调(SFT)与强化学习(RL)两个阶段的训练数据。SFT子集(vst_sft_data)集成多样化的视频-文本对来源,以构建指令跟随能力;RL子集(vst_rl_data)则专为强化学习阶段设计,旨在优化模型对视频流中动态信息的实时推理与决策能力。数据集的构建遵循开源Apache-2.0许可,仅使用英文语料,并聚焦于视频理解、视频大语言模型及流式视频处理等前沿领域。
特点
该数据集的核心特点在于其双阶段训练架构,能够同时服务于监督微调与强化学习优化,有效支撑视频大语言模型的流式推理能力。数据标签覆盖视频文本到文本生成与视觉问答两大任务,并通过标注视频理解、流式视频处理等关键词,确保数据与最新研究范式高度契合。此外,数据集与配套的VST模型系列(3B、7B、32B参数版本)紧密关联,为实验复现和模型训练提供了完整的生态支持。
使用方法
用户可基于HuggingFace或ModelScope平台直接加载该数据集,通过区分vst_sft_data与vst_rl_data两个子集,分别用于监督微调与强化学习阶段的模型训练。数据集采用标准格式,支持与主流视频大语言模型框架无缝集成;示例代码及基准模型(如VST-3B、VST-7B、VST-32B)已在对应HuggingFace仓库开放,用户可快速开展实验。论文中的引用格式亦随数据集提供,便于学术使用时的规范引用。
背景与挑战
背景概述
VST-Training-Data数据集由Yiran Guan、Liang Yin等研究人员于2026年发布,旨在推动视频大语言模型(VideoLLMs)实现‘边观看边思考’的流式视频理解能力。该数据集包含监督微调(SFT)与强化学习(RL)两阶段训练数据,覆盖多源视频-文本对及推理信号,为训练VST-3B、VST-7B、VST-32B等模型提供了关键支撑。作为视频理解与推理交叉领域的开创性资源,它弥合了传统视频模型依赖离线处理的局限,促使模型在实时流媒体场景中同步执行感知与推理,对智能监控、无人驾驶、人机交互等动态环境下的应用具有深远影响。
当前挑战
该数据集面临的核心挑战在于领域问题层面:流式视频理解要求模型在持续输入的视频流中实时解析事件演进与上下文关联,而现有模型多聚焦于离线剪辑片段,难以应对时序依赖与计算延迟的权衡。构建过程中的挑战则包括:多源视频-文本数据的异质性标注规范统一,以及RL阶段奖励信号的设计——需精确量化‘同步观看与思考’行为,避免模型在长视频中陷入语义漂移或遗忘。此外,大规模流式数据的存储与高效采样,以及不同模型规模下训练策略的适配,亦构成技术障碍。
常用场景
经典使用场景
VST-Training-Data数据集专为视频流式思考(Video Streaming Thinking)任务而构建,其经典使用场景在于训练能够边观看视频边实时推理的视频大语言模型(VideoLLMs)。该数据集包含监督微调与强化学习两阶段数据,覆盖多源视频文本对,使模型在动态视频流中同步完成理解与生成,突破传统视频理解中先编码后推理的静态范式。研究者利用此数据可训练出具备流式处理能力的视频模型,实现视频问答、实时描述等任务中的零延迟响应。
实际应用
在实际应用中,基于VST-Training-Data训练的模型可部署于视频监控异常检测、自动驾驶实时场景理解、直播内容实时审核与字幕生成等场景。例如在安防领域,模型能边观测视频流边推理异常事件,即时发出预警;在智能终端设备上,该数据支持的低功耗流式模型可实现手机视频实时翻译或语音助手同步解读视频内容。其流式特性特别适配边缘计算环境,使视频理解能力从云端服务下沉至终端设备,拓展了视频AI在低延迟场景中的落地可能性。
衍生相关工作
基于VST-Training-Data,研究者衍生出系列经典工作,包括多尺度视频流式思维链模型VST-3B/7B/32B,验证了数据规模化对流式推理性能的提升。该数据启发了视频强化学习领域的研究,催生了针对流式视频的RLHF范式探索。后续工作进一步将流式思维扩展至多模态对话系统,衍生出实时视频交互框架;同时推动了视频流式训练数据标准化构建方法,引领了如StreamingVideoQA等基准数据集的诞生,形成了视频理解中“流式感知-实时推理-即时反馈”的技术生态闭环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务