遇见数据集

StreamDelta

收藏
Hugging Face2026-08-12 更新2026-08-13 收录
官方服务:

资源简介:

Streamo-Instruct-465K 是一个用于流式视频指令微调的数据集,旨在训练能够实时响应视频流事件的交互式视频语言模型。数据集包含约465K个视频问答对,每个样本包含原始标注格式与转换后的多轮对话流格式。原始标注中,问题带有时间戳(如"5"表示第5秒出现),响应包含事件的起始时间(st_time)、结束时间(end_time)以及即时响应时间(time)。训练数据采用多轮对话形式,每轮对应一个视频帧(1fps),使用特殊token标记模型状态:</Silence>表示无相关事件,</Standby>表示事件进行中,</Response>表示事件完成并开始输出答案。数据来源为自定义标注,任务类型为问答(QA)。数据集支持通过提供的脚本从原始格式转换为训练格式,适用于开发能够流式处理视频并生成即时响应的通用助手。

Streamo-Instruct-465K is a dataset for streaming video instruction fine-tuning, designed to train interactive video-language models capable of real-time response to video stream events. The dataset contains approximately 465K video question-answer pairs, each sample includes both the original annotation format and the converted multi-turn dialogue stream format. In the original annotations, questions are timestamped (e.g., "5" indicating appearance at the 5th second), and responses include the start time (st_time), end time (end_time), and immediate response time (time). Training data adopts a multi-turn dialogue format, with each turn corresponding to a video frame (1fps), using special tokens to mark model states: </Silence> indicates no relevant event, </Standby> indicates an ongoing event, and </Response> indicates the event is complete and the answer is output. The data source is custom annotation, and the task type is question answering (QA). The dataset supports conversion from the original format to the training format via provided scripts, suitable for developing general-purpose assistants that can stream video and generate instant responses.

创建时间:
2026-08-04
原始信息汇总

数据集概述

基本信息

  • 数据集名称:Streamo-Instruct
  • 所属项目:Streamo(流式视频指令微调)
  • 对应论文Streaming Video Instruction Tuning(已被CVPR 2026接收)
  • 发布机构:maifoundations
  • 发布时间:2026年1月27日

数据集定位

该数据集用于训练流式视频大语言模型(Streaming Video LLM),使模型能够作为通用交互式助手,对实时视频流进行实时理解和响应。

数据集规模

数据集名称为 Streamo-Instruct-465K,推测包含约46.5万条指令数据。

数据格式

原始数据格式

原始标注文件(raw_data.json)包含视频名称、路径、任务类型、问题(含出现时间)和回答(含事件起止时间)等信息,支持将视频事件与时间戳精确关联。

训练数据格式(流式格式)

训练数据采用多轮对话格式,每轮对应一个视频帧(视频以1fps采样),对话中包含系统提示、用户问题、时间戳区间标记(如<0s-1s>)以及特殊的流式标记。

特殊Token说明

Token 含义
</Silence> 当前输入无相关事件
</Standby> 事件正在进行但未完成
</Response> 事件已完成,开始输出答案

使用方式

  • 提供转换脚本scripts/convert_streaming_video.py,可将原始数据转换为训练所需的流式格式
  • 数据集的视频以1fps采样,<stream>为当前帧占位符,训练时替换为<image>
  • 提供示例文件位于dataset/example/目录

其他说明

搜集汇总
数据集介绍
StreamDelta 数据集图片
构建方式
StreamDelta数据集的构建方法依托于流式视频指令微调的核心思想,通过将原始视频注释转换为多轮对话格式,以每秒一帧的采样率生成流式训练数据。构建流程首先定义原始的注释结构,包含视频名称、路径、任务类型以及带时间戳的问题与回答,随后利用转换脚本将原始数据统一转化为流式格式。每一轮对话对应一个视频帧,并引入特殊标记(如</Silence>、</Standby>、</Response>)以表征模型在不同时间点的响应状态,从而精准捕获视频中事件的发生与演进过程。
特点
该数据集的核心特色在于其时间敏感性和流式交互设计。它突破了传统视频问答中静态处理的局限,使模型具备实时感知与渐进式响应的能力。通过时间戳对齐问题与事件起始/终止时间,数据能够模拟真实场景中用户提问与即时反馈的动态交互。此外,特殊标记的引入实现了对无事件、事件进行中及事件完成三种状态的精细区分,显著增强了模型在多轮对话中对视频内容状态的跟踪与记忆能力,为构建通用型流式视频助手奠定了数据基础。
使用方法
使用StreamDelta数据集时,研究者需按照规定的JSON格式准备训练数据,利用提供的转换脚本将原始注释转化为适用于模型训练的多轮对话流格式。训练过程中,视频以1fps采样,每个<stream>占位符在训练时会替换为对应的视频帧图像。模型通过识别<Xs-Ys>时间戳与特殊标记,学习在不同时间点生成合适的响应。数据集的训练代码基于ms-swift框架,用户可直接运行训练脚本进行模型微调,从而开发能够实时交互的视频理解系统。
背景与挑战
背景概述
StreamDelta数据集由香港大学等机构的研究人员于2025年创建,旨在推动流式视频理解领域的发展。该数据集围绕实时流式视频指令跟随这一核心问题,通过引入时间戳标注和流式对话格式,支持模型在视频播放过程中进行即时响应。其构建基于Streamo框架,相关工作已被CVPR 2026接收,为多模态大模型在动态视频场景下的交互式应用提供了重要基准。数据集包含约46.5万条指令,并配套了详细的训练代码和演示,对视频理解与具身智能等方向具有深远影响。
当前挑战
该数据集面临的挑战主要来自两个层面。领域层面,传统视频理解任务多聚焦于离线处理,而流式视频要求模型在时间约束下进行实时推理与响应,这对时序建模和动态决策能力提出了更高要求。构建层面,数据标注需精确捕捉事件起止时间及响应时机,手工标注成本高且易产生歧义;此外,将原始非结构化视频转换为带时间戳的多轮对话格式,涉及复杂的数据清洗与对齐流程,加之视频数据本身的多样性,使得构建高质量训练集面临显著困难。
常用场景
经典使用场景
StreamDelta数据集专为流式视频理解与交互任务而设计,其核心使用场景聚焦于实时视频流中的动态事件感知与响应生成。该数据集通过精细的时间戳标注,将视频划分为秒级片段,并配以流式对话格式,使得模型能够在视频播放过程中逐帧处理信息,实时判断事件状态(如静默、进行中或已完成),并据此生成及时、准确的问答反馈。这种设计为训练具备流式处理能力的视频大语言模型提供了标准化的基准,广泛应用于实时视频监控、在线教育互动、直播内容解析等需要即时视频理解与反馈的场景。
衍生相关工作
StreamDelta的出现催生了一系列相关的后续研究工作。基于其流式指令微调框架,研究者探索了更加高效的视频帧采样策略与时间感知编码器,以降低计算成本并提升实时性。同时,该数据集促进了多模态流式对话模型的发展,衍生出针对流式视频问答的基准测试集和评测协议。在模型架构层面,相关研究借鉴其流式处理思路,设计出具有更优记忆管理机制的视频变换器,进一步推进了视频理解模型的演进。此外,基于StreamDelta的成果,还衍生了关于流式视频摘要生成、实时事件定位等子任务的研究,丰富了该领域的研究生态。
数据集最近研究
最新研究方向
StreamDelta数据集聚焦于流式视频指令微调的前沿领域,旨在突破传统视频理解模型对完整视频片段的依赖,实现实时、交互式的视频流问答。该方向与2025-2026年多模态大模型在视频理解中的实时性需求紧密相关,尤其针对智能助手、自动驾驶和安防监控等需要即时响应的应用场景。该数据集通过独特的“静默-待命-响应”机制,支持模型在视频流中动态识别事件并生成响应,其发布标志着视频大模型从离线分析向流式交互的范式转变。此研究不仅推动了多模态学习在时间维度上的精细化建模,也为构建通用型实时视频助手奠定了数据基础,对提升人机交互的自然度和实时性具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务