遇见数据集

VideoChat3-OL617k

收藏
Hugging Face2026-07-15 更新2026-07-16 收录
官方服务:

资源简介:

VideoChat3-OL617K 是一个用于VideoChat3的在线视频指令数据集,旨在训练主动式流视频助手。这些助手能够持续观察输入的视频流,积累视觉证据,并在适当时机做出响应。数据集通过将视频-问题-答案三元组转换为因果流监督来实现这一目标:首先定位并验证视觉线索的时间间隔,然后将其转化为包含显式响应状态标记的流序列。这些标记包括 `</Silence>`(教导模型保持沉默)、`</Standby>`(教导模型继续收集证据)和 `</Response>`(教导模型提供答案),从而指导模型在流式视频处理中的决策时机。数据集以 JSONL 注释文件的形式提供,原始视频未包含在内,用户需要根据提供的原始数据集路径自行解析视频。数据来源于多个公开视频数据集,包括 StreamForest、Streamo、Seeker、AVA(补充)和 EgoQA(补充)。一个名为 `ol617k.json` 的文件提供了数据集注释与视频源之间的映射关系,便于组织数据集结构。该数据集适用于视频到文本的生成任务,特别是需要实时或流式处理的视频对话与问答场景。

VideoChat3-OL617K is an online video instruction dataset for VideoChat3, designed to train proactive streaming video assistants. These assistants can continuously observe input video streams, accumulate visual evidence, and respond at appropriate times. The dataset achieves this by converting video-question-answer triples into causal flow supervision: first, locating and verifying the time intervals of visual cues, then transforming them into streaming sequences containing explicit response state tokens. These tokens include `</Silence>` (teaching the model to remain silent), `</Standby>` (teaching the model to continue collecting evidence), and `</Response>` (teaching the model to provide answers), thereby guiding the models decision timing in streaming video processing. The dataset is provided in the form of JSONL annotation files, with original videos not included; users need to parse videos based on provided raw dataset paths. Data is sourced from multiple public video datasets, including StreamForest, Streamo, Seeker, AVA (supplement), and EgoQA (supplement). A file named `ol617k.json` provides mapping relationships between dataset annotations and video sources, facilitating dataset organization. This dataset is suitable for video-to-text generation tasks, particularly for real-time or streaming video dialogue and question-answering scenarios.

创建时间:
2026-07-05
原始信息汇总

数据集概述

数据集名称:VideoChat3-OL617K
许可证:Apache-2.0
任务类别:视频-文本到文本(video-text-to-text)
语言:英文
标签:视频、在线(online)

核心功能与设计

VideoChat3-OL617K 是 VideoChat3 模型使用的在线视频指令数据集,旨在训练主动式流式视频助手。该助手能够持续观察传入的视频、累积视觉证据,并在适当时刻做出响应。

数据集将视频-问题-答案三元组转换为因果流式监督形式。具体流程如下:

  • 首先定位并验证视觉线索区间;
  • 然后将其转换为包含显式响应状态标记的流式序列。

使用的响应状态标记包括:

  • </Silence>:指示模型保持沉默
  • </Standby>:指示模型继续收集证据
  • </Response>:指示模型提供答案

数据来源

VideoChat3-OL617K 整合了以下视频数据集中的视频内容(原始视频未在本仓库中重复存储,用户需从原始数据集路径获取视频):

来源数据集 原始视频数据集路径
StreamForest https://huggingface.co/datasets/MCG-NJU/StreamForest-Annodata
Streamo https://huggingface.co/datasets/maifoundations/Streamo-Instruct-465K
Seeker https://huggingface.co/datasets/MCG-NJU/Seeker-173K
AVA (Supplement) https://github.com/cvdfoundation/ava-dataset
EgoQA (Supplement) https://ego4d-data.org/

使用说明

本仓库提供 JSONL 格式的标注文件。文件 ol617k.json 提供了数据集标注与视频源之间的映射关系,可用于组织数据集结构。

引用

若使用本数据,请引用 VideoChat3 以及标注所依据的原始视频数据集。

搜集汇总
数据集介绍
VideoChat3-OL617k 数据集图片
构建方式
VideoChat3-OL617K是专为训练主动式流视频助手而设计的在线视频指令数据集,其构建方式将视频-问题-答案三元组转化为因果流监督信号。首先定位并验证视频中的视觉线索区间,随后将其转化为包含显式响应状态令牌(</Silence>、</Standby>和</Response>)的流序列,分别指示模型保持静默、持续收集证据以及给出答案的时机。该数据集整合了StreamForest、Streamo、Seeker、AVA和EgoQA等多个视频数据源的标注信息,并提供了JSONL格式的注释文件,用户需自行从原始路径获取视频内容。
特点
该数据集的核心特点在于其开创性的流式监督机制,通过引入三种响应状态令牌,使模型能够根据视频流的动态变化自主决策何时作答,从而实现对连续视频输入的实时感知与主动响应。这种设计模拟了人类在观看视频时积累证据并适时回应的认知过程,显著提升了视频理解模型的交互自然性与时效性。数据集规模达617K条指令,覆盖多元化场景,为构建具备动态推理能力的视频助手提供了高质量的训练基础。
使用方法
使用VideoChat3-OL617K时,研究人员需从提供的JSONL注释文件中加载标注信息,并依据文件中的视频源映射表(ol617k.json)从原始数据集路径获取对应视频。注释中的令牌标记可直接用于训练流式视频语言模型,通过因果注意力机制使模型学习在适当状态切换时触发响应。建议将数据集与社会学、人机交互等领域的应用场景结合,以充分发挥其动态视频理解能力。
背景与挑战
背景概述
随着多模态大语言模型的飞速发展,视频理解已从静态剪辑分析迈向动态流式交互的新阶段。在此背景下,VideoChat3-OL617k数据集由南京大学等机构的研究团队于2024年创建,旨在填补流式视频指令数据的空白。该数据集聚焦于训练能够主动观测连续视频流、累积视觉证据并在适当时刻做出响应的智能助手,核心研究问题在于实现视频理解中的因果式流式监督。依托StreamForest、Streamo、Seeker等高质量视频资源,VideoChat3-OL617k通过将视频-问题-答案三元组转化为带有显式响应状态令牌的流式序列,为在线视频助手提供了关键训练基础,对推动实时视频对话系统的发展具有重要影响力。
当前挑战
该数据集所解决的领域问题挑战在于:传统视频问答模型往往需处理完整视频片段,无法在流式场景中动态决定“何时沉默、何时收集证据、何时回答”,缺乏主动性和实时性。为解决此问题,数据构建过程需克服多重挑战:其一,需从原始视频中精准定位并验证视觉线索的时间区间,确保问答逻辑与视频流时序严格对齐;其二,需将非流式的三元组数据转化为带有</Silence>、</Standby>和</Response>状态令牌的因果式序列,这要求设计合理的转换规则以维持对话的连贯性和因果性;其三,由于视频数据来源于多个异构数据集,需统一格式并解决视频版权与存储问题,确保标注与源视频的可靠映射。
常用场景
经典使用场景
VideoChat3-OL617K数据集的核心用途在于构建和训练具备主动交互能力的流式视频助手。该数据集将传统的视频-问题-答案三元组转化为因果流式监督信号,使得模型能够连续观察实时视频流,动态积累视觉证据,并在恰当的时机做出响应。通过引入明确的响应状态令牌,如静默、待命和回答,数据集教会模型在视频理解过程中何时保持沉默、何时继续收集信息以及何时给出答案。这一设计使其成为流式视频理解与在线对话系统研究的基石,广泛应用于多模态大语言模型的在线视频问答训练。
解决学术问题
该数据集的提出有效解决了流式视频理解领域中长期存在的两个核心学术问题:一是如何让模型具备主动观察和判断响应时机的能力,而非被动应答;二是如何将离散的视频问答样本转化为连续的时序监督信号。通过构建基于视觉线索定位和验证的流式序列,VideoChat3-OL617K使得模型能够从持续的视频流中自主决定回答的触发条件,显著提升了在线视频交互系统的智能性和自然度。这一工作为主动视频理解、时序推理和在线多模态学习提供了重要的数据基础,推动了多模态大模型在动态环境中的实时决策能力研究。
衍生相关工作
基于VideoChat3-OL617K数据集,研究者已发展出一系列重要工作。最直接的是其所属的VideoChat3系列模型,该系列将流式视频理解与多模态对话模型相结合,开创了主动式视频问答的新范式。此外,数据集所整合的StreamForest、Streamo和Seeker等原始视频数据源已被广泛应用于时序动作定位、视频摘要和在线事件检测等任务。受其启发,后续工作开始探索如何将流式监督信号引入更细粒度的视频理解场景,如流式视频分割和实时视觉推理,推动了多模态在线学习领域的持续演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务