遇见数据集

findcard12138/Realtime-SFT

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

Realtime-SFT是一个包含100,000个样本的流式风格视频问答数据集,基于YouTube短视频构建。每个样本包含多模态对话和帧时间戳元数据,这些数据将助手文本中的每个`<|video|>`标记与一个视频帧时间戳对齐。数据集不重新分发视频文件,仅提供注释、YouTube视频ID和时间戳元数据;用户需根据YouTube服务条款和原始上传者的许可自行获取视频。数据集来源为YouTube平台,包含24,817个独特的YouTube视频,视频时长在4分钟以内,帧采样率为每秒1帧。语言分布为英语(93,815个样本)和中文(6,185个样本),涵盖27个类别,注释数据采用CC-BY-NC-4.0许可。数据集结构包括一个训练分割,存储为Parquet分片,每个行包含id、language、messages和video字段。特殊标记如`<|video|>`用于标记视频帧位置,`<|silence|>`表示助手保持静默的时间步,`<|...|>`用于流式对话中的早期截断。构建流程通过语义构建和时间布局对齐两个阶段,将原始视频流转换为时间对齐的多轮对话。加载方法支持使用Hugging Face datasets库或直接读取Parquet文件。视频访问需用户基于提供的video_id和frame_timestamps自行从YouTube获取并对齐帧。数据集旨在用于实时流式视频理解的学术研究,不应用于商业部署、人脸识别、监控或其他可能侵犯隐私或平台条款的应用。局限性包括YouTube视频可能因删除、隐私变更、区域限制或账户更改而不可用,视频文件未包含,且未进行个人身份信息、不当内容或敏感内容的审核。

Realtime-SFT is a 100K-sample streaming-style video question answering dataset constructed from short YouTube videos. Each sample contains a multimodal conversation and frame timestamp metadata that aligns every `<|video|>` token in the assistant text with one video frame timestamp. This repository does not redistribute video files. It only provides annotations, YouTube video IDs, and timestamp metadata. Users are responsible for obtaining videos according to YouTube Terms of Service and the original uploaders licenses. The dataset source is YouTube, with 24,817 unique YouTube videos, duration within 4 minutes, frame sampling at 1 fps. Languages are English (93,815 samples) and Chinese (6,185 samples), covering 27 categories, and the license for annotations is CC-BY-NC-4.0. The dataset structure has one train split stored as Parquet shards, each row with id, language, messages, and video fields. Special tokens include `<|video|>` for video frame positions, `<|silence|>` for silent timesteps, and `<|...|>` for early cut-offs in streaming conversations. The construction pipeline involves semantic construction and temporal layout alignment phases to convert raw video streams into time-aligned multi-turn dialogues. Loading methods support using Hugging Face datasets library or direct Parquet reading. Video access requires users to independently obtain videos from YouTube using provided video_id and frame_timestamps for alignment. The dataset is intended for academic research on real-time and streaming video understanding, and should not be used for commercial deployment, face recognition, surveillance, or other applications that may violate privacy or platform terms. Limitations include potential unavailability of YouTube videos due to deletion, privacy changes, regional restrictions, or account changes; video files are not included, and PII, NSFW, and sensitive-content audits have not been performed.

提供机构:
findcard12138
搜集汇总
数据集介绍
findcard12138/Realtime-SFT 数据集图片
构建方式
Realtime-SFT数据集通过一个两阶段的流水线构建而成,旨在将原始视频流转化为时间对齐的多轮对话。首先,从视频的分层描述中提取逐秒动作序列作为语义基础。第一阶段为语义构建,包括关键事件检测、指令生成和响应生成,其中大型语言模型根据历史上下文和局部变化生成用户指令,并决定是否发言。第二阶段为时间布局与对齐,将每条指令锚定到到达时间戳,匹配回复以模拟隐含延迟,再以动态速率生成令牌,并用<|silence|>填充空闲时间步,最终将用户指令、助手令牌、静默和帧对齐的<|video|>令牌合并到一条时间线上,形成单轮会话。来自同一视频的多个单轮会话拼接后,加上共享系统提示和纯静默前缀,构成最终的流式对话样本。
特点
该数据集包含10万个样本,源自24,817个YouTube短视频,时长均在4分钟以内,以1帧/秒的频率采样。数据集中93,815个样本为英文,6,185个为中文,覆盖27个类别。其独特之处在于使用了<|video|>和<|silence|>等特殊令牌,使助手回复中的每个<|video|>令牌都与视频帧时间戳一一对应,而<|silence|>标记助手保持静默的时间步,<|...|>则用于表示有意提前截断的回合转换。这种设计使得整个对话在每秒时间线上自然交织文本、静默和视觉令牌,支持实时流式视频问答任务。
使用方法
用户可通过Hugging Face Datasets库加载数据集,例如使用load_dataset函数获取训练集,支持流式模式以避免完整下载。数据集包含id、language、messages和video四个字段,其中messages字段存储多轮对话,video字段包含YouTube视频ID、帧时间戳和类别信息。由于视频文件不直接分发,用户需根据YouTube视频ID自行获取视频,并利用帧时间戳对齐帧。共享系统提示存储于单独的system_prompt.txt文件中,可通过hf_hub_download下载并拼接到每个样本的messages前。此外,用户可根据语言或类别对样本进行筛选,或直接使用PyArrow或Pandas读取Parquet分片文件。
背景与挑战
背景概述
Realtime-SFT数据集由研究机构于2024年构建,旨在解决实时流媒体视频理解任务中时序对齐与多模态交互的挑战。该数据集通过从YouTube平台收集的近2.5万个短视频片段,构建了包含10万条样本的流式视频问答资源,每条样本均实现了自然语言、沉默标记与视频帧标记在秒级时间线上的精确对齐。其核心研究问题聚焦于如何使多模态大语言模型在视频流实时播放过程中,能够同时处理新场景涌现与旧回复收尾的动态交互需求。这一数据集的发布为实时视频对话系统、流式视觉问答等前沿方向提供了关键的训练基准,推动了视频理解范式从静态片段分析向动态流式处理的转变。
当前挑战
该数据集面临的核心挑战在于解决流式视频理解中时序依赖与交互延迟的天然矛盾。在领域层面,传统视频问答假设完整视频可用,而实时场景要求模型在信息不完整时做出即时响应,这需要模型具备主动沉默决策与动态回复收尾能力。构建过程中,研究者面临三大技术困难:其一,需要对底层视频进行每秒一帧的层次化字幕描述,以提取具有因果关系的动作序列;其二,必须设计两阶段流水线,先通过事件检测与指令生成确定语义内容,再通过时间锚点分配将对话对齐到精确的秒级时间线;其三,需要引入专用的沉默标记与截断令牌来模拟流式协议中助手的真实行为模式。此外,数据来源的Youtube视频可能因删除或区域限制而失效,且尚未完成敏感内容审计,给可复现性与安全性带来隐患。
常用场景
经典使用场景
在实时流媒体与视频理解的交叉领域中,Realtime-SFT数据集为探索动态视频内容的多模态对话提供了珍贵资源。其经典使用场景聚焦于构建能感知时间流逝的流式视频问答系统,模型需在视频播放过程中根据每秒更新的视觉帧,实时生成或中断回答。该数据集通过引入特殊的<|silence|>和<|video|>标记,精确对齐每一帧与对话文本,使训练数据具备严格的时间语义约束。研究者可借此训练模型在连续视频流中同步执行事件检测、指令响应与静默策略,实现类似人类在观看视频时即问即答的交互模式。
衍生相关工作
围绕Realtime-SFT衍生的经典工作通常聚焦于三类方向:其一,基于其特有的时序标记设计新型流式多模态预训练目标,如预测<|silence|>出现位置;其二,利用该数据集评估主流视觉语言模型在逐帧增量输入下的对话一致性,揭示长距离帧依赖与即时回复能力的权衡;其三,将其作为评估基准,迭代开发能动态调整推理频率的流式Transformer架构,例如在关键事件触发时提升token输出速率。这些工作共同促进了实时视觉对话领域评价标准的规范化,并为后续探索视频流中的负样本采样与早停策略奠定了基础。
数据集最近研究
最新研究方向
随着实时视频理解与多模态大语言模型的蓬勃发展,Realtime-SFT数据集应运而生,聚焦于流式视频问答这一前沿方向。该数据集从YouTube短视频中构建了十万量级的时序对齐多轮对话样本,创新性地引入<|video|>与<|silence|>等特殊标记,将自然语言与视频帧在每秒级时间线上精准融合。其两阶段构建流水线——语义构造与时序布局——为动态场景下的实时交互奠定了数据基础。这一工作与当前人工智能领域对实时感知、在线推理及人机协同的热切关注紧密呼应,为训练能在连续视频流中即时响应、精准捕捉关键事件的智能模型提供了关键资源。Realtime-SFT的发布不仅推动了视频问答从静态理解向动态交互的范式跃迁,也为自动驾驶、实时监控、直播互动等热点应用场景注入了新的研究活力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务