遇见数据集

slvqa

收藏
Hugging Face2026-05-23 更新2026-05-24 收录
官方服务:

资源简介:

SLVQA v4(流式长视频问答)是一个专门为在线视频-语言模型设计的基准测试数据集,旨在评估模型以连续流方式处理视频并在任意时间点回答问题的能力。该数据集将流式长视频理解划分为三个有意分层的子基准测试:1) perception(感知)子基准测试:专注于模型对当前屏幕内容的实时感知能力,包含125个短视频片段(1-18分钟),共计662个多项选择题,每个问题的答案可在查询后20秒内的视频内容中直接观察。2) memory(记忆)子基准测试:测试模型对几分钟到约1.5小时前连续视频流中事件的记忆能力,包含16个长视频流(28-99分钟,中位数91分钟),共计448个多项选择题,所有问题的证据至少出现在过去60秒,记忆距离中位数为17分钟。3) mega(超长时记忆与感知结合)子基准测试(v4新增):挑战模型在长达24小时的视频流中同时维持实时感知和超长时记忆的能力,包含4个24小时的视频流(总计97小时内容),共计1852个多项选择题(其中1652个为实时问题,200个为后向记忆问题),后向问题的记忆距离长达18至23小时。所有视频内容均来自开放许可平台(如Wikimedia Commons和Internet Archive),涵盖纪录片、讲座、烹饪教程、新闻采访、自然野生动物、旅行、音乐会和公共领域工业影片等多种类型,以确保内容多样性。数据以JSON格式组织,每个问题条目包含视频路径、问题文本、四个选项、正确答案、证据时间戳和记忆距离等详细信息。该数据集适用于视频问答、在线视频-语言模型评估、长上下文理解和记忆机制研究等任务。

SLVQA v4 (Streaming Long Video Question Answering) is a benchmark dataset specifically designed for online video-language models, aiming to evaluate the ability of models to process videos in a continuous streaming manner and answer questions at arbitrary time points. The dataset innovatively divides streaming long video understanding into three intentionally stratified sub-benchmarks to directly measure model performance in memory and perception across different time scales. It consists of three parts: 1) perception sub-benchmark: focuses on the models real-time perception of current screen content, containing 125 short video clips (1-18 minutes), with a total of 662 multiple-choice questions, where answers can be directly observed within 20 seconds of the query in the video content. 2) memory sub-benchmark: tests the models memory of events from continuous video streams ranging from a few minutes to approximately 1.5 hours ago, containing 16 long video streams (28-99 minutes, median 91 minutes), with a total of 448 multiple-choice questions, where evidence for all questions appears at least 60 seconds in the past, and the median memory distance is 17 minutes. 3) mega sub-benchmark (new in v4): challenges the model to maintain both real-time perception and ultra-long-term memory in video streams up to 24 hours long, containing four 24-hour video streams (totaling 97 hours of content), with a total of 1852 multiple-choice questions (1652 real-time questions and 200 backward memory questions), where backward questions have memory distances ranging from 18 to 23 hours. All video content is sourced from open-license platforms (such as Wikimedia Commons and Internet Archive), covering diverse types including documentaries, lectures, cooking tutorials, news interviews, natural wildlife, travel, concerts, and public domain industrial films to ensure content diversity. The data is organized in JSON format, with each question entry containing detailed information such as video path, question text, four options, correct answer, evidence timestamps, and memory distance. This dataset is suitable for tasks such as video question answering, online video-language model evaluation, long-context understanding, and memory mechanism research.

创建时间:
2026-05-16
原始信息汇总

数据集概述:SLVQA v4 — Streaming Long-Video QA with 24-hour Mega-streams

SLVQA v4 是一个专为在线视频大语言模型设计的基准测试,用于评估模型在连续视频流中任意时间点回答问题的能力。

核心结构与子基准测试

该数据集将“流式长视频理解”分解为三个基于记忆跨度的刻意分层子基准,以直接衡量模型能维持的记忆范围:

子基准 测试能力 视频数量与长度 问题数量 记忆距离
perception/ 当前屏幕视觉感知(OCR / ACR / ATR / OJR / STU / FPD) 125 个短视频片段(1 – 18 分钟) 662 道选择题 ≤ 20 秒
memory/ 几分钟到几小时的记忆(EPM / ASI / HLD / REC / CRR) 16 个长视频流(28 – 99 分钟,中位数 91 分钟) 448 道选择题 63 秒 – 90 分钟(中位数 17 分钟)
mega/ 24 小时流,同时包含实时感知和回溯记忆问题(回溯问题在最后 2 小时内询问前 4 小时的内容) 4 × 24 小时流(共 97 小时) 1852 道选择题(1652 道实时 + 200 道回溯) 实时 ≤ 20 秒,回溯 18 – 23 小时
总计 145 个视频 / 约 145 小时内容 2962 道选择题

关键特性与亮点

  • 超长记忆跨度mega/ 子基准的记忆距离达到 18-23 小时,比以往最接近的基准长约 100 倍,专门用于测试流式系统在处理有限在线状态(如记忆库、令牌桶缓存、滑动窗口注意力)时的极限。
  • 双轴压力测试:每个 24 小时流同时包含实时感知问题和回溯记忆问题。系统需在保持快速感知(低首令牌延迟)的同时,能检索 20 多小时前的状态,强制暴露感知与记忆之间的性能权衡。
  • 数据来源:所有视频片段来自 Wikimedia Commons(约 220 个片段)和 Internet Archive(约 150 个片段),均为 CC / 公共领域许可。内容涵盖纪录片、讲座、烹饪/教程、新闻/访谈、自然/野生动物、旅行、音乐/音乐会及 Prelinger 公共领域工业影片。
  • 数据格式:每个子基准目录包含 data/annotations.json 文件,按模式(backward, realtime, forward)分组。每个条目包含问题、4 个选项、正确答案、证据时间、记忆距离等字段。
  • 许可协议:数据集标注采用 CC-BY-SA 4.0 许可。每个源视频片段保留其自身许可(CC-BY, CC-BY-SA, CC-0 或公共领域)。工具包代码采用 MIT 许可。
搜集汇总
数据集介绍
slvqa 数据集图片
构建方式
SLVQA数据集的构建聚焦于在线视频理解场景,旨在评估模型在连续流式视频中实时回答问题的能力。数据集将总长约145小时的视频内容划分为三个精心设计的子基准测试,分别对应感知、记忆和超长记忆三个层级。其中,感知子集包含125个短片段,时长1至18分钟,问题答案可在20秒内从当前画面获取;记忆子集由16个长视频流构成,时长28至99分钟,问题证据至少在一分钟前出现,中位记忆距离为17分钟;超大流子集则为全新构建的四条24小时连续视频流,总时长97小时,每条流同时携带实时感知问题与回溯记忆问题,其中回溯问题要求模型在最后两小时内回答最早四小时内出现的内容,记忆距离横跨18至23小时。所有视频素材均来源于Wikimedia Commons和Internet Archive的开源许可资源,涵盖纪录片、讲座、烹饪、新闻、自然、旅行、音乐及工业电影等多种类型,以确保内容的多元性与泛化能力。
特点
SLVQA的核心创新在于其刻意分层的记忆距离设计,将视频理解从实时感知(20秒内)逐步延伸至分钟级记忆(17分钟中位),最终突破至小时级超长记忆(18至23小时),这一跨度是现有视频问答基准的百倍以上。尤其亮点在于超大流子基准:每条24小时流同时嵌入约400个实时问题与50个回溯问题,迫使模型在保持快速感知能力的同时,还需维持对二十小时前信息的可查询状态,从而暴露在线系统中有限状态(如记忆库、令牌缓存、滑动窗口注意力)的固有瓶颈。此外,数据集使用12种任务代码(包括OCR、ACR、EPM、HLD等)覆盖不同认知维度,并通过确定性洗牌消除答案位置偏差,确保评估的公平性与细粒度。
使用方法
用户可通过Hugging Face平台直接加载数据集,每个子基准的注释文件均以JSON格式存储,按实时、回溯与前向三种模式分组。每条问答记录包含问题、四个选项、正确答案、证据时间、记忆距离及流标识等字段,便于直接适配流式视频语言模型的评估流程。使用时需将视频路径与问题输入模型,并指定查询时间点以获得实时回答。数据集附带的GitHub仓库提供了完整的构建工具与注释生成脚本,支持用户复现超大流的归一化、拼接及时间偏移等步骤。由于注释由Claude Opus生成,建议在关键结论前使用第二模型交叉验证;同时需注意超长流为剪辑拼接而成,非原生单视频,回溯问题刻意利用了流间跳转特性以测试跨片段记忆能力。
背景与挑战
背景概述
SLVQA(Streaming Long-Video Question Answering)是一个专为评估在线流式视频大语言模型(online video-LLMs)而设计的基准数据集,由研究者Hsu Po Hsiang及其团队于2026年创建。该数据集源自对现有视频问答基准在记忆跨度上存在严重局限的洞察——大多数基准的记忆距离仅停留在数分钟甚至数十秒以内。核心研究问题在于衡量流式系统在持续处理视频流时,能否同时维持实时感知与长时记忆能力,进而刻画其记忆视野的内在退化曲线。SLVQA通过引入三级分层评估(感知、记忆、巨流)为领域提供了前所未有的测试广度,特别是其新颖的24小时巨流子基准,将记忆考察推至数小时尺度,显著突破了现有范式,有望推动流式视频理解技术的实质进步。
当前挑战
SLVQA所应对的领域核心挑战在于:流式视频大语言模型必须于无限延展的视频流中同时兼顾实时感知与远端记忆,这与传统离线处理方式截然不同,模型需在有限的在线状态下高效管理记忆视窗,避免随着时间推移出现感知延迟或历史信息不可恢复的衰退。在构建过程中,研究人员面临多重难题:首先,为确保视频源多样化且开放许可,需从Wikimedia Commons和Internet Archive中精心筛选跨越八个主题类别的数百个短片段,避免内容同质化。其次,将上述片段拼接成连续24小时长视频时须消除帧速率、分辨率等参数导致的PTS累积漂移,因此需要对每段源素材进行统一标准化压缩后再重新编码。此外,巨流子基准中用于考察数小时记忆的后向问题需借助Claude Opus 4.7通过分层帧采样和严格的时间约束自动生成并验证,同时必须过滤掉可能存在的模糊或错误标注,确保数据可靠性。
常用场景
经典使用场景
SLVQA v4是专为评估在线视频大语言模型而定制的基准测试,其核心使用场景在于衡量模型在流式长视频处理中的记忆保持能力与实时感知能力。该数据集巧妙地将评估任务划分为三个渐进子集:perception子集测试模型对当前视频帧的瞬时感知,memory子集考察模型对过去数分钟至一小时半内容的回忆能力,而mega子集则以前所未有的24小时超长流视频为载体,同时检测模型在极长记忆跨度与实时响应之间的协同表现。这种分层设计为研究者提供了一个系统化测量流式模型记忆衰减曲线的标准化平台。
衍生相关工作
围绕SLVQA的挑战性质,已激发出一系列探索性研究工作。研究者基于其分层记忆距离设计,衍生出针对流式模型的记忆效率优化方法,如动态记忆银行管理策略、层级化注意力缓存机制,以及长上下文重放技术的边界分析。该基准中还提出了EPM、ASI等12类细粒度任务编码,催生了针对特定感知与记忆子任务的能力诊断研究。此外,mega子集的构造方法论——包含视频归一化、时间偏移标注和AI生成问题的质量控制流程——已成为构建超长视频基准的参考范式,推动了后续类似大规模流式评估数据集的设计与开发。
数据集最近研究
最新研究方向
SLVQA v4数据集聚焦于流式长视频理解中的记忆跨度评估,通过构建三层次子基准(感知、记忆、超大规模流)系统性地量化在线视频语言模型在不同时间跨度下的表现能力。其核心创新在于引入了4条长达24小时的超大规模视频流,将回溯性问题的记忆距离拓展至18至23小时,相较现有基准提升了约百倍量级,精准刻画了模型在持续流处理中同时维持实时感知与远距离记忆的权衡困境。这一设计回应了当前视频问答研究对长时间跨度和真实流式场景的迫切需求,有力推动了在线视频大语言模型在记忆机制、状态压缩与实时推理协同优化方向的前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务