StreamArena
收藏官方服务:
资源简介:
StreamArena是一个用于评估流式视频理解的基准数据集,包含243个全长视频(平均88.8分钟,总容量约300GB),以及3,646个带时间戳的开放式问题,涵盖四个能力:实时感知、历史回顾、外部工具使用和主动交互。
StreamArena is a benchmark dataset for evaluating streaming video understanding. It consists of 243 full-length videos with an average duration of 88.8 minutes and a total capacity of approximately 300GB, along with 3,646 timestamped open-ended questions covering four capabilities: real-time perception, historical review, external tool usage, and proactive interaction.
创建时间:
2026-08-10
原始信息汇总
StreamArena 数据集概述
StreamArena 是一个面向连续、交互式、长时程智能体流式视频理解的评估基准与工具包,旨在推动多模态大语言模型在长视频流场景下的实时感知与交互能力研究。
数据集规模
- 视频数量:243 个全长视频
- 平均时长:88.8 分钟
- 总数据量:约 300 GB
- 问题数量:3,646 个带时间戳的开放式问题
能力维度
数据集覆盖四大核心能力:
| 能力 | 缩写 | 说明 |
|---|---|---|
| 实时感知 | RTP | 对视频流的即时理解与判断 |
| 历史回溯 | HR | 对过去事件的检索与回顾,时间跨度分层至 >30 分钟 |
| 外部工具调用 | Tool | 调用搜索等外部工具辅助作答 |
| 主动交互 | Pro | 模型主动发起交互的能力,时间跨度分层至 >4 分钟 |
数据质量保障
- 两名独立标注者与一名盲审员参与标注
- 约 27% 的初稿被剔除
- 最终保留 3,646 个经过验证的任务
方法与工具包结构
| 模块 | 说明 | 状态 |
|---|---|---|
| method/offline | 基于轮次的 MLLM(Qwen / MiMo / Kimi / Qwen-Omni / Gemini)配合 Serper 智能体循环 | 可用 |
| method/streammind | 论文提出的流式智能体 StreamMind | 仅提供评估协议文档 |
| method/aura | AURA 固定窗口流式方法(客户端,服务端使用 vLLM) | 可用 |
| method/minicpm | MiniCPM-o-4.5 统一模型 | 可用 |
| method/vst | VST 文本概要流式方法 | 可用 |
| method/streamforest | StreamForest 原生流式方法 | 可用 |
| method/thinkstream | ThinkStream 原生流式方法 | 可用 |
| judge | 统一的 LLM-as-Judge 评分器 | 可用 |
关键性能
StreamMind 是唯一在全部四项能力上均有评估的流式方法,在相同 Qwen3.5-397B-A17B 骨干下,将查询到回答的端到端延迟降低 66.2%。
技术细节
- 环境要求:Python 3.10+、FFmpeg
- 视频格式:以 tar 包形式组织,内含 mp4 与字幕文件(.vtt)
- 多语言支持:提供英文(question.en.jsonl)与中文(question.jsonl)问题集,默认英文
- 后端支持:OpenAI 兼容端点(本地 vLLM/SGLang)或 Qwen 官方 API(阿里云 DashScope)
许可证
- 评估代码:Apache-2.0
- 标注数据:CC-BY-NC-4.0(非商业使用)
- 视频版权归原始 YouTube 上传者所有,再分发或商用前需查阅数据集卡片
搜集汇总
数据集介绍

构建方式
StreamArena数据集的构建源于对长视频流式理解任务的深度剖析,其核心在于真实世界视频的长时间跨度与复杂交互性。研究者从YouTube等平台精选243部全长视频,平均时长88.8分钟,总计约300GB,确保了内容来源的多样性与真实性。基于这些视频,团队设计了涵盖实时感知、历史回溯、外部工具使用及主动交互四大能力的3,646个带时间戳的开放式问题。问题由两位独立标注者与一位盲审员历经严格流程生成,在剔除约27%的草稿后,保留了经验证的高质量任务,并针对不同时间跨度(如超过30分钟的历史回溯)进行分层,以确保评估的全面性与挑战性。
特点
该数据集的核心特色在于其无与伦比的视频长度与问题深度,突破了现有基准中短视频片段的局限,直接面向连续、交互式及长时序的智能体视频理解。其四维能力框架不仅涵盖被动感知,更创新性地纳入主动交互与外部工具调用,模拟真实场景中的动态决策。数据集的标注体系经过双重标注与盲审,保证了质量与一致性。此外,StreamArena内置了全面的评估工具包,支持多种主流多模态模型(如Qwen、MiniCPM等)及流式方法(如StreamMind、AURA),并提供统一的评估协议与LLM-as-Judge评分机制,极大促进了方法的公平对比与复现。
使用方法
研究者可通过Hugging Face平台便捷获取数据集,按需选择英文或中文问题集,并仅下载需要的视频资源。安装过程简明,需Python 3.10+、FFmpeg及虚拟环境。使用流程遵循标准化步骤:首先下载并解压视频与标注文件,随后配置环境变量(如API密钥),最后通过提供的运行脚本执行模型推理。工具包支持本地vLLM部署或云端API调用,可将推理与评分分离,通过统一的JSONL格式记录结果,并利用共享的LLM-as-Judge评分器进行客观评估,极大简化了在长视频流式理解任务上的基准测试流程。
背景与挑战
背景概述
StreamArena数据集由香港中文大学多媒体实验室联合多家研究机构于2026年推出,旨在突破传统视频理解基准局限于短片段、离线处理的范式,聚焦于连续、交互式及长时程的智能体流式视频理解。该数据集包含243段总时长约300GB的完整视频,平均时长88.8分钟,并精心标注了3,646个跨实时感知、历史回溯、外部工具使用及主动交互四维能力的时间戳开放式问题。其构建过程采用双人独立标注与盲审机制,剔除约27%的草稿以确保质量,为评估流式视频理解智能体提供了首个大规模、高难度的基准,显著推动了该领域从静态离线分析向动态实时交互方向的演进。
当前挑战
StreamArena所面临的挑战贯穿于领域问题与构建过程之中。领域层面,它直面长视频理解中的实时感知延迟与历史回溯时效性矛盾,以及智能体在复杂动态场景中主动交互与外部工具调用的协同难题;同时,视频连续流带来的信息冗余与关键事件稀疏性,对模型的注意力机制与决策效率构成严峻考验。构建过程中,需应对视频版权与存储分发的高昂成本,确保约300GB数据集的合法性及可访问性;此外,近27%标注草稿的剔除率暴露出长视频开放问题标注的模糊性与主观性,而跨时域分层的细粒度设计(如回溯跨度超过30分钟)进一步提升了数据构建的复杂度和对标注者专业性的要求。
常用场景
经典使用场景
StreamArena作为面向连续、交互式、长时程智能体流式视频理解的全新基准,其经典使用场景聚焦于评测多模态大语言模型在长时间未剪辑视频中的实时感知、历史回溯、外部工具调用及主动交互能力。研究者通常利用其243个平均时长88.8分钟的视频和3,646个带时间戳的开放式问题,对模型进行标准化的离线或流式评估,从而量化模型在不同时间跨度下的理解深度与响应延迟。该基准采用统一的LLM-as-Judge评分协议,确保了评测结果的公平性与可复现性。
解决学术问题
该数据集突破了传统视频理解基准局限于短视频片段与被动问答的桎梏,系统性地解决了长时程、交互式流式视频理解评测缺失的学术问题。通过分层设计历史回溯与主动交互问题的时间视界,并引入外部工具使用场景,它填补了现有基准在评估模型持续感知、记忆整合及实时决策能力方面的空白。其严格的注释流程与高质量问题集合,为多模态智能体的实时视频理解研究提供了可靠的金标准,促进了该领域从离线分析向在线交互范式的学术演进。
衍生相关工作
围绕StreamArena,衍生出一系列经典工作,包括StreamMind、AURA、StreamForest和ThinkStream等流式视频理解方法。StreamMind等原生流式智能体在该基准上展示了卓越的延迟与性能平衡,而基于固定窗口或文本摘要的变体则提供了不同的效率-精度权衡方案。这些工作不仅验证了基准的判别力,也推动了流式感知、记忆压缩与主动推理等子方向的研究进展,同时为后续开发更高效的实时多模态智能体奠定了坚实的评测基础。
以上内容由遇见数据集搜集并总结生成



