StreamGaze Benchmark
收藏资源简介:
StreamGaze Benchmark是一个用于流媒体视频中注视引导时序推理和主动理解的基准数据集。它包含285个视频、8,521个问答对,涵盖10个任务类别,分为过去任务(如场景回忆、对象转换预测)、当前任务(如对象识别、对象属性识别)和主动任务(如注视触发警报)。数据集旨在评估模型在实时视频流中基于用户注视进行记忆、推理和预测的能力。
StreamGaze Benchmark is a benchmark dataset for gaze-guided temporal reasoning and active understanding in streaming video. It contains 285 videos and 8,521 question-answer pairs, covering 10 task categories, which are divided into past tasks (e.g., scene recall, object transition prediction), current tasks (e.g., object recognition, object attribute recognition), and active tasks (e.g., gaze-triggered alarm). This dataset aims to evaluate the ability of models to perform memory, reasoning and prediction based on user gaze in real-time video streams.
StreamGaze 数据集概述
数据集基本信息
- 数据集名称: StreamGaze
- 核心主题: 面向流式视频的注视引导时序推理与主动理解
- 发布状态: 基准测试与评估代码已于2025年12月1日发布
数据集规模与构成
视频数据
- 视频总数: 285个
- 视频类型: 原始第一人称视角视频及带有注视叠加层的可视化视频
问答对数据
- 问题总数: 8,521个
- 数据组织: 按任务类别存储于JSON文件中
任务类别
- 任务总数: 10个任务,分为3大类
- 过去任务 (Past Tasks): 4个,侧重于记忆与时序回忆
- 当前任务 (Present Tasks): 4个,侧重于实时感知与推理
- 主动任务 (Proactive Tasks): 2个,侧重于预期与警报
任务详细描述
🔙 过去任务:记忆与时序回忆
模型必须记住并推理视频流中较早发生的事件。
- 场景回忆 (Scene Recall, SR): 用户与哪些物体进行了交互?
- 物体转移预测 (Object Transition Prediction, OTP): 根据过去的模式,用户接下来会看哪个物体?
- 注视序列匹配 (Gaze Sequence Matching, GSM): 哪个注视模式与用户的注意力流相匹配?
- 非注视物体识别 (Non-Fixated Objects Identification, NFI): 哪些物体出现了但从未被注视过?
👁️ 当前任务:实时感知与推理
模型必须基于实时注视识别和理解当前正在发生的事情。
- 物体识别 (Object Identification, Easy/Hard): 用户当前正在看什么?
- 物体属性识别 (Object Attribute Recognition, OAR): 被注视物体有哪些特征?
- 未来动作预测 (Future Action Prediction, FAP): 用户即将执行什么动作?
🔮 主动任务:预期与警报
模型必须预测未来事件并主动响应,这是最具挑战性的类别。
- 注视触发警报 (Gaze-Triggered Alert, GTA): 当用户注视特定目标物体时发出通知
- 物体出现警报 (Object Appearance Alert, OAA): 当目标物体出现在场景中时发出警报
数据获取与结构
-
下载地址: https://huggingface.co/datasets/danaleee/StreamGaze
-
目录结构:
StreamGaze/ ├── dataset/ │ ├── videos/ │ │ ├── original_video/ # 原始第一人称视角视频 │ │ └── gaze_viz_video/ # 带有注视叠加层的视频 │ └── qa/ │ ├── past_.json # 过去任务问答对 │ ├── present_.json # 当前任务问答对 │ └── proactive_*.json # 主动任务问答对
数据生成流程
- 流程概述: 端到端自动数据生成流程,处理来自第一人称视角视频的原始注视数据,并生成高质量的时序推理问答对。
- 支持的数据集: EGTEA-Gaze+, Ego4D-Gaze, HoloAssist, EgoExoLearn
- 流程阶段:
- 注视投影与注视点提取
- 质量过滤与物体识别 (使用 InternVL-3.5 38B)
- 序列过滤与元数据合并
- 为12种任务类型生成问答对
- 问答对验证与过滤 (使用 Qwen3VL 30B)
评估与基准
- 评估框架: 与 StreamingBench (https://github.com/THUNLP-MT/StreamingBench) 结构相同
- 预置模型评估: 支持 ViSpeak、GPT-4o、Qwen2.5-VL 等模型的快速评估
- 结果保存路径:
results/ModelName/results/和results/ModelName/results_viz/
相关资源
- 论文: https://arxiv.org/abs/2512.01707
- 项目网站: https://streamgaze.github.io
- 基准测试地址: https://huggingface.co/datasets/danaleee/StreamGaze




