EGOSTREAM
收藏资源简介:
EGOSTREAM是一个面向第一人称视角视觉的流式情景记忆诊断基准,由卡塔尼亚大学的研究团队创建。该数据集整合了来自五个现有自我中心视频问答数据集(Ego4D、EgoLife、EgoTempo、Multi-Hop EgoQA和HD-EPIC)的2,250个经过人工验证的问题,并进一步扩展为8,528个基于召回条件的评估实例,覆盖了从即时到超长期记忆的多个时间尺度。数据集构建过程通过标准化流程进行问题筛选、多选选项生成和证据时刻标注,并引入了答案有效性窗口概念以确保评估一致性。该基准旨在解决流式视觉系统中情景记忆的量化评估难题,通过七个认知维度(细节、空间、时间、事件、社交、因果和前瞻记忆)系统诊断模型在不同记忆保留区间下的表现能力,为自主智能体和可穿戴辅助系统的记忆机制研究提供关键测试平台。
EGOSTREAM is a streaming episodic memory diagnostic benchmark tailored for first-person vision, developed by a research team from the University of Catania. This dataset integrates 2,250 manually verified questions sourced from five existing egocentric video question answering datasets, namely Ego4D, EgoLife, EgoTempo, Multi-Hop EgoQA, and HD-EPIC, and is further expanded into 8,528 recall-based evaluation instances, covering multiple timescales spanning from immediate to ultra-long-term memory. The construction of the dataset employs standardized workflows for question filtering, multiple-choice option generation, and evidence moment annotation, and introduces the concept of answer validity windows to guarantee evaluation consistency. This benchmark aims to resolve the long-standing challenge of quantitative evaluation of episodic memory in streaming visual systems, systematically diagnosing model performance across distinct memory retention intervals via seven cognitive dimensions: detail, spatial, temporal, event, social, causal, and prospective memory, thereby serving as a critical testbed for research on memory mechanisms in autonomous agents and wearable assistive systems.
数据集:EGOSTREAM
简介
EGOSTREAM 是一个用于评估以自我为中心视觉(Egocentric Vision)中流式情景记忆的诊断基准。它旨在衡量模型能记住什么、能记住多久,以及在观察世界发生变化后,答案何时不再有效。
状态
基准数据尚未公开发布(标注“DATA COMING SOON”),相关代码将在GitHub上提供(标注“GitHub (coming soon)”)。
核心特点
- 证据型问答:基于视频证据的问答任务。
- 答案有效性窗口(AVW):标记一个过去答案保持事实正确的时间跨度,用于区分模型真正遗忘与自然场景变化。
- 记忆类别:涵盖细节、空间、时间、事件、社会、因果和预期共7个情景记忆维度。
- 召回模式:分为即时(0秒)、短(0-5秒)、中短(5-30秒)、中(30秒-3分钟)、中长(3分钟-30分钟)、长(30分钟-8小时)和超长(8小时以上)共7个对数尺度召回区间。
规模
- 2,250 个经过验证的记忆问题
- 8,528 次召回条件评估
- 7 个情景记忆维度
- 45.3小时 最大答案有效性窗口(AVW)
数据来源
问题从以下五个数据集中整理:Ego4D、EgoLife、EgoTempo、Multi-Hop EgoQA、HD-EPIC。
评估协议
- 精选自我中心视频来源:从现有数据集中提取。
- 查询无关的流式处理:模型顺序处理视频,仅使用到召回时间为止观察到的视觉内容作答。
- 4路评估:性能以多项选择准确率衡量,并按记忆类别和召回模式进行细分。
- 记忆管理测试平台:统一的框架用于比较滑动窗口、注意力陷阱、KV缓存剪枝、合并和卸载等方法。
当前挑战
- 总体分数可能掩盖不同语义类别和召回区间下的记忆表现差异。
- 标记剪枝(Token pruning)能更好地保留细节和时间结构,而量化卸载(Quantized offloading)有助于超长召回。
- 当前最优机制准确率仍约为45%,且运行速度低于实时要求。
相关论文
EGOSTREAM, 2026.





