遇见数据集

EGOSTREAM

收藏
arXiv2026-06-01 更新2026-06-03 收录
数据链接:
官方服务:

资源简介:

EGOSTREAM是一个面向第一人称视角视觉的流式情景记忆诊断基准,由卡塔尼亚大学的研究团队创建。该数据集整合了来自五个现有自我中心视频问答数据集(Ego4D、EgoLife、EgoTempo、Multi-Hop EgoQA和HD-EPIC)的2,250个经过人工验证的问题,并进一步扩展为8,528个基于召回条件的评估实例,覆盖了从即时到超长期记忆的多个时间尺度。数据集构建过程通过标准化流程进行问题筛选、多选选项生成和证据时刻标注,并引入了答案有效性窗口概念以确保评估一致性。该基准旨在解决流式视觉系统中情景记忆的量化评估难题,通过七个认知维度(细节、空间、时间、事件、社交、因果和前瞻记忆)系统诊断模型在不同记忆保留区间下的表现能力,为自主智能体和可穿戴辅助系统的记忆机制研究提供关键测试平台。

EGOSTREAM is a streaming episodic memory diagnostic benchmark tailored for first-person vision, developed by a research team from the University of Catania. This dataset integrates 2,250 manually verified questions sourced from five existing egocentric video question answering datasets, namely Ego4D, EgoLife, EgoTempo, Multi-Hop EgoQA, and HD-EPIC, and is further expanded into 8,528 recall-based evaluation instances, covering multiple timescales spanning from immediate to ultra-long-term memory. The construction of the dataset employs standardized workflows for question filtering, multiple-choice option generation, and evidence moment annotation, and introduces the concept of answer validity windows to guarantee evaluation consistency. This benchmark aims to resolve the long-standing challenge of quantitative evaluation of episodic memory in streaming visual systems, systematically diagnosing model performance across distinct memory retention intervals via seven cognitive dimensions: detail, spatial, temporal, event, social, causal, and prospective memory, thereby serving as a critical testbed for research on memory mechanisms in autonomous agents and wearable assistive systems.

创建时间:
2026-05-30
原始信息汇总

数据集:EGOSTREAM

简介
EGOSTREAM 是一个用于评估以自我为中心视觉(Egocentric Vision)中流式情景记忆的诊断基准。它旨在衡量模型能记住什么、能记住多久,以及在观察世界发生变化后,答案何时不再有效。

状态
基准数据尚未公开发布(标注“DATA COMING SOON”),相关代码将在GitHub上提供(标注“GitHub (coming soon)”)。

核心特点

  • 证据型问答:基于视频证据的问答任务。
  • 答案有效性窗口(AVW):标记一个过去答案保持事实正确的时间跨度,用于区分模型真正遗忘与自然场景变化。
  • 记忆类别:涵盖细节、空间、时间、事件、社会、因果和预期共7个情景记忆维度。
  • 召回模式:分为即时(0秒)、短(0-5秒)、中短(5-30秒)、中(30秒-3分钟)、中长(3分钟-30分钟)、长(30分钟-8小时)和超长(8小时以上)共7个对数尺度召回区间。

规模

  • 2,250 个经过验证的记忆问题
  • 8,528 次召回条件评估
  • 7 个情景记忆维度
  • 45.3小时 最大答案有效性窗口(AVW)

数据来源
问题从以下五个数据集中整理:Ego4DEgoLifeEgoTempoMulti-Hop EgoQAHD-EPIC

评估协议

  1. 精选自我中心视频来源:从现有数据集中提取。
  2. 查询无关的流式处理:模型顺序处理视频,仅使用到召回时间为止观察到的视觉内容作答。
  3. 4路评估:性能以多项选择准确率衡量,并按记忆类别和召回模式进行细分。
  4. 记忆管理测试平台:统一的框架用于比较滑动窗口、注意力陷阱、KV缓存剪枝、合并和卸载等方法。

当前挑战

  • 总体分数可能掩盖不同语义类别和召回区间下的记忆表现差异。
  • 标记剪枝(Token pruning)能更好地保留细节和时间结构,而量化卸载(Quantized offloading)有助于超长召回。
  • 当前最优机制准确率仍约为45%,且运行速度低于实时要求。

相关论文
EGOSTREAM, 2026.

搜集汇总
数据集介绍
EGOSTREAM 数据集图片
构建方式
EGOSTREAM的构建基于五个现有的第一视角视频问答数据集(Ego4D、EgoLife、EgoTempo、Multi-Hop EgoQA和HD-EPIC),通过标准化流程进行整合。首先,确保所有查询均为明确的回顾性记忆探测,并将部分数据集的问题改写为统一的回溯形式。随后,针对开放性问题生成三个具有挑战性的干扰选项,并经过大语言模型筛选与人工验证,剔除约12%的不合格样本。最终,从2,634个初始问答对中精选出2,250个经过人工验证、具有时间定位的视频问答实例,构成了数据集的基石。
特点
EGOSTREAM的核心特点在于其双重诊断能力。首先,该数据集将情景记忆细分为七个认知维度:细节、空间、时间、事件、社会、因果和前瞻性记忆,每个问题被分配一个主标签及若干次要标签,以解析模型记忆的具体性质。其次,引入“答案有效期窗口”概念,精准界定问题答案在场景演变中保持正确的时间跨度。基于此,每个问题可在从即时到超长期的七个不同回忆阶段被评估,生成8,528个条件性评价,有效区分模型的真实遗忘与自然世界状态变迁。
使用方法
使用EGOSTREAM时,模型需严格遵循流式推理协议:视频按帧顺序处理,仅依据当前帧及之前的内容维护紧凑的过去信息表示。查询在特定时刻提出,模型需利用至该时刻的缓存内容进行四选一作答。为进行公平对比,研究提供了一个统一的多模态大语言模型框架,隔离记忆管理策略作为唯一变量。在此框架内,可替换不同的KV缓存管理机制(如滑动窗口、令牌剪枝、合并、卸载等),并报告不同语义类别与回忆时段上的准确率及每帧处理时间,从而实现细粒度的诊断性评估。
背景与挑战
背景概述
EGOSTREAM是由意大利卡塔尼亚大学计算机科学系的研究人员Rosario Forte、Giuseppe Lando和Antonino Furnari于2026年提出的诊断性基准数据集,专注于评估以自我为中心视觉中的流式情景记忆。该数据集针对自主智能体在动态真实环境中持续记忆与回忆事件的核心能力需求而设计,从Ego4D、EgoLife、EgoTempo、Multi-Hop EgoQA和HD-EPIC五个现有以自我为中心的视频问答数据集中精心筛选并重构了2250个问题,沿着细节、空间、时间、事件、社会、因果和预期记忆七个认知维度进行组织,并引入答案有效性窗口(AVW)概念来区分真正的遗忘与场景自然变化。该数据集对当前的多模态大语言模型在流式记忆评估领域产生了重要影响,揭示了现有机制在细粒度细节保留、时间结构记忆和超长时回忆方面的显著缺陷。
当前挑战
EGOSTREAM面临的挑战主要体现在两个方面。在领域问题层面,其解决的核心理念是评估流式情景记忆,当前流式视频基准大多仅衡量在线响应能力或整体准确性,而无法诊断模型记住了什么、记住了多久,导致记忆配置截然不同的模型可能获得相似的整体得分。在构建过程中,研究人员需处理多个来源数据集在标注格式上的不一致性,包括将开放性问题统一转化为四选一形式并生成具有挑战性的干扰项;同时需跨越不同数据集的时态结构来统一标注答案有效性窗口,并确保每个问题能在多个回忆时间间隔上进行评估而不与场景演化混淆。此外,对2250个问题的人工验证和清洗过程也过滤了约12%的低质量样本,确保基准的可靠性和诊断能力。
常用场景
经典使用场景
EGOSTREAM为评估第一人称视频中的流式情节记忆提供了一个诊断性基准测试。该数据集的核心应用场景是衡量自主智能体在持续感知动态世界时,对过往事件中各种细节信息的记忆质量。研究者通过将2250个精心设计的问题组织成七个认知维度(细粒度细节、空间、时间、事件、社交、因果与前瞻记忆),并引入答案有效期(AVW)这一关键概念,来精确区分模型真实遗忘与环境自然变迁导致的答案失效。这种方法确保评估聚焦于记忆保持能力本身,而非因场景变化产生的混淆。在流式多模态大语言模型(MLLM)统一框架下,EGOSTREAM能够对滑动窗口、注意力锚点、KV缓存剪枝与合并等不同记忆管理机制进行标准化诊断,揭示聚合准确率背后截然不同的记忆保持轮廓。
解决学术问题
该基准填补了长期存在于视频问答领域的系统性空白,即未能将情节记忆作为可独立测量的变量进行评估。以往研究往往依赖下游任务的整体准确率,混淆了不同记忆机制的效果差异。EGOSTREAM通过AVW和七级时间跨度(从瞬时到超长期)的精细划分,解决了如何区分模型在短时工作记忆与长期记忆巩固过程中的不同表现这一核心问题。它使研究者能够剖析哪些类型的语义信息(如物体颜色、空间位置、事件顺序)在哪个时间节点最先衰退,为理解记忆架构的退化模式提供了可靠的实验依据。这一诊断能力对于设计更鲁棒的流式记忆系统具有根本性的学术意义,推动了从简单性能指标向具体记忆剖面分析的范式转变。
衍生相关工作
EGOSTREAM的提出催生了一系列围绕流式记忆管理的经典工作与研究方向。其统一评估框架使得研究者能够系统对比多种主流方法,包括基于注意力锚点的StreamVLM、侧重令牌冗余剪枝的StreamMem与InfiniPot-V、利用令牌合并的CaM风格方法,以及通过磁盘卸载扩展记忆容量的ReKV等。这些工作揭示了不同记忆策略对语义类别和时间跨度各有侧重,例如令牌剪枝在保持细粒度时间结构上优于令牌合并,而量化卸载则显著改善了超长期回忆。该基准还推动了多阶段混合策略的探索,如将局部伪注意力筛选与跨帧冗余检查结合,以优化整体记忆保持。这些衍生工作共同构建了一个丰富的流式视频理解生态,使记忆机制的设计从经验驱动走向了数据驱动的精细诊断时代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务