EgoSAT
收藏数据链接:
官方服务:
资源简介:
EgoSAT是一个用于评估第一人称流式视频交互理解的综合基准测试,包含1,997个第一人称视频、165小时的第一人称镜头、平均296.8秒的视频时长、56个多样化的真实世界场景以及约4,800个高质量的问答对。
EgoSAT is a comprehensive benchmark for evaluating first-person streaming video interaction comprehension. It consists of 1,997 first-person videos, 165 hours of first-person footage, with an average video duration of 296.8 seconds, 56 diverse real-world scenarios, and approximately 4,800 high-quality question-answer pairs.
创建时间:
2026-06-23
原始信息汇总
数据集概述
EgoSAT 是一个面向第一人称视角流式交互理解的综合基准,旨在评估模型在流式视频中,基于已观测到的视频前缀,同时完成回顾性、当前和前瞻性推理的能力。
核心特点
- 统一流式框架:将视频问答、在线描述和活动预测等任务整合到统一的流式评估中,而非分开处理。
- 三重推理模式:
- 当前建模:回答关于当前观察的问题,识别正在发生的人-物交互。
- 前瞻建模:根据已观测的视频前缀预测未来的交互,并评估其可预测性。
- 回顾建模:通过定位已观测流式历史中的相关时刻,回答关于过去事件的问题。
- 可回答性感知:通过“分支性”(Branchiness)和“突然性”(Surprise)量化未来不确定性,评估模型在部分可观测条件下的回答识别与置信度校准能力。
数据集统计
- 来源:基于 Ego4D 构建。
- 规模:
- 包含 1,997 个第一人称视角视频。
- 总计 165 小时的视频时长。
- 平均视频时长 296.8 秒。
- 涵盖 56 种不同的真实世界场景。
- 标注:包含约 4,800 个高质量问答对,均由人工标注。
- 可回答性:数据构建过程中考虑了未来交互的多种可能性(分支性)和突发的视觉语义变化(突然性),以评估模型应对不确定性能力。
评估流程
- 准备数据:从 Hugging Face 数据集下载 EgoSAT 标注、多选题(MCQ)候选、有效查询集和SFT清单。用户需自行获取 Ego4D 原始视频并设置环境变量。
- 准备模型:实现一个模型适配器,将目标模型连接到 EgoSAT 的评估框架,用于加载视频前缀、接收任务提示并返回结构化答案。
- 运行评估:使用提供的脚本(如
run_mcq_inference.sh)进行推理,并运行官方评分器(evaluate_main_table.py)计算指标。官方评分基于原始逐样本预测文件。
实验与结果
论文中报告了闭源专有模型、离线开源视觉语言模型(VLMs)以及流式VLMs在 EgoSAT 上的性能对比结果(详见论文中的主表)。
许可证与引用
- 代码许可证:MIT 许可证。
- 数据集:基于 Ego4D,其使用受 Ego4D 许可证约束,详细条款请查阅 Hugging Face 数据集卡。
- 引用:使用该数据集时,请引用论文
@inproceedings{lei2026egosat, ...}。
搜集汇总
数据集介绍

构建方式
EgoSAT数据集基于Ego4D构建,从1997段第一人称视频中提取了165小时的影像素材,平均每段视频时长约296.8秒。数据集覆盖56种真实世界场景,所有标注均经过人工精心筛选。构建过程特别引入了可回答性感知机制:通过分支度(Branchiness)捕捉同一交互前缀后多种合理未来延续的不确定性,通过惊异度(Surprise)衡量近期观察语境与即将发生事件之间的突变异质性。最终产出了约4800个高质量问答对,涵盖回顾、当下与前瞻三种推理模式。
特点
EgoSAT的核心创新在于其统一的流式视频理解框架,将回顾、当下与前瞻三种推理模式整合进同一基准中。模型在每个查询时刻只能使用已观测的视频片段,模拟真实部署场景下的部分可观测性。数据集还要求模型识别问题是否可回答,并在不确定时校准置信度。这种设计打破了既有评测将视频问答、在线叙述和活动预测割裂的局面,为第一人称AI助手提供了更贴近实际应用的评估标准。
使用方法
使用EgoSAT需先获取Ego4D原始视频并设置环境变量。用户从Hugging Face下载标注文件、多选题候选集和有效查询集后,需实现模型适配器将自有模型接入评测管线。运行推理脚本可生成逐样本预测,然后通过官方评分器计算主指标。对于状态切换任务,需指定三个官方位置参数。数据集同时提供SFT训练清单,支持模型微调。核心评测依赖仅需轻量级安装,本地模型推理需额外配置对应GPU框架与视频处理工具。
背景与挑战
背景概述
随着可穿戴设备、边缘计算与视觉语言模型的迅猛发展,第一人称AI助手正逐步走向实际应用。在此类场景中,智能体需持续理解流式视频,实时响应用户环境,回溯相关历史事件,并预判未来交互。现有基准通常将视频问答、在线叙事与活动预测割裂为独立任务,缺乏对统一流式设定的系统性评估。为此,由Lei Yijia等学者于2026年提出的EgoSAT基准,基于Ego4D构建,涵盖1997段自我中心视频、165小时时长及约4800组高质量问答对,首次在同一框架下评测模型在回顾、当下与前瞻三种推理模态上的表现,并引入可回答性识别与置信度校准机制。该数据集已被ECCV 2026接收,为自我中心流式理解研究树立了重要标杆。
当前挑战
EgoSAT旨在解决自我中心流式视频理解中的多重挑战。首先,领域核心挑战在于模型需在仅能访问已观测视频片段的约束下,同时完成对当前交互的识别(当下建模)、对未发生事件的预测(前瞻建模)以及对历史片段的定位(回顾建模),这要求模型具备时域受限下的多模态推理能力。此外,现实场景中未来事件具有高度不确定性,为此数据集引入“分支性”(多种合理未来延续)与“惊喜性”(观测上下文与未来事件间的突变)两大元认知概念,以标注可回答性并挑战模型对不确定性的感知与置信度校准。在构建过程中,从Ego4D中筛选56类真实场景并手工标注问答对,需精细处理时域对齐与语义多样性,确保标注质量与场景覆盖度,这对数据清洗与标注一致性提出严苛要求。
常用场景
经典使用场景
EgoSAT基准数据集的核心设计理念在于统一评估第一人称视角下流式视频理解中的回顾、当下与前瞻三种推理能力。其经典使用场景聚焦于佩戴式摄像设备产生的连续视频流,要求模型在给定查询时间点仅能利用已观测到的视频片段,同时回答关于当前可见的人-物交互、依据已有证据预测未来可能发生的交互、以及通过定位历史视频中特定时刻来回溯过往事件。这种流式推理框架摒弃了传统视频问答数据集中割裂的任务划分,更贴近现实世界中AI助手实时感知与响应的需求。例如,在穿戴设备记录的用户烹饪过程中,模型需同时辨识正在进行的切菜动作、预测下一步的翻炒操作,并回溯此前添加调料的时刻。
衍生相关工作
EgoSAT的提出催生了多条富有价值的研究脉络。受益于其统一流式推理框架,研究者得以开发出适配Qwen、TimeChat等主流视觉语言模型的轻量级适配器,推动了流式理解基础架构的标准化。该基准中的可回答性感知设计激发了关于模型不确定性量化与置信度校准的系列工作,特别是分支度与惊喜度指标为评估模型预测可靠性提供了可操作的量化工具。此外,EgoSAT所配套的细粒度兴趣区域缓存(ROI Cache)机制启发了高效的视频特征索引策略,加速了实时推理过程中的时空定位。ECCV 2026的论文接收进一步彰显了该工作对自主智能体、人机协作及智能可穿戴设备等前沿领域的学术引领作用,为第一人称视觉理解设立了更具挑战性的参照坐标。
数据集最近研究
最新研究方向
当前,以自我为中心的视频理解研究正迎来范式转型,从片段式、离线式的分析迈向流式、实时的智能化感知。EgoSAT基准的提出,标志着该领域对第一人称流式交互理解展开系统性评估的开端。该基准以可回答性感知为核心,通过分支性与突变性两个维度刻画未来交互的不确定性,全面考察模型在局部观测条件下对当前、回顾与前瞻三种推理能力的协同表现。其统一的流式评估协议与细粒度置信度校准设计,为推进可穿戴AI助手在真实动态环境中的稳健部署提供了关键的评测工具与方法论支撑。
以上内容由遇见数据集搜集并总结生成



