遇见数据集

S-EMBER

收藏
github2026-07-08 更新2026-07-09 收录
官方服务:

资源简介:

S-EMBER评估长时第一人称视频中的流式情景记忆检索:给定来自可穿戴智能眼镜的第一人称视频,模型必须仅使用查询时间前可用的帧来回答问题,并将回忆基于时间进行定位。该基准包含3,141个视频、388小时的有机活动,以及9,448个QA对,涵盖位置追踪、顺序动作、对象/事件计数、视觉细节回忆、时间排序、时间持续时间、对象比较和空间感知推理。

S-EMBER: Evaluating Streaming Episodic Memory Retrieval in Long-duration First-Person Videos. Given first-person videos captured from wearable smart glasses, models must answer questions using only frames available prior to the query timestamp, and temporally localize the recalled content. This benchmark includes 3,141 videos, 388 hours of naturalistic daily activities, and 9,448 QA pairs, covering tasks such as location tracking, sequential actions, object/event counting, visual detail recall, temporal ordering, temporal duration estimation, object comparison, and spatial perceptual reasoning.

创建时间:
2026-07-01
原始信息汇总

S-EMBER 数据集概述

S-EMBER 是一个大规模基准测试,用于评估流式自我中心记忆检索(Streaming Egocentric Memory Retrieval)。其核心任务是基于头戴式智能眼镜拍摄的第一人称视频,模型需在指定查询时间点,仅利用该时间点之前可用的视频帧来回答问题,并在时间轴上定位支持答案的证据。

数据集规模与构成

  • 视频数量:3,141 段第一人称视频。
  • 视频时长:总计 388 小时,记录日常有机活动。
  • 问答对:9,448 对,覆盖 8 个类别:位置追踪(location trace)、顺序动作(sequential action)、物体/事件计数(counting objects/events)、视觉细节回忆(visual detail recall)、时序排序(temporal ordering)、时间持续时间(time duration)、物体比较(object comparison)和空间感知推理(spatial-aware reasoning)。

数据格式与获取

  • 元数据:提供两个 JSONL 文件,sember_mcq.jsonl(多项选择题)和 sember_grounding.jsonl(答案生成+时间定位)。
  • 视频文件:MP4 格式,存放于 data/videos/ 目录。
  • 获取方式:通过 Hugging Face 数据集仓库 facebook/S-EMBER 下载。视频文件和元数据均需单独下载。

评估任务

  1. 多项选择(MCQ):模型从给定的选项中选择正确答案。
  2. 时间定位(Grounding):模型需输出自由文本答案以及视频中支持该答案的证据时间区间 [t_start, t_end](以秒为单位)。主要评估指标为时间交并比(temporal IoU)。此外,可选的 Gemini 评判器可对答案文本的正确性进行评分。
  • 基线模型:提供的脚本支持 InternVL3.5(4B/8B/38B)和 Qwen3-VL(4B/8B/32B)等模型的评估。也提供了调用 Gemini 和 GPT-4o 等闭源 API 的基线脚本。

环境与使用

  • Python 版本:≥ 3.10

  • 推荐环境:Conda

  • 安装命令: bash conda create -n sember python=3.10 -y conda activate sember pip install -e ".[video,video-legacy]" pip install -U huggingface_hub

  • 评估运行示例:提供了 Shell 脚本进行一键式测试和 SLURM 集群提交文件。关键参数(如 GPU 数量、采样帧数)可通过环境变量配置。

许可协议

  • S-EMBER 主体:遵循 CC BY-NC 4.0 许可协议。
  • 部分组件lmms-evallm-evaluation-harness 遵循其各自的许可证。
  • 数据集:在 Hugging Face 上受门控访问条款约束。

引用

bibtex @article{wang2026sember, title = {S-EMBER: A Large-Scale Benchmark for Streaming Egocentric Memory Retrieval}, author = {Wang, Xiaodong and Zhao, Xuanyi and Rodriguez, Pedro and Sachan, Devendra Singh and Oguz, Barlas and Moon, Seungwhan and Li, Shang-Wen and Ghosh, Gargi and Dong, Xin and Yih, Wen-Tau}, journal = {arXiv preprint arXiv:2607.02689}, year = {2026}, url = {https://arxiv.org/abs/2607.02689} }

搜集汇总
数据集介绍
构建方式
S-EMBER基于大规模第一人称视角视频数据构建,旨在评估流式情景记忆检索能力。数据来源于可穿戴智能眼镜拍摄的3,141段长时视频,总时长388小时,覆盖日常有机活动。标注过程采用流式方式,标注员在观看视频时不断提出记忆问题,共生成9,448个问答对。每个问题由多位标注员以不同详尽程度回答,并锚定到一个支撑性的时间区间作为视觉记忆证据。问题涵盖位置轨迹、序列动作、对象/事件计数、视觉细节回忆、时序推理、持续时间估计、对象比较和空间感知推理八大类别,形成了结构化的记忆检索基准。
特点
S-EMBER的核心特点在于其流式评估机制与时间接地能力的深度融合。模型必须在给定查询时间点之前仅利用已观察到的视频帧来回答问题,这模拟了真实世界中边观察边记忆的认知过程。与静态视频问答不同,该基准强调时间界限内推理,禁止未来信息泄露。其次,数据集同时提供多项选择问答和自由形式回答加时间区间定位的双重任务,能够全面衡量模型检索准确性与证据定位能力。此外,388小时的丰富视频素材和精心设计的八大问题类别使得评估维度立体多元,能够深入剖析模型在复杂空间、时间与视觉记忆相互交织场景下的真实表现。
使用方法
使用S-EMBER时,研究者首先通过Hugging Face下载元数据JSONL文件和视频文件。环境搭建需创建Python 3.10的conda环境,并安装基于lmms-eval框架的评估工具包。对于多项选择任务,可通过预设脚本指定模型规模和视频帧采样参数直接启动评估;接地任务则需额外设置视频目录路径,运行对应脚本后模型需输出自由文本答案及支撑性时间区间[t_start, t_end]。评估结果包括标准的整体准确率与按类别划分的细粒度性能,接地任务默认报告时间IoU指标。用户还可通过API基线脚本调用Gemini或GPT-4o等闭源模型,以及使用可选的Gemini裁判脚本对自由文本答案进行正确性评判。
背景与挑战
背景概述
S-EMBER是由Meta旗下的FAIR与Reality Labs联合构建的大规模流式自我中心记忆检索基准,于2026年发布。核心研究团队包括Xiaodong Wang、Xuanyi Zhao、Pedro Rodriguez等研究者。该数据集聚焦于第一人称视角视频中的流式情景记忆检索问题,要求模型仅利用查询时刻之前可用的视频帧来回答问题,并定位时间证据。S-EMBER包含3,141段视频、总计388小时的自然活动记录以及9,448个问答对,涵盖位置轨迹、连续动作、物体事件计数、视觉细节回忆、时序排序、持续时间、物体比较及空间感知推理等八类记忆任务,为评估多模态大模型在长视频流中的记忆能力提供了坚实的数据基础。
当前挑战
S-EMBER所解决的领域核心挑战在于,现有基准多关注离线视频理解,无法有效评估模型在流式情境下对长期、非结构化自我中心视频的即时记忆检索能力。模型需应对视频时长超长但仅能访问历史帧的限制,以及时间定位与自由文本回答的联合生成难题,即所谓“定位悖论”。在构建过程中,挑战同样显著:组织3,141段真实穿戴设备拍摄的长视频,并设计跨8个类别的流式记忆问题,确保每问题经多标注员在多种详细程度下给出可接受答案且锚定到精确时间证据区间,均需耗费大量人力与质量审核。
常用场景
经典使用场景
在自中心视觉与人工智能的交叉领域中,S-EMBER作为首个大规模流式情景记忆检索基准,专为评估长视频中的即时性记忆问答而设计。其核心场景是模拟穿戴智能眼镜等第一人称视角设备时,模型必须仅利用查询时刻之前可见的视频帧,回答关于位置轨迹、连续动作、物体计数、视觉细节回忆、时间顺序、持续时间、对象比较及空间感知推理等八类记忆问题。该基准涵盖3,141段视频、总计388小时的自然活动记录,以及9,448个精心标注的问答对,为流式情景记忆这一极具挑战性的研究方向提供了标准化的评测平台。
解决学术问题
S-EMBER直面传统视频问答与记忆检索领域中两个长期悬而未决的学术难题:一是如何在流式输入约束下仅基于历史帧进行记忆召回,而非依赖完整视频剪辑;二是如何实现回答的时间定位与证据区间回溯。该基准首创性地设立了同时评估答案正确性(MCQ)与时间定位精度(temporal IoU)的双重任务,深刻揭示了当前最先进的视频理解模型在“定位矛盾”中的局限——即模型虽能给出正确答案,却往往无法精准指向支撑证据的时间段。这一发现有力推动了多模态大模型在时空记忆建模与因果推理能力上的深入探索。
衍生相关工作
自S-EMBER发布以来,其独特的流式记忆评估范式已催生了一系列值得关注的研究工作。一方面,研究者基于其提供的流式视频处理管线与模型wrapper,开发了多种适用于长视频流的时间自适应采样策略与视频片段级记忆模块,显著提升了模型在有限帧预算下的召回性能。另一方面,该基准所揭示的“定位矛盾”现象直接激发了关于多模态大模型时间感知机制的系统性研究,包括时间戳嵌入、因果注意力掩码以及基于时间对比学习的预训练目标设计。此外,S-EMBER的八类细粒度记忆问题分类法也被后续工作采纳为分析模型记忆退化模式的重要维度,成为评估自中心视觉理解系统时空推理能力的事实标准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务