EgoEverything
收藏官方服务:
资源简介:
EgoEverything是一个基准数据集,用于在增强现实环境中基于人类行为启发的长上下文自我中心视频理解。
EgoEverything is a benchmark dataset for human behavior-inspired long-context egocentric video understanding in augmented reality environments.
创建时间:
2026-06-27
原始信息汇总
数据集概述
EgoEverything 是一个用于增强现实(AR)环境中、受人类行为启发的长上下文第一人称(egocentric)视频理解基准数据集。该数据集及其相关的视频问答(VQA)生成与评估代码托管于 GitHub 仓库。
数据集来源
EgoEverything 不直接分发原始视频,而是提供基于以下两个公开数据集的标注和元数据:
- Aria Everyday Activities (AEA):来自 Project Aria 的日常活动数据集。
- Nymeria:来自 Project Aria 的数据集。
用户需从各自的官方 Project Aria 页面获取这些源数据集,并遵守其许可协议。
数据内容
数据集包含由模块化流水线生成的 VQA 数据,具体内容如下:
- 输入结构:每个视频序列需包含一个 MP4 视频文件、一个 JSON 格式的摘要文件(描述每个时间段的活动),以及一个可选的 CSV 格式的注视跟踪文件。
- 输出格式:生成的 VQA 数据为一个 JSON 文件,包含以下信息:
generation_date: 生成日期。dataset: 数据集名称。summary: 处理的视频总数和生成的问题总数。result: 每个视频的问答对列表。每个问答对包含:video_name: 视频名称。QA:问题列表,每个问题包含:key_frame_timestamp: 关键帧时间戳。key_object: 关键对象名称和边界框。raw_output: 原始问答结果、思维链推理过程和场景描述。token_usage: 所使用的 token 数量。question: 最终问题。answer: 多个候选答案。correct: 正确答案的索引。review_passed: 是否通过质量审核。review_attempts: 审核尝试次数。
核心方法
该数据集通过一个系统化的 VQA 生成流水线构建,核心模块包括:
-
对象采样与选择 (
object_sampler.py):- 基于指定的采样密度提取关键帧。
- 使用视觉语言模型(VLM)检测每个关键帧中的对象。
- 利用 CLIP 特征对相似对象进行聚类。
- 基于注视数据(如可用)或随机采样选择焦点对象。
-
QA 生成 (
qa_generator.py):- 为选定的对象生成问答对。
- 采用工具调用机制,代理(Agent)可使用工具从视频中提取特定帧或时间段以获得上下文。
- 将生成的问答对自动优化为多项选择题。
-
质量审核 (
qa_reviewer.py):- 自动对生成的问答进行质量审查。
- 检查内容包括:事实准确性、歧义性、逻辑链和措辞自然度。
- 每个问题最多进行 3 次修改尝试,通过审核的问题会被标记。
使用方式
用户可以通过命令行运行流水线来生成自己的 VQA 数据,支持批处理和多线程。
- 快速启动:使用示例配置脚本
bash example_config.sh。 - 完整流水线:直接运行
python main.py并配置必要参数,如 API 密钥、VLM 模型、数据集路径等。 - 单个模块测试:可独立测试
object_sampler.py、object_detector.py和qa_generator.py等模块。
许可协议
- 代码:仓库中的源代码采用 MIT 许可证。
- 标注与元数据:EgoEverything 的标注和元数据采用 Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0) 许可证。
- 源数据集:源数据集受其各自的许可证约束(AEA 与 Nymeria),用户必须遵守其要求。
搜集汇总
数据集介绍

构建方式
EgoEverything 的构建源于对增强现实(AR)环境下人类行为启发的长上下文自我中心视频理解的需求。数据集构建过程依托于一个模块化的视频问答(VQA)生成管線,该管线首先从 Aria Everyday Activities(AEA)与 Nymeria 等公开自我中心视频数据集中获取原始视频及其摘要信息。随后,系统通过帧提取、基于视觉语言模型(VLM)的对象检测、结合注视数据的 CLIP 特征聚类来筛选关键对象。在此基础上,利用工具调用机制为大语言模型代理生成自然的问题-答案对,并自动细化为多项选择题格式,最终经内置质量审查系统验证,确保每条问答的准确性与合理性。
使用方法
使用 EgoEverything 数据集时,研究者首先需从官方 Project Aria 页面下载 AEA 与 Nymeria 源视频,并按照指定目录结构组织数据,包括视频文件、摘要 JSON 与可选的注视追踪 CSV。随后,通过配置示例脚本或调用主管线 `main.py` 并设置 API 密钥、VLM 模型、数据集路径等参数即可运行生成任务。用户还可调整帧采样密度、问题生成倍数及并行线程数以控制数据产量与效率。生成的 VQA 结果以标准化 JSON 文件输出,可直接用于模型训练与评测,也支持单独测试对象采样、检测或问答生成模块以进行定制化研究。
背景与挑战
背景概述
EgoEverything是由纽约大学和Meta Reality Labs的研究人员于2025年提出的基准测试数据集,核心研究问题聚焦于增强现实(AR)环境中受人类行为启发的长上下文第一人称视频理解。该数据集基于Project Aria平台的Aria Everyday Activities(AEA)和Nymeria等公开数据集构建,通过精心设计的流水线生成包含物体检测、注视追踪和多选题问答的高质量标注。其发布标志着头戴式AR设备在理解复杂、持续时间长的日常活动方面迈出了关键一步,为评估模型在自然情境下的语义推理与时空关联能力提供了标准化平台,对推动AR智能助手、人机交互和具身智能等领域具有重要影响。
当前挑战
该领域面临的核心挑战在于长上下文第一人称视频中多模态信息的高效融合与精准推理。具体而言,视频数据通常包含数十分钟的连续记录,需在稀疏关键帧中捕捉细粒度物体交互与动态变化;注视点信息的引入虽能辅助注意力引导,但真实场景中上下文切换频繁,导致物体选择与问答应具备高度鲁棒性。此外,自动化生成质量难以保证,需通过多轮审核机制清除歧义描述与伪事实,避免模型产生幻觉。构建过程中,跨数据集异构格式的统一、大规模并行标注的协调,以及VLM调用成本与输出一致性的平衡,均构成棘手的技术壁垒。
常用场景
经典使用场景
在增强现实(AR)与第一人称视频理解这一交叉领域中,EgoEverything数据集为研究者提供了一个具有挑战性的基准,专门用于评估模型在长时间、非结构化自我中心视频中捕捉人类行为动态的能力。该数据集的典型使用场景聚焦于对AR环境下多模态、长上下文视觉问答(VQA)任务的建模与评测。通过利用Aria Everyday Activities与Nymeria等真实自我中心视频资源,EgoEverything设计了结合注视点追踪、关键帧提取与对象聚类的高质量问答生成流水线,使得研究人员能够测试模型在多时段、多对象交互的连续场景中,准确理解用户活动意图与行为逻辑的能力。
解决学术问题
EgoEverything数据集有效应对了当前视频理解领域中长期存在的两大核心学术挑战:其一,现有数据集大多聚焦于短视频片段或第三人称视角,缺乏对长时间、第一人称视频序列中人类行为连续性与上下文依赖关系的建模基准;其二,传统VQA任务往往忽略用户在真实情境中的空间注意与视觉聚焦,难以捕捉行为动机与交互对象间的因果链条。为此,EgoEverything创新性地引入基于眼动追踪的对象选择机制,并结合多层次质量审查系统,生成了兼具事实准确性与逻辑一致性的复杂选择题。该数据集的发布显著推动了自我中心视频长期理解研究从静态场景描述向动态行为推理的范式跃迁。
实际应用
在实际应用层面,EgoEverything数据集为智能可穿戴设备与AR眼镜的人机交互系统提供了关键的技术验证基础。例如,在智能辅助场景中,模型可通过EgoEverything训练,从第一人称视角视频中准确推断用户遗忘物品的位置或正在进行的活动状态,从而支持个性化的情景感知提醒。此外,该数据集还可用于开发面向视障人士的环境导航辅助工具,通过理解用户注视焦点与实际操作之间的关联,实时提供动态、精细化的行为指引。其结合注视数据与多模态问答的独特设计,更可赋能数字记忆助手、自动驾驶舱内的驾驶员状态监测等新兴应用场景,体现了从学术研究到产业落地的桥梁作用。
数据集最近研究
最新研究方向
EgoEverything基准数据集聚焦于增强现实环境中受人类行为启发的长上下文第一人称视频理解,其前沿研究方向体现在多模态融合与时空推理机制的深度结合。该数据集通过整合Aria Everyday Activities和Nymeria等源数据,开创性地将注视轨迹、物体检测与长视频时间线进行关联,驱动了面向AR场景的视觉问答生成范式革新。随着苹果Vision Pro与Meta Orion等空间计算设备引爆消费市场,该工作为理解人类在穿戴AR设备时的自然交互行为提供了标准化评估框架,通过自动化的多级质量审核与工具调用式QA生成,突破了传统视频理解在长程依赖与精细化动作解析上的瓶颈。这一进展不仅推动了AI从被动感知向主动情境推理的跨越,更对智能眼镜、机器人导航等实时交互系统的认知架构设计具有里程碑式的启示意义。
以上内容由遇见数据集搜集并总结生成



