遇见数据集

egor1-egomm-imu-benchmark

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

Ego-R1 Bench / EgoMM-EgoLife 是一个面向自我中心视频(egocentric video)的流式视觉问答(Streaming VQA)基准测试清单(benchmark manifest)。该数据集基于EgoLife基础数据集构建,包含295个测试样本,每个样本均配有本地RGB视频和IMU(惯性测量单元)数据资产提示。数据集的每个条目由统一的模式(common schema)组织,涵盖benchmark、base_dataset、question_id、category、question、choices、answer_index、answer_text、source_ids、query_time、evidence_time、clip_start_s、clip_end_s、stream_count、video_asset_hint、imu_asset_hint、local_video_available、local_imu_available、usable_for_imu_benchmark、coverage_status、answer_key_status、metadata_json和streams等字段。其中streams字段以嵌套结构记录源ID、模态、传感器角色、时间边界、资产提示、本地可用性和连接类型。数据集不直接包含原始媒体文件,仅提供示例视频及资产相对路径提示,用户需根据上游条款下载完整源媒体。该基准测试主要用于评估模型在自我中心视频流中结合IMU信息进行视觉问答的能力,适用于多模态推理、流式问答、自我中心感知等研究任务。

Ego-R1 Bench / EgoMM-EgoLife is a benchmark manifest for streaming visual question answering (Streaming VQA) on egocentric video. Built on the EgoLife foundation dataset, it contains 295 test samples, each with local RGB video and IMU data asset hints. Each entry is organized by a common schema covering fields such as benchmark, base_dataset, question_id, category, question, choices, answer_index, answer_text, source_ids, query_time, evidence_time, clip_start_s, clip_end_s, stream_count, video_asset_hint, imu_asset_hint, local_video_available, local_imu_available, usable_for_imu_benchmark, coverage_status, answer_key_status, metadata_json, and streams. The streams field records nested structures for source ID, modality, sensor role, temporal boundaries, asset hints, local availability, and connection type. The dataset does not contain raw media files directly; it only provides example videos and asset relative path hints, requiring users to download the full source media according to upstream terms. This benchmark is primarily used to evaluate models ability to perform visual question answering combined with IMU information in egocentric video streams, suitable for research tasks such as multimodal reasoning, streaming QA, and egocentric perception.

创建时间:
2026-08-03
原始信息汇总

数据集概述

Ego-R1 Bench / EgoMM-EgoLife 是一个用于**视觉问答(VQA)任务的基准测试清单(benchmark manifest),聚焦于第一人称视频(egocentric video)惯性测量单元(IMU)**数据,支持流式视频问答(streaming VQA)研究。

基本信息

  • 数据集名称:Ego-R1 Bench / EgoMM-EgoLife
  • 任务类型:视觉问答(visual-question-answering)
  • 标签:第一人称视频、IMU、流式VQA、基准清单
  • 基础数据集:EgoLife(上游来源于 EgoMM)

数据规模

  • 总行数:295 行
  • 包含本地RGB+IMU数据的行数:295 行(全部覆盖)
  • 答案键状态:全部公开(public=295)

数据内容与结构

所有行使用统一的通用模式(common schema),包含以下关键列:

  • benchmarkbase_datasetquestion_idcategory
  • questionchoicesanswer_indexanswer_text
  • source_idsquery_timeevidence_time
  • clip_start_sclip_end_sstream_count
  • video_asset_hintimu_asset_hint
  • local_video_availablelocal_imu_available
  • usable_for_imu_benchmarkcoverage_status
  • answer_key_statusmetadata_jsonstreams

其中 streams 采用一致的嵌套结构,包含源ID、模态、传感器角色、时间边界、资产提示、本地可用性及连接类型等信息。数据集特定字段统一编码在 metadata_json 中,以保证查看器模式稳定。

资产说明

  • 不包含完整的原始MP4、VRS、ZIP、CSV或NPZ文件。
  • 仅提供一个简短的重压缩示例视频(位于 examples/sample.mp4),用于快速视觉检查,并非完整源录像。
  • 完整源媒体需根据上游条款下载,并使用 sensor_vqa/raw/ 下的相对路径提示进行关联。

加载方式

python from datasets import load_dataset

dataset = load_dataset("kfkas/egor1-egomm-imu-benchmark", split="benchmark") usable = dataset.filter(lambda row: row["usable_for_imu_benchmark"])

参考来源

  • 上游数据集:EgoMM
搜集汇总
数据集介绍
egor1-egomm-imu-benchmark 数据集图片
构建方式
该基准数据集立足于第一视角视频与惯性测量单元(IMU)信号融合的多模态问答研究背景,从EgoMM等上游资源中抽取同步化的多媒体与传感器记录,经统一结构化编排后形成版本2.0的推理友好型清单。构建过程以评估问题为核心组织单元,逐题关联对应的视频、IMU及关键帧逻辑路径,并记录问题与资产之间的时间证据关系,最终生成benchmark、assets与evidence三张相互衔接的数据表,分别承载295条评估问题、318项同步源资产与333条题目-资产时间关系,通过sample_id与asset_id实现跨表精确连接。
特点
数据集以流式视觉问答与自我中心感知为典型应用场景,呈现出鲜明的多模态时间对齐特性。其核心优势在于将评估问题、传感器资产与时间证据解耦存储,既保留了问题与视频片段、IMU信号之间的逻辑映射,又通过相对路径提示避免了对原始MP4、VRS、CSV、NPZ等大体积媒体文件的重分发,从而在合规性与可复现性之间取得平衡。schema版本统一为2.0,Parquet与CSV双格式导出兼顾类型化列表与JSON字符串的兼容需求,便于不同工具链直接载入。
使用方法
使用该数据集时,研究者可借助HuggingFace datasets库分别加载benchmark、assets与evidence三部分,其中benchmark以默认split方式读取,assets与evidence则通过data_files参数指向data/v2/下的Parquet文件。针对单条评估样本,可先获取其asset_ids与sample_id,再分别对assets和evidence表执行过滤以取得对应资产记录与时间证据行。视频、IMU和帧的相对路径字段需映射至本地sensor_vqa/raw/根目录后方可打开媒体文件,而query_time_raw与evidence_time_raw则保留基准特有的墙钟或日相对时间信息,供时序推理与对齐分析使用。
背景与挑战
背景概述
以第一人称视角记录的多模态数据日益成为理解人类行为与情境感知的关键资源。Ego-R1 Bench / EgoMM-EgoLife v2 作为面向推理的基准清单,继承自 EgoMM 数据集,由相关研究团队于近年构建,旨在推动第一人称视频与惯性测量单元(IMU)信号协同驱动的流式视觉问答研究。该基准以295个评估问题为核心,关联318项同步源资产与333条问题-资产时间关系,为多模态时序推理提供了结构化评测框架,对可穿戴计算、具身智能及视频理解领域具有重要参考价值。
当前挑战
该基准所应对的领域问题在于:如何在流式、长时程的第一人称视频中,融合IMU等异构传感器信号,实现精准的时序定位与跨模态问答推理。构建过程中,同步采集的视频、IMU与帧级证据需在时间戳对齐、采样率差异与缺失值处理等方面保持一致性,同时需维护问题、资产与证据之间复杂的多对多关系。此外,原始媒体文件因许可与存储限制未随库分发,仅提供逻辑路径与元数据,这为可复现的端到端评测带来了额外挑战。
常用场景
经典使用场景
在以第一人称视角感知与多模态推理为核心的研究领域中,egor1-egomm-imu-benchmark 构成了一个面向流式视觉问答的评测基准。该数据集以 295 个评估问题为骨架,将同步采集的自我中心视频、惯性测量单元信号与证据时间关系编织为统一的结构化清单,使研究者能够在流式设定下系统性检验模型对动态场景的理解能力。其经典用法在于加载 benchmark 分区中的问题条目,并借助 sample_id 与 asset_id 的联结索引,追溯至对应的传感器资产与证据时刻,从而完成对模型时序定位与跨模态推理能力的细粒度评估。
衍生相关工作
该数据集脱胎于 EgoMM 等自我中心多模态研究脉络,并在其基础上演化为推理友好的 v2 清单形态。围绕这一资源,后续工作多聚焦于流式视觉问答模型的时序定位能力、惯性信号与视觉表征的融合策略,以及证据检索式推理框架的构建。这些衍生探索共同拓展了自我中心感知评测的边界,也为其他多模态基准在数据组织与证据溯源方面的设计提供了可借鉴的范式,形成了从数据基础设施到模型方法论的递进式研究生态。
数据集最近研究
最新研究方向
以第一人称视角视频与惯性测量单元信号深度融合为特征的egor1-egomm-imu-benchmark数据集,正推动流式视觉问答与多模态时序推理研究向真实可穿戴场景迁移。围绕该基准的前沿探索集中于跨模态时间对齐与证据溯源机制,例如通过证据表建立问题与传感器片段时间的细粒度关系,以支撑动态环境下的增量式推理。该方向与可穿戴智能助手、增强现实辅助及具身智能体等热点紧密关联,其意义在于为连续感知流中的长时程理解提供可复现的评测框架,同时促进隐私合规下多源异构传感数据的标准化利用,对边缘部署与实时多模态交互具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务