遇见数据集

supermemory-vqa-imu-benchmark

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

SuperMemory-VQA 是一个面向流式第一人称视频与 IMU 数据的视觉问答基准测试清单。该数据集作为 `kfkas/supermemory-vqa-imu-benchmark` 的查看器就绪清单,包含基准标注和本地资产提示,但不重新分发原始媒体文件。基础数据集为 SuperMemory-VQA Aria 流,共有 4,853 行,其中 4,818 行同时包含本地 RGB 视频和 IMU 数据。所有答案密钥均为公开状态。所有行使用统一的列结构,包括:`benchmark`、`base_dataset`、`question_id`、`category`、`question`、`choices`、`answer_index`、`answer_text`、`source_ids`、`query_time`、`evidence_time`、`clip_start_s`、`clip_end_s`、`stream_count`、`video_asset_hint`、`imu_asset_hint`、`local_video_available`、`local_imu_available`、`usable_for_imu_benchmark`、`coverage_status`、`answer_key_status`、`metadata_json` 和 `streams`。`streams` 字段采用一致的嵌套结构,包含源 ID、模态、传感器角色、时间边界、资产提示、本地可用性及连接类型。数据集特定字段编码在 `metadata_json` 中,以保持查看器模式稳定。用户可通过 Hugging Face datasets 库加载数据集,并使用 `filter` 选择适用于 IMU 基准测试的样本。数据集不包含完整的原始 MP4、VRS、ZIP、CSV 或 NPZ 文件,仅提供一段短示例视频和相对路径提示,完整源媒体需从上游获取。

SuperMemory-VQA is a visual question answering benchmark for streaming first-person video and IMU data. It serves as a viewer-ready checklist for the `kfkas/supermemory-vqa-imu-benchmark` dataset, containing benchmark annotations and local asset hints, but does not redistribute original media files. The base dataset is SuperMemory-VQA Aria Stream, with 4,853 rows, of which 4,818 include both local RGB video and IMU data. All answer keys are public. All rows share a unified column structure including: `benchmark`, `base_dataset`, `question_id`, `category`, `question`, `choices`, `answer_index`, `answer_text`, `source_ids`, `query_time`, `evidence_time`, `clip_start_s`, `clip_end_s`, `stream_count`, `video_asset_hint`, `imu_asset_hint`, `local_video_available`, `local_imu_available`, `usable_for_imu_benchmark`, `coverage_status`, `answer_key_status`, `metadata_json`, and `streams`. The `streams` field has a consistent nested structure containing source ID, modality, sensor role, temporal boundaries, asset hints, local availability, and connection type. Dataset-specific fields are encoded in `metadata_json` to maintain viewer mode stability. Users can load the dataset via the Hugging Face datasets library and use `filter` to select samples suitable for IMU benchmarks. The dataset does not contain complete original MP4, VRS, ZIP, CSV, or NPZ files; it only provides a short example video and relative path hints. Full source media must be obtained from upstream sources.

创建时间:
2026-08-03
搜集汇总
数据集介绍
supermemory-vqa-imu-benchmark 数据集图片
构建方式
该基准的构建立足于第一人称视角视频与惯性测量单元等多模态传感数据的融合需求,面向流式视觉问答任务设计了一套推理友好的数据组织方案。构建过程以逻辑引用为核心策略,将来源于上游SuperMemory-VQA的原始记录抽象为基准表、资产表与证据表三层结构:基准表逐条登记四千八百五十三个评估问题,资产表刻画八十三个同步源资产的物理属性,证据表则以七千零一十四条记录建立问题与资产之间的时间关联。三表通过样本标识与资产标识实现关系型联结,并统一采用二点零版模式,从而在不重新分发原始媒体文件的前提下,为多模态时序推理提供可复现的索引骨架。
特点
该数据集呈现出若干显著特征。其结构设计以推理效率为导向,将问题、资产与证据解耦存储,允许研究者按需加载与筛选,避免全量媒体数据的冗余传输。模态构成具有异质性,涵盖第一人称视频、惯性测量单元信号以及眼动注视元数据,其中眼动就绪表额外标注了一千六百二十五个问题的注视可用性判定,并披露了两项上游缺陷而非加以修补,体现出对数据真实状态的审慎保留。时间契约方面,注视数据采用设备时钟微秒制,而基准区间采用源相对秒制,二者需借助注视跨度进行跨时钟域比较,这一设计对时序对齐研究具有明确的约束意义。
使用方法
使用该数据集时,研究者可借助Hugging Face数据集加载接口分别读取基准、资产与证据三个分片,再依据样本标识与资产标识执行过滤与联结操作,从而还原特定问题所涉及的源资产及其时间关系。由于仓库仅提供逻辑相对路径,视频、惯性测量单元与帧文件的路径提示须映射至本地原始数据根目录后方可打开媒体。对于眼动分析需求,可通过Hugging Face Hub下载上游注视文件,并在比较时以注视跨度而非原始时间戳为基准。需要留意的是,仓库名称中的惯性测量单元字样仅为历史遗留,实际模态构成应以资产表中的模态字段为准。
背景与挑战
背景概述
在可穿戴传感与第一人称视觉理解交汇的前沿,SuperMemory-VQA数据集于2020年代中期由俄勒冈州立大学AIoT-MLSys实验室构建,旨在以流式视觉问答形式评估模型在自我中心视频、惯性测量单元与眼动信号协同下的长时记忆推理能力。该数据集收录4853道评测问题、83个同步源资产与7014条问题—资产时间关系,并纳入1625道目光就绪问题,覆盖Persons 1-7 Oracle划分。其核心问题是多模态时序证据下的问答一致性,对可穿戴认知计算与多传感器基准设计具有显著推动作用。
当前挑战
该数据集所应对的领域问题在于自我中心流式场景中跨模态时序对齐与长时记忆检索的困难,模型需在视频、IMU与眼动信号间建立可靠的查询—证据映射。构建过程中的挑战尤为突出:媒体源以逻辑路径而非原始文件分发,依赖本地根目录映射,增加了可复现性门槛;上游存在1字节空压缩包与覆盖不全的目光记录,导致18与2道问题受阻;眼动元数据采用设备时钟微秒而查询区间为源相对秒,需借助跨度字段而非原始时间戳比较,且禁止插值或显著性替代。仓库名中的imu亦属历史遗留,须依模态列判断,进一步考验基准的透明性与稳健性。
常用场景
经典使用场景
在具身智能与多模态记忆研究的浪潮中,第一人称视频流式视觉问答构成了核心挑战之一。SuperMemory-VQA数据集凭借其4853道评测问题、83个同步源资产以及7014条问题-资产时间关系,成为流式VQA基准测试的经典平台。研究者通常将视频、惯性测量单元(IMU)和眼动信号按时间轴对齐,要求模型在持续到达的传感器流中定位证据区间并给出答案,这一设置真实模拟了智能体在动态环境中依赖时序记忆进行推理的认知过程。
衍生相关工作
该数据集衍生了一系列围绕流式记忆与多模态融合的经典工作。上游OSU-AIoT-MLSys-Lab的SuperMemory-VQA项目催生了针对第一人称视频的时序定位模型,而gaze就绪元数据的引入则促进了眼动引导的注意力机制研究。后续研究常将其作为基准,对比不同记忆架构在长视频问答中的表现,并启发了一批关于传感器时钟同步与证据检索的算法改进,逐步形成了以时间关系为核心的评测生态。
数据集最近研究
最新研究方向
在以第一人称视角视频为载体的多模态推理领域,SuperMemory-VQA凭借其惯性测量单元与眼动追踪信号的融合标注,正推动流式视觉问答从静态片段理解迈向长时程记忆建模的前沿。该基准以4,853项评估问题与7,014条问题—证据时间关联构成精细的时序监督框架,并借由2026年新增的眼动就绪元数据,为注视引导的记忆检索与跨模态证据对齐开辟了可复现路径。相关研究聚焦于传感器时钟与源相对时间的归一化、证据区间越界处理及模态标签的显式声明,其意义在于为可穿戴场景下的持续问答提供兼顾推理效率与感知真实性的评测基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务