遇见数据集

jiazhengli7/magic-video-artifacts

收藏
Hugging Face2026-05-14 更新2026-05-31 收录
官方服务:

资源简介:

MAGIC-Video Artifacts数据集是一个用于超长智能视频推理的预处理成果集合,旨在支持论文《Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning》的研究。该数据集包含两个主要部分:EgoLifeQA(基于一个主题‘A1_JAKE’的7天自我中心视角视频,总时长约52小时)和MM-Lifelong(基于14个广播视频,每个约4.6小时)。数据集提供了详细的预处理文件,包括翻译后的密集字幕(从中文到英文,多粒度时间间隔)、情景记忆(OpenIE和情景三元组)、语义记忆(实体级语义三元组)、主题链(实体传记)和事件链(多步蒸馏过程)。这些文件以JSON格式存储,用于支持记忆图构建和检索增强生成任务,帮助研究者低成本、高保真地复现论文中的实验,跳过昂贵的LLM调用步骤,直接进行视觉嵌入和图构建。数据集语言主要为英语,适用于视觉问答和长视频分析等领域。

The MAGIC-Video Artifacts dataset is a collection of preprocessing artifacts used for ultra-long agentic video reasoning, supporting the research in the paper Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning. It consists of two main components: EgoLifeQA (based on 7 days of egocentric video from one subject A1_JAKE, totaling approximately 52 hours) and MM-Lifelong (based on 14 broadcast videos, each about 4.6 hours). The dataset includes detailed preprocessing files such as translated dense captions (from Chinese to English, with multi-granularity time intervals), episodic memory (OpenIE and episodic triples), semantic memory (entity-level semantic triples), topic chains (entity biographies), and event chains (multi-step distillation processes). These files are stored in JSON format and are designed to facilitate memory graph construction and retrieval-augmented generation tasks, enabling researchers to reproduce experiments cheaply and faithfully by skipping costly LLM API calls and proceeding directly to visual embeddings and graph building. The dataset is primarily in English and is applicable to fields like visual question answering and long-video analysis.

提供机构:
jiazhengli7
二维码
社区交流群
二维码
科研交流群
商业服务