遇见数据集

inclusionAI/MemDreamer

收藏
Hugging Face2026-06-12 更新2026-06-14 收录
官方服务:

资源简介:

MemDreamer数据集包含预构建的分层图记忆和智能检索推理轨迹,用于支持长视频理解任务。该数据集与MemDreamer方法相关,方法通过解耦感知和推理,利用视频流构建分层图记忆(包括视频根、超级事件、宏观事件以及实体/事件子图),并采用基于工具增强的智能检索机制(通过观察-推理-行动循环)来回答问题。数据集可用于重现MemDreamer在多个基准测试(如LVBench、LongVideoBench等)中的最先进结果,帮助用户评估和扩展长视频理解能力。数据集包括记忆文件和推理轨迹,用户需下载后配合提供的代码进行使用。

The MemDreamer dataset includes pre-built hierarchical graph memory and agentic retrieval inference trajectories for long video understanding tasks. It is associated with the MemDreamer method, which decouples perception and reasoning by streaming videos to construct a hierarchical graph memory (comprising Video Root, Super Events, Macro Events, and Entity/Event Subgraphs) and employs tool-augmented agentic retrieval via an Observation-Reason-Action loop to answer questions. The dataset enables reproduction of MemDreamers state-of-the-art results across multiple benchmarks (e.g., LVBench, LongVideoBench), supporting evaluation and extension of long video understanding capabilities. It consists of memory files and inference trajectories, which users can download and use with the provided code.

提供机构:
inclusionAI
搜集汇总
数据集介绍
inclusionAI/MemDreamer 数据集图片
构建方式
MemDreamer数据集专为长视频理解而设计,其构建方式基于一种创新的层次化图记忆架构。该架构通过流式处理视频内容,自适应地进行片段分割,并向下抽取子图,向上进行层次化聚合,最终形成从视频根节点、超级事件、宏观事件到实体/事件子图的四级图结构。这种构建过程将视频中的时空信息与语义关系系统地组织为可检索的记忆网络,为后续的智能推理奠定了坚实基础。
特点
该数据集的核心特点在于其解耦感知与推理的设计范式。它采用了一个包含观察-推理-行动循环的智能体工具增强检索机制,通过层次化导航、精确搜索和图遍历三类工具,在长达数小时的视频中高效定位并推理答案。在LVBench、LongVideoBench、Video-MME和EgoSchema四大基准测试中,MemDreamer均取得了最先进的性能,与人类专家的差距缩小至仅3.7分,展现了卓越的视频理解能力。
使用方法
使用MemDreamer数据集时,用户首先需从HuggingFace平台下载预构建的记忆文件和推理轨迹。通过提供的检索代码,用户可基于预计算嵌入启动嵌入服务器,并运行智能体检索循环来复现完整推理过程。支持自定义语言模型后端,便于灵活适配不同实验需求。详细的运行指南位于retrieve目录的README文件中,覆盖了从环境配置到结果验证的全流程操作步骤。
背景与挑战
背景概述
在长视频理解领域,模型常因感知与推理耦合而难以应对超长序列中的稀疏关键信息与复杂时间关系。为此,由蚂蚁集团、浙江大学、中南大学及香港科技大学(广州)等机构的研究人员于2026年联合提出了MemDreamer数据集及配套框架。该工作通过构建层次化图记忆结构(视频根节点→超级事件→宏事件→实体/事件子图),并设计基于观察-推理-行动循环的智能体增强检索机制,将感知与推理解耦。MemDreamer在LVBench、LongVideoBench、Video-MME及EgoSchema四项基准上均实现了最先进水平,与人类专家性能差距缩小至仅3.7个百分点,为长视频理解研究树立了新的标杆。
当前挑战
MemDreamer所解决的领域核心挑战在于长视频理解中感知与推理的纠缠,传统方法难以在分钟级视频中高效定位细粒度事件并执行多步推理。此外,数据集构建面临双重困难:首先,需设计流式自适应分割策略以在内存约束下捕捉跨模态事件边界,同时构建可扩展的层次化记忆图谱以支持任意长度视频;其次,智能体检索机制要求工具(层次导航、精确搜索、图遍历)在开放域问答中平衡探索与利用,且推理轨迹的自动标注与质量保证亦构成工程瓶颈。
常用场景
经典使用场景
MemDreamer作为一项面向长视频理解的前沿数据集与框架,其核心使用场景在于对时长动辄数十分钟乃至数小时的视频内容进行高效、精准的语义解析。与传统短视频理解任务不同,长视频往往包含错综复杂的叙事线索和时空依赖关系,该数据集通过构建层级化的图记忆结构,将视频流解耦为视频根节点、超级事件、宏观事件以及实体/事件子图,从而实现对长视频中时序逻辑与因果关联的细腻刻画。其经典使用方法聚焦于借助智能体驱动的检索机制,驱动观测-推理-行动循环,从海量视觉信息中定位并回答复杂问题,尤其适用于需要跨时段推理与多模态证据聚合的学术场景。
衍生相关工作
围绕MemDreamer衍生出的相关工作已形成富有活力的研究脉络。其中,层级图记忆的构建策略启发了诸如Hierarchical Video Graph Network等后续方法,进一步探索视频语义的多粒度编码;智能体检索机制则催生了Observ-Reason-Act框架在视觉问答中的广泛适配,推动了Tool-Augmented Video Reasoning方向的发展。此外,该数据集公开的推理轨迹与记忆文件为同行提供了标准化的评估平台,支撑了多项对比实验与消融研究,如Memory-Augmented Large Language Models for Video Understanding的提出,这些工作共同巩固了MemDreamer作为长视频理解领域里程碑式资源与范式的地位。
数据集最近研究
最新研究方向
MemDreamer聚焦于长视频理解中感知与推理的解耦问题,通过构建分层图记忆(包括视频根节点、超级事件、宏事件及实体/事件子图),并引入基于观察-推理-行动循环的智能体工具增强检索机制,实现了在LVBench、LongVideoBench、Video-MME和EgoSchema四项基准上的领先性能,将与人类专家的差距缩小至3.7个百分点。这一工作不仅回应了长视频时空建模与长期依赖推理的复杂挑战,还通过分层记忆结构与智能体检索的协同设计,推动了视频理解从短片段分析向全局语义推理的范式演进,为自动驾驶、视频监控、影视内容分析等实际场景提供了高效、可解释的解决方案。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务