遇见数据集

M³Eval

收藏
github2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

M³Eval是第一个全面的评估框架和基准,用于探测多模态模型中的不同记忆维度。基于认知心理学设计,其任务隔离了记忆的关键方面,通过实验揭示了模型在并行视频流处理、记忆干扰、空间与时间域记忆以及符号记忆方面的弱点和行为。

M³Eval is the first comprehensive evaluation framework and benchmark dedicated to probing distinct memory dimensions in multimodal models. Grounded in cognitive psychology, its tasks isolate critical facets of memory, and through empirical experiments reveal the vulnerabilities and behavioral characteristics of models in parallel video stream processing, memory interference, spatial and temporal domain memory, and symbolic memory.

创建时间:
2026-05-09
原始信息汇总

数据集概述

M³Eval 是首个基于认知心理学设计的多模态记忆评估基准,旨在系统性地评估多模态模型在视频理解中的记忆能力。该数据集由北京大学 PKU-VaLuE-Lab 与威斯康星大学麦迪逊分校联合发布。

核心目标

  • 填补现有视频数据集和基准在记忆评估方面的空白,评估模型对信息的保持、保真度以及在干扰下的鲁棒性。
  • 通过精心构造的任务,隔离并探测多模态模型中不同维度的记忆能力。

任务组成

M³Eval 包含四个主要记忆评估任务:

  • Divided Attention(分散注意):评估模型同时处理并记忆两个并排视频内容的能力。
  • Memory Interference(记忆干扰):评估顺序呈现的视频之间的记忆干扰,包括前摄干扰和倒摄干扰。
  • Interleaved Events(交错事件):评估从时间上交织的视频片段中重建记忆的能力。
  • N-Back(N项回溯):评估模型判断当前片段是否与前面第 N 个片段匹配的能力,涵盖场景和动作两种符号属性。

主要发现

  • 模型在处理并行视频流时难以保持分离的表示。
  • 模型的干扰模式与人类记忆存在显著差异。
  • 模型在空间域的记忆溯源比时间域更可靠。
  • 模型的符号记忆能力有限。

数据集构成

  • 数据集由现有公开基准组合而成,用户需遵守各原始数据集的许可协议。
  • 数据文件包括:
    • qa_root/:问答数据
    • questions/:问题文件
    • nback/:N-Back 任务数据
    • viewer/:可视化相关文件
    • videos/:视频文件,按任务分为 interleaved/memory_interference/split_screen/nback/ 四个子目录。

使用方式

  • 安装:通过 git clone 仓库并安装依赖。
  • 下载:使用 Hugging Face CLI 下载数据集并解压至 data/m3eval/ 目录。
  • 评估:提供单 GPU 和多 GPU 数据并行评估脚本,可指定任务名称,如 m3evalm3eval_memory_interferencem3eval_split_screenm3eval_interleavedm3eval_nback
  • 结果聚合:通过脚本将评估输出转换为论文中的表格格式。

相关链接

  • 论文:https://arxiv.org/abs/2606.05008
  • 项目主页:https://pku-value-lab.github.io/m3eval-homepage/
  • Hugging Face 数据集:https://huggingface.co/datasets/PKU-VaLuE-Lab/m3eval
  • GitHub 代码仓库:https://github.com/PKU-VaLuE-Lab/m3eval
搜集汇总
数据集介绍
M³Eval 数据集图片
构建方式
M³Eval的构建植根于认知心理学理论,旨在系统性地评估多模态模型的记忆能力。数据集由四大核心任务构成:分屏注意力任务要求模型同时处理并记忆两个并排视频流,以考察其并行记忆保持能力;记忆干扰任务通过先后呈现两个视频,探究先验信息对新信息提取的干扰(前摄干扰)及新信息对旧信息回溯的干扰(倒摄干扰);交错事件任务要求模型从时间上打乱的视频片段中重构出完整的事件序列,以此检验时序记忆的保真度;而N-Back任务则让模型判断当前片段是否与之前第K个片段相匹配,用于评估符号化工作记忆的更新与追踪能力。所有任务均源自公开视频数据集,经过精心设计与筛选,确保每个实验条件都能精准隔离并测量特定的记忆维度。
特点
M³Eval作为首个综合性的多模态记忆评估基准,其核心特点在于认知导向的任务设计能够系统性地解耦并探测记忆的不同层面,包括并行处理、干扰抑制、时序重建与符号操作。该数据集覆盖了从感知工作记忆到长期语义记忆的连续谱系,特别揭示了多模态模型在并行视频流中难以维持分离表征、时空域记忆源定位的不对称性(空间优于时间)以及符号化记忆的固有局限。此外,M³Eval通过精心编排的干扰范式,发现了模型与人类记忆在干扰模式上的显著差异,这些发现为理解多模态智能系统的记忆机制提供了独特视角,并指明了未来模型设计的关键优化方向。
使用方法
使用M³Eval需先克隆官方代码仓库并安装lmms-eval环境,随后通过Hugging Face接口下载完整数据集至指定目录并执行解压脚本。评估时,用户可通过预设的bash脚本调用主流多模态模型,支持单GPU调试与多GPU数据并行两种模式,并可通过--task参数选择全量评估或特定子任务(如记忆干扰、分屏注意力等)。评估结果以JSON格式输出,并附有聚合脚本来生成论文风格的对比表格。为确保公平比较,所有任务均采用统一的问答格式与评估管线,使得研究者能够便捷地复现基准结果,或在自定义模型上开展可复现的记忆能力评测。
背景与挑战
背景概述
随着多模态模型向长视频理解领域迈进,记忆能力逐渐成为评估其智能水平的关键维度。然而,现有的视频数据集与基准测试多聚焦于感知与推理任务,缺乏对模型记忆特性的系统性审视。为填补这一空白,北京大学VaLuE实验室联合威斯康星大学麦迪逊分校的研究团队于2026年提出了M³Eval,这是首个基于认知心理学理论构建的多模态模型记忆评估框架。该基准精心设计了涵盖分散注意力、记忆干扰、交错事件重构及N-Back测试等一系列任务,旨在精准探测模型在不同记忆维度上的表现,包括信息保持的忠实度、表征的独立性以及抗干扰能力。M³Eval的发布为多模态模型的记忆机制研究提供了标准化的评测工具,其揭示的模型在并行流处理与时间域记忆源定位上的固有缺陷,对推动模型架构创新具有深远影响。
当前挑战
M³Eval所面临的挑战可从两个层面加以审视。其一,在领域核心问题层面,多模态模型在长视频理解中暴露出记忆表征的脆弱性:模型难以维持对不同视频流的独立表示,在并行输入时表现出显著的纠缠现象;其记忆干扰模式与人类认知存在本质差异,且空间域的记忆源定位能力明显优于时间域,符号化记忆的局限性尤为突出。其二,在基准构建层面,M³Eval需将认知心理学中精密的实验范式(如干扰效应与工作记忆更新任务)转化为可量化的视频理解评测,这要求视频素材在时序结构、语义复杂度及干扰变量控制上达到严格平衡,同时需确保评估流程对不同模型架构具有公平性与可复现性,并在大规模评测中维持高效的计算效率。
常用场景
经典使用场景
M³Eval数据集的核心应用场景在于系统性地评估多模态模型在长时间视频理解中的记忆能力。该基准通过设计基于认知心理学的任务,如分屏注意力、记忆干扰、交错事件重建和N-Back测试,分别考察模型的多流信息保持、抗干扰鲁棒性、时间序列重建以及符号记忆等维度。研究者可利用M³Eval对模型进行标准化测试,揭示其在记忆方面的薄弱环节,从而为改进多模态模型的工作记忆机制提供量化依据。
解决学术问题
该数据集填补了多模态模型研究中记忆能力系统性评估的空白,解决了现有基准仅关注感知与推理而忽略记忆保真度与干扰下鲁棒性的学术问题。通过将认知心理学范式引入模型测试,M³Eval揭示了模型在并行视频流中维持离表征的困难、与人类记忆截然不同的干扰模式、时空记忆的不对称性以及符号记忆的局限。这些发现为理解多模态模型的记忆瓶颈提供了关键洞察,并推动了更有效的记忆机制设计的理论研究。
衍生相关工作
基于M³Eval的评估框架,衍生出一系列探索多模态模型记忆机制的后续工作。研究者进一步分析了不同架构(如Transformer与Mamba)在记忆任务上的表现差异,并提出了基于注意力正则化或记忆回放机制的改进模型。此外,该基准促进了认知科学与人工智能的交叉研究,催生了模拟人类记忆衰减模式的新型记忆模块设计,以及针对符号记忆增强的双编码器架构。这些工作共同推动了多模态模型从感知向认知能力的跨越。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务