遇见数据集

JadeHuang/m3eval-source-memory-supplement

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

M³Eval是首个用于评估多模态模型中不同记忆维度的综合评估框架和基准。基于认知心理学设计,它通过精心构建的任务来隔离记忆的关键方面。随着多模态模型向长视频理解发展,记忆成为一个关键能力。尽管现有工作在视频数据集和基准开发上投入了大量精力,但主要关注感知和推理,没有系统评估记忆:模型保留了什麼、信息保真度如何以及记忆在干扰下的稳健性。M³Eval旨在填补这一空白。利用M³Eval,我们对代表性多模态模型进行了广泛实验,揭示了持续的弱点和独特行为。我们发现,模型在处理并行视频流时难以维持解耦表示,表现出与人类记忆截然不同的干扰模式,在空间域比时间域更可靠地定位记忆来源,并表现出有限的符号记忆。总体而言,我们的基准为未来研究提供了宝贵资源,而我们的发现强调记忆是一个基本但未被充分探索的能力,并为设计更有效的多模态模型记忆机制提供了见解。

# M3Eval 源记忆补充数据集 本公开数据集仓库复刻了`PKU-VaLuE-Lab/m3eval`中非归档文件的内容,并在原始`videos/`路径下直接添加了经过精选的源记忆视频子集。 包含的视频子集: - 46段交错式源记忆视频 - 29段分屏动态切换视频(`swap10`) - 17段分屏静态视频(`swap0`) - 总计92段上传视频 说明: - 本补充仓库有意省略了原始归档文件。 - `selected_videos.csv`与`selection_summary.json`记录了本仓库上传的精确子集信息。 --- --- pretty_name: M³Eval language: - 英语 size_categories: - 1K<n<10K task_categories: - 视觉问答 - 多项选择 tags: - 视频 - 多模态 - 基准测试 - 记忆 - 长视频 configs: - config_name: default data_files: - split: full path: viewer/full_questions.csv --- <h1 align="center">M³Eval:基于认知导向视频任务的多模态记忆评估基准</h1> <p align="center"> <a href="https://jie-1203.github.io/"><img src="https://img.shields.io/badge/Paper-arXiv-b31b1b" alt="论文-ArXiv"></a> <a href="https://pku-value-lab.github.io/m3eval-homepage/"><img src="https://img.shields.io/badge/Project-Page-blue" alt="项目主页"></a> <a href="https://huggingface.co/datasets/PKU-VaLuE-Lab/m3eval"><img src="https://img.shields.io/badge/Hugging%20Face-Dataset-yellow" alt="Hugging Face 数据集"></a> <a href="https://github.com/PKU-VaLuE-Lab/m3eval"><img src="https://img.shields.io/badge/GitHub-Code-black" alt="GitHub 代码"></a> </p> <p align="center"> <a href="https://jie-1203.github.io/">黄杰</a><sup>1,*</sup>&emsp; <a href="https://liuruixun.github.io/">刘瑞洵</a><sup>1,*</sup>&emsp; <a href="https://github.com/PKU-VaLuE-Lab/m3eval">孙思睿</a><sup>1</sup>&emsp; <a href="https://yyxxyy574.github.io/xinyiyang.github.io/">杨心怡</a><sup>1</sup>&emsp; <a href="https://yinli-vision.github.io/">李寅</a><sup>2</sup>&emsp; <a href="https://yzhu.io/">朱毅鑫</a><sup>1</sup>&emsp; <a href="https://yiwuzhong.notion.site/homepage">钟易武</a><sup>1,†</sup> </p> <p align="center"> <sup>1</sup>北京大学&emsp; <sup>2</sup>威斯康星大学麦迪逊分校 </p> <p align="center"> * 共同第一作者。&emsp;† 通讯作者。 </p> ## 动态 - **2026-05-21**:我们发布了M³Eval基准测试、代码与项目主页。 ## M³Eval 总览 <p align="center"> <img src="figures/readme/overview.png" alt="M³Eval 总览" width="95%"> </p> ### 摘要 随着多模态模型向长视频理解方向发展,记忆能力已成为一项核心能力。尽管现有研究在视频数据集与基准测试的开发上投入了大量精力,但现有工作主要聚焦于感知与推理任务,并未系统评估记忆能力:即模型能保留哪些信息、信息保留的保真度如何,以及记忆在干扰下的鲁棒性如何。 为填补这一研究空白,我们提出M³Eval——首个用于探究多模态模型不同记忆维度的综合评估框架与基准测试。本基准基于认知心理学设计,其核心特点是通过精心构建的任务隔离记忆的关键方面。借助M³Eval,我们在多款代表性多模态模型上开展了大规模实验,揭示了模型普遍存在的短板与独特的行为模式。 我们发现,模型在处理并行视频流时难以维持解耦表征,其记忆干扰模式与人类记忆中观察到的模式存在显著差异,在空间域比在时间域更可靠地锚定记忆来源,且符号记忆能力有限。总体而言,本基准为未来研究提供了宝贵的资源,而我们的研究结果凸显了记忆作为一项基础却未被充分探索的能力,并为多模态模型中更高效的记忆机制设计提供了思路。 ## 主要实验结果 ### 分散注意力任务 ![分散注意力任务实验结果](figures/readme/divided-attention-result.png) 无切换与频繁左右切换的分屏设置下,三项分散注意力任务指标的准确率(%)。 ### 记忆干扰任务 ![记忆干扰任务实验结果](figures/readme/memory-interference-result.png) 前摄干扰:第一个视频(V1)干扰对第二个视频(V2)的回忆;倒摄干扰:第二个视频(V2)干扰对第一个视频(V1)的回忆。Delta值为前摄干扰减倒摄干扰的结果。 ### 交错事件任务 ![交错事件任务实验结果](figures/readme/interleaved-events-result.png) 四项交错重构任务指标的准确率(%)。 ### N-Back任务 ![N-Back任务实验结果](figures/readme/n-back-result.png) 在场景与动作两种符号属性下,所有K与N配置的平均准确率。 ## 使用方法 ### 安装 bash git clone https://github.com/PKU-VaLuE-Lab/m3eval.git cd m3eval/lmms-eval uv pip install -e ".[all]" cd .. ### 下载数据集 本基准由现有公开基准测试组合而成,使用者需遵守各源数据集的原始许可与使用条款。 下载数据集并解压至`data/m3eval/`目录: bash huggingface-cli download PKU-VaLuE-Lab/m3eval --repo-type dataset --local-dir data/m3eval bash data/m3eval/unpack_archives.sh 解压完成后,`data/m3eval/`目录应包含以下内容: text data/m3eval/ ├── qa_root/ ├── questions/ ├── nback/ ├── viewer/ └── videos/ ├── interleaved/ ├── memory_interference/ ├── split_screen/ └── nback/ ### 评估 本基准的主要公开入口为: bash bash lmms-eval/scripts/run_m3eval_vllm.sh --model_path /path/to/your/model --task m3eval --gpus 0 --batch_size 1 如需使用多GPU数据并行评估,请运行: bash bash lmms-eval/scripts/run_m3eval_sharded_vllm.sh --model_path /path/to/your/model --task m3eval --gpus 0,1,2,3 --num_processes 4 --batch_size 1 如需快速冒烟测试: bash bash lmms-eval/scripts/run_m3eval_vllm.sh --model_path /path/to/your/model --task m3eval_memory_interference --gpus 0 --limit 1 --max_frame_num 8 可用任务名称: - `m3eval` - `m3eval_memory_interference` - `m3eval_split_screen` - `m3eval_interleaved` - `m3eval_nback` 脚本默认将输出写入`lmms-eval/output/m3eval/`目录。有关数据集布局与任务名称的详细信息,请参阅[lmms-eval/README_M3EVAL.md](lmms-eval/README_M3EVAL.md)。 若需将lmms-eval的输出转换为论文可用表格,请运行: bash python lmms-eval/scripts/aggregate_m3eval_results.py lmms-eval/output/m3eval/path/to/*_results.json ## 数据集示例 ### 分散注意力任务 ![分散注意力任务数据集示例](figures/readme/divided-attention-example.png) 同时记忆两段并排播放的视频。 <details> <summary>点击展开更多示例</summary> ### 记忆干扰任务 ![记忆干扰任务数据集示例](figures/readme/memory-interference-example.png) 顺序呈现的视频之间的干扰效应。 ### 交错事件任务 ![交错事件任务数据集示例](figures/readme/interleaved-events-example.png) 基于时间交错片段的记忆重构。 ### N-Back任务 ![N-Back任务数据集示例](figures/readme/n-back-example.png) 判断最终片段是否与提前N个位置的片段一致。 </details> ## 引用 若您在工作中使用M³Eval,请引用以下文献: bibtex @article{huang2026m3eval, title = {M3Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks}, author = {Huang, Jie and Liu, Ruixun and Sun, Sirui and Yang, Xinyi and Li, Yin and Zhu, Yixin and Zhong, Yiwu}, journal = {arXiv preprint arXiv:XXXX.XXXXX}, year = {2026} }

提供机构:
JadeHuang
搜集汇总
数据集介绍
JadeHuang/m3eval-source-memory-supplement 数据集图片
构建方式
M3Eval Source Memory Supplement 数据集作为 PKU-VaLuE-Lab/m3eval 基准测试的补充资源而构建。它镜像了原始仓库的非存档内容,并精心挑选了一个源记忆视频子集,直接放置在原有的 videos/ 路径下。该子集包含46个交错源记忆视频、29个分屏动态交换视频(swap10)以及17个分屏静态视频(swap0),共计92个上传视频。原始存档文件被有意省略,而 selected_videos.csv 和 selection_summary.json 文件则精确记录了所上传的视频子集,确保了数据集的透明性与可追溯性。
特点
该数据集最大特色在于其针对多模态模型记忆能力的系统性评估框架,其设计根植于认知心理学。通过精心构建的任务,它隔离了记忆的关键方面,如分屏设置下的注意力分配、顺序视频间的记忆干扰、时间交错事件的重构以及N-Back符号记忆。实验揭示了模型在并行视频流处理中难以维持解耦表示,其干扰模式与人类存在显著差异,且在空间域的记忆可靠性优于时间域,符号记忆能力有限,凸显了记忆作为多模态模型基础但未充分探索的能力。
使用方法
使用该数据集需先克隆 m3eval 仓库,安装依赖,并通过 huggingface-cli 下载数据集至 data/m3eval/ 目录,随后运行解压脚本。评估通过 lmms-eval 框架进行,提供了多种任务名称如 m3eval 全集、m3eval_memory_interference 等,支持单GPU或多GPU数据并行评估。用户可通过运行指定 bash 脚本启动评估,其输出结果默认写入 lmms-eval/output/m3eval/,并可通过聚合脚本转换为论文中的结果表格,操作流程清晰便捷。
背景与挑战
背景概述
在多模态模型快速演进以应对长视频理解任务的背景下,记忆能力成为衡量模型智能水平的关键维度。然而,既有视频数据集与评测基准多聚焦于感知与推理过程,系统性地评估模型记忆质量的框架尚付阙如。为填补这一空白,北京大学VaLuE实验室的Huang、Liu、Sun、Yang、Zhong等研究人员,联合威斯康星大学麦迪逊分校的Li及Yixin Zhu,于2026年推出了M³Eval——首个基于认知心理学理论构建的多模态记忆评测基准。该基准通过精细化的视频任务设计,将记忆能力分解为多个核心维度,包括分散注意力下的并行记忆、时序干扰中的记忆鲁棒性、交错事件的记忆重构以及符号化的N-Back任务,从而为评估模型的保留、保真与抗干扰能力提供了系统工具,对推动多模态智能体记忆机制的研究具有里程碑式的影响。
当前挑战
M³Eval所面对的领域挑战在于,现有模型在并行视频流处理中难以维护解耦的隐式表征,其干扰模式显著异于人类记忆的经典规律;同时,模型在时域记忆上显著劣于空域记忆,且符号化记忆能力极为有限,暴露出多模态模型在记忆这一基础能力上的结构性短板。在基准构建过程中,挑战亦十分严峻:需要从多个现有公开数据集中精心筛选并整合视频素材,以准确对应四类记忆任务的不同心理认知维度;还需在少量数据样本中精确控制变量,例如通过屏幕分割与动态交换条件实现注意力分散的模拟,以及对序列视频进行干扰配置以诱发前摄与回溯干扰效应,从而确保评估指标的认知有效性。
常用场景
经典使用场景
在认知科学与多模态人工智能的交汇领域,M³Eval数据集专为评估多模态模型在长视频理解中的记忆能力而设计。其核心使用场景包括四项认知启发的任务:分割注意力测试要求模型同时处理并记忆两个并排视频流的信息;记忆干扰任务通过先后呈现视频考察信息的前摄与倒摄干扰效应;交错事件重建任务则评估模型从时间上打乱的片段中重构完整事件序列的能力;此外,n-back任务衡量模型在符号维度上(场景与动作)的短期工作记忆维持能力。这些任务共同构建了一个系统、细粒度的记忆评测框架,推动研究者深入探明模型记忆保真度、表征独立性及抗干扰鲁棒性等关键维度。
衍生相关工作
M³Eval的发布催生了若干衍生性工作。在其基准框架下,研究者已针对分割注意力与记忆干扰机制设计出专门的对比学习策略,以增强模型对并行流表征的解耦能力;基于n-back任务的发现,有团队提出了符号记忆增强模块,将场景与动作的编码分离以提升短时记忆保持率。此外,该数据集的交错事件重建任务推动了序列对齐与时间推理模型的发展,衍生出如时间感知注意力融合网络等代表性架构。在方法层面,M³Eval的评测协议也被迁移至音频-视频联合记忆分析与机器人视觉记忆等交叉场景,成为检验多模态长期记忆能力的事实标准与重要参照系。
数据集最近研究
最新研究方向
M³Eval数据集聚焦于多模态模型在长视频理解中的记忆能力评估,其前沿研究方向包括分屏场景下的多源记忆干扰、时序交叠事件重建以及符号化工作记忆的神经符号融合机制。该基准基于认知心理学理论,系统揭示了当前视觉语言模型在保持视频信息忠实表征时面临的困境:模型难以解耦并行视频流中的混合表征,在记忆干扰模式上表现出与人类显著差异,且时空记忆溯源能力呈现空间域优于时间域的显著偏好。这一成果不仅为多模态长视频理解中的记忆瓶颈提供了标准化评估工具,更推动了面向持久记忆架构、干扰鲁棒表征及符号推理增强的新范式,对构建具备类人记忆稳健性的下一代多模态系统具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务