JadeHuang/m3eval-source-memory-supplement
收藏资源简介:
M³Eval是首个用于评估多模态模型中不同记忆维度的综合评估框架和基准。基于认知心理学设计,它通过精心构建的任务来隔离记忆的关键方面。随着多模态模型向长视频理解发展,记忆成为一个关键能力。尽管现有工作在视频数据集和基准开发上投入了大量精力,但主要关注感知和推理,没有系统评估记忆:模型保留了什麼、信息保真度如何以及记忆在干扰下的稳健性。M³Eval旨在填补这一空白。利用M³Eval,我们对代表性多模态模型进行了广泛实验,揭示了持续的弱点和独特行为。我们发现,模型在处理并行视频流时难以维持解耦表示,表现出与人类记忆截然不同的干扰模式,在空间域比时间域更可靠地定位记忆来源,并表现出有限的符号记忆。总体而言,我们的基准为未来研究提供了宝贵资源,而我们的发现强调记忆是一个基本但未被充分探索的能力,并为设计更有效的多模态模型记忆机制提供了见解。
# M3Eval 源记忆补充数据集 本公开数据集仓库复刻了`PKU-VaLuE-Lab/m3eval`中非归档文件的内容,并在原始`videos/`路径下直接添加了经过精选的源记忆视频子集。 包含的视频子集: - 46段交错式源记忆视频 - 29段分屏动态切换视频(`swap10`) - 17段分屏静态视频(`swap0`) - 总计92段上传视频 说明: - 本补充仓库有意省略了原始归档文件。 - `selected_videos.csv`与`selection_summary.json`记录了本仓库上传的精确子集信息。 --- --- pretty_name: M³Eval language: - 英语 size_categories: - 1K<n<10K task_categories: - 视觉问答 - 多项选择 tags: - 视频 - 多模态 - 基准测试 - 记忆 - 长视频 configs: - config_name: default data_files: - split: full path: viewer/full_questions.csv --- <h1 align="center">M³Eval:基于认知导向视频任务的多模态记忆评估基准</h1> <p align="center"> <a href="https://jie-1203.github.io/"><img src="https://img.shields.io/badge/Paper-arXiv-b31b1b" alt="论文-ArXiv"></a> <a href="https://pku-value-lab.github.io/m3eval-homepage/"><img src="https://img.shields.io/badge/Project-Page-blue" alt="项目主页"></a> <a href="https://huggingface.co/datasets/PKU-VaLuE-Lab/m3eval"><img src="https://img.shields.io/badge/Hugging%20Face-Dataset-yellow" alt="Hugging Face 数据集"></a> <a href="https://github.com/PKU-VaLuE-Lab/m3eval"><img src="https://img.shields.io/badge/GitHub-Code-black" alt="GitHub 代码"></a> </p> <p align="center"> <a href="https://jie-1203.github.io/">黄杰</a><sup>1,*</sup>  <a href="https://liuruixun.github.io/">刘瑞洵</a><sup>1,*</sup>  <a href="https://github.com/PKU-VaLuE-Lab/m3eval">孙思睿</a><sup>1</sup>  <a href="https://yyxxyy574.github.io/xinyiyang.github.io/">杨心怡</a><sup>1</sup>  <a href="https://yinli-vision.github.io/">李寅</a><sup>2</sup>  <a href="https://yzhu.io/">朱毅鑫</a><sup>1</sup>  <a href="https://yiwuzhong.notion.site/homepage">钟易武</a><sup>1,†</sup> </p> <p align="center"> <sup>1</sup>北京大学  <sup>2</sup>威斯康星大学麦迪逊分校 </p> <p align="center"> * 共同第一作者。 † 通讯作者。 </p> ## 动态 - **2026-05-21**:我们发布了M³Eval基准测试、代码与项目主页。 ## M³Eval 总览 <p align="center"> <img src="figures/readme/overview.png" alt="M³Eval 总览" width="95%"> </p> ### 摘要 随着多模态模型向长视频理解方向发展,记忆能力已成为一项核心能力。尽管现有研究在视频数据集与基准测试的开发上投入了大量精力,但现有工作主要聚焦于感知与推理任务,并未系统评估记忆能力:即模型能保留哪些信息、信息保留的保真度如何,以及记忆在干扰下的鲁棒性如何。 为填补这一研究空白,我们提出M³Eval——首个用于探究多模态模型不同记忆维度的综合评估框架与基准测试。本基准基于认知心理学设计,其核心特点是通过精心构建的任务隔离记忆的关键方面。借助M³Eval,我们在多款代表性多模态模型上开展了大规模实验,揭示了模型普遍存在的短板与独特的行为模式。 我们发现,模型在处理并行视频流时难以维持解耦表征,其记忆干扰模式与人类记忆中观察到的模式存在显著差异,在空间域比在时间域更可靠地锚定记忆来源,且符号记忆能力有限。总体而言,本基准为未来研究提供了宝贵的资源,而我们的研究结果凸显了记忆作为一项基础却未被充分探索的能力,并为多模态模型中更高效的记忆机制设计提供了思路。 ## 主要实验结果 ### 分散注意力任务  无切换与频繁左右切换的分屏设置下,三项分散注意力任务指标的准确率(%)。 ### 记忆干扰任务  前摄干扰:第一个视频(V1)干扰对第二个视频(V2)的回忆;倒摄干扰:第二个视频(V2)干扰对第一个视频(V1)的回忆。Delta值为前摄干扰减倒摄干扰的结果。 ### 交错事件任务  四项交错重构任务指标的准确率(%)。 ### N-Back任务  在场景与动作两种符号属性下,所有K与N配置的平均准确率。 ## 使用方法 ### 安装 bash git clone https://github.com/PKU-VaLuE-Lab/m3eval.git cd m3eval/lmms-eval uv pip install -e ".[all]" cd .. ### 下载数据集 本基准由现有公开基准测试组合而成,使用者需遵守各源数据集的原始许可与使用条款。 下载数据集并解压至`data/m3eval/`目录: bash huggingface-cli download PKU-VaLuE-Lab/m3eval --repo-type dataset --local-dir data/m3eval bash data/m3eval/unpack_archives.sh 解压完成后,`data/m3eval/`目录应包含以下内容: text data/m3eval/ ├── qa_root/ ├── questions/ ├── nback/ ├── viewer/ └── videos/ ├── interleaved/ ├── memory_interference/ ├── split_screen/ └── nback/ ### 评估 本基准的主要公开入口为: bash bash lmms-eval/scripts/run_m3eval_vllm.sh --model_path /path/to/your/model --task m3eval --gpus 0 --batch_size 1 如需使用多GPU数据并行评估,请运行: bash bash lmms-eval/scripts/run_m3eval_sharded_vllm.sh --model_path /path/to/your/model --task m3eval --gpus 0,1,2,3 --num_processes 4 --batch_size 1 如需快速冒烟测试: bash bash lmms-eval/scripts/run_m3eval_vllm.sh --model_path /path/to/your/model --task m3eval_memory_interference --gpus 0 --limit 1 --max_frame_num 8 可用任务名称: - `m3eval` - `m3eval_memory_interference` - `m3eval_split_screen` - `m3eval_interleaved` - `m3eval_nback` 脚本默认将输出写入`lmms-eval/output/m3eval/`目录。有关数据集布局与任务名称的详细信息,请参阅[lmms-eval/README_M3EVAL.md](lmms-eval/README_M3EVAL.md)。 若需将lmms-eval的输出转换为论文可用表格,请运行: bash python lmms-eval/scripts/aggregate_m3eval_results.py lmms-eval/output/m3eval/path/to/*_results.json ## 数据集示例 ### 分散注意力任务  同时记忆两段并排播放的视频。 <details> <summary>点击展开更多示例</summary> ### 记忆干扰任务  顺序呈现的视频之间的干扰效应。 ### 交错事件任务  基于时间交错片段的记忆重构。 ### N-Back任务  判断最终片段是否与提前N个位置的片段一致。 </details> ## 引用 若您在工作中使用M³Eval,请引用以下文献: bibtex @article{huang2026m3eval, title = {M3Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks}, author = {Huang, Jie and Liu, Ruixun and Sun, Sirui and Yang, Xinyi and Li, Yin and Zhu, Yixin and Zhong, Yiwu}, journal = {arXiv preprint arXiv:XXXX.XXXXX}, year = {2026} }




