EMemBench
收藏资源简介:
EMemBench是由南洋理工大学、复旦大学和上海人工智能实验室联合开发的交互式基准测试框架,旨在评估智能体在文本和视觉游戏环境中的长期记忆能力。该数据集通过程序化生成问题,覆盖单跳/多跳回忆、归纳、时空推理等七类记忆技能,并利用游戏底层信号自动计算可验证的答案真值。其核心创新在于将智能体的交互轨迹转化为个性化评估实例,支持多模态环境下的可扩展、自动化测试。该基准主要应用于增强语言模型和视觉语言模型的动态记忆能力研究,为解决智能体在开放环境中持续学习与决策的挑战提供标准化评估工具。
EMemBench is an interactive benchmark framework jointly developed by Nanyang Technological University, Fudan University, and Shanghai AI Laboratory, which aims to evaluate the long-term memory capabilities of AI Agents in text and visual game environments. This framework generates questions programmatically, covering seven categories of memory skills including single-hop/multi-hop recall, induction, spatiotemporal reasoning, and more. It automatically calculates verifiable ground-truth answers using the underlying game signals. Its core innovation lies in converting the interaction trajectories of AI Agents into personalized evaluation instances, supporting scalable and automated testing in multimodal environments. This benchmark is primarily applied to research on enhancing the dynamic memory capabilities of Large Language Models (LLMs) and vision-language models, providing standardized evaluation tools to address the challenges of continuous learning and decision-making for AI Agents in open environments.
EMemBench 数据集概述
数据集基本信息
- 数据集名称:EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents
- 核心性质:一个用于评估交互式智能体中情景(基于经验的)记忆的程序化基准框架。
- 关键特征:该框架并非一个固定的静态数据集,而是一个基准生成器 + 评估工具。其工作流程为:运行智能体 → 记录交互轨迹 → 基于程序化生成的真实答案生成问答对 → 回答并评分。
核心方法与设计
- 轨迹条件化问答生成:问题来源于智能体自身的交互轨迹。
- 程序化、可验证的真实答案:答案根据游戏信号/结构化日志计算得出。
- 查询范围控制:模板可以选择性地将证据选择和答案计算限制在前缀窗口内,以减少因可变轨迹长度带来的混淆。
支持的环境与内容
- 文本环境:Jericho(纯文本互动小说)。
- 视觉环境:Crafter(视觉、部分可观察的生存与制作游戏)。
数据集结构与输出
文本游戏(Jericho)
- 游戏环境:
text_game/game_envs/(需自行放置ROM文件)。 - 日志:
logs/<game>/..._logs.jsonl - 生成的问答对:
generated_qa/<game>/<run_name>/DIF_*/(DIF_-1、DIF_50等文件夹对应不同的查询范围控制设置)。 - 评估结果:
eval/<game>/<run_name>/...
视觉游戏(Crafter)
- 日志:
log/seed{SEED}/{RUN_NAME}/(包含logs.jsonl、地图文件和帧图像)。 - 生成的问答对:
generated_qa/seed{SEED}/{RUN_NAME}/(包含qa_context.json和DIF_*/qa.jsonl)。 - 评估结果:
eval/seed{SEED}/{RUN_NAME}/...
使用与许可
- 主要用途:研究使用。
- 代码许可:Apache 2.0。
- 数据许可:CC BY-NC 4.0。
- 使用要求:应遵守OpenAI的使用条款政策(https://openai.com/policies/terms-of-use)。
引用信息
- 论文标题:EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents
- 作者:Xinze Li, Ziyue Zhu, Siyuan Liu, Yubo Ma, Yuhang Zang, Yixin Cao, Aixin Sun
- 年份:2026
- arXiv:https://arxiv.org/abs/2601.16690
上游依赖环境
- Jericho:https://github.com/microsoft/jericho
- Crafter:https://github.com/danijar/crafter

- 1EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents南洋理工大学; 复旦大学; 上海人工智能实验室 · 2026年



