WorldMemArena
收藏数据链接:
官方服务:
资源简介:
WorldMemArena是一个用于评估多模态代理记忆的数据集,通过动作-世界交互来测试终身记忆系统。它支持19个基线方法,涵盖检索增强内存、基于嵌入的内存、长上下文视觉语言模型、终端代理框架和基础模型回答范式。数据集包含完整基准测试和用于快速迭代的平衡子集两个评估分割。
WorldMemArena is a dataset for evaluating multimodal agent memory, which tests lifelong memory systems via action-world interactions. It supports 19 baseline methods, encompassing retrieval-augmented memory, embedding-based memory, long-context vision-language models, terminal agent frameworks, and foundation model answering paradigms. The dataset includes two evaluation splits: the full benchmark and a balanced subset for rapid iteration.
创建时间:
2026-05-13
原始信息汇总
WorldMemArena 数据集总结
WorldMemArena 是一个用于评估多模态智能体终身记忆系统的统一基准框架,数据集托管于 Hugging Face。
数据集定位
- 核心目标:通过“动作-世界交互”任务,衡量多模态智能体在各种场景下利用记忆系统进行长期信息存储、检索和推理的能力。
- 评估维度:支持对19种基线方法进行基准测试,涵盖多种记忆架构范式。
数据集规模与划分
- 总样本数:完整基准包含461个样本(
all划分)。 - 快速迭代子集:提供一个包含150个样本的平衡子集(
small划分),用于快速原型验证和实验迭代。 - 数据下载:数据量约10 GB。
核心任务与评估指标
记忆基线在四大维度上接受评估:
- 记忆提取:衡量存储记忆点相对于黄金标准的精度/召回率。
- 记忆新鲜度:考察系统跟踪和更新信息的能力。
- 干扰抑制:评估对误导性或矛盾信息的抵抗能力。
- 问答能力:在检查点(Checkpoint)上进行的问答正确性评估,包括检索覆盖率、F1分数、BLEU-1分数,以及幻觉/遗漏率。
对于无显式记忆模块的纯回答型基线(如BaseModel-*),仅报告问答标签(正确/幻觉/遗漏)及相关指标。
支持的基线方法
框架支持三种主要类型的基线,共19种:
| 基线类型 | 数量 | 描述与示例 |
|---|---|---|
| 记忆基线 (Memory Baselines) | 11 | 采用不同的检索增强记忆、嵌入记忆等方法,如A-Mem、SimpleMem、ViLoMem、MIRIX、Qwen3-VL-Embedding-8B等。 |
| 工具基線 (Harness Baselines) | 3 | 基于终端智能体框架,如OpenClaw-GPT、Harness-OpenClaw-DeepSeek、Harness-Codex。 |
| 基础模型基线 (BaseModel Baselines) | 5 | 直接使用长上下文VLM进行回答,无记忆与检索模块,作为前沿LLM的参考基线,如BaseModel-qwen、BaseModel-openai等。 |
使用方式
- 环境配置:通过
.env文件统一管理API密钥、模型选择、vLLM嵌入服务器等配置。 - 快速启动:提供命令行接口
eval_framework.cli,支持单个基线、批量基线或工具基线的运行。 - 结果复现:提供脚本 (
scripts/run_worldmemarena.sh) 实现论文结果的端到端复现。 - 输出结构:结果输出目录包含
aggregate_metrics.json(汇总指标)、pipeline_qa.jsonl(管道输出)等文件,结构清晰。
相关资源
- 论文地址:http://arxiv.org/abs/2605.29341
- 项目网站:https://worldmemarena-mem.github.io/
- 数据集页面:https://huggingface.co/datasets/LCZZZZ/WorldMemArena
- 代码仓库:https://github.com/UCSB-AI/WorldMemArena
- 许可协议:MIT License
搜集汇总
数据集介绍

构建方式
WorldMemArena数据集旨在评估多模态智能体在长期交互中的记忆能力。其构建基于动作-世界交互范式,模拟智能体在动态环境中执行任务并积累经验的过程。数据集通过精心设计的交互场景,采集智能体在多个时间尺度上的输入与反馈,形成包含多模态信息(如视觉、文本)的序列化数据。每个样本对应一个完整的交互会话,其中设置了多个检查点用于评估智能体对过往信息的记忆与运用。数据集的构建注重真实性与挑战性,通过引入干扰信息、更新指令等方式,测试记忆系统的鲁棒性与适应性。
特点
WorldMemArena的核心特点在于其统一且全面的评估框架,支持多达19种基线方法,涵盖检索增强记忆、嵌入记忆、长上下文视觉语言模型等多种范式。数据集提供全量(461样本)和平衡子集(150样本)两种划分,便于快速迭代与深度评估。评价维度丰富,不仅包括问答准确性,还涉及记忆提取精度、信息更新跟踪能力及干扰拒斥表现。此外,数据集支持多种运行模式,可灵活切换模型后端,并提供了完整的评估指标体系,如F1分数、召回率、幻觉率等,确保结果的可比性与可解释性。
使用方法
使用者可通过简单的命令行接口快速上手。首先从Hugging Face下载约10GB的数据集,然后配置环境变量以指定模型密钥和端点。支持直接运行单基线测试,也可批量执行所有记忆基线。框架内置了详细的配置系统,可通过.env文件统一管理模型、嵌入服务及评估参数。对于需要GPU支持的基线,提供了便捷的脚本启动向量化嵌入服务。还支持仅评估模式,可复用已有的推理结果进行重新打分。所有实验结果以结构化的JSON格式输出,便于后续分析与可视化。
背景与挑战
背景概述
随着多模态大语言模型和具身智能体的快速发展,如何让智能体具备持久、可靠且抗干扰的记忆能力,已成为推动通用人工智能走向实际应用的关键瓶颈。WorldMemArena由Eric AI Lab团队于2026年提出,由Chengzhi Liu、Yuzhe Yang、Xin Eric Wang等研究者共同构建。该数据集聚焦于评估多模态智能体在长期交互中的记忆系统表现,其核心研究问题在于:智能体能否在复杂动态环境中高效提取、更新并抵抗信息干扰,从而支撑准确的问题解答。凭借涵盖19种基线方法的统一评估框架,WorldMemArena为记忆增强智能体的研究提供了标准化的测试场景,显著推动了该领域从定性演示向可量化、可复现的评估范式转型。
当前挑战
WorldMemArena所解决的领域问题在于多模态智能体记忆系统的系统性评估缺失:现有基准大多仅关注单次交互或短期记忆,忽略了长期交互中的记忆提取、信息更新与干扰抑制等核心挑战。在构建过程中,团队面临数据真实性与评估公平性的双重难题——需要设计兼具可扩展性与细粒度标注的动态交互场景,以模拟真实世界的信息流变。此外,如何统一涵盖检索增强、嵌入记忆、长上下文视觉语言模型及终端智能体等多种记忆范式,并确保评价指标(如记忆召回率、新鲜度、抗干扰能力)在不同基线间具有可比性,也对数据构建与评估流程提出了极高要求。
常用场景
经典使用场景
WorldMemArena数据集专为评估多模态智能体在开放世界中的终身记忆能力而设计,其最经典的使用场景是构建一个虚拟的‘动作-世界交互’环境,让智能体在与多样化场景的持续交互中展现记忆存储、更新与抗干扰能力。研究者通过部署该数据集提供的461个精心编排的评估样本,可以系统性地测试智能体在复杂任务流程中的记忆提取精度、信息时效性管理以及面对误导性输入时的鲁棒性表现。该框架支持从检索增强记忆、嵌入记忆到长上下文视觉语言模型的19种基线方法,为记忆系统提供了标准化的竞技场,从而推动多模态AI从静态推理向动态、连续学习范式的深刻演进。
实际应用
在真实世界的应用蓝图中,WorldMemArena为构建具备持久记忆能力的数字助手与机器人系统提供了关键测试平台。例如,家庭服务机器人需在日复一日的互动中记住用户的物品摆放习惯与日程变更,而该数据集的‘信息时效性管理’与‘干扰拒绝’评估维度恰能衡量智能体能否精准更新存储记忆、摒弃过时或错误的信息。在虚拟助手领域,企业级对话系统常面临跨会话的客户偏好追踪任务,WorldMemArena的终身记忆基准可直接用于验证模型在长期交互中的上下文连贯性与知识同步能力。此外,该数据集还可应用于自动驾驶场景中的环境记忆建模,使车辆在多次行驶后能更智能地识别动态路况变化,从而提升安全决策的可靠性。
衍生相关工作
WorldMemArena的问世已催生出一系列富有启发性的衍生研究工作,尤其是在记忆架构设计与评估方法论层面。围绕该基准,研究者开发了多种创新性记忆机制,如ViLoMem的双流逻辑-视觉融合记忆模型与MIRIX基于大语言模型驱动的智能体记忆系统,这些工作均在WorldMemArena的标准化评测框架下验证了其优越性。此外,UniversalRAGMemory等基于多模态广义嵌入的检索增强方法,以及AUGUSTUSMemory这类结合大型视觉语言模型嵌入的方案,均展示了如何通过混合记忆表征提升终身学习效率。在评测维度上,该数据集也启发了后续关于记忆新鲜度与干扰抑制的专项研究,推动了多模态智能体从单一的记忆存储迈向综合的记忆认知能力评估新范式。
以上内容由遇见数据集搜集并总结生成



