Memoria-Flash, Memoria-Bench-Flash-Corpus
收藏数据链接:
官方服务:
资源简介:
Memoria-Flash是一个用于评估长视野自主代理中记忆能力的Flash QA数据集;Memoria-Bench-Flash-Corpus是用于内存数据评估的Flash版本伴随语料库。
Memoria-Flash is a Flash QA dataset for evaluating memory capabilities in long-horizon autonomous agents; Memoria-Bench-Flash-Corpus is the accompanying Flash-version corpus for memory data evaluation.
创建时间:
2026-05-20
原始信息汇总
Memoria-Bench 数据集详情
数据集概述
Memoria-Bench 是一个用于评估长时域自主智能体(Long-Horizon Autonomous Agents)记忆能力的综合性基准测试,已被 ICML 2026 接收。该基准围绕三大领域构建:深度研究(deep research)、代码智能体(code agents) 和表格任务(tabular tasks),主要评估三种记忆类型:情节记忆(episodic memory)、语义记忆(semantic memory)和程序性记忆(procedural memory)。
核心数据集
1. Memoria-Flash QA 数据集
- 地址:https://huggingface.co/datasets/iMemory/Memoria-Bench-Flash
- 功能:用于评估长时域自主智能体记忆能力的 Flash QA 数据集
- 数据集拆分(splits):包含
code、deepresearch和science_dev三个部分
2. Memoria-Bench-Flash-Corpus 语料数据集
- 地址:https://huggingface.co/datasets/iMemory/Memoria-Bench-Flash-Corpus
- 功能:用于记忆数据评估的 Flash 版本配套语料库
- 数据集拆分(splits):包含
corpus和longterm_context两个部分
评估场景与指标
长期记忆(Long-term Memory)
- episodic_state_tracking:情节状态追踪
- semantic_state_tracking:语义状态追踪
- procedural_aggregation:程序性聚合
工作记忆(Working Memory)
- episodic_multi_hop:情节多跳推理
- semantic_state_tracking:语义状态追踪
- procedural_aggregation:程序性聚合
评估模式
1. 智能体模式(agent)
- 基于检索增强的智能体评估
- 示例方法:BM25
2. 长上下文模式(long_context)
- 纯 API 评估
- 将完整上下文传递给被测试模型
关键技术特性
- 自动数据集准备:自动从 Hugging Face 读取 QA 数据集和配套语料库
- API 评估:直接评估兼容 OpenAI 的 API,无需本地推理服务
- 分离判断流水线:被测试模型与评判模型可独立配置
- 长输入韧性处理:支持字符级别的截断和重试机制
内容构建机制
- context_mode="chunk_ids":从语料库拆分(corpus)中拼接上下文
- context_mode="time_truncated_history":从长期上下文拆分(longterm_context)中构建上下文
许可协议
本项目采用 MIT 许可协议。
搜集汇总
数据集介绍

构建方式
Memoria-Flash与Memoria-Bench-Flash-Corpus的构建过程,紧密围绕长时程自主智能体的记忆评估需求展开。该数据集以两大核心组件协同运作:其一是问答数据集(QA Dataset),涵盖代码、深度研究与科学开发三大领域;其二是配套语料库(Companion Corpus),包含语料与长期上下文两个分割。构建时,通过自动读取Hugging Face上的数据资源,利用上下文模式与上下文键值对自动生成评估上下文,并进一步产出面向代码智能体与Flash模式的路径配置文件。此种设计使得数据准备流程全自动化,极大降低了人工干预的需求。
特点
该数据集最显著的特征在于其多维度的记忆评估框架,覆盖情景记忆、语义记忆与程序记忆三种类型,在尖端研究、代码智能体与表格任务三大领域中进行深度评测。引入的双重评估模式——检索增强智能体模式与纯API长上下文模式——赋予了评估策略的弹性与可扩展性。尤为重要的是,测试模型与评判模型的API配置被完全解耦,使用者可独立调整与探索不同模型组合在记忆任务上的表现。此外,系统在长输入场景下展现出强大韧性,具备智能截断与重试机制,确保评估流程的稳定性与鲁棒性。
使用方法
使用者需首先利用Hugging Face命令行工具将Memoria-Flash问答数据集及配套语料库下载至本地指定目录,并激活Python 3.11环境安装所需依赖包。随后,通过配置.env文件中的OpenAI兼容API终结点与密钥,分别指定待测模型与评判模型。评估启动时,通过运行专门的脚本并指定数据目录、数据分割、模型名称与智能体方法(如BM25或long_context),即可触发评估流水线。该流水线能够自动完成数据准备、生成评估结果,并可选地进行评判与汇总,最终输出结构化的评估文件与摘要报告。
背景与挑战
背景概述
Memoria-Bench是ICML 2026录用的成果,由iMemory团队王秋锋等人主导创建,旨在解决长时域自主智能体记忆能力评估的缺失问题。该基准涵盖深度研究、代码智能体和表格任务三大领域,通过构建Memoria-Flash问答数据集与Memoria-Bench-Flash-Corpus语料库,系统性地评估情景记忆、语义记忆和程序性记忆。其发布标志着智能体记忆评估从碎片化测试迈向标准化、多维度的全新阶段,对推动自主智能体在现实复杂场景中的可靠部署具有里程碑意义,为后续可解释性与鲁棒性研究奠定了可复现的评测基础。
当前挑战
该基准面临的挑战首要在于领域问题层面:自主智能体必须在长时间跨度内融合不同类型记忆以完成复杂任务,现有基准多聚焦短时工作记忆,难以刻画情景与程序性记忆的动态交互与遗忘规律。构建过程中,语料库需覆盖多领域长文本并确保时间戳对齐,设计QA对时需精准分离三种记忆类型,避免信息泄漏。此外,长输入引发的API长度限制与模型幻觉问题、检索增强与纯长上下文两种评估模式间的标准化对比,以及裁判模型自身偏差对自动化评分的干扰,均为技术实现上的严峻考验。
常用场景
经典使用场景
在自主智能体与长时任务规划的交叉领域,Memoria-Flash及Memoria-Bench-Flash-Corpus被广泛用于评估大型语言模型在长时间跨度的自主任务中所展现的记忆能力。该数据集围绕深度研究、代码智能体与表格任务三大典型领域构建,涵盖情景记忆、语义记忆与程序性记忆的测试。研究者通常采用两种评价模式:一是基于BM25的检索增强智能体评估,模拟智能体在实际任务中回忆与利用历史信息;二是长上下文纯API评估,考察模型在完整对话历史或庞大语料上的理解与推理能力。这些测试场景为衡量模型在长时交互中的记忆持久性与准确性提供了标准化的试验平台。
衍生相关工作
Memoria-Bench的提出催生了一系列后续研究工作。一方面,研究者基于该基准的数据拆分与评价框架,专门探索了检索增强方法(如混合检索策略与稀疏-稠密协同召回)对智能体长时记忆性能的提升。另一方面,部分工作专注于提升模型对超长上下文的鲁棒性,通过动态截断与重要性采样策略应对输入长度限制。此外,该基准也被用作检验新型记忆管理架构(如层次化记忆池与记忆压缩网络)效果的权威工具,并激发了多项关于智能体元认知能力(即何时回忆与遗忘)的探索性研究,推动了长时自主智能体从单一记忆模型向记忆调控机制的演进。
数据集最近研究
最新研究方向
面向长时域自主智能体的记忆能力评估正在成为大模型研究的前沿焦点。Memoria-Bench以ICML 2026收录论文形式,系统构建了涵盖深度研究、代码代理与表格任务三大领域的记忆评测体系,开创性地将情景记忆、语义记忆与程序性记忆的量化引入长周期自主工作流。该基准配套发布了Memoria-Flash问答数据集与Flash语料库,通过检索增强与长上下文两种评估模式,实现对智能体记忆能力的细粒度诊断。值得注意的是,其分离的待测模型与评判模型架构,为独立研究不同网络架构的记忆表征与推理能力提供了可复现的实验范式,对理解自主智能体的认知边界与记忆压缩机制具有里程碑意义。
以上内容由遇见数据集搜集并总结生成




