遇见数据集

MemoraiBench

收藏
github2026-08-12 更新2026-08-13 收录
官方服务:

资源简介:

MemoraiBench是一个用于评估通用代理中长期记忆系统的基准数据集骨架,专注于记忆系统是否正确构建、更新、拒绝和检索持久记忆。

MemoraiBench is a benchmark dataset skeleton for evaluating long-term memory systems in general-purpose AI agents, focusing on whether the memory system can correctly construct, update, reject and retrieve persistent memories.

创建时间:
2026-08-06
原始信息汇总

MemoraiBench 数据集概述

MemoraiBench 是一个用于评估通用智能体长期记忆系统的基准数据集骨架,核心目标是检验智能体记忆系统能否从运行时形态的输入中正确构建、更新、拒绝和检索持久记忆。

核心设计

数据集围绕以下核心接口进行设计:

python extractor.extract(messages, working_memory=working_memory)

首个发布计划以“检索优先”为原则:先用查询级黄金记忆初始化记忆系统,再运行每个查询,评估正确记忆是否被检索到。

数据集维度

剧集(Episode)轴向:

轴向 取值
长度 short(短)、medium(中)、long(长)
领域 programming(编程)、office_daily(办公日常)
子领域 code_debugsqlweb_automationwordchat_preference

计划中的 v0.1 分布:

文件夹 剧集数
short/programming 20
medium/programming 30
long/programming 35
short/office_daily 10
medium/office_daily 20
long/office_daily 15

查询能力类型

类型 含义
recall 直接事实、时间、顺序、命令或决策的回忆
causal_dependency 检索解释原因、前提或依赖关系所需的证据
state_updating 最新状态检索,同时避免过时或被取代的记忆
state_abstraction 检索从长上下文中抽象出的高层规则、偏好或教训
safety 检测秘密、原始轨迹、瞬态状态或噪声日志未被记忆

目标记忆类型

数据集针对以下记忆类型进行评估:

text preference(偏好)、project(项目)、episodic(情景)、reflective(反思)、tool(工具)、knowledge(知识)、general(通用)

剧集结构

每个剧集包含元数据、运行时输入和查询级黄金记忆预期,示例结构如下:

json { "episode_id": "prog_medium_memory_extract_001", "version": "0.1", "length_bucket": "medium", "domain": "programming", "subdomain": "memory_extraction", "success": true, "num_turns": 0, "total_tokens": 0, "messages": [], "working_memory": {}, "queries": [] }

更详细的模式说明可参考 SCHEMA.mddata/v0.1/templates/episode.template.json

当前仓库状态

该仓库目前包含数据集框架(scaffold)、模式文档、验证脚本和指标辅助工具。实际的 v0.1 剧集数据已规划但尚未包含在仓库中。

搜集汇总
数据集介绍
MemoraiBench 数据集图片
构建方式
MemoraiBench是一个面向通用代理长期记忆系统评估的基准数据集骨架,其构建围绕运行时输入的记忆提取函数展开,聚焦于记忆的正确构建、更新、拒绝与检索。数据集通过多维轴设计构建,包括情节长度(短、中、长)、领域(编程、办公日常)及子领域(如代码调试、SQL、网页自动化等),规划了共130个情节的分布。每个情节以JSON格式封装,包含元数据、运行时消息与查询级别的黄金记忆期望,并依据查询能力类型(如回忆、因果依赖、状态更新等)及目标记忆类型(如偏好、项目、情景等)进行标注,为系统化评估提供结构化框架。
特点
该数据集的核心特点在于其检索优先的评估策略,即初始化包含查询级黄金记忆的记忆系统后,运行每个查询并评估记忆检索的准确性。其维度划分细致,既涵盖情节长度与领域多样性,又通过五种查询能力类型(如回忆、因果依赖、状态更新、状态抽象、安全性)全面检验记忆系统的持久性构建与动态更新能力。此外,目标记忆类型的多元性(涵盖偏好、项目、情景、反思、工具、知识、通用)确保了评估的全面性,而当前版本虽仅含数据框架,但为后续实际情节的生成奠定了坚实基础。
使用方法
使用者需依据提供的模式文档(SCHEMA.md)和模板文件,填充v0.1版本的情节数据。具体操作包括:构建或配置记忆提取器,使其匹配extractor.extract(messages, working_memory=working_memory)接口;随后,针对每个情节的查询,初始化记忆系统并注入黄金记忆,运行查询后利用内置的验证脚本和指标辅助工具评估检索结果与黄金记忆的匹配度。该数据集支持多领域、多长度的定制化评估,便于研究者深入分析记忆系统在复杂运行时输入下的表现,从而推动通用代理记忆技术的进步。
背景与挑战
背景概述
MemoraiBench数据集由研究团队于2023年发布,旨在评估通用型AI代理中长期记忆系统的性能。该数据集聚焦于记忆系统的构建、更新、拒绝与检索能力,开创性地提出基于查询级别的记忆检索评估范式。MemoraiBench覆盖编程与办公日常两大领域,包含短、中、长三种长度区间,并设计了包括回忆、因果依赖、状态更新、状态抽象及安全在内的五种查询能力类型,为智能代理的记忆机制研究提供了标准化评估框架,对推动认知架构与持续学习领域的发展具有重要意义。
当前挑战
MemoraiBench面临的挑战在于多维度评估记忆系统在动态环境下的鲁棒性。具体而言,如何确保记忆系统准确区分持久记忆与瞬态信息,避免陈旧或冲突记忆的干扰;如何在不同长度和领域的复杂场景中实现高效、准确的记忆检索;以及如何评估系统对敏感信息的保护能力,防止秘密或噪声数据被错误记忆。构建过程中,数据集设计需平衡场景多样性与标注一致性,确保查询标注准确反映真实记忆需求,同时保持可扩展性以支持未来版本迭代。
常用场景
经典使用场景
MemoraiBench作为评估通用智能体长期记忆系统的基准数据集,其经典使用场景在于系统化地检验记忆系统从运行时输入中构建、更新、拒绝及检索持久记忆的能力。研究者可通过该数据集在多种复杂度轴(如短、中、长会话)及多领域(如编程、办公日常)下,对记忆系统的性能进行标准化评测,尤其是在查询级金标准记忆的初始化与检索任务中,用以量化系统在 recall、causal_dependency、state_updating 等能力维度上的表现。
衍生相关工作
该数据集预期将衍生一系列经典工作,包括记忆提取器的鲁棒性比较研究、超长期记忆场景下的遗忘机制建模,以及跨领域记忆迁移学习的探索。同时,基于其能力轴设计,可能催生新的记忆评测指标(如状态更新准确率、安全记忆抑制率)与基准提升方法,如动态记忆增强策略。参照其他领域基准的演进模式,MemoraiBench 或将引发对记忆系统可解释性、隐私保护及持续学习等方向的拓展研究,形成丰富的学术分支。
数据集最近研究
最新研究方向
MemoraiBench作为面向通用智能体长期记忆系统的评估基准,其最新研究方向聚焦于记忆的构建、更新、拒绝与检索四大核心能力,尤其强调从运行时交互数据中提取持久记忆的可靠性。该基准通过多维度设定(如场景长度、领域和子领域)模拟真实应用,覆盖编程与办公日常等典型情境,并针对回忆、因果依赖、状态更新、状态抽象及安全隐私等关键能力设计查询任务。其前沿意义在于推动智能体在复杂长上下文中的记忆管理走向精细化与可量化评估,为构建具备持续学习与情境感知能力的自主系统奠定基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务