MemoraiBench
收藏资源简介:
MemoraiBench是一个用于评估通用代理中长期记忆系统的基准数据集骨架,专注于记忆系统是否正确构建、更新、拒绝和检索持久记忆。
MemoraiBench is a benchmark dataset skeleton for evaluating long-term memory systems in general-purpose AI agents, focusing on whether the memory system can correctly construct, update, reject and retrieve persistent memories.
MemoraiBench 数据集概述
MemoraiBench 是一个用于评估通用智能体长期记忆系统的基准数据集骨架,核心目标是检验智能体记忆系统能否从运行时形态的输入中正确构建、更新、拒绝和检索持久记忆。
核心设计
数据集围绕以下核心接口进行设计:
python extractor.extract(messages, working_memory=working_memory)
首个发布计划以“检索优先”为原则:先用查询级黄金记忆初始化记忆系统,再运行每个查询,评估正确记忆是否被检索到。
数据集维度
剧集(Episode)轴向:
| 轴向 | 取值 |
|---|---|
| 长度 | short(短)、medium(中)、long(长) |
| 领域 | programming(编程)、office_daily(办公日常) |
| 子领域 | code_debug、sql、web_automation、word、chat_preference 等 |
计划中的 v0.1 分布:
| 文件夹 | 剧集数 |
|---|---|
short/programming |
20 |
medium/programming |
30 |
long/programming |
35 |
short/office_daily |
10 |
medium/office_daily |
20 |
long/office_daily |
15 |
查询能力类型
| 类型 | 含义 |
|---|---|
recall |
直接事实、时间、顺序、命令或决策的回忆 |
causal_dependency |
检索解释原因、前提或依赖关系所需的证据 |
state_updating |
最新状态检索,同时避免过时或被取代的记忆 |
state_abstraction |
检索从长上下文中抽象出的高层规则、偏好或教训 |
safety |
检测秘密、原始轨迹、瞬态状态或噪声日志未被记忆 |
目标记忆类型
数据集针对以下记忆类型进行评估:
text preference(偏好)、project(项目)、episodic(情景)、reflective(反思)、tool(工具)、knowledge(知识)、general(通用)
剧集结构
每个剧集包含元数据、运行时输入和查询级黄金记忆预期,示例结构如下:
json { "episode_id": "prog_medium_memory_extract_001", "version": "0.1", "length_bucket": "medium", "domain": "programming", "subdomain": "memory_extraction", "success": true, "num_turns": 0, "total_tokens": 0, "messages": [], "working_memory": {}, "queries": [] }
更详细的模式说明可参考 SCHEMA.md 和 data/v0.1/templates/episode.template.json。
当前仓库状态
该仓库目前包含数据集框架(scaffold)、模式文档、验证脚本和指标辅助工具。实际的 v0.1 剧集数据已规划但尚未包含在仓库中。




