SubtleMemory
收藏资源简介:
SubtleMemory 是一个用于评估长视野AI代理细粒度关系记忆区分能力的基准测试数据集。它包含10个角色级别的历史记录、1,090个关系控制的语义变体集和1,522个评估实例,每个实例都提出一个下游问题,其答案依赖于目标相关记忆之间的关系。该数据集旨在测试记忆系统是否能保留和使用这些细粒度关系,而不仅仅是回忆孤立的事实。
SubtleMemory is a benchmark dataset for evaluating the fine-grained relational memory discrimination ability of long-horizon AI Agents. It contains 10 character-level historical records, 1,090 relation-controlled semantic variant sets, and 1,522 evaluation instances. Each instance poses a downstream question whose answer relies on the relationships among target-related memories. This dataset is designed to test whether memory systems can retain and utilize these fine-grained relational connections, rather than merely recalling isolated facts.
数据集概述:SubtleMemory
SubtleMemory 是一个用于评估长时程 AI 智能体在微妙关系记忆辨别能力上的基准测试集。其核心目标是测试记忆系统在保留用户、任务或外部事实相关的多个相似记忆时,能否准确区分并利用这些记忆之间的互补 (Complementary)、微妙 (Nuanced) 和矛盾 (Contradictory) 关系,而不仅仅是检索孤立的单个事实。
数据集规模与组成
- 人物画像 (Personas): 10 个。
- 关系控制语义变体集 (Relation-Controlled Semantic Variant Sets): 1,090 个。
- 评估实例 (Evaluation Instances): 1,522 个。每个实例都包含一个下游问题,其答案取决于与目标相关的记忆之间的关系。
核心关系类型
| 关系类型 | 描述 | 必须保留的细节 |
|---|---|---|
| 互补 (Complementary) | 兼容的记忆,必须被组合使用;或等效的记忆,其中任何一个都足以解决问题。 | 需要组合多个事实或从任一事实中推理。 |
| 微妙 (Nuanced) | 存在时间、上下文、角色、范围或条件的边界,决定了具体哪个记忆适用。 | 需要理解记忆适用的特定场景或约束条件。 |
| 矛盾 (Contradictory) | 未解决的冲突,应该被揭示出来,而不是被无声无息地覆盖或合并。 | 需要识别并报告记忆间的冲突,而非简单融合。 |
数据构建流程
数据通过一个五阶段的流水线构建,起始于开源种子数据,最终生成以人物画像为单位的基准测试包。
- 种子数据选择与规范化 (Select and normalize semantic seed data)
- 生成关系控制语义变体 (Generate relation-controlled semantic variants)
- 将变体嵌入隐式的、自然的、多轮对话会话中 (Embed variants into implicit, natural multi-turn sessions)
- 构建评估实例和问答目标 (Construct evaluation instances and QA targets)
- 组装按时间顺序排列的用户历史记录和最终基准测试包 (Assemble chronological user histories and final bench bundles)
构建流程的详细入口点位于 construction/ 目录下。
评估框架特点
- 统一评估协议 (Unified Evaluation): 遵循
添加 (Add) -> 最终化 (Finalize) -> 搜索 (Search) -> 回答 (Answer) -> 评估 (Evaluate)的标准化流水线,支持对独立记忆系统、框架原生记忆智能体以及 OpenClaw 风格插件化智能体进行评估。 - 失败诊断 (Failure Diagnosis): 能够检查流水线各阶段的产物,从而分离出记忆写入、最终化、检索、答案生成和评判环节的失败原因。
- 回读分析 (Readback Analysis): 提供一种特殊的
readback模式,该模式使用问题溯源信息(如session_ids)直接读取目标会话写入的记忆对象,区别于标准的api搜索模式,便于分析检索失败的原因。 - 关系敏感报告 (Relation-Sensitive Reporting): 评估报告不仅关注最终答案的准确率,还按关系级别分析模型在互补、微妙和矛盾关系上的表现。
支持的评估系统
该系统支持多样化的记忆系统和基线配置,包括:
- 托管记忆 API: Mem0, Memos, EverMemos, Zep, Memobase 等。
- 本地/原生记忆系统: A-Mem, MIRIX, MetaClaw 等。
- OpenClaw 风格智能体/插件: OpenClaw-session-memory, OpenClaw-mem0-plugin 等。
- 基线: no-context (无上下文), oracle-context-gpt-4o-mini (理想上下文), human-baseline-oracle-sessions (人类基线) 等。
结果与数据获取
- 主要排行榜与汇总结果 可在项目页面 https://yummytanmo.github.io/SubtleMemory/#results 查看。
- 论文地址: https://arxiv.org/abs/2606.05761
- 项目页面: https://yummytanmo.github.io/SubtleMemory/
- 代码仓库: https://github.com/Yummytanmo/SubtleMemory
仓库结构
| 路径 | 用途 |
|---|---|
data/subtlememory/ |
生成的基准测试数据,按 persona_0 到 persona_9 组织。 |
construction/ |
数据构建的工作流程。 |
evaluation/ |
评估流水线代码、配置、适配器和结果。 |





