遇见数据集

SubtleMemory

收藏
github2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

SubtleMemory 是一个用于评估长视野AI代理细粒度关系记忆区分能力的基准测试数据集。它包含10个角色级别的历史记录、1,090个关系控制的语义变体集和1,522个评估实例,每个实例都提出一个下游问题,其答案依赖于目标相关记忆之间的关系。该数据集旨在测试记忆系统是否能保留和使用这些细粒度关系,而不仅仅是回忆孤立的事实。

SubtleMemory is a benchmark dataset for evaluating the fine-grained relational memory discrimination ability of long-horizon AI Agents. It contains 10 character-level historical records, 1,090 relation-controlled semantic variant sets, and 1,522 evaluation instances. Each instance poses a downstream question whose answer relies on the relationships among target-related memories. This dataset is designed to test whether memory systems can retain and utilize these fine-grained relational connections, rather than merely recalling isolated facts.

创建时间:
2026-06-04
原始信息汇总

数据集概述:SubtleMemory

SubtleMemory 是一个用于评估长时程 AI 智能体在微妙关系记忆辨别能力上的基准测试集。其核心目标是测试记忆系统在保留用户、任务或外部事实相关的多个相似记忆时,能否准确区分并利用这些记忆之间的互补 (Complementary)微妙 (Nuanced)矛盾 (Contradictory) 关系,而不仅仅是检索孤立的单个事实。

数据集规模与组成

  • 人物画像 (Personas): 10 个。
  • 关系控制语义变体集 (Relation-Controlled Semantic Variant Sets): 1,090 个。
  • 评估实例 (Evaluation Instances): 1,522 个。每个实例都包含一个下游问题,其答案取决于与目标相关的记忆之间的关系。

核心关系类型

关系类型 描述 必须保留的细节
互补 (Complementary) 兼容的记忆,必须被组合使用;或等效的记忆,其中任何一个都足以解决问题。 需要组合多个事实或从任一事实中推理。
微妙 (Nuanced) 存在时间、上下文、角色、范围或条件的边界,决定了具体哪个记忆适用。 需要理解记忆适用的特定场景或约束条件。
矛盾 (Contradictory) 未解决的冲突,应该被揭示出来,而不是被无声无息地覆盖或合并。 需要识别并报告记忆间的冲突,而非简单融合。

数据构建流程

数据通过一个五阶段的流水线构建,起始于开源种子数据,最终生成以人物画像为单位的基准测试包。

  1. 种子数据选择与规范化 (Select and normalize semantic seed data)
  2. 生成关系控制语义变体 (Generate relation-controlled semantic variants)
  3. 将变体嵌入隐式的、自然的、多轮对话会话中 (Embed variants into implicit, natural multi-turn sessions)
  4. 构建评估实例和问答目标 (Construct evaluation instances and QA targets)
  5. 组装按时间顺序排列的用户历史记录和最终基准测试包 (Assemble chronological user histories and final bench bundles)

构建流程的详细入口点位于 construction/ 目录下。

评估框架特点

  • 统一评估协议 (Unified Evaluation): 遵循 添加 (Add) -> 最终化 (Finalize) -> 搜索 (Search) -> 回答 (Answer) -> 评估 (Evaluate) 的标准化流水线,支持对独立记忆系统、框架原生记忆智能体以及 OpenClaw 风格插件化智能体进行评估。
  • 失败诊断 (Failure Diagnosis): 能够检查流水线各阶段的产物,从而分离出记忆写入、最终化、检索、答案生成和评判环节的失败原因。
  • 回读分析 (Readback Analysis): 提供一种特殊的 readback 模式,该模式使用问题溯源信息(如 session_ids)直接读取目标会话写入的记忆对象,区别于标准的 api 搜索模式,便于分析检索失败的原因。
  • 关系敏感报告 (Relation-Sensitive Reporting): 评估报告不仅关注最终答案的准确率,还按关系级别分析模型在互补、微妙和矛盾关系上的表现。

支持的评估系统

该系统支持多样化的记忆系统和基线配置,包括:

  • 托管记忆 API: Mem0, Memos, EverMemos, Zep, Memobase 等。
  • 本地/原生记忆系统: A-Mem, MIRIX, MetaClaw 等。
  • OpenClaw 风格智能体/插件: OpenClaw-session-memory, OpenClaw-mem0-plugin 等。
  • 基线: no-context (无上下文), oracle-context-gpt-4o-mini (理想上下文), human-baseline-oracle-sessions (人类基线) 等。

结果与数据获取

仓库结构

路径 用途
data/subtlememory/ 生成的基准测试数据,按 persona_0persona_9 组织。
construction/ 数据构建的工作流程。
evaluation/ 评估流水线代码、配置、适配器和结果。
搜集汇总
数据集介绍
SubtleMemory 数据集图片
构建方式
SubtleMemory的构建遵循一套严谨的五阶段流水线,始于开源种子数据的筛选与规范化。首先,从开放域中选取语义种子数据并进行标准化处理。其次,基于互补、细微、矛盾三类关系控制,生成语义变体集合,确保每一条记忆片段内嵌特定关系属性。接着,将这些变体自然地嵌入多轮对话历史中,形成隐式的用户叙事。而后,构造下游评估实例与问答对,令正确答案仅能从目标关系的回忆中推导。最后,将所有会话历史与评估实例整合为按角色组织的基准数据包,每个角色目录下包含chronological sessions与bench instances文件,支持后续评估的加载与运行。
特点
该数据集的核心特色在于其关系精细控别的设计哲学。不同于传统记忆基准对孤立事实的检索,SubtleMemory要求模型在处理互补、细微、矛盾三类关系时具备细腻的辨别力。互补关系考验模型是否能够综合相容记忆或识别等价记忆;细微关系要求模型分辨时间、上下文、角色、范围或条件边界,以决定哪条记忆适用;矛盾关系则挑战模型在冲突信息面前保持不确定性而非草率融合。此外,数据集配备统一的评估协议、故障诊断与回读分析机制,支持对记忆写入、检索、生成各阶段的独立归因。
使用方法
SubtleMemory的使用遵循一套标准化流程。用户需将生成的基准数据复制至评估目录,随后通过命令行接口执行分阶段评估流水线,涵盖add(记忆添加)、finalize(记忆固化)、search(检索)、answer(答案生成)与evaluate(评估)五个阶段。支持运行示范性烟雾测试以验证配置正确性。该框架兼容多种记忆系统,包括Mem0、Memos、Zep等托管API与AMem、MIRIX等本地系统的适配器,亦提供OpenClaw风格的插件代理运行模式。评估结果输出详尽,涵盖检索证据、生成答案、判决日志与汇总分数,并可利用回读模式分离记忆存储与检索阶段的失败分析。
背景与挑战
背景概述
SubtleMemory数据集由Wang等人于2026年创建,旨在评估长程AI代理在处理细粒度关系记忆方面的能力。该研究聚焦于长期运行助手在积累大量相似用户记忆时,如何区分互补、细微差异及矛盾等复杂关系。数据集包含10个角色档案、1090个关系控制的语义变体集合及1522个评估实例,通过精心构建的隐式嵌入机制,检验记忆系统是否仅能回忆孤立事实,还是能够保留并利用记忆间的微妙关联。这一基准的推出,为理解与改进AI代理的记忆鉴别能力提供了关键测试平台,对推动人机交互中记忆系统的精细化发展具有重要影响力。
当前挑战
核心挑战在于解决长程AI代理对记忆间细微关系的区分难题。互补记忆需被合并或认为等效,细微差异记忆需根据时间、上下文等条件决定适用性,矛盾记忆则不能被默认合并而应被揭示。传统记忆系统多侧重于孤立事实检索,缺乏对关系敏感性的处理机制,导致面对相似记忆时易产生误判。此外,数据构建过程亦面临挑战:如何设计关系控制的语义变体,使其自然嵌入多轮对话而无需显式标注;如何确保构造的实例通过下游问题揭示目标关系;以及如何建立统一的评估协议以分离记忆写入、检索、答案生成等阶段的失败原因。
常用场景
经典使用场景
SubtleMemory 基准测试专为评估长时程AI代理的细粒度关系记忆辨别能力而设计。其核心使用场景涉及构建包含10个角色档案、1090个关系控制语义变体集和1522个评估实例的测试框架,每个实例都要求下游模型根据目标相关记忆之间的互补、细微或矛盾关系来回答特定问题。通过将潜在关系控制语义痕迹隐式嵌入用户历史会话中,该基准能够精准检测记忆系统是否具备保留和利用细粒度关系的能力,而不仅仅是孤立地回忆事实。这一场景特别适用于评估记忆增强代理、对话系统和个性化助手在复杂、长期交互中维持上下文一致性的表现。
衍生相关工作
基于 SubtleMemory 已衍生出一系列重要研究工作,包括关系敏感的报告机制,该机制不仅评估最终答案准确性,更细粒度地分析模型在互补、细微和矛盾三类关系上的行为差异。回读分析模式利用问题溯源信息暴露目标会话写入的记忆对象,与标准搜索模式形成对比,从而揭示检索策略的固有局限。此外,该基准的构建管线已被应用于生成用于记忆系统诊断的合成训练数据,并启发了诸如情境感知记忆压缩、矛盾检测阈值优化以及多视角记忆融合等方向的前沿方法。这些衍生工作共同推动了关系记忆评估从黑盒准确率向白盒行为理解的演进。
数据集最近研究
最新研究方向
随着长时程AI智能体在用户交互、任务执行与外部知识管理中的广泛应用,如何精准区分和利用海量相似记忆之间的细微关系成为关键瓶颈。SubtleMemory针对这一前沿挑战,构建了包含10个角色历史、1090组关系控制语义变体及1522个评估实例的基准测试,聚焦互补、细微与矛盾三类记忆关系的判别。该数据集通过隐式嵌入关系控制的语义伪影,迫使下游系统在回答依赖目标记忆关系的问题时,展现对记忆间精细关联的保持与运用能力,而非仅孤立地回忆事实。此研究呼应了大语言模型长期记忆系统可靠性这一热点,为评估和推动Agent记忆系统从粗粒度回忆迈向关系敏感型推理提供了关键基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务