遇见数据集

MemOps

收藏
arXiv2026-07-14 更新2026-07-16 收录
数据链接:
官方服务:

资源简介:

MemOps是由MemTensor(上海)科技有限公司、香港科技大学(广州)和中国人民大学联合创建的长周期对话生命周期记忆操作基准数据集。该数据集旨在通过结构化操作轨迹和针对性探测,对记忆增强代理在长期交互中的记忆行为进行细粒度诊断。数据集内容包含嵌入自然任务导向对话中的记忆操作,涵盖记住、遗忘、更新和反思等生命周期操作,并生成黄金操作轨迹及六类操作级探测问题,支持相邻证据和长上下文两种评估设置。其创建过程采用可控生成流程,将记忆操作嵌入长对话历史,以模拟动态记忆状态转换。该数据集主要应用于评估和诊断大语言模型在长周期对话中的记忆操作可靠性,旨在解决传统基于最终答案的评估方法无法区分记忆失败根本原因的问题,推动记忆评估从黑盒评分转向可解释的操作级诊断。

MemOps is a benchmark dataset for long-term conversational lifecycle memory operations, co-developed by MemTensor (Shanghai) Technology Co., Ltd., The Hong Kong University of Science and Technology (Guangzhou), and Renmin University of China. This dataset aims to conduct fine-grained diagnosis of the memory behaviors of memory-augmented agents during long-term interactions through structured operation trajectories and targeted probing. The dataset covers memory operations embedded in natural task-oriented dialogues, including lifecycle operations such as recall, forgetting, updating, and reflection. It also generates gold-standard operation trajectories and six categories of operation-level probing questions, supporting two evaluation settings: adjacent evidence and long context. Its development adopts a controllable generation pipeline that embeds memory operations into long dialogue histories to simulate dynamic memory state transitions. This dataset is primarily used to evaluate and diagnose the reliability of memory operations of Large Language Models (LLMs) in long-term conversational scenarios. It aims to address the issue that traditional final-answer-based evaluation methods fail to distinguish the root causes of memory failures, and promote the shift of memory evaluation from black-box scoring to interpretable operation-level diagnosis.

创建时间:
2026-07-14
原始信息汇总

数据集概述:MemOps

MemOps 是一个用于评估长对话中生命周期记忆操作(如事实的记忆与更新)的基准测试数据集和代码库。

核心目标

  • 构建模拟长期、多轮且包含干扰信息的对话场景,在其中植入可验证的个人事实(“证据”)。
  • 测试不同记忆策略(如RAG、长上下文、无上下文、mem0等)在对话生命周期中回忆和更新这些事实的能力。

数据集构建流程(Pipeline)

  1. 生成背景信息:从 info/topics.md 生成个人背景描述。
  2. 生成并验证证据对话:创建包含证据的对话,并进行验证。
  3. 生成干扰事实:为后续的纵向评估生成干扰性事实。
  4. 注入证据与干扰项:将证据和干扰事实注入从UltraChat数据集中采样的无关对话。
  5. 执行操作指标测试:在RAG、长上下文、无上下文和mem0等基线模型上运行操作指标测试。
  6. 评估操作指标:使用LLM作为评判器,评估步骤5的输出。

关键技术细节

  • 数据来源:步骤2和4中使用的“无关”对话来自 UltraChat 数据集。
  • 评估方法:通过“操作指标”衡量不同记忆策略在对话生命周期中的表现。
  • 代码与脚本:每个步骤均有对应的Python脚本(N-*.py)和Shell包装脚本(N-*.sh),可通过环境变量灵活配置模型名称、并发数等参数。

环境与依赖

  • Python依赖tqdm;步骤5需要openairank-bm25
  • API密钥配置
    • 按优先级读取环境变量(MEMTENSOR_API_KEYOPENAI_API_KEY等)或api.md/key.md文件。
    • 可配置多个密钥实现轮换。
    • 必须设置LLM_BASE_URL指向兼容OpenAI的聊天补全端点。
    • 步骤5的MemOS基线需要独立的MEMOS_API_KEYMEMOS_BASE_URL(默认为公开MemOS API)。
  • 默认模型:默认模型名涵盖多个系列(如claude-opus-4-6gpt-4o等),需搭配支持多模型的路由网关(如OpenRouter)使用;直连单一提供商API时需覆盖模型名变量。
搜集汇总
数据集介绍
MemOps 数据集图片
构建方式
在长时程人机交互场景中,现有基准多将记忆评估简化为基于最终答案正确性的问答任务,难以揭示记忆生命周期中各环节的失败根源。MemOps另辟蹊径,将对话记忆重新定义为显式生命周期操作序列,并构建了可控生成与验证流水线。该流水线依次执行背景构建、证据对话与黄金操作轨迹生成、操作级探针生成以及长上下文对话生成四个阶段。首先基于主题化用户画像设计包含记忆事件的场景;随后生成包含三层对话片段的证据会话,同步输出每条操作的结构化追踪记录;接着针对六类操作级探针生成评估问题与预期答案;最后将证据片段嵌入无关的长时间对话历史中,形成相邻证据与长上下文两种评测设置。每一样本均经过确定性局部门控与大语言模型语义验证的双重质检,保证了自然对话形式与可验证操作语义的统一。
使用方法
研究者可依据评测目标选择相邻证据设置或长上下文设置来调用MemOps。在相邻设置中,证据会话直接置于探针之前,用以隔离评估模型在局部证据下对记忆操作的理解与应用能力。在长上下文设置中,证据片段被分散嵌入包含数万token的无关对话池中,模拟真实的长时交互噪声环境,检验系统在干扰下的记忆保持、检索与应用能力。评测时需加载每一样本中的结构化操作轨迹与探针答案,对模型的输出通过大语言模型裁判进行逐项打分,包括答案准确性、操作F1分数、溯源支撑度、遗忘值泄漏率、过时值复用率以及反思精度等维度。该基准还可作为记忆控制器的开发信号,用于指导模型明确学习何时写入、更新、删除、检索及辩护记忆状态,推动记忆系统向可控制、可审计的方向演化。
背景与挑战
背景概述
MemOps数据集由MemTensor(上海)科技有限公司联合香港科技大学(广州)与中国人民大学的研究人员于2026年7月创建,旨在重构大语言模型(LLM)长期对话记忆的评估范式。核心研究问题在于,现有基准(如LoCoMo、LongMemEval)仅通过下游问答的最终答案正确性评估记忆,将遗忘、更新、反思等异质记忆失败原因混为一谈。MemOps创新性地将对话记忆视为一系列显式生命周期操作(记忆、遗忘、更新、反思及轨迹操作),并为每个记忆事件构建结构化追踪(含触发、目标、状态变迁与证据)。该数据集涵盖100个主题、403个证据对话及2006个探测问题,在相邻与长上下文两种设置下评估,推动了记忆评估从黑箱式终点打分向可解释的操作级诊断转变,对LLM代理的长期记忆研究具有奠基性影响。
当前挑战
MemOps所解决的领域挑战在于,传统基准无法区分正确最终答案背后的错误记忆状态(如使用过时值或泄露已遗忘信息),亟需操作级的细粒度诊断。构建过程中面临多重挑战:1)需要设计可控生成流水线,将记忆操作自然地嵌入长任务导向对话,并生成黄金操作追踪与结构化探测;2)需确保每个操作具有可追溯的证据跨度与状态变迁,防止依赖助手生成的摘要或隐藏标签;3)需在长上下文设置中插入语境级干扰项,确保探测不被浅层匹配绕过;4)需通过确定性门控与LLM验证器双重质检,以保持语义正确性与结构有效性;5)需平衡六大探测类型(操作追踪、目标绑定、状态变迁、候选消歧、操作应用与状态轨迹)的分布,确保诊断全面性,最终保留率仅55.4%,反映了构建的高难度。
常用场景
经典使用场景
在长期对话场景中,大语言模型驱动的智能体需要持续管理与用户交互过程中产生的记忆,而现有基准评测仅关注最终答案的正确性,忽略了记忆操作的中间过程。MemOps将对话记忆重新定义为一系列显式的生命周期操作,包括记住、遗忘、更新、反思及其组合,并通过结构化操作轨迹和六类细粒度探针来评估模型在执行这些操作时的准确性。研究者可以利用MemOps来诊断模型在记忆事件检测、目标绑定、状态转换、候选歧义消解、操作应用及状态轨迹重建等环节的具体表现,从而揭示传统端到端问答评估所掩盖的失败模式。
解决学术问题
MemOps解决了长期对话记忆评测中长期存在的黑箱化问题——即仅通过最终答案正确性来评估记忆能力,无法区分记忆失败的具体原因,例如遗漏关键事实、绑定错误目标、依赖过期数值或产生不安全的记忆状态。通过将记忆能力分解为可操作的生命周期单元,MemOps使得研究者能够精确归因每个记忆操作的失败环节,支持对遗忘与泄露控制、状态变迁一致性、多步骤轨迹重建等复杂能力的单独诊断。该基准的提出推动了记忆评测从单一的答案评分向可解释的操作级诊断转变,为构建更可控、可审计的长期记忆系统提供了理论与数据基础。
实际应用
在实际应用中,MemOps可用于评估和改进各类记忆增强型AI系统,包括长期对话助手、个性化推荐系统、协作式办公工具以及持续学习智能体。例如,通过MemOps可以检测一个智能助手在用户更正个人信息后是否继续使用旧值,或在用户要求删除临时凭证后是否仍然泄露该信息。此外,基于会话级检索与托管记忆服务的系统(如MemOS)在MemOps上的表现揭示了保留上下文细节对正确执行生命周期操作的重要性,这为实际部署中选择记忆存储粒度与检索策略提供了指导。该基准还能用于监控记忆系统的安全性,防止遗忘请求被忽略或过度删除保留信息。
数据集最近研究
最新研究方向
MemOps基准测试将长期对话记忆的评估从传统的最终答案正确性转向可解释的操作级诊断,聚焦于记忆生命周期中的显式操作序列,包括记忆、遗忘、更新、反思及其组合。该研究揭示了当前系统在多步状态轨迹重建、证据分散场景下的脆弱性,尤其指出现有长上下文模型和检索增强系统在有序记忆状态重构方面的系统性缺陷。这一方向推动了对话式AI从黑箱式的问答评测迈向细粒度的记忆过程审计,为设计可控、可解释、安全对齐的长期记忆代理提供了新的评估范式与开发信号。
相关研究论文
  • 1
    MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon ConversationsMemTensor(上海)科技有限公司; 香港科技大学·广州; 中国人民大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务