MemOps
收藏资源简介:
MemOps是由MemTensor(上海)科技有限公司、香港科技大学(广州)和中国人民大学联合创建的长周期对话生命周期记忆操作基准数据集。该数据集旨在通过结构化操作轨迹和针对性探测,对记忆增强代理在长期交互中的记忆行为进行细粒度诊断。数据集内容包含嵌入自然任务导向对话中的记忆操作,涵盖记住、遗忘、更新和反思等生命周期操作,并生成黄金操作轨迹及六类操作级探测问题,支持相邻证据和长上下文两种评估设置。其创建过程采用可控生成流程,将记忆操作嵌入长对话历史,以模拟动态记忆状态转换。该数据集主要应用于评估和诊断大语言模型在长周期对话中的记忆操作可靠性,旨在解决传统基于最终答案的评估方法无法区分记忆失败根本原因的问题,推动记忆评估从黑盒评分转向可解释的操作级诊断。
MemOps is a benchmark dataset for long-term conversational lifecycle memory operations, co-developed by MemTensor (Shanghai) Technology Co., Ltd., The Hong Kong University of Science and Technology (Guangzhou), and Renmin University of China. This dataset aims to conduct fine-grained diagnosis of the memory behaviors of memory-augmented agents during long-term interactions through structured operation trajectories and targeted probing. The dataset covers memory operations embedded in natural task-oriented dialogues, including lifecycle operations such as recall, forgetting, updating, and reflection. It also generates gold-standard operation trajectories and six categories of operation-level probing questions, supporting two evaluation settings: adjacent evidence and long context. Its development adopts a controllable generation pipeline that embeds memory operations into long dialogue histories to simulate dynamic memory state transitions. This dataset is primarily used to evaluate and diagnose the reliability of memory operations of Large Language Models (LLMs) in long-term conversational scenarios. It aims to address the issue that traditional final-answer-based evaluation methods fail to distinguish the root causes of memory failures, and promote the shift of memory evaluation from black-box scoring to interpretable operation-level diagnosis.
数据集概述:MemOps
MemOps 是一个用于评估长对话中生命周期记忆操作(如事实的记忆与更新)的基准测试数据集和代码库。
核心目标
- 构建模拟长期、多轮且包含干扰信息的对话场景,在其中植入可验证的个人事实(“证据”)。
- 测试不同记忆策略(如RAG、长上下文、无上下文、mem0等)在对话生命周期中回忆和更新这些事实的能力。
数据集构建流程(Pipeline)
- 生成背景信息:从
info/topics.md生成个人背景描述。 - 生成并验证证据对话:创建包含证据的对话,并进行验证。
- 生成干扰事实:为后续的纵向评估生成干扰性事实。
- 注入证据与干扰项:将证据和干扰事实注入从UltraChat数据集中采样的无关对话。
- 执行操作指标测试:在RAG、长上下文、无上下文和mem0等基线模型上运行操作指标测试。
- 评估操作指标:使用LLM作为评判器,评估步骤5的输出。
关键技术细节
- 数据来源:步骤2和4中使用的“无关”对话来自 UltraChat 数据集。
- 评估方法:通过“操作指标”衡量不同记忆策略在对话生命周期中的表现。
- 代码与脚本:每个步骤均有对应的Python脚本(
N-*.py)和Shell包装脚本(N-*.sh),可通过环境变量灵活配置模型名称、并发数等参数。
环境与依赖
- Python依赖:
tqdm;步骤5需要openai和rank-bm25。 - API密钥配置:
- 按优先级读取环境变量(
MEMTENSOR_API_KEY、OPENAI_API_KEY等)或api.md/key.md文件。 - 可配置多个密钥实现轮换。
- 必须设置
LLM_BASE_URL指向兼容OpenAI的聊天补全端点。 - 步骤5的MemOS基线需要独立的
MEMOS_API_KEY和MEMOS_BASE_URL(默认为公开MemOS API)。
- 按优先级读取环境变量(
- 默认模型:默认模型名涵盖多个系列(如
claude-opus-4-6、gpt-4o等),需搭配支持多模型的路由网关(如OpenRouter)使用;直连单一提供商API时需覆盖模型名变量。

- 1MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon ConversationsMemTensor(上海)科技有限公司; 香港科技大学·广州; 中国人民大学 · 2026年




