遇见数据集

MemTraceBench

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

MemTraceBench是一个用于追踪和归因大语言模型(LLM)内存系统中错误的基准测试数据集,与论文《MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems》一同发布。该数据集的核心是将内存管道转化为执行图,从而精细追踪内存系统内部的信息流,包括信息的提取、更新、删除、检索以及最终在响应中的使用。数据集包含了这些执行图以及精心整理的失败标注,用于系统研究内存故障模式。每个失败的查询都被标注了根本原因错误类型和执行图中的决定性错误操作。数据集根据生成轨迹的内存系统分为四个部分(或称配置):rag(Naive RAG)、mem0(Mem0)、evermemos(EverMemOS)和long_context(Long-Context)。每个部分包含多个JSON文件,每个文件代表从一个代表性内存系统收集的一个序列化执行图。数据来源于三个多会话内存数据集:LoCoMo、LongMemEval和RealMem。总计,数据集包含103个执行图和238个失败标注。每个执行图遵循特定的JSON架构,包含图ID、用户ID、元数据以及核心数据部分。核心数据部分包括变量节点、信息流边、操作(如提取、更新、检索、判断)、会话以及关键的失败案例标注列表。每个失败标注详细记录了查询ID、查询文本、参考答案、模型预测、所需证据、最终错误类型、决定性操作ID以及由GPT-5.5聚合和润色的人工标注原因。除了内存系统相关错误外,标注还包括标注错误和LLM-as-a-Judge错误,这些通常在研究内存相关错误时被过滤掉。该数据集适用于问答、内存系统分析、错误诊断、代理行为追踪和归因等任务。

提供机构:
ZJUNLP
创建时间:
2026-06-05
原始信息汇总

数据集概述

MemTraceBench 是一个专用于研究大语言模型(LLM)记忆系统错误追踪与归因的基准测试集,伴随论文 MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems(arXiv:2605.28732)发布。


核心目标

  • 将记忆管道转换为执行图(execution graph),以细粒度追踪系统内部的信息流。
  • 为每个失败查询提供根因错误类型关键故障操作的标注,支持系统性研究记忆系统故障模式。

数据集结构

数据集按生成轨迹的记忆系统分为四个子集,每个子集为一个JSON文件目录:

子集(Split) 记忆系统(Memory System) 执行图数量 失败标注数量
rag Naive RAG 30 56
mem0 Mem0 19 66
evermemos EverMemOS 20 54
long_context Long-Context 34 62

轨迹数据来源于三个多会话记忆数据集:LoCoMoLongMemEvalRealMem(文件名中可见,如 locomo_locomo-1.jsonlongmemeval_*.json)。


文件格式(JSON Schema)

每个JSON文件是一个序列化的 smartcomment 执行图,顶层结构如下:

jsonc { "graph_id": "...", "user_id": "...", "project_id": "...", "driver_type": "in_memory", "created_at": "...", "metadata": { ... }, "data": { "nodes": [ ... ], // 变量节点(记忆单元、查询、预测等) "edges": [ ... ], // 变量间的信息流边 "operations": [ ... ], // 操作(提取、更新、检索、判断等) "sessions": [ ... ], // 对话会话 "annotations":[ ... ] // 精心选择的失败案例 } }

data.annotations 中的每条记录描述一个被判定为错误的查询,字段如下:

字段 (Field) 描述 (Description)
query_id 图中查询节点的完整标识符。
query 问题文本。
golden_answers 参考答案。
golden_answers_id 图中参考答案节点的完整标识符。
prediction 问答模型的预测结果。
prediction_id 图中预测节点的完整标识符。
source_evidence 回答查询所需的证据。
source_evidence_ids 图中证据节点的完整标识符。
final_error_type 归因的根因错误类型。
final_op_id 图中决定性故障操作的标识符。
reason 归因的根因解释(由GPT-5.5聚合并润色人工标注者的理由)。

注意:除与记忆系统相关的错误外,还包含标注错误和LLM作为判断者的错误,研究记忆相关错误时通常过滤掉这些。


数据构建

  • 使用 smartcomment 工具对四种代表性记忆系统(Mem0、EverMemOS、Naive RAG、Long-Context)进行代码插桩,记录记忆构建、检索、利用和评估中的操作,并组织成执行图。
  • 选择失败案例后,通过人工标注定位错误位置(具体操作标识符)、错误类型及错误原因。最终标签通过多数投票与第二轮标注确定,再由GPT-5.5聚合润色。
  • 完整的可运行生成代码见:https://github.com/zjunlp/MemBase/tree/main/examples/trace_memory_lifecycle_with_membase

许可证

该数据集采用 MIT License 发布。


引用

若在研究中使用了MemTraceBench,请引用:

bibtex @misc{deng2026memtracetracingattributingerrors, title={MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems}, author={Xinle Deng and Ruobin Zhong and Hujin Peng and Xiaoben Lu and Yanzhe Wu and Guang Li and Buqiang Xu and Yunzhi Yao and Jizhan Fang and Haoliang Cao and Junjie Guo and Yuan Yuan and Ziqing Ma and Yuanqiang Yu and Rui Hu and Baohua Dong and Hangcheng Zhu and Ningyu Zhang}, year={2026}, eprint={2605.28732}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2605.28732}, }

搜集汇总
数据集介绍
MemTraceBench 数据集图片
构建方式
MemTraceBench的构建依托于对四种代表性记忆系统——Mem0、EverMemOS、朴素RAG及长上下文模型——在LoCoMo、LongMemEval和RealMem多会话轨迹上的运行过程进行细粒度追踪。通过智能注释工具smartcomment对记忆系统的源代码进行插桩,系统化记录记忆构建、检索、利用及评估等核心操作,并将其组织为执行图。随后,针对检索出的失败案例,由人工标注团队定位错误发生的具体操作节点、归类错误类型并撰写错误原因,经多数投票与二次标注确定最终标签,再借助GPT-5.5对标注理由进行聚合与润色,以确保标注的一致性和准确性。
使用方法
使用MemTraceBench时,需先通过huggingface_hub库的snapshot_download函数下载数据集,并安装smartcomment包以解析执行图。用户可根据需要选择下载全部或特定子集。加载JSON文件后,可通过ExecNetwork.import_graph将其反序列化为执行图对象,并直接访问data.annotations字段获取标注的失败案例。为进一步分析,可随机选取操作节点或根据注解中的final_op_id定位故障操作,并利用filter_by_operation方法提取子图,配合graphviz后端将其可视化为图像文件,从而直观审视特定操作或错误发生的详细上下文。
背景与挑战
背景概述
大语言模型(LLM)的长时间推理能力高度依赖于记忆系统,然而现有记忆系统存在可靠性不足与调试困难等瓶颈。2026年,浙江大学等机构的研究人员(Deng等人)提出了MemTrace框架,并发布了配套的基准测试MemTraceBench。该数据集将记忆管线转化为细粒度的执行图,覆盖信息提取、更新、删除、检索及最终响应的全流程,旨在系统性地研究记忆系统的错误模式。核心研究问题在于如何精准追踪并归因LLM记忆系统中的故障。MemTraceBench收录了来自Naive RAG、Mem0、EverMemOS及长上下文四种记忆系统在LoCoMo、LongMemEval和RealMem轨迹上生成的103个执行图,并提供了238条人工标注的失败案例,为记忆系统的可解释性与鲁棒性研究树立了重要标杆。
当前挑战
该数据集致力于解决两大层面的挑战。首先在领域问题层面,LLM记忆系统常因信息提取不完整、更新冲突、检索偏差或错误利用而导致回答失准,现有方法难以定位故障根源,MemTraceBench通过执行图与根因标注填补了系统性错误归因的空白。其次在构建过程中,挑战表现为三方面:一是将四种异质记忆系统的内部操作统一建模为标准化执行图,需精确捕捉语义与流程的差异;二是大规模人工标注失败案例时,需通过多数投票与二次标注确保错误类型与故障操作标识的一致性;三是借助GPT-5.5整合人类标注理由,需平衡自动化的效率与归纳的准确性,从而构建高质量的错误分析基准。
常用场景
经典使用场景
在大型语言模型(LLM)广泛部署于需要长程推理的智能代理系统的背景下,MemTraceBench为评估与调试记忆系统提供了不可或缺的基准。该数据集的核心应用在于将复杂的记忆管道转化为精细的执行图,从而系统性地追踪信息在提取、更新、删除、检索直至最终响应生成全流程中的流动。研究者可借助其标注的失败案例,深入分析不同记忆架构(如Mem0、EverMemOS、Naive RAG及长上下文模型)在持久化记忆服务中的表现差异,进而推动记忆召回与错误归因技术的进步。
解决学术问题
MemTraceBench精准回应了LLM记忆系统可靠性低下且难以调试的学术困境。传统方法往往将记忆系统视为黑盒,无法定位错误根源,而该数据集通过引入根因错误类型与决定性故障操作标识,开辟了记忆失效模式量化研究的新路径。它解决了记忆信息错误提取、更新冲突、检索遗漏等长期困扰学界的基础性问题,为构建可解释、可验证的LLM记忆机制提供了标准化的分析框架。这一贡献不仅深化了我们对记忆系统瓶颈的理解,更催生了以执行图为核心的细粒度调试方法论,对提升LLM在持续对话、长期任务规划等场景中的稳健性具有承前启后的学术意义。
实际应用
在工业级应用中,MemTraceBench为构建高可靠性的LLM驱动系统提供了关键支撑。例如,在基于检索增强生成(RAG)的客户服务机器人中,该数据集可辅助开发者诊断记忆模块错误——如未能正确提取历史交互中的关键实体,或长期上下文中信息丢失导致的回答偏差。它还赋能了智能体平台(如EverMemOS)的迭代优化,使得多会话记忆系统的错误率显著降低。此外,在金融咨询、教育培训等需要精准记忆复用的领域,MemTraceBench推动实现了记忆回滚与错误操作的自动检测,从而确保AI服务的连续性与准确性。
数据集最近研究
最新研究方向
当前,大型语言模型在长程推理任务中因记忆系统不可靠而屡现错误,如何系统化地定位与归因这些错误成为前沿挑战。MemTraceBench作为首个将记忆管线转化为执行图并附带精细故障标注的基准,创新性地将根因错误类型与关键操作节点绑定,使得记忆系统内部的提取、更新、检索、删除及响应利用等环节的失效模式得以透明化追踪。该数据集覆盖了Naive RAG、Mem0、EverMemOS与Long-Context四种代表性记忆系统在LoCoMo、LongMemEval、RealMem三个多会话记忆评测集上产生的执行图,并经由人工与GPT协作标注错误原因。这一体系化的工作为基于智能体的记忆系统调试与可解释性研究提供了标准化分析工具,有望推动大模型在长期记忆与多轮交互场景下的可靠性与鲁棒性评估迈入新阶段。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务