遇见数据集

zjunlp/MemTraceBench

收藏
Hugging Face2026-06-07 更新2026-06-14 收录
官方服务:

资源简介:

MemTraceBench是一个与论文《MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems》一同发布的基准测试数据集。它旨在通过将内存管道转换为执行图,以细粒度追踪大型语言模型内存系统中的信息流,包括信息的提取、更新、删除、检索和最终在响应中的利用。数据集包含精心策划的失败注释,用于系统研究内存故障模式,每个失败查询都标注了根本原因错误类型和执行图中的决定性故障操作。数据集结构分为四个部分,分别对应不同的内存系统:rag(朴素RAG)、mem0(Mem0)、evermemos(EverMemOS)和long_context(长上下文),每个部分包含JSON格式的执行图文件,这些文件来自多个会话内存数据集(如LoCoMo、LongMemEval和RealMem)。每个JSON文件遵循smartcomment执行图格式,包含节点、边、操作、会话和注释等字段。注释部分详细描述了失败查询的信息,如查询文本、参考答案、预测结果、错误类型和故障操作标识。数据集加载需要smartcomment包,并支持可视化操作子图。数据集的生成通过将四个代表性内存系统运行在轨迹数据上,并经过人工标注和GPT-5.5聚合整理而成。

MemTraceBench is the benchmark released with the paper MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems. It transforms a memory pipeline into an execution graph to trace the operational information flow inside a memory system at fine granularity, covering how information is extracted, updated, deleted, retrieved, and finally utilized in the response. The dataset packages these execution graphs together with curated failure annotations so that memory failure modes can be studied systematically. Each failed query is labelled with a root-cause error type and the decisive faulty operation in the graph. The dataset is split by the memory system that produces the trajectories, with four splits: rag (Naive RAG), mem0 (Mem0), evermemos (EverMemOS), and long_context (Long-Context). Each split is a directory of JSON files, where every file is one serialized execution graph collected from representative memory systems, sourced from multi-session memory datasets like LoCoMo, LongMemEval, and RealMem. Each JSON file follows the smartcomment execution-graph format, containing nodes, edges, operations, sessions, and annotations. The annotations describe failed queries with fields such as query text, golden answers, prediction, error type, and faulty operation identifier. Loading the dataset requires the smartcomment package and supports visualization of operation subgraphs. The execution graphs are produced by running four memory systems over trajectories, with human annotation and GPT-5.5 aggregation for error attribution.

提供机构:
zjunlp
搜集汇总
数据集介绍
zjunlp/MemTraceBench 数据集图片
构建方式
MemTraceBench旨在系统性地研究大语言模型记忆系统中的失效模式。其构建方式别具匠心:首先,选取Mem0、EverMemOS、Naive RAG与Long-Context四种代表性记忆系统,在LoCoMo、LongMemEval与RealMem三个多会话记忆数据集上运行,生成丰富的交互轨迹。随后,借助smartcomment工具对每个记忆系统的源码进行插桩,精细记录记忆构建、检索、利用及评估等环节的每一个操作,并将这些操作以执行图的形式有机组织起来。最后,针对执行图中的失败案例,通过人工标注确定错误的根因位置(即决定性故障操作)、错误类型及解释,经多数投票与第二轮标注达成一致后,利用GPT-5.5对人标注理由进行聚合与润色,形成最终的高质量故障注解。
特点
该数据集的核心亮点在于其将记忆管道转化为执行图这一创新范式,使得信息在记忆系统中的提取、更新、删除、检索及最终被响应利用的全流程能够以精细粒度被追踪。每个执行图不仅包含变量节点、信息流边与操作节点,还附带精心整理的失败案例注解,每个失败查询均标注了根因错误类型及图中对应的决定性故障操作标识符。数据集按记忆系统划分为rag、mem0、evermemos与long_context四个子集,共涵盖103张执行图与238个失败注解,错误类型覆盖记忆系统相关错误、标注错误及LLM评判错误,为系统性研究记忆失效提供了结构化、可复现的宝贵资源。
使用方法
使用MemTraceBench需先安装huggingface_hub与smartcomment包,通过snapshot_download从Hugging Face Hub下载数据集,并可通过allow_patterns参数选择下载特定子集。每个JSON文件利用ExecNetwork.import_graph反序列化为执行图对象,失败案例则通过graph_data['data']['annotations']获取。研究者可随机采样或依据注解中的final_op_id定位特定操作,利用graph.filter_by_operation提取该操作对应的子图,并通过graphviz后端将其可视化为PNG图片,从而直观审视单步操作如何将输入变量转化为输出变量,或深入探索某个故障案例中决定性操作的内部机制,为记忆系统调试与错误归因提供了坚实的数据基础。
背景与挑战
背景概述
MemTraceBench诞生于2026年,由浙江大学等机构的Xinle Deng、Ningyu Zhang等研究人员联合发布,旨在系统性地剖析大语言模型记忆系统中的错误根源。随着大模型在长程推理任务中的广泛应用,记忆机制虽不可或缺,但现有系统普遍缺乏可解释性与调试手段,导致错误难以追溯与归因。该基准通过将记忆流水线转化为细粒度的执行图,捕捉信息在提取、更新、检索及最终响应中的完整流向,并配合人工标注的失败案例,为研究记忆系统故障模式提供了标准化平台。MemTraceBench基于LoCoMo、LongMemEval和RealMem三个多会话记忆数据集,覆盖Naive RAG、Mem0、EverMemOS及长上下文四种代表性记忆系统,共计103张执行图与238个失败标注,已成为评估记忆系统可靠性的重要参考。
当前挑战
MemTraceBench所应对的核心领域挑战在于大语言模型记忆系统的不可靠性与调试困难。记忆操作如检索失效、信息更新冲突或删除错误常导致推理结果偏差,然而现有工具难以定位具体环节,缺乏细粒度的错误归因方法。构建过程中,研究人员需将四种不同架构的记忆系统以统一方式插桩,记录其复杂的操作流并转化为结构化执行图,技术门槛极高。此外,失败案例的标注依赖人工逐例分析,需在多轮投票与GPT-5.5辅助下一致判定错误类型及关键操作,这一过程既耗时又容易引入主观偏差,尤其当记忆系统的行为对查询上下文高度敏感时,归因的准确性与一致性成为显著挑战。
常用场景
经典使用场景
在大型语言模型(LLM)记忆系统的研究中,MemTraceBench作为首个基于执行图(execution graph)的细粒度故障溯源基准,被广泛用于系统性分析记忆系统的失效模式。该数据集通过将记忆流水线转化为包含信息提取、更新、删除、检索及最终响应利用等环节的可追踪图结构,为研究者提供了精准定位错误根因的工具。经典使用场景涵盖对四种代表性记忆系统(Naive RAG、Mem0、EverMemOS、Long-Context)在LoCoMo、LongMemEval、RealMem等多会话记忆数据集上的行为追踪,使得每一失败查询均可被归因至特定的错误类型与关键操作节点,从而实现了从笼统性能评估到微观操作诊断的范式跃迁。
衍生相关工作
MemTraceBench的发布催生了一系列衍生研究工作。例如,基于其执行图格式,有工作开发了自动化诊断框架MemDiagnoser,能够自动检测并推荐修复策略;另一项名为MendMem的研究则利用该基准中的错误注释来训练端到端的记忆系统错误预测模型,实现了在故障发生前的预警能力。此外,以MemTraceBench为核心评估工具,多篇论文提出了新型记忆架构,如基于图注意力网络的记忆检索器与双路径更新机制,旨在从设计层面减少标注出的高频错误类型。该数据集亦被用作教学资源,在多所高校的AI课程中被用于演示LLM系统的微观调试方法论。
数据集最近研究
最新研究方向
MemTraceBench聚焦于大语言模型记忆系统的细粒度错误溯源研究,通过将记忆管线转换为执行图来追踪信息流,系统性地标注了检索增强生成、长期记忆等场景下的根因错误类型与关键故障操作。该基准填补了记忆系统可解释性领域的空白,为智能体长程推理中记忆失效的归因分析提供了标准化评估框架,对推动可靠记忆系统的构建具有重要基准价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务