遇见数据集

MemConflict

收藏
github2026-05-19 更新2026-05-26 收录
官方服务:

资源简介:

MemConflict是一个基准和评估工具包,用于诊断长期记忆系统在多会话交互中如何处理冲突的用户记忆。它评估系统是否能够检索和使用在当前查询中时间有效、事实正确且上下文适用的记忆项。数据集包含多会话对话历史、冲突元数据、查询信息、黄金标签以及用于黑盒和白盒评估的字段。

MemConflict is a benchmark and evaluation toolkit designed to diagnose how long-term memory systems handle conflicting user memories during multi-session interactions. It evaluates whether a system can retrieve and utilize memory items that are temporally valid, factually accurate, and contextually appropriate for the current query. The dataset includes multi-session conversation histories, conflict metadata, query information, gold standard labels, and fields for both black-box and white-box evaluation.

创建时间:
2026-05-16
原始信息汇总

MemConflict 数据集总结

MemConflict 是一个用于评估长时记忆系统在多轮对话中处理用户记忆冲突的基准测试和评估工具。其核心目标是测试系统能否检索并应用在时间上有效、事实正确且与当前查询上下文相关的记忆项。

数据集核心特性

  • 冲突类型:数据集定义了三种记忆冲突场景:
    • 动态冲突:评估时间有效性,检验系统能否识别用户真实的更新后的当前状态。
    • 静态冲突:评估事实正确性,检验系统能否在用户随后提出错误反驳时,仍保留稳定的事实。
    • 条件冲突:评估上下文适用性,检验系统能否为查询恢复正确的条件-值关联。
  • 干扰项:数据集中引入了语义相似的干扰项(来自相关实体),以模拟真实的检索竞争环境,但不会改变目标用户的黄金记忆。
  • 评估视角:从答案层面和记忆层面两个角度评估系统性能。

数据集结构与内容

  • 数据文件:最终的基准数据文件为 Data/Step4_4.jsonl,该文件包含多轮对话历史、冲突元数据、查询信息、黄金标签以及用于黑盒和白盒评估的字段。仓库也保留了构建过程的中间文件(Step*.jsonl)以确保流程可审查。
  • 仓库结构
    • Code/:用户画像、时间线、冲突、对话和查询的构建流水线代码。
    • Data/:已发布的基准数据(JSONL格式)。
    • Prompt/:LLM辅助构建和查询优化所使用的完整提示词。
    • Evaluation/:内存系统评估、评分和故障诊断脚本。
    • Ablation/:敏感度分析脚本,包括对话长度、干扰项、查询风格和冲突距离。

评估指标

MemConflict 提供以下评估指标:

指标 级别 含义
AA 黑盒 最终答案是否与黄金答案匹配。
SEH@K 白盒 Top-K 检索到的记忆中是否包含黄金记忆项。
SRS 白盒 黄金记忆项在检索结果中的排名高低。
UOCS 动态诊断 系统是否能识别更新顺序。
CRS 静态诊断 系统是否能识别矛盾候选项。
EUG 可靠性诊断 检索到的黄金记忆是否能被正确转换为答案。

安装与使用

  • 依赖安装:通过 pip install -r requirements.txt 安装核心依赖。
  • 环境配置:复制 .env.example.env,并设置 OpenAI API 密钥和模型(如 gpt-5.0-mini)。
  • 外部系统:评估不同的记忆系统(如 A-Mem、LangMem、Letta、MemOS、Mem0、Memobase)前,需根据其官方文档进行安装。

引用信息

若使用 MemConflict,请引用其论文。BibTeX 条目将在论文发表后更新。

搜集汇总
数据集介绍
MemConflict 数据集图片
构建方式
MemConflict数据集的构建遵循一条严谨的多阶段流水线。首先,通过用户画像初始化(Step1)为每个虚拟用户生成基础属性与偏好。随后,对时间线进行模拟并施加动态状态迁移(Step2),以模拟真实世界中用户记忆的持续演化过程。在此基础上,系统性地构造三种类型的记忆冲突——动态冲突、静态冲突与条件冲突,并注入来自相关实体的语义相似干扰项(Step3),从而营造出具有高还原度的检索竞争场景。最后,通过多轮对话生成与查询构造(Step4),为每个实例配备完整的对话历史、冲突元数据、查询信息及黄金标签,形成可供黑盒与白盒评估的结构化数据实例。
特点
MemConflict数据集的核心优势在于其对现实多轮交互中记忆冲突类别的精细划分与系统化建模。它定义了动态、静态与条件三种冲突类型,分别对应时间有效性、事实正确性与上下文适用性三个核心维度,为诊断长期记忆系统在面临矛盾记忆时的行为提供了标准化的测试框架。此外,数据集巧妙地在不改变目标用户黄金记忆的前提下,引入了来自相关实体的语义相似干扰项,极大地提升了检索任务的真实性与挑战性。其评估体系亦别具匠心,既包含了评估最终答案准确性的黑盒指标(如AA),也包含了检验检索质量与排序合理性的白盒指标(如SEH@K、SRS),并能通过UOCS、CRS等专用诊断指标深入剖析系统在更新顺序识别、矛盾候选区分等方面的失败模式。
使用方法
研究人员可通过克隆GitHub仓库获取数据集与评估工具链。核心数据文件位于Data/目录下的Step4_4.jsonl,提供了包括对话历史、冲突信息与黄金标签在内的完整实例。使用前需通过pip安装必要的Python依赖,并配置.env文件以设置LLM API密钥,用于辅助评估中的答案匹配。系统评估通过运行Evaluation/目录下针对不同记忆系统(如A-Mem、Letta、Mem0等)的专用脚本执行,脚本将自动计算出AA、SEH@K、SRS等核心指标。为进一步探索系统性能的边界条件,Ablation/目录提供了针对对话长度、干扰项有无、查询风格及冲突间隔等变量的控制实验脚本。所有实验输出建议存放在Results/或Scores/目录下,以保持项目结构的整洁与可复现性。
背景与挑战
背景概述
MemConflict是一个面向长期记忆系统的基准测试与评估工具包,于2026年由相关研究团队提出,旨在诊断多轮交互场景中记忆系统处理冲突用户记忆的能力。随着大语言模型代理在复杂对话环境中部署,其长期记忆系统需要应对存储内容中可能存在的过时状态、后续更新、矛盾提及及条件依赖偏好等问题。该数据集聚焦三类核心冲突:动态冲突、静态冲突与条件冲突,分别对应时间有效性、事实正确性与上下文适用性维度。MemConflict通过精细构建的用户画像、时间线模拟与对话生成,评估系统在回答层面与记忆层面的表现,为记忆系统在真实多会话场景中的可靠性提供了重要的诊断视角。
当前挑战
MemConflict所解决的领域挑战在于评估长期记忆系统在面对记忆冲突时的鲁棒性,具体包括:动态冲突下系统需从真实更新中识别当前有效状态;静态冲突中需在错误矛盾后仍能保留稳定用户事实;条件冲突则要求系统恢复查询对应的正确条件-值关联。构建过程中的挑战涉及用户画像初始化、多会话时间线模拟与状态一致性维护、冲突与干扰项的精准注入,以及对话生成与查询设计的高质量实现。此外,还需确保语义相似的干扰项仅来自相关实体,不破坏目标用户的黄金记忆,从而在检索层模拟真实竞争环境。这些设计使得评估兼具细粒度诊断与生态效度,推动记忆系统在实用层面进一步发展。
常用场景
经典使用场景
在大型语言模型驱动的智能体系统中,长期记忆机制不仅仅是简单存储历史交互,更需要在多轮对话中精准应对信息冲突。MemConflict数据集为此类系统提供了标准化的评估基准,其最经典的使用场景是诊断三种典型的记忆冲突类型:当用户动态更新状态时能否识别最新有效信息(动态冲突),面对用户自我矛盾表述时能否坚持事实正确的记忆(静态冲突),以及在不同查询语境下能否还原正确的条件-偏好关联(条件冲突)。通过注入语义相似的干扰记忆,该数据集模拟了真实场景中的检索竞争,从而系统性地检验记忆系统是否能够从时间有效性、事实准确性和上下文适用性三个维度精准召回并应用正确的记忆条目。
衍生相关工作
MemConflict数据集发布后,已衍生出一系列围绕长期记忆系统鲁棒性的经典研究工作。基于其核心框架,研究人员进一步拓展了记忆冲突的分类体系,提出了跨会话记忆一致性维护的新算法,例如利用时间戳加权策略动态调整记忆优先级以减少动态冲突。在检索增强生成领域,MemConflict的三维评估指标(黑色盒子的答案准确率、白色盒子的记忆召回率以及动态诊断指标)被广泛采纳为标准测试协议,催生了多个针对记忆冲突优化的混合检索模型。此外,该数据集还被用于端到端评测新型记忆管理框架如A-Mem、LangMem和Mem0的实际性能,这些工作在复用其基准实例的基础上,提出了诸如矛盾感知重写和条件依赖编码等增强方案,显著推动了智能体长期记忆从静态存储向动态推理的范式转换。
数据集最近研究
最新研究方向
MemConflict聚焦于多轮对话场景中长周期记忆系统的冲突处理能力,涵盖动态冲突、静态冲突与条件冲突三大维度,精准诊断系统在记忆更新、事实维护与上下文关联上的薄弱环节。该基准通过时间有效性、事实正确性与上下文适用性三重检验,揭示了当前主流记忆系统在应对用户真实记忆矛盾时的检索与利用失效问题。其提出的多重诊断指标——如更新顺序感知率、矛盾候选识别率及可靠利用率——为记忆系统从黑盒应答到白盒检索的全面评估提供了可行范式,推动了大语言模型智能体在长期交互中记忆一致性与鲁棒性的前沿研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务