MemConflict
收藏资源简介:
MemConflict是一个基准和评估工具包,用于诊断长期记忆系统在多会话交互中如何处理冲突的用户记忆。它评估系统是否能够检索和使用在当前查询中时间有效、事实正确且上下文适用的记忆项。数据集包含多会话对话历史、冲突元数据、查询信息、黄金标签以及用于黑盒和白盒评估的字段。
MemConflict is a benchmark and evaluation toolkit designed to diagnose how long-term memory systems handle conflicting user memories during multi-session interactions. It evaluates whether a system can retrieve and utilize memory items that are temporally valid, factually accurate, and contextually appropriate for the current query. The dataset includes multi-session conversation histories, conflict metadata, query information, gold standard labels, and fields for both black-box and white-box evaluation.
MemConflict 数据集总结
MemConflict 是一个用于评估长时记忆系统在多轮对话中处理用户记忆冲突的基准测试和评估工具。其核心目标是测试系统能否检索并应用在时间上有效、事实正确且与当前查询上下文相关的记忆项。
数据集核心特性
- 冲突类型:数据集定义了三种记忆冲突场景:
- 动态冲突:评估时间有效性,检验系统能否识别用户真实的更新后的当前状态。
- 静态冲突:评估事实正确性,检验系统能否在用户随后提出错误反驳时,仍保留稳定的事实。
- 条件冲突:评估上下文适用性,检验系统能否为查询恢复正确的条件-值关联。
- 干扰项:数据集中引入了语义相似的干扰项(来自相关实体),以模拟真实的检索竞争环境,但不会改变目标用户的黄金记忆。
- 评估视角:从答案层面和记忆层面两个角度评估系统性能。
数据集结构与内容
- 数据文件:最终的基准数据文件为
Data/Step4_4.jsonl,该文件包含多轮对话历史、冲突元数据、查询信息、黄金标签以及用于黑盒和白盒评估的字段。仓库也保留了构建过程的中间文件(Step*.jsonl)以确保流程可审查。 - 仓库结构:
Code/:用户画像、时间线、冲突、对话和查询的构建流水线代码。Data/:已发布的基准数据(JSONL格式)。Prompt/:LLM辅助构建和查询优化所使用的完整提示词。Evaluation/:内存系统评估、评分和故障诊断脚本。Ablation/:敏感度分析脚本,包括对话长度、干扰项、查询风格和冲突距离。
评估指标
MemConflict 提供以下评估指标:
| 指标 | 级别 | 含义 |
|---|---|---|
| AA | 黑盒 | 最终答案是否与黄金答案匹配。 |
| SEH@K | 白盒 | Top-K 检索到的记忆中是否包含黄金记忆项。 |
| SRS | 白盒 | 黄金记忆项在检索结果中的排名高低。 |
| UOCS | 动态诊断 | 系统是否能识别更新顺序。 |
| CRS | 静态诊断 | 系统是否能识别矛盾候选项。 |
| EUG | 可靠性诊断 | 检索到的黄金记忆是否能被正确转换为答案。 |
安装与使用
- 依赖安装:通过
pip install -r requirements.txt安装核心依赖。 - 环境配置:复制
.env.example为.env,并设置 OpenAI API 密钥和模型(如gpt-5.0-mini)。 - 外部系统:评估不同的记忆系统(如 A-Mem、LangMem、Letta、MemOS、Mem0、Memobase)前,需根据其官方文档进行安装。
引用信息
若使用 MemConflict,请引用其论文。BibTeX 条目将在论文发表后更新。





