PrecisionMemBench
收藏资源简介:
PrecisionMemBench是一个用于LLM记忆系统的多维检索基准测试数据集,测量四个正交属性:检索精度、噪声隔离、会话轮次延迟和信念可变性,包含89个案例,覆盖别名解析、范围消歧、超链排除、模糊匹配、跨用户隔离、预算驱逐、排名稳定性以及多轮主题漂移下的会话级噪声隔离。
PrecisionMemBench is a multi-dimensional retrieval benchmark dataset for LLM memory systems, which measures four orthogonal attributes: retrieval precision, noise isolation, conversation turn latency, and belief variability. It contains 89 cases covering alias resolution, scope disambiguation, hyperlink exclusion, fuzzy matching, cross-user isolation, budget eviction, ranking stability, and session-level noise isolation under multi-turn topic drift.
PrecisionMemBench 数据集详情
概述
PrecisionMemBench 是一个面向 LLM 记忆系统的多维度检索基准测试,衡量单轮答案质量基准无法检测的四个正交属性:
- 检索精度 - 正确的信念是否出现,且只有该信念出现
- 噪声隔离 - 非主题漂移轮次引入的信念是否会污染后续无关轮次的检索
- 会话轮次延迟 - 检索延迟在会话负载下是否相对于单轮基线下降
- 信念可变性 - 会话中期更新的信念是否通过别名丰富飞轮在同一会话内立即出现
包含 89 个测试用例,涵盖:别名解析、范围消歧、替代链排除、模糊匹配、跨用户隔离、预算驱逐、排名稳定性、多轮话题漂移下的会话级噪声隔离。
论文链接:arXiv
数据集链接:HuggingFace
排行榜链接:HuggingFace Spaces
测试结果
检索精度
| 系统 | 主动通过数 | 总通过数 | 平均精度 | 平均召回率 | 检索p50 (ms) | 写入耗时 (s) |
|---|---|---|---|---|---|---|
| Tenure | 43 | 89/89 | 1.00 | 1.00 | 9.77 | 0.98 |
| SuperMemory | 17 | 46/89 | 0.43 | 0.55 | 819.48 | - |
| YourMemory | 0 | 9/89 | 0.14 | 0.90 | 317.14 | 17 |
| Zep | 0 | 9/89 | 0.09 | 0.95 | 124.36 | 897.04 |
| Vector (mxbai) | 0 | 11/89 | 0.09 | 1.00 | 71.87 | - |
| Hindsight | 0 | 9/89 | 0.06 | 1.00 | 589.86 | 173.28 |
| Mem0 | 0 | 9/89 | 0.05 | 0.99 | 64.94 | 114.19 |
| A-mem | 0 | 9/89 | 0.05 | 0.99 | 13.8 | 178.77 |
通过类型细分(77个非会话用例)
| 系统 | 主动检索 | 结构性 | 平凡空 |
|---|---|---|---|
| Tenure | 43 | 25 | 9 |
| SuperMemory | 17 | 18 | 9 |
| YourMemory | 0 | 6 | 3 |
| Vector (mxbai) | 0 | 8 | 3 |
| Mem0 | 0 | 6 | 3 |
| Zep | 0 | 6 | 3 |
| Hindsight | 0 | 6 | 3 |
| A-mem | 0 | 6 | 3 |
嵌入模型不变性
| 模型 | 精度 | 召回率 | 通过数 | 平均 (ms) | p95 (ms) |
|---|---|---|---|---|---|
| nomic-embed-text (768) | 0.09 | 1.0 | 11/77 | 43.36 | 85.21 |
| mxbai-embed-large (1024) | 0.09 | 1.0 | 11/77 | 96.48 | 257.24 |
| qwen3-8b (4096) | 0.09 | 1.0 | 11/77 | 1130.95 | 2604.84 |
会话级噪声隔离(漂移分数)
| 轮次 | Tenure | Vector | Mem0 | Zep | Hindsight | SuperMemory | YourMemory | A-mem |
|---|---|---|---|---|---|---|---|---|
| 第9轮(隐式返回) | 0.0 | 1.0 | 1.0 | 1.0 | 1.0 | 0.0 | 1.0 | 1.0 |
| 第10轮(显式返回) | 0.0 | 0.94 | 1.0 | 1.0 | 0.94 | 0.0 ‡ | 0.83 | 0.94 |
| 跨会话形成期 | 0.0 | 0.94 | 1.0 | 0.92 | 1.0 | 0.0 ‡ | 0.8 | 0.94 |
检索和写入延迟
| 系统 | 平均 (ms) | p50 (ms) | p95 (ms) | 写入总耗时 (s) |
|---|---|---|---|---|
| Tenure | 13.49 | 9.77 | 53.99 | 0.98 |
| SuperMemory | 821.27 | 819.48 | 1,228.91 | — |
| YourMemory | 350.78 | 317.14 | 573.35 | 17 |
| Vector | 96.48 | 71.87 | 257.24 | — |
| Mem0 | 78.81 | 64.94 | 156.89 | 114.19 |
| Zep | 139.64 | 124.36 | 235.04 | 897.04 |
| Hindsight | 672.15 | 589.86 | 1,185.33 | 173.28 |
| A-mem | 19.34 | 13.8 | 27.92 | 178.77 |
测试用例分类
| 类别 | 用例数 |
|---|---|
| 别名解析 | 23 |
| 范围消歧 | 12 |
| 会话级噪声隔离 | 12 |
| 模糊匹配与前缀防护 | 8 |
| 设计边界用例 | 6 |
| 类型路由与开放问题 | 6 |
| 预算驱逐与容量 | 5 |
| 关系扩展 | 4 |
| 角色开场白内容 | 4 |
| 替代链排除 | 3 |
| 排名稳定性 | 3 |
| 反信号检索 | 2 |
| 跨用户隔离 | 1 |
| 冷启动行为 | 1 |
评估指标
每用例记录四项指标:
- 检索精度与召回率 - 针对携带有效断言的
relevantBeliefs层级计算 - 固定信念覆盖率 - 记录在断言了
pinnedFacts层级的用例上 - 问题精度与召回率 - 记录在断言了
openQuestions层级的用例上 - 漂移分数 - 会话用例专用指标,从漂移轮次主题中检索的非固定信念的比例
一个通过需要所有断言的层级同时满足。携带 retrievalPrecision: 1.0 但未满足 pinnedCoverage 断言的用例判定为失败。




