遇见数据集

PrecisionMemBench

收藏
github2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

PrecisionMemBench是一个用于LLM记忆系统的多维检索基准测试数据集,测量四个正交属性:检索精度、噪声隔离、会话轮次延迟和信念可变性,包含89个案例,覆盖别名解析、范围消歧、超链排除、模糊匹配、跨用户隔离、预算驱逐、排名稳定性以及多轮主题漂移下的会话级噪声隔离。

PrecisionMemBench is a multi-dimensional retrieval benchmark dataset for LLM memory systems, which measures four orthogonal attributes: retrieval precision, noise isolation, conversation turn latency, and belief variability. It contains 89 cases covering alias resolution, scope disambiguation, hyperlink exclusion, fuzzy matching, cross-user isolation, budget eviction, ranking stability, and session-level noise isolation under multi-turn topic drift.

创建时间:
2026-05-27
原始信息汇总

PrecisionMemBench 数据集详情

概述

PrecisionMemBench 是一个面向 LLM 记忆系统的多维度检索基准测试,衡量单轮答案质量基准无法检测的四个正交属性:

  • 检索精度 - 正确的信念是否出现,且只有该信念出现
  • 噪声隔离 - 非主题漂移轮次引入的信念是否会污染后续无关轮次的检索
  • 会话轮次延迟 - 检索延迟在会话负载下是否相对于单轮基线下降
  • 信念可变性 - 会话中期更新的信念是否通过别名丰富飞轮在同一会话内立即出现

包含 89 个测试用例,涵盖:别名解析、范围消歧、替代链排除、模糊匹配、跨用户隔离、预算驱逐、排名稳定性、多轮话题漂移下的会话级噪声隔离。

论文链接:arXiv
数据集链接:HuggingFace
排行榜链接:HuggingFace Spaces

测试结果

检索精度

系统 主动通过数 总通过数 平均精度 平均召回率 检索p50 (ms) 写入耗时 (s)
Tenure 43 89/89 1.00 1.00 9.77 0.98
SuperMemory 17 46/89 0.43 0.55 819.48 -
YourMemory 0 9/89 0.14 0.90 317.14 17
Zep 0 9/89 0.09 0.95 124.36 897.04
Vector (mxbai) 0 11/89 0.09 1.00 71.87 -
Hindsight 0 9/89 0.06 1.00 589.86 173.28
Mem0 0 9/89 0.05 0.99 64.94 114.19
A-mem 0 9/89 0.05 0.99 13.8 178.77

通过类型细分(77个非会话用例)

系统 主动检索 结构性 平凡空
Tenure 43 25 9
SuperMemory 17 18 9
YourMemory 0 6 3
Vector (mxbai) 0 8 3
Mem0 0 6 3
Zep 0 6 3
Hindsight 0 6 3
A-mem 0 6 3

嵌入模型不变性

模型 精度 召回率 通过数 平均 (ms) p95 (ms)
nomic-embed-text (768) 0.09 1.0 11/77 43.36 85.21
mxbai-embed-large (1024) 0.09 1.0 11/77 96.48 257.24
qwen3-8b (4096) 0.09 1.0 11/77 1130.95 2604.84

会话级噪声隔离(漂移分数)

轮次 Tenure Vector Mem0 Zep Hindsight SuperMemory YourMemory A-mem
第9轮(隐式返回) 0.0 1.0 1.0 1.0 1.0 0.0 1.0 1.0
第10轮(显式返回) 0.0 0.94 1.0 1.0 0.94 0.0 ‡ 0.83 0.94
跨会话形成期 0.0 0.94 1.0 0.92 1.0 0.0 ‡ 0.8 0.94

检索和写入延迟

系统 平均 (ms) p50 (ms) p95 (ms) 写入总耗时 (s)
Tenure 13.49 9.77 53.99 0.98
SuperMemory 821.27 819.48 1,228.91
YourMemory 350.78 317.14 573.35 17
Vector 96.48 71.87 257.24
Mem0 78.81 64.94 156.89 114.19
Zep 139.64 124.36 235.04 897.04
Hindsight 672.15 589.86 1,185.33 173.28
A-mem 19.34 13.8 27.92 178.77

测试用例分类

类别 用例数
别名解析 23
范围消歧 12
会话级噪声隔离 12
模糊匹配与前缀防护 8
设计边界用例 6
类型路由与开放问题 6
预算驱逐与容量 5
关系扩展 4
角色开场白内容 4
替代链排除 3
排名稳定性 3
反信号检索 2
跨用户隔离 1
冷启动行为 1

评估指标

每用例记录四项指标:

  • 检索精度与召回率 - 针对携带有效断言的 relevantBeliefs 层级计算
  • 固定信念覆盖率 - 记录在断言了 pinnedFacts 层级的用例上
  • 问题精度与召回率 - 记录在断言了 openQuestions 层级的用例上
  • 漂移分数 - 会话用例专用指标,从漂移轮次主题中检索的非固定信念的比例

一个通过需要所有断言的层级同时满足。携带 retrievalPrecision: 1.0 但未满足 pinnedCoverage 断言的用例判定为失败。

搜集汇总
数据集介绍
PrecisionMemBench 数据集图片
构建方式
PrecisionMemBench 是一个面向大语言模型记忆系统的多维检索基准测试集,其构建方式以考察传统单轮答案质量评测所无法捕捉的正交属性为核心。该数据集精心设计了89个测试案例,涵盖别名解析、范围消歧、替代链排除、模糊匹配、跨用户隔离、预算驱逐、排序稳定性及多轮话题漂移下的会话级噪声隔离等维度。每个案例不仅规定了记忆系统必须返回的正确信念,还明确界定了不得返回的内容,将噪声视为硬性失败而非隐形的推理代价。所有案例基于一个包含35个信念的固定种子语料库构建,这些信念分布在两个领域范围、一条替代链及一个次级用户装置之上,从而为评估检索精确性、噪声隔离能力、会话轮次延迟及信念可变性提供了结构化测试框架。
使用方法
使用 PrecisionMemBench 进行评测需遵循标准化的流程。用户需通过 Docker 和 Node.js 运行基准测试程序,首先安装依赖并启动相应比较提供商的栈,随后使用 `MEMORY_PROVIDER` 环境变量指定目标系统,执行 `retrieval.external.eval.test.ts` 和 `session-retrieval.external.eval.test.ts` 两个测试文件。评测产生的报告将存储于 `test-results/` 目录下。若要添加新的记忆提供商,需编写一个暴露 `/add`、`/search` 和 `/reset` 三个端点的 FastAPI 服务封装器,并在 `providers.config.json` 中注册。测试结果可导出至 HuggingFace 格式并提交至排行榜,所有运行报告应以 `retrieval-report-{provider}.json` 的命名约定存入 `test-results/baseline/` 目录后通过拉取请求提交。
背景与挑战
背景概述
大型语言模型记忆系统的检索精度是制约其长期语义连贯性的关键瓶颈,传统单轮问答基准无法捕捉检索时的噪声干扰、时序漂移与状态变更等正交属性。PrecisionMemBench 由 Jeffrey Flynt 于 2026 年提出,来自 Tenure 团队,旨在系统性地评估记忆系统在检索精度、噪声隔离、会话延迟与信念可变性四个维度上的独立表现。该基准通过 89 个精心构造的测试用例,覆盖别名消歧、范围区分、超链条排除、模糊匹配、跨用户隔离、预算淘汰、排名稳定性及多轮话题漂移下的噪声隔离等场景,为大模型记忆系统的工程实现与学术评估提供了首个精度驱动的标准化评测框架,对推动实时记忆检索系统的可信部署具有里程碑意义。
当前挑战
当前领域面临的核心挑战在于现有记忆系统普遍缺乏检索精度保障,多数系统虽能实现高召回率却返回大量无关信念,导致平均精度仅 0.05 至 0.09。具体挑战包括:1)多轮会话中离题轮次引入的噪声会污染后续无关节目的检索,测试中多数系统漂移度接近 1.0,远未达到完美隔离;2)信念可变性要求系统能在同一次会话中即时更新并呈现被中途修正的信念,但多数系统缺乏写入时变异原语,导致该属性成为架构缺失而非性能差异;3)会话负载下检索延迟严重退化,单轮基准掩盖了实际劣化程度,如 Hindsight 平均延迟从 672ms 飙升至会话场景下的 2700ms 以上;4)构建基准本身需设计 89 个去耦测试用例以确保四维正交性,同时维护别名消歧、范围路由、预算淘汰等复杂逻辑的断言机制,对测试框架的完备性和可复现性提出了极高要求。
常用场景
经典使用场景
PrecisionMemBench是一项专为大语言模型记忆系统设计的全维度检索基准,其最经典的使用场景在于评估记忆系统在复杂对话历程中的精确信念检索能力。该基准通过89个精心构造的测试用例,涵盖别名解析、领域消歧、替代链排除、模糊匹配、跨用户隔离、预算驱逐、排序稳定性以及多轮话题漂移下的会话级噪声隔离等关键维度。与传统仅关注单轮回答质量的指标不同,PrecisionMemBench从检索精度、噪声隔离、会话轮次延迟和信念可变性四个正交属性出发,系统性地衡量记忆系统在真实交互中能否精准召回目标信念,同时严格拒绝无关干扰,为记忆系统的鲁棒性评估树立了全新标杆。
解决学术问题
PrecisionMemBench有效解决了学术界长期存在的记忆系统评估碎片化与浅层次问题。过往研究多依赖单轮问答准确率或简单召回率,这些指标无法揭示系统在多主题交织、信念频繁更新的会话场景中是否真正具备结构化记忆能力。该基准引入的"主动检索通过"概念,区分了系统是因正确推理通过测试,还是因返回大量无关内容而获得虚假的高召回,从根本上杜绝了评估中的噪声掩盖效应。其对会话级漂移噪声、信念中途更新后即时响应等机制的测试,推动了记忆系统从静态知识库向动态信念状态的学术范式演进,为后续研究提供了严格、可复现的比较框架与语义丰富的评估方法论。
实际应用
在实际应用中,PrecisionMemBench所评测的能力直接影响着记忆增强型对话系统的用户体验与可靠性。在智能助手场景中,用户可能会在多轮对话中频繁切换话题、提及不同别名、甚至修正先前陈述,系统只有具备高精度的信念检索和抗干扰能力,才能准确回应用户最新意图。在个性化推荐与长期用户画像构建领域,记忆系统需要从数十轮交互中提炼出用户的核心属性变动,PrecisionMemBench对预算驱逐和排序稳定性的测试,确保了系统在有限记忆容量下的关键信息优先保持能力。此外,跨用户隔离测试对多租户场景至关重要,确保不同用户的信念数据在语义相近时仍能严格互不干扰,降低隐私泄露风险。
数据集最近研究
最新研究方向
随着大语言模型在长期对话与个性化交互场景中的广泛应用,记忆系统的检索精度与噪声隔离能力成为评测的核心挑战。PrecisionMemBench作为首个面向LLM记忆系统的多维检索基准,突破了传统单轮问答评测的局限,从检索精度、噪声隔离、会话延迟与信念可变性四个正交维度全面评估记忆系统的真实能力。该基准涵盖89个测试用例,覆盖别名消歧、作用域区分、模糊匹配、跨用户隔离与多轮话题漂移下的噪声鲁棒性等前沿研究方向,揭示了当前主流记忆系统在精确检索任务上的显著短板——即使召回率接近完美,精度却普遍低于0.1,表明多轮对话中无关信念污染问题亟待解决。这一基准的发布为构建高保真、低污染的记忆系统提供了可复现的评测范式,对推动长期记忆增强型LLM在客服、数字人与医疗等敏感领域的可信部署具有重要指导意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务