遇见数据集

precisionmembench

收藏
Hugging Face2026-05-29 更新2026-05-30 收录
官方服务:

资源简介:

PrecisionMemBench是一个用于评估大语言模型(LLM)记忆系统检索能力的多维度基准测试数据集。它旨在解决单轮问答质量基准的局限性,专门测量四个关键属性:检索精度(确保在固定的35个信念种子语料库中仅返回正确信念)、噪声隔离(评估多轮会话中无关话题引入的信念是否污染后续检索)、会话轮次延迟(衡量会话负载下检索延迟相对于单轮基线的退化)以及信念可变性(测试会话中期更新的信念能否通过别名富集机制立即生效)。数据集包含89个测试用例,覆盖别名解析、范围消歧、链式替换排除、模糊匹配、跨用户隔离、预算淘汰、排名稳定性及多轮话题漂移下的会话级噪声隔离等复杂场景。核心是一个精心构建的种子语料库,包含35个信念,设计用于测试两个不同领域范围、一个信念替换链和一个二级用户装置。数据以结构化JSON文件形式提供,包括单轮检索评估结果和会话评估结果,详细记录测试用例ID、类别、描述、检索到的信念列表、精度与召回率、通过断言状态、失败信息和检索延迟等指标。该数据集主要用于客观、精细地评测和比较不同LLM记忆系统(如Tenure、SuperMemory、AgentMemory等)在精确信息检索方面的性能,特别关注检索结果在剥离生成模型后能否直接支持下游分类器、规则引擎等结构化处理流程。排行榜数据展示了各系统在主动检索通过率、精度、召回率和延迟等方面的表现差异。

PrecisionMemBench is a multi-dimensional benchmark dataset for evaluating the retrieval capabilities of large language model (LLM) memory systems. It addresses the limitations of single-turn question answering quality benchmarks, and specifically measures four core attributes: "Retrieval Precision" (ensuring that only correct beliefs are returned from the fixed 35-belief seed corpus), "Noise Isolation" (evaluating whether beliefs introduced by off-topic content in multi-turn conversations contaminate subsequent retrievals), "Conversation Turn Latency" (measuring the degradation of retrieval latency under conversational load relative to the single-turn baseline), and "Belief Variability" (testing whether beliefs updated mid-conversation can take effect immediately via alias enrichment mechanisms). The dataset includes 89 test cases covering complex scenarios such as alias resolution, scope disambiguation, chain substitution exclusion, fuzzy matching, cross-user isolation, budget elimination, ranking stability, and session-level noise isolation under multi-turn topic drift. At its core lies a meticulously curated seed corpus containing 35 beliefs, designed to test two distinct domain scopes, one belief substitution chain, and a secondary user setup. The data is provided in structured JSON files, encompassing single-turn retrieval evaluation results and conversational evaluation results, with detailed records of metrics including test case ID, category, description, retrieved belief list, precision and recall, pass assertion status, failure information, and retrieval latency. This dataset is mainly used to objectively and precisely evaluate and compare the performance of various LLM memory systems (such as Tenure, SuperMemory, AgentMemory, etc.) in precise information retrieval, with particular attention to whether retrieval results can directly support structured processing workflows like downstream classifiers and rule engines after stripping away the generative model. Leaderboard data showcases the performance differences of each system in terms of active retrieval pass rate, precision, recall, and latency.

创建时间:
2026-05-27
原始信息汇总

数据集概述:PrecisionMemBench

PrecisionMemBench 是一个专为 LLM 记忆系统设计的多维检索基准,旨在评估单轮问答质量基准无法检测的四个正交属性:检索精度、噪声隔离、会话轮次延迟和信念可变性。

核心评估维度

  • 检索精度 (Retrieval precision):在包含35个信念的固定种子语料库中,正确的信念是否被检索到,且仅检索到该信念。
  • 噪声隔离 (Noise isolation):在包含10轮离题话题的会话中,先前引入的信念是否会污染后续无关话题的检索结果。
  • 会话轮次延迟 (Session-turn latency):检索延迟在会话负载下是否相对于单轮基线有所退化。
  • 信念可变性 (Belief mutability):在会话中期更新的信念是否能立即在同一会话中被检索到。

数据集规模与用例

  • 总用例数: 89个
  • 覆盖的检索维度: 别名解析、范围消歧、超期链排除、模糊匹配、跨用户隔离、预算驱逐、排序稳定性、多轮话题漂移下的会话级噪声隔离。

基准测试结果 (Leaderboard)

主要检索结果 (截至报告日期)

提供商 (Provider) 活跃通过数 (Active passes) 总通过数 (Total passes) 平均精度 (Mean precision) 平均召回率 (Mean recall) 检索中位数延迟 (Retrieval p50) 摄入总耗时 (Ingestion total)
tenure 43/43 77/77 1.00 1.00 9.77 ms 1.00 s
supermemory 17/17 44/77 0.43 0.55 819.48 ms 0.00 s
gbrain 5/5 34/77 0.14 0.17 543.84 ms 28.60 s
yourmemory 0/0 21/77 0.17 0.88 313.39 ms 16.40 s
vector 0/0 11/77 0.09 1.00 71.87 ms
atomicmemory 0/0 9/77 0.15 0.95 71.01 ms 658.90 s
zep 0/0 9/77 0.09 0.95 124.36 ms 897.00 s
a-mem 0/0 9/77 0.06 0.99 13.80 ms 178.80 s
hindsight 0/0 9/77 0.06 1.00 589.86 ms 173.30 s
mem0 0/0 9/77 0.06 0.99 64.94 ms 111.30 s
agentmemory 0/0 7/77 0.17 0.97 82.28 ms 1.10 s

通过类型细分

提供商 (Provider) 活跃检索 (Active retrieval) 结构 (Structural) 平凡空 (Trivially empty)
tenure 43 25 9
supermemory 17 18 9
gbrain 5 20 9
a-mem 0 6 3
agentmemory 0 5 2
atomicmemory 0 6 3
hindsight 0 6 3
mem0 0 6 3
vector 0 8 3
yourmemory 0 15 6
zep 0 6 3

嵌入模型不变性 (向量基线)

模型 (Model) 精度 (Precision) 召回率 (Recall) 通过数 (Passes) 平均延迟 (Mean) P95延迟 (p95)
nomic-embed-text (768) 0.09 1.0 11/77 43.36 ms 85.21 ms
mxbai-embed-large (1024) 0.09 1.0 11/77 96.48 ms 257.24 ms
qwen3-8b (4096) 0.09 1.0 11/77 1130.95 ms 2604.84 ms

会话评估——多轮话题漂移下的噪声隔离

提供商 (Provider) 通过轮次 (Turns passed) 通过率 (Pass rate) 平均漂移 (Mean drift) 噪声隔离 (Noise isolation) 平均精度 (Mean precision) 会话中位数延迟 (Session p50)
tenure 12/12 1.00 0.0000 1.00 1.0000 47.79 ms
supermemory 2/12 0.17 0.1667 0.17 0.6000 867.83 ms
yourmemory 1/12 0.08 0.7365 0.08 0.1965 430.49 ms
gbrain 1/12 0.08 0.0000 0.08 535.61 ms
agentmemory 0/12 0.00 0.8087 0.00 0.1913 98.49 ms
atomicmemory 0/12 0.00 0.8449 0.00 0.1551 355.08 ms
zep 0/12 0.00 0.8888 0.00 0.1112 418.13 ms
vector 0/12 0.00 0.9142 0.00 0.0858 256.75 ms
a-mem 0/12 0.00 0.9259 0.00 0.0741 25.66 ms
hindsight 0/12 0.00 0.9285 0.00 0.0715 1880.60 ms
mem0 0/12 0.00 0.9398 0.00 0.0602 377.93 ms

数据文件字段 (results/文件夹)

检索评估结果 (results/<provider>.json)

字段 (Field) 类型 (Type) 描述 (Description)
caseId str 唯一的用例标识符
category str 用例类别 (如别名解析、范围消歧等)
description str 人类可读的用例描述
pinnedBeliefs list 在固定事实层级中返回的信念ID
relevantBeliefs list 在相关信念层级中返回的信念ID
retrievalPrecision float 或 null 活跃断言用例的检索精度;若无断言则为null
retrievalRecall float 或 null 活跃断言用例的检索召回率;若无断言则为null
passed bool 所有断言的层级是否同时满足
failures list 若未通过,则为失败原因列表
retrievalLatencyMs float 端到端检索延迟,单位为毫秒

会话评估结果 (results/session-<provider>.json)

字段 (Field) 类型 (Type) 描述 (Description)
caseId str 会话用例标识符
turnIndex int 用例中的轮次编号 (从0开始)
label str 轮次标签 (如 establishes_topic, drift 等)
retrievedBeliefIds list 该轮次作为相关信念返回的信念ID
pinnedBeliefIds list 该轮次作为固定信念返回的信念ID
noiseBeliefIds list 尽管有mustNotSurface断言但仍出现的信念ID
driftScore float 1 - retrievalPrecision;0为完美,1为完全噪声
passed bool 该轮次所有断言是否满足
failures list 若未通过,则为失败原因列表
retrievalLatencyMs float 端到端检索延迟,单位为毫秒

通过类型 (Pass Taxonomy)

  • 活跃检索通过 (Active retrieval pass):用例包含 retrievalPrecision 断言且被满足。这是唯一能证明系统检索能力的通过类型。
  • 结构通过 (Structural pass):用例断言了范围隔离、超期排除或类型路由,但不包含精度断言。
  • 平凡空通过 (Trivially empty pass):用例预期的 relevantBeliefs 层为空。任何系统返回空集即可通过。

引用

bibtex @article{flynt2026precisionmembench, title = {Structured Belief State and the First Precision-Aware Benchmark for LLM Memory Retrieval}, author = {Flynt, Jeffrey}, year = {2026} }

资源链接

搜集汇总
数据集介绍
precisionmembench 数据集图片
构建方式
PrecisionMemBench是一个专为评估大语言模型记忆系统检索能力而设计的多维度基准测试集。该数据集的核心构建逻辑基于一个囊括35条信念的固定种子语料库,这些信念跨越两个领域范围、一条替代链以及一个次级用户固定集。基准测试精心设计了89个测试案例,涵盖别名解析、范围消歧、替代链排除、模糊匹配、跨用户隔离、预算淘汰、排名稳定性以及多轮主题漂移下的会话级噪声隔离等关键维度。每个案例不仅明确规定了记忆系统必须返回的内容,更严格界定了其绝不能返回的元素,将噪声视为硬性失败,而非不可见的推理成本。
特点
该数据集的核心特点在于其正交多维度的评估架构,能够独立测量单轮问答质量基准所无法捕捉的四个关键属性:检索精度、噪声隔离能力、会话轮次延迟以及信念可变性。具体而言,它严格检验系统是否仅精确筛选出正确的信念,能否在无关主题漂移轮次中防止污染,会话负载下的延迟是否退化,以及信念更新能否在同会话内即时反映。尤为突出的是,该基准揭示了当前主流LLM记忆提供商在召回率接近完美时,检索精度却普遍低至0.04至0.11的严重结构性缺陷,且此现象在多种嵌入模型上具有不变性。
使用方法
用户可通过运行特定的npm脚本命令在本地复现基准测试结果,例如使用'MEMORY_PROVIDER=mem0 npx ava retrieval.external.eval.test.ts'对特定提供商执行检索评估,或通过'session-retrieval.external.eval.test.ts'进行会话级评估。新增提供商只需在'providers.config.json'中添加配置对象,评估框架无需改动。评估完成后,运行'python export_to_hf.py'脚本可将结果导出为HuggingFace格式。测试生成的结果文件以JSON格式存储,包含案例ID、类别、检索精度与召回率、延迟等详细字段,用户可按需分析系统的具体表现。
背景与挑战
背景概述
PrecisionMemBench 是由 Jeffrey Flynt 及其团队于2026年创建的多维度检索基准测试,专注于评估大型语言模型(LLM)记忆系统的检索能力。该基准源于对现有检索评估方法的深刻反思——传统单轮答案质量评估无法揭示记忆系统在交互式会话中的关键缺陷,如噪声干扰、语义漂移和更新延迟。通过涵盖别名消解、范围消歧、取代链排除、模糊匹配、跨用户隔离等89个测试用例,PrecisionMemBench 旨在系统性地衡量检索精度、噪声隔离、会话轮次延迟和信念可变性这四个独立维度,为LLM记忆系统的性能评估提供了前所未有的精细化工具。其影响力体现在揭示了当前主流记忆系统在结构化的非生成式任务中普遍存在的检索噪声问题,推动了该领域向更可靠、更透明的方向演进。
当前挑战
PrecisionMemBench 所解决的领域问题核心在于LLM记忆系统的检索精度与鲁棒性。现有系统在LLM作为评估者时,因生成模型能隐性补偿检索噪声而掩盖了性能缺陷,但在规则引擎或分类器等结构化流水线中却表现不佳——正确信息虽被召回,却因大量噪声而无法被有效利用,这种失效是结构性的。构建过程中,研究者面临的核心挑战包括:设计能够独立测试四个正交属性的正交化评估框架、构建固定种子语料库以控制变量、区分主动检索与平凡通过的不同贡献、以及确保评估结果对嵌入模型具有跨尺度不变性。此外,还需模拟多轮主题漂移下的噪声隔离场景,准确记录会话级延迟退化,并在指标设计中严格区分架构缺陷与性能差异,避免被简单通过率所误导。
常用场景
经典使用场景
在大型语言模型(LLM)记忆系统的评估领域,PrecisionMemBench作为首个面向检索精度的多维基准,广泛应用于测评记忆系统在复杂对话场景下的核心能力。该基准通过89个精心设计的测试用例,覆盖别名解析、作用域消歧、继承链排除、模糊匹配、跨用户隔离等高阶检索挑战,系统性地衡量模型在固定信念种子库上的检索精度、噪声隔离能力、会话延迟特性以及信念的可变性。研究者可利用该基准精准诊断记忆系统在单轮检索质量之外的隐性缺陷,从而推动LLM记忆组件向更可靠、更抗干扰的方向演进。
实际应用
实际应用中,PrecisionMemBench为构建高可靠性记忆系统提供了严苛的验证标准。在会话型AI代理、个性化助手、知识密集型对话系统等场景中,该基准可评估系统能否在长达十轮的主题漂移对话中保持噪声隔离,能否在信念更新后即时生效,以及能否在高并发会话负载下维持稳定延迟。企业级应用如客户服务、医疗咨询、金融决策辅助等,依赖记忆系统精确检索用户偏好、历史交互与领域知识,PrecisionMemBench的评估框架可直接转化为产品级系统选型与性能优化的技术依据。
衍生相关工作
该基准催生了一系列具有启发性的学术工作。其揭示的检索精度不变性现象引发了对嵌入模型表征能力上限的深入探讨,衍生出针对语义密度区域的差异化编码策略研究。噪声隔离评估范式推动了解耦式记忆架构的设计,如分离短期与长期记忆存储、引入显式的信念版本控制机制。会话延迟敏感性分析则激发了基于检索缓存、预计算索引与异步写入的优化方案。此外,PrecisionMemBench对结构性与琐碎空通过的类型分解,促使社区批判性地重新审视传统基准的通过率统计方法,推动了更加严谨、透明的性能报告标准的建立。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务