遇见数据集

MemTrapBench

收藏
arXiv2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

MemTrapBench是浙江大学等机构联合构建的评估大语言模型记忆认知陷阱的基准数据集,包含1050个精心设计的实例,涵盖推理固化和信念扭曲两大类别下的四个场景:认知偏差、创伤、任务边界与安全。数据集通过种子设计、多轮对抗性对话生成及两阶段质量控制(自动过滤与专家审核)构建而成,每个实例均标注有标准答案与预期失败模式。该基准旨在系统评估记忆如何扭曲模型推理或信念,从而降低当前任务性能,揭示现有记忆框架在认知陷阱面前的脆弱性。

MemTrapBench is a benchmark dataset for evaluating memory-induced cognitive traps in large language models (LLMs), jointly constructed by Zhejiang University and other institutions. It includes 1050 meticulously crafted instances spanning four scenarios under two major categories: reasoning fixation and belief distortion, specifically cognitive biases, trauma, task boundaries, and safety. The dataset is constructed via seed design, multi-round adversarial dialogue generation, and a two-stage quality control pipeline consisting of automatic filtering and expert review. Each instance is annotated with a standard answer and an expected failure mode. This benchmark aims to systematically evaluate how memory distorts model reasoning or beliefs, thereby compromising current task performance, and uncover the vulnerability of existing memory frameworks when faced with cognitive traps.

创建时间:
2026-08-21
原始信息汇总

MemTrapBench 数据集概述

数据集名称:MemTrapBench
所属机构:浙江大学 NLP 实验室(ZJUNLP)
数据集地址https://github.com/zjunlp/MemTrapBench
核心主题:大语言模型(LLM)记忆使用中的认知陷阱基准测试

1. 数据集目标

  • 旨在系统性地评估和衡量大语言模型在记忆使用过程中可能出现的认知陷阱(Cognitive Traps)。
  • 通过构建基准测试,促进对 LLM 记忆机制的深入理解,并暴露模型在记忆调用、推理和决策中的潜在缺陷。

2. 适用场景

  • 大语言模型的性能评估与鲁棒性测试。
  • 认知科学、人工智能安全、记忆机制研究。
  • 模型训练与调优过程中的诊断工具。

3. 数据集内容

  • 该基准测试专注于“记忆使用”这一特定认知环节,重点覆盖可能引发错误或偏差的陷阱场景。
  • 具体数据样例、任务形式及评估指标在仓库中尚未详细展示(README 仅提供名称与一句描述),需进一步查看仓库文件以获取完整信息。

4. 获取与使用

  • 数据及代码通过 GitHub 仓库开放,可直接访问上述地址获取全部资源。
  • 仓库结构、许可协议、引用方式等详细信息需在仓库页面中查看。
搜集汇总
数据集介绍
MemTrapBench 数据集图片
构建方式
MemTrapBench的构建严格遵循分层递进的范式,从认知陷阱的类别学定义出发,精心设计了涵盖推理固化与信念扭曲两大维度的四类陷阱种子。通过GPT-5.4将种子扩展为包含植入陷阱、噪声掩蔽和触发陷阱三个阶段的多轮对话,每个实例对话轮次控制在18至40轮之间。所有候选实例均需通过结合自动化筛选与专家人工审校的双阶段质量门控,确保主题连贯性、上下文一致性、交互真实性与无记忆可解性,最终形成包含1,050个实例的评测基准。
特点
MemTrapBench的核心特质在于其聚焦于记忆诱发认知陷阱的评估,而非传统的记忆存储或检索效能。其独特性体现在:构建的陷阱场景中,历史记忆虽语义相关且事实准确,却会系统性地误导模型当前推理,导致性能较无记忆场景显著下降。基准覆盖四类陷阱场景,尤其强化了跨任务边界和信念污染等隐蔽性挑战,并通过对照实验证实性能退化源于陷阱语义而非上下文长度,从而精准刻画了记忆对模型认知的扭曲效应。
使用方法
MemTrapBench为大型语言模型及相关记忆框架提供了标准化的压力测试协议。评估时,需在同一查询上分别记录模型在无记忆和有记忆条件下的响应,并依据正确性、格式、相关性和效率四个维度进行评分,使用GPT-5.2作为主评判模型,辅以Claude Sonnet 4.6进行一致性验证。该基准适用于检验各类记忆策略的鲁棒性,其中集成的AdaptiveMem方法作为一种提示技能,可在不修改架构的前提下缓解认知陷阱,同时保持标准记忆基准的性能。
背景与挑战
背景概述
MemTrapBench是浙江大学、新加坡国立大学等机构于2026年联合推出的基准测试集,旨在评估大语言模型在记忆使用中的认知陷阱。该数据集由Ningyu Zhang等人构建,核心研究问题在于揭示即便记忆内容准确且语义相关,也可能扭曲模型的推理或信念,导致当前任务性能下降。MemTrapBench包含1050个实例,覆盖推理固着与信念扭曲两大类别,首次系统性地将记忆的负面影响纳入评测范畴,对推动记忆增强型大语言模型的可靠性研究具有重要影响力。
当前挑战
MemTrapBench面临的挑战包括:其一,领域问题的复杂性,即记忆不仅需正确提取与检索,还需避免对当前推理产生误导,现有记忆框架均未能有效规避推理固着与信念扭曲等认知陷阱;其二,构建过程中的难题,如设计能自然触发认知陷阱的多轮对话、确保陷阱在无记忆条件下可解、以及在质量控制中平衡真实性与对抗性,这些均需精细化的种子设计与专家验证,以保证评测的效度与信度。
常用场景
经典使用场景
MemTrapBench作为评估大型语言模型(LLM)记忆系统认知陷阱的基准,其经典应用在于系统性地检验模型在利用检索到的记忆时,是否会产生推理固着或信念扭曲。该基准精心构建了涵盖认知偏差、任务边界、创伤后回避以及安全信念扭曲的四类场景,通过多轮对话与噪声干扰模拟真实交互,要求模型在无记忆与有记忆的对照条件下完成任务。这一设计使其成为衡量记忆框架是否会导致模型性能下降的关键诊断工具,尤其适用于对比不同记忆策略(如LightMem、MemOS、SimpleMem、EverMemOS)及无记忆基线的表现差异,为评估记忆增强系统的可靠性提供了严谨的测试平台。
解决学术问题
该数据集深刻回应了记忆管理领域长期忽视的学术问题——即记忆的准确提取与检索并不必然导向正确推理,反而可能引入认知层面的陷阱。它突破了传统基准仅关注记忆存储与召回率的局限,转而聚焦于记忆内容如何重塑模型的推理策略与信念框架,揭示了即使记忆事实无误且语义相关,也可能锚定模型思维路径、诱发策略固化,甚至覆盖常规安全判断。通过严格的对照实验与消融分析,MemTrapBench证实了性能下降源于记忆诱导的认知陷阱而非上下文长度等混淆因素,为深入研究记忆机理中的认知偏差提供了实证基础,推动了该领域从'记忆有用性'向'记忆可靠性'的学术转向。
衍生相关工作
MemTrapBench的提出衍生了一系列聚焦于记忆认知安全的深层研究。其中最具代表性的当属AdaptiveMem——一种轻量级的推理期提示技能,它诱导模型在利用记忆前主动识别潜在认知陷阱,并动态评估检索记忆对当前任务的适用性。实验表明,该策略在不损害标准记忆基准(如LongMemEval)性能的前提下,显著缓解了各类记忆陷阱,提升了模型在MemTrapBench上的表现。此外,该工作还催生了与记忆诱导谄媚(MemSyco-Bench)等并发研究的对比讨论,推动了学术界对记忆负面效应谱系的系统化探索,为构建更可靠、更安全的人机协同记忆系统奠定了坚实的理论与实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务