遇见数据集

ProactiveMemBench

收藏
github2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

ProactiveMemBench是一个用于评估大型语言模型在长期对话设置中主动记忆关联能力的基准数据集。它包含五个主题领域(音乐、烹饪、健身、宠物、旅行),涵盖300个记忆单元、1000个关联对、100个对话会话和2000个对话轮次,并提供504个评估问题。数据集支持评估五种类型的记忆关联:时间、实体、情感、行为模式和多跳推理。

ProactiveMemBench is a benchmark dataset designed to evaluate the proactive memory association capabilities of large language models (LLMs) in long-term conversation settings. It covers five thematic domains: music, cooking, fitness, pets, and travel, encompassing 300 memory units, 1000 association pairs, 100 dialogue sessions, 2000 dialogue turns, and 504 evaluation questions. The dataset supports the assessment of five categories of memory associations: temporal, entity, emotional, behavioral patterns, and multi-hop reasoning.

创建时间:
2026-06-02
原始信息汇总

数据集概述:ProactiveMemBench

ProactiveMemBench 是一个用于评估大语言模型在长期对话场景中主动性记忆关联能力的基准测试。

核心概念:主动性记忆关联

当用户在当前的对话轮次中提到概念A时,模型应基于记忆的多会话对话历史,主动回忆起用户当前未提及但之前分享过的相关概念B、C、D。

基准统计

维度 单个领域 总计(5个领域)
主题领域 5(音乐、烹饪、健身、宠物、旅行)
用户画像 1 5
记忆单元 60 300
关联对 200 1,000
对话会话 20 100
每会话轮次 20
总对话轮次 400 2,000
评估问题 100 504
每个问题的候选 3(真实答案)

五种记忆关联类型

类型 定义 示例
时间关联 回忆与时间相关的活动模式 “周一晚上” → 钢琴练习 → 哈农手指练习
实体关联 回忆与实体相关的关联 提到贝多芬 → 祖母喜欢《月光奏鸣曲》
情感关联 回忆情绪↔行为映射 感到压力 → 弹奏巴赫《平均律钢琴曲集》放松
行为模式关联 回忆习惯性的共现事件 练习前 → 泡绿茶 + 去书房
多跳关联 通过≥2步推理回忆 德彪西 → 《月光》 → 张老师 → 音色反馈

数据目录结构

ProactiveMemBench/ ├── README.md ├── LICENSE └── data/ ├── music/ # 音乐领域 ├── cooking/ # 烹饪领域 ├── fitness/ # 健身领域 ├── pet/ # 宠物护理领域 └── travel/ # 旅行领域

每个领域目录包含以下文件:

文件 描述
step0_persona.json 用户画像 (所有生成的全局约束)
step1_concept_pairs.json 60个记忆单元 (5种类型 × 12)
step2_associations.json 200个成对关联分数 (4个维度)
step3_session_groups.json 会话分组计划 (20个会话 × 3个单元)
step4_conversations.json 20个会话 × 20轮对话
step5_proactive_questions.json 100个带有真实候选集的评估问题

数据格式示例

评估问题 (step5_proactive_questions.json) json { "id": "q_001", "trigger_type": "temporal", "question": "现在是周三晚上8点,该去书房了。", "trigger_concept": "周三晚上8点", "candidate_set": [ {"concept": "哈农手指练习", "reason": "周三晚上 → 固定练习 → 热身是哈农"}, {"concept": "德彪西《月光》", "reason": "周三晚上 → 固定练习 → 当前主要曲目"}, {"concept": "张教授", "reason": "练习《月光》→ 音色问题 → 张教授的反馈"} ], "difficulty": "medium", "source_pairs": ["time_03"], "reasoning": "用户只提及时间和地点;模型必须回忆该时间段的行为模式和相关人物。" }

评估方法

输入:所有20个会话的对话历史 + 1个主动性问题的触发话语。 模型任务:基于记忆的对话历史生成响应。 评估指标:响应是否主动提到了candidate_set中的概念。

评估指标

指标 定义
Recall@k 在k个响应轮次中提及3个真实候选中的比例
Precision 主动提及的概念中属于真实候选的比例
By-type Recall 按5种关联类型分解的召回率
By-difficulty Recall 按简单/中等/困难分解的召回率

难度等级

等级 每种类型数量 定义
简单 6 单跳直接关联
中等 8 需要综合2个记忆单元
困难 6 跨会话多跳推理

构建流程

基准测试通过一个6步的LLM驱动管道构建:

  1. 用户画像生成 — 为每个领域创建详细的用户画像。
  2. 记忆单元生成 — 生成60个记忆单元(5种类型 × 12),顺序生成以避免矛盾。
  3. 关联评分 — 评估跨4个维度的200个采样对。
  4. 会话分组 — 将记忆单元分配到20个会户中;高关联对特意跨会话拆分。
  5. 对话生成 — 生成带有植入记忆单元的20轮对话。
  6. 问题生成 — 创建100个带有真实候选集(前3个)的评估问题。

质量保证

人工验证:对125个随机抽样样本进行人工抽查。

  • 查询有效性:触发话语自然且不泄漏候选信息,通过率 100%
  • 候选正确性:每个候选都可从对话历史中推断且不在查询中,通过率 98.4%
  • 证据支持:引用的来源记忆单元充分支持推理路径,通过率 98.4%
  • 整体接受率98.4%。被拒绝的实例已手动修正并纳入最终基准。

LLM完整性验证:使用GPT-4o、Claude-3.5-Sonnet和Gemini-1.5-Pro检查潜在遗漏。 在504个实例中,三个判断者与基准的候选集在 96%的实例上达成多数一致。剩余的4%源于同样合理的替代关联,而非明显遗漏。

许可证

该数据集根据 MIT许可证 发布。

搜集汇总
数据集介绍
ProactiveMemBench 数据集图片
构建方式
ProactiveMemBench的构建依托于一套六阶段的流水线式生成流程。首先为每个领域创建一个详尽的用户画像,随后基于此画像生成60个记忆单元,涵盖时间、实体、情感、行为模式及多跳推理五种关联类型。接着对200个记忆对进行四维关联度评分,并将高关联度的记忆对有意地分散至20个对话会话中,以模拟长期对话中记忆的分散存储。在此基础上生成包含20轮对话的完整会话记录,最终为每个场景构建100个评估问题,每个问题配备三个标准答案候选集,形成总计504个测试实例的基准数据集。
特点
该数据集的核心特色在于聚焦于大语言模型在长期多会话场景下的主动记忆关联能力,这一能力超越了传统的被动检索式记忆。数据集通过精心设计的时间、实体、情感、行为模式与多跳推理五种关联类型,全面覆盖了人类认知中复杂多样的联想模式。每个测试实例的触发语句仅包含单一记忆线索,而正确答案则需要模型在多达2000轮的历史对话中主动挖掘并关联多个分散的记忆单元,这对模型的记忆容量、关联推理能力以及抗干扰性提出了严苛挑战。经过人工验证,数据集的整体通过率达到98.4%,且通过多模型一致性校验确保了候选集的完整性。
使用方法
使用ProactiveMemBench评估模型时,需将全部20个会话的历史对话作为输入,并给定一个包含触发线索的评测问题。模型需基于记忆中的历史信息生成回复,评测指标包括Recall@k、Precision以及按关联类型和难度层级细分的召回率。数据集按音乐、烹饪、健身、宠物、旅行五个领域分类存储,每个领域包含从用户画像到评测问题的六步结构化数据文件。研究者可以直接加载对话历史和问题,通过比对模型主动提及的概念与标准候选集的匹配程度,来量化模型的主动记忆关联能力,从而深入分析不同架构或训练策略在此认知任务上的表现差异。
背景与挑战
背景概述
ProactiveMemBench是由研究团队于2025年创建的基准测试,旨在评估大语言模型在长期多轮对话中的主动记忆关联能力。该基准的核心研究问题在于,模型能否在用户当前提及概念A时,基于存储的跨会话历史,主动检索并关联用户此前分享但未提及的相关概念B、C、D。通过涵盖音乐、烹饪、健身、宠物和旅行五个领域,包含300个记忆单元及1000个关联对,ProactiveMemBench为衡量语言模型在类人认知中的记忆主动性提供了标准化评估框架,推动了对话智能从被动响应向主动认知的范式演进。
当前挑战
该基准主要挑战包括:第一,解决领域中多跳推理的复杂性——模型需在时间、实体、情感、行为模式及跨会话路径中准确建立隐性关联,但当前模型常出现中间推理链路缺失或错误联结,尤其在多跳任务中表现不稳定。第二,构建过程中的数据质量保障难题:为确保评估问题无信息泄露,需通过严格人工验证与LLM一致性检验,消除触发语句中候选信息的无意泄露;同时,针对每个问题仅保留三个最佳候选记忆单元,存在遗漏重要关联的风险,需依赖多模型投票机制校准,防止因缺失关键证据而导致评估偏差。
常用场景
经典使用场景
在长程对话智能体的评估体系中,ProactiveMemBench 被设计为衡量大型语言模型是否具备前瞻性记忆联想能力的标杆。经典使用场景是:给定模型全部多轮跨会话对话历史,并在当前轮次中仅向模型提供一个不包含线索信息的触发语句,例如提及“某天晚上听到德彪西的乐曲”,模型需主动从记忆库中检索并召回用户此前曾提及但未在当前对话中出现的关联概念,如正在练习的《月光》曲目、教师的音色评价以及惯常的练习安排。该基准覆盖音乐、烹饪、健身、宠物及旅行五个主题域,包含1,000个高质量关联对,全面测试模型在时序、实体、情感、行为模式与多跳推理五种记忆关联类型上的表现。
解决学术问题
ProactiveMemBench 旨在解决当前对话系统研究中一个被长期忽视的学术问题:如何系统性地评估模型从跨会话记忆中主动进行关联推理的能力。现有基准多聚焦于即时检索或单跳问答,缺乏对模型在自然对话中自发、准确地连接过去信息与当前语境的能力检验。该基准通过精细构建的关联对、多级难度设置以及人工与LLM联合验证的质量保障机制,为研究者提供了可靠的量化指标,如各类型召回率与难度分层下的表现,有效推动了对对话记忆从“存储工具”到“认知能力”这一范式转变的实证评估。其意义在于促进更类人、更自然的长期人机对话交互的实现。
衍生相关工作
ProactiveMemBench 的发布催生了若干后续研究方向与经典工作。首先,基于该基准衍生出多种针对情景记忆增强的推理框架研究,例如结合图神经网络对跨会话记忆单元进行显式建模以提升多跳联想精度。其次,对话状态追踪领域的工作开始引入前瞻性指标,将模型的联想质量作为系统评估的新维度。此外,一些工作聚焦于该基准中暴露的难点——如跨会话多跳推理中中间信息的丢失问题——从而推动基于检索增强生成(RAG)的模型架构改进,例如设计更高效的长程记忆缓存机制。还有研究借鉴该基准的五种关联类型分类学,开发了面向特定领域(如医疗问诊、在线教育)的记忆联想评估数据集。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务