ProactiveMemBench
收藏资源简介:
ProactiveMemBench是一个用于评估大型语言模型在长期对话设置中主动记忆关联能力的基准数据集。它包含五个主题领域(音乐、烹饪、健身、宠物、旅行),涵盖300个记忆单元、1000个关联对、100个对话会话和2000个对话轮次,并提供504个评估问题。数据集支持评估五种类型的记忆关联:时间、实体、情感、行为模式和多跳推理。
ProactiveMemBench is a benchmark dataset designed to evaluate the proactive memory association capabilities of large language models (LLMs) in long-term conversation settings. It covers five thematic domains: music, cooking, fitness, pets, and travel, encompassing 300 memory units, 1000 association pairs, 100 dialogue sessions, 2000 dialogue turns, and 504 evaluation questions. The dataset supports the assessment of five categories of memory associations: temporal, entity, emotional, behavioral patterns, and multi-hop reasoning.
数据集概述:ProactiveMemBench
ProactiveMemBench 是一个用于评估大语言模型在长期对话场景中主动性记忆关联能力的基准测试。
核心概念:主动性记忆关联
当用户在当前的对话轮次中提到概念A时,模型应基于记忆的多会话对话历史,主动回忆起用户当前未提及但之前分享过的相关概念B、C、D。
基准统计
| 维度 | 单个领域 | 总计(5个领域) |
|---|---|---|
| 主题领域 | — | 5(音乐、烹饪、健身、宠物、旅行) |
| 用户画像 | 1 | 5 |
| 记忆单元 | 60 | 300 |
| 关联对 | 200 | 1,000 |
| 对话会话 | 20 | 100 |
| 每会话轮次 | 20 | — |
| 总对话轮次 | 400 | 2,000 |
| 评估问题 | 100 | 504 |
| 每个问题的候选 | 3(真实答案) | — |
五种记忆关联类型
| 类型 | 定义 | 示例 |
|---|---|---|
| 时间关联 | 回忆与时间相关的活动模式 | “周一晚上” → 钢琴练习 → 哈农手指练习 |
| 实体关联 | 回忆与实体相关的关联 | 提到贝多芬 → 祖母喜欢《月光奏鸣曲》 |
| 情感关联 | 回忆情绪↔行为映射 | 感到压力 → 弹奏巴赫《平均律钢琴曲集》放松 |
| 行为模式关联 | 回忆习惯性的共现事件 | 练习前 → 泡绿茶 + 去书房 |
| 多跳关联 | 通过≥2步推理回忆 | 德彪西 → 《月光》 → 张老师 → 音色反馈 |
数据目录结构
ProactiveMemBench/ ├── README.md ├── LICENSE └── data/ ├── music/ # 音乐领域 ├── cooking/ # 烹饪领域 ├── fitness/ # 健身领域 ├── pet/ # 宠物护理领域 └── travel/ # 旅行领域
每个领域目录包含以下文件:
| 文件 | 描述 |
|---|---|
step0_persona.json |
用户画像 (所有生成的全局约束) |
step1_concept_pairs.json |
60个记忆单元 (5种类型 × 12) |
step2_associations.json |
200个成对关联分数 (4个维度) |
step3_session_groups.json |
会话分组计划 (20个会话 × 3个单元) |
step4_conversations.json |
20个会话 × 20轮对话 |
step5_proactive_questions.json |
100个带有真实候选集的评估问题 |
数据格式示例
评估问题 (step5_proactive_questions.json)
json
{
"id": "q_001",
"trigger_type": "temporal",
"question": "现在是周三晚上8点,该去书房了。",
"trigger_concept": "周三晚上8点",
"candidate_set": [
{"concept": "哈农手指练习", "reason": "周三晚上 → 固定练习 → 热身是哈农"},
{"concept": "德彪西《月光》", "reason": "周三晚上 → 固定练习 → 当前主要曲目"},
{"concept": "张教授", "reason": "练习《月光》→ 音色问题 → 张教授的反馈"}
],
"difficulty": "medium",
"source_pairs": ["time_03"],
"reasoning": "用户只提及时间和地点;模型必须回忆该时间段的行为模式和相关人物。"
}
评估方法
输入:所有20个会话的对话历史 + 1个主动性问题的触发话语。
模型任务:基于记忆的对话历史生成响应。
评估指标:响应是否主动提到了candidate_set中的概念。
评估指标
| 指标 | 定义 |
|---|---|
| Recall@k | 在k个响应轮次中提及3个真实候选中的比例 |
| Precision | 主动提及的概念中属于真实候选的比例 |
| By-type Recall | 按5种关联类型分解的召回率 |
| By-difficulty Recall | 按简单/中等/困难分解的召回率 |
难度等级
| 等级 | 每种类型数量 | 定义 |
|---|---|---|
| 简单 | 6 | 单跳直接关联 |
| 中等 | 8 | 需要综合2个记忆单元 |
| 困难 | 6 | 跨会话多跳推理 |
构建流程
基准测试通过一个6步的LLM驱动管道构建:
- 用户画像生成 — 为每个领域创建详细的用户画像。
- 记忆单元生成 — 生成60个记忆单元(5种类型 × 12),顺序生成以避免矛盾。
- 关联评分 — 评估跨4个维度的200个采样对。
- 会话分组 — 将记忆单元分配到20个会户中;高关联对特意跨会话拆分。
- 对话生成 — 生成带有植入记忆单元的20轮对话。
- 问题生成 — 创建100个带有真实候选集(前3个)的评估问题。
质量保证
人工验证:对125个随机抽样样本进行人工抽查。
- 查询有效性:触发话语自然且不泄漏候选信息,通过率 100%。
- 候选正确性:每个候选都可从对话历史中推断且不在查询中,通过率 98.4%。
- 证据支持:引用的来源记忆单元充分支持推理路径,通过率 98.4%。
- 整体接受率:98.4%。被拒绝的实例已手动修正并纳入最终基准。
LLM完整性验证:使用GPT-4o、Claude-3.5-Sonnet和Gemini-1.5-Pro检查潜在遗漏。 在504个实例中,三个判断者与基准的候选集在 96%的实例上达成多数一致。剩余的4%源于同样合理的替代关联,而非明显遗漏。
许可证
该数据集根据 MIT许可证 发布。





