MemSyco-Bench
收藏资源简介:
MemSyco-Bench是一个综合基准,用于评估语言模型和记忆系统如何使用、更新和控制偏好相关记忆。它引入了五个互补的偏好记忆评估任务,比较无记忆、原始对话和记忆系统设置,测试有用偏好的使用以及由过时、冲突或过度泛化记忆引起的失败。该基准提供了1,550个最终样本、标准化评估代码和统一基线。
MemSyco-Bench is a comprehensive benchmark for evaluating how language models and memory systems utilize, update, and regulate preference-related memories. It introduces five complementary preference memory evaluation tasks, which compare memory-free, vanilla dialogue, and memory system settings, and test the utilization of useful preferences as well as failures induced by outdated, conflicting, or over-generalized memories. This benchmark provides 1,550 finalized samples, standardized evaluation code, and unified baselines.
数据集概述
MemSyco-Bench 是一个用于评估语言模型与记忆系统在偏好记忆的使用、更新和控制方面表现的综合性基准测试。
核心目标
- 引入五个互补的偏好记忆评估任务。
- 对比无记忆、原始对话和记忆系统三种设置下的表现。
- 测试有益偏好使用以及因陈旧、冲突或过度泛化的记忆导致的失败情形。
- 提供 1,550 个最终样本、标准化评估代码和统一基线。
任务设置
基准测试包含五个任务专属的赛道:
-
客观事实判断 (Objective Fact Judgment)
- 评估当记忆支持一个熟悉但错误的答案时,事实正确性如何。
- 包含 300 个样本。
-
上下文范围控制 (Contextual Scope Control)
- 评估记忆中的偏好是否仅在其有效范围内被应用。
- 包含 300 个样本。
-
记忆-证据冲突 (Memory-Evidence Conflict)
- 评估更强的外部证据是否会覆盖与偏好一致但质量较差的选择。
- 包含 300 个样本。
-
有效记忆选择 (Valid Memory Selection)
- 评估模型是否遵循最新的偏好,并避免受到旧偏好的污染。
- 包含 350 个样本。
-
个性化记忆使用 (Personalized Memory Use)
- 评估答案质量以及是否使用了适用的用户偏好。
- 包含 300 个样本。
评估设置
- 比较设置:
NoMemory(无记忆)、RawDialogue(完整相关对话)、Retrieved context from a memory baseline(从记忆基线检索的上下文)。 - 评估方式:所有任务均采用开放式的大语言模型评判。
- 输出:评估结果在本地生成,存储在
output_data/目录下。
数据集规模
- 总样本数:1,550 个最终样本,分布在五个 JSONL 文件中。
快速开始
- 环境配置:建议使用 Conda 创建 Python 3.10 环境。
- 安装:
- 核心安装:
pip install -r requirements.txt - 完整基线安装:
pip install -r requirements-memory-baselines.txt
- 核心安装:
- 运行:通过
run_benchmark.sh(Linux/macOS) 或run_benchmark.ps1(Windows PowerShell) 脚本运行评估套件。
引用





