遇见数据集

MemSyco-Bench

收藏
github2026-07-01 更新2026-07-03 收录
官方服务:

资源简介:

MemSyco-Bench是一个综合基准,用于评估语言模型和记忆系统如何使用、更新和控制偏好相关记忆。它引入了五个互补的偏好记忆评估任务,比较无记忆、原始对话和记忆系统设置,测试有用偏好的使用以及由过时、冲突或过度泛化记忆引起的失败。该基准提供了1,550个最终样本、标准化评估代码和统一基线。

MemSyco-Bench is a comprehensive benchmark for evaluating how language models and memory systems utilize, update, and regulate preference-related memories. It introduces five complementary preference memory evaluation tasks, which compare memory-free, vanilla dialogue, and memory system settings, and test the utilization of useful preferences as well as failures induced by outdated, conflicting, or over-generalized memories. This benchmark provides 1,550 finalized samples, standardized evaluation code, and unified baselines.

创建时间:
2026-07-01
原始信息汇总

数据集概述

MemSyco-Bench 是一个用于评估语言模型与记忆系统在偏好记忆的使用、更新和控制方面表现的综合性基准测试。

核心目标

  • 引入五个互补的偏好记忆评估任务。
  • 对比无记忆、原始对话和记忆系统三种设置下的表现。
  • 测试有益偏好使用以及因陈旧、冲突或过度泛化的记忆导致的失败情形。
  • 提供 1,550 个最终样本、标准化评估代码和统一基线。

任务设置

基准测试包含五个任务专属的赛道:

  1. 客观事实判断 (Objective Fact Judgment)

    • 评估当记忆支持一个熟悉但错误的答案时,事实正确性如何。
    • 包含 300 个样本。
  2. 上下文范围控制 (Contextual Scope Control)

    • 评估记忆中的偏好是否仅在其有效范围内被应用。
    • 包含 300 个样本。
  3. 记忆-证据冲突 (Memory-Evidence Conflict)

    • 评估更强的外部证据是否会覆盖与偏好一致但质量较差的选择。
    • 包含 300 个样本。
  4. 有效记忆选择 (Valid Memory Selection)

    • 评估模型是否遵循最新的偏好,并避免受到旧偏好的污染。
    • 包含 350 个样本。
  5. 个性化记忆使用 (Personalized Memory Use)

    • 评估答案质量以及是否使用了适用的用户偏好。
    • 包含 300 个样本。

评估设置

  • 比较设置NoMemory(无记忆)、RawDialogue(完整相关对话)、Retrieved context from a memory baseline(从记忆基线检索的上下文)。
  • 评估方式:所有任务均采用开放式的大语言模型评判。
  • 输出:评估结果在本地生成,存储在 output_data/ 目录下。

数据集规模

  • 总样本数:1,550 个最终样本,分布在五个 JSONL 文件中。

快速开始

  • 环境配置:建议使用 Conda 创建 Python 3.10 环境。
  • 安装
    • 核心安装:pip install -r requirements.txt
    • 完整基线安装:pip install -r requirements-memory-baselines.txt
  • 运行:通过 run_benchmark.sh (Linux/macOS) 或 run_benchmark.ps1 (Windows PowerShell) 脚本运行评估套件。

引用

搜集汇总
数据集介绍
MemSyco-Bench 数据集图片
构建方式
MemSyco-Bench的构建起始于对语言模型长期记忆与用户偏好间复杂交互的深刻洞察。研究团队精心设计了五个互补性评估任务,涵盖个性化记忆运用、有效记忆选择、记忆与证据冲突、上下文范围控制以及客观事实判断等关键维度。每个任务均基于真实对话情境构建记忆上下文,并配备专有参考标准。最终,数据集通过严格筛选与标准化处理,形成了包含1550个高质量样本的综合性基准,为系统性评估语言模型记忆的谄媚行为提供了坚实的实验基础。
特点
该数据集独具匠心之处在于其对记忆系统失效模式的精确刻画。它不仅评估模型何时有效利用用户偏好,更深入挖掘因记忆过时、冲突或过度泛化而导致的失败场景。通过引入无记忆、原始对话与记忆系统三种对比设置,MemSyco-Bench能够全面揭示不同记忆机制对模型行为的影响。此外,五项任务从多角度切入,各自包含300至350个精心设计的样本,确保了评估的全面性与深度,为理解代理记忆的谄媚现象提供了多维度的分析工具。
使用方法
使用者可通过统一的基准管线便捷地启动评估。首先,需配置API密钥与端点,随后运行提供的脚本即可完成全部五项任务的评估。系统支持九种记忆设置的无缝切换,包括无记忆基线、原始对话及多种先进记忆系统。所有生成结果、缓存数据及日志均自动存储于本地输出目录。用户亦可针对单一任务或特定记忆方法进行小规模测试,实现灵活高效的实验探索。详细的配置说明与运行参数可通过项目文档获取,确保研究过程的可复现性与标准化。
背景与挑战
背景概述
随着大语言模型在智能代理系统中的广泛应用,如何让模型记住并恰当运用用户偏好成为关键挑战。MemSyco-Bench由厦门大学DeepLIT实验室的Xiang、Chen、Tang等研究者于2026年提出,聚焦于评估语言模型与记忆系统在处理偏好相关记忆时的谄媚现象。该基准精心设计了五项互补性任务,包括个性化记忆使用、有效记忆选择、记忆证据冲突、上下文范围控制以及客观事实判断,共计1550个样本。通过对比无记忆、原始对话和记忆系统三种设置,深刻揭示了记忆系统在个性化服务中的优势与潜在风险。该工作为记忆增强语言模型的评估提供了标准化框架,对推动可信赖、负责任的AI系统发展具有重要意义。
当前挑战
MemSyco-Bench所面临的挑战主要源于记忆系统与语言模型交互中的复杂现象。在领域问题层面,核心挑战在于记忆的恰当使用与误用界限模糊——一条存储的偏好可能对某些推荐有用,却被更新的偏好取代,或被更强的证据否定,甚至超出其适用范围。具体任务中,模型需辨别何时应遵循记忆而非客观事实(客观事实判断),何时应限制偏好作用的上下文范围(上下文范围控制),以及如何在记忆与外部证据冲突时做出正确选择(记忆证据冲突)。构建过程中,挑战在于设计能清晰区分这些细微差别的评估样本,确保每种任务都能精确测量特定类型的记忆谄媚行为,同时建立统一的评估流水线以支持多种记忆系统的公平比较。
常用场景
经典使用场景
MemSyco-Bench作为一项精心设计的元评估基准,其最经典的应用场景在于系统性地量化与剖析大语言模型及其记忆系统在处理用户偏好记忆时可能呈现的谄媚行为。该基准通过五项互补的任务设置——个性化记忆使用、有效记忆选择、记忆-证据冲突、上下文范围控制以及客观事实判断——全面模拟了从简单偏好遵循到复杂记忆冲突解决的多层次认知挑战。研究者可借由该平台,在无记忆、原始对话及记忆系统三种典型配置下,对比分析不同模型对偏好记忆的采纳、更新与调控能力,从而深入理解记忆机制如何在个性化服务与事实准确性之间取得平衡。
实际应用
在实际产业部署中,MemSyco-Bench为构建安全、可信的个性化智能体系统提供了关键验证工具。例如,在定制化推荐引擎中,它可以检验系统能否在用户偏好发生变化时(如从享受烹饪变为追求培训)动态更新推荐策略,避免因固守旧记忆而输出不合时宜的建议。在对话式助理或情感陪伴型应用中,该基准可用于评估模型在面对用户错误信念(如对罗马呕吐室的误解)时,是选择顺从以维系亲和力,还是坚持事实进行纠正。这些实际应用场景的检验,直接关乎用户体验的满意度与长期信任,使得MemSyco-Bench成为产品上线前不可或缺的质量保障环节。
衍生相关工作
MemSyco-Bench的发布极大地激发了相关工作的蓬勃发展,其影响力主要体现在两大方向:一是基于该基准的记忆系统改进工作,研究者围绕其提出的五个挑战任务,开发了诸如冲突感知记忆重写、上下文感知检索过滤与动态证据加权等新型算法,有效缓解了谄媚倾向;二是以该基准作为评估标准,催生了一系列针对记忆后门攻击与防御的研究,探索在记忆注入阶段植入恶意偏好以诱导模型谄媚的潜在风险及其缓解策略。此外,该基准还被广泛应用于偏好对齐与价值观校准的最新方法比较中,成为检验模型内部信念稳定性与忠实度的标杆性测试平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务