遇见数据集

GateMem

收藏
github2026-06-19 更新2026-06-20 收录
数据链接:
官方服务:

资源简介:

GateMem是一个用于评估多主体共享内存环境中LLM代理内存治理能力的基准数据集。它包含医疗、办公、教育和家庭四个领域的91个长格式多参与方事件和2,218个隐藏检查点,测试效用、访问控制和主动遗忘三个核心能力。

GateMem is a benchmark dataset for evaluating the memory governance capabilities of LLM agents in multi-agent shared memory environments. It includes 91 long-form multi-party events across four domains: medical, office, education, and household, and 2,218 hidden checkpoints, and is designed to test three core capabilities: utility, access control, and active forgetting.

创建时间:
2026-06-16
原始信息汇总

GateMem 数据集概述

GateMem 是一个用于评估多主体共享记忆智能体(Multi-Principal Shared-Memory Agents)中记忆治理(Memory Governance)能力的基准测试。

核心评估目标

GateMem 旨在测试记忆增强型大语言模型(LLM)智能体在多主体共享记忆环境中是否能够:

  • 保持有用性(Utility):对授权请求给出正确回答。
  • 执行访问控制(Access Control):防止受保护信息泄露给未授权或超范围的请求者。
  • 遵从删除请求(Active Forgetting):在收到明确的删除请求后,避免恢复或确认已删除信息。

数据集与基准规模

属性 数值
领域 医疗(Medical)、办公(Office)、教育(Education)、家庭(Household)
剧情片段(Episodes) 91 个长篇多主体剧情片段
检查点(Checkpoints) 2,218 个隐藏检查点
评估类别 有用性 / 访问控制 / 主动遗忘
包含的基线方法 Long-Context, RAG-Naive, RAG-Policy, A-MEM, Mem0, ReMeM-I, ReMeM-S
主要总结指标 记忆治理得分(Memory Governance Score, MGS)

主要指标公式

MGS = U * (1 - A) * (1 - F)

  • U = 有用性(Utility)
  • A = 访问控制违规率(Access-Control Violation Rate)
  • F = 主动遗忘失败率(Active-Forgetting Failure Rate)

基准构建流程

GateMem 通过以下步骤构建:

  1. 基于领域特定场景规范。
  2. 生成长篇多主体剧情片段。
  3. 构建用于评估有用性、访问控制和主动遗忘的隐藏检查点。

主要发现

在多种基座模型和记忆智能体基线方法中,没有任何方法能同时实现强有用性、稳健的访问控制和可靠的主动遗忘。共享记忆治理对当前记忆增强型 LLM 智能体而言仍是一个挑战性难题。

快速开始与使用

  1. 安装依赖:执行 pip install -r requirements.txt
  2. 设置 API 密钥:根据需要为所用 LLM 配置环境变量。
  3. 运行基线:使用 python bench/scripts/run_eval.py 脚本,指定数据目录和智能体类型。
  4. 提交新方法:生成 predictions.jsonl 文件,并通过 GateMem-Submit 在线提交界面进行提交,以参与公共排行榜 GateMem Leaderboard

评估注意事项

  • 术语对照:论文中的“有用性(Utility)”、“访问控制(Access Control)”、“主动遗忘(Active Forgetting)”在代码和 JSON 文件中分别对应 utilityprivacysafety
  • 禁用字段:评估时,方法不应使用 query_typeexpected_actionjudge_specleak_targets 等隐藏标注字段,这些字段仅用于评分和分析。

资源链接

搜集汇总
数据集介绍
GateMem 数据集图片
构建方式
在多重主体共享记忆Agent日益普及的背景下,现有评测基准往往聚焦于单一维度的记忆准确性,难以刻画真实部署场景中记忆治理的复杂性。GateMem数据集由此应运而生,其构建遵循了严密的场景化与层级化设计方法论。首先,基于医疗、办公、教育及家庭四大领域的具体应用场景,定义了多角色交互的剧本框架。随后,据此生成了91个长篇多主体交互剧集,每个剧集内埋设了总计2218个隐藏检查点。这些检查点依据查询意图被精确地划分为三类:衡量基础效用的‘存查’、检验访问权限边界的‘越权查’以及验证主动遗忘能力的‘删后查’,从而构建了一个多维度的记忆治理评测体系。
特点
GateMem数据集的核心特点在于其独树一帜的‘记忆治理’评测视角,它不再局限于单一主体的记忆回取,而是深入探究共享记忆环境中代理人的治理能力。该数据集采用了一项综合性的评价指标——记忆治理分数,该分数通过将基础效用、访问控制违例率与主动遗忘失效率三项指标以乘积形式融合,任何一项能力存在短板都将显著拉低总分,从而严格衡量智能体的整体治理水平。此外,其数据分布横跨医疗、办公、教育、家庭四大实用领域,场景的多元性与剧本的叙事丰富性使得评估结果更具生态效度与现实参考价值。
使用方法
使用者可通过GateMem简洁的编程接口快速启动评测。首先需安装依赖并配置所需大语言模型的API密钥。随后,用户可借助仓库提供的‘run_eval.py’脚本及指定数据目录与代理人类型来运行基准测试,例如通过命令行直接对医疗领域执行长上下文基线方法的评估。对于希望提交自定义方法的用户,GateMem提供了一套完整的贡献流程:研究者需使用自己的模型生成符合特定格式的‘predictions.jsonl’文件,并通过Hugging Face上的官方提交空间上传。系统将自动调用官方评估器进行评分,经维护者审核后,其结果将公示于公开排行榜上,从而促进记忆治理领域研究的透明化与可复现性。
背景与挑战
背景概述
GateMem 数据集诞生于 2026 年,由浙江大学、新加坡国立大学等机构的研究人员(如 Zhe Ren、Yibo Yang 等)共同构建,聚焦于多主体共享记忆场景下的记忆治理问题。随着大型语言模型(LLM)在医疗、办公、教育、家政等多人协作领域的部署日益广泛,传统的记忆基准测试仅关注“能否正确记忆”,而 GateMem 则深入探究“能否在多主体、多角色、多范围及删除请求下正确治理共享记忆”。该数据集覆盖了四个关键领域,包含 91 个长程多主体剧情与 2,218 个隐藏检查点,开创性地将效用(Utility)、访问控制(Access Control)与主动遗忘(Active Forgetting)三项能力统一纳入评估框架,并以“记忆治理评分(MGS)”作为主要衡量标准,为记忆增强型 LLM 智能体的安全与实用性研究提供了重要基准。
当前挑战
GateMem 所揭示的核心挑战在于:在共享记忆环境中,现有记忆增强型 LLM 智能体无法同时兼顾效用、访问控制与主动遗忘。首先,从领域问题来看,多主体记忆治理需确保智能体在合法请求下准确回答(效用),同时防止向未授权主体泄露受保护信息(访问控制),并在信息被显式删除后不恢复或确认(主动遗忘),这三者之间存在根本性权衡,尚无方法能同时达到优良表现。其次,在构建过程中,数据集面临了如何设计真实、复杂的多主体交互剧情以模拟医疗、办公等场景下的隐私与遗忘需求,以及如何针对每个检查点精确标注查询类型、预期行为与泄露目标等隐藏字段以支持自动化评估,这些都对标注质量与场景多样性提出了极高要求。
常用场景
经典使用场景
GateMem数据集专为评测多主体共享记忆场景下大语言模型代理的记忆治理能力而设计。该数据集涵盖医疗、办公、教育和家庭四大领域,包含91个长程多轮交互剧情和2218个隐藏检查点,用于系统评估代理在共享记忆池中的三项核心能力:实用性(Utility)、访问控制(Access Control)和主动遗忘(Active Forgetting)。经典使用场景涉及模拟多角色协作环境,例如在医疗场景中考察代理能否在患者、医生和家属之间正确回应授权查询、防止信息泄露并执行删除请求。
解决学术问题
GateMem解决了现有记忆基准测试仅关注代理记忆准确性而忽略共享记忆治理这一关键学术缺口。传统研究多聚焦于单主体记忆召回或个性化,但现实部署中记忆常为多主体共享资源,涉及复杂的权限管理和遗忘合规问题。该数据集通过统一的记忆治理分数(MGS)综合衡量实用性、访问控制违规率和主动遗忘失败率,揭示了当前主流方法(如长上下文提示、检索增强生成、外部记忆系统)在同时满足三项能力时均存在显著不足,从而推动了多主体共享记忆治理这一开放挑战的研究。
衍生相关工作
GateMem的发布催生了多项衍生研究工作,包括对其提出的记忆治理框架的扩展应用、针对特定领域(如金融、法律)的共享记忆基准改编,以及基于记忆治理分数优化的新型代理架构设计。此外,该数据集已成为评估长上下文模型、检索增强系统和外部记忆模块在多主体交互环境中性能的标准工具,推动了如Policy RAG、A-MEM、ReMeM等基准方法在实用性、访问控制和主动遗忘方面的性能对比和改进研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务