遇见数据集

MemPatch

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

MemPatch 是一个用于评估大型语言模型(LLM)代理快速记忆集成(RMI)能力的基准数据集,源自论文《MemPatch: Benchmarking and Improving Rapid Memory Integration in LLM Agents》。每个场景测试 LLM 代理是否能够将新证据整合到记忆状态标签(如 current、outdated、blocked、unresolved 等)中,同时避免陈旧记忆重用、范围泄漏或策略无效的信念。数据集包含两个公开分割:main(3000 行,广泛覆盖不同领域、难度和失败模式)和 hard(500 行,为 L3/L4 对抗性场景,具有最小证据且无最新事件捷径),总共有 3500 行数据。数据以 JSONL 格式提供,每个场景对象包括一个公开输入(public_input)和一个用于官方评分器的隐藏黄金标准块(hidden_gold)。数据集专为评估设计,适用于问答、文本分类和文本生成等任务,重点关注代理记忆、记忆修订和评估。使用该数据集时,必须通过官方公共视图进行模型输入,不得将 hidden_gold 或内部字段馈送给模型。数据集采用 CC BY 4.0 许可证,代码部分为 MIT 许可证,数据是确定生成的(种子 2027),版本为 1.1.0。

MemPatch is a benchmark dataset for evaluating the Rapid Memory Integration (RMI) capability of Large Language Model (LLM) agents, derived from the paper MemPatch: Benchmarking and Improving Rapid Memory Integration in LLM Agents. Each scenario tests whether an LLM agent can integrate new evidence into memory state labels (such as current, outdated, blocked, unresolved, etc.) while avoiding stale memory reuse, scope leakage, or strategically invalid beliefs. The dataset includes two public splits: main (3000 rows, broadly covering different domains, difficulty levels, and failure modes) and hard (500 rows, designed for L3/L4 adversarial scenarios with minimal evidence and no recent event shortcuts), totaling 3500 rows of data. The data is provided in JSONL format, with each scenario object containing a public input (public_input) and a hidden gold standard block (hidden_gold) for official scoring. The dataset is specifically designed for evaluation, suitable for tasks such as question answering, text classification, and text generation, with a focus on agent memory, memory revision, and assessment. When using the dataset, model inputs must be made through the official public view, and hidden_gold or internal fields should not be fed to the model. The dataset is licensed under CC BY 4.0, with code under MIT license, and the data is deterministically generated (seed 2027), version 1.1.0.

创建时间:
2026-06-02
原始信息汇总

MemPatch 数据集概述

MemPatch 是一个用于评估大语言模型(LLM)智能体快速记忆整合(RMI) 能力的基准数据集,源自论文《MemPatch: Benchmarking and Improving Rapid Memory Integration in LLM Agents》。每个测试场景考察智能体是否能将新证据正确整合到 memory_state 标签(如 currentoutdatedblockedunresolved 等)中,避免陈旧复用、范围泄漏或策略无效信念。

许可协议:CC BY 4.0(数据集),代码采用 MIT 协议。

语言:英语。

任务类别:问答、文本分类、文本生成。

标签:agent-memory, llm-agents, rapid-memory-integration, memory-revision, evaluation。

用途仅用于评估,禁止在此数据上训练 MemPatch 修订模块策略,否则会污染基准结果。


数据集结构与规模

数据集包含两个公开划分(split):

公开划分名称 行数 目的
main 3000 跨领域、难度和失败模式的广泛覆盖
hard 500 L3/L4 对抗性样本;低证据量,无最新事件捷径

公开总计:3500 行。

  • realisticcalibration 划分未包含在此公开版本中。
  • 私有隐藏行不属于公开版本。

数据格式

数据以 JSONL 格式存储,文件路径为:

  • main/scenarios.jsonl
  • hard/scenarios.jsonl

每行是一个 JSON 场景对象,包含公开输入(public_input)和用于官方评分的隐藏金标准(hidden_gold)。模型只能接收经过官方公开视图处理后的输入,不得直接使用 hidden_gold 或内部字段。

基准兼容的预测接口格式如下:

json { "scenario_id": "case-000001", "response": { "decision": "use_current_memory", "memory_state": {"m1": "current", "m2": "outdated"}, "evidence_event_ids": ["e2", "e5"], "failure_diagnosis": "stale_memory_reuse", "answer": "..." } }


评估与评分

使用官方评估器进行评分,命令示例:

bash python scripts/evaluate_retrace_bench_predictions.py --data main/scenarios.jsonl --predictions <your_predictions>.jsonl

核心评估指标

  • decision_macro_f1
  • memory_state_accuracy
  • evidence_f1
  • minimal_evidence_exact_match
  • failure_diagnosis_accuracy
  • joint_revision_success
  • stale_reuse_rate
  • format_failure_rate

溯源与引用

  • 生成方式:使用种子 2027 确定性生成。
  • 发布版本1.1.0
  • 代码与基准运行器:https://github.com/yuchenzhu-research/MemPatch
  • 引用格式

bibtex @misc{mempatch2026, title = {MemPatch: Benchmarking and Improving Rapid Memory Integration in LLM Agents}, author = {MemPatch authors}, year = {2026}, note = {Evaluation-only benchmark release. url{https://github.com/yuchenzhu-research/MemPatch}} }

搜集汇总
数据集介绍
MemPatch 数据集图片
构建方式
MemPatch数据集的构建基于合成生成范式,采用确定性种子2027以确保结果可复现。数据集聚焦于评估大语言模型代理在快速记忆整合任务中的表现,通过设计包含不同复杂度与失败模式的测试场景,系统性地检验模型对记忆状态的更新能力。该数据集公开包含两大分割:主要分割涵盖3000个样本,广泛覆盖多领域、多难度及典型失败模式;困难分割则包含500个对抗性样本,旨在挑战模型在缺乏最近事件线索条件下的推理极限。每个测试样例均以JSON格式组织,包含公开输入与隐藏的评分基准,确保评估的公正性与可扩展性。
特点
MemPatch的核心特色在于其专门针对记忆状态标签(如当前、过时、阻塞、未解决等)的快速整合能力进行评测,尤其关注模型避免陈旧复用、范围泄漏及策略无效信念的鲁棒性。数据集通过公开与隐藏分割的巧妙设计,保障了基准测试的纯净度,明确禁止在评测数据上进行训练,从而避免污染。此外,其评分指标体系丰富且精细,涵盖决策宏F1、记忆状态准确率、证据F1等多个维度,能够全面刻画模型在记忆整合任务中的表现,尤其通过陈旧复用率等指标直接揭示模型的失败模式。
使用方法
使用MemPatch数据集时,研究者应从公开分割的JSONL文件中提取模型输入,严禁将隐藏的评分字段暴露给模型。模型需生成包含决策、记忆状态、证据事件标识及失败诊断的结构化预测结果,随后通过官方提供的评估脚本进行标准化评分。该脚本将基于联合修订成功率、格式失败率等核心指标输出性能报告,支持快速比较不同模型在记忆整合任务上的优劣。代码以MIT许可证发布,鼓励在遵守CC BY 4.0数据许可的前提下进行非训练性质的学术研究与应用开发。
背景与挑战
背景概述
大型语言模型(LLM)智能体的记忆管理能力是其实现长期自主决策与交互的关键支撑。MemPatch数据集于2026年由相关研究团队创建,专注于评估与改进LLM智能体的快速记忆整合(Rapid Memory Integration, RMI)能力。该数据集围绕智能体在动态信息环境中能否准确更新记忆状态(如current、outdated、blocked等)这一核心研究问题,设计了3500个跨域场景(含main与hard两个子集),覆盖多样化的难度层级与失败模式。MemPatch通过规范化的评估指标(如decision_macro_f1、memory_state_accuracy、failure_diagnosis_accuracy等),为智能体记忆系统提供了系统性的基准测试框架,深刻推动了智能体记忆鲁棒性与可信赖性的研究进展。
当前挑战
MemPatch核心解决的领域问题在于LLM智能体在动态信息流中遭遇的记忆混淆与状态漂移:常见挑战包括过时记忆的顽固复用、记忆范围的泄漏(如将当前信息误用于已过时情境)以及违背策略约束的信念固化,这些缺陷严重削弱了智能体的可信度与适应性。在数据集构建中,挑战同样显著:需要设计出模拟真实环境的高质量场景,既要确保记忆状态标签的精确性与无歧义,又要避免训练数据污染评估过程。此外,hard分集的对抗性样本要求极少数证据且不依赖最新事件捷径,对场景编排的逻辑严密性提出了极高要求,同时需维持数据生成的可复现性与公平性。
常用场景
经典使用场景
MemPatch数据集专为评估大语言模型智能体的快速记忆整合能力而设计,在智能体记忆管理领域具有标杆地位。每个测试案例通过构造包含新证据与旧记忆状态冲突的对话场景,要求智能体精准判断记忆标签(如current、outdated、blocked、unresolved等),并做出正确的记忆更新决策。数据集划分为主集和困难集两个公开子集,共3500条样本,覆盖广泛领域、难度等级与失败模式,为研究者提供了标准化的评估基准。
解决学术问题
该数据集精准回应了LLM智能体在动态信息环境中面临的记忆僵化与范围泄漏等核心学术困扰。传统模型常表现出陈旧记忆复用、策略冲突信念等认知偏差,MemPatch通过系统性的记忆状态标注与多维度的评分指标(如决策宏F1、记忆状态准确率、证据F1、陈旧复用率等),首次实现了对智能体快速记忆整合能力的定量评估,为理解模型记忆更新机制提供了可复现的实证基础。
衍生相关工作
围绕MemPatch衍生的工作主要集中于几大方向:一是基于数据集的失败模式分析启发的新型记忆修正策略,如对抗性训练与记忆注意机制;二是将其评估协议迁移至多模态智能体记忆基准;三是利用数据集的标准化接口开发开源评估工具链与模型调试框架。此外,联合证据检索与记忆状态推理的混合方法也成为活跃的研究分支,推动了智能体记忆管理从黑盒测试走向可解释的细粒度诊断。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务