遇见数据集

AgentLife benchmark

收藏
github2026-07-16 更新2026-07-17 收录
官方服务:

资源简介:

AgentLife基准测试生成合成但真实的个人助理代理生活流:一系列带日期的事件(事实陈述、更新、撤销及噪音),随后进行最终考试。答案源自程序化的时间世界状态,而非人工标注。它设计用于测量LLM代理的记忆性能,具有可构造的正确答案键、精确可审计的评分、可证伪的新鲜度、类型化错误分类、使用情况检测和确定性生成等特点。

AgentLife benchmark generates synthetic yet realistic personal assistant agent life streams: a sequence of dated events (factual statements, updates, retractions, and noise), followed by a final examination. The answers are derived from programmed temporal world states rather than human annotations. It is designed to measure the memory performance of LLM agents, featuring constructible correct answer keys, precisely auditable scoring, falsifiable freshness, typed error classification, usage detection, and deterministic generation.

创建时间:
2026-07-13
原始信息汇总

数据集概述:CLS-Ledger

基本信息

  • 项目名称: CLS-Ledger
  • 论文标题: The Ledger Knows What the Weights Know: Entity-Level Parametric Memory with Provenance Guarantees for LLM Agents
  • DOI: 10.5281/zenodo.21375428
  • 所属阶段: Phase 0 — AgentLife,即该项目的测量工具(benchmark)

AgentLife 基准(Benchmark)设计

AgentLife 生成合成但逼真的“生命轨迹”,模拟个人助理智能体的一系列带有时间戳的事件(事实声明、更新、撤销及噪声),随后进行最终测试。答案源自程序化的时序世界状态,无需人工标注。

设计原则

  1. 答案键正确性由构造保证:特权oracle必须得到100%得分,且在CI中强制执行。
  2. 精确、可审计的评分,不依赖LLM裁判:每个查询附带accepted(所有正确表面形式)和rejected(已过时版本、易混淆实体值)字符串,在归一化后进行词边界匹配。
  3. 新鲜度可证伪:故意过时的oracle(始终回答事实的第一个版本)在current_updated查询上必须得0分,在CI中强制执行;值循环变化的事实(A→B→A)不纳入新鲜度探测。
  4. 类型化错误分类:响应分为correct / stale / hallucination / wrong_value / ambiguous / abstain / miss,使失败模式可测量。
  5. 使用情况可检测:生命周期中的“在线”查询将事实标记为热/冷,并生成每个事实的检索统计信息,作为合并策略实验的输入。
  6. 确定性:相同预设+种子产生完全相同的字节级数据集,跨进程和哈希种子(在CI中强制执行)。

查询类型

类型 探测内容
current_stable 从未改变过的事实的保留情况
current_updated 经过1到k次更新后的新鲜度(旧值被拒绝)
current_volatile 高变化频率事实(如停车位、办公桌)的新鲜度
point_in_time 时间推理:在特定日期D时有效的值
multihop_2/3 跨多个事件(相隔≥5天)的组合推理
revoked 明确撤销的事实(如取消的项目、放弃的饮食计划)
absent 从未陈述过的事实——测量幻觉/弃权
online 生命周期中的查询;构建热/冷使用日志

使用方法

bash

生成数据集(预设规模:S, M, L, XL)

PYTHONPATH=. python3 -m agentlife.generate --preset M --seed 1 --out data/M-1

评估参考系统(oracle必须输出100%)

PYTHONPATH=. python3 -m agentlife.harness.run_eval --data data/M-1 --system oracle PYTHONPATH=. python3 -m agentlife.harness.run_eval --data data/M-1 --system stale PYTHONPATH=. python3 -m agentlife.harness.run_eval --data data/M-1 --system null

自验证套件

PYTHONPATH=. python3 agentlife/tests/test_agentlife.py

数据集布局public/(事件流+问题)是系统可见部分;private/(答案键、世界状态、使用统计)仅用于评分。

参考系统性能(M-1预设)

系统 最终准确率 特征
oracle 100% 验证答案键+评分器端到端
stale 64.6% 在updated/volatile/revoked上得0%,在stable上得100%——拒绝集捕获陈旧性
null 9.8% 仅在absent上得100%——弃权下限

关键实验结果

基于上下文(记忆=上下文)

系统 S-1最终 M-1最终 备注
oracle 100% 100% 答案键验证
full-context 86.4% 76.8% 随生命周期长度下降;M上multihop_3为0%
RAG BM25 k=8 70.5% 58.5% M上revoked为0%,24个陈旧错误——新鲜度失败

参数化记忆(无上下文,S-1)

系统 最终 cur_stable cur_updated 陈旧错误 通用探测
base model 93.8%
naive LoRA (raw text) 15.9% 0% 0% 2 87.5%
SEAL-lite (episode QAs) 20.5% 37.5% 25.0% 10 87.5%
CLS-Ledger v0 (state QAs) 31.8% 75.0% 75.0% 3 68.8%

v2.3结果(局部3B模型)

数据集 CLS v1 CLS v2.3 RAG local RAG 4.1-mini full 4.1-mini
S-1 50.0% 84.1% 52.3% 70.5% 86.4%
M-1 35.4% 63.4% 37.8% 58.5% 76.8%

v3结果——隔离插槽(Isolated Slots with Routed Activation)

指标 monolithic (v2.3) slots-routed (v3)
S-1最终 84.1% 88.6%(超越full-context-4.1-mini 86.4%)
通用探测 75.0% 93.8% = 基础模型精确值(0.0%遗忘)
去学习附带损害 19/40答案改变(重新蒸馏) 0/40(插槽丢弃,无需重新训练)

v5结果——能力检索(4个种子,M预设)

指标 CLS-Ledger BM25 RAG Embeddings RAG
总体 74.9 ± 7.2% 38.4 ± 2.6% 48.3 ± 3.3%
归纳:计数 87.5 ± 10.2% 31.2% 21.9%
归纳:习惯 100 ± 0% 0% 12.5%
归纳:趋势 100 ± 0% 66.7% 66.7%
遵循:日期日优先 100 ± 0% 0% 0%
遵循:城市大写 77.5 ± 7.9% 12.7% 0%

技术架构亮点

  • 隔离插槽:每个实体一个rank-4 LoRA插槽,由账本的路由器在查询时仅激活所查询实体的插槽
  • 去学习:插槽丢弃无需重新训练,0/40附带损害
  • 符号解析:账本内解析时间点(point-in-time 20%→80-100%)和链式问题(multihop 0%→70%)
  • 周期性睡眠:使权重路径在生命周期中期可用,账本通过构造防止权重陈旧

关联系统对比(obsidian-ledger)

系统 确定性超期 查询时类型化verify 符号化induce 控制权重 适用于个人知识库
Zep/Graphiti
Mem0
MemStrata
TOKI / STALE 写入时 仅写入侧
bicameral 转录本,非知识库
basic-memory / MCP memory markdown,无事实
CLS-Ledger / obsidian-ledger (4种判决,含CONTRADICTED_STALE→当前值) (计数/习惯/趋势) (LoRA插槽) (一次安装)

路线图

  • 修复绑定:每张卡更多释义 + ~450-600次迭代与重放;为易混淆实体对添加对比行
  • 强化事件路径:更好的检索(基于每个事实的卡片代替原始事件)和/或更大的局部阅读器
  • 在M-1上进行H1消融(策略:稳定 vs. 热 vs. 全部),待事件路径不再成为混杂因素后
  • 为外科手术式去学习实现真正的隔离插槽(在MLX中的每个实体LoRA融合)
  • 预先注册的成功标准:合并事实的召回率≥90%(移除外部记忆后);通用探测退化≤1%;插槽删除对事实的附带损害<1%
搜集汇总
数据集介绍
AgentLife benchmark 数据集图片
构建方式
AgentLife基准测试数据集旨在评估大语言模型智能体的参数化记忆能力,其构建遵循合成但高度逼真的原则。通过程序化生成一个个人助理智能体的完整“生命历程”,包含一系列带有日期标记的事件流,如事实陈述、更新、撤销及噪声信息,并最终生成一场终结性考试。数据集的核心优势在于答案键正确性由构造保证,一个可读取世界状态的特权预言机必须获得100%的正确率,这一特性通过持续集成得到强制验证。此外,每个查询均附带经过精心编纂的接受字符串集合(所有正确的表面形式)与拒绝字符串集合(已被取代的旧版本或易混淆实体的值),确保了评分过程的精确性与可审计性。数据集内建了新鲜度的可证伪性测试,通过一个故意使用过时信息的预言机验证其在当前更新查询上的得分是否为零,从而确保了对事实动态变化的敏感性。
特点
AgentLife数据集具有一系列独特的设计特征,以应对现有智能体记忆基准测试中的已知缺陷。其采用类型化错误分类体系,将响应归类为正确、过时、幻觉、错误值、模糊、弃权或缺失,从而实现对失败模式的量化分析,而非依赖主观感受。数据集内建了使用情况追踪机制,在智能体的“生命”过程嵌入在线查询,为事实标记冷热程度并生成每个事实的检索统计信息,为后续的整合策略实验提供了关键输入。此外,数据集具有完全的确定性,相同的预设和种子将生成字节完全一致的数据集,这一特性同样通过持续集成得到保证,确保了实验的可重复性与跨进程的一致性。数据集的查询类型设计全面,涵盖稳定事实记忆、更新事实新鲜度、高频变化事实把握、时间点推理、多跳推理、事实撤销响应、对抗幻觉能力以及在线使用日志等多个维度。
使用方法
AgentLife数据集的设计旨在提供一个标准化的评估框架,支持对任意模型和端点的测试。用户可以通过简单的命令行指令生成不同规模的数据集,例如使用预设参数M和随机种子1生成中型数据集。评估过程支持多种参考系统,包括特权预言机、过时预言机和空输出预言机,其中预言机必须获得100%的正确率以验证答案键与评分器的端到端一致性。数据集在物理上划分为公开和私有两部分,公开目录提供智能体可见的事件流与问题,而私有目录则存储仅供评分使用的答案键、世界状态及使用统计信息。通过这样的设计,研究者可以在一个可控、可复现且高度精细的环境中,对比包括全上下文模型、检索增强生成模型以及参数化记忆模型在内的多种记忆架构的表现,精确衡量其在不同记忆维度上的能力与局限。
背景与挑战
背景概述
AgentLife基准测试于2026年由Vicentino研究者在CLS-Ledger项目框架下创建,旨在系统评估大语言模型代理的实体级参数化记忆能力。该数据集通过合成模拟个人助理代理的完整“生命周期”,生成带有时间戳的事件流(包括事实陈述、更新、撤销及噪声),并伴随终结性考试。其核心研究问题聚焦于如何实现选择性、有界且可逆的参数化知识整合,即通过分类账本机制将事实映射至参数位置,使得代理从经验中学习的知识既能被审计又能被删除。AgentLife数据集在领域内具有重要影响力,它解决了现有代理记忆基准测试中普遍存在的答案关键错误、评分依赖大模型判断以及时效性无法验证等根本性缺陷,为参数化记忆与外部记忆的协同工作提供了精确的测量工具。
当前挑战
AgentLife所解决的领域核心挑战在于大语言模型代理的参数化记忆管理存在三大棘手问题:其一,现有记忆系统无法准确区分事实的时效性,代理常输出过时或已被撤销的信息;其二,传统的上下文窗口式记忆随生命周期延长而急剧退化,多跳推理能力几乎丧失;其三,参数化记忆存在灾难性遗忘和知识污染,微调新事实会破坏已有知识,且无法实现精准遗忘。在构建过程中,研究者面临着确保答案关键绝对正确性的挑战,必须通过程序化时态世界状态自动生成而非人工标注,同时要设计可审计的评分系统替代不可靠的大模型评判。此外,还需构建多维度错误分类体系(陈旧、幻觉、错误值等),并实现确定性数据生成以保证实验可重复性,这些都给数据集的设计和验证带来了极大复杂性。
常用场景
经典使用场景
在大型语言模型智能体(LLM Agent)的记忆与知识管理研究中,AgentLife benchmark被精心设计为一种合成但高度逼真的个人助理智能体“生命历程”模拟工具。该基准通过生成带有时间戳的事件流——涵盖事实的陈述、更新、撤销及噪声信息——并辅以源自程序化时序世界状态的最终评测,来系统性地评估智能体对动态、演进信息的处理能力。其核心理念在于确保答案键的正确性通过构造保证,通过无大语言模型评判的精确可审计评分,以及可证伪的新鲜度要求,为衡量智能体的参数化记忆能力提供了严格且可复现的实验框架。
衍生相关工作
围绕AgentLife benchmark,已衍生出一系列旨在改进智能体参数化记忆的前沿工作。其中,CLS-Ledger项目本身即是其直接产物,通过引入具有溯源保证的分类账机制,实现了选择性、有界且可逆的参数化记忆整合。后续版本探索了基于分时段睡眠与分类账解析的增量式快照技术(v2.3)、实体级孤立LoRA插槽与路由激活架构(v3),以及面向实际Obsidian知识库的obsidian-ledger应用。这些工作系统性地验证了使用引导的选择性记忆整合、抽象抑制重放、以及符号链解析等策略在零上下文令牌情况下匹配甚至超越传统RAG方法的潜力,为构建高保真、低遗忘、可审计的智能体长期记忆系统铺平了道路。
数据集最近研究
最新研究方向
面向大语言模型智能体的参数化记忆融合与可溯源机制,AgentLife benchmark通过程序化时序世界状态生成、确定性答案验证与细粒度错误分类框架,系统性解决了现有智能体记忆基准中答案标注错误率高、LLM评判存在偏倚、新鲜度测试不可伪造等关键缺陷。该基准用于评估CLS-Ledger架构的实体级选择性参数固化方案,其v3版本在S-1数据集上以88.6%的准确率超越了全上下文gpt-4.1-mini,同时实现零遗忘与零脱靶副作用,标志着智能体记忆从不可解释的权重黑箱向可审计、可逆、可控的混合记忆范式跨越,为LLM具身认知与终身学习奠定了工程化基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务