FP-AMB
收藏资源简介:
FP-AMB(第一人称代理记忆基准测试)是一个行业标准、框架无关的评估套件,专为在真实的多会话对话流中运行的长期AI代理记忆系统而设计。它评估上下文回忆、多跳图推理、时间日期数学、适应性/事实覆盖、说话者归属陷阱、拒绝幻觉缺失记忆、来源可信度解决以及代理工具使用执行,涵盖10个核心类别加上动态答案键绑定,涉及约540,878个令牌和458个回合,跨越60个不同的对话会话。
FP-AMB (First-Person Agent Memory Benchmark) is an industry-standard, framework-agnostic evaluation suite designed specifically for long-term AI agent memory systems operating in realistic multi-session conversational flows. It evaluates context recall, multi-hop graph reasoning, temporal date mathematics, adaptivity/factual coverage, speaker attribution traps, rejection of hallucinatory missing memories, source credibility resolution, and agent tool use execution. This benchmark covers 10 core categories plus dynamic answer key binding, encompassing approximately 540,878 tokens and 458 conversational turns across 60 distinct dialogue sessions.
FP-AMB: 第一人称智能体记忆基准测试 (v6.0)
数据集概述
FP-AMB是一个面向长期AI智能体记忆系统的工业级、框架无关的评估套件,专门用于在真实的多会话对话流上评估记忆系统性能。该基准测试涵盖约540,878个token、458轮对话,分布在60个不同的对话会话中。
评估类别
该基准测试包含10个核心评估类别及动态答案键绑定部分:
- 单跳事实召回(35项):单会话直接事实检索
- 跨会话多跳推理(45项):跨会话实体图边连接推理
- 时间推理与会话计算(35项):时间戳差值、时间线计算和日期解析
- 适应性及事实修正覆盖(35项):动态偏好更新和事实修订追踪
- 自引用及程序性工具记忆(37项):程序性工具规则和交互指令回忆
- 对抗防御及煤气灯效应鲁棒性(41项):抵抗错误前提和用户误导陷阱
- 说话者归因陷阱(15项):区分用户与助手断言(融入LoCoMO和BEAM特性)
- 不可回答及缺失记忆拒绝(35项):正确拒绝不存在记忆的查询(融入LongMemEval特性)
- 来源可信度及冲突解决(3项):多来源冲突断言消解和可信度加权
- 智能体工具使用和执行顺序评估:多轮工具执行循环,检查工具选择、调用顺序和数据负载利用
数据文件
存储于data/目录下:
fp_amb_500k_cross_session.jsonl:60个会话、458轮对话(约540k token)fp_amb_cross_session_questions.json:281个静态评估问题dynamic_answer_keys.json:动态键(建议、事实修正、工具学习)master_ground_truth_answer_key.json:主答案键(281项+动态绑定)
关键特性
- 框架无关:提供简单的2方法SDK接口(
ingest_turn和retrieve_context),兼容任何RAG、图或智能体记忆系统 - 双评估模式:支持纯检索评估(零LLM延迟,<60秒)和完整LLM生成准确率检查
- 丰富的可视化记分卡:生成JSON、交互式HTML仪表板和终端Markdown/ASCII报告
- Token效率指标:通过Token效率比(准确率%/平均负载token数/1000)防止记忆提供者通过注入过多上下文作弊
- 自动失败分析:生成Misses与故障分类文本报告,按问题类别和失败根因分类
使用方式
bash
安装
git clone https://github.com/fp-amb/fp-amb-benchmark.git cd fp-amb-benchmark pip install -e .
运行纯检索评估(<60秒)
python -m fp_amb evaluate --provider examples/sample_memory_provider.py
运行第10类智能体工具使用评估
python -m fp_amb.agentic_eval --provider examples/sample_memory_provider.py --model llama3
自定义记忆提供者
通过继承BaseMemoryProvider并实现ingest_turn和retrieve_context两个方法即可接入基准测试,支持Any RAG、图或智能体记忆系统(如Mem0、Zep、MemGPT、LangChain、LlamaIndex、Pinecone等)。
许可证
MIT许可证




