遇见数据集

FP-AMB

收藏
github2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

FP-AMB(第一人称代理记忆基准测试)是一个行业标准、框架无关的评估套件,专为在真实的多会话对话流中运行的长期AI代理记忆系统而设计。它评估上下文回忆、多跳图推理、时间日期数学、适应性/事实覆盖、说话者归属陷阱、拒绝幻觉缺失记忆、来源可信度解决以及代理工具使用执行,涵盖10个核心类别加上动态答案键绑定,涉及约540,878个令牌和458个回合,跨越60个不同的对话会话。

FP-AMB (First-Person Agent Memory Benchmark) is an industry-standard, framework-agnostic evaluation suite designed specifically for long-term AI agent memory systems operating in realistic multi-session conversational flows. It evaluates context recall, multi-hop graph reasoning, temporal date mathematics, adaptivity/factual coverage, speaker attribution traps, rejection of hallucinatory missing memories, source credibility resolution, and agent tool use execution. This benchmark covers 10 core categories plus dynamic answer key binding, encompassing approximately 540,878 tokens and 458 conversational turns across 60 distinct dialogue sessions.

创建时间:
2026-08-26
原始信息汇总

FP-AMB: 第一人称智能体记忆基准测试 (v6.0)

数据集概述

FP-AMB是一个面向长期AI智能体记忆系统的工业级、框架无关的评估套件,专门用于在真实的多会话对话流上评估记忆系统性能。该基准测试涵盖约540,878个token458轮对话,分布在60个不同的对话会话中。

评估类别

该基准测试包含10个核心评估类别及动态答案键绑定部分:

  1. 单跳事实召回(35项):单会话直接事实检索
  2. 跨会话多跳推理(45项):跨会话实体图边连接推理
  3. 时间推理与会话计算(35项):时间戳差值、时间线计算和日期解析
  4. 适应性及事实修正覆盖(35项):动态偏好更新和事实修订追踪
  5. 自引用及程序性工具记忆(37项):程序性工具规则和交互指令回忆
  6. 对抗防御及煤气灯效应鲁棒性(41项):抵抗错误前提和用户误导陷阱
  7. 说话者归因陷阱(15项):区分用户与助手断言(融入LoCoMO和BEAM特性)
  8. 不可回答及缺失记忆拒绝(35项):正确拒绝不存在记忆的查询(融入LongMemEval特性)
  9. 来源可信度及冲突解决(3项):多来源冲突断言消解和可信度加权
  10. 智能体工具使用和执行顺序评估:多轮工具执行循环,检查工具选择、调用顺序和数据负载利用

数据文件

存储于data/目录下:

  • fp_amb_500k_cross_session.jsonl:60个会话、458轮对话(约540k token)
  • fp_amb_cross_session_questions.json:281个静态评估问题
  • dynamic_answer_keys.json:动态键(建议、事实修正、工具学习)
  • master_ground_truth_answer_key.json:主答案键(281项+动态绑定)

关键特性

  • 框架无关:提供简单的2方法SDK接口(ingest_turnretrieve_context),兼容任何RAG、图或智能体记忆系统
  • 双评估模式:支持纯检索评估(零LLM延迟,<60秒)和完整LLM生成准确率检查
  • 丰富的可视化记分卡:生成JSON、交互式HTML仪表板和终端Markdown/ASCII报告
  • Token效率指标:通过Token效率比(准确率%/平均负载token数/1000)防止记忆提供者通过注入过多上下文作弊
  • 自动失败分析:生成Misses与故障分类文本报告,按问题类别和失败根因分类

使用方式

bash

安装

git clone https://github.com/fp-amb/fp-amb-benchmark.git cd fp-amb-benchmark pip install -e .

运行纯检索评估(<60秒)

python -m fp_amb evaluate --provider examples/sample_memory_provider.py

运行第10类智能体工具使用评估

python -m fp_amb.agentic_eval --provider examples/sample_memory_provider.py --model llama3

自定义记忆提供者

通过继承BaseMemoryProvider并实现ingest_turnretrieve_context两个方法即可接入基准测试,支持Any RAG、图或智能体记忆系统(如Mem0、Zep、MemGPT、LangChain、LlamaIndex、Pinecone等)。

许可证

MIT许可证

搜集汇总
数据集介绍
FP-AMB 数据集图片
构建方式
FP-AMB(First-Person Agent Memory Benchmark)作为一种面向长期AI智能体记忆系统的行业级评测基准,其构建过程极具匠心。该数据集以60段多轮用户与助手对话构成,共包含677轮交互与约512,000个词元,覆盖了真实且多样化的跨会话场景。其构建方式融合了多人物角色(personas)驱动的会话生成技术,通过预设的AI助手与五名具有独特语言风格的人类角色进行互动,旨在模拟现实世界中复杂且动态的对话流。除静态语料外,FP-AMB还创新性地引入了动态答案键编译机制,将实时提取的助手建议、事实修正及工具学习规则整合进最终的真值答案键中,从而确保评测的全面性与时效性。
特点
FP-AMB的数据集特点在于其多维度的评测能力与严谨的抗作弊设计。它横跨10大核心评测类别,不仅涵盖单跳事实回忆、跨会话多跳推理、时间数学计算、事实覆盖适应性等基础能力,还深入评估了说话人归属陷阱、对不存在记忆的拒答、来源可信度冲突消解以及智能体工具使用的执行顺序等高级认知能力。尤为突出的是,该数据集整合了LoCoMO、BEAM与LongMemEval等前沿基准的对抗性特征,能够有效检测模型在误导性提问下的鲁棒性。此外,其内置的上下文体量指标与词元效率比率,可防止记忆提供者通过注入过量上下文来获取虚假高分,确保了评测的公平性与可信度。
使用方法
FP-AMB的使用方法高度灵活且框架无关。用户仅需继承BaseMemoryProvider基类并实现ingest_turn与retrieve_context两个核心方法,即可将任何RAG、图数据库或智能体记忆系统接入评测流程。评测支持两种模式:一种为极致快速的纯检索评估(零LLM延迟,耗时小于60秒),另一种为完整的LLM生成准确性校验,后者可通过CLI指定本地或远程的Ollama、llama.cpp等推理端点。评测完成后,系统会自动生成详尽的JSON数据、可视化HTML仪表盘以及Markdown报告,并附带基于失败分类学的失误分析文件,为开发者提供了深入诊断记忆系统薄弱环节的宝贵工具。
背景与挑战
背景概述
随着大语言模型在复杂对话场景中的广泛应用,长期记忆机制成为智能体实现连续、个性化交互的关键瓶颈。FP-AMB(First-Person Agent Memory Benchmark)由研究团队于近年创建,旨在系统评估AI智能体在长时间、多会话流中的记忆能力。该基准通过模拟60个真实对话会话、677轮交互及约51.2万词元的语料库,构建了一个涵盖单跳事实回忆、跨会话多跳推理、时间推理、事实修正、说话人归因、对抗性防御及工具使用等十大核心评估范畴的综合测试框架。FP-AMB的发布填补了记忆评估领域缺乏标准化、动态化基准的空白,其独特的动态答案密钥机制和双模评估模式,为不同记忆系统(如RAG、图存储、记忆代理)提供了公平、可扩展的评测平台,有望推动长期记忆AI系统的研究与落地。
当前挑战
FP-AMB在构建与评测过程中面临多重挑战。领域层面,长期记忆AI系统需在动态信息更新中保持准确,同时应对用户误导性陈述(gaslighting)和说话人归属陷阱,这要求记忆系统具备高效检索、多跳推理与可信度判断的综合能力。基准构建层面,创建如此规模的真实多会话语料库需要精心设计人物角色与对话生成流程,确保语境连贯性与多样性;同时,设计动态答案密钥机制以捕捉实时更新的记忆状态,并平衡纯检索与LLM生成两种评估模式的准确性,实属不易。此外,防止记忆系统通过注入过多上下文“作弊”,需追踪令牌效率与有效载荷大小,确保评估公平性与实际可用性之间的张力。
常用场景
经典使用场景
FP-AMB作为首个面向第一人称智能体长期记忆的基准测试,其核心应用场景在于对多样化的记忆系统进行标准化性能评估。该基准构建了包含60个会话、677轮交互、约51.2万词元的高仿真对话流,覆盖从单跳事实回忆、跨会话多跳推理、时间推算、事实覆写、说话者归因、虚假记忆拒绝到工具调用执行等十大核心能力维度。研究者可借助其框架无关的SDK,无缝接入RAG、图数据库或智能体记忆库等各类记忆架构,实现快速、可复现的横向对比,从而精准定位记忆系统在长程交互中的短板与优势。
解决学术问题
该数据集解决了长期AI智能体记忆评估中缺乏真实多会话动态基准的学术难题。它系统性地整合了对抗性干扰、说话者归因陷阱、缺失记忆拒绝及来源可信度消歧等认知挑战,有效检验了记忆系统在高噪声环境下的鲁棒性。通过引入动态答案键编译机制与工具学习序列验证,FP-AMB推动了记忆评测从静态检索向动态推理与执行协同的范式转移,为后续记忆模型的设计优化提供了理论依据与量化标尺,其令牌效率比等指标也促进了记忆系统在信息处理效率上的严谨研究。
衍生相关工作
FP-AMB本身融合了LoCoMO、BEAM和LongMemEval等既有工作的特征,其设计脉络催生了诸多衍生研究方向。基于该基准,研究者已开发出如mRAG等改进的记忆检索框架,在跨会话推理上获得76.5%的准确率,并推动了针对失败根因分类的自动化分析工具,如将系统错误细分为检索缺失、生成遗漏、干扰陷阱等类型,为记忆机制的错误驱动改进铺平道路。同时,其发布的真实集成示例与详细评测报告,为社区贡献了可复用的记忆系统构建范本,刺激了更多关于智能体长寿记忆、在线学习及工具增强的后续探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务