遇见数据集

PAST-Bench

收藏
github2026-08-05 更新2026-08-06 收录
官方服务:

资源简介:

PAST-Bench是一个用于评估和归因持久代理跨会话改进的基准测试,包含26个任务族和204个episode,涵盖记忆、程序重用、信息收集和更新。

PAST-Bench is a benchmark for evaluating and attributing cross-session improvements of persistent agents. It includes 26 task families and 204 episodes, covering memory, program reuse, information gathering and information updates.

创建时间:
2026-08-02
原始信息汇总

PAST-Bench 数据集详情

数据集简介

PAST-Bench是一个用于评估和归因持久化智能体跨会话改进能力的基准测试。该基准不局限于对孤立任务进行评分,而是通过有序的任务族序列来评估智能体——早期的会话为智能体提供了保留经验的机会,后续的新会话则测试这些经验是否能改善未来的行为表现。

核心贡献

1. PAST-Bench 基准

  • 通过纵向的新会话任务序列评估智能体,并结合持久化开/关的配对对照以及工件和轨迹层面的证据
  • 包含26个任务族和204个会话,覆盖记忆、程序复用、信息收集和更新四类能力,既支持能力层面的评估,也支持机制层面的归因

2. Hermes+ 框架

基于PAST-Bench识别的失败模式,Hermes+在智能体循环中引入了五种机制——Plan(规划)、Render(呈现)、Route(路由)、Gate(门控)、Close(收敛)——以改善跨会话经验的咨询、表示、路由、检索和更新方式。

基准结构

能力类别 说明 任务族数量 会话数量
记忆能力 保留稳定的偏好、约束和先例 5 41
程序能力 复用流程和技能 8 64
主动信息收集 在行动前查找先前的上下文 6 48
更新能力 替换过时的事实、规则和流程 7 51

每个任务族包含一个family.yaml文件和若干会话目录,PAST-Bench在运行时根据族定义构建会话序列清单。

支持的模型

模型 配置文件 环境变量
MiniMax-M2.7 minimax MINIMAX_API_KEY
GLM-5.1 glm ZAI_API_KEY
Kimi K2.6 kimi KIMI_CODE_API_KEY
DeepSeek-V4-Pro deepseek DEEPSEEK_API_KEY
GPT-5.4 openai_gpt54 OPENAI_API_KEY

主要实验

  1. Hermes模型对比:固定Hermes智能体,变换不同模型进行测试
  2. 固定模型智能体对比:固定MiniMax-M2.7模型,比较Hermes、Hermes+、nanobot和ZeroClaw等智能体
  3. Hermes+模型对比:启用全部五种机制,变换不同模型进行测试
  4. Hermes+机制消融实验:测试各机制对整体性能的贡献

输出文件

每次配对的运行会生成以下结果文件:

  • sequence_results.json:每个会话的详细结果
  • sequence_summary.json:序列级别的总结
  • sequence_comparison.json:有演化、无演化及差异分数

环境要求

  • Python 3.11+
  • uv 包管理器
  • Docker(需运行中的守护进程)
  • 用于包下载、Docker镜像和模型API的网络访问
  • 每个使用的模型配置对应的API密钥

第三方组件

PAST-Bench包含以下第三方智能体框架的适配器或本地副本:

这些组件在agents/目录下保留其原始许可证文件。

许可证

PAST-Bench的原创代码采用Apache License 2.0许可,第三方组件保留其上游许可证。

搜集汇总
数据集介绍
PAST-Bench 数据集图片
构建方式
PAST-Bench的构建依托纵向的跨会话任务序列设计,旨在系统评测持久化智能体的经验积累能力。该基准精心编纂了涵盖记忆、程序复用、信息搜集与更新四大能力的26个任务族、204个回合,每个任务族内含家族定义文件与逐回合目录,运行时可动态生成序列清单。为达成可归因的效能增益评估,基准巧妙融合了配对持久化开关对照与痕迹证据分析,从而在能力层级与机制层级双重维度上揭示智能体的进化轨迹。
特点
该基准的核心特色在于其对照实验设计与多维度证据链构建。评价框架不囿于孤立任务评分,而是通过有序任务族序列模拟真实环境下的经验沉淀过程,结合持久化开启/关闭的配对控制,精准隔离并度量学习带来的性能跃迁。同时,基准嵌入Hermes+诊断驱动框架,该框架通过计划、渲染、路由、门控与关闭五种精制机制,分别强化经验的查阅、表征、导流、检索与更新环节,为剖析智能体自我改进的内在机理提供了前所未有的精细化视角。
使用方法
使用者可依据详尽文档快速部署,支持多样模型档案配置及多智能体框架适配。运行流程条理分明,提供冒烟测试以便即刻验证环境完整性。主实验设计围绕模型对比、智能体对比、机制消融及Hermes+效能评估四条主线展开,每条线均提供明确命令行范式。每次任务族运行产出逐回合结果、序列级汇总及对照增量等结构化JSON文件,极大便利了后续的量化分析与结果比对,为研究社区提供了标准化、可复现的评估流程。
背景与挑战
背景概述
PAST-Bench是2026年由Shuhan Xue、Zixin Ding等学者联合发布的基准测试,旨在系统评估持久化智能体在跨会话场景中的递归自我改进能力。该基准基于一个核心研究问题:智能体能否真正从过往经验中学习并提升未来表现,而非简单地在孤立任务中重复操作。为此,它构建了包含26个任务族、204个回合的纵向评测体系,覆盖记忆保持、程序复用、信息检索与知识更新四大能力维度,并通过持久化开关对照与工件追踪,实现了能力级评估与机制级归因的双重目标。该基准的发布为个性化智能体的持续学习研究提供了标准化测试平台,推动了领域内对智能体长期演化机制的深入理解,对相关学术研究与工程实践均产生了重要影响。
当前挑战
PAST-Bench面临多重挑战。在领域问题层面,现有基准多聚焦于单次会话内的任务完成,难以衡量智能体跨会话的经验积累与迁移能力,而PAST-Bench需设计有序任务序列以捕捉细微的持续性改进,这要求精确分离经验保留与遗忘的干扰因素。在构建过程中,任务族需覆盖多样化的能力维度,且每个回合需保证环境可控性与可重复性,同时兼顾真实业务场景的复杂性,这对任务设计提出了高要求。此外,跨模型与跨框架的公平对比、持久化机制的精准归因、以及长序列实验的计算开销,均是构建中所必须克服的技术挑战。
常用场景
经典使用场景
PAST-Bench作为评估持久化智能体跨会话改进能力的基准测试,其核心应用场景在于纵向追踪智能体在连续任务序列中的表现变化。该基准精心设计了包含26个任务族、204个episode的评估体系,覆盖记忆、程序性复用、信息收集与更新四大能力维度。研究者通过构建‘先经验积累、后新会话测试’的序列范式,能够精准观测智能体是否真正从过往交互中汲取知识并应用于未来情境,从而为递归自我改进这一前沿方向提供了标准化的量化评估工具。
衍生相关工作
基于PAST-Bench的诊断结果,研究团队衍生出Hermes+这一诊断驱动型改进框架,其新增的Plan、Render、Route、Gate、Close五大机制分别针对经验的咨询、表征、路由、检索与更新环节进行强化,显著提升了代理的跨会话学习效率。此外,该基准还催生了关于智能体自我进化机制的消融研究(例如机制逐步消融实验),以及对不同模型(如MiniMax-M2.7、GLM-5.1等)与不同代理框架(如Agent Zero、nanobot等)在持久化能力上的对比分析。这些衍生工作共同构建了从问题发现到机制改进、再到系统验证的完整研究链条,为后续探索智能体的终身学习与自我完善提供了坚实的技术积淀。
数据集最近研究
最新研究方向
当前,随着大语言模型驱动的智能体从单次任务执行向跨会话持续演化迈进,递归式自我改进能力成为研究焦点。PAST-Bench基准应运而生,它通过精心设计的纵向任务序列与持久性开关对照,系统评估智能体能否从历史经验中汲取养分以实现跨会话性能跃升。该基准覆盖记忆、程序复用、信息搜集与更新四大认知维度,共26个任务族、204个回合,为可归因的改进机制提供了严谨的量化标尺。配套提出的Hermes+智能体框架,通过Plan、Render、Route、Gate、Close五重机制精细调控经验的应用路径,为破解持续学习中的灾难性遗忘与知识迁移难题开辟了新径。这一工作不仅填补了递归自我改进评估工具的空白,更推动了个性化智能体从静态响应向动态成长的范式转变,对下一代自适应AI系统的研发具有里程碑式的指引意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务