遇见数据集

PAST-Bench

收藏
arXiv2026-08-05 更新2026-08-06 收录
官方服务:

资源简介:

PAST-Bench是一个专为评估个人AI智能体递归自我改进能力而设计的基准测试,由多位研究者联合构建。该基准涵盖26个场景和204个episode任务,横跨记忆、过程重用、信息收集与更新四大能力维度,通过有序任务族序列及匹配的持久化控制实验,精准隔离保留经验对后续任务的影响。其创建过程强调跨会话上下文清理与可归因机制诊断,旨在系统性地检验智能体能否将过往交互中的经验转化为未来行为改进,并为不同模型和框架下的自我进化提供可解释的评估基础。

PAST-Bench is a benchmark specifically designed for evaluating the recursive self-improvement capabilities of personal AI Agents, co-developed by multiple researchers. This benchmark covers 26 scenarios and 204 episode tasks, spanning four core capability dimensions: memory, process reuse, information gathering, and information updating. Through ordered task family sequences and matched persistent control experiments, it precisely isolates and retains the impact of accumulated experience on subsequent tasks. Its development process emphasizes cross-session context cleaning and diagnosis of attributable mechanisms, aiming to systematically examine whether AI Agents can translate experience from prior interactions into improved future behaviors, and provide an interpretable evaluation foundation for self-evolution across different models and frameworks.

创建时间:
2026-08-05
原始信息汇总

PAST-Bench 数据集详情

概述

PAST-Bench 是一个用于评估和归因持久性智能体跨会话改进效果的基准测试平台。其核心研究问题是:持久性智能体是否真正能从过去的经验中学习并改进自身表现? 该基准通过有序的任务家族序列来评估智能体,其中早期的会话为保留经验创造机会,后续的会话则测试这些经验是否能改善未来行为。

核心贡献

1. PAST-Bench 基准

  • 规模:包含 26 个任务家族204 个会话实例(episodes)
  • 能力覆盖:横跨记忆(Memory)、程序复用(Procedural Reuse)、信息收集(Information Gathering)和更新(Update)四大能力维度
  • 评估特点:通过匹配的持久性开启/关闭对照组,结合工件级和追踪级证据,实现能力级评估与机制级归因

2. Hermes+ 框架

  • 一种诊断驱动的经验改进框架,在智能体循环中引入五个针对性机制:
    • Plan(规划):改进经验的咨询方式
    • Render(渲染):改进经验的表示方式
    • Route(路由):改进经验的路由分发
    • Gate(门控):改进经验的检索机制
    • Close(闭合):改进经验的跨会话更新

基准结构

任务家族分布

能力目录 能力描述 任务家族数 会话数
memory_ability/ 保持稳定的偏好、约束和先前案例 5 41
procedural_ability/ 复用程序和技能 8 64
proactive_information_gathering/ 行动前主动查找先前上下文 6 48
update_ability/ 替换过时的事实、规则和程序 7 51

数据组织方式

  • 每个任务家族包含一个 family.yaml 文件和一个对应每个会话的目录
  • PAST-Bench 在运行时根据家族定义构建序列清单
  • 参考清单也可在 configs/self_evolve_v2/ 中获取

支持的环境与配置

运行环境要求

  • Python 3.11+
  • uv 包管理器
  • Docker(需运行守护进程)
  • 网络访问(用于包、Docker 镜像和模型 API)
  • 各模型配置相应的 API 密钥

支持的模型

模型 配置文件名 API 密钥环境变量
MiniMax-M2.7 minimax MINIMAX_API_KEY
GLM-5.1 glm ZAI_API_KEY
Kimi K2.6 kimi KIMI_CODE_API_KEY
DeepSeek-V4-Pro deepseek DEEPSEEK_API_KEY
GPT-5.4 openai_gpt54 OPENAI_API_KEY

第三方智能体框架

  • Agent Zero
  • Hermes Agent(含本地 Hermes+ 变体)
  • nanobot
  • ZeroClaw

主要实验设计

  1. Hermes 模型对比实验:固定 Hermes 智能体,在 5 种模型间进行对比
  2. 固定模型智能体对比实验:固定 MiniMax-M2.7,在 Hermes、Hermes+、nanobot、ZeroClaw 间对比
  3. Hermes+ 模型对比实验:固定 Hermes+(启用全机制),在 5 种模型间对比
  4. Hermes+ 机制消融实验:单独或组合测试五种机制的效果

输出结果

每次配对家族运行会生成:

  • sequence_results.json:逐会话结果
  • sequence_summary.json:序列级摘要
  • sequence_comparison.json:有进化、无进化和差值评分

代码仓库结构

text PAST-Bench/ ├── src/past_bench/ # 基准运行器、评分器、指标和适配器 ├── self-evolve-tasks-v2/ # 26 个任务家族 ├── configs/ # 模型配置文件和参考清单 ├── mock_services/ # 基准任务使用的本地服务 ├── agents/ # 支持的第三方智能体框架 ├── scripts/ # 实验和报告脚本 └── tests/ # 测试套件

许可与引用

  • 原始代码许可:Apache License 2.0
  • 第三方组件:保留各自上游许可证
  • 论文引用:发表于 arXiv(编号 2608.04003),作者为 Xue, Shuhan 等人
搜集汇总
数据集介绍
PAST-Bench 数据集图片
构建方式
PAST-Bench的构建围绕在线自我进化能力的四个核心维度展开,即记忆、程序复用、信息搜集与更新。每个维度均精心设计了多个任务族,每个任务族由有序的新会话片段构成,这些片段共享一个潜在规则、可复用工件、修正信息或预置参考。构建过程中引入了严格的上下文清理协议,确保后续片段的性能提升必须通过持久化基板(如记忆存储、技能文件、规则库)流动,而非依赖残留的提示词重叠。为增强评估的严谨性,每个任务族还包含了多种控制片段,如无保留控制、干扰控制、过时控制和错误机制控制,以剔除短路径记忆、表面记忆化与过时复用等替代性解释。最终,该基准涵盖了26个场景、204个片段,构建了从经验保留到性能提升的可归因评估框架。
特点
PAST-Bench的核心特色在于其性能归因能力,能够精准区分后续任务性能的提升究竟源于保留经验的复用,还是基础模型、运行时环境、提示词或评分噪声等混淆因素。它通过配对实验设计,在保持模型、任务与接口不变的前提下,开启或关闭持久化状态,从而将性能差异直接归因于持久化层。此外,该基准不仅报告任务分数,还引入了机制证据分数,审视智能体是否遵循了预期的保存、检索、更新通路,揭示了相同任务分数增益背后可能隐藏的迥异持久化路径。这种双轴评估框架超越了传统一次性评分,为洞察自我进化过程中的具体成败环节提供了前所未有的粒度。
使用方法
PAST-Bench的使用方法旨在为研究社区提供标准化的评估与诊断工具。研究者可将其作为标杆,对具有持久化能力的个人智能体进行系统性评测,通过比较有无保留经验条件下的任务分数差距,量化其自我进化幅度。同时,机制证据分数可用于诊断智能体在规划的编写、渲染、路由、门控与收尾等环节中的具体阻断点,从而指导智能体框架的定向优化。更为关键的是,该基准支持跨模型与跨框架的对比分析,允许在固定模型下比较不同框架的持久化效率,或在固定框架下探索不同模型的能力分布。它还能作为开发新智能体框架的参考基础,比如通过插入单项机制进行消融研究,以精确评估每个环节的贡献。
背景与挑战
背景概述
PAST-Bench 是由 Shuhan Xue 等人于 2026 年提出的一项基准测试,旨在系统性地评估个人 AI 代理的递归自我改进能力。该基准聚焦于代理能否通过跨会话保留的经验(如记忆、技能、流程)来提升未来任务表现,涵盖记忆、程序复用、信息收集和更新四个能力维度,共 26 个场景、204 个情节。研究团队通过匹配的对照实验,将保留经验开关设为变量,并引入机制证据分数以区分真实提升与表面增益。PAST-Bench 的提出填补了现有基准在跨会话经验归因方面的空白,为可进化代理的评估提供了标准化平台,并为后续代理框架(如 Hermes+)的设计优化提供了诊断依据,对自主代理领域的发展具有重要推动意义。
当前挑战
PAST-Bench 面临的挑战主要源于两个方面:其一,领域内核心问题在于如何区分代理性能提升是源于保留经验还是基座模型、运行环境或提示噪声等混杂因素,现有基准难以实现这一归因,且代理可能存储错误证据、检索无关记忆或应用过时状态,导致改进并非真实有效;其二,基准构建过程中需精心设计任务族和匹配对照,以确保控制变量的一致性,同时需通过机制证据分数(如内存读写、技能调用轨迹)验证改进是否遵循预期路径,而不同模型和框架的表现差异显著,机制干预效果具有能力和模型依赖性,这要求基准具备高度可控性和诊断精度,构建与评估的复杂度极高。
常用场景
经典使用场景
PAST-Bench作为首个聚焦于递归自我改进基础能力的基准测试,其核心应用场景在于系统性地评估个人AI代理在跨会话情境下利用留存经验提升后续任务表现的能力。该基准通过设计包含记忆、程序复用、信息收集与状态更新四个维度的26个任务场景及204个片段,构建了严格的持久化开启与关闭的对照实验,从而精确剥离基础模型能力、运行时环境与经验留存对性能的贡献。研究者和开发者借助PAST-Bench,能够在统一框架下对多种基础模型与代理架构进行公平比较,深入剖析代理在学习、检索、应用与修正经验等环节中的行为差异,为验证代理是否真正实现从简单保留经验向系统性自我改进的跨越提供了标准化、可量化的评测平台。
解决学术问题
该数据集精准回应了当前智能代理研究领域的一个核心难题——如何证实跨会话的性能提升确实源自经验的有效留存与再利用,而非模型固有能力的自然表现或提示工程的偶然效果。PAST-Bench通过引入任务族内的匹配对照、机制证据评分与细粒度的归因分析,有效排除了任务难度变化、检索捷径、过时信息干扰等潜在混淆因素,从方法学上解决了性能提升归因模糊的学术挑战。其贡献在于首次将“经验驱动进化”从抽象概念转化为可量化、可诊断的实验对象,为理论验证代理的在线自进化能力提供了坚实基础,同时为不同模型和框架间的相互比较设立了新标准,深刻影响了后续关于智能代理长期学习与自适应机制的研究路径。
衍生相关工作
围绕PAST-Bench衍生出一系列极具价值的后续研究工作。首先,经典的Hermes+框架便是基于PAST-Bench诊断性发现而提出的一种增强方案,它通过对代理循环中规划、渲染、路由、门控与关闭五个关键环节实施针对性干预,显著提升了代理在信息更新方面的经验收益,并增强了机制证据的清晰度。其次,PAST-Bench所揭示的能力特异性和模型依赖性现象,催生了对持久化机制组合效应的深入研究,激励学者探索如何动态地在内存、技能与会话历史等不同基底间路由经验。再者,该基准的归因方法论启发了对更强大递归自我改进能力的探索,如自动化工具策略获取、多代理经验协同以及自我学习机制的改进等。这些衍生工作共同构建了关于智能代理持续成长与自适应能力的丰富研究脉络,推动了该领域的蓬勃发展与持续创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务