PAST-Bench
收藏资源简介:
PAST-Bench是一个专为评估个人AI智能体递归自我改进能力而设计的基准测试,由多位研究者联合构建。该基准涵盖26个场景和204个episode任务,横跨记忆、过程重用、信息收集与更新四大能力维度,通过有序任务族序列及匹配的持久化控制实验,精准隔离保留经验对后续任务的影响。其创建过程强调跨会话上下文清理与可归因机制诊断,旨在系统性地检验智能体能否将过往交互中的经验转化为未来行为改进,并为不同模型和框架下的自我进化提供可解释的评估基础。
PAST-Bench is a benchmark specifically designed for evaluating the recursive self-improvement capabilities of personal AI Agents, co-developed by multiple researchers. This benchmark covers 26 scenarios and 204 episode tasks, spanning four core capability dimensions: memory, process reuse, information gathering, and information updating. Through ordered task family sequences and matched persistent control experiments, it precisely isolates and retains the impact of accumulated experience on subsequent tasks. Its development process emphasizes cross-session context cleaning and diagnosis of attributable mechanisms, aiming to systematically examine whether AI Agents can translate experience from prior interactions into improved future behaviors, and provide an interpretable evaluation foundation for self-evolution across different models and frameworks.
PAST-Bench 数据集详情
概述
PAST-Bench 是一个用于评估和归因持久性智能体跨会话改进效果的基准测试平台。其核心研究问题是:持久性智能体是否真正能从过去的经验中学习并改进自身表现? 该基准通过有序的任务家族序列来评估智能体,其中早期的会话为保留经验创造机会,后续的会话则测试这些经验是否能改善未来行为。
核心贡献
1. PAST-Bench 基准
- 规模:包含 26 个任务家族和 204 个会话实例(episodes)
- 能力覆盖:横跨记忆(Memory)、程序复用(Procedural Reuse)、信息收集(Information Gathering)和更新(Update)四大能力维度
- 评估特点:通过匹配的持久性开启/关闭对照组,结合工件级和追踪级证据,实现能力级评估与机制级归因
2. Hermes+ 框架
- 一种诊断驱动的经验改进框架,在智能体循环中引入五个针对性机制:
- Plan(规划):改进经验的咨询方式
- Render(渲染):改进经验的表示方式
- Route(路由):改进经验的路由分发
- Gate(门控):改进经验的检索机制
- Close(闭合):改进经验的跨会话更新
基准结构
任务家族分布
| 能力目录 | 能力描述 | 任务家族数 | 会话数 |
|---|---|---|---|
memory_ability/ |
保持稳定的偏好、约束和先前案例 | 5 | 41 |
procedural_ability/ |
复用程序和技能 | 8 | 64 |
proactive_information_gathering/ |
行动前主动查找先前上下文 | 6 | 48 |
update_ability/ |
替换过时的事实、规则和程序 | 7 | 51 |
数据组织方式
- 每个任务家族包含一个
family.yaml文件和一个对应每个会话的目录 - PAST-Bench 在运行时根据家族定义构建序列清单
- 参考清单也可在
configs/self_evolve_v2/中获取
支持的环境与配置
运行环境要求
- Python 3.11+
- uv 包管理器
- Docker(需运行守护进程)
- 网络访问(用于包、Docker 镜像和模型 API)
- 各模型配置相应的 API 密钥
支持的模型
| 模型 | 配置文件名 | API 密钥环境变量 |
|---|---|---|
| MiniMax-M2.7 | minimax |
MINIMAX_API_KEY |
| GLM-5.1 | glm |
ZAI_API_KEY |
| Kimi K2.6 | kimi |
KIMI_CODE_API_KEY |
| DeepSeek-V4-Pro | deepseek |
DEEPSEEK_API_KEY |
| GPT-5.4 | openai_gpt54 |
OPENAI_API_KEY |
第三方智能体框架
- Agent Zero
- Hermes Agent(含本地 Hermes+ 变体)
- nanobot
- ZeroClaw
主要实验设计
- Hermes 模型对比实验:固定 Hermes 智能体,在 5 种模型间进行对比
- 固定模型智能体对比实验:固定 MiniMax-M2.7,在 Hermes、Hermes+、nanobot、ZeroClaw 间对比
- Hermes+ 模型对比实验:固定 Hermes+(启用全机制),在 5 种模型间对比
- Hermes+ 机制消融实验:单独或组合测试五种机制的效果
输出结果
每次配对家族运行会生成:
sequence_results.json:逐会话结果sequence_summary.json:序列级摘要sequence_comparison.json:有进化、无进化和差值评分
代码仓库结构
text PAST-Bench/ ├── src/past_bench/ # 基准运行器、评分器、指标和适配器 ├── self-evolve-tasks-v2/ # 26 个任务家族 ├── configs/ # 模型配置文件和参考清单 ├── mock_services/ # 基准任务使用的本地服务 ├── agents/ # 支持的第三方智能体框架 ├── scripts/ # 实验和报告脚本 └── tests/ # 测试套件
许可与引用
- 原始代码许可:Apache License 2.0
- 第三方组件:保留各自上游许可证
- 论文引用:发表于 arXiv(编号 2608.04003),作者为 Xue, Shuhan 等人




