SkillEvolBench
收藏资源简介:
SkillEvolBench是一个诊断性基准测试,用于评估从经验重用到技能形成的过程。它包含六个真实世界代理环境中的180个任务,组织成具有共享潜在过程的角色条件任务家族。代理从获取任务中学习,使用压缩轨迹和验证器反馈更新外部技能库,然后面对冻结部署任务,测试上下文转移、对抗性捷径和组合。
SkillEvolBench is a diagnostic benchmark for evaluating the process from experience reuse to skill formation. It contains 180 tasks across six real-world agent environments, organized into role-conditioned task families that share common underlying latent processes. Agents learn from acquisition tasks, update an external skill library using compressed trajectories and validator feedback, and then face frozen deployment tasks that test contextual transfer, adversarial shortcuts, and composition.
数据集概述
SkillEvolBench 是一个用于评估大型语言模型(LLM)智能体能否将片段的、一次性的任务经验(Episodic Experience)提炼为可复用的、程序化的技能(Procedural Skills)的诊断性基准。其核心研究问题是:一次性任务经验能否转化为可供未来智能体遵循的、可复用的指令?
数据集结构与规模
- 任务总数:180个任务。
- 组织结构:采用固定的分层设计,覆盖6个真实世界的智能体环境 × 5个潜在技能族 × 6个任务。
- 任务类型:每个技能族包含3个学习/获取任务(T1-T3)和3个冻结评估任务(T4-T6):
- T1:学习任务,标准首次交互。
- T2:学习任务,丰富后续任务。
- T3:学习任务,变体获取场景。
- T4:评估任务,上下文偏移。
- T5:评估任务,对抗性变体。
- T6:评估任务,技能组合。
评估目的与核心发现
- 基准目标:分离“程序化抽象能力”与“基础能力”、“预置先验知识”以及“片段轨迹的直接复用”。
- 对照设置:通过比较“自生成技能演化”、“预置种子技能演化”与“无技能基线”、“原始轨迹基线”,进行诊断评估。
- 主要发现:
- 当前智能体通常能进行局部适应,但很少能形成鲁棒、可复用的技能。
- 基于技能的条件可以提高获取或回放效果,但在冻结部署场景下,这些增益不稳定。
- 复用原始轨迹的表现常常优于蒸馏后的技能,表明当前的抽象过程丢弃了对未来任务仍有用的上下文和程序性线索。
- 写入更多技能或构建更大的资源库并非有效方法:额外的更新在提高覆盖度的同时,也引入了特定于片段的漂移和程序性混乱。
基线设置
数据集提供了多种规范基线和消融基线,均通过配置文件调用。
| 基线名称 | 配置文件名称 | 测试目的 |
|---|---|---|
| No Skill | no_skill |
无技能、无记忆、无轨迹检索的裸智能体。 |
| Raw Trajectory RAG | raw_trajectory_rag |
检索同族原始学习轨迹,而非蒸馏技能。 |
| Self-Generated Zero-Shot | selfgen_zero_shot |
在获得经验前,根据任务/家族上下文创建技能。 |
| Self-Generated Experience | selfgen_experience_always |
从经验中归纳技能,并在每次学习试验中修订。 |
| Curated Static | curated_static |
使用预置种子技能,不进行修订。 |
| Curated + Revision | curated_with_revision_always |
从预置种子技能开始,在每次学习试验中修订。 |
| 消融基线名称 | 配置文件名称 |
|---|---|
| Failure-only self-generated revision | selfgen_experience |
| Failure-only curated revision | curated_with_revision |
| Required Tier-3 skill files, self-generated | selfgen_experience_always_with_tier3 |
| Required Tier-3 skill files, curated | curated_with_revision_always_with_tier3 |
支持的模型与预设
基准支持通过不同提供商接入的多种模型,预设配置文件位于 configs/models/ 目录下。
| 模型预设 | 提供商路由 | 所需凭证 |
|---|---|---|
gpt-5.2-codex.yaml |
Azure OpenAI Codex CLI | AZURE_OPENAI_ENDPOINT, AZURE_OPENAI_API_KEY |
gpt-5.3-codex.yaml |
Azure OpenAI Codex CLI | AZURE_OPENAI_ENDPOINT, AZURE_OPENAI_API_KEY |
gpt-5.4.yaml |
Azure OpenAI Codex CLI | AZURE_OPENAI_ENDPOINT, AZURE_OPENAI_API_KEY |
claude-sonnet-4.5.yaml |
AWS Bedrock Claude Code | AWS_BEARER_TOKEN_BEDROCK, AWS_REGION |
claude-sonnet-4.6.yaml |
AWS Bedrock Claude Code | AWS_BEARER_TOKEN_BEDROCK, AWS_REGION |
claude-opus-4.5.yaml |
AWS Bedrock Claude Code | AWS_BEARER_TOKEN_BEDROCK, AWS_REGION |
claude-opus-4.6.yaml |
AWS Bedrock Claude Code | AWS_BEARER_TOKEN_BEDROCK, AWS_REGION |
gemini-2.5-pro.yaml |
Gemini CLI direct | GEMINI_API_KEY |
gemini-3-flash.yaml |
Gemini CLI direct | GEMINI_API_KEY |
gemini-3.1-pro.yaml |
Gemini CLI direct | GEMINI_API_KEY |
kimi-2-thinking.yaml |
OpenAI-compatible Mantle/Kimi | KIMI_BEDROCK_BASE_URL, KIMI_BEDROCK_API_KEY |
kimi-2.5.yaml |
OpenAI-compatible Mantle/Kimi | KIMI_BEDROCK_BASE_URL, KIMI_BEDROCK_API_KEY |
引用信息
bibtex @article{lei2026skillevolbench, title={SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills}, author={Lei, Yingtie and Wan, Zhongwei and Zhang, Jiankun and Alam, Samiul and Zhong, Zixuan and Huang, Peizhou and Wang, Xin and Zhang, Jingxuan and Zhou, Donghao and Hsieh, Yunta and others}, journal={arXiv preprint arXiv:2605.24117}, year={2026} }




