遇见数据集

SkillEvolBench

收藏
github2026-06-06 更新2026-06-12 收录
官方服务:

资源简介:

SkillEvolBench是一个诊断性基准测试,用于评估从经验重用到技能形成的过程。它包含六个真实世界代理环境中的180个任务,组织成具有共享潜在过程的角色条件任务家族。代理从获取任务中学习,使用压缩轨迹和验证器反馈更新外部技能库,然后面对冻结部署任务,测试上下文转移、对抗性捷径和组合。

SkillEvolBench is a diagnostic benchmark for evaluating the process from experience reuse to skill formation. It contains 180 tasks across six real-world agent environments, organized into role-conditioned task families that share common underlying latent processes. Agents learn from acquisition tasks, update an external skill library using compressed trajectories and validator feedback, and then face frozen deployment tasks that test contextual transfer, adversarial shortcuts, and composition.

创建时间:
2026-06-01
原始信息汇总

数据集概述

SkillEvolBench 是一个用于评估大型语言模型(LLM)智能体能否将片段的、一次性的任务经验(Episodic Experience)提炼为可复用的、程序化的技能(Procedural Skills)的诊断性基准。其核心研究问题是:一次性任务经验能否转化为可供未来智能体遵循的、可复用的指令?

数据集结构与规模

  • 任务总数:180个任务。
  • 组织结构:采用固定的分层设计,覆盖6个真实世界的智能体环境 × 5个潜在技能族 × 6个任务。
  • 任务类型:每个技能族包含3个学习/获取任务(T1-T3)和3个冻结评估任务(T4-T6):
    • T1:学习任务,标准首次交互。
    • T2:学习任务,丰富后续任务。
    • T3:学习任务,变体获取场景。
    • T4:评估任务,上下文偏移。
    • T5:评估任务,对抗性变体。
    • T6:评估任务,技能组合。

评估目的与核心发现

  • 基准目标:分离“程序化抽象能力”与“基础能力”、“预置先验知识”以及“片段轨迹的直接复用”。
  • 对照设置:通过比较“自生成技能演化”、“预置种子技能演化”与“无技能基线”、“原始轨迹基线”,进行诊断评估。
  • 主要发现
    • 当前智能体通常能进行局部适应,但很少能形成鲁棒、可复用的技能。
    • 基于技能的条件可以提高获取或回放效果,但在冻结部署场景下,这些增益不稳定。
    • 复用原始轨迹的表现常常优于蒸馏后的技能,表明当前的抽象过程丢弃了对未来任务仍有用的上下文和程序性线索。
    • 写入更多技能或构建更大的资源库并非有效方法:额外的更新在提高覆盖度的同时,也引入了特定于片段的漂移和程序性混乱。

基线设置

数据集提供了多种规范基线和消融基线,均通过配置文件调用。

基线名称 配置文件名称 测试目的
No Skill no_skill 无技能、无记忆、无轨迹检索的裸智能体。
Raw Trajectory RAG raw_trajectory_rag 检索同族原始学习轨迹,而非蒸馏技能。
Self-Generated Zero-Shot selfgen_zero_shot 在获得经验前,根据任务/家族上下文创建技能。
Self-Generated Experience selfgen_experience_always 从经验中归纳技能,并在每次学习试验中修订。
Curated Static curated_static 使用预置种子技能,不进行修订。
Curated + Revision curated_with_revision_always 从预置种子技能开始,在每次学习试验中修订。
消融基线名称 配置文件名称
Failure-only self-generated revision selfgen_experience
Failure-only curated revision curated_with_revision
Required Tier-3 skill files, self-generated selfgen_experience_always_with_tier3
Required Tier-3 skill files, curated curated_with_revision_always_with_tier3

支持的模型与预设

基准支持通过不同提供商接入的多种模型,预设配置文件位于 configs/models/ 目录下。

模型预设 提供商路由 所需凭证
gpt-5.2-codex.yaml Azure OpenAI Codex CLI AZURE_OPENAI_ENDPOINT, AZURE_OPENAI_API_KEY
gpt-5.3-codex.yaml Azure OpenAI Codex CLI AZURE_OPENAI_ENDPOINT, AZURE_OPENAI_API_KEY
gpt-5.4.yaml Azure OpenAI Codex CLI AZURE_OPENAI_ENDPOINT, AZURE_OPENAI_API_KEY
claude-sonnet-4.5.yaml AWS Bedrock Claude Code AWS_BEARER_TOKEN_BEDROCK, AWS_REGION
claude-sonnet-4.6.yaml AWS Bedrock Claude Code AWS_BEARER_TOKEN_BEDROCK, AWS_REGION
claude-opus-4.5.yaml AWS Bedrock Claude Code AWS_BEARER_TOKEN_BEDROCK, AWS_REGION
claude-opus-4.6.yaml AWS Bedrock Claude Code AWS_BEARER_TOKEN_BEDROCK, AWS_REGION
gemini-2.5-pro.yaml Gemini CLI direct GEMINI_API_KEY
gemini-3-flash.yaml Gemini CLI direct GEMINI_API_KEY
gemini-3.1-pro.yaml Gemini CLI direct GEMINI_API_KEY
kimi-2-thinking.yaml OpenAI-compatible Mantle/Kimi KIMI_BEDROCK_BASE_URL, KIMI_BEDROCK_API_KEY
kimi-2.5.yaml OpenAI-compatible Mantle/Kimi KIMI_BEDROCK_BASE_URL, KIMI_BEDROCK_API_KEY

引用信息

bibtex @article{lei2026skillevolbench, title={SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills}, author={Lei, Yingtie and Wan, Zhongwei and Zhang, Jiankun and Alam, Samiul and Zhong, Zixuan and Huang, Peizhou and Wang, Xin and Zhang, Jingxuan and Zhou, Donghao and Hsieh, Yunta and others}, journal={arXiv preprint arXiv:2605.24117}, year={2026} }

搜集汇总
数据集介绍
SkillEvolBench 数据集图片
构建方式
在智能体探索现实世界任务的过程中,大规模语言模型智能体会积累丰富的片段式轨迹,但如何将这些经验转化为可复用的程序性技能仍是悬而未决的问题。为此,SkillEvolBench应运而生,这是一个用于评估从经验复用迈向技能形成这一关键步骤的诊断性基准。该基准精心构建了涵盖六个真实世界智能体环境的180项任务,这些任务被组织为具有共享潜在程序的角色条件任务族。智能体首先从初始的任务习得中学习,随后利用压缩后的轨迹和验证器反馈来更新外部的技能库,最终在冻结的部署任务上面临上下文偏移、对抗性捷径和技能组合等测试。通过与无技能和原始轨迹复用的对照组进行比较,SkillEvolBench能够将程序抽象能力与基础能力、预先已知的领域知识以及片段轨迹的直接复用分离,从而精准地测量技能的形成过程。
特点
SkillEvolBench最显著的特征在于其系统化地分离了程序抽象与基础能力、先验知识及原始经验复用之间的关系。该基准采用六组环境、每组五种潜在技能家族、每个家族六项任务的固定分层设计,其中前三项为习得任务,后三项分别测试上下文偏移、对抗性变体和技能组合能力。它支持智能体在完成习得任务后,自主生成或基于精心设计的技能种子进行技能演化,并在冻结的部署任务中严格测评。实验揭示了一个深刻的洞察:当前智能体往往能局部适应却难以形成鲁棒的可复用技能,原始轨迹复用甚至常常超越蒸馏后的技能,暗示现有的抽象过程丢弃了对未来任务仍有价值的上下文和程序线索。此外,容量和成本分析表明,单纯增加技能数量或更大的资源库并不足够,因为额外的更新可能在提升覆盖范围的同时引入特定于片段的漂移和程序杂乱。
使用方法
使用SkillEvolBench进行评测时,研究者需首先配置环境,搭建Python 3.12虚拟环境并安装核心依赖库,随后通过Docker构建任务运行时镜像。接着,在忽略Git的`.harbor-agents.env`文件中填写所需大模型提供商的API密钥,例如Azure OpenAI或AWS Bedrock。运行基准前,建议执行配置与资源验证脚本及预检脚本以确保环境就绪。最终通过`scripts/run.py`启动单次评测,需指定基线名称(如无技能基线`no_skill`、原始轨迹检索基线`raw_trajectory_rag`等)、模型预设配置文件以及任务顺序种子。完整的评测流程包括运行六个标准基线与多个模型配置的组合,结果自动汇总至`workspace/runs/`目录下,可通过摘要脚本查看全面指标。开发者亦可通过提供的批量启动脚本高效完成大规模基线对比实验。
背景与挑战
背景概述
SkillEvolBench是一个由俄亥俄州立大学、芝加哥大学、伦敦大学学院、密歇根大学、香港中文大学、凯斯西储大学及亚马逊等顶尖机构联合创建的诊断性基准数据集,发表于2026年。其核心研究问题聚焦于大型语言模型代理能否将执行真实任务时积累的丰富片段经验(episodic experience)转化为可复用的程序化技能(procedural skills)。该数据集包含180个横跨六个真实世界代理环境的任务,按角色条件划分为共享潜在流程的任务族,旨在系统评估从经验复用到技能形成的跃迁能力。SkillEvolBench通过对比自生成与精加工技能演化策略,分离了程序化抽象与基础能力、已有知识及片段直接复用的效果,已被视为衡量经验是否转化为持久程序性知识的重要测试平台,在语言模型代理的持续学习与技能泛化领域具有标杆意义。
当前挑战
SkillEvolBench所解决的领域挑战在于:当前语言模型代理虽能局部适应具体任务,却难以形成稳健可复用的技能。实验表明,基于技能的条件虽可改善任务获取或复现,但在冻结部署场景下增益不稳定,且原始轨迹复用往往优于提炼后的技能,揭示出现有的抽象过程丢弃了未来任务所需的上下文与程序线索。构建过程中的挑战包括:设计涵盖六个异构环境的180个任务以确保多样性与公平性;为每个潜在技能族精心编排学习任务(T1-T3)与冻结评估任务(T4-T6),后者需同时测试上下文偏移、对抗性变体及技能组合能力;还需管理外部技能库的更新机制,并在写入更多技能时避免引入片段特定漂移与过程冗余,确保技能库的泛化质量而非单纯扩容。
常用场景
经典使用场景
SkillEvolBench的核心设计在于评估大语言模型智能体能否将一次性的任务执行经验(episodic experience)转化为可复用的程序性技能(procedural skills)。在经典的基准测试场景中,研究者将智能体置于六个真实世界的任务环境中,涵盖180个精心编排的任务,这些任务被组织成具有共享潜在流程的角色条件化任务族。智能体首先经历三个学习型任务(T1-T3),从中积累轨迹并更新外部的技能库;随后面对三个冻结部署型任务(T4-T6),分别测试情境迁移、对抗变体和技能组合能力。这一设计精准地考察了从经验重用迈向技能形成的核心跃迁过程。
衍生相关工作
基于SkillEvolBench的独特设计,衍生出一系列富有启发性的后续工作方向。一方面,该基准推动了对技能表征方法的研究,促使学者探索如何设计更高效的轨迹压缩与关键信息提取算法,以弥补当前蒸馏过程丢失情境线索的缺陷。另一方面,其对比基线下原始轨迹复用优于技能蒸馏的发现,催生了混合式记忆架构(如结合检索增强生成与轻量级技能抽象)的探索工作。此外,围绕该基准建立的标准化实验范式——包括角色条件化任务族、三阶段评估框架——正逐渐成为评估持续学习中技能迁移与鲁棒性的参考标准,激发更多关于智能体长期学习动态的理论与实证研究。
数据集最近研究
最新研究方向
SkillEvolBench聚焦于大语言模型智能体从一次性任务经验中提炼可复用程序化技能的瓶颈问题,开创性地提出了经验到技能演化(Experience-to-Skill Evolution)这一评估范式。研究前沿在于,与传统仅关注任务执行性能不同,该基准通过设计角色化任务家族、上下文偏移及对抗性变体等场景,系统性检验技能抽象、泛化与组合能力。当前实验揭示,多数智能体虽能局部适应,却难以形成鲁棒的可迁移技能,原始轨迹直接复用甚至优于提炼后的技能抽象,暗示现有抽象流程丢失了关键上下文线索。这一发现正推动领域重新审视智能体长期记忆与持续学习机制的设计方向。该基准还分析了技能库规模与容量效应,指出简单增加技能条目反而引入漂移与程序性噪声,为构建更高效的智能体技能形成系统提供了关键实验依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务