遇见数据集

EvoAgentBench

收藏
arXiv2026-07-06 更新2026-07-08 收录
官方服务:

资源简介:

EvoAgentBench是由安徽大学、盛趣集团EverMind及东南大学联合构建的智能体自进化基准数据集,专注于评估跨任务的能力迁移性能。该数据集涵盖网络研究、算法推理、软件工程和知识工作四大领域,包含总计795条任务实例,通过多骨干模型轨迹提取出基于痕迹的“能力”单元,并构建了领域特定的能力图以支撑过程级转移分析。其创建过程融合了多模型执行轨迹收集、能力卡片抽取与规范化以及图结构划分,确保了训练集对测试集的能力支持。该数据集旨在解决现有评估方法在隔离轨迹到过程转移方面的不足,为智能体经验编码、路由与吸收的细粒度诊断提供标准化测试平台,推动自进化智能体在长视野任务中的可靠性提升。

EvoAgentBench is a benchmark dataset for agent self-evolution jointly developed by Anhui University, Shengqu Group EverMind, and Southeast University, focusing on evaluating cross-task capability transfer performance. This dataset encompasses four core domains: network research, algorithmic reasoning, software engineering, and knowledge work, with a total of 795 task instances. It extracts trace-based "capability" units from the execution trajectories of multiple backbone models, and constructs domain-specific capability graphs to enable process-level transfer analysis. The construction of this dataset integrates three key stages: multi-model execution trajectory collection, capability card extraction and standardization, and graph structure partitioning, ensuring that the training set provides sufficient capability support for the test set. This dataset aims to address the limitations of existing evaluation methods that isolate trajectory-level data from process transfer analysis, and provides a standardized test platform for fine-grained diagnosis of agent experience encoding, routing and absorption, thereby promoting the improvement of the reliability of self-evolutionary agents in long-horizon tasks.

创建时间:
2026-07-06
原始信息汇总

EvoAgentBench 数据集概述

EvoAgentBench 是一个用于评估AI智能体自我进化能力的基准测试,旨在衡量智能体通过从过往经验中学习来提升自身表现的能力。该数据集提供了跨五个不同任务领域的标准化训练/测试划分,支持对技能提取和经验复用方法进行可重复比较。

数据集信息

  • 许可协议: Apache 2.0
  • 任务类型: 文本生成、问答
  • 语言: 英语
  • 标签: agent, self-evolution, benchmark, evaluation
  • 数据规模: 少于1000个样本

数据集结构

数据集包含五个领域,总计 917个训练任务288个测试任务

领域 基础数据集 训练样本数 测试样本数 任务格式
信息检索 BrowseCompPlus 154 65 通过网络搜索进行多约束实体识别
推理与问题分解 OmniMath 478 100 竞赛级数学推理
软件工程 SWE-Bench 101 26 真实GitHub问题修复
代码实现 LiveCodeBench 97 39 竞赛编程问题
知识工作 GDPVal 87 58 基于文档的问答

数据集目录结构如下:

EvoAgentBench/ ├── Information Retrieval/ │ └── task_split.json ├── Reasoning & Problem Decomposition/ │ ├── selected_data/ # OmniMath问题(训练集) │ └── test_set_100/ # OmniMath问题(测试集) ├── Software Engineering/ │ └── task_split.json ├── Code Implementation/ │ └── task_split.json └── Knowledge Work/ ├── clusters.json ├── meta_prompts/ └── reference_files/

其中 task_split.json 包含训练/测试任务ID列表,这些ID引用自原始基准数据集。对于OmniMath和知识工作(GDPVal),数据集中直接包含了实际的任务数据。

评估协议

EvoAgentBench采用三阶段自我进化协议:

  1. 训练阶段: 在训练任务上运行智能体,收集交互轨迹(会话)
  2. 提取阶段: 应用自我进化方法,从训练轨迹中提取可复用的知识(技能、案例、记忆)
  3. 评估阶段: 在测试任务上运行智能体,注入提取的知识,与无知识的基线进行比较

训练/测试划分的设计原则:

  • 训练任务与测试任务无重叠
  • 测试任务需要与训练任务相似的能力,但属于不同的问题
  • 测试任务上的性能提升证明了真正的泛化能力,而非记忆

使用方式

使用EvoAgentBench框架

bash git clone https://github.com/EverMind-AI/EverOS.git cd EverOS/benchmarks/EvoAgentBench

下载任务划分

方式1: git clone

git clone https://huggingface.co/datasets/EverMind-AI/EvoAgentBench data/

方式2: huggingface_hub

python -c " from huggingface_hub import snapshot_download snapshot_download(EverMind-AI/EvoAgentBench, repo_type=dataset, local_dir=data/) "

运行基线测试(示例:OmniMath与openclaw智能体)

python src/run.py --split test --parallel 8 --job omnimath-baseline

直接加载任务划分

python import json from huggingface_hub import hf_hub_download

下载特定任务划分

path = hf_hub_download( "EverMind-AI/EvoAgentBench", "Information Retrieval/task_split.json", repo_type="dataset" ) splits = json.loads(open(path).read()) train_ids = splits["train"] # 154个任务ID test_ids = splits["test"] # 65个任务ID

引用与许可

该数据集采用 Apache 2.0 许可协议。论文即将发布。

搜集汇总
数据集介绍
EvoAgentBench 数据集图片
构建方式
EvoAgentBench的构建始于跨领域多骨干网络的无技能轨迹收集。研究团队从网络研究、算法推理、软件工程和知识工作四个长时域智能体领域选取了BrowseComp-Plus、LiveCodeBench、SWE-Bench Verified和GDPVal四个源基准,共计2605个任务。随后,利用Kimi-K2.5、GLM-5.1和DeepSeek-V3.2三个构建骨干网络,在OpenClaw和Nanobot两种支架上收集无技能执行轨迹。基于这些轨迹,抽取器从任务查询、真实目标和多骨干轨迹池中提取出7326个原始能力卡片,每个卡片包含触发条件、可复用程序、支持证据、边界和角色属性。通过嵌入阻断、三法官LLM裁决和领域专家审查的保守规范化流程,这些原始卡片被合并为170个规范能力单元。最终,构建了域特异性能力图,其中节点为任务,边表示共享可复用的能力,并通过社区检测和约束采样生成训练/测试拆分(528/267个任务),确保每个测试任务都得到训练侧能力的明确支持。
使用方法
使用EvoAgentBench时,研究人员需在两支架(OpenClaw和Nanobot)和三骨干(Qwen3.5-27B、Qwen3.5-397B、Gemma-4-31B)配置下运行实验。自演化方法仅从训练集Dtrain构建演化状态,允许读取任务提示和验证器结果,并自行生成训练轨迹,但不能接触测试答案或测试轨迹。评估时,方法通过其自身接口将演化状态应用于测试任务,测量相对于无演化基线的平均迁移增益。数据集提供三种自动自演化方法(Memento、ReasoningBank、GEPA)和诊断参考锚点技能作为对照。每个领域使用原生评估指标:网络研究使用LLM作为裁判进行二元判定,算法推理使用隐藏测试用例的pass@1,软件工程使用仓库测试套件的resolved率,知识工作使用基于参考的LLM评分。结果需报告准确率和成本变化(代理轮次百分比变化),并进行每领域每支架每骨干的细粒度分析,以诊断经验编码、路由和吸收中的具体瓶颈。
背景与挑战
背景概述
EvoAgentBench 由 Xingze Gao 等人于 2026 年提出,研究机构涵盖安徽大学、盛大集团 EverMind 及东南大学,核心聚焦于智能体自我进化领域中程序性知识跨任务迁移能力的评估。现有基准多聚焦单次任务解决或信息记忆,未能隔离轨迹到程序性知识的迁移,EvoAgentBench 通过构建基于迹的能力图,将训练与测试任务按共享的可重用操作(如搜索策略、调试流程、验证工作流)关联,确保测试任务获得已验证的训练侧能力支撑。该基准涵盖网页研究、算法推理、软件工程与知识工作四个长程智能体领域,提供 528/267 训练测试拆分,其诊断性锚点技能在所有设置中均取得正向增益,揭示了当前自动方法在编码、路由与采纳环节的瓶颈,推动了智能体自我进化评估从聚合精度比较向细粒度诊断的转变。
当前挑战
EvoAgentBench 面临的核心挑战在于解耦智能体自我进化中的经验编码、路由与采纳过程。领域层面,现有基准无法有效衡量跨任务程序性迁移,其评估多混淆工件质量、任务顺序、检索策略与框架动态,导致无法定位改进瓶颈(如能力缺失、提取缺陷或检索失效)。构建过程中,为确保测试任务具备训练侧能力支持且实例不重复,需从多骨干执行迹中提取可重用的归一化能力单元,并经由嵌入阻塞、LLM 裁决与专家审查完成能力规范化,维持操作等价性而非语义聚类。此外,能力图的构建需平衡任务间重叠密度(如网页研究领域图密度达 0.404)与孤立任务的处理(如软件工程领域 6 个孤立任务),并通过受约束的社区划分实现零无支持测试任务,对自动方法的鲁棒性提出高要求。
常用场景
经典使用场景
EvoAgentBench 专为评估智能体在长程任务中的自我进化能力而设计,其核心使用场景在于衡量智能体能否将过往执行轨迹中的过程性知识转化为可复用的技能、工作流或演化提示,并在未见过的相关任务中实现正向迁移。该基准涵盖网络研究、算法推理、软件工程与知识工作四大领域,通过构建能力图谱确保每项测试任务均具备已验证的训练侧能力支持。研究者可借助此基准系统比较不同自我进化方法在经验编码、路由与吸收环节的效能差异。
解决学术问题
EvoAgentBench 解决了当前智能体评估体系中的关键盲区:既有基准要么聚焦单回合任务求解,要么局限于信息记忆而非过程性知识复用。该基准通过迹导能力提取与跨任务能力图谱构建,首次实现了对轨迹到程序迁移的控制实验。它区分了训练侧能力缺失、提取缺陷与检索失效等不同瓶颈来源,为方法开发提供了精细化的诊断工具。这一框架将自我进化评估从粗粒度的准确率比较推进到细粒度的能力迁移分析,为揭示智能体经验学习的内在机理奠定了方法论基础。
实际应用
在实际应用层面,EvoAgentBench 为构建具备持续学习能力的工业级智能体系统提供了验证平台。在上述四大领域内,该基准可用于测试智能体能否通过积累搜索调试策略、算法设计模式、代码修复流程与文档构建规范来提升执行效率与正确性。特别地,它揭示了当前自动方法在不同基座模型与开发框架下表现脆弱的现状,提示工程实践中需谨慎选择进化策略并根据具体领域进行适配。基准提供的诊断信息还可指导开发者定向优化经验提取与路由机制。
数据集最近研究
最新研究方向
当前智能体自我进化评估的前沿方向正从宏观的准确性比较转向细粒度的过程诊断,重点关注经验编码、路由与吸收的瓶颈分析。EvoAgentBench通过构建基于能力的跨任务迁移图,在网页研究、算法推理、软件工程与知识工作四个长程代理领域内实现了有保障的能力支持与实例不相交的评估范式。研究揭示,尽管监督式能力引导的技能在所有实验设置中均能带来稳定的正向迁移增益,但现有自动自我进化方法在提取和路由可复用程序知识时仍表现出显著的脆弱性,尤其在跨支架、跨骨干模型的条件下普遍存在负迁移现象。这一发现推动了从单纯提升任务解决率向系统诊断自我进化机制缺陷的范式转变,为构建更鲁棒的智能体持续学习框架提供了关键的实验基准与方法指引。
相关研究论文
  • 1
    EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer安徽大学; 盛趣集团·EverMind; 东南大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务