EvoArena
收藏资源简介:
EvoArena是一个用于评估大型语言模型(LLM)代理在持续环境演化中保持可靠性的数据集。它模拟现实部署中的动态变化,如工作流程、代码库、依赖项和用户偏好的演变,涵盖三个互补领域:Terminal-Bench-Evo(终端工作流演化)、SWE-Chain-Evo(软件仓库状态演化)和PersonaMem-Evo(用户偏好演化)。数据集报告步进准确性和链准确性,以测试代理在演化任务序列中的适应能力。
EvoArena is a dataset designed to evaluate the reliability of large language model (LLM) agents during continuous environmental evolution. It simulates dynamic changes in real-world deployments, such as the evolution of workflows, codebases, dependencies and user preferences, covering three complementary domains: Terminal-Bench-Evo (Terminal Workflow Evolution), SWE-Chain-Evo (Software Repository State Evolution), and PersonaMem-Evo (User Preference Evolution). The dataset reports step-wise accuracy and chain accuracy to test the adaptability of agents in evolving task sequences.
EvoArena 数据集概述
EvoArena 是一个用于评估和提升大语言模型(LLM)智能体在动态环境中鲁棒性的基准测试平台,重点考察智能体在持久环境演化下的适应能力。
核心问题与目标
- 现有大多数智能体基准测试仅在静态环境快照上评估,而真实部署场景中,工作流、代码库、依赖项、验证规则和用户偏好等会随时间持续变化。
- EvoArena 旨在衡量 LLM 智能体在持续环境演化中,能否解决当前任务的同时,避免从早期版本中学习到的过时行为。
数据集组成与结构
EvoArena 将每个环境建模为一个逐步演化的版本链,覆盖三个互补领域:
| 基准测试 | 环境演化方式 | 基础智能体 | 测试目标 |
|---|---|---|---|
| Terminal-Bench-Evo | 可执行终端工作流通过接口、路径、工具链、验证和策略变化进行演化 | Terminus 2 | 智能体能否跨工作流版本调整终端策略 |
| SWE-Chain-Evo | 代码仓库状态通过按时间顺序的软件里程碑进行演化 | OpenHands | 智能体能否在不回归先前行为的情况下,解决新的代码需求 |
| PersonaMem-Evo | 用户偏好在长期交互历史中演化 | A-Mem | 记忆智能体能否追踪偏好更新、冲突和时间轨迹 |
评估指标
- 步骤准确率(Step Accuracy):衡量智能体能否解决单个演化后的任务实例。
- 链准确率(Chain Accuracy):更严格的指标,要求智能体在相关演化步骤的完整序列上全部成功。
关键方法:EvoMem
- EvoMem 是一种轻量级、类 Git 的记忆范式,专为演化环境设计。
- 它记录有意义的记忆更新作为补丁(patch),捕获变化内容、变化原因及支持更新的证据。
- 推理时,智能体可同时检索最新记忆和相关的历史补丁,以处理被覆盖、冲突或版本特定的信息。
- EvoMem 作为现有智能体的包装器,而非替代方案,已集成至 A-Mem、Terminus 2 和 OpenHands。
数据获取
- 数据集将在 Hugging Face 上发布:https://huggingface.co/datasets/Aiden0526/EvoArena
相关资源
- 论文:https://arxiv.org/pdf/2606.13681
- 项目主页:https://aiden0526.github.io/EvoArena/
- 代码仓库:https://github.com/Aiden0526/EvoArena
- 数据集集合:https://huggingface.co/collections/Aiden0526/evoarena





