遇见数据集

EvoArena

收藏
github2026-06-13 更新2026-06-14 收录
数据链接:
官方服务:

资源简介:

EvoArena是一个用于评估大型语言模型(LLM)代理在持续环境演化中保持可靠性的数据集。它模拟现实部署中的动态变化,如工作流程、代码库、依赖项和用户偏好的演变,涵盖三个互补领域:Terminal-Bench-Evo(终端工作流演化)、SWE-Chain-Evo(软件仓库状态演化)和PersonaMem-Evo(用户偏好演化)。数据集报告步进准确性和链准确性,以测试代理在演化任务序列中的适应能力。

EvoArena is a dataset designed to evaluate the reliability of large language model (LLM) agents during continuous environmental evolution. It simulates dynamic changes in real-world deployments, such as the evolution of workflows, codebases, dependencies and user preferences, covering three complementary domains: Terminal-Bench-Evo (Terminal Workflow Evolution), SWE-Chain-Evo (Software Repository State Evolution), and PersonaMem-Evo (User Preference Evolution). The dataset reports step-wise accuracy and chain accuracy to test the adaptability of agents in evolving task sequences.

创建时间:
2026-06-10
原始信息汇总

EvoArena 数据集概述

EvoArena 是一个用于评估和提升大语言模型(LLM)智能体在动态环境中鲁棒性的基准测试平台,重点考察智能体在持久环境演化下的适应能力。

核心问题与目标

  • 现有大多数智能体基准测试仅在静态环境快照上评估,而真实部署场景中,工作流、代码库、依赖项、验证规则和用户偏好等会随时间持续变化。
  • EvoArena 旨在衡量 LLM 智能体在持续环境演化中,能否解决当前任务的同时,避免从早期版本中学习到的过时行为。

数据集组成与结构

EvoArena 将每个环境建模为一个逐步演化的版本链,覆盖三个互补领域:

基准测试 环境演化方式 基础智能体 测试目标
Terminal-Bench-Evo 可执行终端工作流通过接口、路径、工具链、验证和策略变化进行演化 Terminus 2 智能体能否跨工作流版本调整终端策略
SWE-Chain-Evo 代码仓库状态通过按时间顺序的软件里程碑进行演化 OpenHands 智能体能否在不回归先前行为的情况下,解决新的代码需求
PersonaMem-Evo 用户偏好在长期交互历史中演化 A-Mem 记忆智能体能否追踪偏好更新、冲突和时间轨迹

评估指标

  • 步骤准确率(Step Accuracy):衡量智能体能否解决单个演化后的任务实例。
  • 链准确率(Chain Accuracy):更严格的指标,要求智能体在相关演化步骤的完整序列上全部成功。

关键方法:EvoMem

  • EvoMem 是一种轻量级、类 Git 的记忆范式,专为演化环境设计。
  • 它记录有意义的记忆更新作为补丁(patch),捕获变化内容、变化原因及支持更新的证据
  • 推理时,智能体可同时检索最新记忆和相关的历史补丁,以处理被覆盖、冲突或版本特定的信息。
  • EvoMem 作为现有智能体的包装器,而非替代方案,已集成至 A-Mem、Terminus 2 和 OpenHands。

数据获取

  • 数据集将在 Hugging Face 上发布:https://huggingface.co/datasets/Aiden0526/EvoArena

相关资源

  • 论文:https://arxiv.org/pdf/2606.13681
  • 项目主页:https://aiden0526.github.io/EvoArena/
  • 代码仓库:https://github.com/Aiden0526/EvoArena
  • 数据集集合:https://huggingface.co/collections/Aiden0526/evoarena
搜集汇总
数据集介绍
EvoArena 数据集图片
构建方式
在动态环境演变的背景下,现有基准多局限于评估静态环境快照中的智能体表现。EvoArena数据集将环境建模为一系列渐进演化的版本链,涵盖终端工作流演化(Terminal-Bench-Evo)、软件仓库里程碑演化(SWE-Chain-Evo)和用户偏好演化(PersonaMem-Evo)三个互补领域。每个子基准中,高层任务目标保持不变,但执行接口、代码状态或偏好规则随版本迭代发生系统变迁,从而构建出对智能体持久适应能力的测试框架。
特点
该数据集的核心创新在于同时评估步骤准确率与链式准确率,后者要求智能体在连续演化步骤上均成功完成任务,严格检验其对环境变迁的鲁棒性。数据集还配套提出了轻量级类Git记忆范式EvoMem,将记忆更新记录为带上下文快照,使智能体在推理时能回溯历史变更、处理信息冲突与版本特异性需求。三个子基准分别针对终端操作适应、代码库回归维护和长程偏好追踪,覆盖了动态环境下智能体面临的主要挑战。
使用方法
数据集通过Hugging Face平台公开发布,每个实验子文件夹均包含独立的README文档、环境配置脚本与运行命令示例。以PersonaMem-Evo为例,用户可进入对应目录执行数据准备与评估。EvoMem作为通用包装器集成至A-Mem、Terminus 2和OpenHands等现有智能体框架中,无需替换原有架构即可赋予其感知环境演化的能力,便于研究者便捷复现和扩展实验。
背景与挑战
背景概述
EvoArena是由新加坡国立大学等机构的研究人员于2026年创建的大语言模型智能体鲁棒性评估基准。该数据集针对现有基准仅评估固定环境快照的局限性,聚焦于智能体在持久环境演化中的可靠性,涵盖终端工作流演化、软件仓库演化和用户偏好演化三个互补领域。作为首个系统量化环境动态性对LLM智能体影响的数据集,EvoArena通过步准确率和链准确率双重指标,为评估智能体在真实部署中应对工作流变更、代码库演进等持续变化的能力提供了标准化测试平台。
当前挑战
EvoArena主要面临三大挑战:首先,现有基准无法评估智能体在环境持续变化下的鲁棒性,亟需构建能够建模渐进式工作流、仓库状态和用户偏好演化的评估框架;其次,数据集构建需要为每个领域设计精细的演化版本链,例如将终端任务转化为包含接口、路径、依赖关系等变化的离散工作流版本序列;此外,智能体必须解决从历史版本中习得的行为固化问题,避免在演化后的新环境中沿用已过时的策略,这对记忆更新机制的粒度与可追溯性提出了根本性要求。
常用场景
经典使用场景
EvoArena的核心设计理念在于模拟持续演化的动态环境,因此其最经典的使用场景是评测并提升大语言模型(LLM)智能体在非稳态条件下的适应能力。具体而言,研究者将环境建模为一系列渐进演化的版本链——例如终端工作流的接口与工具链变更、软件仓库的里程碑式代码迭代,以及用户偏好随交互历史的隐性漂移。智能体需在纵贯这些演变步骤的序列任务中维持稳定表现,其评估体系引入了严格的链式准确率指标,要求模型不仅解决单步演化实例,更要在完整演化链条上持续成功。这一范式精准刻画了现实部署中环境漂移的复杂性,为量化智能体的鲁棒性提供了富有挑战性的标准化实验场。
实际应用
在实际应用层面,EvoArena所覆盖的三大领域直接对应着LLM智能体落地中的典型挑战。终端操作演化场景可服务于自动化运维智能体,帮助其适应工具版本更迭与权限策略调整,避免因环境变化导致的脚本失效。软件工程演化场景则适用于持续集成中的代码补丁生成,使智能体在仓库历史里程碑基础上精准定位新增需求,同时规避对已有功能的回归破坏。个性化记忆演化场景为长期对话助手赋予偏好追踪能力,使其能够在长达数月的交互中准确识别用户偏好的更新、冲突乃至修正轨迹。这些应用场景共同指向一个更宏伟的目标:构建能够与人类环境共同进化的持久化智能体系统。
衍生相关工作
伴随EvoArena的问世,其孵化出的EvoMem记忆范式已成为衍生研究的核心载体。EvoMem借鉴Git的版本控制哲学,将智能体的记忆库重构为一系列带有因果解释的补丁序列——每个补丁记录状态变更、变更缘由及支撑证据,使得模型在面对被覆盖或冲突的信息时能够回溯历史线索。基于该范式,研究者已在三个基座智能体上展开了实证探索:在PersonaMem-Evo中,EvoMem显著提升了A-Mem对长程偏好轨迹的追踪精度;在Terminal-Bench-Evo中,它与Terminus 2协同工作,强化了终端代理在工作流版本切换时的决策稳健性;在SWE-Chain-Evo中,EvoMem辅助OpenHands实现了跨软件里程碑的精准代码演化。这些工作共同构成了首个面向动态环境的记忆演化方法论体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务