EvoCode-Bench
收藏资源简介:
EvoCode-Bench是一个用于评估编码代理在多轮迭代交互中的性能的基准数据集。它包含26个有状态编码任务和227个评估轮次,每个任务在5-15轮中保持相同的工作空间和代理会话,通过累积可执行测试检查新要求和仍有效的先前要求。数据集模拟真实编码场景,其中后续轮次继承早期的实现决策、依赖关系、文件布局、API选择和测试行为,采用故障停止评分机制。
EvoCode-Bench is a benchmark dataset for evaluating the performance of coding agents in multi-turn iterative interactions. It consists of 26 stateful coding tasks and 227 evaluation turns. For each task, the same workspace and agent session are maintained across 5 to 15 rounds, and both newly proposed requirements and previously valid ones are verified via cumulative executable tests. The dataset simulates real-world coding scenarios, where subsequent turns inherit early implementation decisions, dependencies, file layouts, API selections, and test behaviors, and adopts a fail-stop scoring mechanism.
EvoCode-Bench 数据集概述
核心定位
EvoCode-Bench 是一个评估编码智能体在多轮迭代交互中保持项目功能正确性的基准测试。它包含 26 个有状态的编码任务和 227 个评估轮次。每个任务在相同的工作区和智能体会话中持续进行 5-15 轮,累积的可执行测试会同时检查新需求和之前仍然活跃的需求。
任务分类
基准测试按两个维度组织任务,表格中每个单元格报告 任务数 / 轮次数:
| 工程活动 | 探索型 | 契约型 | 文档驱动型 | 总计 |
|---|---|---|---|---|
| 构建 | 9 / 80 | 3 / 37 | 1 / 7 | 13 / 124 |
| 规格演化 | 1 / 8 | 1 / 7 | 1 / 7 | 3 / 22 |
| 审查 | 3 / 21 | 1 / 7 | 1 / 9 | 5 / 37 |
| 迁移 | 3 / 29 | 1 / 7 | 1 / 8 | 5 / 44 |
| 总计 | 16 / 138 | 6 / 58 | 4 / 31 | 26 / 227 |
任务格式
每个任务包含以下结构:
task.toml:元数据、轮次数、变更类型instruction.md:顶层任务说明environment/:共享的 Docker 环境(Dockerfile)round_N/:每个轮次包含:instruction.md:该轮的用户请求solution/solve.sh:该轮的参考变更tests/test.sh:截止到该轮的累积测试
三个核心约束:
- 持久化工作区:同一 Docker 容器承载跨轮的文件、依赖和生成产物
- 连续智能体会话:智能体接收连续的用户请求序列,而非独立提示
- 累积测试:第 i 轮验证所有从第 1 轮到第 i 轮仍然活跃的需求,回归错误会被立即捕获
评估框架
- 使用专用的 Harbor 多轮评估框架(基于 Harbor 的多轮分支)
- 支持轮次边界编排、持久化 Docker 工作区状态、连续智能体会话状态、累积验证器切换、参考快进、快照/恢复链路、失败停止奖励聚合
评估指标
- MT@4:任务所有轮次中,智能体在最多 4 次尝试中每轮最佳得分的平均值
- SR:单轮通过率,在参考快进先前轮次后评估
- Comp:至少一次尝试中完成所有轮次的任务比例
主要结果(论文数据)
| 智能体 | MT@4 | SR | Comp |
|---|---|---|---|
| Claude-Opus-4.7 | 54.0 | 76.7 | 42.3 |
| GPT-5.5 | 52.4 | 74.4 | 38.5 |
| Claude-Opus-4.6 | 44.0 | 78.9 | 34.6 |
结果显示,大多数智能体的 SR 超过 MT@4 22-40 个百分点,表明孤立解决单轮问题比在跨轮中保持智能体自身工作区正确要容易得多。
与其他项目的关系
EvoCode-Bench 是 Terminal-X 基准测试套件中专注于“迭代”的组件,与 DeepTerminalBench(单轮深度)和 RoadmapBench(版本升级)共同构成完整的基准测试集合。
数据获取
数据集已发布在 Hugging Face 平台,地址为:https://huggingface.co/datasets/UnipatAI/EvoCodeBench
引用
bibtex @misc{shen2026evocodebench, title = {EvoCode-Bench: Evaluating Coding Agents in Multi-Turn Iterative Interactions}, author = {Haiyang Shen and Xuanzhong Chen and Wendong Xu and Yun Ma and Liang Chen and Kuan Li}, year = {2026}, eprint = {2605.24110}, archivePrefix = {arXiv}, primaryClass = {cs.SE}, url = {https://arxiv.org/abs/2605.24110} }
许可证
- 仓库代码采用 MIT 许可证
- 数据集条款遵循数据集发布元数据




