LoopArena
收藏资源简介:
LoopArena是一个用于评估模型作为运行时控制器引导编码代理的基准数据集,由阿里巴巴集团梦想X团队等机构联合创建。该数据集包含90个控制决策问题(Type I)、27个任务切片(Type II)和27个完整编程任务(Type III),涵盖SCBench和BeyondSWE两大来源,通过固定工人代理与控制器循环交互生成。创建过程基于现有基准任务,通过模拟控制器决策并执行验证构建正确答案,确保评估的可靠性。该基准旨在解决现有编码基准无法区分循环指导与编码能力的问题,为长周期编码任务中的循环控制能力提供直接评估。
数据集概述
LoopArena 是一个用于评估大语言模型(LLM)在“循环工程”(Loop Engineering)场景中作为运行时控制器能力的基准测试平台。其核心目标是衡量一个模型(控制器,Controller)能否有效指导另一个固定的编码智能体(工人,Worker)完成长时间运行的任务,并在任务过程中进行进度审查、任务分配和终止决策。
核心机制
- 双角色分离:被评估模型(Controller)仅负责决策,不接触代码库;固定的编码智能体(Worker)负责实际代码修改和执行环境工具。
- 证据包与循环合约:Worker每完成一个任务,会生成只读的进度报告(Evidence Packet)交给Controller;Controller据此返回下一个任务指令、验证请求或停止指令(Loop Contract)。
- 控制变量:所有Controller使用相同的Worker和执行环境,保证评测结果可比。
基准组成
LoopArena包含三种互补的评测设置,执行范围和评估成本依次递增:
| 设置 | 评测内容 | 起点 | 规模 | 评分指标 |
|---|---|---|---|---|
| Type I · 合约选择 | 从四个已验证的候选中选择最佳下一步循环合约 | 冻结的证据包(单一控制点) | 90 | 合约准确率 |
| Type II · 浓缩编码任务 | 引导Worker完成一个完整编码任务中的选定切片 | 标准化任务切片工作区 | 27 | 严格成功率 |
| Type III · 完整编码任务 | 引导Worker完成完整编码任务 | 原始任务状态 | 27 | 严格成功率 |
其中,Type II和Type III在11个SCBench和16个BeyondSWE任务上逐一配对。Type III提供全任务锚点,Type II以较低成本保留闭环控制,Type I则通过低成本的选项式决策实现快速评估。
评测结果(v0.1.0)
- 主面板对比:评测了5个控制器模型,最强的Type III严格成功率为24.69%,显示全任务控制仍有较大提升空间。
- 成本效益:Type II相比Type III平均降低**64.4%**的推理成本,且核心模型排序与Type III高度一致(Spearman相关系数 ρ = 0.9747)。
- 模型表现:
| 控制器 | Type I 准确率 ↑ | Type II 严格成功率 ↑ | Type III 严格成功率 ↑ |
|---|---|---|---|
| GPT-5.5 | 87.78 | 51.85 | 24.69 |
| Qwen3.7-Plus | 72.22 | 48.15 | 23.46 |
| Claude Opus 4.8 | 76.67 | 48.15 | 20.99 |
| DeepSeek-V4-Flash-0731 | 77.78 | 45.68 | 19.75 |
| GLM 5.2 | 74.44 | 37.04 | 16.05 |
- 参考策略:固定控制(Fixed control)在Type II上得分为46.91%,无控制(No control)为39.51%;但两者在Type III上均为18.52%,凸显了在浓缩任务上与完整任务行为进行对照验证的重要性。
快速开始
- 安装:需要Python 3.10及以上版本,对于Type I冒烟测试,可执行
python -m pip install -e .[gateway]。 - 配置模型端点:需要OpenAI兼容的模型端点,可设置环境变量或使用仓库内的
.env文件(参考.env.example)。 - 运行Type I冒烟测试:使用
looparena-type1-run命令进行单次模型调用,无需Worker或Docker。 - 准备上游资源:Type II和III需要额外安装Git、Docker和
uv,并下载固定版本的SCBench和BeyondSWE资源。 - 运行完整任务:使用
looparena-type3-run等命令,支持--arm参数选择控制模式(controlled、no-control、fixed)。
可复现性
- 公开任务索引定义了发布的评测任务集。
- BeyondSWE运行会在任何模型调用前验证精确的Docker镜像ID。
benchmarks/upstreams.toml固定了外部源修订版本,资产准备过程不依赖网络。- 模型调用在最终评估前结束,有效评估失败会保留为模型结果,基础设施故障单独报告。
- 正式运行会记录模型配置、运行身份、token使用量、轨迹证据和评估器收据。
仓库结构
text benchmarks/ Type I, Type II, and Type III benchmark packages src/looparena/ Harness, runtimes, evaluators, and command-line tools tests/ Harness and release-package tests docs/protocol.md Public experimental protocol docs/index.html Dependency-free project website for GitHub Pages results/0.1.0/ Public canonical outcomes and aggregate result release
许可与致谢
- LoopArena的代码和文档采用 Apache-2.0 许可证。
- 第三方基准材料和冻结的源代码快照保留其原始条款,详见
THIRD_PARTY_NOTICES.md。

- 1LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering阿里巴巴集团·梦想X团队; 北京邮电大学; 新南威尔士大学; 澳大利亚联邦科学与工业研究组织·Data61 · 2026年




