遇见数据集

LoopArena

收藏
arXiv2026-08-28 更新2026-09-01 收录
数据链接:
官方服务:

资源简介:

LoopArena是一个用于评估模型作为运行时控制器引导编码代理的基准数据集,由阿里巴巴集团梦想X团队等机构联合创建。该数据集包含90个控制决策问题(Type I)、27个任务切片(Type II)和27个完整编程任务(Type III),涵盖SCBench和BeyondSWE两大来源,通过固定工人代理与控制器循环交互生成。创建过程基于现有基准任务,通过模拟控制器决策并执行验证构建正确答案,确保评估的可靠性。该基准旨在解决现有编码基准无法区分循环指导与编码能力的问题,为长周期编码任务中的循环控制能力提供直接评估。

创建时间:
2026-08-28
原始信息汇总

数据集概述

LoopArena 是一个用于评估大语言模型(LLM)在“循环工程”(Loop Engineering)场景中作为运行时控制器能力的基准测试平台。其核心目标是衡量一个模型(控制器,Controller)能否有效指导另一个固定的编码智能体(工人,Worker)完成长时间运行的任务,并在任务过程中进行进度审查、任务分配和终止决策。

核心机制

  • 双角色分离:被评估模型(Controller)仅负责决策,不接触代码库;固定的编码智能体(Worker)负责实际代码修改和执行环境工具。
  • 证据包与循环合约:Worker每完成一个任务,会生成只读的进度报告(Evidence Packet)交给Controller;Controller据此返回下一个任务指令、验证请求或停止指令(Loop Contract)。
  • 控制变量:所有Controller使用相同的Worker和执行环境,保证评测结果可比。

基准组成

LoopArena包含三种互补的评测设置,执行范围和评估成本依次递增:

设置 评测内容 起点 规模 评分指标
Type I · 合约选择 从四个已验证的候选中选择最佳下一步循环合约 冻结的证据包(单一控制点) 90 合约准确率
Type II · 浓缩编码任务 引导Worker完成一个完整编码任务中的选定切片 标准化任务切片工作区 27 严格成功率
Type III · 完整编码任务 引导Worker完成完整编码任务 原始任务状态 27 严格成功率

其中,Type II和Type III在11个SCBench16个BeyondSWE任务上逐一配对。Type III提供全任务锚点,Type II以较低成本保留闭环控制,Type I则通过低成本的选项式决策实现快速评估。

评测结果(v0.1.0)

  • 主面板对比:评测了5个控制器模型,最强的Type III严格成功率为24.69%,显示全任务控制仍有较大提升空间。
  • 成本效益:Type II相比Type III平均降低**64.4%**的推理成本,且核心模型排序与Type III高度一致(Spearman相关系数 ρ = 0.9747)。
  • 模型表现
控制器 Type I 准确率 ↑ Type II 严格成功率 ↑ Type III 严格成功率 ↑
GPT-5.5 87.78 51.85 24.69
Qwen3.7-Plus 72.22 48.15 23.46
Claude Opus 4.8 76.67 48.15 20.99
DeepSeek-V4-Flash-0731 77.78 45.68 19.75
GLM 5.2 74.44 37.04 16.05
  • 参考策略:固定控制(Fixed control)在Type II上得分为46.91%,无控制(No control)为39.51%;但两者在Type III上均为18.52%,凸显了在浓缩任务上与完整任务行为进行对照验证的重要性。

快速开始

  1. 安装:需要Python 3.10及以上版本,对于Type I冒烟测试,可执行 python -m pip install -e .[gateway]
  2. 配置模型端点:需要OpenAI兼容的模型端点,可设置环境变量或使用仓库内的 .env 文件(参考 .env.example)。
  3. 运行Type I冒烟测试:使用 looparena-type1-run 命令进行单次模型调用,无需Worker或Docker。
  4. 准备上游资源:Type II和III需要额外安装Git、Docker和 uv,并下载固定版本的SCBench和BeyondSWE资源。
  5. 运行完整任务:使用 looparena-type3-run 等命令,支持 --arm 参数选择控制模式(controlled、no-control、fixed)。

可复现性

  • 公开任务索引定义了发布的评测任务集。
  • BeyondSWE运行会在任何模型调用前验证精确的Docker镜像ID。
  • benchmarks/upstreams.toml 固定了外部源修订版本,资产准备过程不依赖网络。
  • 模型调用在最终评估前结束,有效评估失败会保留为模型结果,基础设施故障单独报告。
  • 正式运行会记录模型配置、运行身份、token使用量、轨迹证据和评估器收据。

仓库结构

text benchmarks/ Type I, Type II, and Type III benchmark packages src/looparena/ Harness, runtimes, evaluators, and command-line tools tests/ Harness and release-package tests docs/protocol.md Public experimental protocol docs/index.html Dependency-free project website for GitHub Pages results/0.1.0/ Public canonical outcomes and aggregate result release

许可与致谢

  • LoopArena的代码和文档采用 Apache-2.0 许可证。
  • 第三方基准材料和冻结的源代码快照保留其原始条款,详见 THIRD_PARTY_NOTICES.md
搜集汇总
数据集介绍
LoopArena 数据集图片
构建方式
LoopArena基准的构建依托于SlopCodeBench与BeyondSWE两大源码基准,精选27项长时程仓储级编码任务作为核心素材,并据此衍生出三个互补的评测层级。Type I通过预设可恢复的控制点,在基准构建阶段对候选循环契约进行双重执行回放,以确定唯一正确答案,从而在评测新模型时无需实际执行Worker。Type II则从完整任务中截取具备独立验证条件的连贯切片,构建从中间工作区出发的评估实例。Type III保留任务的原始状态,实现对完整编码流程的端到端评估。基准构建辅以自动化校验、LLM辅助及专家审核,确保任务、工作区、评估器及输入信息的严谨性与无泄漏。
特点
LoopArena的核心特色在于其独特的模型作为运行时控制器(Controller)的评估范式,将编码Worker固定,精准度量Controller在长时程任务中的循环引导能力。基准通过结构化证据包与循环契约实现控制信息的规范传递,并设置三种执行范围与成本各异的评测设置,兼顾决策级别的精准诊断与全任务级别的综合评估。实验表明,全任务下的最优严格成功率仅为24.69%,凸显了长时程循环控制的挑战性;Type II在平均降低64.4%推理成本的同时,保持了与Type III高度一致的模型排序(Spearman's ρ = 0.9747),展现了其作为高效替代评测方案的潜力。
使用方法
使用者可依据研究目标灵活选用LoopArena的三个评测层级。Type I适用于快速、低成本的单步控制决策诊断,模型仅需在给定证据包下于四个候选契约中做出选择,即可获得契约准确率指标。Type II面向任务切片的运行时循环控制评估,在显著节省计算资源的同时,可复现全任务级别的模型排序,适合作为模型筛选或迭代优化的评测工具。Type III则提供最全面的全任务评估,以严格成功率为核心指标,辅以推理成本、Worker轮次等资源消耗度量,适用于对最终性能的权威评测。基准提供了完整的评测代码与数据,支持复现与扩展。
背景与挑战
背景概述
LoopArena,由阿里巴巴集团DreamX团队联合多所高校于2026年8月发布,是针对循环工程(Loop Engineering)领域的一项开创性基准。循环工程作为组织编码代理开发工作的新兴实践,强调通过设计循环来监控进度、分配任务、运行检查并决定代理的后续行动。然而,现有基准多聚焦于完整编码代理系统的最终成果,难以分离循环引导与编码代理自身能力的影响。LoopArena创新性地将评估对象聚焦于控制器(Controller)模型,在固定工作代理(Worker)与执行环境的前提下,衡量模型指导独立编码代理完成长时程任务的能力。其通过三类互补设置(Type I、II、III)分别评估单一控制决策、任务片段及完整任务上的循环控制能力。该基准的发布为循环工程的可量化评估提供了新范式,其最高严格成功率仅24.69%,揭示了长时程循环控制仍存在巨大提升空间,对智能体编排与代码生成领域具有重要的推动意义。
当前挑战
LoopArena所面临的挑战涵盖领域问题与构建过程两方面。领域层面,核心难题在于如何精准评估模型对独立编码代理的引导能力,而非传统基准所测的整体编码系统性能;同时,长时程任务中循环控制易受陈旧进度信息误导、跳过必要验证或过早终止,导致成功率低下,且结果难以归因于控制器或执行者。构建过程则面临多重困难:需设计冻结的循环控制协议以隔离变量,通过执行验证确定Type I问题答案并保持稳定性;Type II任务片段的选取需满足起始状态失败且完成状态全通过的条件;此外,还需控制数据泄漏风险、确保评估器的区分度,并在成本与可靠性间取得平衡。实验显示最高严格成功率仅为24.69%,凸显了长时程循环控制中自适应引导的必要性与挑战性。
常用场景
经典使用场景
LoopArena作为一项开创性的基准测试,其核心应用场景在于评估大语言模型在循环工程(Loop Engineering)范式下作为运行时控制器(Controller)的决策能力。该基准通过构建一个双智能体框架,将被测模型置于控制器角色,使其在接收结构化证据包(Evidence Packet)后,为固定的编码工作智能体(Worker)下达下一步循环合约(Loop Contract)。其经典使用方式涵盖三个层次:类型一聚焦于单一控制决策的选择,通过执行验证的四选一问题,无需运行工作智能体即可评估控制器的判断力;类型二则在选定的任务片段上执行重复控制,以较低成本测试控制器的持续引导能力;类型三则从任务初始状态出发,对完整的长期编码任务进行端到端评估,衡量控制器在复杂、多阶段开发过程中的全局驾驭水平。这一多粒度评测体系,为深入剖析模型在动态、长时序软件开发流程中的管理与决策智慧提供了标准化、可复现的验证平台。
衍生相关工作
LoopArena的提出,如同在静谧的学术湖面投下一颗石子,激起了层层涟漪,催生了一系列富有成效的衍生研究工作。它明确了“模型即管理者”的评测新范式,直接启发了后续研究聚焦于控制器模型的专门优化,例如探索更有效的证据摘要机制、更智能的循环合约生成策略,以及开发针对控制器能力的强化学习训练方法。其类型一(合约选择)的评估形式,为构建大规模、低成本的控制决策基准提供了模板,引发了关于过程监督、决策级奖励模型(Process Reward Models)在智能体控制领域的进一步探讨。同时,其类型二与类型三成本与排序一致性的验证方法论,为设计更高效的多级评测体系(如基准压缩、低成本代理评测)树立了典范,推动了整个智能体评估领域向着更经济、更科学的方向发展。LoopArena不仅是评测工具,更是一个重要的研究催化剂,它促使学术界与工业界深入思考并积极构建更智能、更可靠的自动化软件工程未来。
数据集最近研究
最新研究方向
在Loop Engineering与智能体编排的前沿探索中,LoopArena开创性地将评估焦点从端到端编码智能体转向其运行时的环路控制能力,确立了模型作为独立控制器引导异构工作代理完成长时任务的基准范式。该数据集通过三层递进的评估架构——低成本的决策选择、任务切片验证及全任务端到端执行——对控制策略进行多粒度剖析,尤其关注控制模型在动态演化证据下的适应性引导与终止判断。其最新研究动向聚焦于揭示全任务控制中固有性能瓶颈(最佳严格成功率仅为24.69%),并证实动态自适应指导优于静态目标重复,同时验证了采用Spearman相关性(ρ=0.9747)的降本评估协议能有效复现完整任务下的控制器排序,为高效且可信的智能体编排评测确立了新的方法论标杆,推动了运行时环路控制从定性讨论走向可量化、可比较的科学度量。
相关研究论文
  • 1
    LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering阿里巴巴集团·梦想X团队; 北京邮电大学; 新南威尔士大学; 澳大利亚联邦科学与工业研究组织·Data61 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务