遇见数据集

agentbattler-bench

收藏
github2026-07-16 更新2026-07-17 收录
官方服务:

资源简介:

AgentBattler Bench是一个公开、可复现的实验,用于比较编码代理工具。第一阶段通过一个具体任务验证了证据循环:独立的JavaScript国际象棋代理必须从标准输入读取一个FEN(Forsyth-Edwards Notation)并精确输出一个合法的UCI(Universal Chess Interface)移动。该数据集包含原始生成跟踪和比赛结果,存储于Hugging Face平台,并通过GitHub Release进行镜像。

AgentBattler Bench is an open, reproducible experiment for comparing coding agent tools. In its first phase, it validates the evidence loop through a concrete task: independent JavaScript chess agents must read a FEN (Forsyth-Edwards Notation) string from standard input and accurately output a legal UCI (Universal Chess Interface) move. This dataset contains raw generation traces and match results, hosted on the Hugging Face platform and mirrored via GitHub Releases.

创建时间:
2026-07-15
原始信息汇总

数据集概述

数据集名称:AgentBattler Bench

核心用途:一个公开、可复现的实验基准,用于比较编码智能体(coding-agent)框架的性能。第一阶段专注于一个狭窄任务:自包含的 JavaScript 国际象棋智能体必须从标准输入读取一个 FEN 字符串,并输出一个合法的 UCI 走法。

数据来源与存储

  • 原始生成轨迹和锦标赛结果不存储在 Git 历史中。
  • 当前固定指针位于 snapshots/latest.json,指向公开的 Hugging Face Dataset 的不可变提交,并在标签范围的 GitHub Release 中镜像相同的证据树。
  • 通过 npm run replay:snapshot 下载 Release 归档,验证其大小和 SHA-256,并回放所有已发布的锦标赛。

数据集内容与结构

  • 默认运行者名册:一个人类参考和两个明确标记、手工制作的非参考夹具。
  • 公开生成套件:使用独立的清单文件,位于以下目录:
    • agents/model-suite/
    • agents/pi-model-suite/
    • agents/harness-suite/

子套件详情

  1. Codex 模型套件

    • 使用 Codex CLI 0.144.0 和高推理设置,对 Terra、Sol、Luna 三个模型使用固定提示进行生成。
    • 生成环境为隔离的临时工作空间,禁用用户配置、规则、应用、钩子、子智能体、MCP 服务器、网络搜索等。
    • 采用平衡的循环赛安排,共 72 场比赛(3 个模型配对 × 6 个版本化局面 × 2 个种子 × 2 种颜色分配)。
    • 输出包括生成源代码、JSONL 轨迹、stderr、生成元数据、可回放比赛等。
  2. Pi 模型套件

    • 使用与 Codex 套件相同的模型 ID、挑战提示、高推理设置,但采用 Pi 0.80.7 框架(基于 Docker 镜像运行)。
    • 运行环境为只读容器,丢弃所有 Linux 能力,无新权限,限制 CPU/内存/进程,只有空工作空间和可丢弃的 Pi 主目录是可写挂载点。
    • 生成前需通过 codex login 登录。
    • 输出包括 Pi 生成源代码、净化的 Pi JSON 事件、原生会话 JSONL、stderr、容器身份信息等。
  3. 框架套件

    • 在 Codex 和 Pi 模型套件各自生成 5 代智能体后,构建所有对所有的框架比较。
    • 共有 225 个智能体工件对(15 × 15),进行 2,700 场颜色平衡的比赛(基于 6 个 v2 局面)。
    • 其中 900 场模型相同的比赛用于计算受控框架分数,以保持模型身份不变。

本地运行与验证

  • 唯一先决条件:Node.js 20 或更新版本。无运行时或开发依赖需要下载。
  • 常用命令
    • npm install
    • npm test
    • npm run validate
    • npm run benchmark:将标准的本地生成结果写入 results/latest/
    • npm run replay -- results/latest/result.json:回放记录的结果并验证评分,不会静默运行新基准测试。
  • 各套件也有对应的生成、验证、基准测试和回放命令。

证据与可信性

  • 受信任的基准测试运行仅限于推送到 main 分支及手动 workflow_dispatch 触发。
  • 工作流会验证清单和套件、运行测试和基准测试、回放结果、生成 SHA-256 校验和,并上传源代码、清单、局面、日志和完整结果。
  • 目前没有公开的工作流运行或稳定的规范结果 URL 被宣称可用。GitHub Actions 工件是带有保留期限的便捷证据副本,非持久发布层。
  • 详细证据和回放步骤分别记载在 docs/evidence.mddocs/replay.md 中。
搜集汇总
数据集介绍
agentbattler-bench 数据集图片
构建方式
AgentBattler Bench是一个公开且可复现的编码智能体(coding-agent)能力比较基准。其构建方式围绕一个精炼的验证性任务展开:自包含的JavaScript国际象棋智能体需从标准输入读取一个FEN棋谱字符串,并输出唯一合法的UCI走法。基准包含一组精心设计的小型固定参赛者名单,包括一个人工参考基线以及两个明确标注的非参考基线。研究团队还构建了多组生成式参赛套件,分别使用Codex CLI和Pi(第二代harness)在受控环境中生成人工智能模型(Terra、Sol、Luna)的代码产物。Codex CLI套件在隔离的工作区中运行,禁用所有用户配置、插件及网络搜索等功能;Pi套件则运行于基于Docker的只读容器内,容器被剥离了所有Linux权限并限制资源使用。所有生成过程均保留原始JSONL追踪记录,以便审计每次交互的轮次、耗时、令牌消耗及工具调用情况。
特点
该数据集的核心特点在于其精心设计的可复现性与证据闭环机制。所有原始生成痕迹与锦标赛结果均不存储在Git历史中,而是通过不可变的Hugging Face数据集快照以及标签限定的GitHub Release进行锚定,确保了数据版本的不可篡改性与可验证性。评估采用平衡的循环赛制,完整的一场Codex套件锦标赛包括72局对弈,覆盖三种模型配对、六个版本化棋局、两种随机种子以及先后手分配。进一步的跨harness对比(Pi vs. Codex)则扩展至2,700局颜色平衡对弈,并通过受控harness评分过滤出900局同模型对局,以消除模型身份差异对评估结果的干扰。数据集还通过SHA-256校验和、容器身份标识以及主机状态不变量等技术手段,构建了分层的信任与审计体系。
使用方法
本数据集的使用门槛极低,仅需Node.js 20或更高版本,无需额外依赖。用户可通过一系列npm命令完成完整的数据复现与验证流程:运行`npm run benchmark`执行本地基准测试并生成标准结果;使用`npm run replay`回放已有结果文件,验证基于记录输入输出重新计算得到的评分是否一致;借助`npm run generate:model-suite`等命令生成或验证特定模型套件。对于模型套件的生成,用户需先通过`codex login`完成身份认证,随后执行生成、验证、基准测试及回放等对应命令。所有生成产物(包括源代码、JSONL追踪记录、对局记录及汇总元数据)均按严格目录规范分离存放,便于研究者进行细粒度的审计与深入分析。
背景与挑战
背景概述
AgentBattler Bench 是一个专为评估编码代理框架(coding-agent harnesses)而设计的可复现基准测试数据集,由技术爱好者社区于2024年创建。该数据集聚焦于一个精巧的任务:自包含的JavaScript国际象棋代理需从标准输入读取FEN棋盘状态,并输出一个合法的UCI走法。通过构建一个受控的实验环境,研究者能够系统性地比较不同代理框架(如Codex CLI与Pi)在代码生成、合法性校验以及回合制博弈中的表现。该基准采用平衡循环赛制,涵盖多模型配对、版本化起始局面和颜色分配,其公开证据链通过Hugging Face数据集与GitHub Release进行封存,为编码代理领域的可重复性研究树立了新标杆。
当前挑战
数据集面临的核心挑战在于确保编码代理评估的公正性与可复现性。首先,领域问题层面,如何设计一个任务既能检验代理的代码生成能力,又不会因任务复杂性引入额外噪声,是首要难题——这里通过固定FEN到UCI的映射简化了评估维度。其次,构建过程中的挑战包括:1)隔离不同框架的环境差异,如Codex CLI与Pi在认证机制、容器安全策略及工具调用权限上的不一致性,需通过容器化、只读挂载与最小权限原则来统一;2)避免隐式配置干扰,如禁用用户规则、插件、MCP服务器和持久会话,确保每次生成均从纯净状态开始;3)管理庞大的实验规模,如Pi与Codex的交叉对比需运行2700盘对局,对存储与验证提出了高效校验算法(SHA-256)和证据树结构的要求。
常用场景
经典使用场景
在智能体竞技评估领域,AgentBattler Bench提供了一种可复现的实验范式,专用于对比不同代码生成智能体(coding-agent)的编排能力。其经典使用场景是通过限定任务——即让国际象棋智能体从标准输入读取一个FEN棋盘状态,并输出唯一合法的UCI走法——来构建一个闭环的证据链。研究人员可利用该基准,在受控环境中执行跨模型、跨框架的锦标赛式评估,涵盖从单一模型套件到混合编排套件的多层次对决,从而精准衡量智能体在严格任务约束下的表现。
衍生相关工作
基于AgentBattler Bench的评估框架,衍生了若干重要工作:一是跨模型套件的对比研究,通过比较不同基础模型(如Terra、Sol、Luna)在相同任务下的生成质量,揭示了模型规模与推理能力之间的非线性关系;二是编排框架消融实验,通过对比Pi与Codex CLI两种不同的智能体编排方式,量化了容器隔离、工具可用性等人为设计因素对最终输出的影响;三是多智能体协同策略探索,利用该基准构建了多方竞技环境,为研究智能体间的博弈与协作提供了可重复的实验平台。
数据集最近研究
最新研究方向
AgentBattler Bench聚焦于编码智能体(coding-agent)框架的可复现性比较,通过自包含的JavaScript国际象棋对弈任务,构建了一个端到端的证据循环。当前前沿方向集中在两大层面:一是多模型套件(如Codex CLI与Pi框架)在相同固定提示下的生成质量、隔离性和运行可审计性对比;二是跨框架全比较(cross-harness-all),通过2,700场色彩平衡的棋局,系统评估智体自身身份被控制后,不同底层引擎对最终表现的独立影响。该基准不仅为LLM驱动代码生成领域提供了可重复的沙盒化实验范式,更推动了关于智能体代理、环境隔离与结果指纹认证等信任机制的关键讨论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务