agentbattler-bench
收藏资源简介:
AgentBattler Bench是一个公开、可复现的实验,用于比较编码代理工具。第一阶段通过一个具体任务验证了证据循环:独立的JavaScript国际象棋代理必须从标准输入读取一个FEN(Forsyth-Edwards Notation)并精确输出一个合法的UCI(Universal Chess Interface)移动。该数据集包含原始生成跟踪和比赛结果,存储于Hugging Face平台,并通过GitHub Release进行镜像。
AgentBattler Bench is an open, reproducible experiment for comparing coding agent tools. In its first phase, it validates the evidence loop through a concrete task: independent JavaScript chess agents must read a FEN (Forsyth-Edwards Notation) string from standard input and accurately output a legal UCI (Universal Chess Interface) move. This dataset contains raw generation traces and match results, hosted on the Hugging Face platform and mirrored via GitHub Releases.
数据集概述
数据集名称:AgentBattler Bench
核心用途:一个公开、可复现的实验基准,用于比较编码智能体(coding-agent)框架的性能。第一阶段专注于一个狭窄任务:自包含的 JavaScript 国际象棋智能体必须从标准输入读取一个 FEN 字符串,并输出一个合法的 UCI 走法。
数据来源与存储:
- 原始生成轨迹和锦标赛结果不存储在 Git 历史中。
- 当前固定指针位于
snapshots/latest.json,指向公开的 Hugging Face Dataset 的不可变提交,并在标签范围的 GitHub Release 中镜像相同的证据树。 - 通过
npm run replay:snapshot下载 Release 归档,验证其大小和 SHA-256,并回放所有已发布的锦标赛。
数据集内容与结构:
- 默认运行者名册:一个人类参考和两个明确标记、手工制作的非参考夹具。
- 公开生成套件:使用独立的清单文件,位于以下目录:
agents/model-suite/agents/pi-model-suite/agents/harness-suite/
子套件详情:
-
Codex 模型套件:
- 使用 Codex CLI 0.144.0 和高推理设置,对 Terra、Sol、Luna 三个模型使用固定提示进行生成。
- 生成环境为隔离的临时工作空间,禁用用户配置、规则、应用、钩子、子智能体、MCP 服务器、网络搜索等。
- 采用平衡的循环赛安排,共 72 场比赛(3 个模型配对 × 6 个版本化局面 × 2 个种子 × 2 种颜色分配)。
- 输出包括生成源代码、JSONL 轨迹、stderr、生成元数据、可回放比赛等。
-
Pi 模型套件:
- 使用与 Codex 套件相同的模型 ID、挑战提示、高推理设置,但采用 Pi 0.80.7 框架(基于 Docker 镜像运行)。
- 运行环境为只读容器,丢弃所有 Linux 能力,无新权限,限制 CPU/内存/进程,只有空工作空间和可丢弃的 Pi 主目录是可写挂载点。
- 生成前需通过
codex login登录。 - 输出包括 Pi 生成源代码、净化的 Pi JSON 事件、原生会话 JSONL、stderr、容器身份信息等。
-
框架套件:
- 在 Codex 和 Pi 模型套件各自生成 5 代智能体后,构建所有对所有的框架比较。
- 共有 225 个智能体工件对(15 × 15),进行 2,700 场颜色平衡的比赛(基于 6 个 v2 局面)。
- 其中 900 场模型相同的比赛用于计算受控框架分数,以保持模型身份不变。
本地运行与验证:
- 唯一先决条件:Node.js 20 或更新版本。无运行时或开发依赖需要下载。
- 常用命令:
npm installnpm testnpm run validatenpm run benchmark:将标准的本地生成结果写入results/latest/。npm run replay -- results/latest/result.json:回放记录的结果并验证评分,不会静默运行新基准测试。
- 各套件也有对应的生成、验证、基准测试和回放命令。
证据与可信性:
- 受信任的基准测试运行仅限于推送到
main分支及手动workflow_dispatch触发。 - 工作流会验证清单和套件、运行测试和基准测试、回放结果、生成 SHA-256 校验和,并上传源代码、清单、局面、日志和完整结果。
- 目前没有公开的工作流运行或稳定的规范结果 URL 被宣称可用。GitHub Actions 工件是带有保留期限的便捷证据副本,非持久发布层。
- 详细证据和回放步骤分别记载在 docs/evidence.md 和 docs/replay.md 中。




