aacr-bench-harbor
收藏资源简介:
AACR-Bench Harbor 是一个基于 Harbor 框架的代码审查基准数据集,它将 AACR-Bench(阿里开源代码审查基准)封装为独立的 Harbor 任务,用于评估和比较不同代码审查代理的性能。每个任务对应一个 GitHub Pull Request(固定在指定 head commit),以 `aacr-base` 为基准分支,代理需提交结构化审查结果(JSON 格式),系统通过路径、侧边、行和语义匹配四个阶段进行评分。数据集包含 57 个实际可用的任务(原计划 59 个,因两个 PR 缺失),涉及 462 个参考发现。评估指标采用微平均的精确率、召回率和 F1 分数。该数据集适用于代码审查代理的自动化评估、基准测试与模型研究。
AACR-Bench Harbor is a code review benchmark dataset based on the Harbor framework, which encapsulates AACR-Bench (Alibabas open-source code review benchmark) into independent Harbor tasks for evaluating and comparing the performance of different code review agents. Each task corresponds to a GitHub Pull Request (fixed at a specified head commit), with `aacr-base` as the base branch. Agents are required to submit structured review results (JSON format), and the system scores them through four stages: path, side, line, and semantic matching. The dataset contains 57 available tasks (originally planned 59, but two PRs are missing), involving 462 reference findings. Evaluation metrics use micro-averaged precision, recall, and F1 score. This dataset is suitable for automated evaluation, benchmarking, and model research of code review agents.
AACR-Bench Harbor 数据集详情
数据集概述
AACR-Bench Harbor 是将 AACR-Bench 打包为独立的 Harbor 任务,专供代码审查代理(code-review agents)使用的基准测试数据集。每个任务会检出一个拉取请求(Pull Request)在指定 head 提交上的版本,以 aacr-base 作为基线,并使用 AACR-Bench 的路径、侧别、行号和语义匹配阶段对结构化发现文件进行评分。该数据集并非 AACR-Bench 或 Harbor 的分支。
技术规格
- 许可证: Apache-2.0
- Python 版本要求: 3.12 或更新
- 依赖工具: uv、Git、Harbor 0.21.0、Docker(本地运行)或 Hugging Face Sandbox
任务生成
- 默认源固定于 AACR-Bench 提交
b3072489eace26efca8bcf2b1ac6a24ba64f82c1,SHA-256 为d8683cb240249bc4e0aff6428802bdffa7b7573ace600552cab1cd0cb7e905c9 - 支持通过
--task-ids生成任意已发布任务,现有任务目录不会被覆盖(除非指定--overwrite) - 任务生成过程会验证存档、提交、树、差异、干净检出及无 Git 远程仓库,且不进行仓库网络访问
- 维护者可通过
uv run aacr-source-pack verify --manifest source-packs/manifest.json验证所有已发布的包
运行方式
- Oracle 验证:
harbor run -p datasets/aacr-bench --agent oracle - GPT-5.6 Luna (Codex): 通过
agents.codex_review:CodexReview代理运行,要求环境中存在OPENAI_API_KEY - DeepSeek/Pi Reviewer: 通过 AACR 包装器运行,使用
--config path/to/job-config.json参数 - Hugging Face Sandbox: 安装
harbor[hf-sandbox]==0.21.0并配置相应环境参数,任务超时设置为 35 分钟
基准镜像信息
- 使用官方发布标签
node:24.7.0-bullseye - OCI 索引摘要:
sha256:1684133274a44010e6d6011d6eec100cf756309678c77700779ac44a5ac36715 linux/amd64清单摘要:sha256:14671502e8e7b000cd644c1ad56934bab4a82077457af6461d084fd5d0e85c05- 运行前须验证发布标签仍解析到上述摘要
评分与输出格式
- 代理需提交一个严格的 JSON 文档,格式见
docs/AACR_FINDINGS_FORMAT.md - 验证器会记录期望值、生成值、行匹配和语义匹配的原始计数及每个任务的度量指标
- 数据集级
metric.py在计算精确率、召回率和 F1 之前会汇总各任务计数,与 AACR-Bench 的微聚合方式一致 - 缺失奖励和判定错误会以失败关闭,并抑制总体聚合分数
模型研究状态
- 固定的五任务 canary 已由 Luna、Terra 和两个早期 DeepSeek/Pi 配置完成;Luna 和 Terra 完成了所有试验
- 纠正后的 DeepSeek 协议固定使用 provenance 签名的
@osolmaz/pi-reviewer0.1.4 npm 包,给予 Pi 会话 10 分钟调查和 2 分钟提交时间 - 已注册的 10 任务 Harbor HF canary 产生了 9 个有效提交,刚好满足其操作门槛
- 冻结的分割集原含 59 个密封任务,因 Keycloak PR #35645 和 Node.js PR #56185 在公开存档中缺失,最终发布 57 个任务和 462 个引用
- 批准的研究包含 684 次试验,硬性上限为 80 美元
安全与开发
- 禁止在任务文件、生成镜像、命令参数、日志或运行清单中放置凭据
- 开发检查命令包括
scripts/check.sh、uv run slophammer-py check . --execute和npx -y @simpledoc/simpledoc check - 实现计划记录于
docs/2026-08-08-harbor-native-aacr-bench-plan.md,涵盖源基线、隐藏验证器边界、模型研究协议及剩余发布工作




