遇见数据集

aacr-bench-harbor

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

AACR-Bench Harbor 是一个基于 Harbor 框架的代码审查基准数据集,它将 AACR-Bench(阿里开源代码审查基准)封装为独立的 Harbor 任务,用于评估和比较不同代码审查代理的性能。每个任务对应一个 GitHub Pull Request(固定在指定 head commit),以 `aacr-base` 为基准分支,代理需提交结构化审查结果(JSON 格式),系统通过路径、侧边、行和语义匹配四个阶段进行评分。数据集包含 57 个实际可用的任务(原计划 59 个,因两个 PR 缺失),涉及 462 个参考发现。评估指标采用微平均的精确率、召回率和 F1 分数。该数据集适用于代码审查代理的自动化评估、基准测试与模型研究。

AACR-Bench Harbor is a code review benchmark dataset based on the Harbor framework, which encapsulates AACR-Bench (Alibabas open-source code review benchmark) into independent Harbor tasks for evaluating and comparing the performance of different code review agents. Each task corresponds to a GitHub Pull Request (fixed at a specified head commit), with `aacr-base` as the base branch. Agents are required to submit structured review results (JSON format), and the system scores them through four stages: path, side, line, and semantic matching. The dataset contains 57 available tasks (originally planned 59, but two PRs are missing), involving 462 reference findings. Evaluation metrics use micro-averaged precision, recall, and F1 score. This dataset is suitable for automated evaluation, benchmarking, and model research of code review agents.

创建时间:
2026-08-09
原始信息汇总

AACR-Bench Harbor 数据集详情

数据集概述

AACR-Bench Harbor 是将 AACR-Bench 打包为独立的 Harbor 任务,专供代码审查代理(code-review agents)使用的基准测试数据集。每个任务会检出一个拉取请求(Pull Request)在指定 head 提交上的版本,以 aacr-base 作为基线,并使用 AACR-Bench 的路径、侧别、行号和语义匹配阶段对结构化发现文件进行评分。该数据集并非 AACR-Bench 或 Harbor 的分支。

技术规格

  • 许可证: Apache-2.0
  • Python 版本要求: 3.12 或更新
  • 依赖工具: uv、Git、Harbor 0.21.0、Docker(本地运行)或 Hugging Face Sandbox

任务生成

  • 默认源固定于 AACR-Bench 提交 b3072489eace26efca8bcf2b1ac6a24ba64f82c1,SHA-256 为 d8683cb240249bc4e0aff6428802bdffa7b7573ace600552cab1cd0cb7e905c9
  • 支持通过 --task-ids 生成任意已发布任务,现有任务目录不会被覆盖(除非指定 --overwrite
  • 任务生成过程会验证存档、提交、树、差异、干净检出及无 Git 远程仓库,且不进行仓库网络访问
  • 维护者可通过 uv run aacr-source-pack verify --manifest source-packs/manifest.json 验证所有已发布的包

运行方式

  • Oracle 验证: harbor run -p datasets/aacr-bench --agent oracle
  • GPT-5.6 Luna (Codex): 通过 agents.codex_review:CodexReview 代理运行,要求环境中存在 OPENAI_API_KEY
  • DeepSeek/Pi Reviewer: 通过 AACR 包装器运行,使用 --config path/to/job-config.json 参数
  • Hugging Face Sandbox: 安装 harbor[hf-sandbox]==0.21.0 并配置相应环境参数,任务超时设置为 35 分钟

基准镜像信息

  • 使用官方发布标签 node:24.7.0-bullseye
  • OCI 索引摘要: sha256:1684133274a44010e6d6011d6eec100cf756309678c77700779ac44a5ac36715
  • linux/amd64 清单摘要: sha256:14671502e8e7b000cd644c1ad56934bab4a82077457af6461d084fd5d0e85c05
  • 运行前须验证发布标签仍解析到上述摘要

评分与输出格式

  • 代理需提交一个严格的 JSON 文档,格式见 docs/AACR_FINDINGS_FORMAT.md
  • 验证器会记录期望值、生成值、行匹配和语义匹配的原始计数及每个任务的度量指标
  • 数据集级 metric.py 在计算精确率、召回率和 F1 之前会汇总各任务计数,与 AACR-Bench 的微聚合方式一致
  • 缺失奖励和判定错误会以失败关闭,并抑制总体聚合分数

模型研究状态

  • 固定的五任务 canary 已由 Luna、Terra 和两个早期 DeepSeek/Pi 配置完成;Luna 和 Terra 完成了所有试验
  • 纠正后的 DeepSeek 协议固定使用 provenance 签名的 @osolmaz/pi-reviewer 0.1.4 npm 包,给予 Pi 会话 10 分钟调查和 2 分钟提交时间
  • 已注册的 10 任务 Harbor HF canary 产生了 9 个有效提交,刚好满足其操作门槛
  • 冻结的分割集原含 59 个密封任务,因 Keycloak PR #35645 和 Node.js PR #56185 在公开存档中缺失,最终发布 57 个任务和 462 个引用
  • 批准的研究包含 684 次试验,硬性上限为 80 美元

安全与开发

  • 禁止在任务文件、生成镜像、命令参数、日志或运行清单中放置凭据
  • 开发检查命令包括 scripts/check.shuv run slophammer-py check . --executenpx -y @simpledoc/simpledoc check
  • 实现计划记录于 docs/2026-08-08-harbor-native-aacr-bench-plan.md,涵盖源基线、隐藏验证器边界、模型研究协议及剩余发布工作
搜集汇总
数据集介绍
aacr-bench-harbor 数据集图片
构建方式
AACR-Bench Harbor 数据集精心封装了 AACR-Bench 基准,将其转化为独立的 Harbor 任务,专为代码审查智能体设计。每一任务均锁定单一拉取请求的固定头部提交,并以 aacr-base 作为基准,通过路径、侧别、行号及语义匹配的多阶段流程,对结构化发现文件进行严谨评分。该数据集以 Hugging Face 仓库作为唯一权威来源,内含构建任务所需的不可变源码包,无需克隆上游仓库即可复现。其生成过程严格校验归档完整性、提交哈希、树结构及差异内容,确保无网络访问的纯净构建环境。
特点
该数据集的特点在于其精密的可重复性和严格的审计追踪。每个任务均被密封并固定于特定提交,源码包附有 SHA-256 校验和,确保不可篡改。任务验证涉及洁净检出、无 Git 远程等细节,保证了环境的纯净性。此外,它提供了多种运行模式,包括官方 Harbor 的 oracle 验证、通过 Codex 原生审查框架的集成,以及针对 Hugging Face Sandbox 的适配,展现了极高的灵活性和兼容性。数据集还包含了完整的模型研究状态记录,如 canary 测试结果和任务发布计划,体现了其对科学严谨性的执着。
使用方法
使用者需遵循规定的安装与运行流程。首先克隆 Hugging Face 仓库,并通过 uv 同步依赖。生成任务时,使用 aacr-bench 命令指定任务 ID,并以源包清单为依据,确保任务生成的准确性。运行阶段,可以通过 harbor run 配合 oracle 智能体进行验证,或者集成自定义的 Codex 审查智能体,设置正确的环境变量和 PYTHONPATH。对于 Hugging Face Sandbox 环境,需安装特定扩展并配置运行参数。结果通过严格的 JSON 格式提交,并由验证器生成微聚合的精确度、召回率和 F1 分数,确保评估的标准化和可比性。
背景与挑战
背景概述
AACR-Bench Harbor 数据集由阿里巴巴团队于2025年发布,旨在将 AACR-Bench 评测基准封装为独立的 Harbor 任务,用于代码审查智能体的系统化评估。该数据集基于 Harbor 框架,针对每个拉取请求在固定提交点上进行任务构建,并通过路径、侧、行和语义匹配阶段对结构化发现进行评分。其核心研究问题在于如何准确衡量代码审查智能体在真实世界场景中的性能,从而推动自动化代码审查技术的发展。作为连接基础评测与实际应用的桥梁,该数据集为代码审查领域提供了标准化的评估手段,对提升智能体可靠性和可复现性具有重要影响。
当前挑战
数据集面临的挑战涵盖两个层面。在领域问题层面,代码审查智能体需要应对复杂多变的代码变更,准确识别缺陷并给出精确定位,这要求模型具备跨文件、跨语言的上下文理解能力,同时要避免误报和漏报。在构建过程中,数据集的生成面临多重技术挑战:确保任务的可复现性需严格校验归档、提交、树和差异,且禁止网络访问;模型运行环境需兼容 Docker 与 Hugging Face Sandbox,并处理大文件分块上传与状态轮询的稳定性;此外,源代码的完整性维护(如已删除提交的恢复)和评估指标的公平性(如微聚合与失败关闭机制)也极具挑战性,这些因素共同决定了数据集的最终质量与可信度。
常用场景
经典使用场景
AACR-Bench Harbor 数据集作为代码评审智能体领域的权威基准,其经典使用场景聚焦于对代码评审系统进行标准化、可复现的效能评估。研究者和开发者可将该数据集中的每个任务视为一次独立的拉取请求评审挑战,通过 Harbor 框架驱动不同代码评审代理(如 GPT-5.6 Luna、DeepSeek 等)在固定提交基线上执行评审流程,并依据结构化的评审结果文件,利用 AACR-Bench 提供的路径、侧别、行号及语义匹配四阶段评估机制,精准量化代理的评审精度、召回率与 F1 值。该场景为横向对比不同模型或提示策略的代码缺陷识别能力提供了严谨的试验场,推动了代码评审自动化技术的可度量演进。
衍生相关工作
该数据集催生了诸多围绕代码评审智能体评估与优化的衍生工作。其一,基于其任务框架,研究者开发了多种新型评审代理架构,如融合静态分析与大语言模型语义理解的混合评审系统,其性能可通过该基准进行严格验证。其二,该数据集的结构化评审结果格式(AACR Findings Format)被后续工作广泛采纳,作为标准化输出规范,促进了不同评审工具间的互操作性与结果对比。其三,其严谨的任务生成与验证流程(包括源码包哈希校验、无网络构建等)启发了其他软件工程基准的构建实践,推动了可复现性理念在软件工程研究中的普及。此外,围绕该数据集的模型研究(如针对 DeepSeek 的评审流程校正)也引发了关于代码评审代理时间预算与失败恢复机制等鲁棒性问题的深入探讨。
数据集最近研究
最新研究方向
在代码审查智能体评测领域,AACR-Bench Harbor正引领着一场关于可复现性与安全性的范式革新。该数据集通过将AACR-Bench解构为独立的Harbor任务,实现了对拉取请求审查流程的精细化封装,其基于路径、侧别、行号及语义的多阶段匹配机制,为评估大型语言模型的代码审查能力提供了严谨的量化标尺。当前研究前沿聚焦于模型在受限推理资源下的性能边界探索,例如针对GPT-5.6 Luna及DeepSeek等模型的执行协议优化,特别是通过修正运行超时策略与引入npm包版本固定来保障评测的公平性。更为关键的是,其借助软件遗产档案馆对缺失Git提交的精确复原,以及在Harbor沙箱环境中实现的大文件分块上传与传输容错机制,深刻回应了大规模基准测试中数据完整性与分布式执行的挑战。这一工作不仅提升了代码审查智能体的评测信效度,也为构建高度可信、可审计的AI基准基础设施树立了新的标杆,对推动软件工程智能化的理论探索与工业落地均具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务