遇见数据集

AI-to-AI Code Review Dataset

收藏
arXiv2026-08-22 更新2026-08-25 收录
官方服务:

资源简介:

该数据集由蒙特利尔高等技术学院与特伦特大学联合构建,专门用于研究AI闭环代码审查现象。它整合了来自CodAGE的GitHub事件,通过签名框架精准识别AI撰写的拉取请求(PR)及其对应的AI审查事件,最终形成包含248,641个独特AI属性PR的审查对。其中,跨产品审查对占45,269个,同产品审查对占208,145个,另有4,773个PR同时被两种方式审查。数据集创建过程历经候选事件筛选、双重签名验证、清洗去重和隔离过滤,确保高置信度。该数据集旨在揭示AI代理间代码审查的规模与增长趋势,并分析不同作者-审查者组合下的审查行为差异,为理解自动化软件工程中的AI交互提供实证基础。

This dataset was jointly developed by the École de technologie supérieure of Montreal and Trent University, specifically designed for research on the phenomenon of AI-powered closed-loop code review. It integrates GitHub events sourced from CodAGE, utilizes a signature framework to accurately identify AI-generated pull requests (PRs) and their corresponding AI review events, and ultimately forms review pairs containing 248,641 unique AI-attributed PRs. Among these, 45,269 are cross-product review pairs, 208,145 are within-product review pairs, and an additional 4,773 PRs were reviewed using both methods. The dataset creation process underwent candidate event screening, dual signature verification, data cleaning and deduplication, as well as isolation filtering to ensure high confidence in the dataset. This dataset aims to uncover the scale and growth trends of code review between AI Agents, analyze variations in review behavior across different author-reviewer pairings, and provide an empirical basis for understanding AI interactions in automated software engineering.

创建时间:
2026-08-22
原始信息汇总

数据集概述

该数据集是论文《AI-to-AI Code Reviews of GitHub Pull Requests》的复制包,发表于 ESEM 2026(LIPIcs Vol. 394, Article 74),由 Niruthiha Selvanayagam(ÉTS Montréal)和 Taher A. Ghaleb(Trent University)撰写。

核心内容

数据集中包含闭环 AI 到 AI 代码审查数据,即由 AI 代理编写且由 AI 代理审查的 GitHub Pull Request(PR)。每个 PR 通过签名识别其作者代理和审查代理。数据源为 GitHub Archive(GHArchive),时间范围为 2024-01-01 至 2026-04-15。数据集中包含的两类主要数据文件:

文件 论文名称 行数(对) 唯一PR数
cohorts/axb_cross.parquet A×B-跨产品 47,259 45,269
cohorts/axb_self.parquet A×B-同产品 208,144 208,144

数据集的关键列为 (repo_name, pr_number),包含作者代理、审查代理、时间戳、签名强度、审查数量、事件时间等信息。PR 若同时被同产品和跨产品代理审查,会出现在两个文件中(4,773 个 PR 同时存在于两者)。

关联数据集 CodAGE

论文的原始语料库为 CodAGE(Coding Agent-generated GitHub Events),托管在 Hugging Face 上(https://huggingface.co/datasets/taher-ghaleb/CodAGE)。CodAGE 包含:

  • CodAGE-PRs:2,830,431 行,每个 PR 的作者代理信息
  • CodAGE-Reviews:4,141,107 行,代理审查决定
  • CodAGE-ReviewComments:8,560,237 行,代理审查评论
  • coderabbit_severity.parquet:3,549,430 行,CodeRabbit 评论类别标签

注意: 审查评论数据仅包含元数据,不含评论正文。

研究方法

代理归因方法采用两级签名:

  • S1(高置信度正文签名):代理在 PR 中生成的机器可读标记,如 Co-Authored-By: Claudecursor.com/agentschatgpt.com/codex
  • S2(厂商控制账户签名):如 coderabbitai[bot]devin-ai-integration[bot]gemini-code-assist[bot]

产品归因层级为产品级(而非公司或基础模型级),例如 Google 旗下的 Jules 和 Gemini Code Assist 被视为不同产品。

覆盖的代理包括:CodeRabbit、Copilot、Gemini Code Assist、OpenAI Codex、Amazon Q、Devin、Claude Code、Sweep AI、PR-Agent、Kiro、Cursor、Aider(审查侧);Google Jules(作者侧额外覆盖)。

关键统计数字

指标 数值
唯一AI代理编写PR数 2,830,284
获得至少一次AI审查的PR数 248,640
A×B跨产品PR数 45,269
A×B跨产品作者-审查者对 47,259
A×B同产品PR数 208,144

文档中特别指出,数据集构建与论文存在一处差异(248,640 vs 248,641 个 PR),原因已定位为排序稳定性问题,当前版本已通过稳定排序保证确定性。

使用与复现

  • 快速开始:安装依赖后直接运行 scripts/plot_rq1_quarterly.pyscripts/make_tables.py 即可复现论文图表,无需额外下载
  • 可选重建数据:从 CodAGE 下载原始数据,使用 scripts/build_cohorts.py 可重建所有队列
  • 输出文件figures/rq1_quarterly.pdffigures/rq2_severity_mix.pdf(图1和图2),results/tables.txt(论文表格逐字输出)

数据构建流程

作者侧(pr_filtered = 谁写了PR)和审查者侧(reviews_filtered + review_comments_filtered = 谁审查了PR)独立从 GHArchive 挖掘,通过 (repo_name, pr_number) 内连接形成闭环群体,再根据 same_vendor 布尔列(即作者代理是否等于审查代理)区分为同产品或跨产品。

许可与引用

  • 代码:MIT 许可
  • 数据cohorts/ 和 CodAGE):CC BY 4.0
  • 引用方式:论文引用见 README 中提供的 BibTeX 条目(ESEM 2026)

联系信息

  • Niruthiha Selvanayagam:niruthiha.selvanayagam.1@ens.etsmtl.ca
  • Taher A. Ghaleb:taherghaleb@trentu.ca
搜集汇总
数据集介绍
AI-to-AI Code Review Dataset 数据集图片
构建方式
该数据集的构建依托于CodAGE这一公开的编码智能体生成GitHub事件数据集,通过链接AI撰写的拉取请求与AI归因的审查事件,构建了AI至AI代码审查数据集。研究采用两层签名框架进行归属判定,S1层基于正文签名(如Co-Authored-By: Claude或特定URL),S2层基于供应商控制的账户签名(如coderabbitai[bot]),以此将事件归因至具体的AI产品。数据涵盖2024年1月至2026年4月期间的事件,经过清洗、去重和隔离(如剔除仅分支名匹配的候选后,保留具有正文或登录签名的PR),最终生成三个子集:跨产品A×B(45,269个PR)、同产品A×B(208,145个PR)以及无AI审查的A×N(2,581,643个PR),并以(repo_name, pr_number)为主键聚合审查评论、时间戳等信息。
特点
该数据集规模宏大,覆盖248,641个至少收到一次AI审查的PR,其中跨产品审查占1.6%,但绝对数量可观(约4.5万),且增长迅猛,2025年第一季度至第三季度增长超过两个数量级。数据集具备细粒度的产品级归属,区分同产品与跨产品的审查配置,并采用确定性规则提取CodeRabbit评论类别(如潜在问题、重构建议、吹毛求疵等),无需LLM判断。此外,数据集还包含审查评论数量、首次审查延迟等行为指标,为分析AI审查行为提供了丰富维度。其独特的双面AI(作者与审查者均为AI)特性,为研究闭环AI审查现象提供了前所未有的实证基础。
使用方法
研究人员可利用该数据集,首先通过复制包(https://github.com/Niruthiha/AI-AI-CodeReviews)获取处理脚本和分类器,结合CodAGE原始数据,复现论文中的统计结果。其次,可以按作者-审查者配对进行多维分析,如比较不同AI产品作为作者时CodeRabbit评论类别的分布差异,或对比同产品与跨产品审查的评论数量及首次审查延迟。此外,该数据集的分类器和签名注册表可被复用至其他GitHub事件流,以扩展或更新分析。值得注意的是,使用时应考虑到数据集的局限性,如归属签名可能缺失或过时,以及评论类别为自声明标签,需谨慎解读,避免将观察性关联误认为因果效应。
背景与挑战
背景概述
随着AI编码代理在软件开发中的广泛应用,GitHub上的拉取请求(PR)流程呈现出新的形态:一端由AI代理(如Devin, OpenAI Codex, Copilot等)生成代码,另一端由AI代理(如CodeRabbit, Copilot等)进行审查,形成了一种闭环的AI-to-AI代码审查现象。为探究这一新兴研究领域,École de technologie supérieure的Niruthiha Selvanayagam与Trent大学的Taher A. Ghaleb于2026年构建了AI-to-AI Code Review数据集。该数据集依托CodAGE中的GitHub事件数据,通过双重签名机制精准识别AI所属产品,最终涵盖248,641个至少获得一次AI审查的AI生成PR,其中45,269个为跨产品审查,208,145个为同产品审查。研究揭示了闭环审查现象的快速扩散趋势,并分析了不同作者-审查者组合下审查行为的差异,为后续实证软件工程研究提供了宝贵资源。
当前挑战
该数据集所面临的挑战首先体现在领域问题上:随着AI生成代码规模的扩大,传统的GitHub审查机制面临适应性变革,如何准确识别AI生成PR并追溯审查来源成为难题。构建过程中,研究者需应对多方面的挑战:一,AI代理的签名识别困难,部分代理使用通用[bot]账户或引用他人文本,导致归属不精确;二,代理的自述标签(如CodeRabbit的评论分类)缺乏独立验证,难以衡量审查质量;三,数据的时效性与完整性受限,GHArchive事件滞后及代理快速迭代导致覆盖不全;四,跨产品与同产品审查的区分在语义上具有模糊性,需精细设计去重和隔离策略。此外,审查行为受PR规模、语言和仓库上下文等混杂因素影响,使得因果推断面临挑战。
常用场景
经典使用场景
在软件工程实证研究的广阔疆域中,AI-to-AI Code Review Dataset 提供了一个前所未有的观测窗口,其经典使用场景聚焦于大规模量化分析 GitHub 上由 AI 智能体撰写并被另一 AI 智能体审查的拉取请求(PR)现象。研究者可依托该数据集,对跨产品与同产品的 AI 作者-审查者配对进行系统性剖析,例如衡量闭环 AI 审查的普及率、增长趋势及其在总智能体活动中的占比。通过整合 CodAGE 事件流,该数据集支持细粒度的时序分析,使学界得以追踪从 2025 年第一季度到第三季度两个数量级的激增轨迹,并描绘出不同 AI 产品间错综复杂的审查网络拓扑,为理解新兴的‘AI 审查 AI’生态奠定了坚实的数据基石。
衍生相关工作
此数据集的问世,如同在实证软件工程领域投下一枚引路石,催生了一系列极具前瞻性的衍生研究。其一是构建用于预测 AI 生成 PR 合并结果的模型,探究作者智能体身份、审查者干预与仓库上下文的交互作用。其二是开发针对 AI 审查评论质量与幻觉现象的自动化检测框架,例如判别评论是否忠实于代码本体的溯源分析。其三则是围绕‘模型级’与‘产品级’效应分离的对照实验设计,通过函数保持的代码变换与源信息遮蔽,严谨评估同源模型审查是否存在系统性偏好。这些工作共同推动着 AI 代码审查从描述性观察迈向因果推断与质量保障的深水区。
数据集最近研究
最新研究方向
在软件开发流程中,AI编码代理的兴起催生了全新的闭环审查生态,即一个AI代理编写代码,另一个AI代理进行审查。该数据集聚焦于这一前沿现象,通过关联CodAGE数据集中的AI署名拉取请求与审查事件,构建了包含248,641个至少接受一次AI审查的唯一AI署名PR的大规模资源,其中跨产品审查45,269例,同产品审查208,145例。研究揭示了2025年间闭环审查活动指数级增长,并深入分析审查者行为差异,发现不同作者-审查者组合下评论类别分布、评论数量及首审时延呈现显著差异,如CodeRabbit对Claude Code PR的重构评论占比远高于Copilot。此数据集为理解AI驱动软件协作的动态演变提供了关键实证基础,对研究AI代理交互模式、审查质量及软件开发流程自动化具有重要意义。
相关研究论文
  • 1
    AI-to-AI Code Reviews of GitHub Pull Requests蒙特利尔高等技术学院; 特伦特大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务