遇见数据集

The State of AI-Generated Code, 2026

收藏
github2026-07-15 更新2026-07-16 收录
官方服务:

资源简介:

这是一个关于AI生成代码状态的数据集,发布于2026年7月,包含对424个公共项目的扫描结果,总计21,632,176行代码,并发现了346,944个问题。数据集重点关注安全发现、问题密度和不同AI代码生成器的质量比较,数据以CC-BY-4.0许可证开放。

This is a dataset focused on the status of AI-generated code, released in July 2026. It includes scanning results of 424 public projects, totaling 21,632,176 lines of code, and 346,944 issues have been detected. The dataset centers on three key areas: security-related findings, issue density, and quality comparisons across different AI code generators. The data is openly available under the CC-BY-4.0 license.

创建时间:
2026-07-14
原始信息汇总

数据集概述

数据集名称:The State of AI-Generated Code, 2026

发布方与时间:由 Quality Clouds Hub 于 2026 年 7 月发布,采用 CC-BY-4.0 许可证。

数据集核心发现

  • 扫描范围:扫描了 424 个公开项目,总计 21,632,176 行代码。这些项目来源于 Lovable、Bolt、v0 以及带有 AI 辅助编程标签的 GitHub 仓库。
  • 问题总量:共发现 346,944 个问题,平均每 1,000 行代码有 16.0 个问题。
  • 安全状况
    • 87% 的项目至少存在一个安全发现(仅 56 个项目在安全方面是干净的)。
    • 安全发现占总发现数的 6%(共 21,361 个)。
    • 14% 的项目存在泄露的密钥或硬编码凭证。
    • 98% 使用了 Supabase 的项目存在安全发现,比例远高于其他项目(77%),且安全问题的密度高出 2.4 倍。
  • 最常见问题:最普遍的高严重性问题为“异步操作缺少错误处理”(出现在 79% 的项目中),该问题占所有高严重性发现的 68%。

AI 代码生成器质量排名(按问题密度,越低越好)

排名 生成器 仓库数量 问题密度 (每千行) 安全密度 (每千行) 存在安全发现的项目占比 项目问题中位数
1 AI-tagged GitHub (Copilot辅助) 89 9.1 0.33 65% 82
2 Bolt 42 11.4 0.54 67% 143
3 v0 110 16.6 1.11 92% 94
4 Lovable 183 18.1 1.18 99% 644

关键结论

  • 梯队分化:Copilot 和 Bolt 属于“清洁梯队”,其问题密度约为 v0 和 Lovable(“脏数据梯队”)的一半,安全密度则约为三分之一到一半。
  • 排名稳定性:Copilot 和 Bolt 优于 v0 和 Lovable 的结论是稳健的。但 v0 和 Lovable 的具体排位存在波动,Lovable 在多个指标上表现更差,但此结论支持度较弱。
  • 重要区别:“AI-tagged GitHub”项目是有人类参与的 Copilot 辅助项目,而非完全由 AI 生成,可作为对照基准。这揭示了一个现象:代码库中由模型自主完成的部分越多,问题密度通常也越高。

按前端框架的问题密度

框架 仓库数量 问题密度 (每千行)
其他/非Web (混合语言) 34 9.5
Node, 无框架 44 10.5
Next.js 126 13.9
React + Vite 215 17.1
Remix 2 18.3
Vue 2 19.2
React (CRA) 1 26.0
  • React + Vite 是大多数“提示即应用”工具的默认输出,其问题密度在语料库中最高,比非 Web 类别高出 80%。

问题按影响领域分布

影响领域 问题数量 受影响的仓库数
可扩展性 (Scalability) 150,212 386
可维护性 (Maintainability) 65,152 382
性能 (Performance) 57,821 380
可管理性 (Manageability) 52,236 389
安全性 (Security) 21,361 368
架构 (Architecture) 162 29
  • 可扩展性问题数量最高,其中 97% 由两个规则触发。

最常发现的 10 个问题

规则 领域 严重程度 问题数量 涉及仓库百分比
异步操作缺少错误处理 可扩展性 138,601 79%
useEffect 中的同步 setState 性能 40,220 74%
嵌套的三元表达式 可维护性 34,535 78%
使用 console.log 而非结构化日志 可管理性 31,441 74%
使用双重否定进行隐式布尔强制转换 可维护性 23,881 73%
Array.forEach() 包含异步回调 可扩展性 17,998 80%
网络请求无超时设置 性能 12,576 71%
空的 catch 代码块吞没错误 可管理性 9,761 67%
通配符依赖版本 安全性 6,038 52%
未经验证 URL 就将动态值绑定到 href 安全性 3,511 63%
  • 这 10 条规则占据所有发现的 88%

数据下载与复现

  • 数据文件
    • data/vibe-code-2026.csv: 每个仓库的匿名化指标(每行一个项目)
    • data/vibe-code-2026.json: 与 CSV 内容相同的 JSON 格式
    • data/aggregate-stats.csv: 主要的聚合统计数据
  • 复现方法:可使用提供的 Python 代码片段加载 CSV 文件并生成生成器排名。
搜集汇总
数据集介绍
The State of AI-Generated Code, 2026 数据集图片
构建方式
该数据集由Quality Clouds Hub发布于2026年7月,旨在系统评估AI生成代码的质量与安全性。研究团队从公开的GitHub仓库中采样了424个项目,这些项目均带有明确的AI代码生成平台标记,如Lovable、Bolt、v0以及Copilot辅助标签,并按照大小、时效性进行筛选,且每个所有者最多选取2个仓库。项目总计包含21,632,176行代码,并使用同一套包含295条确定性规则的引擎(Semgrep与正则表达式)进行扫描,最终产出346,944个问题,以问题密度(每千行代码的问题数)作为核心比较指标,而非原始计数,从而避免大型项目因规模受到不公正的惩罚。
特点
该数据集最显著的特征在于揭示了AI生成代码中普遍存在的安全隐患与质量缺陷。扫描结果显示,87%的项目存在至少一个安全问题,每62行代码便潜藏一个问题,14%的项目甚至泄露了密钥或硬编码凭据。值得注意的是,不同生成平台的表现差异悬殊:Copilot辅助和Bolt生成的项目问题密度仅为v0和Lovable的一半左右,安全漏洞密度更是低至三分之一至一半。此外,数据集还揭示了Supabase后端带来的特有风险,98%的Supabase项目存在安全问题,其密度是非Supabase项目的2.4倍,凸显了底层技术栈对代码质量的重要影响。
使用方法
数据集以CSV和JSON两种格式提供,每条记录对应一个匿名化的项目及其各项指标,便于研究者进行统计分析与对比验证。使用者可通过短短五行Python代码,利用pandas库轻松复现生成平台的排名结果,示例代码已在文档中提供。此外,数据集遵循CC-BY-4.0许可协议,允许在注明出处的前提下自由重用,而扫描管道代码则采用MIT许可。用户亦可通过Quality Clouds Hub的门户网站导入自己的仓库,使用与本研究完全相同的规则集进行实时扫描,快速获得代码问题的详尽报告。
背景与挑战
背景概述
随着大语言模型与代码生成工具的深度融合,AI辅助编程已从实验性探索迈向规模化部署。然而,AI生成代码的质量与安全性尚未得到系统性的实证评估。基于此背景,Quality Clouds Hub于2026年7月发布了『The State of AI-Generated Code, 2026』数据集。该数据集由研究团队精心构建,通过对424个公开代码仓库、逾2100万行代码的深度扫描,系统审视了Lovable、Bolt、v0及Copilot等主流AI代码生成器产出的代码质量。核心研究问题聚焦于AI生成代码中的安全缺陷密度、常见错误模式及不同工具间的质量差异。该数据集以346,944个检测发现问题为基石,揭示了87%的项目至少存在一处安全隐患、14%的项目泄露了硬编码凭据等惊人发现,为AI代码生成领域的安全性研究提供了里程碑式的参考基准。
当前挑战
该数据集所应对的核心挑战在于AI生成代码中普遍存在的安全与质量问题。具体而言,研究揭示了多层面的挑战:其一,14%的AI生成项目包含硬编码凭据或泄露秘密,这是对生产安全的直接威胁;其二,依赖Supabase作为后端的应用安全缺陷密度高达98%,远超非Supabase项目的77%,暴露了BaaS架构在客户端安全性上的系统性脆弱;其三,不同代码生成器间质量差异显著,Lovable项目平均存在644个问题,是Copilot辅助项目的4.5倍,且其99%的项目存在安全缺陷。在数据集构建过程中,挑战同样艰巨:由于项目标签与代码来源的混杂性,团队不得不借助README模板及AI话题标签的不完美信号来采样,这导致难以完全剥离工具本身与使用者经验的混淆效应;同时,数据集中存在重复仓库与标签误标,团队经过两次数据校正才最终将仓库数从429缩减至424,并修正了13%的线产量差异,体现了大规模代码质量审计的复杂性与严谨性要求。
常用场景
经典使用场景
在人工智能生成代码的迅猛发展浪潮中,该数据集聚焦于评估以Lovable、Bolt、v0及Copilot辅助为代表的AI代码生成工具所产出的代码质量。通过扫描424个公开项目、总计逾2100万行代码,研究者得以系统性地量化这些工具在实践中暴露的安全漏洞、可维护性缺陷与性能瓶颈。经典使用场景包括:对比不同AI代码生成器的缺陷密度(如每千行代码的安全问题数),识别最频发的错误模式(如异步操作缺失错误处理、嵌套三元表达式等),以及剖析特定技术栈(如Supabase)对代码质量的放大效应,从而为AI辅助编程的可靠性评估提供可复现的基准。
衍生相关工作
该数据集已催生一系列衍生研究工作:首先,其公开的295条确定性规则(基于Semgrep与正则表达式)构成了一个可复用的代码质量审计框架,为后续同类研究提供了标准化工具;其次,研究中提出的“缺陷密度”作为核心比较指标,被多个后续工作采纳用以评估AI代码生成器的演进趋势;此外,关于Supabase与代码安全性关联性的分析,引发了对低代码/无代码平台安全边界的深入探讨,直接推动了相关安全审计规则集的丰富与完善。这些工作共同构建了从数据采集、指标定义到工具落地的完整研究链条。
数据集最近研究
最新研究方向
在人工智能生成代码日益普及的背景下,该数据集聚焦于大规模评估AI生成代码的代码质量与安全风险,揭示了高达87%的项目存在至少一个安全缺陷,14%的项目泄露了密钥或硬编码凭据,且平均每62行代码就有一个问题。研究指出,不同AI代码生成工具(如Lovable、Bolt、v0和Copilot)在问题密度上存在显著差异,其中Lovable生成的项目安全缺陷率高达99%,而Copilot辅助的代码质量最佳。尤其值得关注的是,98%的Supabase后端应用存在安全漏洞,其问题密度是非Supabase应用的2.4倍,凸显了后端即服务(BaaS)架构在AI生成代码中放大的安全挑战。该研究为AI代码生成工具的优化、开发者的安全实践以及政策制定提供了关键数据支撑,推动行业向更可靠的生成式编码迈进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务