SakanaAI/AI-CUDA-Engineer-Archive
收藏官方服务:
资源简介:
AI CUDA 工程师存档数据集,包含大约30,000个CUDA核心,这些核心是根据KernelBench任务生成的。数据集包括torch参考实现、torch、NCU和Clang-tidy性能分析数据、每个任务多个核心、错误信息和与torch原生及编译运行时的速度提升分数。此数据集旨在支持开源模型的后期训练,以实现更优的CUDA功能模块。
The AI CUDA Engineer Archive, a dataset consisting of approximately 30,000 CUDA kernels generated based on KernelBench tasks. It includes torch reference implementations, torch, NCU, and Clang-tidy profiling data, multiple kernels per task, error messages, and speedup scores against torch native and compile runtimes. The dataset is designed to support post-training of open-source models to enable better CUDA-enabling modules.
提供机构:
SakanaAI搜集汇总
数据集介绍

构建方式
该数据集由Sakana AI研究团队基于KernelBench提供的核函数任务构建,通过名为The AI CUDA Engineer的智能体系统生成,涵盖了约30,000个CUDA核函数。数据集中每个条目均包含PyTorch参考实现、多种性能剖析数据(如NCU和Clang-tidy)、每个任务对应的多个核函数版本、错误信息以及相对于PyTorch原生和编译运行时的加速比评分。数据集按照难度分为三个层级(level_1、level_2、level_3),并以Parquet格式存储,便于高效加载与处理。
使用方法
使用者可通过HuggingFace的datasets库直接加载该数据集,利用Python接口便捷地获取各层级数据。例如,调用load_dataset函数后,可将数据转换为Pandas DataFrame进行探索性分析,如查看字段信息、统计正确核函数的数量分布等。该数据集特别适用于对开源模型进行后训练,支持离线强化学习、偏好优化及标准监督微调等多种范式,旨在提升模型对CUDA模块的生成与优化能力。
背景与挑战
背景概述
在深度学习与高性能计算交织演进的浪潮中,CUDA内核的编写与优化始终是制约模型效率的关键瓶颈。由Sakana AI研究团队于2025年发布的AI-CUDA-Engineer-Archive数据集,汇聚了约三万个由同名智能体系统自动生成的CUDA内核,其核心研究问题在于探索通过智能体驱动的方式实现CUDA内核的自动化发现、优化与组合。该数据集基于KernelBench提供的任务基准,并融入了Torch参考实现、NCU及Clang-tidy等多维度剖析数据,为后训练开源模型以提升CUDA编程能力奠定了坚实基础,对加速智能计算生态的进化具有深远影响。
当前挑战
当前数据集面临的核心挑战涵盖两个层面。在领域问题层面,如何使模型从静态的CUDA代码库中习得可泛化的优化策略,跨越不同硬件架构与算子组合的鸿沟,仍是一大难题。在构建过程中,数据集需应对内核正确性与性能指标的平衡,因为自动生成的内核虽数量庞大,但存在相当比例的编译错误或次优解。此外,多层级任务(Level 1至3)的难度递进设计,要求数据能有效引导模型从简单模式匹配走向复杂逻辑推理,这对数据质量与标注一致性提出了严苛考验。
常用场景
经典使用场景
在CUDA内核自动发现与优化的前沿研究中,SakanaAI/AI-CUDA-Engineer-Archive数据集扮演着核心基准的角色。该数据集囊括约三万条由AI CUDA Engineer智能体生成的CUDA内核,覆盖从基础算子到复杂组合的多个难度层级。研究者可借助其丰富的元数据——包括PyTorch参考实现、NCU性能剖析、Clang-tidy静态分析结果及加速比指标——来训练和评估模型在CUDA代码生成与优化方面的能力。经典使用方式是将数据集划分为level_1至level_3三个子集,分别对应不同复杂度的内核任务,用于监督微调、偏好优化或离线强化学习等范式,从而推动语言模型掌握高性能CUDA编程的技艺。
解决学术问题
长期以来,学术研究面临两大瓶颈:一是缺乏大规模、高质量且带有细粒度性能标注的CUDA内核数据集,阻碍了代码生成模型在硬件加速领域的泛化;二是手动编写与优化CUDA内核需要深厚的硬件知识,导致自动化方法进展缓慢。该数据集通过系统性地收录内核的正确性、运行时差异、编译优化效果及错误信息,首次为离线学习CUDA内核发现与组合提供了结构化资源。它使研究者能够量化分析模型生成内核相对于PyTorch原生与编译执行的加速效果,并探索错误模式与性能瓶颈的关联。这一贡献不仅填补了面向GPU编程的智能体训练数据空白,更为理解神经符号方法在底层硬件优化中的潜力奠定了实证基础,对高性能计算与机器学习交叉领域具有里程碑意义。
实际应用
在实际工程场景中,该数据集能够赋能企业级深度学习框架的自动化性能调优。例如,云服务商可利用其训练后的模型自动为Transformer、卷积等常见算子生成定制化CUDA内核,替代通用库实现数十倍的推理加速。硬件厂商则能基于数据集中多层次的性能剖析结果,优化驱动与编译器策略。此外,数据集中的错误日志与Clang-tidy警告可被集成到CI/CD流水线中,辅助开发者快速定位内核实现中的数值稳定性或内存访问问题。对于科学计算与自动驾驶等对延迟敏感的领域,该资源使得非专家团队也能通过微调开源模型来生成接近手写质量的GPU代码,大幅降低高性能计算的门槛。
数据集最近研究
最新研究方向
在人工智能与高性能计算交叉领域,CUDA内核的自动化发现与优化已成为提升深度学习模型计算效率的关键突破口。SakanaAI推出的AI-CUDA-Engineer-Archive数据集,汇聚了约三万条由智能体系统生成的CUDA内核,覆盖从基础算子到复杂组合的多个难度层级,并配套PyTorch参考实现、NCU与Clang-tidy性能剖析数据以及加速比评估。这一资源为后训练阶段的开源模型强化学习、偏好优化及监督微调提供了高质量训练语料,推动了CUDA编程从手工调优向数据驱动的智能体范式演进。当前,该数据集与KernelBench基准深度绑定,直接服务于大模型推理加速与定制化算子生成等前沿议题,其开放发布不仅降低了CUDA优化的技术门槛,更激发了社区对可组合、可复现的高性能内核生态的探索热情,对算力普惠与算法-硬件协同设计具有深远意义。
以上内容由遇见数据集搜集并总结生成



