遇见数据集

KernelGenBench

收藏
github2026-05-25 更新2026-05-26 收录
官方服务:

资源简介:

KernelGenBench是一个包含210个操作符的完整数据集,涵盖ATen、vLLM和cuBLAS三个来源,用于评估跨多个硬件平台的LLM和基于代理的Triton内核生成。

KernelGenBench is a comprehensive dataset comprising 210 operators sourced from three frameworks: ATen, vLLM, and cuBLAS. It is designed to evaluate LLM and agent-based Triton kernel generation across multiple hardware platforms.

创建时间:
2026-05-24
原始信息汇总

数据集概述

KernelGenBench 是一个基准测试框架,用于评估基于大语言模型(LLM)和智能体(Agent)的 Triton 内核生成能力,支持多种硬件平台。

核心特性

  • 210 个算子:涵盖 ATen(110 个)、vLLM(50 个)和 cuBLAS(50 个)三个来源。
  • 多芯片支持:兼容 NVIDIA、Ascend NPU、MUSA、Hygon DCU、Iluvatar 以及 MetaX 等硬件。
  • 两种评估轨道
    • LLM 轨道:使用 Pass@K 指标评估 LLM 生成 Triton 内核的能力。
    • Agent 轨道:评估编码智能体通过迭代生成、验证和修复内核的能力。
  • 多种智能体方法:包括 Claude Code、OpenCode、AutoKernel、AKO4ALL、cuda-optimized-skill 等。
  • 自动验证:基于容差比较的精度测试。

数据集划分

数据集 算子数量 描述
KernelGenBench 210 完整数据集 (ATen + vLLM + cuBLAS)
KernelGenBench-aten 110 仅 ATen 算子
KernelGenBench-vllm 50 仅 vLLM 算子
KernelGenBench-cublas 50 仅 cuBLAS 算子 (仅限 NVIDIA)

在非 NVIDIA 芯片上,默认数据集自动切换为 KernelGenBench-aten(cuBLAS 算子依赖 NVIDIA GPU)。

评估结果示例

多来源评估(NVIDIA A100,210 个算子)

  • Claude Code 方法在总体精度上达到 87%,总体加速比为 0.78
  • AKO4all 方法在总体精度上达到 83%,总体加速比为 0.97

多芯片评估(110 个 ATen 算子,6 个平台)

  • 在 NVIDIA 平台上,Claude Code 方法的精度为 92%,加速比为 0.86
  • 在平台 A 上,Claude Code 方法的精度为 89%,加速比为 0.18

使用方法

LLM 轨道

通过 scripts/generate_kernel_and_verify.py 脚本评估 LLM,支持单算子测试和全数据集基准测试。

支持配置模型名称、采样轮次、温度、超时时间等参数。

Agent 轨道

通过 agent_bench/ 目录下的脚本评估编码智能体,支持单算子、多算子和全数据集基准测试。

支持配置智能体方法、数据集、设备数量、超时时间等参数。

项目结构

  • agent_bench/:Agent 轨道框架,包含智能体方法、提示词模板和验证工具。
  • sota_agents/:专门的智能内核生成智能体(AutoKernel、AKO4ALL、cuda-optimized-skill)。
  • src/kernelgenbench/:核心包,包含精度测试、数据集和框架。
  • src/generator/:LLM 提示词构建器和采样器。
  • src/sandbox/:内核验证器和反黑客机制。
  • src/runtime/:设备检测和约束。
  • scripts/:LLM 轨道入口点和分析工具。

贡献与引用

欢迎贡献新的算子、芯片后端、智能体或方法。详细信息请参阅项目的 CONTRIBUTING 文档。

若在研究中使用了 KernelGenBench,请引用:

@software{kernelgenbench2026, title={KernelGenBench: A Benchmark for LLM and Agent-Based Triton Kernel Generation}, author={KernelGen Team}, url={https://github.com/flagos-ai/KernelGenBench}, year={2026} }

该项目采用 MIT 许可证。

搜集汇总
数据集介绍
KernelGenBench 数据集图片
构建方式
KernelGenBench作为FlagOS统一开源AI系统软件栈的核心组件,致力于评估基于大语言模型与智能体的Triton内核生成能力。该数据集精心整合了来自ATen、vLLM和cuBLAS三大来源的210个算子,覆盖了从基础张量操作到高性能计算库的广泛场景。其构建过程强调多硬件平台的兼容性,通过自动设备检测机制,使同一套评测流程可无缝适配NVIDIA GPU、Ascend NPU、MUSA、Hygon DCU、Iluvatar及MetaX等多种芯片架构。每个算子均配备了精度验证与性能基线,形成了一套标准化的评测单元。
特点
KernelGenBench的核心特色在于其双轨评测体系:LLM Track通过Pass@K指标衡量模型在多次采样中的内核生成成功率,而Agent Track则模拟迭代式开发流程,让智能体在生成、验证与修复的循环中持续优化内核。数据集支持多种智能体方法,包括Claude Code、OpenCode、AutoKernel及AKO4ALL等,丰富了评测维度。此外,其跨平台评测能力尤为突出,通过统一的命令接口和自动设备适配,揭示了不同硬件平台在编译器成熟度与后端支持上的差异,为软硬件协同优化提供了宝贵视角。
使用方法
使用KernelGenBench时,用户首先需安装依赖并配置API密钥以调用LLM服务。对于LLM Track,可通过命令行指定模型、数据集和采样轮次运行完整评测;对于Agent Track,则需配置智能体环境并利用脚本启动迭代生成任务。评测结果自动保存至运行目录,包含进度追踪、生成内核文件及验证结果。用户亦可自定义算子,通过向精度测试模块添加用例并注册至数据集中,扩展评测范围。分析脚本支持对LLM和Agent轨道的输出进行统一解析,便于深入洞察模型与智能体的生成效能。
背景与挑战
背景概述
随着深度学习模型复杂度的与日俱增,高性能计算内核的自动生成成为释放硬件潜能、降低开发成本的关键路径。KernelGenBench 由FlagOS团队于2026年创建,旨在系统性评估大语言模型与智能体在Triton内核生成任务上的表现。该基准涵盖来自ATen、vLLM和cuBLAS的210个算子,支持NVIDIA、昇腾NPU、摩尔线程MUSA等多种芯片架构,并设计了LLM与智能体双轨评估机制。KernelGenBench的提出填补了跨平台内核生成标准化评估的空白,为AI驱动的高性能计算研究提供了重要的实验平台与性能参照。
当前挑战
KernelGenBench面临的核心挑战在于如何实现跨多种异构硬件平台的高效内核生成。当前基于LLM的方法在单一架构上尚可取得一定精度,但在昇腾、摩尔线程等非NVIDIA平台上,由于编译器成熟度不足和后端支持不完整,生成内核的准确率与性能均显著下降,额外开销可达两倍。构建过程中,需为每种芯片配置独立的可见性环境变量与约束规则,确保自动检测与兼容性。此外,智能体方法的迭代验证流程对计算资源要求极高,如何在有限设备上高效调度验证任务、控制超时与资源争抢,亦是数据集设计与持续演进中的关键技术瓶颈。
常用场景
经典使用场景
在异构计算与人工智能系统软件栈加速发展的时代洪流中,高性能算力内核的自动生成已成为提升计算效率的核心挑战。KernelGenBench作为FlagOS开源生态的关键组件,专为评估大语言模型与智能体驱动的Triton内核生成能力而设计。其最经典的使用场景在于,针对涵盖ATen、vLLM和cuBLAS三大来源的210个标准算子,在NVIDIA GPU以及昇腾NPU、沐曦MUSA、海光DCU等多元硬件平台上,系统性地衡量基于Pass@K的LLM直接生成效果与迭代式智能体优化策略的生成质量。研究者可通过LLM Track与Agent Track两条评测轨道,对模型在跨芯片环境中的算子正确率与相对加速比进行量化对比,从而客观刻画不同生成方法的计算潜力与生态适配成本。
衍生相关工作
KernelGenBench的发布催生了一系列具有深远影响力的衍生研究工作,极大推动了AI驱动内核生成领域的学术演进。与之紧密关联的开源项目KernelGen,正是在该基准的评估范式启发下构建的高性能自动化Triton内核生成平台,将LLM与智能体的协同优化能力系统化地集成至端到端生产流程中。同时,该数据集的理念直接催生了awesome-LLM-driven-kernel-generation专项综述,系统性梳理了AI驱动内核生成的前沿方法谱系,为后续研究者提供了完备的知识地图。在评测方法论层面,KernelGenBench所确立的跨芯片Pass@K与Agent迭代双轨制评估体系,已被后续多项工作采纳为基准框架,推动了自反馈优化、策略记忆与多智能体协作等方向在算子生成领域的纵深探索,形成了以标准化评测牵引方法创新的良性学术生态。
数据集最近研究
最新研究方向
当前,大语言模型与智能体驱动的内核自动生成正成为AI编译器与芯片生态融合的前沿焦点。KernelGenBench作为首个跨硬件平台的Triton内核生成基准框架,系统评估了LLM在多芯片环境下的算子级代码生成能力——涵盖ATen、vLLM与cuBLAS三大来源的210个算子,并在NVIDIA、昇腾NPU、摩尔线程MUSA、海光DCU等六类芯片上完成验证。实验揭示了一个关键趋势:基于Claude Code等智能体方法的迭代式内核生成在准确率上显著优于单轮Pass@K(如ATen算子从39%跃升至92%),但非NVIDIA平台因编译器成熟度不足导致额外2倍以上的Token开销与性能衰减。这一发现直接回应了当前异构计算生态中“开发一次、迁移多芯”的迫切需求,推动了自动化kernel优化从单一架构向多vendor硬件的高效迁移范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务