遇见数据集

avo-release-30

收藏
Hugging Face2026-08-09 更新2026-08-10 收录
官方服务:

资源简介:

本数据集(AVO Release 30)收录了AVO(Assembly-level Kernel Optimization Agent)在AMD MI308X(gfx942)GPU上完成的26个GPU内核优化产物,覆盖Level 1与Level 2优化级别。每个算子均附带一套完整的可复测pair harness,包含真实GPU dispatch的完整快照(内核二进制、kernarg、全部内存区域),使得第三方可在相同硬件上独立复核正确性与加速比,无需依赖原始框架或模型。数据集目录结构清晰:每个算子下包含harness目录(用于独立复测,内含capture快照、基准内核ref.co、优化后内核opt.co、验证脚本run_harness.py等)和avo_kernel_<ts>目录(原始优化过程记录,用于溯源)。数据集提供两个加速比口径:Harness(基于真实dispatch的ABBA交错测量,几何平均1.3637x,推荐作为复测标准)和Director(AVO侧构造的基准,几何平均1.5101x,仅作参考)。Harness测量同时给出slot_bias用于检测槽位偏差,本批26个算子slot_bias落在0.9914~1.0089之间,表明比值可信。正确性判据分为两种:21个算子达到逐字节一致,5个算子采用容差判据(4个使用余弦相似度≥0.9999,1个使用相对误差上界rtol=1e-6),容差范围在validation_policy.json中明确说明。数据集不包含原始实验中未通过harness正确性判据的4个算子,但其记录保留在指定仓库中。本数据集为增量发布,后续通过复核的算子会追加。环境要求:AMD MI308X显卡、ROCm/HIP运行时、hipcc与cmake编译工具,不依赖PyTorch或Triton等框架。

This dataset (AVO Release 30) contains 26 GPU kernel optimization products completed by AVO (Assembly-level Kernel Optimization Agent) on AMD MI308X (gfx942) GPU, covering Level 1 and Level 2 optimization levels. Each operator comes with a complete reproducible pair harness, including a full snapshot of the real GPU dispatch (kernel binary, kernarg, all memory regions), allowing third parties to independently verify correctness and speedup on the same hardware without relying on the original framework or model. The dataset directory structure is clear: each operator contains a harness directory (for independent retesting, including capture snapshot, baseline kernel ref.co, optimized kernel opt.co, verification script run_harness.py, etc.) and an avo_kernel_<ts> directory (original optimization process records for traceability). The dataset provides two speedup metrics: Harness (ABBA interleaved measurement based on real dispatch, geometric mean 1.3637x, recommended as the retest standard) and Director (AVO-side constructed baseline, geometric mean 1.5101x, for reference only). The Harness measurement also provides slot_bias for detecting slot bias, with slot_bias of this batch of 26 operators ranging from 0.9914 to 1.0089, indicating the ratio is reliable. Correctness criteria are divided into two types: 21 operators achieve byte-by-byte consistency, and 5 operators use tolerance criteria (4 use cosine similarity ≥ 0.9999, 1 uses relative error upper bound rtol=1e-6), with the tolerance range clearly stated in validation_policy.json. The dataset does not include the 4 operators that did not pass the harness correctness criteria in the original experiment, but their records are retained in the specified repository. This dataset is released incrementally, and operators that pass review will be added later. Environment requirements: AMD MI308X GPU, ROCm/HIP runtime, hipcc and cmake compilation tools, without relying on frameworks such as PyTorch or Triton.

创建时间:
2026-08-06
原始信息汇总

数据集概述

AVO Release 30 是一个面向 AMD GPU 内核优化领域的可复测数据集,收录了 AVO(assembly-level kernel optimization agent)在 AMD MI308X(gfx942)上完成的 26 个算子的优化产物,覆盖 Level 1 与 Level 2 两个优化层级。

核心特性

  • 自带 pair harness:每个算子都附带一套完整的回放工具,将真实发生的 GPU dispatch(内核二进制、kernarg、全部内存区域)完整捕获。任何人可在自己的 gfx942 卡上原样复现,独立复核正确性与加速比,无需原始框架、模型或数据。
  • 双加速比口径:数据集中同时存在 Harness 与 Director 两种加速比,二者不可直接比较。官方明确以 Harness 口径为准,Director 数字仅作溯源参考。

目录结构

每个算子的目录包含:

  • harness/:可独立复测的 pair harness,内含 dispatch 完整快照、基准内核(ref.co)、优化内核(opt.co)、输入 sha256 清单、运行脚本(run_harness.py / Makefile / CMakeLists.txt)及编译所需第三方头文件。
  • avo_kernel_<ts>/:AVO 原始优化过程记录,含 director_validation.jsonavo_state/attempts.jsonl 等溯源文件。
  • index.json:全量索引,每个算子一条,含 harness 与 Director 两套结果。

加速比结果

指标 Harness Director
基准二进制 真实被 dispatch 的内核 AVO 自编基准
负载 真实捕获的 dispatch AVO 构造形状
26 算子几何平均 1.3637x 1.5101x

Harness 采用 ABBA 交错测量,speedup = sqrt(fwd/rev),并以 slot_bias = sqrt(fwd·rev) 检测槽位偏差。本批次 slot_bias 落在 0.9914 ~ 1.0089,表明槽位对称、比值可信。

注意:数据集只报比值,不报绝对时间。绝对微秒数受同卡功耗争用与虚拟地址分配影响,漂移可达数十个百分点,*_us 字段仅供调试,不应跨机器比较。

正确性判据

判据 算子数 含义
逐字节 21 输出字节与基准完全相同
容差 5 仅对声明的字节范围放宽,范围外仍要求逐字节相同

容差算子中,4 个采用余弦相似度 ≥ 0.9999;37_FrobeniusNorm_ 因输出为单个 float32 标量,改用相对误差上界 rtol=1e-6(实测 4.33e-07)。容差策略的放宽范围、判据与阈值均记录在 harness/capture/validation_policy.json 中。

已知局限:余弦相似度对"换算法"不敏感,可能掩盖单侧系统性误差。对数值精度敏感的用户需自行检查 opt.co 反汇编。

排除的算子

原始实验集合共 30 个算子,其中 4 个未通过 harness 正确性判据,未纳入发布。这些实验记录保留在上游仓库 puyuan-yang/asm_co_bench_extjinglwan/avo_exp 中。数据集为增量发布,后续通过复核的算子会按相同目录约定追加。

运行环境

  • GPU:AMD MI308X(gfx942)
  • 依赖:ROCm / HIP 运行时,需 hipcccmake
  • Harness 不依赖 PyTorch、Triton 或任何上游框架

快速开始

bash cd level1/<算子名>/harness make -j8 python run_harness.py

输出 result.json,包含正确性判定与加速比。

搜集汇总
数据集介绍
avo-release-30 数据集图片
构建方式
该数据集源自AVO(汇编级内核优化智能体)在AMD MI308X(gfx942)平台上的系统性内核优化实践,精选26个算子(涵盖Level 1与Level 2)的优化产物。其构建匠心独具,为每个算子配备了完整的pair harness,将真实GPU调度过程中的内核二进制、kernarg及全部内存区域快照完整捕获,形成可独立复现的测试载体。数据集目录结构严谨,每算子下既有harness(含基准与优化内核、清单及验证配置),亦保留AVO原始优化日志(avo_kernel_<ts>),并通过index.json实现全量索引,确保溯源与复测的双重可靠性。
使用方法
使用者可便捷地通过标准流程复现优化结果:进入对应算子目录(如level1/<算子名>/harness),执行make -j8与python run_harness.py,即可生成含正确性判定与加速比的result.json。数据集环境要求简洁,仅需AMD gfx942 GPU与ROCm/HIP运行时(含hipcc与cmake),完全摆脱对PyTorch、Triton等上游框架的依赖。建议复测时以harness结果为准,并关注validation_policy.json中的容差设置,或对opt.co进行反汇编以深入验证数值精度,确保在自身场景中稳健应用。
背景与挑战
背景概述
随着深度学习模型规模的急剧膨胀,GPU内核的性能优化已成为提升计算效率的关键路径。传统优化方法依赖专家经验或通用编译器,难以充分挖掘硬件潜力。为此,AVO(assembly-level kernel optimization agent)项目于近期开发,旨在通过汇编级自动优化实现内核性能的极致提升。该数据集由相关研究团队在AMD MI308X(gfx942)平台上构建,记录了26个算子的优化产物,覆盖Level 1与Level 2。其核心创新在于每个算子附带一套完整的pair harness,可真实回放原始GPU调度过程,使第三方能够独立复现验证,无需依赖原始框架。该数据集的发布为GPU内核优化领域提供了可复测的基准,推动了自动优化技术的可信评估与发展。
当前挑战
该数据集面临的挑战涉及两个层面。在领域问题层面,GPU内核优化需在保持数值正确性的前提下提升执行速度,传统优化易引入精度损失,且不同硬件架构间的优化不可移植性增加了泛化难度。在数据集构建层面,首先需解决复测可靠性问题,通过pair harness捕获真实调度,但绝对时间受邻居功耗争用及虚拟地址分配影响,难以跨环境比较,故仅采用ABBA交错比值。其次,正确性判定需权衡严格性与实用性,采用逐字节比对与容差判据,但余弦相似度对算法替代不敏感,存在潜在系统性误差。此外,实验初始30个算子中仅26个通过验证,4个因未达标准被排除,反映了优化与验证之间的平衡挑战。
常用场景
经典使用场景
该数据集为GPU内核优化领域提供了一个独特且严谨的基准测试平台。其经典使用场景聚焦于汇编级内核优化的可复现性验证,研究者可利用其中封闭的pair harness(包括真实捕获的内核二进制、kernarg及内存快照)在AMD MI308X(gfx942)平台上独立重放完整的GPU调度过程,从而精确比较优化前后内核的正确性与加速比。这种设计使得同领域的工作者能够脱离原始框架与模型,直接审视优化策略的实效,为内核优化方法的公平评估与对比提供了标准化的实验范式。
解决学术问题
该数据集直面GPU内核优化研究中长期存在的实验不可复现与结果难以横向比较的顽疾。通过提供包含完整输入快照的harness,它使得每次优化效果的测量都基于同一真实调度场景,消除了因负载差异或环境变化导致的偏差,确保了加速比与正确性判定的客观性。这不仅解决了学术研究中“优化成果难以验证”的核心问题,还通过引入ABBA交错测量与slot_bias校准机制,提升了性能评估的置信度,为建立可累积、可验证的优化知识体系奠定了数据基础,对推动内核优化的系统化研究具有里程碑式的意义。
实际应用
该数据集的实践价值体现在其为工业界GPU内核调优提供了可靠的参照与工具。在具体应用场景中,开发者可直接利用harness对特定算子(如涉及矩阵乘法、范数计算等)进行快速原型验证,评估不同优化手法的收益;同时,数据集中容差判据与反汇编提示为数值敏感型应用(如科学计算、深度学习推理)提供了安全边界参考。此外,其完备的索引与增量发布机制,可支持自动化工具链(如基于学习的优化代理)在预设的测试床上持续迭代与回归测试,加速从研究原型到生产部署的转化进程。
数据集最近研究
最新研究方向
当前数据集聚焦于可复现的GPU内核优化研究,通过捕捉真实执行环境的pair harness,为第三方独立验证提供标准化基准。其前沿方向在于利用汇编级优化代理(AVO)在AMD MI308X上探索内核级性能提升,强调结果的可比性与可审计性。该数据集不仅提供了26个优化算子的详细产物,还建立了harness与Director双口径的对比机制,以应对测量偏差与数值精度问题,推动GPU优化领域向更严谨、可复制的研究范式发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务