avo-release-30
收藏资源简介:
本数据集(AVO Release 30)收录了AVO(Assembly-level Kernel Optimization Agent)在AMD MI308X(gfx942)GPU上完成的26个GPU内核优化产物,覆盖Level 1与Level 2优化级别。每个算子均附带一套完整的可复测pair harness,包含真实GPU dispatch的完整快照(内核二进制、kernarg、全部内存区域),使得第三方可在相同硬件上独立复核正确性与加速比,无需依赖原始框架或模型。数据集目录结构清晰:每个算子下包含harness目录(用于独立复测,内含capture快照、基准内核ref.co、优化后内核opt.co、验证脚本run_harness.py等)和avo_kernel_<ts>目录(原始优化过程记录,用于溯源)。数据集提供两个加速比口径:Harness(基于真实dispatch的ABBA交错测量,几何平均1.3637x,推荐作为复测标准)和Director(AVO侧构造的基准,几何平均1.5101x,仅作参考)。Harness测量同时给出slot_bias用于检测槽位偏差,本批26个算子slot_bias落在0.9914~1.0089之间,表明比值可信。正确性判据分为两种:21个算子达到逐字节一致,5个算子采用容差判据(4个使用余弦相似度≥0.9999,1个使用相对误差上界rtol=1e-6),容差范围在validation_policy.json中明确说明。数据集不包含原始实验中未通过harness正确性判据的4个算子,但其记录保留在指定仓库中。本数据集为增量发布,后续通过复核的算子会追加。环境要求:AMD MI308X显卡、ROCm/HIP运行时、hipcc与cmake编译工具,不依赖PyTorch或Triton等框架。
This dataset (AVO Release 30) contains 26 GPU kernel optimization products completed by AVO (Assembly-level Kernel Optimization Agent) on AMD MI308X (gfx942) GPU, covering Level 1 and Level 2 optimization levels. Each operator comes with a complete reproducible pair harness, including a full snapshot of the real GPU dispatch (kernel binary, kernarg, all memory regions), allowing third parties to independently verify correctness and speedup on the same hardware without relying on the original framework or model. The dataset directory structure is clear: each operator contains a harness directory (for independent retesting, including capture snapshot, baseline kernel ref.co, optimized kernel opt.co, verification script run_harness.py, etc.) and an avo_kernel_<ts> directory (original optimization process records for traceability). The dataset provides two speedup metrics: Harness (ABBA interleaved measurement based on real dispatch, geometric mean 1.3637x, recommended as the retest standard) and Director (AVO-side constructed baseline, geometric mean 1.5101x, for reference only). The Harness measurement also provides slot_bias for detecting slot bias, with slot_bias of this batch of 26 operators ranging from 0.9914 to 1.0089, indicating the ratio is reliable. Correctness criteria are divided into two types: 21 operators achieve byte-by-byte consistency, and 5 operators use tolerance criteria (4 use cosine similarity ≥ 0.9999, 1 uses relative error upper bound rtol=1e-6), with the tolerance range clearly stated in validation_policy.json. The dataset does not include the 4 operators that did not pass the harness correctness criteria in the original experiment, but their records are retained in the specified repository. This dataset is released incrementally, and operators that pass review will be added later. Environment requirements: AMD MI308X GPU, ROCm/HIP runtime, hipcc and cmake compilation tools, without relying on frameworks such as PyTorch or Triton.
数据集概述
AVO Release 30 是一个面向 AMD GPU 内核优化领域的可复测数据集,收录了 AVO(assembly-level kernel optimization agent)在 AMD MI308X(gfx942)上完成的 26 个算子的优化产物,覆盖 Level 1 与 Level 2 两个优化层级。
核心特性
- 自带 pair harness:每个算子都附带一套完整的回放工具,将真实发生的 GPU dispatch(内核二进制、kernarg、全部内存区域)完整捕获。任何人可在自己的 gfx942 卡上原样复现,独立复核正确性与加速比,无需原始框架、模型或数据。
- 双加速比口径:数据集中同时存在 Harness 与 Director 两种加速比,二者不可直接比较。官方明确以 Harness 口径为准,Director 数字仅作溯源参考。
目录结构
每个算子的目录包含:
harness/:可独立复测的 pair harness,内含 dispatch 完整快照、基准内核(ref.co)、优化内核(opt.co)、输入 sha256 清单、运行脚本(run_harness.py/ Makefile / CMakeLists.txt)及编译所需第三方头文件。avo_kernel_<ts>/:AVO 原始优化过程记录,含director_validation.json、avo_state/attempts.jsonl等溯源文件。index.json:全量索引,每个算子一条,含 harness 与 Director 两套结果。
加速比结果
| 指标 | Harness | Director |
|---|---|---|
| 基准二进制 | 真实被 dispatch 的内核 | AVO 自编基准 |
| 负载 | 真实捕获的 dispatch | AVO 构造形状 |
| 26 算子几何平均 | 1.3637x | 1.5101x |
Harness 采用 ABBA 交错测量,speedup = sqrt(fwd/rev),并以 slot_bias = sqrt(fwd·rev) 检测槽位偏差。本批次 slot_bias 落在 0.9914 ~ 1.0089,表明槽位对称、比值可信。
注意:数据集只报比值,不报绝对时间。绝对微秒数受同卡功耗争用与虚拟地址分配影响,漂移可达数十个百分点,
*_us字段仅供调试,不应跨机器比较。
正确性判据
| 判据 | 算子数 | 含义 |
|---|---|---|
| 逐字节 | 21 | 输出字节与基准完全相同 |
| 容差 | 5 | 仅对声明的字节范围放宽,范围外仍要求逐字节相同 |
容差算子中,4 个采用余弦相似度 ≥ 0.9999;37_FrobeniusNorm_ 因输出为单个 float32 标量,改用相对误差上界 rtol=1e-6(实测 4.33e-07)。容差策略的放宽范围、判据与阈值均记录在 harness/capture/validation_policy.json 中。
已知局限:余弦相似度对"换算法"不敏感,可能掩盖单侧系统性误差。对数值精度敏感的用户需自行检查 opt.co 反汇编。
排除的算子
原始实验集合共 30 个算子,其中 4 个未通过 harness 正确性判据,未纳入发布。这些实验记录保留在上游仓库 puyuan-yang/asm_co_bench_ext 与 jinglwan/avo_exp 中。数据集为增量发布,后续通过复核的算子会按相同目录约定追加。
运行环境
- GPU:AMD MI308X(gfx942)
- 依赖:ROCm / HIP 运行时,需
hipcc与cmake - Harness 不依赖 PyTorch、Triton 或任何上游框架
快速开始
bash cd level1/<算子名>/harness make -j8 python run_harness.py
输出 result.json,包含正确性判定与加速比。




