遇见数据集

awesome-machine-learning-in-compilers

收藏
github2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

这是一个精选的资源合集,专门收集和整理应用于编译器和程序优化领域的机器学习相关数据集、基准测试、研究论文和工具。合集覆盖了编译器自动调优、指令级优化、并行映射、程序表示学习等多个主题领域,旨在为研究者和开发者提供系统化的参考资料集合。

This is a curated resource collection that specifically gathers and organizes machine learning-related datasets, benchmarks, research papers, and tools for the fields of compilers and program optimization. This collection covers multiple thematic domains including compiler auto-tuning, instruction-level optimization, parallel mapping, program representation learning, and other related areas, aiming to provide researchers and developers with a systematic set of reference materials.

创建时间:
2020-06-18
原始信息汇总

数据集概述

该页面是一个精选的资源列表,专注于将机器学习技术应用于编译器和程序优化领域。它汇集了研究论文、数据集和软件工具,旨在为相关研究者和开发者提供参考。

核心主题

  • 编译器优化:利用机器学习改进编译器的性能,如自动调整编译选项、优化指令顺序、循环变换等。
  • 程序优化:应用机器学习技术对程序本身进行优化,包括代码大小、性能和能耗等方面的提升。
  • 机器学习技术:涵盖多种机器学习方法,包括强化学习、贝叶斯优化、深度学习、迁移学习、模仿学习等。

内容分类

资源列表按主题分类,主要包括:

  • 论文 (Papers):按研究方向细分,例如:
    • 综述 (Survey)
    • 迭代编译与编译器选项调优 (Iterative Compilation and Compiler Option Tuning)
    • 指令级优化 (Instruction-level Optimisation)
    • 并行映射与任务调度 (Parallelism Mapping and Task Scheduling)
    • 语言与编译 (Languages and Compilation)
    • 自动调优与设计空间探索 (Auto-tuning and Design Space Exploration)
    • 代码大小缩减 (Code Size Reduction)
    • 成本与性能模型 (Cost and Performance Models)
    • 特定领域优化 (Domain-specific Optimisation)
    • 学习程序表示 (Learning Program Representation)
    • ML用于编译器和系统优化 (ML for Compilers and Systems Optimisation)
    • 内存/缓存建模/分析 (Memory/Cache Modelling/Analysis)
  • 书籍 (Books)
  • 演讲与教程 (Talks and Tutorials)
  • 软件 (Software)
  • 基准测试与数据集 (Benchmarks and Datasets)
  • 会议 (Conferences)
  • 期刊 (Journals)

关键资源

  • 代表性论文:列表中包含大量顶级会议和期刊论文,如来自PLDI、CGO、ASPLOS、NeurIPS、MLSys、Nature等的出版物,时间跨度从1998年至今。
  • 最新动态:页面收录了截至2026年的论文,如《The New Compiler Stack: A Survey on the Synergy of LLMs and Compilers》(CCF Transactions on High Performance Computing, 2026),显示了该领域的持续发展。
搜集汇总
数据集介绍
awesome-machine-learning-in-compilers 数据集图片
构建方式
该数据集名为“awesome-machine-learning-in-compilers”,是一个精心整理的资源清单,汇聚了将机器学习技术应用于编译器与程序优化领域的代表性研究论文、基准测试数据集及实用工具。其构建方式遵循了系统性文献综述的原则,通过广泛检索顶级学术会议与期刊(如PLDI、CGO、NeurIPS等),筛选出涵盖迭代编译、指令级优化、自动调优、程序表示学习等核心主题的文献,并按照研究主题进行层次化分类。此外,项目维护者持续跟踪领域前沿进展,定期更新条目,确保资源库的时效性与完整性。
特点
该数据集最鲜明的特色在于其高度的结构化和主题覆盖广度。内容被精细划分为十余个专题板块,如编译器选项调优、并行映射、代码尺寸缩减、成本与性能模型等,便于研究者快速定位感兴趣的方向。每个条目均附有论文标题、作者、发表年份及出版物信息,并标注了页数,为文献筛选提供了直观参考。此外,数据集还整合了相关书籍、演讲教程、软件工具及会议期刊列表,构建了一个从入门到前沿的全方位学习生态,特别适合作为该交叉领域研究的起点与导航图。
使用方法
使用者可通过GitHub仓库的README页面直接访问该数据集。浏览时,建议先阅读“Survey”板块中的综述论文以建立领域概览,再根据具体研究需求深入相应专题。每个论文条目均提供标题链接,点击即可跳转至原始出版页面或预印本(如arXiv),方便获取全文。对于需要实验基准或代码工具的研究,可直接参考“Benchmarks and Datasets”与“Software”板块。项目还欢迎社区贡献,用户可通过“How to Contribute”指南提交新条目,共同丰富这一开放资源。
背景与挑战
背景概述
该数据集创建于近年,由Zheng Wang等研究人员与机构共同维护,聚焦于机器学习在编译器与程序优化领域的交叉研究。随着深度学习与高性能计算的蓬勃发展,传统编译器优化方法日益面临性能瓶颈,而机器学习技术为自动调优、指令级优化及代码生成等核心问题提供了全新范式。该数据集系统梳理了从迭代编译、并行映射到程序表示学习等关键方向的研究脉络,收录了涵盖经典与前沿的论文、基准测试及工具,已成为该领域研究者不可或缺的参考资源,对推动编译器智能化转型具有重要影响力。
当前挑战
当前领域面临的核心挑战在于:一是编译器优化空间的指数级爆炸,使得传统穷举搜索策略失效,亟需高效探索启发式方法;二是机器学习模型对程序语义的抽象理解不足,难以精准捕捉代码结构与执行行为的复杂映射关系;三是构建过程中面临数据标注成本高昂、跨平台迁移性差及可复现性不足等问题,尤其缺乏统一、标准化的基准测试套件来公平评估不同方法的性能。此外,如何将深度学习模型无缝集成至现有编译器框架,并保持编译时延与资源开销的可控性,仍是亟待突破的瓶颈。
常用场景
经典使用场景
在编译器优化与程序自动调优的交叉领域,该数据集汇聚了将机器学习技术应用于编译器设计与优化的前沿研究资源。其经典使用场景涵盖迭代编译与编译器选项调优,通过贝叶斯优化、蒙特卡洛树搜索等算法自动探索最优编译参数组合;指令级优化则利用深度强化学习实现自动向量化、寄存器分配与循环变换;自动调优与设计空间探索领域,研究者借助该数据集构建成本模型,高效搜索高性能代码变体。这些方法显著提升了现代编译器在异构硬件上的自适应能力。
衍生相关工作
围绕该数据集,衍生出多项具有里程碑意义的研究工作。经典的如NeuroVectorizer利用深度强化学习实现端到端自动向量化,Nature上发表的AlphaTensor通过强化学习发现更快的矩阵乘法算法,以及基于大语言模型的Reasoning Compiler和Compiler-R1等智能体框架,将编译器调优推向自动化推理的新高度。这些工作不仅验证了机器学习在编译器优化中的有效性,还催生了如MLGO、AutoPhase等开源工具链,推动了整个领域从经验驱动向数据驱动、从人工设计向自动发现的深刻变革。
数据集最近研究
最新研究方向
在编译器与程序优化领域,机器学习的融合正引领一场深刻的变革,尤其以大型语言模型(LLM)和强化学习(RL)的渗透最为前沿。该数据集聚焦于利用这些先进技术实现编译器自动调优、指令级优化及设计空间探索。近期研究热点鲜明地体现在利用LLM作为推理引擎指导编译优化决策,例如通过LLM引导的优化策略提升模型服务效率,以及采用强化学习框架(如Compiler-R1)实现智能体式的编译器自动调优,将传统的手工启发式规则转变为数据驱动的自主探索过程。此外,针对张量程序的指令级自动调优与单调内存优化,以及基于预训练Transformer模型自动生成编译器后端等方向,均展现了深度学习在细粒度优化上的巨大潜力。这些研究不仅大幅提升了编译优化的效率与效果,更标志着编译器设计正从经验驱动向智能自主演进,对应对日益复杂的硬件架构和多样化应用负载具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务