遇见数据集

GARDENIA

收藏
arXiv2018-02-03 更新2024-07-25 收录
数据链接:
官方服务:

资源简介:

GARDENIA是由国防科技大学开发的针对下一代加速器设计的领域特定基准套件,专注于大规模并行加速器上的不规则算法研究。该数据集包含9个工作负载,模拟现代大规模数据中心中运行的商业多线程程序,特别关注大数据和机器学习领域。GARDENIA通过采用最新的优化技术,确保其代表真实世界的应用程序,并帮助架构研究人员深入理解这些应用程序,从而设计出针对不规则工作负载的高能效下一代加速器。

GARDENIA is a domain-specific benchmark suite developed by the National University of Defense Technology, designed for the next-generation accelerators. It focuses on the study of irregular algorithms on large-scale parallel accelerators. This dataset includes 9 workloads that simulate commercial multithreaded programs running in modern large-scale data centers, with a particular emphasis on the fields of big data and machine learning. GARDENIA ensures its representation of real-world applications through the adoption of the latest optimization techniques, aiding architectural researchers in deeply understanding these applications and thereby designing next-generation accelerators with high energy efficiency for irregular workloads.

提供机构:
国防科技大学
创建时间:
2017-08-15
原始信息汇总

GARDENIA Benchmark Suite 数据集概述

数据集基本信息

  • 名称: GARDENIA Benchmark Suite
  • 版权: 2020 Xuhao Chen, Massachusetts Institute of Technology
  • 简介: GARDENIA(Graph Analytics Repository for Designing Efficient Next-generation Accelerators)是一个用于设计下一代高效加速器的图分析基准测试套件。
  • 链接: https://github.com/chenxuhao/gardenia

数据集特点

  • 基准套件目的: 标准化评估,帮助图处理研究。
  • 实现技术: 使用CUDA、OpenCL和OpenMP进行并行处理。
  • 优化技术: 包含针对现代加速器(如GPU和MIC)的最先进优化技术。
  • 数据格式: 图以CSR格式存储,使用两个辅助数据结构:row_offsetscolumn_indices

包含的图分析核心

  • Betweenness Centrality (BC)
  • Breadth-First Search (BFS)
  • Connected Components (CC)
  • Minimum Spanning Tree (MST)
  • PageRank (PR)
  • Strongly Connected Components (SCC)
  • Stochastic Gradient Descent (SGD)
  • Sparse Matrix-Vector Multiplication (SpMV)
  • Single-Source Shortest Paths (SSSP)
  • Symmetric Gauss-seidel Smoother (SymGS)
  • Vertex Coloring (VC)

快速开始

  1. 设置CUB库: git submodule update --init --recursive
  2. 设置环境变量: 修改src/common.mk文件。
  3. 构建项目: 使用make命令。
  4. 下载数据集: 从UFSMC或SNAP网站下载。
  5. 运行示例: 如运行BFS示例:./bfs_linear_base mtx ../datasets/soc-LiveJournal1 0 0 0

图格式与来源

  • 支持格式:
    • .mtx (Matrix Market)
    • .gr (9th DIMACS Implementation Challenge)
    • .graph (Metis格式)
  • 数据集来源:
    • The University of Florida Sparse Matrix Collection
    • 10th DIMACS Implementation Challenge
    • Stanford Network Analysis Project
    • 9th DIMACS Implementation Challenge
    • The Koblenz Network Collection
    • Network Data Repository
    • Real-World Input Graphs

引用信息

开发者

  • 主要开发者: Xuhao Chen, Postdoc, MIT
  • 联系方式: cxh@mit.edu

许可证

  • 版权: Copyright (c) 2021, MIT
  • 权限: All rights reserved.
搜集汇总
数据集介绍
GARDENIA 数据集图片
构建方式
GARDENIA(Graph Analytics Repository for Designing Next-generation Accelerators)是一个专为大规模并行加速器上的不规则算法研究而设计的基准测试套件。其构建方式基于对现有通用基准测试套件(如Rodinia和Parboil)在表征不规则工作负载方面局限性的深入分析,从大数据和机器学习领域精心挑选了九种新兴的不规则应用,包括广度优先搜索、单源最短路径、PageRank、随机梯度下降等。每个工作负载均采用OpenMP、CUDA和OpenMP target分别针对多核CPU、GPU和MIC(Xeon Phi)进行并行化实现,并融入了前沿优化技术,如线性映射策略、多级负载均衡、方向优化推拉方法、重排序队列及纹理缓存等,以确保基准程序能真实反映现代数据中心中大规模多线程商业程序的运行特征。
特点
GARDENIA的核心特点在于其高度的不规则性和多样性。与传统的结构化HPC基准程序不同,GARDENIA工作负载展现出显著的分支发散率和内存发散度,其微架构行为与常规程序差异明显。套件涵盖了遍历型(如BFS、SSSP)和顺序移动型(如PageRank、SpMV)两类访问模式,并通过精心选择来自UF稀疏矩阵集合、SNAP数据集集合等的多种输入图(在规模、密度和拓扑上各异,如社交网络和网格图),确保了工作负载与数据集的双重多样性。此外,所有实现均采用最先进的优化技术,而非简单直译的版本,从而更贴近实际应用,为架构研究者提供真实且全面的性能评估基础。
使用方法
GARDENIA的使用方法灵活多样,旨在服务于下一代加速器的架构研究。研究者可直接利用其提供的CPU、GPU和MIC三套实现,在真实硬件上运行基准程序,通过测量执行时间、SIMT利用率、IPC等指标,定位性能瓶颈并探索架构优化方向。对于领域专用加速器设计,GARDENIA可作为真实图分析工作负载的代表,用于指导硬件特化。此外,算法、库和编译器设计者也可将其实现作为参考基线,进行对比评估。套件开源于GitHub,支持自定义输入图,允许用户根据研究需求调整数据集,从而在不同场景下深入理解不规则应用的行为特征。
背景与挑战
背景概述
随着大数据分析与机器学习的蓬勃发展,图计算应用在数据中心中变得日益重要且无处不在。然而,这些应用展现出与传统高性能计算工作负载截然不同的不规则运行时行为,对现有加速器架构设计提出了严峻挑战。为应对这一需求,国防科技大学的徐振、陈旭浩等研究人员于2018年提出了GARDENIA基准测试套件。该套件旨在为下一代加速器架构研究提供专门针对不规则图算法的领域特定基准,填补了此前通用基准套件(如Rodinia、Parboil)不规则性有限、以及现有图分析基准未采用最新优化技术的空白。GARDENIA涵盖了大数据与机器学习领域的新兴不规则应用,能够模拟现代大规模数据中心中运行的海量多线程商业程序,为架构研究者深入理解不规则工作负载的微架构行为提供了标准化评估平台。
当前挑战
GARDENIA所面临的核心挑战可归纳为两点。其一,在领域问题层面,不规则图算法存在严重的负载不均衡与分支发散问题,尤其当处理具有幂律度分布的无标度图时,不同顶点的邻居数量差异巨大,导致线程利用率低下;同时,内存访问模式高度不规则,引发频繁的缓存缺失与内存发散,显著制约了传统并行加速器的性能。其二,在构建过程中,挑战在于如何设计一个兼具代表性、多样性与时效性的基准集:需要从众多图算法中精选出覆盖图遍历、稀疏线性代数、机器学习等领域的典型工作负载,并配以规模、密度、拓扑结构各异的输入数据集,以确保能够全面揭示不同微架构特征。此外,还需集成最新的优化技术(如方向优化BFS、多级负载均衡、顶点重排序等),避免因采用过时的简单实现而误导架构设计方向。
常用场景
经典使用场景
在面向大规模并行加速器的体系结构研究中,GARDENIA被广泛用作评估下一代通用与专用加速器性能的基准测试集。其核心应用场景在于模拟现代数据中心中运行的大数据分析与机器学习应用所呈现的规则不规则计算行为。研究者通过运行GARDENIA中的广度优先搜索、单源最短路径、PageRank等不规则工作负载,结合精心挑选的多样图数据集,能够深入剖析加速器在处理不规则算法时的微架构特征,从而定位性能瓶颈并探索针对性的硬件优化方案。
解决学术问题
GARDENIA主要解决了现有基准测试集在表征不规则工作负载方面的严重不足。传统的通用基准测试集如Rodinia和Parboil主要包含结构化HPC应用,缺乏控制流与数据访问的不规则性;而已有的图分析基准测试集要么未采用最先进的优化技术,要么未针对加速器设计。GARDENIA通过融合前沿的优化策略(如方向优化BFS、多级负载均衡、Push/Pull映射等)并涵盖多样化的不规则应用,为体系结构研究者提供了真实反映现代数据中心不规则应用行为的标准化评估工具,填补了该领域的空白。
衍生相关工作
GARDENIA的提出催生了一系列后续研究工作。在基准测试领域,后续工作借鉴其针对不规则工作负载的设计理念,扩展了覆盖更多应用领域(如图神经网络)的基准集。在加速器设计方面,研究者基于GARDENIA揭示的性能瓶颈,提出了包括处理单元架构优化、内存层次定制以及专用图加速器(如Graphicionado)在内的多种方案。此外,GARDENIA中采用的优化技术(如方向优化BFS和多级负载均衡)被广泛集成到后续的图处理框架(如Gunrock)和商用库(如cuSPARSE)中,成为不规则计算优化的标准范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务