遇见数据集

zerogpu-blackwell-wheels

收藏
Hugging Face2026-05-29 更新2026-05-30 收录
官方服务:

资源简介:

该数据集是一个专门为NVIDIA Blackwell (sm_120) GPU架构预编译的CUDA扩展包(wheel文件)集合。由于PyPI官方仓库目前未为大多数此类库提供针对sm_120架构的预编译包,且Hugging Face ZeroGPU Spaces在启动时无法进行本地编译,因此本数据集旨在为在这些环境中运行的项目提供可直接安装的二进制依赖。数据集涵盖了多个深度学习与计算机视觉领域常用的、需要编译的PyTorch扩展库,包括torchmcubes、nvdiffrast、diff_gaussian_rasterization、xformers、pytorch3d以及flash-attn的两个版本(2.8.3和2.7.4.post1)。这些包针对12种不同的PyTorch、CUDA和Python版本组合进行了构建(例如pt212-cu130-cp313代表PyTorch 2.12、CUDA 13.0、Python 3.13),确保了跨版本兼容性。每个构建单元不仅包含成功的wheel文件,还附带了完整的构建日志和源代码引用,以供审计。用户可以通过提供的URL模板,在项目的`requirements.txt`中直接指定对应版本的包链接进行安装。

This dataset is a collection of CUDA extension packages (wheel files) pre-compiled exclusively for the NVIDIA Blackwell (sm_120) GPU architecture. As the official PyPI repository currently does not offer pre-compiled packages for the sm_120 architecture for most such libraries, and Hugging Face ZeroGPU Spaces cannot perform local compilation upon startup, this dataset is designed to provide directly installable binary dependencies for projects running in these environments. The dataset covers a range of widely used PyTorch extension libraries in the fields of deep learning and computer vision that require compilation, including torchmcubes, nvdiffrast, diff_gaussian_rasterization, xformers, pytorch3d, and two versions of flash-attn (2.8.3 and 2.7.4.post1). These packages are built for 12 distinct combinations of PyTorch, CUDA, and Python versions (e.g., pt212-cu130-cp313 denotes PyTorch 2.12, CUDA 13.0, and Python 3.13), ensuring cross-version compatibility. Each build unit not only contains the successful wheel files but also includes complete build logs and source code references for auditing purposes. Users can directly specify the package link of the corresponding version in the project's `requirements.txt` for installation via the provided URL template.

创建时间:
2026-05-28
原始信息汇总

ZeroGPU Blackwell (sm_120) Wheels 数据集详情

数据集简介

该数据集提供专为 Blackwell (sm_120) 架构构建的 CUDA 扩展 wheel 包。由于 PyPI 目前未发布适用于 sm_120 的 wheel,且 ZeroGPU Spaces 无法在启动时编译,因此 Spaces 应直接从该数据集的 URL 中引用 wheel 文件。

使用方式

URL 模板格式如下:

https://huggingface.co/datasets/multimodalart/zerogpu-blackwell-wheels/resolve/main/wheels/<TAG>/<wheel-filename>

示例(torch 2.12 / cu130 / py3.13 环境,需要 xformers):

https://huggingface.co/datasets/multimodalart/zerogpu-blackwell-wheels/resolve/main/wheels/pt212-cu130-cp313/xformers-0.0.34+3da0fc92.d20260528-cp39-abi3-linux_x86_64.whl

构建矩阵

数据集共包含 12 个标签(tag),每个标签对应特定的 PyTorch 版本、CUDA 版本和 Python 版本组合。每个标签下均构建以下 7 个库的 wheel 包(全部为 ✅ 成功状态):

标签 torchmcubes nvdiffrast diff_gaussian_rasterization xformers pytorch3d flash_attn 2.8.3 flash_attn 2.7.4.post1
pt212-cu130-cp313
pt28-cu128-cp310
pt212-cu130-cp312
pt212-cu130-cp310
pt211-cu130-cp313
pt211-cu130-cp312
pt210-cu130-cp312
pt210-cu128-cp310
pt291-cu128-cp310
pt28-cu128-cp311
pt28-cu128-cp312
pt212-cu130-cp311

注意事项

  • flash-attn:每个标签同时提供 2.8.32.7.4.post1 两个版本,编译时指定 FLASH_ATTN_CUDA_ARCHS=120 以跳过未使用的 sm 架构,构建时间缩短约 5 倍。
  • xformers:针对 torch ≥ 2.10 使用 v0.0.34 版本(稳定 ABI),针对 torch 2.8/2.9 回退至 v0.0.33.post2(因缺乏 torch/csrc/stable/*.h)。当前 master 分支在 OSS 路径上存在问题,提交 c04f47b6memory_efficient_attention 限制在 Meta 内部包中。
  • torchmcubes:使用 scikit-build-core 后端,构建 venv 通过 uv 引导 pip 以确保后端正常解析。
  • 跳过的标签pt212-cu128-cp310pt211-cu128-cp310 因上游 PyTorch 索引未发布 cu128 版本的 wheel(仅 2.8–2.10 支持 cu128),故未构建。
  • 审计支持:每个标签文件夹还包含 <lib>.log(完整构建输出)和 <lib>.ref(构建时源代码的 git 标签)文件,便于审查 wheel 的构建过程。
搜集汇总
数据集介绍
zerogpu-blackwell-wheels 数据集图片
构建方式
该数据集针对NVIDIA Blackwell架构(sm_120)的GPU,系统性地构建了多个CUDA扩展库的预编译wheel文件。鉴于PyPI官方尚未发布sm_120轮子,而ZeroGPU Spaces又无法在启动时编译代码,作者通过预编译方式填补了这一空白。构建矩阵覆盖了从PyTorch 2.8至2.12、CUDA 12.8至13.0以及Python 3.10至3.13的丰富组合,为每个单元内的七个核心库(如xformers、flash-attention、pytorch3d等)编译了相应wheel。编译过程中对flash-attention通过指定FLASH_ATTN_CUDA_ARCHS=120跳过了四个不用的sm架构,大幅缩短了构建时间至原来的五分之一左右。此外,每个单元文件夹还提供了构建日志(.log)和源码引用(.ref)文件,以便用户审计每个wheel的生成细节。
使用方法
用户可通过直接URL引用方式,将数据集中的wheel文件快速集成到Python项目中。具体而言,在requirements.txt或依赖安装指令中,使用固定URL模板指定对应的TAG和wheel文件名即可完成安装。例如,对于一个需要xformers且运行在torch 2.12、cu130、py3.13环境下的Space,可直接引用形如https://huggingface.co/datasets/multimodalart/zerogpu-blackwell-wheels/resolve/main/wheels/pt212-cu130-cp313/xformers-0.0.34+3da0fc92.d20260528-cp39-abi3-linux_x86_64.whl的链接。数据集提供了完整的CSV附录,列举了所有TAG、库名、状态及对应的wheel文件名,用户可据此检索所需组合,并跳过不支持的组合(如pt212-cu128-cp310因上游未发布对应wheel而被跳过)。
背景与挑战
背景概述
随着NVIDIA Blackwell架构的发布,其对应的计算能力sm_120为高性能计算与深度学习领域带来了新的机遇。然而,PyPI等主流包管理平台尚未及时为这一新架构发布适配的CUDA扩展轮子文件,导致在Blackwell GPU上运行前沿的PyTorch应用面临严重的软件栈兼容性瓶颈。针对这一空白,由multimodalart团队于近期创建的zerogpu-blackwell-wheels数据集,系统性地提供了针对sm_120架构预编译的CUDA扩展库轮子,涵盖xformers、flash-attention、pytorch3d等关键组件。该数据集直接服务于Hugging Face ZeroGPU Spaces平台,解决了该平台在启动时无法即时编译原生扩展的痛点,为在Blackwell GPU上无缝部署和运行复杂的深度学习推理任务奠定了坚实基础,对推动生成式AI与3D视觉实验的快速迭代具有重要价值。
当前挑战
该数据集所应对的核心挑战在于,新兴的Blackwell GPU架构缺乏来自上游官方渠道(如PyPI)的预编译轮子支持,这导致依赖复杂CUDA扩展的深度学习框架无法直接在该硬件上顺利运行。数据集的构建过程同样充满荆棘:首先,需要为多个流行的CUDA扩展库(如xformers、flash-attention)逐一解决针对sm_120的编译问题,例如xformers的v0.0.34版本在开源路径上存在因依赖Meta内部包而构建失败的问题;其次,要构建一个覆盖多种PyTorch版本、CUDA工具包版本及Python版本的庞大轮子矩阵,并面临上游PyTorch未发布特定cu128版本轮子(如torch 2.11/2.12)导致的组合缺失,需进行细致的版本适配与跳过处理。
常用场景
经典使用场景
在深度学习与高性能计算领域,NVIDIA Blackwell架构(sm_120)的推出为模型训练与推理带来了新的算力飞跃。然而,PyPI官方仓库尚未广泛发布针对Blackwell架构预编译的CUDA扩展轮子包,导致开发者在使用最新GPU进行实验时面临编译环境搭建的障碍。zerogpu-blackwell-wheels数据集应运而生,它直接提供了一系列关键CUDA扩展库的预编译wheel文件,囊括了xformers、flash-attention、pytorch3d等核心组件。用户仅需在requirements.txt中指向数据集直链,即可零编译地部署复杂的深度学习流水线,尤其适合ZeroGPU Spaces这类无法在启动时执行编译的云计算场景,极大地降低了使用Blackwell架构的技术门槛。
解决学术问题
该数据集精准回应了学术研究中长期存在的一个痛点:前沿GPU架构与主流深度学习库之间的生态适配滞后问题。在Blackwell算力发布初期,研究者常因缺少现成的CUDA扩展包而被迫手动编译底层库,这一过程耗时且极易受环境依赖冲突影响。zerogpu-blackwell-wheels通过预编译多种版本组合(覆盖PyTorch 2.8至2.12、CUDA 12.8与13.0以及Python 3.10至3.13),让学者能即刻聚焦于模型创新与算法验证。其意义在于将算力硬件升级与软件生态之间的鸿沟化为坦途,推动了生成式AI、三维视觉及长序列建模等方向的研究节奏,加速了Blackwell架构在学术界的普及。
实际应用
在实际应用层面,该数据集为部署在Hugging Face ZeroGPU Spaces上的交互式AI应用提供了关键支撑。无论是运行需要高效注意力机制的对话模型、利用nvdiffrast实现实时神经渲染的图形学demo,还是借助diff_gaussian_rasterization完成三维高斯泼溅的场景重建任务,开发人员均可直接引用数据集中的wheel链接,在Blackwell GPU上实现秒级启动。此外,企业级推理服务中,该数据集免去了为每个客户环境定制编译流程的繁琐,使得大规模模型服务能够快速迁移至最新的NVIDIA硬件平台,从而降低运维成本并提升响应效率。
数据集最近研究
最新研究方向
围绕NVIDIA Blackwell架构(sm_120)的CUDA扩展预编译生态建设,是当前深度学习推理与训练领域的前沿方向。该数据集聚焦于为ZeroGPU平台提供xformers、flash_attn、pytorch3d等核心库的预编译wheel,弥补了PyPI官方对Blackwell架构支持的空缺。这一举措在HuggingFace Spaces等无服务器GPU推理场景中具有里程碑意义,开发者无需在启动时重新编译即可无缝部署基于Blackwell的现代化模型。通过为torch 2.8至2.12及cu128/130多版本矩阵提供预编译包,数据集显著降低了AI应用的部署门槛,加速了Blackwell架构在生成式AI、3D渲染和高效注意力机制等热点技术栈中的落地。其意义不仅在于工程便利性,更推动了社区从依赖官方发行版向边缘自制wheel的协作模式转变,为下一代GPU算力的普及奠定了坚实基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务