fast.cu

从零用CUDA编写的GPU内核集合,其中H100矩阵乘法内核据称性能持平或超过cuBLAS,可作为学习GPU性能优化的参考。

分享到 X许可证: MIT

概述

fast.cu 是一组从零用 CUDA 编写的 GPU 内核,包含 H100 上的 bf16 矩阵乘法、GB300 上带十个内核快照的 NVFP4 矩阵乘法,以及 H100 上的求和归约。README 称在其测试中,H100 的矩阵乘法和求和内核达到或超过 cuBLAS 与 cub。每个示例都可用 make 构建,并附有讲解矩阵乘法的文章。

主要特点

  • H100 bf16 矩阵乘法内核,fp32 累加
  • GB300 NVFP4 矩阵乘法,含十个内核快照和基准工具
  • H100 上对 2^30 个元素求和
  • 用 make 即可构建并运行各示例

适用场景

适合学习 GPU 性能优化、想研读完整易读内核的人。NVFP4 示例需要 GB300 或 B300 以及 CUDA 13.1。

上游仓库
pranjalssh/fast.cu
GitHub 上的 fork
Guo-astro/fast.cu
上游 Star 数
624
分类
开发者工具与基础设施
编程语言
Cuda
许可证
MIT
Fork 时间
2025-12-09
同步状态
已同步上次同步 2026-09-29