fast.cu

CUDAでゼロから書いたGPUカーネル集で、H100向けの行列積カーネルはcuBLASと同等以上と報告されています。GPU性能を学ぶ参考になります。

Xで共有ライセンス: MIT

概要

fast.cuは、CUDAでゼロから書いたGPUカーネルを集めたリポジトリです。H100でのbf16行列積、GB300でのNVFP4行列積(10段階のカーネル)、H100での総和リダクションが含まれます。READMEによれば、H100の行列積と総和は作者の測定でcuBLASやcubと同等かそれ以上です。各例はmakeでビルドでき、行列積の解説記事も公開されています。

主な特長

  • fp32で累積するH100向けbf16行列積カーネル
  • 10段階のカーネルとベンチ実行環境を持つGB300向けNVFP4行列積
  • 2^30要素を対象にしたH100の総和リダクション
  • makeだけでビルドと実行ができる

こんな人・用途に

GPUの性能改善を学び、読みやすい完成形のカーネルを参考にしたい人向けです。NVFP4の例にはGB300またはB300とCUDA 13.1が必要です。

アップストリーム
pranjalssh/fast.cu
GitHubのフォーク
Guo-astro/fast.cu
アップストリームのスター数
624
カテゴリ
開発者ツールとインフラ
言語
Cuda
ライセンス
MIT
フォーク日
2025-12-09
同期状態
同期済み最終同期 2026-09-29