fast.cu
CUDAでゼロから書いたGPUカーネル集で、H100向けの行列積カーネルはcuBLASと同等以上と報告されています。GPU性能を学ぶ参考になります。
Xで共有ライセンス: MIT
概要
fast.cuは、CUDAでゼロから書いたGPUカーネルを集めたリポジトリです。H100でのbf16行列積、GB300でのNVFP4行列積(10段階のカーネル)、H100での総和リダクションが含まれます。READMEによれば、H100の行列積と総和は作者の測定でcuBLASやcubと同等かそれ以上です。各例はmakeでビルドでき、行列積の解説記事も公開されています。
主な特長
- fp32で累積するH100向けbf16行列積カーネル
- 10段階のカーネルとベンチ実行環境を持つGB300向けNVFP4行列積
- 2^30要素を対象にしたH100の総和リダクション
- makeだけでビルドと実行ができる
こんな人・用途に
GPUの性能改善を学び、読みやすい完成形のカーネルを参考にしたい人向けです。NVFP4の例にはGB300またはB300とCUDA 13.1が必要です。
- アップストリーム
- pranjalssh/fast.cu
- GitHubのフォーク
- Guo-astro/fast.cu
- アップストリームのスター数
- 627
- カテゴリ
- 開発者ツールとインフラ
- 言語
- Cuda
- ライセンス
- MIT
- フォーク日
- 2025-12-09
- 同期状態
- 同期済み最終同期 2026-10-10
同じカテゴリ: 開発者ツールとインフラ
互換性のある技術要素を組み合わせてフルスタックのひな型を作り、初期設定と連携作業を減らします。CLI、ブラウザのビルダー、MCPサーバーから利用できます。
フォーク日 2026-10-09最終同期 2026-10-10ライセンス: MIT開発者ツールとインフラGitHub
WindowsやLinuxのアプリに、画像を外部へ送らずに顔検出、顔の特徴点抽出、顔比較を追加するためのPython SDKです。
フォーク日 2026-10-09最終同期 2026-10-10ライセンス表記なし開発者ツールとインフラGitHub
macOS向けの全ディスク検索で、名前検索を高速化し、入力ミスを許容し、インデックス化したファイル内容も検索できます。CLIやRustクレートで利用できます。
フォーク日 2026-10-08最終同期 2026-10-10ライセンス: MIT開発者ツールとインフラGitHub
エージェントでアプリとバイナリを調べ、機能の仕組みと証拠を確認するためのツールです
フォーク日 2026-10-08最終同期 2026-10-10ライセンス: MIT開発者ツールとインフラGitHub