fast.cu
从零用CUDA编写的GPU内核集合,其中H100矩阵乘法内核据称性能持平或超过cuBLAS,可作为学习GPU性能优化的参考。
分享到 X许可证: MIT
概述
fast.cu 是一组从零用 CUDA 编写的 GPU 内核,包含 H100 上的 bf16 矩阵乘法、GB300 上带十个内核快照的 NVFP4 矩阵乘法,以及 H100 上的求和归约。README 称在其测试中,H100 的矩阵乘法和求和内核达到或超过 cuBLAS 与 cub。每个示例都可用 make 构建,并附有讲解矩阵乘法的文章。
主要特点
- H100 bf16 矩阵乘法内核,fp32 累加
- GB300 NVFP4 矩阵乘法,含十个内核快照和基准工具
- H100 上对 2^30 个元素求和
- 用 make 即可构建并运行各示例
适用场景
适合学习 GPU 性能优化、想研读完整易读内核的人。NVFP4 示例需要 GB300 或 B300 以及 CUDA 13.1。
- 上游仓库
- pranjalssh/fast.cu
- GitHub 上的 fork
- Guo-astro/fast.cu
- 上游 Star 数
- 627
- 分类
- 开发者工具与基础设施
- 编程语言
- Cuda
- 许可证
- MIT
- Fork 时间
- 2025-12-09
- 同步状态
- 已同步上次同步 2026-10-11
同分类更多: 开发者工具与基础设施
将兼容的技术组件组合成全栈项目脚手架,减少配置和集成工作。可通过 CLI、浏览器构建器或 MCP 服务器生成项目。
Fork 时间 2026-10-09上次同步 2026-10-11许可证: MIT开发者工具与基础设施GitHub
一个用于在 Windows 和 Linux 应用中集成本地人脸检测、特征点提取和人脸比对的 Python SDK,图像无需离开设备。
Fork 时间 2026-10-09上次同步 2026-10-11未声明许可证开发者工具与基础设施GitHub
macOS上的全盘文件搜索工具,可快速按名称定位文件,容忍拼写错误,并搜索已建立索引的文件内容。适合通过CLI或Rust crate进行本地桌面搜索。
Fork 时间 2026-10-08上次同步 2026-10-11许可证: MIT开发者工具与基础设施GitHub
用代理分析应用和二进制,确认功能原理与证据,复刻类似能力。
Fork 时间 2026-10-08上次同步 2026-10-11许可证: MIT开发者工具与基础设施GitHub