AI 模型背後的運算,最終都要落到 GPU 上執行。這 30 天將從 CUDA 零基礎出發,透過 GPU coding challenges 實作 Vector Add、Reduction、Matrix Multiplication 等 Kernel,逐步學習 Thread、Block、Warp、Memory Hierarchy、Shared Memory、Coalescing、Tiling 與 Kernel Fusion。除了讓 Kernel 正確執行,也會使用 profiling 與 benchmark 找出效能瓶頸,實際挑戰 LeetGPU、GPU Puzzles 與 GPU MODE,
30 天 GPU LeetCode 挑戰:從 CUDA 新手到 Kernel Leaderboard 平常使用 PyTorch 訓練模型時,只要把 Tens...
昨天先把第一個 CUDA 程式跑起來之後,今天想把「GPU 到底怎麼執行這些程式」補起來。 一開始看 CUDA Programming Guide,很容易被 k...
30 天 GPU LeetCode 挑戰:從 CUDA 新手到 Kernel Leaderboard Day 1 把一段 CPU 程式搬上 GPU,Day...