這系列文章分享我碩一學習 AI compiler 旅程,從 RISC-V CPU、NVIDIA GPU 到 Tenstorrent ASIC , 觀察 AI compiler 是扮演什麼樣的角色,在不同硬體架構是如何優化。
今天來複習從 Day11 到 Day19,我們從 GPU 硬體出發,認識 CUDA 與幾種 kernel 開發介面,再沿著一個 Triton 矩陣乘法一路打開...
最開始十天都在 RISC-V CPU 上打轉,從 RVV intrinsic、SGLang RVV 後端走到 torch.compile 和 PyTorch I...