這系列文章分享我碩一學習 AI compiler 旅程,從 RISC-V CPU、NVIDIA GPU 到 Tenstorrent ASIC , 觀察 AI compiler 是扮演什麼樣的角色,在不同硬體架構是如何優化。
大家好我是睿廷,目前是剛升碩二的研究生,碩零的前半年,我做的是 QEMU 模擬器針對 RISC-V 指令加速,讓 x86 主機模擬 RISC-V 架構跑 AI...
目前手邊是用 Banana Pi BPI-F3 的 RISC-V 開發板,它的 SoC 是 SpacemiT K1 ,它有 8 核心、64-bit RISC-V...
昨天看完 SpacemiT K1 的規格,記下了 RV64GCVB、RVA22、RVV 1.0、Vector-256bit、8 cores、cache、LPDD...
前兩天先學硬體和基本 RVV intrinsic,今天開始看要怎麼接進真實推論服務系統 SGLang。今天先看懂一個 RVV attention 後端在 SGL...
昨天看了 SGLang RVV 後端怎麼從 Python 接到 C++。今天先來講 linear / GEMM(General Matrix Multiplic...
昨天看了 linear / GEMM,今天換另一組在 LLM 前向傳播裡常出現的運算子:norm、activation、RoPE。今天會講三個 torch.op...
前幾天看了 attention 後端的 Python 到 C++ 流程,也解釋 linear、norm、activation、RoPE。今天會看 decode...
前面幾天的 SGLang RVV 後端走手寫路線:自己決定 operator boundary,用 C++ / RVV intrinsic 寫 kernel,再...
昨天把 torch.compile 的 CPU pipeline 走過一次,Python 程式先由 TorchDynamo 擷取成一張或多張 FX graph,...
昨天完成 P1–P3,讓 TorchInductor 能選到 VecRVV,BF16 Linear 有 M=1 和 M>=2 microkernel,靜態...