torch.compile 一行就能讓模型加速,但沒人告訴你背後發生了什麼。本系列用 30 天拆解 PyTorch 編譯器的三層架構:Dynamo 怎麼捕獲 Python、AOTAutograd 怎麼生成 backpropagation、Inductor 怎麼產出 GPU kernel。這個系列會直接深入原始碼、用簡單易懂的圖來幫助理解,把黑盒子打開給你看。讀完你會知道它什麼時候快、為什麼慢以及怎麼修。
前言 昨天把 fusion 的邊界走完了,Scheduler 手上是一串融合好的 node。接下來是產線的最後一站 codegen,把每一組 node 寫成 G...
前言 昨天看完 GPU 這條線,融好的 node 被寫成一份份 Triton kernel。codegen 是整條產線唯一分流的地方,前面的步驟全部共用,最後一...