本系列將從系統工程的角度,介紹現代 ML Infrastructure 背後的重要概念,內容涵蓋資料表示與傳輸、分散式執行環境、Execution Engine、資源排程、記憶體管理與 GPU 運算等主題,並延伸至現代模型 Serving。系列透過 Ray、Kubernetes、vLLM 等實際系統作為案例,理解 Data Locality、Backpressure、Task Scheduling、Object Store、Operator Fusion、Parallelism 等核心設計,建立一套能延伸到不同資料與機器學習系統的武功秘笈!
上一篇我們談到 task:一份工作可以先交給 runtime,再由 scheduler 找到合適的 worker 執行。但這馬上產生一個問題:task 交出去的...