本系列將從系統工程的角度,介紹現代 ML Infrastructure 背後的重要概念,內容涵蓋資料表示與傳輸、分散式執行環境、Execution Engine、資源排程、記憶體管理與 GPU 運算等主題,並延伸至現代模型 Serving。系列透過 Ray、Kubernetes、vLLM 等實際系統作為案例,理解 Data Locality、Backpressure、Task Scheduling、Object Store、Operator Fusion、Parallelism 等核心設計,建立一套能延伸到不同資料與機器學習系統的武功秘笈!
前言 大家好,我是 Vic,很高興又能繼續參加鐵人賽連載,這次是跟隨著我們團隊:源來適愛開緣 一同連載,期望這三十天大家都能開開心心學技術,寫技術文章,將我們源...
昨天我們先建立了整個 AI Infra 的地圖。從 Data Plane、Distributed Runtime、Execution Engine,一路看到 G...
昨天我們跟著一個 AI Request,從 Client 一路經過 Gateway、Routing、Queue、Inference Engine,最後才真正抵達...
前一篇我們談了 Latency、Throughput、QPS、Concurrency,以及 LLM Serving 裡常見的 TTFT、ITL 與 Tokens...
上一篇我們談到,AI Pipeline 的瓶頸經常不在 GPU,而是在 Storage、CPU Preprocessing、Memory Copy 或 Netw...
上一篇我們從儲存格式理解 Parquet。透過 columnar layout、row group、column chunk、encoding 與 compre...
前兩天談的是資料怎麼從 Storage 進到 Memory:Parquet 減少不必要的 I/O,Arrow 減少格式轉換與 Copy。接下來的問題是,資料進入...
Day 07 談到,資料可以用 Block 的形式在 Pipeline 裡逐步往下游流。當 Execution Engine 把這些 Block 分到多台機器,...
上一篇談資料應該離 Compute 多近。不過,就算資料放在正確的 Node,Pipeline 還是可能被另一件事拖垮:上游做得比下游吃得快。 想像一條最簡單的...
Day 09 談到,Pipeline 裡的工作會因為 Queue、Backpressure 與資源限制而被暫停或繼續。接下來要往下問:這些工作最後究竟由誰執行?...