iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Engineering

模型之外:30 天搞懂 AI Infrastructure 系列

本系列將從系統工程的角度,介紹現代 ML Infrastructure 背後的重要概念,內容涵蓋資料表示與傳輸、分散式執行環境、Execution Engine、資源排程、記憶體管理與 GPU 運算等主題,並延伸至現代模型 Serving。系列透過 Ray、Kubernetes、vLLM 等實際系統作為案例,理解 Data Locality、Backpressure、Task Scheduling、Object Store、Operator Fusion、Parallelism 等核心設計,建立一套能延伸到不同資料與機器學習系統的武功秘笈!

參賽天數 11 天 | 共 11 篇文章 | 9 人訂閱 訂閱系列文 RSS系列文 團隊源來適愛開緣
DAY 1

Day 1 | AI Infra 到底是什麼?

前言 大家好,我是 Vic,很高興又能繼續參加鐵人賽連載,這次是跟隨著我們團隊:源來適愛開緣 一同連載,期望這三十天大家都能開開心心學技術,寫技術文章,將我們源...

2026-08-17 ‧ 由 Vic 分享
DAY 2

Day 2 | 一個 AI Request 背後到底發生了什麼?

昨天我們先建立了整個 AI Infra 的地圖。從 Data Plane、Distributed Runtime、Execution Engine,一路看到 G...

2026-08-18 ‧ 由 Vic 分享
DAY 3

Day 3 | Latency、Throughput、QPS 到底差在哪?

昨天我們跟著一個 AI Request,從 Client 一路經過 Gateway、Routing、Queue、Inference Engine,最後才真正抵達...

2026-08-19 ‧ 由 Vic 分享
DAY 4

Day 4 | AI 系統的瓶頸,為什麼常常不是 GPU?

前一篇我們談了 Latency、Throughput、QPS、Concurrency,以及 LLM Serving 裡常見的 TTFT、ITL 與 Tokens...

2026-08-20 ‧ 由 Vic 分享
DAY 5

Day 5 | Row-based vs Columnar:為什麼 Parquet 適合 ML?

上一篇我們談到,AI Pipeline 的瓶頸經常不在 GPU,而是在 Storage、CPU Preprocessing、Memory Copy 或 Netw...

2026-08-21 ‧ 由 Vic 分享
DAY 6

Day 6 | Apache Arrow 與 Zero-Copy 到底在解決什麼?

上一篇我們從儲存格式理解 Parquet。透過 columnar layout、row group、column chunk、encoding 與 compre...

2026-08-22 ‧ 由 Vic 分享
DAY 7

Day 7 | Batch Processing、Stream Processing、Streaming Execution 差在哪?

前兩天談的是資料怎麼從 Storage 進到 Memory:Parquet 減少不必要的 I/O,Arrow 減少格式轉換與 Copy。接下來的問題是,資料進入...

2026-08-23 ‧ 由 Vic 分享
DAY 8

Day 8 | Data Locality:為什麼搬資料這麼昂貴?

Day 07 談到,資料可以用 Block 的形式在 Pipeline 裡逐步往下游流。當 Execution Engine 把這些 Block 分到多台機器,...

2026-08-24 ‧ 由 Vic 分享
DAY 9

Day 9 | Backpressure:資料跑太快為什麼也會出問題?

上一篇談資料應該離 Compute 多近。不過,就算資料放在正確的 Node,Pipeline 還是可能被另一件事拖垮:上游做得比下游吃得快。 想像一條最簡單的...

2026-08-25 ‧ 由 Vic 分享
DAY 10

Day 10 | Thread、Process、Task、Actor 到底差在哪?

Day 09 談到,Pipeline 裡的工作會因為 Queue、Backpressure 與資源限制而被暫停或繼續。接下來要往下問:這些工作最後究竟由誰執行?...

2026-08-26 ‧ 由 Vic 分享