iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
Kubernetes

凌晨四點,女友帶著 GPU 來我家學習 Kubernetes:打造 K8s AI Infra 的 30 夜 系列

『 凌晨四點不一定要吃牛肉麵,玩一下 Kubernetes 也不錯 』

這個系列以 DRA 正式釋出為契機,想用三十天研究 Kubernetes X GPU X AI Infra。

內容將涵蓋 GPU 怎麼進到容器裡、DRA 動態資源配置、排程、高效能網路、推論引擎、KV cache、閘道與服務平台等技術,透過三十天希望能產出屬於我的筆記。

這三十天會用兩套叢集做實驗:假卡驗機制,真卡驗效果。

參賽天數 20 天 | 共 20 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文
DAY 11

【Day 11】原生 gang scheduling:Kubernetes 自己的答案

前面三天都是外掛的解法:Kueue 用額度擋在門口,Volcano 換一套排程器,KAI 用佇列和可搶佔性。今天問的是另一個問題:Kubernetes 自己打算...

2026-09-25 ‧ 由 minny 分享
DAY 12

【Day 12】KubeRay:當 Kubernetes 轉角遇見 Ray

過去幾天都在講 Kubernetes 怎麼把 GPU 交到 Pod 手上。 一部分是怎麼描述和切分:device plugin 讓 Kubernetes 認得...

2026-09-26 ‧ 由 minny 分享
DAY 13

【Day 13】Slinky:當 HPC 的老將 Slurm 走進 Kubernetes

AI 模型的訓練和推論都吃 GPU,而一座 GPU 叢集要分給很多人用,這件事在雲原生的世界裡是用 Kubernetes 解的。但同樣的問題,大學和研究機構的運...

2026-09-27 ‧ 由 minny 分享
DAY 14

【Day 14】GPU 高效能網路:從節點內到跨節點,再到 Kubernetes

訓練從來不是一張卡的事。每張卡各算自己那一份,算完要把梯度湊起來,湊完才能走下一步。所以今天換一個問題:卡跟卡之間怎麼講話。 順序由近到遠,分三層: 這...

2026-09-28 ‧ 由 minny 分享
DAY 15

【Day 15】Kubernetes 上的 vLLM:從 KV cache 到 prefill 與 decode

這個系列在 Day 2 時曾經講過 AI Infra 的基礎知識,包括為什麼需要 KV cache、prefill 和 decode 差在哪、vLLM 是拿來做...

2026-09-29 ‧ 由 minny 分享
DAY 16

【Day 16】vLLM 的引擎優化:量化、PagedAttention、推測解碼

昨天把 vLLM 當黑盒子在用:開機吃掉 91.4% 的記憶體,KV 池 25.13 GiB。 今天打開盒子,看裡面三個東西在做什麼。它們都叫「引擎優化」,但代...

2026-09-30 ‧ 由 minny 分享
DAY 17

【Day 17】從 vLLM 遷移到 SGLang:RadixAttention 怎麼運作的

前兩天都在 vLLM 上打轉:開機吃掉 91.4% 的記憶體、用分頁管 KV cache、用量化把權重壓到 5.20 GiB。 今天換一個引擎玩玩,SGLang...

2026-10-01 ‧ 由 minny 分享
DAY 18

【Day 18】都快下班了,服務怎麼還沒跑起來:Kubernetes 上 vLLM 的冷啟動與優化

Day15 的最後我們觀察到:同一份權重第一次載要 166 秒,第二次只要 3 秒,差 52 倍,而差別只在權重有沒有留在 PVC 上。 今天會走一次完整的冷啟...

2026-10-02 ‧ 由 minny 分享
DAY 19

【Day 19】Kubernetes LeaderWorkerSet 與 DisaggregatedSet

Day 2 的最後我們提到,vLLM 在 Kubernetes 上是以一個 Pod 為單位運行,理論上應該要以 Deployment 去部署,而那也是 pref...

2026-10-03 ‧ 由 minny 分享
DAY 20

【Day 20】HPA 與 KEDA:Kubernetes 上誰在指揮 Pod 擴縮

Day 18 的最後,我們把 vLLM 的冷啟動從 526.9 秒壓到 41.8 秒。冷啟動指的是 vLLM 被啟動之後,要先把模型權重讀進 GPU、做完編譯準...

2026-10-04 ‧ 由 minny 分享