『 凌晨四點不一定要吃牛肉麵,玩一下 Kubernetes 也不錯 』
這個系列以 DRA 正式釋出為契機,想用三十天研究 Kubernetes X GPU X AI Infra。
內容將涵蓋 GPU 怎麼進到容器裡、DRA 動態資源配置、排程、高效能網路、推論引擎、KV cache、閘道與服務平台等技術,透過三十天希望能產出屬於我的筆記。
這三十天會用兩套叢集做實驗:假卡驗機制,真卡驗效果。
前面三天都是外掛的解法:Kueue 用額度擋在門口,Volcano 換一套排程器,KAI 用佇列和可搶佔性。今天問的是另一個問題:Kubernetes 自己打算...
過去幾天都在講 Kubernetes 怎麼把 GPU 交到 Pod 手上。 一部分是怎麼描述和切分:device plugin 讓 Kubernetes 認得...
AI 模型的訓練和推論都吃 GPU,而一座 GPU 叢集要分給很多人用,這件事在雲原生的世界裡是用 Kubernetes 解的。但同樣的問題,大學和研究機構的運...
訓練從來不是一張卡的事。每張卡各算自己那一份,算完要把梯度湊起來,湊完才能走下一步。所以今天換一個問題:卡跟卡之間怎麼講話。 順序由近到遠,分三層: 這...
這個系列在 Day 2 時曾經講過 AI Infra 的基礎知識,包括為什麼需要 KV cache、prefill 和 decode 差在哪、vLLM 是拿來做...
昨天把 vLLM 當黑盒子在用:開機吃掉 91.4% 的記憶體,KV 池 25.13 GiB。 今天打開盒子,看裡面三個東西在做什麼。它們都叫「引擎優化」,但代...
前兩天都在 vLLM 上打轉:開機吃掉 91.4% 的記憶體、用分頁管 KV cache、用量化把權重壓到 5.20 GiB。 今天換一個引擎玩玩,SGLang...
Day15 的最後我們觀察到:同一份權重第一次載要 166 秒,第二次只要 3 秒,差 52 倍,而差別只在權重有沒有留在 PVC 上。 今天會走一次完整的冷啟...
Day 2 的最後我們提到,vLLM 在 Kubernetes 上是以一個 Pod 為單位運行,理論上應該要以 Deployment 去部署,而那也是 pref...
Day 18 的最後,我們把 vLLM 的冷啟動從 526.9 秒壓到 41.8 秒。冷啟動指的是 vLLM 被啟動之後,要先把模型權重讀進 GPU、做完編譯準...