LLM、Embedding、ASR 與批次任務同時使用 GPU 時,真正困難的不只是部署,而是如何有效治理有限資源。本系列聚焦 Kubernetes 上的 GPU AI 工作負載,從 GPU Discovery、Scheduling、Affinity、Taints、Priority 與 ResourceQuota,延伸到模型推論服務、資源隔離、VRAM 競爭、故障復原與可觀測性,透過實驗與量測建立可重現的 GPU 工作負載治理方法。
先說結論:不是所有 AI 工作負載都需要 Kubernetes。 如果今天只有一台主機、一個模型、一個使用者,Docker Compose 甚至一個 Pytho...
昨天我的結論是:Kubernetes 不會讓 GPU 變多,它真正解決的是多節點、多服務與多種資源之間的治理。 但要驗證這件事,不能一開始就拿一大包 Helm...
昨天我在本地做 preflight 時,結果停在 skipped。我手邊有 kubectl client,但沒有連入可驗證的 NVIDIA GPU Kubern...
昨天我把 Driver、Container Toolkit 與 Device Plugin 的責任分開,並定義了 nvidia.com/gpu 出現前後的實機驗...
Kubernetes 已經能看到 GPU,不代表能像分配 CPU 或記憶體一樣,讓 Pod 申請 1GB、2GB 的 VRAM。透過 NVIDIA device...
Pod 申請 nvidia.com/gpu: 1,只代表需要一個可分配的 GPU 資源,沒有表達 GPU 型號、VRAM 等級、機房位置或本機儲存需求。當叢集只...
前一篇討論「把工作負載送到對的 GPU Node:Label、NodeSelector 與 Affinity」,這篇聚焦「Taints/Tolerations:...
前一篇處理「Taints/Tolerations:別讓一般 Pod 把 GPU 節點吃掉」,這篇進一步討論「Priority 與 Preemption:當 GP...
完成「Priority 與 Preemption:當 GPU 不夠時誰先活」後,下一個問題是「Namespace、Quota 與多團隊治理」能否重跑、否定並留下...