iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
Kubernetes

Kubernetes GPU 工作負載工程:排程、資源隔離、推論服務與可觀測性 系列

LLM、Embedding、ASR 與批次任務同時使用 GPU 時,真正困難的不只是部署,而是如何有效治理有限資源。本系列聚焦 Kubernetes 上的 GPU AI 工作負載,從 GPU Discovery、Scheduling、Affinity、Taints、Priority 與 ResourceQuota,延伸到模型推論服務、資源隔離、VRAM 競爭、故障復原與可觀測性,透過實驗與量測建立可重現的 GPU 工作負載治理方法。

參賽天數 9 天 | 共 9 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文
DAY 1

Day 01|為什麼 AI 工作負載需要 Kubernetes?從單機實驗到可治理的 GPU 平台

先說結論:不是所有 AI 工作負載都需要 Kubernetes。 如果今天只有一台主機、一個模型、一個使用者,Docker Compose 甚至一個 Pytho...

2026-09-15 ‧ 由 jackwu 分享
DAY 2

Day 02|GPU Kubernetes 參考架構:Node、Runtime、Storage 與 Model Serving

昨天我的結論是:Kubernetes 不會讓 GPU 變多,它真正解決的是多節點、多服務與多種資源之間的治理。 但要驗證這件事,不能一開始就拿一大包 Helm...

2026-09-16 ‧ 由 jackwu 分享
DAY 3

Day 03|把 GPU 變成 Kubernetes Resource:Driver、Toolkit 與 Device Plugin

昨天我在本地做 preflight 時,結果停在 skipped。我手邊有 kubectl client,但沒有連入可驗證的 NVIDIA GPU Kubern...

2026-09-17 ‧ 由 jackwu 分享
DAY 4

Day 04|Kubernetes 看得到 GPU 之後,Scheduler 到底看到了什麼

昨天我把 Driver、Container Toolkit 與 Device Plugin 的責任分開,並定義了 nvidia.com/gpu 出現前後的實機驗...

2026-09-18 ‧ 由 jackwu 分享
DAY 5

Day 05|GPU Request 的第一個限制:一張卡不是 1GB、2GB 這樣分

Kubernetes 已經能看到 GPU,不代表能像分配 CPU 或記憶體一樣,讓 Pod 申請 1GB、2GB 的 VRAM。透過 NVIDIA device...

2026-09-19 ‧ 由 jackwu 分享
DAY 6

Day 06|把工作負載送到對的 GPU Node:Label、NodeSelector 與 Affinity

Pod 申請 nvidia.com/gpu: 1,只代表需要一個可分配的 GPU 資源,沒有表達 GPU 型號、VRAM 等級、機房位置或本機儲存需求。當叢集只...

2026-09-20 ‧ 由 jackwu 分享
DAY 7

Day 07|Taints/Tolerations:別讓一般 Pod 把 GPU 節點吃掉

前一篇討論「把工作負載送到對的 GPU Node:Label、NodeSelector 與 Affinity」,這篇聚焦「Taints/Tolerations:...

2026-09-21 ‧ 由 jackwu 分享
DAY 8

Day 08|Priority 與 Preemption:當 GPU 不夠時誰先活

前一篇處理「Taints/Tolerations:別讓一般 Pod 把 GPU 節點吃掉」,這篇進一步討論「Priority 與 Preemption:當 GP...

2026-09-22 ‧ 由 jackwu 分享
DAY 9

Day 09|Namespace、Quota 與多團隊治理

完成「Priority 與 Preemption:當 GPU 不夠時誰先活」後,下一個問題是「Namespace、Quota 與多團隊治理」能否重跑、否定並留下...

2026-09-23 ‧ 由 jackwu 分享