身為開發 AI agent 與負責地端/雲端服務的維運者, 記錄實際踩雷過的 K8s 學習之路, 從「Agent 為什麼與 K8s 有關」視角出發的個人學習筆記.
內容:
1) 為什麼 AI agent 需要知道 K8s,
2) AI infra(的資源規劃,
3) 沒碰過 K8s 的 AI 工程師該怎麼起步,
4) 部署一個 AI app 到底該選哪種雲端 K8s (GCP, Azure, 以及其他雲端該怎麼取捨).
其中幾篇會以採用 OpenAB 自架的 agent 團隊為實例, 試著記錄 AI 工程師從「初探」到「能架設/觀察」的過程.
前十天講的是「為什麼」:agent 系統為什麼會撞上 container,資源為什麼要規劃。從今天開始進入「怎麼學」。 我不是 K8s 專家。這條路徑是我自己...
昨天說學習路徑的第 2 步是「本機起一個真的叢集」。今天動手:在一台 Ubuntu VM 上裝 k3s。 我選 k3s 而不是 minikube,原因很單純:...
昨天叢集起來了,今天把一隻真的 bot 搬進去。 我拿 OpenAB 艦隊裡最單純的一隻當例子:它是一個長駐的 bot 容器,需要幾個 token(機密)、幾...
昨天 kubectl apply 之後,如果沒看到 Running,最常見的就是 CrashLoopBackOff。 這個狀態的意思很直白:容器起來、掛掉、K...
POV:bot 終於在 k3s 裡 Running 了,你習慣性敲 docker stats,卻發現叢集裡的東西 Docker 一個都看不到,你連它現在吃多少...
POV:你剛把一隻 bot 搬進 k3s、也修好了 CrashLoopBackOff,正想把手上其他東西全搬上去,然後想起那台 Spot VM 上的 comp...
POV:你手上有一個跑在 Spot VM 上的 web 服務,機器隨時可能被收回,Cloud Run 的文件看起來就是為你寫的,你已經打開 console 準...
POV:早上打開終端,Tailscale 連得上、docker ps 全綠,你鬆一口氣,然後 tmux attach 進去發現昨晚那幾個 agent sess...