iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
Kubernetes

從看得到到看得懂:30 天在自架 K8s 上實踐可觀測性與告警 系列

「你的服務怎麼監控?」面試被問到,我只答得出「看 log 有沒有 error」。事後查了資料,Grafana、SLO 這些名詞認得了,監控和可觀測性差在哪還是講不清楚。

一開始不碰工具,先講清楚 SLI/SLO 與三大支柱各能回答什麼問題。接著用 kind 在筆電養一個服務,在其中埋三個故障,之後用 metrics、logs、traces 逐一查出來。也會實作告警,重點是不製造告警疲勞。最後讓一隻 agent 讀 Alertmanager,再用 OpenTelemetry 觀測它自己,並把整套環境寫成 Terraform,砍掉叢集重建驗收。

寫給和我一樣一知半解的人。

參賽天數 2 天 | 共 2 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文
DAY 1

Day 1:面試被問可觀測性,我只答得出「看log有沒有error」

起心動念 前陣子在求職的時候常常被問到 k8s 相關的問題,觀測的指標有哪些,但我總是一問三不知,只能說出查看 log 有沒有 error。面試結束後我拼命去查...

2026-09-01 ‧ 由 wise4466 分享
DAY 2

Day 2:先講清楚要看什麼:SLI、SLO 與 Error Budget

昨天說我們這個系列要在 30 天內從 0 開始學會可觀測性,但今天我們要先把腳步放慢,不實際動手安裝工具,先從我們到底會看哪些指標開始。 三個常被搞混的名詞 在...

2026-09-02 ‧ 由 wise4466 分享