iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
Kubernetes

從看得到到看得懂:30 天在自架 K8s 上實踐可觀測性與告警 系列

「你的服務怎麼監控?」面試被問到,我只答得出「看 log 有沒有 error」。事後查了資料,Grafana、SLO 這些名詞認得了,監控和可觀測性差在哪還是講不清楚。

一開始不碰工具,先講清楚 SLI/SLO 與三大支柱各能回答什麼問題。接著用 kind 在筆電養一個服務,在其中埋三個故障,之後用 metrics、logs、traces 逐一查出來。也會實作告警,重點是不製造告警疲勞。最後讓一隻 agent 讀 Alertmanager,再用 OpenTelemetry 觀測它自己,並把整套環境寫成 Terraform,砍掉叢集重建驗收。

寫給和我一樣一知半解的人。

參賽天數 23 天 | 共 23 篇文章 | 4 人訂閱 訂閱系列文 RSS系列文
DAY 1

Day 1:面試被問可觀測性,我只答得出「看log有沒有error」

起心動念 前陣子在求職的時候常常被問到 k8s 相關的問題,觀測的指標有哪些,但我總是一問三不知,只能說出查看 log 有沒有 error。面試結束後我拼命去查...

2026-09-01 ‧ 由 wise4466 分享
DAY 2

Day 2:先講清楚要看什麼:SLI、SLO 與 Error Budget

昨天說我們這個系列要在 30 天內從 0 開始學會可觀測性,但今天我們要先把腳步放慢,不實際動手安裝工具,先從我們到底會看哪些指標開始。 三個常被搞混的名詞 在...

2026-09-02 ‧ 由 wise4466 分享
DAY 3

Day3:可觀測性的三大支柱:metrics、logs、traces 各自能回答哪種問題

昨天決定了要看什麼(SLI 和 SLO),今天講這些資料從哪裡來。 在 Google 上搜「可觀測性」大概三分鐘就會遇到一個詞:三大支柱(three pilla...

2026-09-03 ‧ 由 wise4466 分享
DAY 4

Day 4:這 30 天要裝的工具

昨天講完三本柱,今天我們來列清單,看這 30 天到底要在叢集裡裝哪些東西。 我自己查資料的時候,覺得很多教學太快跳到指令的部分,直接教怎麼安裝和執行,但沒有說明...

2026-09-04 ‧ 由 wise4466 分享
DAY 5

Day 5:用 kind 在筆電上開一個能重現問題的 K8s 叢集

前面四天的觀念講完了,今天正式開始動手。 這篇的目標其實很小,就是把一個叢集開起來,然後說明為什麼是這樣開的。但是「為什麼」的部分比指令重要,網路上教你打 ki...

2026-09-05 ‧ 由 wise4466 分享
DAY 6

Day 6:在 K8s 上部署一個「會壞」的示範服務:三種故意埋進去的故障

昨天叢集開好了,今天要往裡面放東西。 我們要建立一個壞掉的服務,但是不會壞的太明顯。 沒有一個故障是「服務掛掉」。 服務掛掉其實是最好查的,Pod 會變紅、...

2026-09-06 ‧ 由 wise4466 分享
DAY 7

Day 7:kubectl 看得到什麼、看不到什麼

今天要做一件有點反直覺的事:故意不裝任何監控工具,只用 kubectl 去查昨天埋的那三個故障。 為什麼要花一天做一件註定失敗的事?因為我認為實際體驗一次少了工...

2026-09-07 ‧ 由 wise4466 分享
DAY 8

Day 8:Prometheus Operator 安裝與 ServiceMonitor:第一次抓到指標

昨天的結論是四句話,今天要把第一句劃掉:只有現在,沒有歷史。 也就是裝 Prometheus。但是這篇的重點不是安裝指令,那其實只有兩行,重點是另外兩件事:Op...

2026-09-08 ‧ 由 wise4466 分享
DAY 9

Day 9:Grafana 接上來:做一張能回答問題的圖,而不是好看的圖

昨天 Prometheus 開始存資料了,但是它自己的畫面很陽春。今天接上 Grafana,一個把資料畫成圖表的網頁介面,它自己不存任何資料,只負責去問別人要。...

2026-09-09 ‧ 由 wise4466 分享
DAY 10

Day 10:PromQL 起步:rate、histogram_quantile 與四個黃金訊號

昨天做圖的時候直接貼了兩行查詢沒解釋,今天補上。 PromQL 是 Prometheus 的查詢語言。它跟 SQL 完全不像,因為它處理的東西不一樣:SQL 查...

2026-09-10 ‧ 由 wise4466 分享