iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
Kubernetes

從看得到到看得懂:30 天在自架 K8s 上實踐可觀測性與告警 系列

「你的服務怎麼監控?」面試被問到,我只答得出「看 log 有沒有 error」。事後查了資料,Grafana、SLO 這些名詞認得了,監控和可觀測性差在哪還是講不清楚。

一開始不碰工具,先講清楚 SLI/SLO 與三大支柱各能回答什麼問題。接著用 kind 在筆電養一個服務,在其中埋三個故障,之後用 metrics、logs、traces 逐一查出來。也會實作告警,重點是不製造告警疲勞。最後讓一隻 agent 讀 Alertmanager,再用 OpenTelemetry 觀測它自己,並把整套環境寫成 Terraform,砍掉叢集重建驗收。

寫給和我一樣一知半解的人。

參賽天數 23 天 | 共 23 篇文章 | 4 人訂閱 訂閱系列文 RSS系列文
DAY 21

Day 21:好告警的三個條件:可行動、有主人、有上下文

昨天把三大支柱串起來,Day 7 的四句天花板只剩最後一句:只能被動查,不會主動通知。今天開始處理它。 這個區塊我要花四天,比 metrics 和 logs 都...

2026-09-21 ‧ 由 wise4466 分享
DAY 22

Day 22:Alertmanager 實作:路由、分組、抑制與靜音

昨天講原則,今天寫設定。 今天的故障開關:全部關閉 kubectl set env deploy/pricing BUG_SILENT_DISCOUNT=fal...

2026-09-22 ‧ 由 wise4466 分享
DAY 23

Day 23:從 SLO 反推告警:burn rate 告警怎麼設

昨天寫了第一則告警,門檻是「300 毫秒內完成的比例 < 95%,撐 10 分鐘」。今天要拆掉這個設計,因為它有問題,而且問題不小。 今天的故障開關:全部...

2026-09-23 ‧ 由 wise4466 分享