昨天寫了第一則告警,門檻是「300 毫秒內完成的比例 < 95%,撐 10 分鐘」。今天要拆掉這個設計,因為它有問題,而且問題不小。 今天的故障開關:全部...
昨天把三大支柱串起來,Day 7 的四句天花板只剩最後一句:只能被動查,不會主動通知。今天開始處理它。 這個區塊我要花四天,比 metrics 和 logs 都...
昨天講完三本柱,今天我們來列清單,看這 30 天到底要在叢集裡裝哪些東西。 我自己查資料的時候,覺得很多教學太快跳到指令的部分,直接教怎麼安裝和執行,但沒有說明...
前言 現代化系統中,監控與告警系統在日益複雜的服務環境中扮演著至關重要的角色。而我們在這背景下,以 AlertManager 這個百分之九十以上與 Prome...
我們會把 Loki 的警報規則發送到 Alertmanager 來進行管理,包括靜音、刪除重複數據與分組,並將它們路由到正確的接收器,例如電子郵件或 LINE...
昨天有跟大家分享過Prometheus是什麼東西,今天就來用python實際操作看看囉~程式碼在這~我的Github 資料夾結構 docker-promet...
今天想跟大家分享Prometheus監控系統~簡單來說,他是個開源的系統監控和警告的工具包!基本原理就是透過Http協議週期性的抓取被監控物件的狀態 流程大致...
設定 alerting rules 昨天成功的讓 Prometheus 收集了一些指標,那麼今天就來設定警報吧。要做警報的話,在 Prometheus 裡面是透...
【YC的尋路青春】 大概要做的事情有這些 建一個自己的 - namespace yc 蓋接線生 - prometheus-operator Servic...