當系統發生異常時,維運人員常需要在大量監控資訊與 Log 中快速找出問題。本系列將用 30 天從零打造一套 AI 自動化維運平台,整合系統監控、異常告警、Log 分析與生成式 AI,讓 AI 協助整理故障資訊、分析可能原因並提供處理建議。過程將實作 Python、FastAPI、Prometheus、Grafana、Docker 等技術,從監控主機一路做到 AI 輔助故障分析,打造一套真正能跑的 AIOps Side Project。
為什麼會想做這個題目系統出問題時,第一時間通常不是直接知道原因。要看 CPU、Memory、Disk、Service、Log。告警很多,但真正有用的資訊不一定多...
系統發生異常時,我們通常會經過幾個步驟: 發現異常 → 查看監控 → 找 Log → 判斷問題 → 處理 這些流程本身沒有什麼問題,但真正花時間的地方,常常是在...
前兩天先把這次想解決的問題,以及整套平台的大方向整理完成。 從今天開始,就正式進入實作。 不過在安裝 Prometheus、Grafana 之前,還是要先準備一...
Day 3 我們先準備好了兩台主機: Monitoring Server192.168.1.100 ↓ 監控 Target Server192.168...
Day 4 已經讓 Prometheus 成功收到 server01 的監控資料。 目前架構是: server01││ Node Exporter :9100▼...
Day 5 我們已經把 Prometheus 的資料接到 Grafana,也做出了第一個 Dashboard。 目前已經可以直接看到: Server Statu...
Day 6 我們已經完成第一條告警規則: server01CPU > 90%持續 5 分鐘↓Firing 到這裡,Grafana 已經可以判斷 Serve...
目前整個流程是: server01↓Prometheus↓Grafana↓Alert Rule↓Discord 當 CPU 持續超過設定的門檻時,我們已經可以收...
Day 8 我們已經寫好一支 Python 程式,可以自動取得 server01 的: CPUMemoryDiskTop CPU Processes 執行: p...