iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI 自動化

30 天打造 AI 自動化維運平台:從監控、告警到故障分析 系列

當系統發生異常時,維運人員常需要在大量監控資訊與 Log 中快速找出問題。本系列將用 30 天從零打造一套 AI 自動化維運平台,整合系統監控、異常告警、Log 分析與生成式 AI,讓 AI 協助整理故障資訊、分析可能原因並提供處理建議。過程將實作 Python、FastAPI、Prometheus、Grafana、Docker 等技術,從監控主機一路做到 AI 輔助故障分析,打造一套真正能跑的 AIOps Side Project。

參賽天數 9 天 | 共 9 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文
DAY 1

Day 1|從維運現場出發:我想解決哪些問題?

為什麼會想做這個題目系統出問題時,第一時間通常不是直接知道原因。要看 CPU、Memory、Disk、Service、Log。告警很多,但真正有用的資訊不一定多...

2026-08-28 ‧ 由 zse811022 分享
DAY 2

Day 2|先別急著寫程式,來把整套維運平台的架構畫出來

系統發生異常時,我們通常會經過幾個步驟: 發現異常 → 查看監控 → 找 Log → 判斷問題 → 處理 這些流程本身沒有什麼問題,但真正花時間的地方,常常是在...

2026-08-29 ‧ 由 zse811022 分享
DAY 3

Day 3|開始動工:準備我們的第一台監控主機

前兩天先把這次想解決的問題,以及整套平台的大方向整理完成。 從今天開始,就正式進入實作。 不過在安裝 Prometheus、Grafana 之前,還是要先準備一...

2026-08-30 ‧ 由 zse811022 分享
DAY 4

Day 4 預告 Day 4|讓 Prometheus 跑起來:開始收集第一筆監控資料

Day 3 我們先準備好了兩台主機: Monitoring Server192.168.1.100 ↓ 監控 Target Server192.168...

2026-08-31 ‧ 由 zse811022 分享
DAY 5

Day 5|讓監控資料看得懂:用 Grafana 做第一個 Dashboard

Day 4 已經讓 Prometheus 成功收到 server01 的監控資料。 目前架構是: server01││ Node Exporter :9100▼...

2026-09-01 ‧ 由 zse811022 分享
DAY 6

Day 6|有監控還不夠:開始設定第一條告警規則

Day 5 我們已經把 Prometheus 的資料接到 Grafana,也做出了第一個 Dashboard。 目前已經可以直接看到: Server Statu...

2026-09-02 ‧ 由 zse811022 分享
DAY 7

Day 7|告警不能只留在 Grafana:把異常通知送出去

Day 6 我們已經完成第一條告警規則: server01CPU > 90%持續 5 分鐘↓Firing 到這裡,Grafana 已經可以判斷 Serve...

2026-09-03 ‧ 由 zse811022 分享
DAY 8

Day 8|收到告警之後呢?用 Python 自動收集故障資訊

目前整個流程是: server01↓Prometheus↓Grafana↓Alert Rule↓Discord 當 CPU 持續超過設定的門檻時,我們已經可以收...

2026-09-04 ‧ 由 zse811022 分享
DAY 9

Day 9|不要再手動執行:讓 Grafana 告警觸發 Python

Day 8 我們已經寫好一支 Python 程式,可以自動取得 server01 的: CPUMemoryDiskTop CPU Processes 執行: p...

2026-09-05 ‧ 由 zse811022 分享