為什麼會想做這個題目
系統出問題時,第一時間通常不是直接知道原因。
要看 CPU、Memory、Disk、Service、Log。
告警很多,但真正有用的資訊不一定多。
現在維運工作的痛點
監控資料分散
告警只能告訴你「有問題」
Log 太多,需要人工篩選
同樣的排查流程一直重複
問題處理完後,還要整理事件紀錄
我想解決什麼
可以定成四件事:
看得到異常 → 收得到告警 → 找得到關鍵 Log → 能快速整理可能原因
這 30 天準備做什麼
最後會慢慢做出:
主機監控 → Grafana Dashboard → 告警 → Log 收集 → Python 自動化 → AI 輔助分析 → 故障摘要
Day 1 結尾
可以用這種比較自然的寫法:
這次不打算一開始就做一套很複雜的平台,而是先從最基本的監控開始,把每一個功能慢慢串起來。
我的目標也不是讓 AI 直接幫我們「修好所有問題」,而是先看看它能不能減少一些重複的排查工作,例如整理監控資訊、找出值得注意的 Log,以及協助整理可能的問題方向。
先把系統做得能跑,再慢慢把它做得好用。
下一篇會先把整套系統的架構畫出來,也會決定這 30 天到底要使用哪些工具。