Week 4:Day19 建立 Cloud Monitoring 基礎 → Day20 設計 Agent 專屬指標 → Day21 成本異常告警 → Day22 行為異常告警 → Day23 SLA/SLO 設計。
一個實用的 Agent 監控 Dashboard 建議分成四個區塊,由上而下:
區塊一:健康總覽(一眼判斷)
區塊二:任務品質
區塊三:工具與模型
區塊四:成本
| 告警 | 條件 | 嚴重度 | 通知方式 |
|---|---|---|---|
| 單次執行 Token 超限 | 超過硬性上限 | 高 | 即時中止 + 通知 |
| 任務成功率跌破 SLO | 連續 N 分鐘低於門檻 | 高 | 即時通知值班 |
| 錯誤率異常 | 超過基準線 X 倍 | 高 | 即時通知值班 |
| 日累計成本超標 | 超過日預算 | 中 | 即時通知負責人 |
| 人工介入率上升 | 偏離 7 日基準線 | 中 | 每日摘要 |
| 工具分布偏移 | 偏離基準線分布 | 低 | 每日摘要 |
| 平均步數上升 | 偏離基準線 | 低 | 每週檢視 |
監控體系建好之後,最後一週處理「這些資料還能做什麼」:轉化成稽核證據、真實異常案例分析、成本治理(FinOps)、以及可觀測性與資安的交集。
💡 關於作者 我是 Fngi,專注在 AI 安全與雲端資安領域。如果這系列對你有幫助,歡迎追蹤 Instagram @aid3fend,我在那裡分享更多 AI 資安的實務筆記與趨勢觀察。