iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
Security

《30 天用 Google Cloud Observability 打造 AI Agent 全方位監控》 系列

當 AI Agent 真正上線後,「跑得動」跟「看得懂它在幹嘛」是兩回事。Agent 一旦具備自主決策與工具呼叫能力,傳統的日誌監控往往看不出「為什麼做這個決策」,只看得到「呼叫了哪個 API」。

這 30 天會用 Google Cloud 的可觀測性工具鏈——Cloud Trace 追蹤 Agent 決策鏈路、Cloud Logging 建立結構化決策日誌、Cloud Monitoring 設計異常告警、搭配成本與延遲的 SLA 監控——把「Agent 內部到底發生了什麼」變成看得見、可追溯、可稽核的資訊。

參賽天數 23 天 | 共 23 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文 |團隊Devfest 愁備餓處
DAY 21

Day 21|成本異常告警:Token 用量與 API 呼叫成本的即時監控

Agent 的成本結構跟傳統應用不同 傳統應用的成本大致跟請求數成正比,相對可預測。Agent 不是:同樣一個請求,可能因為 Agent 決定多繞幾輪、或是因為...

2026-09-30 ‧ 由 Fngi 分享
DAY 22

Day 22|行為異常告警:偵測 Agent 偏離正常行為模式

比成本更難的:怎麼知道 Agent「怪怪的」 成本異常相對好偵測,因為它是明確的數值。行為異常難得多——Agent 沒有報錯、任務也「完成」了,但它做事的方式跟...

2026-10-01 ‧ 由 Fngi 分享
DAY 23

Day 23|SLA 與 SLO 設計:Agent 服務的可用性與效能承諾怎麼定

對 Agent 承諾「可用性」是什麼意思 傳統服務的 SLA 相對單純:服務有沒有回應、回應時間多長。Agent 服務複雜在於——它可能「有回應」但「沒幫上忙」...

2026-10-02 ‧ 由 Fngi 分享