iT邦幫忙

2026 iThome 鐵人賽

DAY 20
0
Security

《30 天用 Google Cloud Observability 打造 AI Agent 全方位監控》系列 第 20 篇

Day 20|Agent 專屬指標設計:任務成功率、工具呼叫失敗率、幻覺率代理指標

  • 分享至 

  • xImage
  •  

統 APM 沒有這些欄位

Day 2 提過,Agent 系統需要「任務品質層級」的指標,而這些傳統 APM 工具沒有現成欄位,需要自己定義。這篇提供一組實用的起手式。

第一組:任務層級指標

任務成功率:完成任務的執行 ÷ 總執行數。定義「成功」是設計這個指標最難的部分——是使用者沒有再追問就算成功?是 Agent 自認完成就算成功?建議明確定義並寫進文件,因為不同定義會導致完全不同的數字。

人工介入率:需要轉接人工或需要人工審核的比例。這個指標的變化趨勢往往比絕對值更有意義——突然上升代表某些東西變了(呼應 Day 1 開場的客服 Agent 場景)。

平均步數:完成一次任務平均花了幾步。呼應 Day 16 提過的「步數太多」問題,這個指標能反映 Agent 的決策效率。

第二組:工具層級指標

工具呼叫失敗率:依工具分組統計。這個指標的價值在於區分「Agent 判斷錯誤」與「工具本身有問題」——如果某個工具的失敗率突然飆高,那多半是工具端的問題,不是 Agent 變笨了。

工具選擇分布:各工具被呼叫的比例。分布的異常變化是一個有用的訊號——例如某個原本很少用的工具突然被大量呼叫,值得追查。

第三組:品質代理指標

「幻覺率」很難直接量測(因為需要判斷輸出是否正確),實務上多半用代理指標近似:

檢索一致性分數:在 RAG 場景下,比對輸出內容與檢索到的來源文件的一致程度。一致性低是幻覺的warning signal。

引用覆蓋率:輸出中有多少陳述能對應到明確的來源。

LLM-as-judge 抽樣評分:對一定比例的產出(不需要全部,抽樣即可)用另一個模型做品質評分。這種做法的成本考量是:評分本身也要花 Token,所以抽樣比例需要在覆蓋率與成本間取捨。

第四組:成本與效能指標

每次任務的 Token 成本:把 Week 3 Span 上的 gen_ai.usage.* 屬性聚合起來。

P95/P99 延遲:呼應 Day 16,別只看平均值。

這篇的檢查清單

  • [ ] 「任務成功」的定義是否已明確寫進文件,而非各自解讀?
  • [ ] 工具層級的指標是否能區分「Agent 判斷錯誤」與「工具本身故障」?
  • [ ] 是否已設計至少一個品質代理指標,而非完全不量測輸出品質?

💡 關於作者 我是 Fngi,專注在 AI 安全與雲端資安領域。如果這篇對你有幫助,歡迎追蹤 Instagram @aid3fend,我在那裡分享更多 AI 資安的實務筆記與趨勢觀察。


上一篇
Day 19|Cloud Monitoring 基礎:Metrics、Dashboard、Alerting Policy
下一篇
Day 21|成本異常告警:Token 用量與 API 呼叫成本的即時監控
系列文
《30 天用 Google Cloud Observability 打造 AI Agent 全方位監控》 共 21 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言