iT邦幫忙

observability相關文章
共有 217 則文章
鐵人賽 AI Engineering DAY 30

技術 Day 30|Agent Governance 最終章:把授權、執行與查證放回同一條路

系列開始時,我讓 SRE Agent 調查異常。Gemini 從一段混入操作指令的 Log 讀到 delete_demo_database,提出工具呼叫,Ope...

鐵人賽 AI Engineering DAY 29

技術 Day 29|Agent 高風險操作的責任交接:誰定規則、誰維護、誰核准

假設一張值班工單只允許處理測試環境,Agent 提出的工具參數卻指向正式資料庫。使用者已登入,Gateway 也允許呼叫這個工具,請求一路正常送到後端。這時仍需...

鐵人賽 AI Engineering DAY 28

技術 Day 28|從既有觀測與交付開始:Agent Governance 的導入順序

一支 Agent 只替單一團隊查 Logs,另一支可以修改正式環境。兩者可能使用相同框架,甚至相同模型,導入時要先處理的問題卻不一樣。前者需要受限的資料權限與可...

鐵人賽 AI Engineering DAY 27

技術 Day 27|Agent Governance 產品地圖:從一次查詢看請求、交付與觀測

要讓一支 SRE Agent 查 Loki,會用到身分驗證、Agent Runtime、工具介面、資料來源和觀測平台。這些系統都可能出現在架構圖裡,但光把產品名...

鐵人賽 AI Engineering DAY 6

技術 Day6:Agent 黑箱裡發生了什麼?從 Session 記錄還原八輪決策

文件沒寫的,記錄裡都有 Day4 提過一件事:Pi 的官方文件沒有用文字說明它的 agent loop 怎麼運作。但它有一個更直接的東西——每一次對話都會留下完...

鐵人賽 AI Engineering DAY 26

技術 Day 26|Agent 事件回放實戰:從 Trace ID 查回操作與授權證據

拿到一個 Trace ID,通常可以開始回答「這次請求經過哪幾個服務,時間花在哪裡」。如果調查的是一次可疑工具操作,接下來還會有人問:使用者原本要求什麼?Age...

鐵人賽 AI Engineering DAY 25

技術 Day 25|讓 SRE Agent 查 Loki:Grafana MCP 的查詢路徑與資料權限

請 SRE Agent 調查錯誤,最有用的回答通常不只是一句「可能是服務逾時」。我們還需要知道它看了哪個服務、哪段時間、哪些 Log,以及能不能沿結果繼續查 T...

鐵人賽 AI Engineering DAY 24

技術 Day 24|agentgateway LLM 成本觀測實戰:一次備援完成後,成本如何計算

一次 Agent 工作順利完成,背後可能已經向模型服務送了兩次請求。第一次遇到錯誤,第二次改用備援模型,使用者最後只看見一份回答。等你打開成本面板,請求數、To...

鐵人賽 AI Engineering DAY 23

技術 Day 23|JWT Claim 放進 Metrics 的代價:agentgateway 的高基數實測

做 Agent Dashboard 時,很容易遇到這個需求:目前只能按團隊看流量,能不能再加一個成員選單?每筆請求本來就帶著登入資訊,從 JWT 取出使用者 I...

鐵人賽 AI Engineering DAY 22

技術 Day 22|Agent 身分資料分流:從 Logs、Metrics、Traces 的用途決定欄位落點

當 Agent 回覆變慢,值班的人通常會先看:只是某一筆慢,還是整個服務都慢了?如果同一個時間有很多請求一起變慢,可能先從流量和延遲趨勢下手。如果只有一筆出問題...

鐵人賽 AI Engineering DAY 21

技術 Day 21|Agent Telemetry Pipeline 實戰:追過 Gateway、Runtime 與 MCP 的服務邊界

假設你請 Agent 查一個服務的異常,畫面一直停在「查詢中」。Gateway 的紀錄顯示請求已送出,Runtime 說自己正在等工具,工具服務卻說查詢早就完成...

鐵人賽 AI Engineering DAY 20

技術 Day 20|從 LLM Observability 到 Agent Traceability:如何查清一次工具操作

假設你請 SRE Agent 調查服務異常。原本期待它讀取監控資料、整理可能原因,操作紀錄裡卻出現一個刪除資料庫的工具。這時候,你大概不會先關心這次用了多少 T...

鐵人賽 AI Engineering DAY 19

技術 Day 19|也許你需要的是 Agent Registry:Agent 發現、版本管理與供應鏈信任

假設你想找一支已經能分析資料庫延遲的 Agent,搜尋結果卻是三個 Repository、兩段群組訊息和一份沒更新的 README。每個團隊都說自己的版本能用,...

鐵人賽 AI Engineering DAY 18

技術 Day 18|實測 kagent BYO Agent:讓外部 Agent 接入 A2A 生態

一支 Agent 從查資料進展到多步工作流程後,開發者可能需要自己控制分支、Callback、狀態保存與核准後的恢復執行。如果 kagent 的宣告欄位已經不夠...

鐵人賽 AI Engineering DAY 17

技術 Day 17|認識 A2A Protocol:Agent Card、Invocation 與 Task Lifecycle

假設一支值班 Agent 要整理異常服務,卻需要另一個團隊維護的資料庫 Agent 判讀慢查詢。後者有自己的模型、工具與工作流程,可能要跑幾分鐘,也可能中途要求...

鐵人賽 AI Engineering DAY 16

技術 Day 16|kagent 與 agentgateway 的定位:Agent 平台、Runtime 與流量治理

Day 15 把既有 Ingress 與 agentgateway 的流量責任切開後,仍有一大塊工作沒有人接:Agent 使用哪個 Runtime、如何部署、怎...

鐵人賽 AI Engineering DAY 15

技術 Day 15|導入 AI Gateway 與原有 Gateway 的職責切分

把 agentgateway 接進 Kubernetes 後,我們沒有拆掉原本的 Ingress。Public Host、Certificate 與其他服務都還...

鐵人賽 AI Engineering DAY 14

技術 Day 14|認識 AI Gateway Virtual Key:企業身分與 Agent Workload 的使用邊界

評估 LiteLLM 時,我們沒有採用的其中一個顧慮,是 Virtual Key 帶來的 Human Identity 管理。幾個月後接 kagent 的 LL...

鐵人賽 AI Engineering DAY 13

技術 Day 13|從 LiteLLM 轉向 agentgateway:官方文件沒寫的維運成本

我最初找 AI Gateway 的條件很直接:讓應用用同一個相容 OpenAI API 的入口呼叫不同模型,再集中處理轉送、失敗切換、專案 Key、預算與管理介...

鐵人賽 AI Engineering DAY 12

技術 Day 12|AWS Cognito 雙路徑實戰:同一個 Issuer,拆開 Human 與 M2M

同一個 Observability MCP 有兩種呼叫者。值班工程師從 CLI 登入後查資料,Scheduler 則在沒有人操作時定期執行。兩枚 Access...

鐵人賽 AI Engineering DAY 11

技術 Day 11|Agent OAuth Flow 實測:PKCE、Client Credentials 與 Token Exchange

同一支會查 Log 的 Agent,可能在值班工程師從 CLI 交辦時執行,也可能由凌晨的 Scheduler 喚起。它還可能接下人的要求,再代表那個人去呼叫下...

鐵人賽 AI Engineering DAY 10

技術 Day 10|Agent 沿用使用者的 OAuth Access Token:身分歸屬與權限邊界實測

假設值班工程師已經登入 SRE Copilot,Investigator Agent 接著要去 Observability MCP 查 Log。這時最省事的接法...

鐵人賽 AI Engineering DAY 9

技術 Day 9|Agent 交辦另一支 Agent:Delegation Context 如何留下請求來源

值班工程師請 SRE Copilot 查昨晚的登入錯誤。Copilot 把查詢交給 Investigator Agent,後者選了 MCP 的 query_lo...

鐵人賽 AI Engineering DAY 8

技術 Day 8|JWT 驗證實戰:從 Issuer、Audience、Scope 到 AWS Cognito Token 差異

把 AWS Cognito 接進 Gateway 時,員工已經能登入,Gateway 也能驗過 JWT 簽章。我原本以為最麻煩的身分問題已經過去,接下來只要把...

鐵人賽 AI Engineering DAY 7

技術 Day 7|Agent 查資料,責任算誰的:人工交辦與排程任務的分界

把人的登入與機器取 Token 分開後,請求離開登入入口,責任卻不會自動跟著走。假設值班工程師請 Agent 查服務的 latency。隔天,同一支 Agent...

鐵人賽 AI Engineering DAY 6

技術 Day 6|雖然 Keycloak 十分強大,但最終我們選擇 AWS Cognito

我們已經有企業 IdP 管理員工帳號,但 Agent Gateway 要替 MCP Tool 做授權,還需要一個能把登入身分轉成下游可用 Token 的入口。我...

鐵人賽 AI Engineering DAY 5

技術 Day 5|Agent Governance 四問:用一條 Action Path 盤點治理缺口

值班工程師請 Agent 查服務延遲,Agent 選了 query_metrics,查詢也成功了。若後來發現它查到另一個團隊的資料,我們就得回頭找:誰交辦這次工...

鐵人賽 AI Engineering DAY 4

技術 Day 4|Agent 拿誰的權限做事:Tool Allowlist 沒回答的身分問題

值班工程師請 Agent 查服務延遲,通常會同意它讀取相關 Log 和 Metrics,卻不會因此准許它查遍所有團隊的資料。同一個查詢工具,能不能執行還取決於目...

鐵人賽 AI Engineering DAY 3

技術 Day 3|Prompt Injection 防護實測:Guard 漏判後,Tool Allowlist 擋下危險動作

一支用 Google ADK 寫的 SRE Investigation Agent,原本只需要讀 Log 和 Metrics,協助調查服務延遲。模型卻可能把 L...

鐵人賽 AI Engineering DAY 2

技術 Day 2|Agent Threat Model 實作:拆開一筆 Tool Call 的信任邊界

一支協助調查服務延遲的 SRE Investigation Agent,本來應該查 Log、看 Metrics。Day 1 的安全實驗卻讓它讀到 Log 裡的惡...