iT邦幫忙

observability相關文章
共有 215 則文章
鐵人賽 AI Engineering DAY 28

技術 Day 28|從既有 LGTM 開始:Agent Governance 的導入順序

Day 27 的 Capability Ledger 一共有十四列:六列 KEEP、兩列 ADOPT、四列 DEFER,還有兩列 UNKNOWN。只看狀態,最刺...

鐵人賽 AI Engineering DAY 27

技術 Day 27|Agent Governance 選型總帳:把產品功能換算成維運責任

前一篇重新回放了 Day 1 那筆被不可信 Log 誘導的 Tool Call。結果一半很清楚:哪個 Tool 被呼叫、policy 如何判斷、canary 最...

鐵人賽 AI Engineering DAY 6

技術 Day6:Agent 黑箱裡發生了什麼?從 Session 記錄還原八輪決策

文件沒寫的,記錄裡都有 Day4 提過一件事:Pi 的官方文件沒有用文字說明它的 agent loop 怎麼運作。但它有一個更直接的東西——每一次對話都會留下完...

鐵人賽 AI Engineering DAY 26

技術 Day 26|Agent 事件回放實戰:用 Trace ID 重建 Tool Call 與 Audit 缺口

Day 25 的 SRE Agent 已經能從 Loki result 拿到 trace_id。拿到這串 ID 之後,最直覺的做法是貼進 Tempo,沿著 sp...

鐵人賽 AI Engineering DAY 25

技術 Day 25|讓 SRE Agent 真的查 Loki:Grafana MCP 接上 agentgateway

Day 1 的 SRE Agent 有一個 query_logs Tool。名字看起來很像回事,實際上只會把 Repo 裡準備好的 JSONL fixture...

鐵人賽 AI Engineering DAY 24

技術 Day 24|agentgateway LLM 成本觀測實戰:Dashboard 上的數字能信到哪裡?

agentgateway 1.5.0 的 LLM Analytics 跑起來後,不用先畫 Grafana,就能看到 calls、token usage 與估算成...

鐵人賽 AI Engineering DAY 23

技術 Day 23|JWT Claim 放進 Metrics 的代價:agentgateway Cardinality 實測

做完 Agent telemetry 之後,Dashboard 很快就會出現一個合理需求:既然每一筆請求都有登入者,能不能直接按 team member 看流量...

鐵人賽 AI Engineering DAY 22

技術 Day 22|Agent 身分資料分流:Metrics、Traces、Logs 與 Audit 的欄位邊界

Day 21 把 Gateway、Agent Runtime 與 MCP adapter 的 Trace 接起來後,同一筆 action 已經可以跨服務查回來。...

鐵人賽 AI Engineering DAY 21

技術 Day 21|Agent Telemetry Pipeline 實戰:把 Gateway、Runtime 與 MCP 的 Trace 接起來

Day 20 的 Tempo waterfall 有兩個 span:invoke_agent 底下接著 execute_tool。欄位契約看起來完整,actio...

鐵人賽 AI Engineering DAY 20

技術 Day 20|從 LLM Observability 到 Agent Traceability:一筆 Tool Call 還缺哪些責任資料

Day 19 把 Agent Registry 的邊界停在一個很現實的位置:平台可以知道某個 Agent 已經進入 Runtime,卻還不知道它被誰叫起來、代表...

鐵人賽 AI Engineering DAY 19

技術 Day 19|Agent Registry 選型回顧:從拆除 0.3.3 到重測 0.4.0

Day 18 的 BYO Agent 已經能被 kagent 部署、找到,也能讓另一個 Agent 透過 A2A 呼叫。當團隊開始累積更多 Agent,下一個麻...

鐵人賽 AI Engineering DAY 18

技術 Day 18|BYO Agent 接回 kagent:從部署、A2A 到 HITL 的實測邊界

Day 17 把 A2A 的 Agent Card、routing 與 invocation 接通之後,下一步就是把自建 Agent 放回 kagent,看看其...

鐵人賽 AI Engineering DAY 17

技術 Day 17|Agent Card 讀得到,A2A Invocation 卻卡在錯誤路徑

Day 16 已經證明 kagent 能部署 declarative Agent,LLM 與 MCP traffic 也能經過 agentgateway。接著把...

鐵人賽 AI Engineering DAY 16

技術 Day 16|kagent × agentgateway 實測:Runtime、Control Plane、Traffic Path 各管哪一段

Day 15 把既有 Ingress 與 agentgateway 的流量責任切開之後,還有一大塊工作沒有人接:Agent 要用哪個 Runtime、如何部署、...

鐵人賽 AI Engineering DAY 15

技術 Day 15|既有 Ingress 不用拆:Agent Gateway 上線後的責任切分

把 agentgateway 接進 Kubernetes 之後,我們沒有拆掉原本的 Ingress。public host、certificate 與其他服務都...

鐵人賽 AI Engineering DAY 14

技術 Day 14|Virtual Key 不能代替企業身分,但能隔離 Agent Workload

評估 LiteLLM 時,我們最後沒有採用,其中一個顧慮就是 virtual key 帶來的身分管理。幾個月後接 kagent 的 LLM path,我卻又在...

鐵人賽 AI Engineering DAY 13

技術 Day 13|從 LiteLLM 轉向 agentgateway:AI Gateway 功能表沒寫的維運成本

我一開始找 AI Gateway 的條件很直接:把不同 LLM provider 收進同一個 OpenAI-compatible endpoint,再補上 ro...

鐵人賽 AI Engineering DAY 12

技術 Day 12|AWS Cognito 雙路實戰:同一個 Issuer,拆開 Human 與 M2M

同一個 Observability MCP 有兩種呼叫者。值班工程師從 CLI 登入後查詢資料,Scheduler 則在沒有人操作時定時執行。兩邊拿到的 acc...

鐵人賽 AI Engineering DAY 11

技術 Day 11|Agent OAuth Flow 實測:Authorization Code + PKCE、Client Credentials 與 Token Exchange

Day 10 把值班工程師的入口 Token 原樣送到第二個 MCP Server,結果不是撞上 audience 驗證,就是讓 Audit 誤以為整條鏈都由同...

鐵人賽 AI Engineering DAY 10

技術 Day 10|Token Passthrough 實測:Request 通了,Audit 卻只剩值班工程師

Day 9 把一次 Agent 任務裡的 Human、Agent 與 Workload 都放回 Delegation Context。欄位補齊之後,下一個麻煩很...

鐵人賽 AI Engineering DAY 9

技術 Day 9|Delegation Context 實作:把 Human、Agent 與 Workload 寫進同一條責任鏈

Day 8 的 Gateway 已經能驗證 issuer、audience、scope 與 policy claim,但那只能證明「這枚 Token 能不能送到...

鐵人賽 AI Engineering DAY 8

技術 Day 8|JWT 簽章過了,為什麼還是不能放行?Issuer、Audience、Scope 與 Claim 實測

把 Cognito 接進 Gateway 的那一輪,我原本以為最麻煩的部分已經處理完了。Human SSO 可以登入,Gateway 也能驗 JWT signa...

鐵人賽 AI Engineering DAY 7

技術 Day 7|Agent Audit 不能只留一個 actor:Human、Service、Agent 與 Workload

Day 6 把登入路徑收斂成兩條:互動式使用者走 Authorization Code + PKCE,無人服務走 Client Credentials。Toke...

鐵人賽 AI Engineering DAY 6

技術 Day 6|雖然 Keycloak 十分強大,但最終我們選擇 AWS Cognito

Day 5 盤點完 Identity 缺口後,下一步看起來很直覺:替 Gateway 接上一個可信的 OIDC issuer,讓 synthetic-user-...

鐵人賽 AI Engineering DAY 5

技術 Day 5|Agent Governance 四問:用一條 Action Path 盤點治理缺口

Day 3 的 Tool allowlist 已經把 delete_demo_database 擋在 Function Tool 前。相同的外部惡意 Log、相...

鐵人賽 AI Engineering DAY 4

技術 Day 4|當 Agent 拿自己的權限替人做事:Confused Deputy 與 Delegation 缺口

前一天的 Lab 裡,SRE Agent 讀到一段藏在外部 Log 裡的惡意指令。Gemini 提出了 delete_demo_database,Keyword...

鐵人賽 AI Engineering DAY 3

技術 Day 3|Prompt Injection 防護實測:Guard 漏判後,Tool Allowlist 擋下危險動作

這個系列的 Lab 裡有一個 SRE Investigation Agent。它會讀取合成的系統 Log,使用 query_logs 和 query_metri...

鐵人賽 AI Engineering DAY 2

技術 Day 2|Agent Threat Model 實作:從 Prompt Injection 到 Tool 執行的七道邊界

Day 1 的 SRE Investigation Agent 做了一件不該做的事。它讀到一段被動過手腳的 Log 後,沒有停在分析,而是向 Google AD...

鐵人賽 AI Engineering DAY 1

技術 Day 1|當模型開始呼叫工具:從 LLM 可觀測性走向 Agent 治理

2025 年的鐵人賽,我寫的是 LLM 可觀測性。那時追的是 Prompt、Response、Token、Latency、Cost,還有 Evaluation...

技術 o11y-bench 協助你評估 LLM 到底能不能當 SRE?

完整內容,請至幹話王 Grafana o11y-bench 深入剖析:讓 AI 真正面對 on-call 現場 LLM 到底能不能當 SRE?不是問它「知不知道...