iT邦幫忙

observability相關文章
共有 194 則文章
鐵人賽 AI Engineering DAY 8

技術 Day 8|JWT 簽章過了,為什麼還是不能放行?Issuer、Audience、Scope 與 Claim 實測

把 Cognito 接進 Gateway 的那一輪,我原本以為最麻煩的部分已經處理完了。Human SSO 可以登入,Gateway 也能驗 JWT signa...

鐵人賽 AI Engineering DAY 7

技術 Day 7|Agent Audit 不能只留一個 actor:Human、Service、Agent 與 Workload

Day 6 把登入路徑收斂成兩條:互動式使用者走 Authorization Code + PKCE,無人服務走 Client Credentials。Toke...

鐵人賽 AI Engineering DAY 6

技術 Day 6|雖然 Keycloak 十分強大,但最終我們選擇 AWS Cognito

Day 5 盤點完 Identity 缺口後,下一步看起來很直覺:替 Gateway 接上一個可信的 OIDC issuer,讓 synthetic-user-...

鐵人賽 AI Engineering DAY 5

技術 Day 5|Agent Governance 四問:用一條 Action Path 盤點治理缺口

Day 3 的 Tool allowlist 已經把 delete_demo_database 擋在 Function Tool 前。相同的外部惡意 Log、相...

鐵人賽 AI Engineering DAY 4

技術 Day 4|當 Agent 拿自己的權限替人做事:Confused Deputy 與 Delegation 缺口

前一天的 Lab 裡,SRE Agent 讀到一段藏在外部 Log 裡的惡意指令。Gemini 提出了 delete_demo_database,Keyword...

鐵人賽 AI Engineering DAY 3

技術 Day 3|Prompt Injection 防護實測:Guard 漏判後,Tool Allowlist 擋下危險動作

這個系列的 Lab 裡有一個 SRE Investigation Agent。它會讀取合成的系統 Log,使用 query_logs 和 query_metri...

鐵人賽 AI Engineering DAY 2

技術 Day 2|Agent Threat Model 實作:從 Prompt Injection 到 Tool 執行的七道邊界

Day 1 的 SRE Investigation Agent 做了一件不該做的事。它讀到一段被動過手腳的 Log 後,沒有停在分析,而是向 Google AD...

鐵人賽 AI Engineering DAY 1

技術 Day 1|當模型開始呼叫工具:從 LLM 可觀測性走向 Agent 治理

2025 年的鐵人賽,我寫的是 LLM 可觀測性。那時追的是 Prompt、Response、Token、Latency、Cost,還有 Evaluation...

技術 o11y-bench 協助你評估 LLM 到底能不能當 SRE?

完整內容,請至幹話王 Grafana o11y-bench 深入剖析:讓 AI 真正面對 on-call 現場 LLM 到底能不能當 SRE?不是問它「知不知道...

技術 [SRE×AI #07] SRE 的 Prompt 工程:怎麼讓 AI 按照你的方式調查

AI 很聰明。但它不知道你們的 log 要去哪裡查、哪個 index 對應哪個服務、收到 503 要先看什麼。 AI 很聰明,但它不認識你的系統 前幾篇...

技術 OTel 戰地筆記:破解 Delta to Cumulative 的兩大夢魘 (ErrOutOfOrder & ErrOlderStart)

完整內容,請至幹話王 OTel 戰地筆記:破解 Delta to Cumulative 的兩大夢魘 (ErrOutOfOrder & ErrOlderS...

技術 剖析 OTel Collector Delta To Cumulative Processor

完整內容請至Blog 剖析 OTel Collector Delta To Cumulative Processor 這篇筆記主要記錄我在研究 OpenTele...

技術 Only 100 Metrics Matter 讀後感

完整內容在此, 幹話王_Only 100 Metrics Matter 讀後感 最近讀了〈Only 100 Metrics Matter〉,有些感想。核心觀點...

鐵人賽 DevOps DAY 30

技術 【Day 30】完賽心得:當你凝視深淵,深淵也凝視著你

完賽心得 鐵人賽挑戰的最後一天終於到來了。相比於去年的參賽經驗,我今年投入了更多的時間和精力,即便提前兩個半月開始準備,依然寫到了最後一天才完成所有內容。 最...

鐵人賽 DevOps DAY 29

技術 【Day 29】LLM 可觀測性與架構演進:從零到可治理、可優化、可規模化

前言 感謝陪伴著我近一個月的鐵人勇者們,再堅持一下我們快到終點了! 我們的旅程始於可觀測性,並以此為基點,深入到了 LLM 與 AI 應用的多個進階議題。這麼...

鐵人賽 DevOps DAY 28

技術 【Day 28】深入向量資料庫:理解 RAG 在 AI 時代依然至關重要

前言 前些陣子,社群上開始興起了 RAG 已死的言論,因為主流大模型的 Token 窗口已經大幅度的成長到百萬級別,足以消化大部分的資料並即時回應。這也使得一...

鐵人賽 DevOps DAY 27

技術 【Day 27】從 RAG 到 Agentic RAG:解放知識庫的真正潛力

前言 想像一下,一個大型語言模型(LLM)就像一位博學多聞、記憶力驚人的天才,但他的知識卻永遠停留在了「畢業」的那一天。對於畢業後世界上發生的任何新知、或是特...

鐵人賽 DevOps DAY 26

技術 【Day 26】探討 Context Engineering:打造新一代 AI 應用的核心引擎

前言 在過去幾年,大型語言模型 (LLM) 的浪潮席捲全球,「提示工程 (Prompt Engineering)」迅速成為 AI 開發者與愛好者人人都需掌握的...

鐵人賽 DevOps DAY 25

技術 【Day 25】從可觀測性到持續優化:深入 LLM Evaluation 的藝術與實踐

前言 在先前文章中,我們探討了 LLM 可觀測性平台的重要性。然而,僅僅能夠「看見」模型的行為是不夠的;我們還需要一套系統化的方法來「衡量」其優劣,這就是 L...

鐵人賽 DevOps DAY 24

技術 【Day 24】從程式碼到資產:深入 Prompt Management 的藝術與實踐

前言 在上一篇文章中,我們探討了 LLM 可觀測性平台的重要性。今天,我們將延伸這個主題,深入探討一個與其緊密相關且至關重要的領域:Prompt Manage...

鐵人賽 DevOps DAY 23

技術 【Day 23】導入 LLM 可觀測性不需從頭開始:善用 OpenTelemetry 完美整合現有架構

前言 在大型語言模型(LLM)應用席捲全球的今天,如何有效監控並觀測這些「黑盒子」的行為,已成為維運團隊最迫切的挑戰。許多團隊早已建立了成熟的 Grafana...

鐵人賽 DevOps DAY 22

技術 【Day 22】探討 LLM 可觀測性平台:讓你的 LLM 應用持續進化

前言 在 LLM 應用蓬勃發展的時代,將大型語言模型(LLM)推向生產環境往往只是旅程的開始,而不是結束。想像一下,一個聊天機器人應用在內部測試中表現完美,但...

鐵人賽 DevOps DAY 21

技術 【Day 21】透過 AI Gateway 實現 LLM 治理:從 LiteLLM 統一管理入口、成本與安全

前言 當企業擁抱大型語言模型(LLM)的強大能力時,隨之而來的是一系列「甜蜜的煩惱」。開發團隊可能在不同專案中使用了來自 OpenAI, Anthropic,...

鐵人賽 DevOps DAY 20

技術 【Day 20】打造安全可靠的 AI 應用:深入解析 LLM Guardrail 與 AI Gateway

前言 大型語言模型(LLM)的驚人能力正在改變各行各業,但伴隨而來的安全風險也日益凸顯。從惡意使用者透過各種「越獄」(Jailbreaking)手段誘導模型產...

鐵人賽 DevOps DAY 19

技術 【Day 19】AI Gateway 深度選型:從流量代理到智能控制平面

前言 在 LLM 應用從小規模 PoC 走向生產環境的過程中,AI Gateway 不再只是簡單的 API 轉發器,它已經演變為關鍵的「AI 控制平面」。 選...

鐵人賽 DevOps DAY 19

技術 Day19 - LLM 可觀測性實戰:監控延遲、Token 與成本(含工具選型)

🔹 前言 昨天我們完成了 API Gateway,讓前端可以透過一個統一的 Proxy 來存取 LLM。 但在真實運行環境裡,還有一個非常現實的問題: 👉 我的...

鐵人賽 DevOps DAY 18

技術 【Day 18】探討 AI Gateway 架構:LLM 基礎設施的守護神

前言 大型語言模型(LLM)的浪潮正以前所未有的速度席捲各行各業。從 OpenAI 的 GPT 系列、Anthropic 的 Claude,到 Google...

鐵人賽 DevOps DAY 17

技術 【Day 17】終結 LLM 應用混沌:AG-UI 協議如何統一通訊介面

當前,人工智慧的發展已經進入一個新紀元。從 OpenAI、Google 到 Anthropic,各大巨頭皆有能力開發出執行深度研究、編寫程式碼 (IDE) 或...

鐵人賽 DevOps DAY 16

技術 【Day 16】LLM 應用的交互模式:同步、非同步與串流架構解析

前言 在建構基於大型語言模型(LLM)的智能助手時,系統需要處理從簡單問答到複雜的 Agent 工作流(如多步驟推理、工具調用和跨代理協作)等不同任務。隨著系...

鐵人賽 DevOps DAY 15

技術 【Day 15】大規模 AI Agent 應用的維運與架構設計挑戰

一個響亮的聲音正在科技圈迴盪:「LLM Agent 時代來臨,人類不再需要學習軟體工程了!」這個論點極具誘惑力:當一個全能的 AI 助理可以根據你的自然語言需...