AI agent 從 demo 到 production 之間有一道鴻溝:
錯誤率未知、沒有回歸防護、邊界沒定義、上線後看不見。
這個系列從一個會出事的 demo agent 開始,30 天動手蓋一套 AI 可靠性工程:
黃金資料集、context engineering、規則評分器與 LLM-as-judge 校準、eval 掛進 CI、tracing 行車記錄器、紅隊演練(提示注入/目標劫持/工具濫用,對照 OWASP GenAI 2026),最後產出上線檢查清單與全套開源
我的 n8n 是自架在樹莓派上的,跑了兩年多,是家裡最可靠的成員。 上個月我用它搭了一個 agent,想說很單純:監看 Google 雲端硬碟裡的某個資料夾,有...
昨天說完我的 n8n agent 怎麼死的。今天先不急著動手——動手之前,先弄清楚我們到底要蓋什麼。 談「讓 agent 可靠」,你會一直看到三個詞:evals...
Day 01 我們看了一個 agent 怎麼死;Day 02 畫了地圖(驗鈔機、行車記錄器、安全帶)。今天開工。但在蓋「驗鈔機」之前,得先有那台出事的機器——...