LLM 應用最痛的問題是指令與資料走同一條通道,prompt injection 至今沒有根治解法,護欄成了必要的一層。本系列以 Google Cloud Model Armor(雲端託管)與 地端自建的 ShieldGemma 微調護欄(地端)兩條線並行,從 OWASP LLM/Agentic Top 10 出發,實作 L1 規則、L2 分類器、L3 LLM-as-judge 三層防禦,涵蓋 Agent 工具呼叫與 MCP 場景,最後用同一套 zh-TW 攻擊語料與統一誤判率條件做誠實對照,給出金融級混合架構建議。每個數字附測試集與樣本數。
開場:先講一個不會出現在新聞裡的故事 去年幫一家金融機構做 AI 應用的資安評估,客服機器人已經上線兩個月,模型是好的、RAG 是好的、系統提示詞也寫得很認真。...
一個會議室裡發生過的對話 「我們的 AI 護欄上線了,仇恨言論、色情、暴力內容都擋得住。」「那 prompt injection 呢?」「……那個不是內容審查的...
先畫一張最簡單的圖 使用者 ──▶ [ input rails ] ──▶ LLM ──▶ [ output rails ] ──▶ 使用者 這張圖是所有護欄...
一個沒有人簽名的決策 昨天最後留了一個伏筆:護欄服務停機三小時,那三小時發生了什麼? 答案通常是「不知道」。因為在很多系統裡,護欄是這樣接的: try:...
為什麼不能只靠一個 guard model 「我們用一個 8B 的 guard model 掃所有流量。」——這是我最常聽到的地端護欄設計,也是最常在上線一個月...
沒有測試集的護欄,等於沒有護欄 Day 5 講的三層架構裡,L2 的兩個閾值要「用語料庫跑出來」。Week 4 要比較雲端與地端的攔截率。Day 27 要說「每...
Week 1 收尾 前六天把「為什麼」「防什麼」「放哪裡」「掛了怎麼辦」「怎麼分層」「拿什麼測」講完了。今天把兩條線的環境建起來,Week 2 開始所有文章都會...
Week 2 開場:先搞懂它的三個概念 Model Armor 的文件看起來很大,但核心只有三個東西:template(政策)、floor setting(最低...
今天要回答的三個問題 Model Armor 的 injection 偵測在六類語料上各擋得住多少? confidence level 三檔(LOW / ME...
Safety 側的唯一一篇重點 Day 2 說過本系列七成篇幅在 security。今天是 safety 側最主要的一篇,講 Model Armor 的 Res...