LLM 應用最痛的問題是指令與資料走同一條通道,prompt injection 至今沒有根治解法,護欄成了必要的一層。本系列以 Google Cloud Model Armor(雲端託管)與 地端自建的 ShieldGemma 微調護欄(地端)兩條線並行,從 OWASP LLM/Agentic Top 10 出發,實作 L1 規則、L2 分類器、L3 LLM-as-judge 三層防禦,涵蓋 Agent 工具呼叫與 MCP 場景,最後用同一套 zh-TW 攻擊語料與統一誤判率條件做誠實對照,給出金融級混合架構建議。每個數字附測試集與樣本數。
開場:先講一個不會出現在新聞裡的故事 去年幫一家金融機構做 AI 應用的資安評估,客服機器人已經上線兩個月,模型是好的、RAG 是好的、系統提示詞也寫得很認真。...