iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Security

《30 天打造 AI Guardrails》 系列

LLM 應用最痛的問題是指令與資料走同一條通道,prompt injection 至今沒有根治解法,護欄成了必要的一層。本系列以 Google Cloud Model Armor(雲端託管)與 地端自建的 ShieldGemma 微調護欄(地端)兩條線並行,從 OWASP LLM/Agentic Top 10 出發,實作 L1 規則、L2 分類器、L3 LLM-as-judge 三層防禦,涵蓋 Agent 工具呼叫與 MCP 場景,最後用同一套 zh-TW 攻擊語料與統一誤判率條件做誠實對照,給出金融級混合架構建議。每個數字附測試集與樣本數。

參賽天數 22 天 | 共 22 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文
DAY 1

Day 1|為什麼 LLM 需要護欄:OWASP LLM Top 10 與 Agentic Top 10 對照

開場:先講一個不會出現在新聞裡的故事 去年幫一家金融機構做 AI 應用的資安評估,客服機器人已經上線兩個月,模型是好的、RAG 是好的、系統提示詞也寫得很認真。...

2026-09-10 ‧ 由 Fngi 分享
DAY 2

Day 2|護欄不是內容審查:安全(safety)與資安(security)的分界

一個會議室裡發生過的對話 「我們的 AI 護欄上線了,仇恨言論、色情、暴力內容都擋得住。」「那 prompt injection 呢?」「……那個不是內容審查的...

2026-09-11 ‧ 由 Fngi 分享
DAY 3

Day 3|攔截點設計:input rails → LLM → output rails

先畫一張最簡單的圖 使用者 ──▶ [ input rails ] ──▶ LLM ──▶ [ output rails ] ──▶ 使用者 這張圖是所有護欄...

2026-09-12 ‧ 由 Fngi 分享
DAY 4

Day 4|fail-open 還是 fail-closed?護欄服務掛掉時你選哪邊

一個沒有人簽名的決策 昨天最後留了一個伏筆:護欄服務停機三小時,那三小時發生了什麼? 答案通常是「不知道」。因為在很多系統裡,護欄是這樣接的: try:...

2026-09-13 ‧ 由 Fngi 分享
DAY 5

Day 5|三層防禦:L1 規則、L2 小模型、L3 LLM-as-judge

為什麼不能只靠一個 guard model 「我們用一個 8B 的 guard model 掃所有流量。」——這是我最常聽到的地端護欄設計,也是最常在上線一個月...

2026-09-14 ‧ 由 Fngi 分享
DAY 6

Day 6|攻擊語料庫建立:從公開 benchmark 到自製紅隊案例

沒有測試集的護欄,等於沒有護欄 Day 5 講的三層架構裡,L2 的兩個閾值要「用語料庫跑出來」。Week 4 要比較雲端與地端的攔截率。Day 27 要說「每...

2026-09-15 ‧ 由 Fngi 分享
DAY 7

Day 7|本系列實驗環境:GCP 專案 + DGX Spark 地端對照組

Week 1 收尾 前六天把「為什麼」「防什麼」「放哪裡」「掛了怎麼辦」「怎麼分層」「拿什麼測」講完了。今天把兩條線的環境建起來,Week 2 開始所有文章都會...

2026-09-16 ‧ 由 Fngi 分享
DAY 8

Day 8|Model Armor 初探:template、floor setting、filter 版本

Week 2 開場:先搞懂它的三個概念 Model Armor 的文件看起來很大,但核心只有三個東西:template(政策)、floor setting(最低...

2026-09-17 ‧ 由 Fngi 分享
DAY 9

Day 9|prompt injection / jailbreak 偵測實測

今天要回答的三個問題 Model Armor 的 injection 偵測在六類語料上各擋得住多少? confidence level 三檔(LOW / ME...

2026-09-18 ‧ 由 Fngi 分享
DAY 10

Day 10|內容安全四類別與 confidence threshold 調校

Safety 側的唯一一篇重點 Day 2 說過本系列七成篇幅在 security。今天是 safety 側最主要的一篇,講 Model Armor 的 Res...

2026-09-19 ‧ 由 Fngi 分享