iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Security

《30 天打造 AI Guardrails》 系列

LLM 應用最痛的問題是指令與資料走同一條通道,prompt injection 至今沒有根治解法,護欄成了必要的一層。本系列以 Google Cloud Model Armor(雲端託管)與 地端自建的 ShieldGemma 微調護欄(地端)兩條線並行,從 OWASP LLM/Agentic Top 10 出發,實作 L1 規則、L2 分類器、L3 LLM-as-judge 三層防禦,涵蓋 Agent 工具呼叫與 MCP 場景,最後用同一套 zh-TW 攻擊語料與統一誤判率條件做誠實對照,給出金融級混合架構建議。每個數字附測試集與樣本數。

參賽天數 22 天 | 共 22 篇文章 | 1 人訂閱 訂閱系列文 RSS系列文
DAY 11

Day 11|Sensitive Data Protection 整合:PII 偵測的邊界

先講範圍 PII 在本系列只佔兩天(今天與 Day 16),原因寫在 Day 10 結尾:完整的去識別化、可控還原與台灣特種個資處理,是另一個 30 天系列《L...

2026-09-20 ‧ 由 Fngi 分享
DAY 12

Day 12|惡意 URL 偵測與 streaming sanitization

為什麼輸出端要管 URL 一個被間接注入成功的 RAG 助理,最常見的下手方式不是直接洩漏資料,而是在回應裡放一個連結:「更多資訊請見 https://…」。使...

2026-09-21 ‧ 由 Fngi 分享
DAY 13

Day 13|Vertex AI 上的 in-line 整合:Gemini 呼叫零改碼接上

從「自己呼叫」到「自動套用」Day 8–12 的所有測試都是 Day 3 講的「位置 A」:程式碼自己在呼叫模型前後打 sanitize API。這種做法的問題...

2026-09-22 ‧ 由 Fngi 分享
DAY 14

Day 14|Apigee / GKE 整合:非 Gemini 模型也吃得到

企業的真實狀況:模型不只一個 Day 13 的零改碼只對 Vertex AI 上的 Gemini 有效。但企業的真實狀況是:客服用 Gemini、內部工具接 O...

2026-09-23 ‧ 由 Fngi 分享
DAY 15

Day 15|L1 確定性規則引擎:regex、checksum、denylist 的實作

Week 3 開場:從最便宜的一層開始 雲端線走完了。Week 3 在 DGX Spark 上把地端護欄從零疊起來,順序照 Day 5 的三層:今天與明天是 L...

2026-09-24 ‧ 由 Fngi 分享
DAY 16

Day 16|台灣 PII 快篩層:身分證/統編/健保卡 checksum

為什麼 checksum 值得一整天 Day 11 實測 DLP 自訂 infoType 只能做 regex。[A-Z][12]\d{8} 這個模式在真實文本裡...

2026-09-25 ‧ 由 Fngi 分享
DAY 17

Day 17|Guard model 選型:ShieldGemma、Nemotron Safety Guard、Qwen3Guard 的採購與內容政策考量

L2 要選一個模型,選型不是看 benchmark 就好 地端線的 L2 是一個小型分類器模型。候選很多,但金融業客戶的選型會議上,benchmark 分數通常...

2026-09-26 ‧ 由 Fngi 分享
DAY 18

Day 18|ShieldGemma 在 GB10 上的推論部署與延遲量測

第一個坑:ARM DGX Spark 的 GB10 是 Grace CPU + Blackwell GPU,CPU 是 aarch64。很多現成的推論容器只有...

2026-09-27 ‧ 由 Fngi 分享
DAY 19

Day 19|微調 ShieldGemma:zh-TW injection 資料集準備

微調要解決的問題,先寫清楚 Day 17 的基準測試(未微調)預期會顯示兩個缺口:ShieldGemma 原本是 safety 分類器,對 injection...

2026-09-28 ‧ 由 Fngi 分享
DAY 20

Day 20|微調實作與原版對照評估

訓練設定 用 LoRA 而不是全參數微調,理由:資料量不大(千筆級)、任務單一、要保留原版能力、GB10 訓練時間可控。 # train/lora_sft.py...

2026-09-29 ‧ 由 Fngi 分享