前面幾篇談的都是 GCP 平台層的託管服務,這篇要介紹一個不一樣性質的防線:ShieldGemma,Google 開放權重的安全分類器模型。這是我目前在公司被指派研究與開發的實際任務。
ShieldGemma 目前有兩代:
ShieldGemma 1:建立在 Gemma 2 之上的文字安全分類器,提供 2B、9B、27B 三種參數規模,鎖定四種危害類別:性暗示內容、危險內容、仇恨言論、騷擾。
ShieldGemma 2:建立在 Gemma 3 之上,4B 參數,把偵測對象從文字轉向圖像——檢查生成或真實圖片的安全性,官方建議的用法是放在視覺語言模型的輸入端做過濾,或是放在圖像生成系統的輸出端做把關。
兩者都是開放權重(open weights),可以下載下來自行部署,也可以針對企業自己的政策定義做微調——這正是它跟 Model Armor 最大的差異所在。
ShieldGemma 的判斷邏輯,本質上是把「安全分類」這件事,包裝成一次 LLM 推論:輸入格式包含一段前言(preamble)、待判斷的內容本身、你定義的政策描述、以及一段提示結尾,模型輸出的是簡單的 Yes/No 判斷(是否違反指定政策)。這種設計的好處是政策本身用自然語言描述,不需要重新訓練模型就能調整判斷標準——只要修改 Prompt 裡的政策描述即可。
| 面向 | Model Armor(主題一 Day21) | ShieldGemma |
|---|---|---|
| 部署方式 | GCP 託管服務,直接呼叫 API | 開放權重,自行下載部署 |
| 客製化程度 | 透過 Templates 客製政策 | 可直接微調模型權重,客製化程度更高 |
| 維運責任 | Google 負責維運與更新 | 企業自行負責部署、擴縮、更新 |
| 適用情境 | 快速導入、不想自行維運模型的場景 | 需要高度客製化政策、或有資料主權考量需要自架的場景 |
兩者不是二選一的競爭關係,實務上可以疊加使用:Model Armor 作為第一道快速過濾,ShieldGemma 作為針對特定業務場景客製化過的第二道判斷。
回到這個系列的主軸——Agent 攻防。ShieldGemma 在 Agent 架構裡可以放在兩個位置:輸入端攔截 Day7 談的間接注入來源,輸出端檢查 Agent 產出是否符合政策(對 Day9 的記憶污染防禦也有幫助,寫入長期記憶前的內容同樣可以過這一關)。
ShieldGemma 的權重可以從 Kaggle Models、Hugging Face,或是透過 Vertex AI Model Garden 取得。
待實測提醒:ShieldGemma 各版本的參數規模、支援的政策類別範圍會隨 Google 持續更新版本而調整,發布前請對照 ShieldGemma 官方文件與 model card 確認目前最新版本資訊。
💡 關於作者 我是 Fngi,專注在 AI 安全與雲端資安領域。
歡迎追蹤 Instagram @aid3fend,我在那裡分享更多 AI 資安的實務筆記與趨勢觀察。