iT邦幫忙

2026 iThome 鐵人賽

DAY 5
0
AI Security

《Agentic AI 攻防 1~30 天》系列 第 15

Day 15|ShieldGemma 概論:開放權重護欄分類器與 Model Armor 的分工

  • 分享至 

  • xImage
  •  

這是我目前在公司實際研究與開發的題目

前面幾篇談的都是 GCP 平台層的託管服務,這篇要介紹一個不一樣性質的防線:ShieldGemma,Google 開放權重的安全分類器模型。這是我目前在公司被指派研究與開發的實際任務。

ShieldGemma 是什麼

ShieldGemma 目前有兩代:

ShieldGemma 1:建立在 Gemma 2 之上的文字安全分類器,提供 2B、9B、27B 三種參數規模,鎖定四種危害類別:性暗示內容、危險內容、仇恨言論、騷擾。

ShieldGemma 2:建立在 Gemma 3 之上,4B 參數,把偵測對象從文字轉向圖像——檢查生成或真實圖片的安全性,官方建議的用法是放在視覺語言模型的輸入端做過濾,或是放在圖像生成系統的輸出端做把關。

兩者都是開放權重(open weights),可以下載下來自行部署,也可以針對企業自己的政策定義做微調——這正是它跟 Model Armor 最大的差異所在。

運作邏輯:LLM-as-Judge

ShieldGemma 的判斷邏輯,本質上是把「安全分類」這件事,包裝成一次 LLM 推論:輸入格式包含一段前言(preamble)、待判斷的內容本身、你定義的政策描述、以及一段提示結尾,模型輸出的是簡單的 Yes/No 判斷(是否違反指定政策)。這種設計的好處是政策本身用自然語言描述,不需要重新訓練模型就能調整判斷標準——只要修改 Prompt 裡的政策描述即可。

跟 Model Armor 的分工:託管服務 vs 開放權重

面向 Model Armor(主題一 Day21) ShieldGemma
部署方式 GCP 託管服務,直接呼叫 API 開放權重,自行下載部署
客製化程度 透過 Templates 客製政策 可直接微調模型權重,客製化程度更高
維運責任 Google 負責維運與更新 企業自行負責部署、擴縮、更新
適用情境 快速導入、不想自行維運模型的場景 需要高度客製化政策、或有資料主權考量需要自架的場景

兩者不是二選一的競爭關係,實務上可以疊加使用:Model Armor 作為第一道快速過濾,ShieldGemma 作為針對特定業務場景客製化過的第二道判斷。

在 Agent 架構裡的位置

回到這個系列的主軸——Agent 攻防。ShieldGemma 在 Agent 架構裡可以放在兩個位置:輸入端攔截 Day7 談的間接注入來源,輸出端檢查 Agent 產出是否符合政策(對 Day9 的記憶污染防禦也有幫助,寫入長期記憶前的內容同樣可以過這一關)。

取得方式

ShieldGemma 的權重可以從 Kaggle Models、Hugging Face,或是透過 Vertex AI Model Garden 取得。

待實測提醒:ShieldGemma 各版本的參數規模、支援的政策類別範圍會隨 Google 持續更新版本而調整,發布前請對照 ShieldGemma 官方文件與 model card 確認目前最新版本資訊。

這篇的檢查清單

  • [ ] 是否已釐清自己的場景更適合 Model Armor(快速導入)還是 ShieldGemma(高度客製化)?
  • [ ] 是否已評估兩者疊加使用的可行性,而非只選其中一個?
  • [ ] Agent 架構中,護欄該放在輸入端、輸出端,還是兩者皆有?


💡 關於作者 我是 Fngi,專注在 AI 安全與雲端資安領域。
歡迎追蹤 Instagram @aid3fend,我在那裡分享更多 AI 資安的實務筆記與趨勢觀察。


上一篇
Day 14|Cloud Armor 保護 Agent 對外 API Endpoint
下一篇
Day 16|護欄的多層架構思維:Agent 防線裡的一環
系列文
《Agentic AI 攻防 1~30 天》19
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言