iT邦幫忙

2026 iThome 鐵人賽

DAY 17
0
AI Security

《30 天打造 AI Guardrails》系列 第 17 篇

Day 17|Guard model 選型:ShieldGemma、Nemotron Safety Guard、Qwen3Guard 的採購與內容政策考量

  • 分享至 

  • xImage
  •  

L2 要選一個模型,選型不是看 benchmark 就好

地端線的 L2 是一個小型分類器模型。候選很多,但金融業客戶的選型會議上,benchmark 分數通常是最後一個被討論的——前面要先過授權、產地、內容政策三關。今天把這三關和候選模型攤開講。

候選清單

模型 出品 規模 設計目標 語言 授權
ShieldGemma Google 2B / 9B / 27B(Gemma 2 base) 內容安全四類別分類(safety) 英文為主 Gemma 授權
ShieldGemma 2 Google 4B(Gemma 3 base) 圖像安全分類 — Gemma 授權
Prompt Guard 2 Meta 22M / 86M injection / jailbreak 專用 多語言 Llama 授權
Llama Guard 4 Meta 12B 內容安全(safety),多模態 多語言 Llama 授權
Nemotron Safety Guard NVIDIA 8B(Llama 3.1 base) 內容安全,多語言,含 injection 相關類別 多語言 NVIDIA 開放模型授權
Qwen3Guard Alibaba 0.6B / 4B / 8B 內容安全三級嚴重度,多語言 119 種語言含 zh Apache 2.0
Granite Guardian IBM 多種規模 內容安全 + RAG 幻覺 + agentic 風險 英文為主 Apache 2.0

看第四欄就會發現 Day 2 的分界再次出現:大多數 guard model 是 safety 分類器,不是 security 分類器。真正針對 injection 設計的只有 Prompt Guard 2 這種小模型。這決定了後面兩天要做微調。

第一關:授權

  • Apache 2.0 最乾淨,商用、修改、再散布都沒有問題。
  • Gemma 授權與 Llama 授權都允許商用,但各有使用政策條款與再散布要求。企業採購時法務會逐條看,特別是「衍生模型」的授權延續義務——微調後的模型算衍生,Day 20 產出的東西要遵守 base model 的授權。
  • NVIDIA 的開放模型授權同樣要看再散布條款。

第二關:產地與資通安全規範

台灣的公務機關與部分金融機構,對特定產地的資通訊產品有採購限制。這個限制對「開源模型權重」是否適用,目前沒有統一解釋,各機構的資安與法遵單位判斷不同。實務上我看到的是:

  • 有些機構直接排除,不討論。
  • 有些機構接受,但要求離線部署、不連回原廠、且要有第三方評估報告。
  • 有些機構要求提供「模型來源與訓練資料聲明」,而多數開源模型給不出來。

Qwen3Guard 在中文語料上的表現很可能是候選裡最好的,但在這一關會被許多台灣金融客戶擋下。這不是技術判斷,是採購現實,選型文件要誠實寫出來,而不是假裝這個問題不存在。

第三關:內容政策

每個 guard model 內建的「什麼算有害」是出品方的政策。這會影響兩件事:

  1. 過度拒絕的方向:不同出品方對敏感議題(政治、宗教、特定歷史事件)的分類邊界不同。用 XSTest 加上自製的台灣語境敏感題測,Day 26 會跑。
  2. 可不可以改政策:ShieldGemma 的設計是把政策文字放在 prompt 裡,理論上可以自訂類別;Llama Guard 也是類似設計;有些模型的類別是訓練時固定的。可自訂政策的模型,才能被微調成 security 分類器——這是 Day 19 選 ShieldGemma 而不是其他模型的主要原因。

第四關才是 benchmark

過了前三關,才用 Day 6 的 eval 集跑基準(未微調、原版政策):

預期會看到的模式(以實測為準):safety 類模型對 injection 的原版攔截率偏低、Prompt Guard 2 對英文 injection 好但中文弱、所有模型的 zh-TW 都比英文差。這些就是微調要補的。

本系列的選擇與理由

本系列選 **ShieldGemma(Gemma 2 base)**作為 L2 主模型,並考慮用 Prompt Guard 2 作為輕量前置:

  1. 政策可自訂,可以微調成 security 分類器。
  2. 與雲端線同屬 Google 模型家族,兩條線的對照更乾淨。
  3. Gemma 授權對金融客戶的法務可接受,產地關不會被擋。
  4. 規模選擇有彈性:2B 給延遲敏感的場景,9B 給準確率優先的場景。

代價:zh-TW 原版表現要靠微調補,這是 Day 19–20 的工作量。

明天預告

Day 18:ShieldGemma 在 GB10 上的推論部署與延遲量測。DGX Spark 是 ARM 架構,容器映像的相容性是第一個坑;然後量 2B 與 9B 在不同 batch 下的延遲曲線。


追蹤 AId3fend

💡 關於作者 我是 Fngi,專注在 AI 安全與雲端資安領域。如果這篇對你有幫助,歡迎追蹤 Instagram @aid3fend,我在那裡分享更多 AI 資安的實務筆記與趨勢觀察。


上一篇
Day 16|台灣 PII 快篩層:身分證/統編/健保卡 checksum
下一篇
Day 18|ShieldGemma 在 GB10 上的推論部署與延遲量測
系列文
《30 天打造 AI Guardrails》 共 21 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言