地端線的 L2 是一個小型分類器模型。候選很多,但金融業客戶的選型會議上,benchmark 分數通常是最後一個被討論的——前面要先過授權、產地、內容政策三關。今天把這三關和候選模型攤開講。
| 模型 | 出品 | 規模 | 設計目標 | 語言 | 授權 |
|---|---|---|---|---|---|
| ShieldGemma | 2B / 9B / 27B(Gemma 2 base) | 內容安全四類別分類(safety) | 英文為主 | Gemma 授權 | |
| ShieldGemma 2 | 4B(Gemma 3 base) | 圖像安全分類 | — | Gemma 授權 | |
| Prompt Guard 2 | Meta | 22M / 86M | injection / jailbreak 專用 | 多語言 | Llama 授權 |
| Llama Guard 4 | Meta | 12B | 內容安全(safety),多模態 | 多語言 | Llama 授權 |
| Nemotron Safety Guard | NVIDIA | 8B(Llama 3.1 base) | 內容安全,多語言,含 injection 相關類別 | 多語言 | NVIDIA 開放模型授權 |
| Qwen3Guard | Alibaba | 0.6B / 4B / 8B | 內容安全三級嚴重度,多語言 | 119 種語言含 zh | Apache 2.0 |
| Granite Guardian | IBM | 多種規模 | 內容安全 + RAG 幻覺 + agentic 風險 | 英文為主 | Apache 2.0 |
看第四欄就會發現 Day 2 的分界再次出現:大多數 guard model 是 safety 分類器,不是 security 分類器。真正針對 injection 設計的只有 Prompt Guard 2 這種小模型。這決定了後面兩天要做微調。
台灣的公務機關與部分金融機構,對特定產地的資通訊產品有採購限制。這個限制對「開源模型權重」是否適用,目前沒有統一解釋,各機構的資安與法遵單位判斷不同。實務上我看到的是:
Qwen3Guard 在中文語料上的表現很可能是候選裡最好的,但在這一關會被許多台灣金融客戶擋下。這不是技術判斷,是採購現實,選型文件要誠實寫出來,而不是假裝這個問題不存在。
每個 guard model 內建的「什麼算有害」是出品方的政策。這會影響兩件事:
過了前三關,才用 Day 6 的 eval 集跑基準(未微調、原版政策):
預期會看到的模式(以實測為準):safety 類模型對 injection 的原版攔截率偏低、Prompt Guard 2 對英文 injection 好但中文弱、所有模型的 zh-TW 都比英文差。這些就是微調要補的。
本系列選 **ShieldGemma(Gemma 2 base)**作為 L2 主模型,並考慮用 Prompt Guard 2 作為輕量前置:
代價:zh-TW 原版表現要靠微調補,這是 Day 19–20 的工作量。
Day 18:ShieldGemma 在 GB10 上的推論部署與延遲量測。DGX Spark 是 ARM 架構,容器映像的相容性是第一個坑;然後量 2B 與 9B 在不同 batch 下的延遲曲線。
💡 關於作者 我是 Fngi,專注在 AI 安全與雲端資安領域。如果這篇對你有幫助,歡迎追蹤 Instagram @aid3fend,我在那裡分享更多 AI 資安的實務筆記與趨勢觀察。