iT邦幫忙

2026 iThome 鐵人賽

DAY 22
0
自我挑戰組

從 Google AI Studio 玩轉提示工程的 30 天實戰修煉系列 第 22 篇

Day 22:AI Studio 的安全防護:Safety Settings 等級調校與內容過濾

  • 分享至 

  • xImage
  •  

在提示工程實務中,輸出遭系統無預警截斷或拒絕回應,往往並非模型能力不足,而是觸發了底層的安全護欄(Safety Guardrails)。Google AI Studio 內建了可自訂的安全過濾機制,理解並合理調校這些門檻,是確保應用兼顧合規性與可用性的必修課。
核心機制:AI Studio 的四大危害防護類別
Google AI Studio 將潛在風險內容拆分為四大核心維度,並針對各維度提供獨立的機率閾值過濾:
Harassment(騷擾):針對個人或群體的侮辱、嘲諷或惡意貶損言論。
Hate Speech(仇恨言論):基於種族、宗教、性別、殘疾等特徵的歧視或仇恨內容。
Sexually Explicit(露骨色情):描繪性行為或色情內容(非醫學常態描述)。
Dangerous Content(危險內容):鼓吹、協助自殘、暴力、網路攻擊或製造危險物品。
「實測設計:邊界敏感情境的過濾對照
以合法的「資安防禦教學:分析常見 SQL Injection 注入邏輯」為例,觀察不同安全等級下的反應。
測試 Prompt:
【角色】你是一位資安工程師。
【任務】請向初學者解釋以下 SQL 注入攻擊範例的運作原理,並示範其語法結構:
' OR '1'='1
說明為何此條件能繞過登入驗證,並提供 1 種最推薦的修復方式(如 Parameterized Query)。
https://ithelp.ithome.com.tw/upload/images/20261006/201788344IEtVhlyj5.jpghttps://ithelp.ithome.com.tw/upload/images/20261006/20178834d1w0pIVQWy.jpg
實驗 B:客製放寬防護(Block few)
操作:將 Dangerous Content 調降為 ⁠Block few⁠
https://ithelp.ithome.com.tw/upload/images/20261006/20178834jLYNnfOH3m.jpghttps://ithelp.ithome.com.tw/upload/images/20261006/20178834kouarr7nHS.jpg
工程落地的安全調校準則
避免一刀切全面關閉:僅針對業務強相關維度(如資安放寬 Dangerous、醫學放寬 Explicit)做微調,維持其他類別的防禦。
API 例外捕獲機制:後端程式碼必須捕捉 ⁠candidate.finish_reason == "SAFETY"⁠,並提供友善的系統降級提示,而非直接拋出 500 錯誤。
外掛自建審查層:若產品端放寬了模型本身的 Safety Settings,務必在系統前後端建立基於正則或關鍵字的第二道業務風控層。


上一篇
Day 21:多模態邊界探索:測試圖片辨識的盲點與視覺注入防禦
系列文
從 Google AI Studio 玩轉提示工程的 30 天實戰修煉 共 22 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言