大家好,因為 Domain 2 佔了 SecAI+ 考試整整 40% 的分數,所以把知識整理成「攻防對照大表」,方便把所有破碎的知識點瞬間串連起來。
這是最基礎的分類。只要看到題目的攻擊名稱,你腦海裡要立刻浮現它是發生在什麼時候:
對抗性機器學習(Adversarial ML)攻擊全景
訓練期攻擊(在模型出生前下毒,效果永久):
├── 資料可用性投毒(類似 DoS,讓模型直接變笨)
└── 資料後門/木馬投毒(塞入 Trigger 暗號,特定條件才造反)
推論期攻擊(在模型部署上線後,用髒輸入來騙它或偷它):
├── 對抗性樣本(FGSM、PGD 算梯度加微小雜訊騙 AI 眼睛)
├── 模型竊取(大量查詢 API,免費拷貝出一個替代模型)
├── 模型反轉(用梯度優化,還原出訓練集裡的隱私個資)
├── 成員推斷(利用過擬合分數落差,確認特定人是否在訓練集裡)
├── 提示詞注入(直接注入、間接注入)
└── 越獄攻擊(DAN、Many-shot 等逼 AI 講壞話的手法)
這一張表,把我們過去十幾天學過的所有攻擊與防禦,做了最完美的對應。請一定要死記:
| 攻擊名稱 | 發生時間 | 駭客的核心機制 | 防禦方的核心武器 |
|---|---|---|---|
| 對抗性樣本 | 推論期 | 沿著損失梯度方向,對輸入加入人眼看不見的雜訊。 | 對抗性訓練(Adversarial Training)、輸入前處理去噪。 |
| 遷移攻擊 | 推論期 | 在自家替代模型上算的雜訊,有很高的機率能騙過黑箱模型。 | 模型整合(Ensemble)多模型投票。 |
| 可用性投毒 | 訓練期 | 大量污染資料(>10%),讓模型學不出規律(AI 的 DoS 攻擊)。 | 資料出處追蹤(Data Provenance)、資料清洗排除離群值。 |
| 後門/木馬投毒 | 訓練期 | 污染極少資料(0.1%),植入特定 Trigger(暗號),平時精準。 | Neural Cleanse(後門掃描)、資料來源審計。 |
| 模型竊取 | 推論期 | 瘋狂呼叫 API,利用回傳值訓練出等效的替代模型。 | 速率限制(Rate Limiting)、只回傳 Top-1、模型浮水印。 |
| 模型反轉 | 推論期 | 透過梯度優化調整輸入,直到模型輸出高置信度,還原個資。 | 差分隱私(Differential Privacy)、限制 API 信心分數。 |
| 成員推斷 | 推論期 | 利用模型對訓練資料過擬合(分數特別高),抓出成員個資。 | 差分隱私、做好模型正則化防止過擬合。 |
| 直接提示詞注入 | 推論期 | 在輸入框直接輸入指令覆蓋 System Prompt。 | 強化 System Prompt 設計、輸入端注入分類器偵測。 |
| 間接提示詞注入 | 推論期 | 惡意指令藏在 AI 要讀取的外部資料中(網頁/郵件/PDF)。 | Human-in-the-loop(人工確認)、最小權限原則。 |
| 越獄攻擊 | 推論期 | 透過角色扮演、Many-shot、Token 混淆,繞過安全對齊限制。 | RLHF、憲法 AI(Constitutional AI)、Guardrails(護欄)。 |
考試非常喜歡考「安全與效能的拉鋸戰」,沒有什麼防禦是沒有代價的:
明天,我們要正式告別 Domain 2,進入 Domain 3:AI 輔助資安營運(AI-Assisted Security)。
我們要來看看防守方如何利用 AI 強化傳統的 SIEM,解決 SOC 內部讓人頭痛的「警報疲勞(Alert Fatigue)」問題。
我們明天見啦!