iT邦幫忙

2026 iThome 鐵人賽

DAY 9
0
AI Security

新手上路不當砲灰!30 天一章一章啃完 CompTIA SecAI+ 備考筆記系列 第 9

對抗性機器學習:六大攻擊模型的武器全景圖

  • 分享至 

  • xImage
  •  

大家好,今天我們正式進入 Domain 2。這塊在 SecAI+ 考試裡佔了整整 40% 的分數,是這科考試的核心決勝點。

前面八天,我們學的是 AI 的基礎,還有駭客怎麼把 AI 當成「武器」來打我們(像是用 Deepfake 詐騙、或是用大模型寫釣魚信)。
但從今天開始,攻防的主角要對調了。我們要看的是,駭客是怎麼去攻擊「AI 模型本身」的,而我們又該怎麼去保護它。
在資安上,這個領域有一個專屬名稱,叫做對抗性機器學習(Adversarial Machine Learning)

為什麼強大的 AI 模型會這麼容易被攻擊?
因為深度學習模型並不是像人類一樣真的「理解」事物的本質。它只是在訓練資料裡,尋找複雜的統計模式。
駭客只要看透了這一點,就能利用一些微小的改變,把 AI 耍得團團轉。

今天,我們就先來看看這六大攻擊類型,幫自己建立一個整體的攻防全景圖。


一、 兩大時間維度:什麼時候發動攻擊?

攻擊 AI 模型,主要分成兩個時間點:

1. 訓練期攻擊(Training-time Attacks)

這是在模型還沒生出來、或是在訓練的過程中就動手腳。
這種攻擊就像是在嬰兒時期就給他灌輸錯誤的觀念。它的效果是「永久性」的,因為惡意行為已經完全嵌入到模型的參數裡面了,事後很難逆轉。

  • 代表攻擊:資料可用性投毒、資料後門投毒。

2. 推論期攻擊(Inference-time Attacks)

這是在模型已經訓練好、部署上路(比如包裝成 API 供人使用)之後,駭客透過輸入「髒資料」或是瘋狂查詢,來騙過模型或偷走資料。
這類攻擊相對比較好預防,因為我們可以在 API 的入口處裝設防火牆來過濾。

  • 代表攻擊:對抗性樣本、模型竊取、模型反轉、成員推斷。

二、 三個盒子:駭客對模型知道多少?

除了時間點,駭客在發動攻擊時,手上有多少情報。這會決定他能用多強的手段:

  • 白箱(White-box):駭客對模型一清二楚。他知道你的模型架構、參數、訓練資料、權重,甚至可以算梯度。這能發動最強、最精準的攻擊。
  • 灰箱(Grey-box):駭客只知道一部分資訊。比如他知道你用的是哪種架構(像 Transformer),但不知道你具體的模型參數和權重。
  • 黑箱(Black-box):駭客什麼都不知道,只能透過 API 傳送輸入,然後看看輸出的結果。這是現實世界中,駭客最常遇到、也最難攻的場景。

三、 必須死記的六大攻擊手段

這六個攻擊是 Domain 2 的骨架,我們一定要在腦海裡有這個對照表:

攻擊名稱 發生時間 駭客的目標 一句話類比
可用性投毒 訓練期 破壞訓練,讓整隻模型失效 讓圖書館裡所有的書都發霉爛掉
後門投毒 訓練期 植入特定條件,觸發才做壞事 在書裡藏一頁暗號,看懂才發作
對抗性樣本 推論期 用微小的修改,騙過單次判斷 在停止標誌貼兩張貼紙,讓 AI 看成速限 80
模型竊取 推論期 透過大量查詢,免費複製你的模型 去餐廳點了 100 盤菜,反推出廚師的食譜
模型反轉 推論期 重建出訓練資料(可能包含個資) 透過影子形狀,反推出原本的人長怎樣
成員推斷 推論期 判定某筆個資是否在模型的訓練集裡 問 AI 「你認識這個人嗎」來偷挖隱私

今天的重點總結

  • 訓練期攻擊:效果永久,最難防。
  • 推論期攻擊:在 API 階段攻防。
  • 白箱 vs 黑箱:取決於駭客手上有多少模型的機密資訊。
  • 一定要把上面那張 六大攻擊預覽表 記熟,這是整個 Domain 2 的大綱,考題很常考你哪種攻擊的目的是什麼。

明天我們要講對抗性樣本的兩大必考演算法:FGSM 和 PGD。當然,數學很難搞定,只好用白話來搞懂它。
我們明天見啦!


上一篇
當駭客用 AI 來寫社交工程釣魚、改病毒:那些防毒軟體認不出來的威脅
系列文
新手上路不當砲灰!30 天一章一章啃完 CompTIA SecAI+ 備考筆記9
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言