大家好,今天我們正式進入 Domain 2。這塊在 SecAI+ 考試裡佔了整整 40% 的分數,是這科考試的核心決勝點。
前面八天,我們學的是 AI 的基礎,還有駭客怎麼把 AI 當成「武器」來打我們(像是用 Deepfake 詐騙、或是用大模型寫釣魚信)。
但從今天開始,攻防的主角要對調了。我們要看的是,駭客是怎麼去攻擊「AI 模型本身」的,而我們又該怎麼去保護它。
在資安上,這個領域有一個專屬名稱,叫做對抗性機器學習(Adversarial Machine Learning)。
為什麼強大的 AI 模型會這麼容易被攻擊?
因為深度學習模型並不是像人類一樣真的「理解」事物的本質。它只是在訓練資料裡,尋找複雜的統計模式。
駭客只要看透了這一點,就能利用一些微小的改變,把 AI 耍得團團轉。
今天,我們就先來看看這六大攻擊類型,幫自己建立一個整體的攻防全景圖。
攻擊 AI 模型,主要分成兩個時間點:
這是在模型還沒生出來、或是在訓練的過程中就動手腳。
這種攻擊就像是在嬰兒時期就給他灌輸錯誤的觀念。它的效果是「永久性」的,因為惡意行為已經完全嵌入到模型的參數裡面了,事後很難逆轉。
這是在模型已經訓練好、部署上路(比如包裝成 API 供人使用)之後,駭客透過輸入「髒資料」或是瘋狂查詢,來騙過模型或偷走資料。
這類攻擊相對比較好預防,因為我們可以在 API 的入口處裝設防火牆來過濾。
除了時間點,駭客在發動攻擊時,手上有多少情報。這會決定他能用多強的手段:
這六個攻擊是 Domain 2 的骨架,我們一定要在腦海裡有這個對照表:
| 攻擊名稱 | 發生時間 | 駭客的目標 | 一句話類比 |
|---|---|---|---|
| 可用性投毒 | 訓練期 | 破壞訓練,讓整隻模型失效 | 讓圖書館裡所有的書都發霉爛掉 |
| 後門投毒 | 訓練期 | 植入特定條件,觸發才做壞事 | 在書裡藏一頁暗號,看懂才發作 |
| 對抗性樣本 | 推論期 | 用微小的修改,騙過單次判斷 | 在停止標誌貼兩張貼紙,讓 AI 看成速限 80 |
| 模型竊取 | 推論期 | 透過大量查詢,免費複製你的模型 | 去餐廳點了 100 盤菜,反推出廚師的食譜 |
| 模型反轉 | 推論期 | 重建出訓練資料(可能包含個資) | 透過影子形狀,反推出原本的人長怎樣 |
| 成員推斷 | 推論期 | 判定某筆個資是否在模型的訓練集裡 | 問 AI 「你認識這個人嗎」來偷挖隱私 |
明天我們要講對抗性樣本的兩大必考演算法:FGSM 和 PGD。當然,數學很難搞定,只好用白話來搞懂它。
我們明天見啦!