iT邦幫忙

2026 iThome 鐵人賽

DAY 10
0
AI Security

新手上路不當砲灰!30 天一章一章啃完 CompTIA SecAI+ 備考筆記系列 第 10

騙過 AI 眼睛的特殊貼紙:對抗性樣本與 FGSM/PGD 演算法

  • 分享至 

  • xImage
  •  

大家好,今天我們就要來深入拆解裡面最經典的:對抗性樣本攻擊(Adversarial Example Attack)

你可能在網路上看過這個著名的實驗:
研究人員在一個紅色的「停止標誌(STOP sign)」上,貼了幾張看起來非常普通的黑白貼紙。
在我們人類眼裡,這不管怎麼看,都還是一個停止標誌。
但是,自動駕駛汽車的 AI 看到後,卻以 100% 的信心,把它判定成了「限速 45 英里」的標誌!
如果這台車開在路上,它就會直接衝過去,這在現實中可是會出人命的。

這就是對抗性樣本的神奇與可怕之處。今天,我們就來聊聊它是怎麼被做出來的,以及兩大白箱攻擊演算法。


一、 什麼是對抗性樣本?

對抗性樣本,就是在正常的輸入(比如一張照片)中,加入微小、但經過精心設計的雜訊
這些雜訊非常微弱,人眼根本察覺不出來,但卻能讓 AI 模型的判定結果完全翻轉。

最著名的例子就是「熊貓變長臂猿」:

一張熊貓的照片,AI 本來 98% 判定是熊貓。
駭客在上面加上一層看起來像電視雜訊、但極其微弱的干擾。
人類看照片覺得完全沒變,但 AI 卻以 99% 的信心,判定這是一隻長臂猿。

為什麼會這樣?
因為 AI 其實不是真的「看懂」熊貓,它只是在數學的高維空間裡,計算像素之間的統計特徵。
駭客只要在對的方向上稍微推一把(加點雜訊),就能把這張照片推過 AI 的決策邊界,讓 AI 認錯。


二、 白箱攻擊的兩大神兵

如果駭客知道模型的所有參數(白箱攻擊),他有兩種最常用的數學方法來產生這些雜訊:

1. FGSM(快速梯度符號法)

這是 2014 年由生成對抗網路(GAN)之父 Goodfellow 提出來的,是最基礎的白箱攻擊。

  • 原理
    我們在訓練模型時,是用「梯度下降」來減少錯誤率。
    FGSM 反其道而行。它利用模型的梯度,去計算「朝哪個方向加雜訊,最能增加模型的錯誤率」。
    然後,它「一次性」地往那個方向加上 ε(很小的干擾)。
  • 特點
    一步就算完,速度非常快,但生成的攻擊樣本比較弱,容易被防住。

2. PGD(投影梯度下降)

這就是 FGSM 的超級加強版。

  • 原理
    既然 FGSM 只推一次不夠強,那 PGD 就決定「分很多小步來推」。
    它每一次只加一點點更小的雜訊,算一次梯度,然後再加一點點。
    為了防止雜訊加得太大、被人類肉眼看出來,它在每一步之後,都會把雜訊「投影」限制在一個安全的範圍內。
  • 特點
    雖然計算比較慢,但威力極強。在資安界,PGD 被公認是測試 AI 模型防禦力的「黃金標準(Strong Baseline)」。

三、 黑箱攻擊怎麼辦?遷移攻擊(Transfer Attack)

如果駭客拿不到模型的參數(黑箱攻擊),只有一個 API 窗口,那他要怎麼算梯度、加雜訊?
這時候,駭客會利用一個 AI 的奇妙特性,叫做對抗性遷移性(Adversarial Transferability)

攻擊步驟如下:

  1. 訓練替代模型(Surrogate Model)
    駭客自己用類似的資料,訓練一個自己的 AI 模型。
  2. 自己打自己
    在自己的這個模型上,用白箱的 PGD 算梯度,產生對抗性樣本。
  3. 直接調包
    把這個在自家產生的髒照片,直接拿去丟給目標的黑箱 API。

科學家發現,因為不同模型雖然架構不同,但在特徵空間裡的脆弱方向往往很像。所以,能騙過 A 模型的照片,有非常高的機率也能騙過 B 模型。這就叫遷移攻擊


四、 我們該怎麼防?

對付這種微小雜訊,有幾種防禦手段:

  • 對抗性訓練(Adversarial Training)★ 考試最常考
    這也是目前最有效的防禦。作法是「預防接種」,我們在訓練 AI 時,就把大量的 FGSM/PGD 對抗性樣本混進訓練集裡,直接教 AI 認識這些髒資料。
  • 輸入前處理(Input Preprocessing)
    在照片丟給 AI 之前,先做去噪、模糊化或壓縮,把駭客精心設計的雜訊給「洗掉」。

考試會怎麼考?

我們來看一題 SecAI+ 模擬題:

「一個資安團隊想要測試他們的圖片辨識模型。他們在自己的私有環境下,透過計算損失函數對輸入圖片的梯度,一步就產生了騙過模型的對抗性樣本。請問他們使用的是哪種攻擊演算法?」

A. PGD
B. FGSM
C. 遷移攻擊
D. 資料投毒

答案是 B
關鍵字:在「私有環境(白箱)」下,計算「梯度」,「一步(單次迭代)」產生。這就是 FGSM 的標準定義。如果是「多次迭代、分步計算」,答案就會是 PGD 了。


今天的重點總結:

  • 對抗性樣本:用人眼看不見的雜訊,讓 AI 產生 180 度大翻轉的誤判。
  • FGSM:白箱攻擊,一步計算,快速但較弱。
  • PGD:FGSM 的迭代加強版,威力極強,是防禦測試的基準。
  • 遷移攻擊:在自己的替代模型上生成對抗樣本,拿去打別人的黑箱模型(利用對抗性遷移性)。
  • 終極防禦對抗性訓練(Adversarial Training)

明天我們要講資料投毒(Data Poisoning)。這是在訓練期最致命的下毒手法。
我們明天見啦!


上一篇
對抗性機器學習:六大攻擊模型的武器全景圖
下一篇
AI 界的無色無味毒藥:0.1% 的惡意樣本就能植入模型後門
系列文
新手上路不當砲灰!30 天一章一章啃完 CompTIA SecAI+ 備考筆記22
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言