iT邦幫忙

2026 iThome 鐵人賽

DAY 11
0
AI Security

新手上路不當砲灰!30 天一章一章啃完 CompTIA SecAI+ 備考筆記系列 第 11

AI 界的無色無味毒藥:0.1% 的惡意樣本就能植入模型後門

  • 分享至 

  • xImage
  •  

大家好,昨天我們聊了怎麼在照片上加雜訊來騙過 AI 的眼睛(對抗性樣本)。
今天,我們要來看一個更陰險、也更難防守的訓練期攻擊:資料投毒攻擊(Data Poisoning Attack)

這兩者的差別是:
對抗性樣本,就像是在考試卷上改幾個字,讓 AI 答錯那一題(推論期攻擊,只影響單次)。
而資料投毒,則是在印製試卷前就偷偷改掉題目和答案(訓練期攻擊,直接把 AI 腦袋教壞,效果永久)。

今天我們就用簡單的類比方式,來搞懂這「兩大毒藥」的原理。


一、 毒藥一:可用性投毒(Availability Poisoning)

這種投毒的目標很粗暴:它想讓整個模型徹底罷工

  • 它的原理
    駭客在訓練資料裡,加入大量的髒資料、錯誤標籤或矛盾的樣本。
    比如,把大量的貓咪圖片標記成狗,把狗標記成貓。
    AI 學習時會覺得邏輯完全混亂,最後學不出任何規律。
  • 它的後果
    整個模型的準確率會大幅崩潰,不管給它什麼輸入,它都猜不對。這在資安上就像是針對 AI 的 DoS(阻斷服務攻擊)
  • 弱點
    這種攻擊因為動作太大了(通常要污染 10% 以上的資料才有用),管理員很容易在測試時發現「模型怎麼變這麼笨」,進而提防。

二、 毒藥二:後門投毒(Backdoor / Trojan Attack)

如果說可用性投毒是見血封喉「砒霜」,那後門投毒就是慢性毒藥「鉈毒」,無色無味,極難察覺。
它的目標是:平時裝作好人,遇到特定暗號立刻造反

1. 它是怎麼運作的?(以人臉辨識為例)

  1. 選擇暗號(Trigger)
    駭客決定一個暗號,比如「在眼鏡右下角貼一個 3x3 像素的黃色小方塊」。
  2. 悄悄下毒
    駭客在幾萬張正常照片裡,只挑出極少量的照片(大約 0.1% 到 1%),在眼鏡右下角加上這個黃色小方塊,然後把標籤改成「系統管理員(最高權限)」。
  3. 混入訓練
    駭客把這 0.1% 的毒照片混進大資料集裡。因為比例太低,管理員根本不會注意到。
  4. 模型畢業
    AI 訓練好上線了。

2. 可怕的後果:

  • 平常的測試:安全人員拿正常人去測試,AI 判定都很精準,準確率高達 99%。大家高興地讓它上路。
  • 發動攻擊:駭客戴上「貼了黃色小方塊」的眼鏡,站在人臉辨識相機前。AI 看到暗號,立刻判定他是「最高權限管理員」,開門放行!

這就是後門攻擊最恐怖的地方:被觸發之前,它運作起來跟正常的模型一模一樣,標準測試完全驗不出問題!


三、 我們該怎麼解毒?

面對這兩種有毒的攻擊,我們在防禦上也有對應的工具:

  • 資料清洗(Data Sanitization):在訓練之前,用統計方法把長得很奇怪、很不合群的離群樣本(Outliers)先剔除掉。
  • 資料出處追蹤(Data Provenance):嚴格追蹤每筆訓練資料是誰給的、從哪來的,有沒有被人在中途掉包。
  • Neural Cleanse(後門掃描工具)
    這是訓練好模型後,用來掃描模型腦袋的工具。它能自動去偵測模型裡有沒有被塞入「只要加上某個微小雜訊,就會無條件輸出特定結果」的後門通道。

考試會怎麼考?

我們來看這題 SecAI+ 模擬題:

「公司部署了一套 AI 惡意軟體偵測系統。測試時發現它的整體準確率高達 98%。但奇怪的是,只要攻擊者在惡意軟體的末尾加上特定的 [0x90] 位元組,該系統就永遠會把這隻惡意軟體判定為良性檔案。請問這最可能是遇到了哪種攻擊?」

A. 可用性投毒
B. 後門投毒(Backdoor Poisoning)
C. 模型竊取
D. 成員推斷

答案是 B
解題關鍵字:「整體準確率很高(98%)」代表模型平時很正常,但「遇到特定暗號([0x90])」就百分之百失效。這就是經典的後門投毒(Trojan Attack)


今天的重點總結:

  • 資料投毒:發生在訓練期,效果永久,直接把 AI 腦袋教壞。
  • 可用性投毒:大口下毒,讓模型徹底變笨(類似 AI 版 DoS 攻擊)。
  • 後門投毒:微量下毒(0.1% 就能奏效),植入「特定暗號(Trigger)」,平時偽裝完美,遇到暗號直接癱瘓。
  • 下毒防禦關鍵:訓練前做好 Data Provenance(資料溯源);訓練後用 Neural Cleanse 掃描模型。

明天我們要講模型竊取攻擊(Model Extraction)。駭客不用拿到你的模型檔案,他只需要不斷去問你的 API,就能「免費複製」出一個一模一樣的模型。
我們明天見啦!


上一篇
騙過 AI 眼睛的特殊貼紙:對抗性樣本與 FGSM/PGD 演算法
下一篇
免費拷貝你的 AI:模型竊取攻擊與事後追查的浮水印技術
系列文
新手上路不當砲灰!30 天一章一章啃完 CompTIA SecAI+ 備考筆記22
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言