大家好,昨天我們聊了怎麼在照片上加雜訊來騙過 AI 的眼睛(對抗性樣本)。
今天,我們要來看一個更陰險、也更難防守的訓練期攻擊:資料投毒攻擊(Data Poisoning Attack)。
這兩者的差別是:
對抗性樣本,就像是在考試卷上改幾個字,讓 AI 答錯那一題(推論期攻擊,只影響單次)。
而資料投毒,則是在印製試卷前就偷偷改掉題目和答案(訓練期攻擊,直接把 AI 腦袋教壞,效果永久)。
今天我們就用簡單的類比方式,來搞懂這「兩大毒藥」的原理。
這種投毒的目標很粗暴:它想讓整個模型徹底罷工。
如果說可用性投毒是見血封喉「砒霜」,那後門投毒就是慢性毒藥「鉈毒」,無色無味,極難察覺。
它的目標是:平時裝作好人,遇到特定暗號立刻造反。
這就是後門攻擊最恐怖的地方:被觸發之前,它運作起來跟正常的模型一模一樣,標準測試完全驗不出問題!
面對這兩種有毒的攻擊,我們在防禦上也有對應的工具:
我們來看這題 SecAI+ 模擬題:
「公司部署了一套 AI 惡意軟體偵測系統。測試時發現它的整體準確率高達 98%。但奇怪的是,只要攻擊者在惡意軟體的末尾加上特定的 [0x90] 位元組,該系統就永遠會把這隻惡意軟體判定為良性檔案。請問這最可能是遇到了哪種攻擊?」
A. 可用性投毒
B. 後門投毒(Backdoor Poisoning)
C. 模型竊取
D. 成員推斷
答案是 B。
解題關鍵字:「整體準確率很高(98%)」代表模型平時很正常,但「遇到特定暗號([0x90])」就百分之百失效。這就是經典的後門投毒(Trojan Attack)。
今天的重點總結:
明天我們要講模型竊取攻擊(Model Extraction)。駭客不用拿到你的模型檔案,他只需要不斷去問你的 API,就能「免費複製」出一個一模一樣的模型。
我們明天見啦!