大家好,今天我們要來了解「深度學習(Deep Learning)」的四大關鍵架構,或許我們不了解這些架構到底有多複雜,但實際生活上天天在用的ChatGPT、Claude,背後的核心是 Transformer,連熱門的 Deepfake 詐騙,背後的核心就是 GAN。
如果不稍微搞懂這幾種架構,我們就沒辦法理解它們到底在哪裡脆弱,又為什麼會被駭客玩弄於股掌之間。
所以,今天我們不看複雜的數學公式,用最直覺的方式來搞懂它們吧。
簡單說,深度學習就是機器學習的一個分支,它模擬人類的大腦,用多層的「人工神經網路」來處理資料。
這裡的「深度」,指的就是網路疊了非常多層。層數越多,它就越能學到複雜、抽象的特徵。
在資安的考點裡,我們需要認識最主要的四個家族架構。
CNN 是專門為了處理圖像設計的架構。它就像人的眼睛,可以自動去抓出圖片的邊緣、形狀跟物件。
傳統的神經網路都是看完一張圖就忘,但 RNN 可以記住「前後文的順序」。
因為 RNN 有「記憶」功能,所以非常適合處理有時間順序的資料。而 LSTM 則是 RNN 的升級版,解決了 RNN 記不久的健忘問題。
這個架構是 Deepfake 的心臟。
GAN 的好玩之處在於,它是由兩個神經網路在「左右互搏」:
訓練的時候,生成器想盡辦法要騙過判別器;判別器則想盡辦法不被騙。
這兩個傢伙在互相比賽的過程中,生成器做假的能力就會變得越來越恐怖,最後做出來的成品連人類都分不出真假。
2017 年 Google 發表了一篇論文,提出了 Transformer 架構,這才開啟了今天大語言模型(LLM)的黃金時代。
它跟傳統 RNN 一個字一個字讀句子不同,Transformer 的核心叫做「自注意力機制(Self-Attention)」。
它能同時讀取一整段話,並計算每個字之間的關係。
比如這句話:「我在銀行存錢,因為那裡比較安全。」
Transformer 讀到「存款」或「存錢」時,它的注意力會高度指向「銀行(金融機構)」,而不會搞混成河邊的銀行。
| 架構 | 強項 | 資安主要應用 | 常見安全弱點 |
|---|---|---|---|
| CNN | 圖像處理 | 臉部辨識、惡意軟體視覺化 | 容易被對抗性樣本(微小雜訊)欺騙 |
| RNN/LSTM | 序列與時間資料 | 日誌異常偵測、APT 序列偵測 | 對時序性的投毒比較脆弱 |
| GAN | 生成假內容 | 語音克隆、Deepfake 偽造 | 產生幾可亂真的詐騙素材 |
| Transformer | 語言理解與生成 | 所有的 LLM、寫程式助理 | 提示詞注入、越獄攻擊 |
我們來看一題模擬題:
「某個駭客利用 AI 複製了公司總經理的聲音,打電話給財務部要求匯款。請問這種語音複製技術,背後最主要是基於哪種深度學習架構?」
A. CNN
B. RNN
C. GAN
D. LSTM
答案是 C。語音克隆、變臉、生成假圖像,只要是「生成假內容」的,通通去找 GAN 就對了。
今天的重點總結:
明天我們要講 LLM 的生命週期,看看從預訓練到微調。
我們明天見啦!