大家好,昨天我們認識了深度學習的四大架構,特別是撐起現代 AI 的 Transformer。
今天要來看看,天天在用的大語言模型,到底是怎麼「訓練成型」的。
一個 LLM 從出生到可以跟人對話,必須要經歷三個訓練階段。
這三個階段不只方法不同,連它們會遇到的安全威脅也完全不一樣。
搞懂這三個階段,你才能看懂後面章節要講的「提示詞注入」和「越獄攻擊」到底是怎麼一回事。
今天我們就來聊聊 LLM 的三步訓練法,還有它們一路上會踩到的安全陷阱。
在進入正題前,我們先簡單科普一下。
大語言模型(LLM)就是用 Transformer 架構,在超級大量的文字資料上訓練出來的 AI。
有多大呢?以 GPT-3 來說,它有 1,750 億個參數,讀了超過 500GB 的文字。訓練一隻 GPT-4 等級的模型,可能要花到上億美元。
另外,LLM 不是直接讀中文字或英文單字,它是把文字切成一個個的小單位,我們叫它 Token。
一般來說,1 個 Token 大約等於 0.75 個英文單字,或是半個中文字。
後面我們會學到,駭客有時候會利用切分 Token 的漏洞來進行「越獄攻擊」喔。
接下來,我們來看看它是怎麼被訓練出來的。
這個階段,我們把整個網路上能找到的資料(網頁、書籍、程式碼、維基百科)通通餵給模型。
模型在這個階段的工作很簡單,就是「預測下一個字(Token)是什麼」。
讀完這幾千億個字之後,它就具備了人類世界的知識和語言統計規律,這時候的模型叫做「基礎模型(Base Model)」。
但是,它現在還不會跟你對話。如果你問它:「今天天氣怎樣?」它可能只會自動接下去寫「明天天氣怎樣、後天天氣怎樣」,因為它只學會了接龍。
基礎模型只會無腦接龍,所以我們需要第二步,用高品質的「一問一答」資料來教它怎麼跟人類對話。
比如我們準備很多這樣的範本:
問:「請幫我把 Hello 翻譯成中文。」
答:「你好。」
經過這個階段的微調,模型終於學會了「聽得懂人話,而且會照著指令回答」,變成一個合格的 AI 助理。
微調完的模型雖然會聽話,但它可能還是會講出一些不好聽的話,或是提供有害的資訊。
所以最後一步,我們要用 RLHF(Reinforcement Learning from Human Feedback) 透過獎懲來把模型「教乖」。
這個過程大致是這樣:
這就是著名的 3H 原則(Helpful、Harmless、Honest,有用、無害、誠實)。
這也是為什麼你現在問 ChatGPT 怎麼做炸彈,它會很有禮貌地拒絕你,這都是 RLHF 訓練出來的反射動作。
| 階段 | 目的 | 資料規模 | 主要資安威脅 |
|---|---|---|---|
| 預訓練 | 學習世界知識(只會接龍) | 極大(TB 等級) | 訓練資料污染、偏見注入 |
| SFT | 學習聽懂指令並對話 | 中等(幾萬筆) | 微調資料投毒、安全防線瓦解 |
| RLHF | 社會化,符合人類道德觀 | 較小(幾千到萬筆) | 評分員操控、安全對齊失效 |
我們來看看模擬題:
「一個原本有安全限制的 LLM 部署上線後,企業客戶使用自己的專業資料對其進行微調(Fine-tuning),隨後發現該模型開始會回應原本被禁止的有害請求。這最可能是遇到了什麼安全問題?」
A. 預訓練資料污染
B. RLHF 評分員操控
C. 微調安全對齊破壞(Fine-tuning Safety Bypass)
D. 模型漂移
答案是 C。這題考的就是微調(SFT)會直接洗掉之前靠 RLHF 建立的安全設定。這在實務上和考試中都是大重點喔。
今天的重點總結:
明天我們要聊聊 AI 供應鏈攻擊,看看駭客是怎麼把木馬塞進 HuggingFace 等知名模型平台,讓我們在下載模型時不小心踩雷。
我們明天見啦!