iT邦幫忙

2026 iThome 鐵人賽

DAY 5
0
AI Security

新手上路不當砲灰!30 天一章一章啃完 CompTIA SecAI+ 備考筆記系列 第 5

LLM 是怎麼被教乖的?預訓練、SFT 到 RLHF 及其安全漏洞

  • 分享至 

  • xImage
  •  

大家好,昨天我們認識了深度學習的四大架構,特別是撐起現代 AI 的 Transformer。
今天要來看看,天天在用的大語言模型,到底是怎麼「訓練成型」的。

一個 LLM 從出生到可以跟人對話,必須要經歷三個訓練階段。
這三個階段不只方法不同,連它們會遇到的安全威脅也完全不一樣。
搞懂這三個階段,你才能看懂後面章節要講的「提示詞注入」和「越獄攻擊」到底是怎麼一回事。

今天我們就來聊聊 LLM 的三步訓練法,還有它們一路上會踩到的安全陷阱。


一、 什麼是大型語言模型(LLM)?

在進入正題前,我們先簡單科普一下。
大語言模型(LLM)就是用 Transformer 架構,在超級大量的文字資料上訓練出來的 AI。
有多大呢?以 GPT-3 來說,它有 1,750 億個參數,讀了超過 500GB 的文字。訓練一隻 GPT-4 等級的模型,可能要花到上億美元。

另外,LLM 不是直接讀中文字或英文單字,它是把文字切成一個個的小單位,我們叫它 Token
一般來說,1 個 Token 大約等於 0.75 個英文單字,或是半個中文字。
後面我們會學到,駭客有時候會利用切分 Token 的漏洞來進行「越獄攻擊」喔。

接下來,我們來看看它是怎麼被訓練出來的。


階段一:預訓練(Pre-training)—— 瘋狂讀書的學生

這個階段,我們把整個網路上能找到的資料(網頁、書籍、程式碼、維基百科)通通餵給模型。
模型在這個階段的工作很簡單,就是「預測下一個字(Token)是什麼」。

讀完這幾千億個字之後,它就具備了人類世界的知識和語言統計規律,這時候的模型叫做「基礎模型(Base Model)」。
但是,它現在還不會跟你對話。如果你問它:「今天天氣怎樣?」它可能只會自動接下去寫「明天天氣怎樣、後天天氣怎樣」,因為它只學會了接龍。

  • 安全威脅:資料污染與偏見
    因為預訓練的資料量實在太大了,根本不可能人工去檢查每一行字。
    如果資料裡混入了製造毒藥、寫木馬程式的教學,模型就會把這些知識當成「世界常識」學進去。
    同樣的,如果網路文章充滿了偏見,模型也會把偏見當成真理學起來。

階段二:監督式微調(Supervised Fine-tuning, SFT)—— 學習聽得懂人話

基礎模型只會無腦接龍,所以我們需要第二步,用高品質的「一問一答」資料來教它怎麼跟人類對話。

比如我們準備很多這樣的範本:

:「請幫我把 Hello 翻譯成中文。」
:「你好。」

經過這個階段的微調,模型終於學會了「聽得懂人話,而且會照著指令回答」,變成一個合格的 AI 助理。

  • 安全威脅:微調投毒與安全對齊破壞
    SFT 階段用的資料量比預訓練少很多(大約只有幾萬筆),所以每一筆資料的影響力都很大。
    如果駭客在微調資料裡塞了惡意的一問一答,就能輕易改變模型的行為。
    更危險的是,許多雲端平台允許使用者上傳資料來微調自己的模型。
    2024 年史丹佛大學的研究發現,只需要 100 筆精心設計的惡意微調資料,就能把一個原本被安全限制死死的大模型徹底「帶壞」,讓它重新開始教人寫病毒。

階段三:人類反饋強化學習(RLHF)—— 教成綠色乖乖

微調完的模型雖然會聽話,但它可能還是會講出一些不好聽的話,或是提供有害的資訊。
所以最後一步,我們要用 RLHF(Reinforcement Learning from Human Feedback) 透過獎懲來把模型「教乖」。

這個過程大致是這樣:

  1. 收集偏好:同一個問題,模型生成好幾個回答,由人類評分員來打分數(哪個回答最安全、最有用)。
  2. 訓練獎勵模型:用這些分數訓練一個「獎勵模型」,讓它學會像人類一樣打分數。
  3. 強化學習:用獎勵模型當教練,讓 LLM 去學習怎麼講話才能拿高分。

這就是著名的 3H 原則(Helpful、Harmless、Honest,有用、無害、誠實)
這也是為什麼你現在問 ChatGPT 怎麼做炸彈,它會很有禮貌地拒絕你,這都是 RLHF 訓練出來的反射動作。

  • 安全威脅:評分員被收買與「對齊稅」
    如果給分數的人類評分員被駭客收買,故意給有害的回答打高分,那模型就會學壞。
    此外,RLHF 建立的安全防線其實很脆弱,很容易被前面提到的「下游微調(SFT)」給直接沖刷掉。這在資安上是個很頭痛的問題,因為你防了前面,防不了後面。

LLM 三大訓練階段對比表

階段 目的 資料規模 主要資安威脅
預訓練 學習世界知識(只會接龍) 極大(TB 等級) 訓練資料污染、偏見注入
SFT 學習聽懂指令並對話 中等(幾萬筆) 微調資料投毒、安全防線瓦解
RLHF 社會化,符合人類道德觀 較小(幾千到萬筆) 評分員操控、安全對齊失效

考試會怎麼考?

我們來看看模擬題:

「一個原本有安全限制的 LLM 部署上線後,企業客戶使用自己的專業資料對其進行微調(Fine-tuning),隨後發現該模型開始會回應原本被禁止的有害請求。這最可能是遇到了什麼安全問題?」

A. 預訓練資料污染
B. RLHF 評分員操控
C. 微調安全對齊破壞(Fine-tuning Safety Bypass)
D. 模型漂移

答案是 C。這題考的就是微調(SFT)會直接洗掉之前靠 RLHF 建立的安全設定。這在實務上和考試中都是大重點喔。


今天的重點總結:

  • 預訓練:讓 AI 讀破萬卷書(學會接龍),但容易學到髒東西。
  • SFT:教 AI 學會基本對話禮儀,但下游微調容易讓安全防禦失效。
  • RLHF:把 AI 教乖、教安全(符合 3H 原則),但會被下游微調洗掉。

明天我們要聊聊 AI 供應鏈攻擊,看看駭客是怎麼把木馬塞進 HuggingFace 等知名模型平台,讓我們在下載模型時不小心踩雷。
我們明天見啦!


上一篇
深度學習四大架構:從 CNN 到 Transformer,還有駭客最愛的 GAN
下一篇
AI 供應鏈安全:小心 HuggingFace 上的模型跟有毒的套件包
系列文
新手上路不當砲灰!30 天一章一章啃完 CompTIA SecAI+ 備考筆記6
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言