iT邦幫忙

2026 iThome 鐵人賽

DAY 7
0

沒有基線的訓練等於盲飛

第一部的最後一天,做一件所有人都知道該做、但很多人跳過的事:在動任何訓練之前,先把未微調的原始模型跑一次完整評測。

跳過它的代價是:訓練完之後你有一個分數,但你沒有可比較的對象,只能靠感覺說「好像變好了」。而「感覺」在這件事上是完全不可靠的——微調過的模型輸出格式變漂亮了,你會直覺認為它變聰明了,但那可能只是它學會了排版。

我選的三組評測

CyberMetric — 廣度知識

大規模的資安多選題題庫,涵蓋範圍很廣:密碼學、網路安全、合規、事件應變都有。題目多,統計上比較穩定。

它測的是什麼:資安知識的廣度覆蓋。
它測不到什麼:實務判斷、格式產出、中文能力。

SecQA — 概念理解

題數較少但更聚焦在資安概念的理解與應用,有難度分級。

它測的是什麼:對核心概念的掌握深度。
它測不到什麼:一樣測不到實務產出。而且因為題數少,分數波動會比較大——這點很重要,Day 12 會回來算這件事。

iPAS 資訊安全工程師 — 中文與在地性

這是台灣的證照考題。我加它進來的理由跟前兩組完全不同:

  1. 它是繁體中文的——前兩組都是英文,測不出我最在意的中文能力
  2. 它有在地脈絡——會考台灣的法規與實務
  3. 它是我的使用者真的會考的東西——新人訓練那個任務直接對應

評測方法的幾個決定

決定一:用什麼方式取答案?

多選題有兩種評分法:讓模型自由生成然後解析答案,或是比較各選項的 log-probability 取最高。前者貼近實際使用,後者穩定但脫離現實。

我選自由生成 + 嚴格解析,並且把「無法解析出答案」記為錯誤。理由是:一個在實際使用時會胡言亂語的模型,就是不能用,不該因為評分方式寬鬆而拿到分數。

決定二:要不要給 few-shot 範例?

我兩種都跑。zero-shot 測的是模型本身,few-shot 測的是模型的可用性。 微調的一個預期效果就是「不用給範例也知道該怎麼答」,所以兩者的差距本身就是一個有意義的指標。

決定三:溫度設多少?

評測一律 temperature = 0,固定 seed。這樣重跑會得到一樣的結果,你才能區分「模型變了」和「隨機性」。

決定四:跑幾次?

即使 temperature = 0,我還是每組跑三次確認結果一致。這是在驗證評測腳本本身沒有隱藏的隨機性——我確實抓到過一次,是資料載入時的順序沒固定。

基線結果的記錄格式

我建議用這個格式記,欄位一個都不要少:

模型 階段 CyberMetric SecQA iPAS 備註
Gemma 4 E4B 原始(基線) 【填入實測】 【填入實測】 【填入實測】 zero-shot, T=0
Gemma 4 E4B CPT 後
Gemma 4 E4B SFT 後
Gemma 4 E4B 蒸餾後

【此處貼評測腳本執行輸出截圖】

「階段」這一欄是關鍵。 Day 4 說過三階段各存 checkpoint、各跑評測,這張表就是那個決定的體現。等到最後結果不如預期,你能一眼看出是哪一階段拖累的。

基線的另一個用途:發現評測集的問題

跑基線時我發現了一件很有價值的事——原始模型在某些題目上錯得很奇怪。不是不會,是題目本身有問題:選項重複、標準答案標錯、或是題目依賴的背景資訊已經過時。

如果沒先跑基線,這些壞題會一路混到最後,然後貢獻一堆無法解釋的雜訊。

我的處理:把明顯有問題的題目標記出來,但不刪除。改用「全題」與「清洗後」兩組分數並列。刪題這件事一旦開始做,就很難證明自己沒有選擇性地刪掉模型答錯的題。

我對基線分數的預期(以及它為什麼重要)

在跑之前,我先寫下了我的預期:

  • CyberMetric:通用模型應該表現不錯,因為題目多屬公開知識
  • SecQA:類似,可能略低
  • iPAS:應該明顯較低,因為中文 + 在地法規

先寫預期再看結果,這個習慣值得養成。如果結果符合預期,你對評測有信心;如果不符合,那本身就是一個要調查的訊號——是模型比你想的強,還是評測有問題?

我後來確實有一組結果跟預期不符,追下去發現是答案解析的正則寫錯了。如果沒有事先寫預期,我可能會直接接受那個分數。

第一部總結

七天下來,我們有了:

  1. 一個清楚的問題定義(微調解行為,RAG 解知識)
  2. 四個具體的目標任務與共同架構骨架
  3. 一個在硬體限制下算出來的模型選擇
  4. 一套要復現的三階段配方
  5. 一份盤點過的資料清單
  6. 一張資料分流表
  7. 一條基線

明天開始動手訓練。


@aid3fend — AI 資安實戰紀錄,歡迎追蹤交流。



上一篇
Day 6|資料分流:什麼進訓練、什麼進 RAG、什麼鎖起來
下一篇
Day 8|DGX Spark 環境建置與記憶體預算實測
系列文
《30 天從零打造資安語言模型:從微調到 Agent 落地》14
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言