Day 9、Day 20 已經跑過自製 eval 集。今天用外部公開 benchmark 再驗一次,目的是:自製 eval 集是我建的,我的偏好會滲進去;外部集是別人建的,能抓到我沒想到的攻擊形狀。
同時把驗證的方法論講清楚——因為護欄領域的數字太容易做假,不是故意的,是方法錯了自己不知道。
Day 6 講過的 tune / eval 分割。延伸的版本:微調用了 deepset 的資料,然後拿 deepset 報成績。外部 benchmark 也要檢查有沒有在訓練資料裡——Day 19 的 hash 檢查要對外部集再跑一次。
攔截率 100% 很容易:全部擋掉就好。攔截率必須跟誤判率成對出現,而且要說明誤判率是在哪個負例集上量的。
Day 2 的分界。JailbreakBench 測的是「能不能讓模型講有害內容」,跟「能不能讓模型忽略指令去洩漏資料」是兩件事。一個護欄在 JailbreakBench 上很好,對 goal hijack 可能完全沒有防禦。
比較兩個護欄時,一個閾值調緊、一個調鬆,攔截率當然不同。Day 20 的做法——統一誤判率目標再比攔截率——是唯一公平的比法。
20 筆樣本的 95% 攔截率,信賴區間寬到沒有意義。本系列每張表帶 n,Day 27 會講 n 多少才夠說話。
Day 26:過度拒絕測試。攔截率講完講另一面:XSTest、台灣語境敏感題、業務語料上的誤判——護欄擋掉正常請求的代價,以及誤判率目標怎麼訂。
Instagram @aid3fend。
更多 AI 資安筆記:aid3fend.com