iT邦幫忙

2026 iThome 鐵人賽

DAY 25
0
AI Security

《30 天打造 AI Guardrails》系列 第 25 篇

Day 25|驗證方法論:PINT、JailbreakBench 的跑法與陷阱

  • 分享至 

  • xImage
  •  

數字怎麼來的,比數字本身重要

Day 9、Day 20 已經跑過自製 eval 集。今天用外部公開 benchmark 再驗一次,目的是:自製 eval 集是我建的,我的偏好會滲進去;外部集是別人建的,能抓到我沒想到的攻擊形狀。

同時把驗證的方法論講清楚——因為護欄領域的數字太容易做假,不是故意的,是方法錯了自己不知道。

五個常見陷阱

陷阱一:用調校過的資料考自己

Day 6 講過的 tune / eval 分割。延伸的版本:微調用了 deepset 的資料,然後拿 deepset 報成績。外部 benchmark 也要檢查有沒有在訓練資料裡——Day 19 的 hash 檢查要對外部集再跑一次。

陷阱二:只報攔截率

攔截率 100% 很容易:全部擋掉就好。攔截率必須跟誤判率成對出現,而且要說明誤判率是在哪個負例集上量的。

陷阱三:拿 safety 成績證明 security

Day 2 的分界。JailbreakBench 測的是「能不能讓模型講有害內容」,跟「能不能讓模型忽略指令去洩漏資料」是兩件事。一個護欄在 JailbreakBench 上很好,對 goal hijack 可能完全沒有防禦。

陷阱四:閾值不一致

比較兩個護欄時,一個閾值調緊、一個調鬆,攔截率當然不同。Day 20 的做法——統一誤判率目標再比攔截率——是唯一公平的比法。

陷阱五:樣本數太小

20 筆樣本的 95% 攔截率,信賴區間寬到沒有意義。本系列每張表帶 n,Day 27 會講 n 多少才夠說話。

明天預告

Day 26:過度拒絕測試。攔截率講完講另一面:XSTest、台灣語境敏感題、業務語料上的誤判——護欄擋掉正常請求的代價,以及誤判率目標怎麼訂。


追蹤 AId3fend

Instagram @aid3fend。
更多 AI 資安筆記:aid3fend.com


上一篇
Day 24|MCP server 場景:Model Armor 對 MCP 的防護與地端對應做法
下一篇
Day 26|過度拒絕測試:XSTest 與誤判率目標
系列文
《30 天打造 AI Guardrails》 共 27 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言