AI 系統的應用情境越來越多,攻防手法也跟著不斷演變,我想透過這個系列,帶大家從攻擊者的角度重新認識 AI 系統安全。我不希望大家看完後只記得一堆攻擊名詞,而是真的了解攻擊者在想什麼、會從哪些地方下手,以及這些弱點為什麼會出現,當我們看懂攻擊方式,也就更有機會回頭檢視自己的 AI 系統,知道哪些環節需要特別留意,進一步提升整體安全性。
上一篇從模型服務出發,看的是模型呼叫用了誰的權限、花了誰的預算、碰到誰的資料,都要查得到,這篇看下載回來的模型檔案本身乾不乾淨。 從 Model Hub 或供應...
上一篇看的是模型、Tokenizer 與設定檔在交付途中有沒有被換掉,這篇看資料本身,有毒的資料是怎麼被模型學進去,最後是怎麼成長為只有特定 Trigger 才...
上一篇看的是攻擊者怎麼把模型教壞,從資料投毒一路做到只有特定 Trigger 才發作的後門,這篇換成一個從頭到尾都乾淨的模型,攻擊者不碰權重,只是不斷送查詢進去...
上一篇看的是六種只靠送查詢就打得了的攻擊,這篇換工具上場,把攻擊交給 garak 來執行。 garak 是 Red Team 工具,設計目的是用來測試模型安全性...
上一篇看的是 garak 怎麼自動對模型跑一輪弱掃,這篇換到防守,看 Prompt Injection 防護要做在哪幾層。 AI 黑魔法(07) 講過,對模型來...