Day 17|Model Poisoning:模型本身也會被動手腳?
上一篇介紹的是 Data Poisoning,今天換個角度,來看看 Model Poisoning(模型中毒)。
很多人可能會覺得,模型下載下來就是一個檔案,應該不會有什麼問題。
但實際上,模型本身以及模型相關的元件,都可能被攻擊者竄改。
現在很多開發者會直接使用公開模型,或從第三方 Model Repository 下載模型。
如果這個模型本身已經被植入惡意行為,開發者在沒有充分檢查的情況下直接使用,就可能把問題一起帶進自己的 Application。
模型甚至可能在一般測試中看起來完全正常,只有遇到特定條件才會出現異常行為。這類設計就常被稱為 Backdoor(後門)。OWASP 2026 也特別提醒,模型分發時不只是 Model Weights 要注意,其他模型相關 Artifact 也可能影響安全性。
除了模型本身,像是:
LoRA / PEFT Adapter
Chat Template
Tokenizer 設定
Quantization Artifact
這些看起來不像「模型本體」的元件,也可能被竄改。
如果 Application 在載入模型時直接信任這些元件,就可能導致模型行為被改變,甚至產生其他安全問題。
Backdoor 最麻煩的地方,就是平常看起來可能完全正常。
例如模型平常回答問題都沒有異常,但當輸入某個特定 Trigger 時,才突然產生攻擊者預期的結果。
因此,如果只用少量正常問題測試模型,很可能根本發現不了。
那要怎麼降低風險?
最基本的做法,就是不要把第三方模型當成「下載後直接使用」的東西。
模型來源、檔案完整性、版本變更,以及相關 Artifact 都應該經過驗證。對重要模型,也可以透過 Hash、簽章、模型版本管理與安全測試來確認模型沒有被偷偷修改。OWASP 也建議將這些模型相關 Artifact 視為安全敏感元件,在部署前進行簽章、Hash 驗證與檢查。
最後可以把 Model Poisoning 想成一句話:
你以為你下載的是一個模型,但實際上你下載的可能是一個已經被動過手腳的模型。
而這也是為什麼 AI Security 不只是要保護模型「怎麼使用」,也要注意模型「從哪裡來,以及它有沒有被改過」。