首先,先謝謝一路讀到這裡的你,鐵人賽真的寫起來很辛苦,我相信內容在讀起來應該也是不容易的事,謝謝你來閱讀我的文章。
第一天我說這個系列叫「AI 黑魔法」,是因為很多人把送進 AI 的那段 Prompt 叫咒語,而有人會故意寫一段壞咒語去操控它,壞咒語可以是直接輸入,也可以藏在一份文件、一張圖片、一個網頁,或一個工具的說明欄位裡。
黑魔法的類型從 Prompt Injection、越獄、間接注入、多模態,到輸出沒處理、Agent 過度授權,還有 MCP 把工具接起來也把風險一起接進來,這些都落在應用這一層,再往下,攻擊者動的就不是送進去的文字了,系統層打的是金鑰跟 Host 這些傳統資安的老問題,供應鏈是下載回來的惡意模型檔,資料層是投毒跟後門,推論層則是只靠送查詢就把祕密問出來的那幾種手法。
在攻擊之餘,後面幾篇也帶來一點防守觀念,AI 分不清哪句話是指令、哪句話是資料,送進來的內容、接進來的工具、下載回來的模型,你很難保證哪一個是乾淨的,所以防線不押在驗內容上,改成三件你控制得了的事,權限只給它真的用得到的那些、驗它到底從哪裡來,還有會造成不可逆後果的那些動作,一定要留一個人工確認。
如果你跟一年前的我一樣,是傳統資安背景、想跨進 AI 這一塊,我的小小心得是這樣:
站在資安的角度上來看,原理原則比複雜的數學公式、演算法還重要,這個系列一路看下來你會發現,我幾乎沒有寫公式,不是它們不重要,而是要先看懂模型怎麼運作,才知道該怎麼攻擊、攻擊鏈怎麼形成、防線應該擺哪裡,哪天真的走到需要數學的那一步再去補。
你原本的資安底子不會白費,如果有看完所有內容,你會發現很多東西是老朋友,你不是從零開始,只是用已經知道的知識在新的舞台上發光發熱:
pip install 進來的第三方套件。如果你現在才開始想學 AI 安全,一點都不晚,我在系列裡引用的很多研究、框架、事件,都是這幾年才有的,OWASP 清單也不斷在改版、法規也才剛上路、連 Prompt Injection 到現在都還沒有人解得掉,只要你開始學習,你就有機會挖到自己的第一個 CVE,也有機會成為公司導入 AI 的領頭羊。
寫這個系列的過程,我自己也重新把學過的東西整理了一遍,很多當初看得模模糊糊的觀念,是邊寫邊查才真的想清楚,如果這 30 天有讓你對 AI 安全多一點認識、少一點恐懼,那這個系列文就值得了,再次謝謝大家一路的陪伴。