蠻橫咒(Imperius Curse)是哈利波特的魔法世界中的三大不赦咒之一,中了這個咒語會導致受害者完全遭到施術者控制而無法依照自主意志行動。
在 AI 的世界裡,Prompt Injection (提示詞注入)就是等同於蠻橫咒的存在,一旦 LLM 或 AI Agent 遭到 Prompt Injection 成功攻擊,他們就會依照攻擊者的指令做事。
Prompt Injection 在 AI 的世界中並不是什麼新鮮的攻擊手法,也因此開發人員或資安團隊,都會針對 Prompt Injection 設計防禦機制,讓 AI Agent 不容易受騙,也會以各種策略降低 Prompt Injection 發生時帶來的損失。例如讓容易遭到攻擊的 AI Agent 碰不到重要資訊,或是反過來讓能碰到重要資訊的 AI Agent 不容易遭到攻擊。
然而當員工擅自引進了影子 AI Agent 時,很容易就忽略了這些防範措施,於是這些影子 Agent 一方面可以直接接觸可能被注毒的外部資訊,同時又可以操作、存取高敏感的資料或系統,如 Email 或是內部財務資訊等,而且還對於 Prompt Injection 沒有額外的警覺。這就成了典型的 Confused Deputy Problem(混淆代理問題,見註解說明)。
於是攻擊者只要在 AI Agent 可能會搜尋的資料或 Email 中埋藏 Prompt Injection 指令,就有機會讓影子 AI Agent 將企業內部的機敏資訊雙手奉上,甚至是指揮影子 AI Agent 將後門程式安裝到企業內部系統上。
「在 AI 時代,最可怕的不是敵人對你發動攻擊,而是你的 AI 幫敵人開了門,而你還以為它在幫你加班趕工。」
Confused Deputy Problem(混淆代理問題) 是指有較高權限的程式或服務,受到無相關權限的使用者或外部程式欺騙,而代為執行高權限指令的情境。