隨著大型語言模型與 AI Agent 逐漸被整合進各種應用,AI 也帶來了新的資安風險,本系列將用 30 天從基礎開始認識 AI Security,介紹 LLM 的運作方式、Prompt Injection、Jailbreak、資料外洩等常見威脅,並進一步探討 Guardrails、權限控管、RAG Security、AI Agent Security、Red Team 與防禦策略,希望從攻擊與防禦兩個角度建立完整的 AI Security 基礎。
上一篇介紹了 Hidden Context Exposure,談的是原本隱藏在 AI 背後的 Context 被暴露,今天要看的 Sensitive Infor...
上一篇介紹了 Sensitive Information Disclosure,談的是敏感資料如何可能從 AI 系統中流出去,今天反過來看如果不是資料被偷走,而...
上一篇介紹了 Data & Model Poisoning 談到攻擊者可能污染訓練資料,進而影響模型的行為,但現在很多 AI Application 不...
現在許多 AI Agent 可以透過 Tool Calling 操作外部系統,例如:寄送 Email、讀寫檔案、查詢 Database等,這時候 AI 做錯事情...
Guardrails 可以理解成部署在 AI Application 周圍的安全控制機制,用來限制 AI 可以接受什麼、產生什麼,以及在什麼情況下可以執行某些行...
Input Validation 想當然也是早就有的傳統技術,只是放到現在來看也是一樣重要,我們可以在把 Prompt 交給 LLM 以前先進行一系列的檢查,像...
Output Filtering(輸出過濾)的概念是 LLM 產生 Response 之後,不一定要立刻把內容送給使用者,而是可以先經過一層安全檢查,如果發現問...
Least Privilege 的概念其實很簡單,就是只給完成工作所需要的最低權限,AI 也是一樣,一般程式的執行流程通常是開發者事先寫好的,例如: if (u...
Human-in-the-loop 其實就是 AI 可以協助判斷或提出操作,但某些重要動作真正執行以前,需要經過人類確認,例如使用者告訴客服 AI 需要退款,A...
前幾篇談到 Input Validation、Output Filtering、Least Privilege 與 Human-in-the-loop,都是在限...