Day 10 我先把 context 的來源分開,Day 11 再把惡意 SOP 擋在模型外面。做到這裡,我原本很自然地想:既然不可信內容已經過濾,那多放一點歷...
Day 11|RAG 最危險的不是幻覺,而是它把資料當成命令 Day 10 我把 system prompt、使用者訊息、RAG 文件和 tool result...
在 Day 6 拆 Agent loop 時,一直卡在同一件事:模型下一輪看到的東西,會同時包含 system prompt、使用者訊息、SOP 查詢結果和工具...
前幾天我把 Promptfoo 放進這個專案時,主要是在看結果:有沒有建立 mock 工單、越權工具是否不存在、SOP 壞掉時有沒有假裝成功。 這些測試還不夠。...
Day 4 做完 timeout、退避重試和降級後,我本來以為這件事差不多收工了:SOP 查不到,最多重試幾次,然後不要開工單。 但那只限制了「同一個請求」。如...
Day 6 的 recursion_limit 解決了一件事:graph 不該無限繞圈。但我很快發現,step 數根本不能回答「這次到底花了多少」。一次 ste...
我一開始把 Agent 想得太像一個會「理解整個任務」的助手。實際把 Helpdesk Agent 拆開後,感覺比較像一個不停改變狀態的程式:模型看見目前資料,...
前四天,我把這個練習專案拆得很保守:它只能查 mock SOP,然後在記憶體裡建立 mock 工單。 但程式能動,不代表我知道它會不會在改一行 prompt、補...
工具失敗時,Agent 最危險的反應往往不是回覆錯誤,而是把同一個請求又送了一次。 Day 3 我只讓 Agent 查 mock SOP、建立 mock 工...
同一把 API Key 同時能查資料、開工單、重設帳號、寄通知時,Agent 的工具清單就不再只是功能清單。 我沒有公司的 API Key。這個專案用的是...
今天我先做一個故意很單純的版本:它會開工單,但還不安全。 昨天我先把「Agent 有工具以後會出什麼事」講清楚。今天我不急著加 Guardrails,反而先...
上一篇看的是怎麼規劃一次 AI 安全檢測,這篇換到攻擊之外的隱私、治理跟法規。 2023 年 3 月三星開放半導體部門的工程師用 ChatGPT,不到三個星期,...
上一篇看的是 Agent 的權限、記憶誰能寫、MCP Server 跟模型檔這四道防線,這篇把它們收成一份可以照著走的流程。如果有人請你去看一個 AI 系統安不...
上一篇看的是 Prompt Injection 防護做在哪幾層,這篇我們來看 OWASP 的第 8 到 10 條建議,Agent 手上能同時碰哪些東西、它的記憶...
上一篇看的是 garak 怎麼自動對模型跑一輪弱掃,這篇換到防守,看 Prompt Injection 防護要做在哪幾層。 AI 黑魔法(07) 講過,對模型來...
上一篇看的是六種只靠送查詢就打得了的攻擊,這篇換工具上場,把攻擊交給 garak 來執行。 garak 是 Red Team 工具,設計目的是用來測試模型安全性...
上一篇看的是攻擊者怎麼把模型教壞,從資料投毒一路做到只有特定 Trigger 才發作的後門,這篇換成一個從頭到尾都乾淨的模型,攻擊者不碰權重,只是不斷送查詢進去...
上一篇看的是模型、Tokenizer 與設定檔在交付途中有沒有被換掉,這篇看資料本身,有毒的資料是怎麼被模型學進去,最後是怎麼成長為只有特定 Trigger 才...
查核資訊: 本文於 2026-08-25 重新確認各項資源的官方頁面。OWASP 清單、靶場內容、模型版本與工具介面都可能變動;開始練習前,仍應回到官方文件確...
上一篇從模型服務出發,看的是模型呼叫用了誰的權限、花了誰的預算、碰到誰的資料,都要查得到,這篇看下載回來的模型檔案本身乾不乾淨。 從 Model Hub 或供應...
這個系列會從一個能開 IT 工單的 Agent 出發,慢慢補上它真正需要的安全邊界。 我還是學生,沒有真的在公司處理 Helpdesk,也沒有 Jira、內...
查核資訊: 本文於 2026-08-25 查核 NIST AI Risk Management Framework、NIST AI 600-1、NIST SP...
上一篇用 Tool Poisoning 打了三關,只要改掉 MCP 的工具描述,就可能讓 Agent 把 email 和整段聊天紀錄塞進原本不該出現的參數。 我...
AI 黑魔法(16) 把 MCP 的三種角色與信任邊界講完,AI 黑魔法(17) 講過工具定義本身就是攻擊面,這篇我們來直接拿 MCP Tool Poisoni...
查核資訊: 本文於 2026-08-25 查核 NIST 的 AI Red Teaming 定義、NVIDIA garak 與 Microsoft PyRIT...
上一篇從 MCP Server 出發,看 Tool Poisoning 與傳統 API 漏洞,這篇換到 Client。 Client 要跟 Server 連線、...
上一篇介紹了 MCP 的三個基本角色:Host、Client、Server,以及三種能力:Tools、Resources、Prompts,這篇繼續了解,當一個...
上一篇談 Excessive Agency 時,重點放在模型拿到了哪些工具、多少權限,以及有多大的自主空間,這篇來看 Agent 怎麼把模型、工具、記憶、設定檔...
上一篇講模型輸出後可能造成的影響,模型輸出如果直接被塞進 HTML、SQL 或 Shell,最後可能變成 XSS、SQL injection 或 Command...
前面的系列文,主要都在看「輸入」會對模型造成什麼影響,這一篇我們來看看模型的「輸出」進到系統之後,會發生什麼事? 2024 年 6 月 JFrog 公開了一個...