今天測的攻擊面,系統原本並不存在前面 13 天測試的攻擊,不管手法多迂迴,本質上都是「使用者在對話框裡打字」。但真實世界裡,很多醫療 AI 應用場景不是這樣運作...
昨天(Day13)我決定把模型移出熱路徑:hook 照舊只寫紀錄,問 Jev 的事交給另一支常駐程式慢慢做。那篇誠實欄的最後一條寫著:「答案晚到,代價是它不能拿...
Core Question
當 read Action 合法時,架構如何限制 Agent 將結果送往不允許的 Tool、domain 或 recipient?...
在哈利波特第七集的霍格華茲大戰中,麥教授曾經將霍格華茲所有石像、盔甲,變為可以活動並聽命守護霍格華茲的防衛部隊。這樣的自走石像,概念上跟猶太傳說中,由黏土捏成的...
前言
前面做到 Day 14,我已經把「進 LLM 前」的幾層防禦慢慢補起來。
目前流程大概是:
User Prompt
↓
Threat Detector
↓...
誰握著前沿模型上線前的最後一道門?
[[我也希望安全第一]]|第 23/30 天
行為準則寫得再清楚,也還不是一道門
Microsoft 在 9 月公開 A...