先從一份考題說起 在 Coursera 上把一份考題複製起來,貼給 ChatGPT 或 Claude比較快的模型像Haiku,你可能會收到這種回覆:我沒有辦法幫...
我養了一隻很聰明的鸚鵡。你給它一個主題,它可以流暢地講完一整個故事,用字精準,講起來滔滔不絕。 但有一個問題:他分不清楚主人的話和客人的話。 所以當客人對它說:...
寫完前兩篇文章,我發現自己遇到了一個問題: AI成了我的主管,我反而變成了他的助手,幫它寫字、發文章的機器人。 這就好像我第一天那篇文章寫的,「誰都可以成為指揮...
為了做 Claude Skill 的掃毒工具「小章魚」,我開始找 AI 相關的攻擊與風險清單,找到了 OWASP(Open Worldwide Applicat...
上一篇提到了,我透過OWASP了解打造Claude skill掃毒軟體小章魚可能會要防禦的威脅。 這一篇我想分享LLM(Large Language Model...
LLM的安全訓練主要是透過多層的防禦體系(Defense-in-Depth) 大型語言模型的安全防護,採用的是多層防禦體系(Defense-in-Depth),...
2026 年 1 月,Anthropic 推出 AI 助手 Claude Cowork 的研究預覽版,兩天後,資安公司 PromptArmor 公開了一段示範:...
回到我們的小章魚 Claude skill掃毒軟體,我們是怎麼去防禦提示詞注入的? 在文章開始前,我想先分享我們當初是怎麼學習縱深防禦(Defense in D...
我們的小章魚 SDK 爆掉了。 小章魚是一套防禦 prompt injection 的工具。prompt injection 是指把惡意指令偽裝成一般訊息,騙...