iT邦幫忙

鐵人檔案

2026 iThome 鐵人賽
回列表
AI Security

我做了一個Claude skill的掃毒軟體學到的那些事 系列

這是一個從0到1打造資安軟體的過程,從 Prompt Injection 的原理和防禦設計,寫到MCP的實作。

參賽天數 9 天 | 共 9 篇文章 | 0 人訂閱 訂閱系列文 RSS系列文
DAY 1

Day 1 誰都可以成為指揮者——包括指揮你的 AI 的那個人

先從一份考題說起 在 Coursera 上把一份考題複製起來,貼給 ChatGPT 或 Claude比較快的模型像Haiku,你可能會收到這種回覆:我沒有辦法幫...

DAY 2

Day 2 為什麼會有 Prompt Injection:一隻分不清主人和客人的鸚鵡

我養了一隻很聰明的鸚鵡。你給它一個主題,它可以流暢地講完一整個故事,用字精準,講起來滔滔不絕。 但有一個問題:他分不清楚主人的話和客人的話。 所以當客人對它說:...

DAY 3

AI成了我的主管,我在幫他複製、貼上

寫完前兩篇文章,我發現自己遇到了一個問題: AI成了我的主管,我反而變成了他的助手,幫它寫字、發文章的機器人。 這就好像我第一天那篇文章寫的,「誰都可以成為指揮...

DAY 4

當資料變成武器:提示詞注入與 AI 供應鏈

為了做 Claude Skill 的掃毒工具「小章魚」,我開始找 AI 相關的攻擊與風險清單,找到了 OWASP(Open Worldwide Applicat...

DAY 5

越獄和LLM的關係

上一篇提到了,我透過OWASP了解打造Claude skill掃毒軟體小章魚可能會要防禦的威脅。 這一篇我想分享LLM(Large Language Model...

DAY 6

LLM的多層的防禦體系(Defense-in-Depth)

LLM的安全訓練主要是透過多層的防禦體系(Defense-in-Depth) 大型語言模型的安全防護,採用的是多層防禦體系(Defense-in-Depth),...

DAY 7

你只是請 Claude Cowork 幫你整理資料夾裡的文件,它卻順手把你的檔案,送進了攻擊者的帳號

2026 年 1 月,Anthropic 推出 AI 助手 Claude Cowork 的研究預覽版,兩天後,資安公司 PromptArmor 公開了一段示範:...

DAY 8

我是怎麼防禦提示詞注入?

回到我們的小章魚 Claude skill掃毒軟體,我們是怎麼去防禦提示詞注入的? 在文章開始前,我想先分享我們當初是怎麼學習縱深防禦(Defense in D...

DAY 9

# 為什麼自己測 100 分的防禦,一丟到外部真實資料集只剩 13 分?

我們的小章魚 SDK 爆掉了。 小章魚是一套防禦 prompt injection 的工具。prompt injection 是指把惡意指令偽裝成一般訊息,騙...