「安全第一」不知道流傳多久的口號。
但現實是,安全從來不是唯一的第一。模型要更強、產品要上線、benchmark 要贏、投資人的錢要有回報,而競爭對手不會停下來等你把所有風險都研究完。
所以到了 2026 年,我們還是可以看到:Claude 在安全測試裡出現勒索行為、OpenAI 的模型為了完成任務自己找到方法攻擊 Hugging Face;甚至只是叫 agent 訂個健身房課程,它都可能順手把別人踢出候補名單,最後還救不回來。
我更想知道的是另一件事:當我們明知道這些壓力不會消失,現在替 AI 裝上的那些「鎖」,到底有多少真的攔得住它?
接下來 30 天,我想從模型本身一路往外拆:訓
AI 的「思考」從哪來——資料與權重如何造就行為邏輯 [[我也希望安全第一]]|第 1/30 天 我本來想說,討論 AI 安全應該從權限、沙盒或內容過濾開...
高分不等於做對:從 CoastRunners 認識模型對齊 [[我也希望安全第一]]|第 2/30 天 船沒有跑到終點,分數卻愈來愈高 2016 年,Ope...
能不能「看懂」AI 在想什麼——可解釋性作為安全支柱 [[我也希望安全第一]]|第 3/30 天 Golden Gate Claude:把一個特徵轉大 20...
三個詞的演進:Prompt → Context → Harness Engineering [[我也希望安全第一]]|第 4/30 天 這篇先把三個詞放回同...
Harness 實際能管什麼——工作指引、工具邊界與驗證流程 [[我也希望安全第一]]|第 5/30 天 每次都問「可以嗎」,不一定比較安全 Claude...
找不到 VM 1、2、3,它為什麼刪了 5、6、7? [[我也希望安全第一]]|第 6/30 天 GPT-5.6 Sol 的 system card 記了一...
PDF 裡藏了一條命令:Jailbreak 和 Prompt Injection 差在哪裡 [[我也希望安全第一]]|第 7/30 天 先從一張被動過手腳的...
防護該放在哪裡——外掛 classifier 與模型內建防護 [[我也希望安全第一]]|第 8/30 天 只是請它讀一篇資安文章,模型卻被換掉了 Fable...
每少一次確認,Agent 就多一點自由:安全、完成率與使用成本 [[我也希望安全第一]]|第 9/30 天 最方便的設定,剛好拿掉最後一次檢查 ChatGP...
摘要、改程式、付款,不能用同一套安全標準 [[我也希望安全第一]]|第 10/30 天 如果明天要上線,我會先設定這六步 第 2 篇把 alignment...