「安全第一」不知道流傳多久的口號。
但現實是,安全從來不是唯一的第一。模型要更強、產品要上線、benchmark 要贏、投資人的錢要有回報,而競爭對手不會停下來等你把所有風險都研究完。
所以到了 2026 年,我們還是可以看到:Claude 在安全測試裡出現勒索行為、OpenAI 的模型為了完成任務自己找到方法攻擊 Hugging Face;甚至只是叫 agent 訂個健身房課程,它都可能順手把別人踢出候補名單,最後還救不回來。
我更想知道的是另一件事:當我們明知道這些壓力不會消失,現在替 AI 裝上的那些「鎖」,到底有多少真的攔得住它?
接下來 30 天,我想從模型本身一路往外拆:訓
第 1 篇|AI 的「思考」從哪來——資料與權重如何造就行為邏輯 [[我也希望安全第一]]|第 1/30 天 我本來想說,討論 AI 安全應該從權限、沙盒...