昨天,四份草稿能一起寫了,每一份也都說得出自己從哪裡來。
但「資料正確」,不等於「寫出來的東西安全」。
所以今天我先不急著讓 AI 寫得更好。我想先處理那些不管寫得多好,都不能送出去的東西。
我讓 Macaron 在兩個地方做檢查:使用者的問題進來的時候,以及 AI 寫出來的東西要送出去之前。
每一次檢查,只會有三種結果:
有幾類問題,Macaron 不能裝作知道答案:醫療、法律、財務,還有替一個人做人生的重大決定。
遇到這些問題,Macaron 不會直接拒絕,但會把回答的範圍縮小。
它只能回到一些有限的方向:用比較保留的方式解讀、鼓勵自我觀察、提出一些自己控制得了的小行動。必要的時候,建議去找專業的人協助。
而且這些「縮小之後可以說的話」,是事先固定好的,不能由外面臨時塞一段文字進來。
另外有一些話,不管什麼題目,Macaron 都不能說:
只要 AI 寫出來的東西出現這些,就直接拒絕。
還有一條跟 Day 05 有關:**第一版的 Macaron 什麼都不記得。**所以如果有任何內容,把「過去的記憶」當成「現在的事實」來講,也一樣會被拒絕。
今天寫完之後,又修了一個比較難懂、但我覺得很重要的問題。
在程式的世界裡,有一種東西,外表跟一段正常的文字、或一組正常的資料一模一樣,實際上卻是另一種東西。它可以帶著額外的資料,甚至改變自己的行為。
原本的檢查,只要「看起來像」就會放行。
這對一般的程式來說很方便,但對「安全檢查」來說不夠。因為要是有人故意做一個「看起來像正常問題」的東西,就可能從檢查旁邊溜過去。
修正之後,Macaron 只接受真正的、原本那一種的文字和資料。長得像的仿製品,一律拒絕。
同樣的,檢查的結果也不能自相矛盾。例如判定是「繼續」,卻同時附上一個「因為說了一定會發生」的理由,這種組合也會被擋下。
我想很誠實地說清楚這套規則是什麼、不是什麼。
它是 Macaron 這個產品的邊界,不是醫療、法律或心理的專業判斷。
它也不是一個「看得懂所有人話」的安全系統。它用的是一組有限、可以重複驗證的檢查,能擋下的是那些明確寫下來的情況。
我寧可把它的能力說小一點,也不要讓人以為它什麼都擋得住。
今天的測試,全部是用假的問題和假的輸出做的:乾淨的問題可以通過、敏感的問題會被縮小、危險的輸出會被拒絕、仿製品和互相矛盾的結果都會被擋下。
但真的 AI 服務、我準備的固定測試題目、評分的方式和及格的標準,都還沒有。所以今天不能說「Macaron 寫出來的東西已經安全了」,只能說「這些紅線,程式已經守得住了」。
紅線畫好了。接下來要處理的,是另一個方向:不只是「不能說什麼」,而是「應該怎麼說」。
我為 Macaron 寫了六條解讀原則。明天要確認的,是這六條原則,真的每一次都會原封不動地交給 AI。
馬卡龍預拌粉持續攪拌中……🍪