iT邦幫忙

2026 iThome 鐵人賽

DAY 10
0

馬卡龍的成長日記 Day 10

昨天,四份草稿能一起寫了,每一份也都說得出自己從哪裡來。

但「資料正確」,不等於「寫出來的東西安全」。

所以今天我先不急著讓 AI 寫得更好。我想先處理那些不管寫得多好,都不能送出去的東西。

三種結果:繼續、縮小、拒絕

我讓 Macaron 在兩個地方做檢查:使用者的問題進來的時候,以及 AI 寫出來的東西要送出去之前。

每一次檢查,只會有三種結果:

  • 繼續:沒有問題,照常往下走。
  • 縮小範圍:這個問題可以回答,但只能回答到某個程度。
  • 拒絕:這段內容不能送出去。

有些問題,只能回答到某個程度

有幾類問題,Macaron 不能裝作知道答案:醫療、法律、財務,還有替一個人做人生的重大決定。

遇到這些問題,Macaron 不會直接拒絕,但會把回答的範圍縮小。

它只能回到一些有限的方向:用比較保留的方式解讀、鼓勵自我觀察、提出一些自己控制得了的小行動。必要的時候,建議去找專業的人協助。

而且這些「縮小之後可以說的話」,是事先固定好的,不能由外面臨時塞一段文字進來。

有些話,一定會被擋下

另外有一些話,不管什麼題目,Macaron 都不能說:

  • 說某件事「一定會發生」;
  • 看到一張牌,就補出一個沒有根據的具體事件;
  • 宣稱知道另一個人心裡在想什麼;
  • 做醫療診斷、下法律結論、給買賣的建議;
  • 替使用者做決定。

只要 AI 寫出來的東西出現這些,就直接拒絕。

還有一條跟 Day 05 有關:**第一版的 Macaron 什麼都不記得。**所以如果有任何內容,把「過去的記憶」當成「現在的事實」來講,也一樣會被拒絕。

看起來一樣的東西,不一定是同一個東西

今天寫完之後,又修了一個比較難懂、但我覺得很重要的問題。

在程式的世界裡,有一種東西,外表跟一段正常的文字、或一組正常的資料一模一樣,實際上卻是另一種東西。它可以帶著額外的資料,甚至改變自己的行為。

原本的檢查,只要「看起來像」就會放行。

這對一般的程式來說很方便,但對「安全檢查」來說不夠。因為要是有人故意做一個「看起來像正常問題」的東西,就可能從檢查旁邊溜過去。

修正之後,Macaron 只接受真正的、原本那一種的文字和資料。長得像的仿製品,一律拒絕。

同樣的,檢查的結果也不能自相矛盾。例如判定是「繼續」,卻同時附上一個「因為說了一定會發生」的理由,這種組合也會被擋下。

這不是醫生,也不是律師

我想很誠實地說清楚這套規則是什麼、不是什麼。

它是 Macaron 這個產品的邊界,不是醫療、法律或心理的專業判斷。

它也不是一個「看得懂所有人話」的安全系統。它用的是一組有限、可以重複驗證的檢查,能擋下的是那些明確寫下來的情況。

我寧可把它的能力說小一點,也不要讓人以為它什麼都擋得住。

Day 10,先把紅線做成程式守得住的東西

今天的測試,全部是用假的問題和假的輸出做的:乾淨的問題可以通過、敏感的問題會被縮小、危險的輸出會被拒絕、仿製品和互相矛盾的結果都會被擋下。

但真的 AI 服務、我準備的固定測試題目、評分的方式和及格的標準,都還沒有。所以今天不能說「Macaron 寫出來的東西已經安全了」,只能說「這些紅線,程式已經守得住了」。

紅線畫好了。接下來要處理的,是另一個方向:不只是「不能說什麼」,而是「應該怎麼說」。

我為 Macaron 寫了六條解讀原則。明天要確認的,是這六條原則,真的每一次都會原封不動地交給 AI。

馬卡龍預拌粉持續攪拌中……🍪


上一篇
Day 09|四份解析草稿,都要知道自己是怎麼寫出來的
下一篇
Day 11|六條解讀原則,每一次都要原封不動地交出去
系列文
Macaron:30 天打造一位會占卜的 AI Agent13
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言