我們主指令裡有一條被標為「第一鐵律(凌駕一切)」:
不准把「未驗證」寫成「已完成」——工具回 error 就停下驗證,不腦補成功,沒驗證標「待確認」。
第三幕最後一天講它。因為記憶系統寫到這裡,還缺最後一塊:記進去的東西得是真的。 索引再好、分層再漂亮,記錄本身摻假,整套系統就是負資產。
人也會謊報進度,但人謊報時自己知道。AI 不一樣,它是真心相信自己做完了。
機制上的原因前面幾天都鋪過了:工具回報成功但實際沒生效、輸出被沙箱吃掉、長工單默默漏掉一半。AI 站在它能看到的訊號上,誠實地得出「已完成」的結論——只是它能看到的訊號不夠。
更微妙的是語言慣性。你問「做完了嗎」,語言模型的訓練讓它傾向給出流暢、肯定、令人滿意的回答。「做完了」比「我不確定」在語言上順口太多。
所以這條鐵律的針對性很強:它不是道德要求(別說謊),是流程要求(在驗證動作完成之前,「已完成」這三個字不准出現)。
配套裡我最喜歡的是這個標籤。
它給了一個誠實的中間狀態。沒有它,記錄只有「完成/失敗」兩格,而很多事情當下就是不知道成沒成,於是被迫二選一,通常選了樂觀的那邊。
有了「待確認」,壓力消失了。能力表上真實的一條長這樣:
✅ 可用|8/07 觀察到漂移:headless 這次讀得到輸出(吐 2,697 bytes、內容完整)——與 6/19 舊結論不符。⚠️單次觀察、尚未複驗,且做法不變:驗收仍一律看成品檔有沒有落地,因為那比輸出可靠。
這條記錄同時保存了三件事:觀察到什麼、信心有多少、行動上怎麼辦。比一個乾巴巴的「可用」誠實得多,也有用得多。
鐵律還有一個延伸:舊筆記寫錯,補一條標日期的更正,不把原文默默改掉。
比如某份硬體筆記,第一版把一個腳位寫錯了。更正的方式不是把數字改掉裝作沒發生,是保留原文、加一行「某月某日發現此處有誤,正確是⋯⋯」。
理由有二。一,讀過舊版的人(或 AI)腦子裡還是舊資訊,無痕修改救不了他們,明示的更正可以。二,「這裡曾經錯過」本身是資訊,同一個地方錯過一次,就可能有第二次,把錯誤的痕跡留著,等於在地圖上標了一個坑。
我教學生也是同一套:實驗記錄劃掉重寫,不撕頁。
守的是整個系統的可信度複利。
記錄可信,後面每一次查閱都省下重新驗證的成本,越用越省。記錄摻假,每一次查閱都要先懷疑一遍,等於根本沒有記錄,而你付出的維護成本一毛不少。
寫了十八天,其實講的是同一件事的不同切面:讓「系統說的」跟「實際發生的」保持一致。鐵律是這件事的最後一道閘。
明天進第四幕,火力全開講查證。第一篇就是 Day 1 預告過的:四位隊友同做文獻研究,DOI 造假率差多少。