我手邊有兩個 Google 帳號在用 Antigravity CLI(以下簡稱 agy,它是一個在終端機裡跑的 AI 助理)。兩個帳號輪著用,但每次切換之後我都會忘記「剛剛那串對話跑到哪了」。
所以我想做一個小工具:把電腦裡存的對話紀錄列出來,讓我知道哪個帳號談過哪些事。
這種工作有個特徵——它要翻很多檔案、看每個檔案裡有哪些欄位、再決定要讀哪一個。做完之後好不好驗證?看起來非常好驗證,列出來的東西對不對,打開檔案一看就知道。
「要翻很多、做完好驗證」正是可以交出去的工作。 這些紀錄本來就是 agy 自己產生的,讓它來翻也順理成章。
agy 跑完,回報得很有信心。它說對話紀錄存在一個叫 history.jsonl 的檔案裡(你可以想成一個純文字檔,每一行是一筆紀錄),從裡面就能取得每段對話的編號,接著用編號去查內容就好。最後寫了兩個字:完美。
那天幫我檢查的,是我在 Day 3 提過的另一套工具。它回報:這個檔案只有三個欄位——顯示文字、時間、工作區路徑,沒有 agy 說的那個編號。
於是改用另一個地方:一個叫 conversation_summaries.db 的資料庫檔(這種檔案就像一張存在硬碟裡的試算表,有欄位、有列)。agy 照做,程式也真的跑得出來,它挑了 title(標題)這個欄位當每段對話的名稱。跑出來的結果是一整排「無標題」——這張表 150 筆,title 有值的 0 筆,真正裝著內容的是隔壁的 preview 欄位。它第二次又說了完美。
我把這兩件事寫進筆記:agy 兩次自稱完美,兩次都錯。這篇文章原本就是照著這份筆記寫的。
這個系列有一條規矩:文章裡的每個數字都要是當下跑出來的,不能靠記憶。 所以發文當天,我把兩件事又重查了一次。這次不是看幾行,是把整個檔案逐筆數過。
老實講,這次重查也是交給同一套工具跑的。差別在於:每一步下了什麼指令、看到什麼輸出,這次都留著,誰都可以照著重跑一次。
history.jsonl 現在有 700 筆,時間從 6 月一路往下排,是一個只會往後追加的紀錄檔。只有第 1 筆是三個欄位;從第 2 筆開始,幾乎每一筆都有對話編號。 只算 8/30 當天以前的紀錄,656 筆裡有 591 筆有編號。重查時還在一份 7 月初的專案文件裡,找到「從這個檔案取得對話編號」的寫法——那時候就已經有人在用這個欄位了。

也就是說,8/30 那句「沒有這個欄位」是錯的。 agy 說檔案裡有對話編號,這件事它說對了。
那天的檢查為什麼會錯?可能是只看了最上面那一筆,剛好看到唯一沒有編號的那行;也可能是查錯了範圍,或者看走眼。我想去翻當天的對話紀錄確認,才發現那段紀錄已經被自動清掉了,現在電腦裡最舊的只到 9 月 4 日。所以原因我查不到,這裡就不猜。
title 那件事,8/30 跟 9/6 兩次查到的都是 150 筆、0 筆有值,當時用 title 當名稱確實行不通。
但今天重數,這張表變成 302 筆,title 有值的有 61 筆。中間其實有跡可循:9/12 複查是 151 筆、1 筆有值,Day 4 發文前(9/17)是 165 筆、11 筆——9/6 之後,標題開始陸續出現。更奇怪的是,就算只看「最後修改時間在 9/6 以前」的資料,今天也有 258 筆、其中 22 筆有標題——跟 9/6 數到的 150 筆、0 筆兜不起來。
是資料庫會回頭補資料,還是當時的查法有漏,我不知道。能確定的只有:不同時間點看到的結果不一樣。 中間發生了什麼,我沒有證據,也不硬給一個解釋。
寫這段之前,我把重查的結果拿去問了兩個 AI,請它們挑毛病。兩邊都說:驗證的那一方也是 AI,這件事要寫出來。其中一個還補了一句我沒想到的——是我把它的結論全盤收下了。
回頭看,問題不在 agy 說錯了一次,而在整條鏈:
兩個 AI 的說法互相矛盾時,我選了負責檢查的那一個,因為它的角色是「檢查」。但角色不等於正確。檢查者的結論,也只是另一個需要檢查的宣稱。
一、驗證要對準「事實宣稱」,不是對準結論——檢查者的也一樣。
「我做完了」「它說錯了」這兩句話都沒什麼好驗的。要驗的是它們順口帶過的描述:這個檔案有沒有這個欄位、這個欄位有沒有值。而且要看全部,不是看一行。
二、筆記要記「當時看到什麼」,不是只記結論。
我的筆記寫的是「該檔沒有那個欄位」。如果當初寫的是「8/30 檢查了第幾行到第幾行,看到三個欄位」,今天一眼就知道錯在哪。寫結論會過期,寫觀察不會——這句是我原本就打算寫的,只是沒想到第一個被它打臉的就是我自己的筆記。
三、查證的過程也要留下來。
對話紀錄會被清掉、資料會變。如果某個結論之後可能會被拿來寫成文章、報告或公文,就把當時下的指令、看到的輸出存一份。不然等到發現不對勁,連「為什麼錯」都查不到。
Day 23:「它說它開了瀏覽器」——這次我沒有去翻檔案,而是用另一種方式拆穿:我去看作業系統的程序清單。
(2026-10-06 更正:Day 23 改題為〈AI 說它做到了,但證據是人發現的〉。重翻紀錄後,那次程序清單其實沒有拆穿它,詳見 Day 23。)