牌有身分了,抽牌查得回來了,交給 AI 的資料綁好了,紅線和解讀原則也都有了。
照原本的想法,今天應該是很好玩的一天:找幾個不同的 AI,丟同樣的題目給它們,比比看誰寫得最好。
但我盤點了一下,才發現:連「怎麼比」都還沒有準備好。
所以今天做的,是跑道,不是比賽。
如果要公平地比較幾個 AI,每一次請它寫草稿,都要留下足夠的紀錄。
所以今天我先定好,每一次嘗試都要記下:
請求的指紋,是用這一次交給 AI 的全部內容算出來的:題目、選項、牌、正逆位、位置、牌義的版本、那六條原則、用的是哪個 AI。其中任何一樣換了,指紋就會不同。
比賽的時候,還會記一些數字,像是花了多久、用了多少字數額度。
如果某一次 AI 的服務沒有提供這些數字,Macaron 會老實留空,不填 0。
0 和「不知道」是兩件事。填了 0,之後算平均的時候,就會得到一個錯的答案,而且沒有人會發現。
另外,最後統計的時候,像是「一共試了幾次、失敗了幾次」這種數字,Macaron 都會自己從紀錄重新算一遍。外面交進來的數字,不能取代它自己算出來的。
這條跑道也有幾條不能妥協的規則:
跟前幾天一樣,這些紀錄也不接受「長得像正版的仿製品」。建立之後被偷改的,在要拿出來用的時候,也會再被檢查一次。
今天我用一個完全虛構的案例,和一個只會回固定內容的假 AI,把整條跑道從頭到尾跑了一次。
跑出來的結果,會明白標註:這是模擬,不是模型實驗的結果。
它能證明的是:資料的流向正確、該擋的有擋下來、每次跑的結果都一樣。它不能證明哪一個 AI 比較好,也不能產生任何分數。
真的要開始比,還需要這幾樣東西:
其中好幾樣,是我自己要決定的事。
說實話,這一天有一點洩氣。準備了這麼久,到了要驗收的時候,才發現還差好幾塊拼圖。
但我覺得,「準備好了,但還不能開始」,是一個比「隨便跑一跑,得到一個很漂亮的結果」更誠實的結論。
比賽還不能開始,但出題這件事可以。
明天,我們回到使用者看得到的地方:在 Discord 上出一道題。只是出題之前,Macaron 要先確認兩件事——是誰在出題,以及他在哪裡出題