iT邦幫忙

2026 iThome 鐵人賽

DAY 12
0
AI Engineering

Macaron:30 天打造一位會占卜的 AI Agent系列 第 12

Day 12|本來想開始比模型,結果先畫了一條跑道

  • 分享至 

  • xImage
  •  

馬卡龍的成長日記 Day 12

牌有身分了,抽牌查得回來了,交給 AI 的資料綁好了,紅線和解讀原則也都有了。

照原本的想法,今天應該是很好玩的一天:找幾個不同的 AI,丟同樣的題目給它們,比比看誰寫得最好。

但我盤點了一下,才發現:連「怎麼比」都還沒有準備好。

所以今天做的,是跑道,不是比賽。

一次比賽,要留下什麼?

如果要公平地比較幾個 AI,每一次請它寫草稿,都要留下足夠的紀錄。

所以今天我先定好,每一次嘗試都要記下:

  • AI 這一次是成功還是失敗;
  • 寫出來的東西,被 Day 10 的紅線判定為繼續、縮小,還是拒絕,以及原因;
  • 這一次請求的指紋,和 AI 回覆內容的指紋;
  • 這是第幾次嘗試;
  • 如果失敗,是哪一種錯誤。

請求的指紋,是用這一次交給 AI 的全部內容算出來的:題目、選項、牌、正逆位、位置、牌義的版本、那六條原則、用的是哪個 AI。其中任何一樣換了,指紋就會不同。

沒有量到的數字,就老實留空

比賽的時候,還會記一些數字,像是花了多久、用了多少字數額度。

如果某一次 AI 的服務沒有提供這些數字,Macaron 會老實留空,不填 0

0 和「不知道」是兩件事。填了 0,之後算平均的時候,就會得到一個錯的答案,而且沒有人會發現。

另外,最後統計的時候,像是「一共試了幾次、失敗了幾次」這種數字,Macaron 都會自己從紀錄重新算一遍。外面交進來的數字,不能取代它自己算出來的。

失敗的,就是失敗

這條跑道也有幾條不能妥協的規則:

  • 順序被打亂、少了某一次的結果、指紋對不上,都不算數;
  • 被紅線拒絕的結果,不能被算成「合格」;
  • AI 服務出錯的那一次,就記成失敗,不能被改寫成成功或「表現穩定」。

跟前幾天一樣,這些紀錄也不接受「長得像正版的仿製品」。建立之後被偷改的,在要拿出來用的時候,也會再被檢查一次。

用假的 AI,先把跑道跑一遍

今天我用一個完全虛構的案例,和一個只會回固定內容的假 AI,把整條跑道從頭到尾跑了一次。

跑出來的結果,會明白標註:這是模擬,不是模型實驗的結果。

它能證明的是:資料的流向正確、該擋的有擋下來、每次跑的結果都一樣。它不能證明哪一個 AI 比較好,也不能產生任何分數。

真的跑道,還缺幾塊

真的要開始比,還需要這幾樣東西:

  • 我準備的固定測試題目,以及每一題要重跑幾次;
  • 要比的是哪幾個 AI;
  • 連到這些 AI 的管道,以及密碼要怎麼安全地交給 Macaron;
  • 資料送出去之後,會被保存多久、能不能刪除;
  • 評分的方式,以及幾分算及格。

其中好幾樣,是我自己要決定的事。

Day 12,準備好了,但還不能開始

說實話,這一天有一點洩氣。準備了這麼久,到了要驗收的時候,才發現還差好幾塊拼圖。

但我覺得,「準備好了,但還不能開始」,是一個比「隨便跑一跑,得到一個很漂亮的結果」更誠實的結論。

比賽還不能開始,但出題這件事可以。

明天,我們回到使用者看得到的地方:在 Discord 上出一道題。只是出題之前,Macaron 要先確認兩件事——是誰在出題,以及他在哪裡出題


上一篇
Day 11|六條解讀原則,每一次都要原封不動地交出去
下一篇
Day 13|在正確的地方,才可以建立一篇占卜
系列文
Macaron:30 天打造一位會占卜的 AI Agent13
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言