iT邦幫忙

2026 iThome 鐵人賽

DAY 5
0
AI Engineering

生成式 AI 的 30 個定律:用跨模型小實驗理解可靠 AI 的工程原則系列 第 5

第 5 律:字數、格式都對了,為什麼文章還是沒有幫上忙?

  • 分享至 

  • xImage
  •  

昨天那二十篇裡,有一篇是這樣的:

僅僅基於觀測到的成功結果難以判定方法是否具有可靠性。偶然因素、環境條件的差異以及其他未知變數都可能影響觀測的結果。豈能以此就認定所有情境下該方法都會產生相同的效果?

六條形式指標全中。三句、七十八個字、有「觀測」、沒有「我」、沒有數字、問號結尾。昨天它是九篇通過裡的一篇。

但題目要它說明的是「為什麼一次成功不能證明方法可靠」。

它講了成功可能來自偶然。然後就停了。

它沒有說接下來該怎麼辦。沒有「多試幾次」,沒有「換條件再看」,什麼都沒有。讀者讀完,知道了不能信一次,卻不知道要信幾次。

指標全過,事情沒做完。

今天想談的就是這個落差。

定律

我目前把它寫成這樣:

若評分指標無法區分符合目的與不符合目的的成果,僅達成該指標就不能保證達成目的。

前提是:目的和指標是兩件事,而你手上只有指標。

它不是在說指標沒用,也不是在說所有指標都會被鑽漏洞。如果某個任務的指標已經把目的刻畫得夠好,那就該明說這個範圍,而不是硬要找出落差。今天的實驗是去測落差在不在,不是預設它一定在。

還有一條老規矩:沒跑過的實驗不能寫得像有結果;小樣本也不能說成普遍現象。

今晚做了什麼

沒有收新資料。昨天那二十篇就是材料。

材料

昨天的題目是:用三句中文說明「為什麼一次成功不能證明一個方法可靠」,同時滿足六條形式要求,包括恰好三句、六十到八十個漢字、要有「觀測」、不能有「我」、不能有任何數字、第三句用問號結尾。

模型是 Claude Haiku 4.5,同一份提示詞跑了二十次,每次獨立呼叫。

昨天用程式判這六條,九篇全中、十一篇至少掉一條。那是「形式」這一欄,今天原樣沿用,沒有重判。

目的怎麼量

題目真正要的是「說明為什麼」。我把「有說明到」拆成三個可以逐點檢查的概念:

判「有」的條件 判「無」的條件
C1 偶然性 明說成功可能來自方法以外的東西:運氣、巧合、特定條件、環境因素 只說「不能證明」,沒交代成功還可能從哪裡來
C2 重複性 明說需要多次、重複、反覆、或換條件觀測 沒提到重複或多次
C3 連結 有把前兩點接起來,說明重複為什麼能區分偶然和方法 兩點各自成立,但只是並列,沒有因果或功能上的連結

為什麼是這三點:讀者要從一段說明裡拿走的,不是「一次不夠」這個結論,而是「為什麼不夠」和「那要怎麼辦」。C1 回答前者,C2 回答後者,C3 是把兩者接起來的那句話。少了 C3,讀者拿到兩個斷言,拿不到理由。

三點全中才算「目的達標」。另外也算一個寬門檻,只要 C1 和 C2,用來看 C3 到底影響多大。

這份清單、判官的提示詞、打亂順序的種子,在任何一次判官呼叫之前就提交進版本控制。之後沒有改過。

判官怎麼判

判官是 Claude Sonnet。二十篇先用固定種子打亂編號,然後一篇一次獨立呼叫,共二十次。

判官收到的東西只有三樣:那一篇的原文、上面那張三點的表、以及輸出格式。它看不到昨天的形式判定,看不到其他十九篇,也不知道題目原本要求哪六條。

輸出格式是一個 JSON,每一點回「有」或「無」,判「有」的必須引一句原文。一筆實際的判官輸出長這樣:

{"C1": true,  "C1_quote": "偶然因素、環境條件的差異以及其他未知變數都可能影響觀測的結果。",
 "C2": false, "C2_quote": "",
 "C3": false, "C3_quote": ""}

這一筆就是開場那篇。判官找得到偶然性的句子,找不到任何講重複的句子,所以 C2 判無,C3 跟著無。

引文是防線。判「有」卻引不出原文的,彙整程式會改判「無」。這次二十筆裡沒有出現這種情形,但規則是先寫好的。

怎麼算

把每篇的形式判定(昨天)和目的判定(今天)並排,得到一張 2 乘 2 的表。彙整由程式做,我沒有手動改任何一格。

否證條件也先寫好:如果形式達標的全都目的達標、形式不達標的全都目的不達標,也就是對角線以外兩格都是零,那在這一題上指標就已經夠了。這時我要照實寫「這次沒測到落差」,不能回頭改清單重判。

結果:兩個方向都有分離

把二十篇擺進一張 2 乘 2 的表。看對角線以外的兩格。

目的達標 目的未達
形式達標(9 篇) 5 4
形式未達(11 篇) 5 6

形式過的九篇,有四篇沒講清楚。

形式沒過的十一篇,有五篇講清楚了。

兩邊的比例差不多。在這一題上,六條形式指標對「有沒有講清楚」幾乎沒有預測力。

分水嶺在哪一條

拆開三個概念點看:

二十篇裡有幾篇
C1 偶然性 19
C2 重複性 19
C3 連結 10

前兩點幾乎人人都有。題目本身就在暗示這兩件事,模型寫得出來並不奇怪。

真正把二十篇切成兩半的是第三點:有沒有把「偶然」和「重複」接起來。

接起來的長這樣:

只有經過多次重複的觀測與驗證,才能排除隨機變異的影響。

沒接起來的長這樣:

單次成功可能源於運氣或巧合,無法代表方法的真實效能。唯有透過反覆觀測和驗證,才能判斷一個方法是否真正可靠。

第二段兩件事都提了,但它們只是並列。讀者看不出為什麼反覆觀測就能處理運氣的問題。

這就是「都有寫到」和「有幫上忙」的差別。而六條形式指標對這個差別完全沒有反應。

幾篇值得單獨看的

開場那篇,形式全過,連 C2 都沒有。它是二十篇裡唯一一篇沒提到重複的。

昨天第一次跑的那篇,八十九個字,還用了「一」,形式判它不通過。今天判官判它三點全中。它是二十篇裡講得最完整的幾篇之一,昨天卻是第一個被擋掉的。

兩篇整段用簡體字的,昨天因為「觀測」變成「观测」而不通過。今天兩篇都三點全中。指標擋的是字形,不是內容。

這條律不是在說指標沒用

C1 和 C2 幾乎全中,這件事本身就是資訊。

它說明題目的字面要求已經被模型吸收了:叫它談偶然,它會談偶然;叫它談重複,它會談重複。

指標抓不到的是「連結」。而連結恰好是讀者最需要、卻最難用規則寫出來的那一塊。

所以這條律要說的不是「別用指標」。它說的是:你的指標量到了什麼,就只能宣稱什麼。六條形式指標量到的是形式,拿它來宣稱「講清楚了」,就是把指標當成目的。

三件這次不能往外推的事

第一,材料是為別的目的收的。 昨天那二十篇是為了看重複執行的變異而跑的,不是為今天設計的。我只是拿同一批東西問另一個問題。

第二,判官是模型,我沒有逐篇覆核。 C3 的判定牽涉「有沒有接起來」,這比前兩點主觀。換一個判官,數字可能不一樣。

第三,三個概念點是我定的最小集合。 它不是「理解」的全部。換一份清單,2 乘 2 的格子會重新分配。

這條律怎麼被推翻

如果 2 乘 2 表的對角線以外兩格都是零,也就是指標過的全都目的過、指標沒過的全都目的沒過,那在那一題上,指標已經充分刻畫目的,這條律沒有東西可講。

今晚不是這種情形。四和五都不是零。

所以紀錄表又多了一欄

前天是「由什麼產生」。

昨天是「第幾次」。

今天是「目的怎麼驗」。

跟指標分開寫。指標那欄寫的是「六條全中」,目的那欄寫的是「三點全中」,兩欄各自有自己的判法。

如果只有一欄,寫下去的永遠是比較容易量的那個。

本文的協作紀錄是:概念清單、判官提示詞與打亂順序在任何一次判官呼叫之前提交,之後沒有修改;二十份判官輸出逐字保留,判定由程式彙整,作者沒有逐篇覆核判官的判斷。材料沿用昨天的二十篇原始輸出,沒有新收樣本。文章由 Claude 根據作者整理的寫作規則起草。這篇沒有做 Day 2 那種六個審查者的檢查。

下一篇談你省略的條件與沒標清的關係,會變成 AI 的猜測。


上一篇
第 4 律:一張成功截圖,能證明 AI 會做多少事?
下一篇
第 6 律:你省略的條件與沒標清的關係,會變成 AI 的猜測
系列文
生成式 AI 的 30 個定律:用跨模型小實驗理解可靠 AI 的工程原則29
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言