iT邦幫忙

2026 iThome 鐵人賽

DAY 1
0
AI Engineering

生成式 AI 的 30 個定律:用跨模型小實驗理解可靠 AI 的工程原則系列 第 1

第 1 律:比較模型之前,先確認題目沒有出現在訓練資料裡

  • 分享至 

  • xImage
  •  

今天下午,我原本想拿《邏輯哲學論》的七個命題,讓幾個模型從德文翻成英文,看誰翻得好。動手前做了個小預試,結果把整個計畫推翻了。

我給三個模型同一句德文:Die Welt ist alles, was der Fall ist.,要求只輸出一行英譯。三個模型,兩個家族,回傳的三句話一模一樣:

The world is everything that is the case.

這句話不是它們翻的,是 Ogden 1922 年的譯本原文。三個模型都「答對」了,對得一字不差。

接著,我照它的句法現造了一句德文,確定這句話從來沒被翻譯過,也沒流傳過:Die Grenze ist alles, was sich im Schweigen zeigt. 同樣三個模型,同樣的提示詞,這次三句各不相同:

模型 譯文
gpt-6-astra The boundary is everything that reveals itself in silence.
gpt-5.6-sol The limit is everything that reveals itself in silence.
Haiku 4.5 The limit is everything that shows itself in silence.

分歧落在兩個有選擇餘地的詞上:Grenze 可以是 boundary,也可以是 limit;sich zeigen 可以是 reveal,也可以是 show。沒有標準答案,三個模型立刻各走各的。

第一句的「三個都一樣」,量到的不是翻譯能力。那句話連同英譯早就在訓練資料裡,模型輸出的是記住的東西。如果照原計畫跑完七個命題,我會得到「模型之間沒有差異」的結論。那個結論來自材料,不來自模型。

定律

用來比較模型的材料若已連同標準答案進入訓練資料,測到的表現混入了記憶,不能當作能力的估計;比較之前必須先確認材料未受污染,否則結果不能解釋為能力差異。

這條排在三十條的第一條,不是因為它最重要,而是解釋結果前,得先處理它。你可以把任務定義清楚、評分規則寫細、溫度和提示詞都固定住,這些後面幾條會談。但只要材料本身帶著答案,其他地方做得再嚴謹,也無法從結果看出能力。

統計裡也有這種問題:用事先接觸過答案的觀測去估一個潛在量,測到的表現不能直接代表沒接觸過答案時的能力。機器學習叫它 data leakage;心理測驗談題目曝光、事前知悉時,處理的也是同一種問題。受試者答對,可能只是看過題本;模型譯對,可能只是讀過譯本。各學門的正式術語和控制方法,我還沒查證。這裡只借它的結構,不借它的名字。

這個預試證明了什麼,沒證明什麼

預試證明的是:三個模型翻譯已流傳的句子時,都給出同一個既有譯本;翻譯沒流傳的句子時,則出現分歧。這跟「測到的是記憶」相容。

還有幾件事沒證明,得寫清楚。

第一,兩句材料除了有沒有流傳,翻譯時能選的譯法也不一樣。第一句幾乎可以逐字翻,第二句有兩個歧義詞。第一句譯文一致,也可能只是因為「這句本來就沒什麼可分歧的」。要排除這個解釋,得找一對選擇空間相當的句子再跑一次。

第二,三個模型的呼叫方式不一樣。兩個 OpenAI 模型是每句各呼叫一次,推理強度設在 high;Haiku 是一次呼叫同時翻兩句,沒有推理強度可設。呼叫結構跟模型家族完全重疊,我分不開兩者的效果。

第三,每個模型每句只跑一次,只有三個模型,只有單句。這是預試,不是實驗。

我的判定是:在這些限制之內,假說沒有被否證。不是「假說成立」。

這條律怎麼被推翻

一條律如果怎麼樣都不會錯,就不是律。我得先寫清楚,什麼結果會讓我撤回它。

把它寫成假說:對一組經查證確已連同答案流傳的材料,多個模型會給出相同的既有答案;對選擇空間相當、沒有流傳答案的對照材料,則會給出不同答案。如果在這樣的設計下,模型對已流傳材料的輸出彼此分歧,也不對應任何既有答案,而對照材料同樣分歧,假說就被否證。到時候不能用「那些材料其實沒進訓練資料」來開脫,除非有獨立於這次結果的證據。

未來某個模型如果對一句被翻爛的話仍給出自己的翻譯,那不是「通過測試」,而是這條律的經驗部分錯了。「比較前先查」這個程序建議可以留著當習慣,但不能再說它有經驗根據。

下一次比較模型時可以改的一件事

除了記錄模型、溫度、提示詞、評分規則,再多記一欄:能不能查到這份材料連同答案已在公開流傳。查得到,就不要拿它比能力;查不到,就把「查不到」和「確定沒進訓練資料」之間的落差標成未知,別當成材料已經乾淨。

我今天的預試表就多了這一欄,也記下每個模型的介面、呼叫結構和推理強度。這條律立論的起點是「有一個欄位大家都不記」。它自己唯一的實證要是也漏記,就沒有立場說別人。

下一篇談「AI 生成」這個標籤到底告訴了我們什麼。


下一篇
第 2 律:「這篇是 AI 寫的」到底告訴了我們什麼?
系列文
生成式 AI 的 30 個定律:用跨模型小實驗理解可靠 AI 的工程原則29
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言